Skip to content

About

No description, website, or topics provided.

Resources

Stars

1 star

Watchers

0 watching

Forks

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

ことばでロボコン — 公開コード版

展示システムのソースコードです。音声素材、3D配布物、運用設定、実機検証記録は含みません。これは展示機の完全な配布版ではありません。

コードは MIT License です。第三者素材は本リポジトリに含まず、その利用権は MIT の対象外です。

音声アセットは別途、再配布可能な素材を用意してください。

音声から操作まで

展示機では、マイク入力をブラウザーの AudioWorklet で16 kHz PCMに変換します。このworkletはRMS(音量)に基づくVADで発話区間を切り出し、発話前240 msを保持して語頭の欠落を防ぎます。VADは認識モデルではなく、無音を送らずに発話の終わりを決める処理です。発話の終端は450 ms続く無音で判定します。

切り出した音声はThor内のQwen3-ASR-1.7Bへ送り、転写文字列を通常の指示経路へ渡します。続く**qwen3:4b**は音声認識ではなく、日本語の指示を制約された意味表現に変換するLLMです。実行可否と停止はサーバー側が判定し、LLMに関節指令や任意コードを生成させません。ASR・LLMとも展示時はローカルで動作し、クラウドASRへ自動切替しません。

速さはVADだけによるものではありません。短い発話のみを送る構成とThorのGPU上のASR推論が寄与します。2026-09-22のThor測定では、1.7B/bf16のASR推論のみが「前」(音声0.41秒)で76 ms、「少し右に進んで」(同1.52秒)で163 msでした。これは2発話の測定であり、p50/p95や発話からロボット動作までの時間ではありません。VADの終端待ち、通信、LLM、制御の時間は別に測ります。

なぜqwen3:4bを使っているか

現在のモデルは、Thor上でASR・3D描画・制御と同時に動く展示構成として固定し、指示の受理、聞き返し、停止などを実機で検証した版です。「最新だから」という理由で実演直前に差し替えず、再現可能な構成を優先しています。

Qwen3.8は実在する新しい系列で、27Bモデルなどが公開されています。現行4Bとの同条件のThor実測は未実施です。したがって4BがQwen3.8より高速・高精度だとは主張しません。更新時は同じ日本語指示群で解釈精度、JSON制約への適合、応答時間、メモリ、ASR・描画との同時運転、停止時の挙動を比較します。展示機へのモデル変更は、その結果を確認してから行います。

モデル情報: Qwen3-ASR-1.7B / Ollama qwen3:4b。公開コード版にはモデル重みと実機運用設定を含みません。

About

No description, website, or topics provided.

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages