ローカル(オフライン)セットアップチュートリアル
概要
ローカル(オフライン)モードを使用すると、ASR(自動音声認識)、翻訳、TTS(テキスト読み上げ)をすべてデバイス上で実行できます。API キー不要、インターネット接続不要、データがデバイスから外に出ることはありません。すべての処理は WebAssembly と WebGPU を使用してローカルで行われます。
API キーもインターネットも不要
プライバシー最優先 — すべての音声とテキストはデバイス上に保持されます。モデルをダウンロードした後は、ローカル(オフライン)モードは完全にオフラインで動作します。会話がデバイスの外に出ることはありません。
1プロバイダーとして「ローカル(オフライン)」を選択
Sokuji を開き、設定パネルに移動します。プロバイダーのドロップダウンから 「ローカル(オフライン)」 を AI プロバイダーとして選択します。
2ASR モデルをダウンロード
ソース言語に合った ASR モデルを選択します。Sokuji は sherpa-onnx WASM と WebGPU(Cohere Transcribe、Voxtral Mini、Whisper)を搭載した 42 のオフライン/ストリーミングモデルを提供し、99 以上の言語をカバーしています。モデルサイズは軽量(約 5MB)から高精度(約 2GB 以上)まで様々です。最高の精度と速度には Cohere Transcribe または Voxtral Mini 4B Realtime を推奨します。
3翻訳モデルをダウンロード
翻訳言語ペアを選択します。最高の品質と速度なら TranslateGemma、高速 CPU 翻訳用の 74 の Opus-MT 言語ペア、または WebGPU 経由の Qwen LLM による高品質な多言語翻訳から選べます。
4TTS モデルをダウンロード
音声出力用の TTS モデルをダウンロードしてください。Piper、Coqui、Mimic3、Matcha エンジンを搭載した 136 モデルが 52 言語で利用可能です。
5翻訳を開始
セッション開始ボタンをクリックします。インターネット接続は不要です — 翻訳はデバイス上で完全にリアルタイムで行われます。
追加情報
ローカル(オフライン)モードとは?
ローカル(オフライン)は、クラウドサービスを一切使用せずに ASR、翻訳、TTS を実行する完全オンデバイス AI 翻訳パイプラインです:
- 完全なプライバシー — すべての音声・テキスト処理はデバイス上で完結
- 初回モデルダウンロード後はオフラインで動作
- API キー、アカウント、サブスクリプション不要
- WebAssembly (WASM) と WebGPU によりネイティブに近いパフォーマンスを実現
- 無料で使用可能、使用制限なし
利用可能なモデル
ローカル(オフライン)モードは翻訳パイプラインの各段階に豊富なモデルを提供します:
- ASR:Cohere Transcribe、Voxtral Mini 4B Realtime、Whisper、SenseVoice、Moonshine、NeMo、Zipformer を含む 42 モデル — 99 以上の言語に対応
- 翻訳:高速 CPU 翻訳用の 74 の Opus-MT 言語ペア、および WebGPU 経由の TranslateGemma と Qwen LLM による多言語サポート
- TTS:Piper、Coqui、Mimic3、Matcha エンジンを使用した 52 言語 136 モデル
ハードウェア要件
- CPU (WASM):モダンブラウザがあれば動作 — 特別なハードウェア不要
- WebGPU:Cohere Transcribe、Voxtral Mini、Whisper ASR、TranslateGemma、Qwen 翻訳モデル用のオプション GPU アクセラレーション — 専用 GPU で大幅に高速化
- 推奨:快適なモデル読み込みのため 4GB 以上の RAM
- ストレージ:精度レベルに応じてモデルサイズは 5MB〜200MB 以上
- モダンブラウザが必要:WebGPU サポートには Chrome 113 以上、Edge 113 以上、または Firefox 120 以上
モデルカタログ
ASR(音声認識)モデル
ソース言語、精度要件、ハードウェア能力に基づいて音声認識モデルを選択してください。
オフラインモデル(CPU/WASM)
WebAssembly で CPU 上で動作する 23 モデル。GPU 不要。互換性が最も高い。
| モデル | 言語 | サイズ | 精度 | 速度 |
|---|---|---|---|---|
| SenseVoice (int8) | zh, en, ja, ko, yue | 238 MB | ★★★★☆ | ★★★★☆ |
| SenseVoice Nano (int8) | zh, en, ja, ko, yue | 265 MB | ★★★★★ | ★★★☆☆ |
| Moonshine Tiny EN (q) | en | 45 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny JA (q) | ja | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny KO (q) | ko | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Base ZH (q) | zh | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base JA (q) | ja | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base ES (q) | es | 66 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base AR (q) | ar | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base UK (q) | uk | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base VI (q) | vi | 142 MB | ★★★★☆ | ★★★★☆ |
| NeMo Canary (int8) | en, es, de, fr | 208 MB | ★★★★☆ | ★★★☆☆ |
| NeMo FastConformer Multi | be, de, en, es, fr, hr, it, pl, ru, uk | 133 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer DE | de | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer ES | es | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer PT | pt | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo Parakeet TDT 0.6B (int8) | 25 EU languages | 671 MB | ★★★★★ | ★★★☆☆ |
| Dolphin Base CTC Multi | zh, ja, ko, th, vi, ar, hi, bn, ru | 105 MB | ★★★★☆ | ★★★★☆ |
| Whisper Tiny (ONNX) | 99+ languages | 154 MB | ★★★☆☆ | ★★☆☆☆ |
| WenetSpeech Yue U2++ | zh, yue, en | 135 MB | ★★★★☆ | ★★★★☆ |
| Omnilingual 300M v2 | 1147 languages | 367 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer RU (int8) | ru | 74 MB | ★★★★☆ | ★★★★☆ |
| Zipformer VI 30M (int8) | vi | 35 MB | ★★★☆☆ | ★★★★★ |
ストリーミングモデル(CPU/WASM)
10 のリアルタイムストリーミングモデル。話しながら低遅延で文字起こし。
| モデル | 言語 | サイズ | 精度 | 速度 |
|---|---|---|---|---|
| Zipformer EN Kroko | en | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer FR Kroko | fr | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer DE Kroko | de | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ES Kroko | es | 156 MB | ★★★☆☆ | ★★★★☆ |
| Zipformer ZH (int8) | zh | 77 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ZH 2025 (int8) | zh | 167 MB | ★★★★☆ | ★★★★☆ |
| Zipformer RU Vosk (int8) | ru | 29 MB | ★★★☆☆ | ★★★★★ |
| Zipformer Multi (8 lang) | ar, en, id, ja, ru, th, vi, zh | 339 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer BN Vosk | bn | 94 MB | ★★★☆☆ | ★★★★☆ |
| NeMo CTC EN 80ms (int8) | en | 132 MB | ★★★★☆ | ★★★★★ |
WebGPU モデル(GPU 必須)
WebGPU で高速化された 9 モデル。Cohere Transcribe と Voxtral Mini 4B Realtime(推奨)および Whisper を含む。最高の精度と速度、互換 GPU が必要。
| モデル | 言語 | サイズ | 精度 | 速度 |
|---|---|---|---|---|
| Cohere Transcribe (q4) | 14 languages | ~2.1 GB | ★★★★★ | ★★★★☆ |
| Cohere Transcribe (q4f16) | 14 languages | ~1.5 GB | ★★★★★ | ★★★★☆ |
| Voxtral Mini 4B Realtime | 13 languages | ~2.3 GB | ★★★★★ | ★★★★★ |
| Whisper Tiny EN | en | 120 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Tiny | 99+ languages | 122 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Base | 99+ languages | 208 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Small | 99+ languages | 586 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Medium | 99+ languages | 680 MB | ★★★★★ | ★★☆☆☆ |
| Whisper Large V3 Turbo | 99+ languages | 759 MB | ★★★★★ | ★★☆☆☆ |
翻訳モデル
最高の品質と速度なら TranslateGemma、高速 CPU 翻訳なら Opus-MT、幅広い多言語対応なら Qwen LLM を選択。
TranslateGemma 4B(WebGPU)— おすすめ
Google の翻訳専用モデル。すべてのローカル翻訳モデルの中で最高の品質と最速の速度を実現。51 言語の任意方向双方向翻訳に対応。WebGPU が必要。
| モデル | 言語 | サイズ | 品質 | 速度 |
|---|---|---|---|---|
| TranslateGemma 4B (q4) | 51 languages | ~3.1 GB | ★★★★★ | ★★★★★ |
| TranslateGemma 4B (q4f16) | 51 languages | ~2.7 GB | ★★★★★ | ★★★★★ |
Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu
Qwen LLM(WebGPU)
119〜201 以上の言語に対応する大規模言語モデル。高品質だが GPU が必要。柔軟な多言語翻訳に最適。
| モデル | 言語 | サイズ | 品質 | 速度 |
|---|---|---|---|---|
| Qwen 2.5 0.5B | 28 languages | ~400 MB | ★★★☆☆ | ★★★★☆ |
| Qwen 3 0.6B | 119+ languages | 919 MB | ★★★★☆ | ★★★☆☆ |
| Qwen 3.5 0.8B | 201+ languages | ~1.6 GB | ★★★★★ | ★★☆☆☆ |
| Qwen 3.5 2B | 201+ languages | ~1.8 GB | ★★★★★ | ★☆☆☆☆ |
Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans
Qwen 3/3.5: 119–201+ languages (multilingual)
Opus-MT(CPU/WASM)
74 言語ペア、各約 110 MB。高速・軽量で任意のデバイスで動作。単方向翻訳に最適。
| src ↓ tgt → | en | ja | zh | ko | de | fr | es | it | ru | ar | hi | vi | tr | uk | pt | nl | pl | da | sv | fi | cs | ro | hu | id | no | et | th | af | xh |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| en | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||
| ja | ✓ | ||||||||||||||||||||||||||||
| zh | ✓ | ||||||||||||||||||||||||||||
| ko | ✓ | ||||||||||||||||||||||||||||
| de | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| fr | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| es | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| it | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| ru | ✓ | ✓ | ✓ | ✓ | |||||||||||||||||||||||||
| ar | ✓ | ||||||||||||||||||||||||||||
| hi | ✓ | ||||||||||||||||||||||||||||
| vi | ✓ | ||||||||||||||||||||||||||||
| tr | ✓ | ||||||||||||||||||||||||||||
| uk | ✓ | ✓ | |||||||||||||||||||||||||||
| pt | |||||||||||||||||||||||||||||
| nl | ✓ | ✓ | |||||||||||||||||||||||||||
| pl | ✓ | ||||||||||||||||||||||||||||
| da | ✓ | ✓ | |||||||||||||||||||||||||||
| sv | ✓ | ||||||||||||||||||||||||||||
| fi | ✓ | ✓ | |||||||||||||||||||||||||||
| cs | ✓ | ||||||||||||||||||||||||||||
| ro | ✓ | ✓ | |||||||||||||||||||||||||||
| hu | ✓ | ||||||||||||||||||||||||||||
| id | ✓ | ||||||||||||||||||||||||||||
| no | ✓ | ||||||||||||||||||||||||||||
| et | ✓ | ||||||||||||||||||||||||||||
| th | ✓ | ||||||||||||||||||||||||||||
| af | ✓ | ||||||||||||||||||||||||||||
| xh | ✓ |
TTS(テキスト読み上げ)モデル
52 言語で 136 モデル。すべて WASM 経由で CPU 上で動作 — GPU 不要。Piper、Coqui、Mimic3、VITS、Matcha エンジン搭載。
TTS 設定
- 話速 — 合成音声の再生速度を制御します。速度スライダーを調整して、お好みに合わせて出力を速くしたり遅くしたりできます。
- 話者 ID — 合成音声の声質を制御します。多くのモデルは複数の話者 ID をサポートしており、それぞれ異なる声質を持っています。一部のマルチスピーカーモデルには異なる性別の声が含まれており、話者 ID を変更することで男性または女性の声を選択できます。
| 言語 | モデル数 | エンジン | 話者 | サイズ範囲 |
|---|---|---|---|---|
| af | 1 | mimic3 | 1 | ~94 MB |
| ar | 2 | piper | 1 | 81–95 MB |
| bg | 1 | coqui | 1 | ~71 MB |
| bn | 2 | mimic3, coqui | 1 | 71–94 MB |
| ca | 3 | piper | 1 | 39–95 MB |
| cs | 2 | piper | 1 | 81–95 MB |
| cy | 2 | piper | 1–7 | ~95 MB |
| da | 1 | piper | 1 | ~95 MB |
| de | 8 | piper | 1 | 39–81 MB |
| el | 2 | piper, mimic3 | 1 | 81–94 MB |
| en | 13 | piper | 1–904 | 81–97 MB |
| es | 6 | piper | 1–2 | 39–95 MB |
| et | 1 | coqui | 1 | ~71 MB |
| fa | 8 | piper, mimic3, matcha | 1 | 81–146 MB |
| fi | 2 | piper | 1 | 81–95 MB |
| fr | 8 | piper | 1–16 | 39–95 MB |
| ga | 1 | coqui | 1 | ~71 MB |
| gu | 1 | mimic3 | 1 | ~94 MB |
| hi | 3 | piper | 1 | ~95 MB |
| hr | 1 | coqui | 1 | ~71 MB |
| hu | 3 | piper | 1 | ~95 MB |
| id | 1 | piper | 1 | ~95 MB |
| is | 4 | piper | 1 | ~95 MB |
| it | 2 | piper | 1 | 39–95 MB |
| ka | 1 | piper | 1 | ~95 MB |
| kk | 3 | piper | 1+ | 39–81 MB |
| ko | 1 | mimic3 | 1 | ~94 MB |
| lb | 1 | piper | 1 | ~95 MB |
| lt | 1 | coqui | 1 | ~71 MB |
| lv | 1 | piper | 1 | ~95 MB |
| ml | 2 | piper | 1 | ~95 MB |
| mt | 1 | coqui | 1 | ~71 MB |
| ne | 3 | piper | 1+ | 39–95 MB |
| nl | 4 | piper | 1 | 39–95 MB |
| no | 1 | piper | 1 | ~95 MB |
| pl | 7 | piper | 1 | ~95 MB |
| pt | 4 | piper | 1 | 81–95 MB |
| ro | 1 | piper | 1 | ~95 MB |
| ru | 4 | piper | 1 | ~95 MB |
| sk | 1 | piper | 1 | ~95 MB |
| sl | 1 | piper | 1 | ~95 MB |
| sr | 1 | piper | multi | ~95 MB |
| sv | 2 | piper | 1+ | ~95 MB |
| sw | 1 | piper | 1 | ~95 MB |
| tn | 1 | mimic3 | multi | ~94 MB |
| tr | 3 | piper | 1 | ~95 MB |
| uk | 2 | piper | 1+ | 39–95 MB |
| vi | 4 | piper, mimic3 | 1–65 | 46–95 MB |
| yue | 1 | vits | 1 | ~114 MB |
| zh | 3 | vits, piper, matcha | 1–218 | 81–213 MB |
トラブルシューティング
一般的な問題
モデルのダウンロードに失敗する: 初回ダウンロード時のインターネット接続を確認してください。モデルはローカルの IndexedDB にキャッシュされるため、以降はオフラインで使用できます。ダウンロードが破損している場合は、ブラウザデータのクリアをお試しください。
ASR が音声を認識しない: ソース言語に正しい ASR モデルを選択しているか確認してください。より精度の高い大きなモデルをお試しください。マイクが正常に動作し、権限が付与されていることを確認してください。
翻訳品質が低い: Opus-MT モデルは品質よりも速度に最適化されています。デバイスが WebGPU をサポートしている場合は、TranslateGemma または Qwen LLM モデルをお試しください。正しい言語ペアを選択していることを確認してください。
WebGPU が利用できない: WebGPU には互換性のあるブラウザと GPU が必要です。GPU 不要で任意のモダンブラウザで動作する WASM ベースのモデル(sherpa-onnx、Opus-MT)にフォールバックしてください。
パフォーマンスのヒント
- 利用可能な場合は WebGPU モデルを使用して処理を大幅に高速化
- 他のブラウザタブを閉じてモデル読み込み用のメモリを確保
- 低スペックデバイスや速度を優先する場合は小さいモデルを選択
- WASM モデル(sherpa-onnx、Opus-MT)は互換性が高いが WebGPU 代替品より低速
- ブラウザのメモリ使用量を監視 — 大きなモデルは 2GB 以上のブラウザメモリが必要な場合があります
さらにヘルプが必要ですか?コミュニティサポート、モデル互換性ガイド、ローカル(オフライン)機能の最新情報については、GitHub リポジトリをご覧ください。