AI プロバイダーに戻る

ローカル(オフライン)セットアップチュートリアル

概要

ローカル(オフライン)モードを使用すると、ASR(自動音声認識)、翻訳、TTS(テキスト読み上げ)をすべてデバイス上で実行できます。API キー不要、インターネット接続不要、データがデバイスから外に出ることはありません。すべての処理は WebAssembly と WebGPU を使用してローカルで行われます。

API キーもインターネットも不要

プライバシー最優先 — すべての音声とテキストはデバイス上に保持されます。モデルをダウンロードした後は、ローカル(オフライン)モードは完全にオフラインで動作します。会話がデバイスの外に出ることはありません。

1プロバイダーとして「ローカル(オフライン)」を選択

Sokuji を開き、設定パネルに移動します。プロバイダーのドロップダウンから 「ローカル(オフライン)」 を AI プロバイダーとして選択します。

2ASR モデルをダウンロード

ソース言語に合った ASR モデルを選択します。Sokuji は sherpa-onnx WASM と WebGPU(Cohere Transcribe、Voxtral Mini、Whisper)を搭載した 42 のオフライン/ストリーミングモデルを提供し、99 以上の言語をカバーしています。モデルサイズは軽量(約 5MB)から高精度(約 2GB 以上)まで様々です。最高の精度と速度には Cohere Transcribe または Voxtral Mini 4B Realtime を推奨します。

3翻訳モデルをダウンロード

翻訳言語ペアを選択します。最高の品質と速度なら TranslateGemma、高速 CPU 翻訳用の 74 の Opus-MT 言語ペア、または WebGPU 経由の Qwen LLM による高品質な多言語翻訳から選べます。

4TTS モデルをダウンロード

音声出力用の TTS モデルをダウンロードしてください。Piper、Coqui、Mimic3、Matcha エンジンを搭載した 136 モデルが 52 言語で利用可能です。

5翻訳を開始

セッション開始ボタンをクリックします。インターネット接続は不要です — 翻訳はデバイス上で完全にリアルタイムで行われます。

追加情報

ローカル(オフライン)モードとは?

ローカル(オフライン)は、クラウドサービスを一切使用せずに ASR、翻訳、TTS を実行する完全オンデバイス AI 翻訳パイプラインです:

  • 完全なプライバシー — すべての音声・テキスト処理はデバイス上で完結
  • 初回モデルダウンロード後はオフラインで動作
  • API キー、アカウント、サブスクリプション不要
  • WebAssembly (WASM) と WebGPU によりネイティブに近いパフォーマンスを実現
  • 無料で使用可能、使用制限なし

利用可能なモデル

ローカル(オフライン)モードは翻訳パイプラインの各段階に豊富なモデルを提供します:

  • ASR:Cohere Transcribe、Voxtral Mini 4B Realtime、Whisper、SenseVoice、Moonshine、NeMo、Zipformer を含む 42 モデル — 99 以上の言語に対応
  • 翻訳:高速 CPU 翻訳用の 74 の Opus-MT 言語ペア、および WebGPU 経由の TranslateGemma と Qwen LLM による多言語サポート
  • TTS:Piper、Coqui、Mimic3、Matcha エンジンを使用した 52 言語 136 モデル

ハードウェア要件

  • CPU (WASM):モダンブラウザがあれば動作 — 特別なハードウェア不要
  • WebGPU:Cohere Transcribe、Voxtral Mini、Whisper ASR、TranslateGemma、Qwen 翻訳モデル用のオプション GPU アクセラレーション — 専用 GPU で大幅に高速化
  • 推奨:快適なモデル読み込みのため 4GB 以上の RAM
  • ストレージ:精度レベルに応じてモデルサイズは 5MB〜200MB 以上
  • モダンブラウザが必要:WebGPU サポートには Chrome 113 以上、Edge 113 以上、または Firefox 120 以上

モデルカタログ

ASR(音声認識)モデル

ソース言語、精度要件、ハードウェア能力に基づいて音声認識モデルを選択してください。

オフラインモデル(CPU/WASM)

WebAssembly で CPU 上で動作する 23 モデル。GPU 不要。互換性が最も高い。

モデル言語サイズ精度速度
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

ストリーミングモデル(CPU/WASM)

10 のリアルタイムストリーミングモデル。話しながら低遅延で文字起こし。

モデル言語サイズ精度速度
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

WebGPU モデル(GPU 必須)

WebGPU で高速化された 9 モデル。Cohere Transcribe と Voxtral Mini 4B Realtime(推奨)および Whisper を含む。最高の精度と速度、互換 GPU が必要。

モデル言語サイズ精度速度
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

翻訳モデル

最高の品質と速度なら TranslateGemma、高速 CPU 翻訳なら Opus-MT、幅広い多言語対応なら Qwen LLM を選択。

TranslateGemma 4B(WebGPU)— おすすめ

Google の翻訳専用モデル。すべてのローカル翻訳モデルの中で最高の品質と最速の速度を実現。51 言語の任意方向双方向翻訳に対応。WebGPU が必要。

モデル言語サイズ品質速度
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM(WebGPU)

119〜201 以上の言語に対応する大規模言語モデル。高品質だが GPU が必要。柔軟な多言語翻訳に最適。

モデル言語サイズ品質速度
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT(CPU/WASM)

74 言語ペア、各約 110 MB。高速・軽量で任意のデバイスで動作。単方向翻訳に最適。

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

TTS(テキスト読み上げ)モデル

52 言語で 136 モデル。すべて WASM 経由で CPU 上で動作 — GPU 不要。Piper、Coqui、Mimic3、VITS、Matcha エンジン搭載。

TTS 設定

  • 話速 — 合成音声の再生速度を制御します。速度スライダーを調整して、お好みに合わせて出力を速くしたり遅くしたりできます。
  • 話者 ID — 合成音声の声質を制御します。多くのモデルは複数の話者 ID をサポートしており、それぞれ異なる声質を持っています。一部のマルチスピーカーモデルには異なる性別の声が含まれており、話者 ID を変更することで男性または女性の声を選択できます。
言語モデル数エンジン話者サイズ範囲
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

トラブルシューティング

一般的な問題

モデルのダウンロードに失敗する: 初回ダウンロード時のインターネット接続を確認してください。モデルはローカルの IndexedDB にキャッシュされるため、以降はオフラインで使用できます。ダウンロードが破損している場合は、ブラウザデータのクリアをお試しください。

ASR が音声を認識しない: ソース言語に正しい ASR モデルを選択しているか確認してください。より精度の高い大きなモデルをお試しください。マイクが正常に動作し、権限が付与されていることを確認してください。

翻訳品質が低い: Opus-MT モデルは品質よりも速度に最適化されています。デバイスが WebGPU をサポートしている場合は、TranslateGemma または Qwen LLM モデルをお試しください。正しい言語ペアを選択していることを確認してください。

WebGPU が利用できない: WebGPU には互換性のあるブラウザと GPU が必要です。GPU 不要で任意のモダンブラウザで動作する WASM ベースのモデル(sherpa-onnx、Opus-MT)にフォールバックしてください。

パフォーマンスのヒント

  1. 利用可能な場合は WebGPU モデルを使用して処理を大幅に高速化
  2. 他のブラウザタブを閉じてモデル読み込み用のメモリを確保
  3. 低スペックデバイスや速度を優先する場合は小さいモデルを選択
  4. WASM モデル(sherpa-onnx、Opus-MT)は互換性が高いが WebGPU 代替品より低速
  5. ブラウザのメモリ使用量を監視 — 大きなモデルは 2GB 以上のブラウザメモリが必要な場合があります

さらにヘルプが必要ですか?コミュニティサポート、モデル互換性ガイド、ローカル(オフライン)機能の最新情報については、GitHub リポジトリをご覧ください。

GitHub Repository