本地(离线)设置教程
概述
本地(离线)模式让您可以在设备上完全本地运行 ASR(自动语音识别)、翻译和 TTS(文字转语音)。无需 API 密钥,无需互联网连接,数据不会离开您的设备。所有处理均通过 WebAssembly 和 WebGPU 在本地完成。
无需 API 密钥或互联网
隐私优先 — 所有音频和文本都保留在您的设备上。下载模型后,本地(离线)模式可完全离线工作。您的对话永远不会离开您的设备。
1选择"本地(离线)"作为提供商
打开 Sokuji 并导航到设置面板。从提供商下拉菜单中选择 "本地(离线)" 作为 AI 提供商。
2下载 ASR 模型
为您的源语言选择 ASR 模型。Sokuji 提供 42 个离线/流式模型,由 sherpa-onnx WASM 和 WebGPU(Cohere Transcribe、Voxtral Mini、Whisper)驱动,覆盖 99+ 种语言。模型大小从轻量级(约 5MB)到高精度(约 2GB+)不等。推荐使用 Cohere Transcribe 或 Voxtral Mini 4B Realtime 以获得最佳精度和速度。
3下载翻译模型
选择翻译语言对。选择 TranslateGemma 获得最佳质量和速度,选择 Opus-MT 进行快速 CPU 翻译,或选择 Qwen LLM 通过 WebGPU 进行更高质量的多语言翻译。
4下载 TTS 模型
下载 TTS 模型以获得语音输出。提供 136 个模型,覆盖 52 种语言,由 Piper、Coqui、Mimic3 和 Matcha 引擎驱动。
5开始翻译
点击 开始会话 按钮。无需互联网连接 — 翻译完全在您的设备上实时进行。
附加信息
什么是本地(离线)模式?
本地(离线)是完全在设备上运行的 AI 翻译管道,无需任何云服务即可运行 ASR、翻译和 TTS:
- 完全隐私 — 所有音频和文本处理都在设备上完成
- 初次下载模型后即可离线工作
- 无需 API 密钥、账户或订阅
- 由 WebAssembly (WASM) 和 WebGPU 驱动,提供接近原生的性能
- 免费使用,无使用限制
可用模型
本地(离线)模式为翻译管道的每个阶段提供丰富的模型选择:
- ASR:42 个模型,包括 Cohere Transcribe、Voxtral Mini 4B Realtime、Whisper、SenseVoice、Moonshine、NeMo 和 Zipformer — 覆盖 99+ 种语言
- 翻译:74 个 Opus-MT 语言对用于快速 CPU 翻译,以及通过 WebGPU 运行的 TranslateGemma 和 Qwen LLM 支持多语言翻译
- TTS:136 个模型,覆盖 52 种语言,使用 Piper、Coqui、Mimic3 和 Matcha 引擎
硬件要求
- CPU (WASM):适用于任何现代浏览器 — 无需特殊硬件
- WebGPU:可选 GPU 加速,用于 Cohere Transcribe、Voxtral Mini、Whisper ASR、TranslateGemma 和 Qwen 翻译模型 — 使用独立 GPU 可显著提升速度
- 建议:4GB+ 内存以便舒适地加载模型
- 存储空间:模型大小从 5MB 到 200MB+ 不等,取决于精度级别
- 需要现代浏览器:Chrome 113+、Edge 113+ 或 Firefox 120+ 以支持 WebGPU
模型目录
ASR(语音识别)模型
根据源语言、精度需求和硬件能力选择语音识别模型。
离线模型(CPU/WASM)
23 个通过 WebAssembly 在 CPU 上运行的模型。无需 GPU。兼容性最好。
| 模型 | 语言 | 大小 | 精度 | 速度 |
|---|---|---|---|---|
| SenseVoice (int8) | zh, en, ja, ko, yue | 238 MB | ★★★★☆ | ★★★★☆ |
| SenseVoice Nano (int8) | zh, en, ja, ko, yue | 265 MB | ★★★★★ | ★★★☆☆ |
| Moonshine Tiny EN (q) | en | 45 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny JA (q) | ja | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny KO (q) | ko | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Base ZH (q) | zh | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base JA (q) | ja | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base ES (q) | es | 66 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base AR (q) | ar | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base UK (q) | uk | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base VI (q) | vi | 142 MB | ★★★★☆ | ★★★★☆ |
| NeMo Canary (int8) | en, es, de, fr | 208 MB | ★★★★☆ | ★★★☆☆ |
| NeMo FastConformer Multi | be, de, en, es, fr, hr, it, pl, ru, uk | 133 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer DE | de | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer ES | es | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer PT | pt | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo Parakeet TDT 0.6B (int8) | 25 EU languages | 671 MB | ★★★★★ | ★★★☆☆ |
| Dolphin Base CTC Multi | zh, ja, ko, th, vi, ar, hi, bn, ru | 105 MB | ★★★★☆ | ★★★★☆ |
| Whisper Tiny (ONNX) | 99+ languages | 154 MB | ★★★☆☆ | ★★☆☆☆ |
| WenetSpeech Yue U2++ | zh, yue, en | 135 MB | ★★★★☆ | ★★★★☆ |
| Omnilingual 300M v2 | 1147 languages | 367 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer RU (int8) | ru | 74 MB | ★★★★☆ | ★★★★☆ |
| Zipformer VI 30M (int8) | vi | 35 MB | ★★★☆☆ | ★★★★★ |
流式模型(CPU/WASM)
10 个实时流式模型。边说边转录,低延迟。
| 模型 | 语言 | 大小 | 精度 | 速度 |
|---|---|---|---|---|
| Zipformer EN Kroko | en | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer FR Kroko | fr | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer DE Kroko | de | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ES Kroko | es | 156 MB | ★★★☆☆ | ★★★★☆ |
| Zipformer ZH (int8) | zh | 77 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ZH 2025 (int8) | zh | 167 MB | ★★★★☆ | ★★★★☆ |
| Zipformer RU Vosk (int8) | ru | 29 MB | ★★★☆☆ | ★★★★★ |
| Zipformer Multi (8 lang) | ar, en, id, ja, ru, th, vi, zh | 339 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer BN Vosk | bn | 94 MB | ★★★☆☆ | ★★★★☆ |
| NeMo CTC EN 80ms (int8) | en | 132 MB | ★★★★☆ | ★★★★★ |
WebGPU 模型(需要 GPU)
9 个由 WebGPU 加速的模型,包括 Cohere Transcribe 和 Voxtral Mini 4B Realtime(推荐)以及 Whisper。精度和速度最佳,需要兼容的 GPU。
| 模型 | 语言 | 大小 | 精度 | 速度 |
|---|---|---|---|---|
| Cohere Transcribe (q4) | 14 languages | ~2.1 GB | ★★★★★ | ★★★★☆ |
| Cohere Transcribe (q4f16) | 14 languages | ~1.5 GB | ★★★★★ | ★★★★☆ |
| Voxtral Mini 4B Realtime | 13 languages | ~2.3 GB | ★★★★★ | ★★★★★ |
| Whisper Tiny EN | en | 120 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Tiny | 99+ languages | 122 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Base | 99+ languages | 208 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Small | 99+ languages | 586 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Medium | 99+ languages | 680 MB | ★★★★★ | ★★☆☆☆ |
| Whisper Large V3 Turbo | 99+ languages | 759 MB | ★★★★★ | ★★☆☆☆ |
翻译模型
选择 TranslateGemma 获得最佳质量和速度,选择 Opus-MT 进行快速 CPU 翻译,或选择 Qwen LLM 获得更广泛的多语言覆盖。
TranslateGemma 4B(WebGPU)— 推荐
Google 专为翻译打造的模型,在所有本地翻译模型中质量最高、速度最快。支持 51 种语言的任意方向双向翻译。需要 WebGPU。
| 模型 | 语言 | 大小 | 质量 | 速度 |
|---|---|---|---|---|
| TranslateGemma 4B (q4) | 51 languages | ~3.1 GB | ★★★★★ | ★★★★★ |
| TranslateGemma 4B (q4f16) | 51 languages | ~2.7 GB | ★★★★★ | ★★★★★ |
Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu
Qwen LLM(WebGPU)
支持 119–201+ 种语言的大型语言模型。质量更高但需要 GPU。最适合灵活的多语言翻译。
| 模型 | 语言 | 大小 | 质量 | 速度 |
|---|---|---|---|---|
| Qwen 2.5 0.5B | 28 languages | ~400 MB | ★★★☆☆ | ★★★★☆ |
| Qwen 3 0.6B | 119+ languages | 919 MB | ★★★★☆ | ★★★☆☆ |
| Qwen 3.5 0.8B | 201+ languages | ~1.6 GB | ★★★★★ | ★★☆☆☆ |
| Qwen 3.5 2B | 201+ languages | ~1.8 GB | ★★★★★ | ★☆☆☆☆ |
Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans
Qwen 3/3.5: 119–201+ languages (multilingual)
Opus-MT(CPU/WASM)
74 个语言对,每个约 110 MB。快速、轻量,可在任何设备上运行。最适合单向翻译。
| src ↓ tgt → | en | ja | zh | ko | de | fr | es | it | ru | ar | hi | vi | tr | uk | pt | nl | pl | da | sv | fi | cs | ro | hu | id | no | et | th | af | xh |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| en | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||
| ja | ✓ | ||||||||||||||||||||||||||||
| zh | ✓ | ||||||||||||||||||||||||||||
| ko | ✓ | ||||||||||||||||||||||||||||
| de | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| fr | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| es | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| it | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| ru | ✓ | ✓ | ✓ | ✓ | |||||||||||||||||||||||||
| ar | ✓ | ||||||||||||||||||||||||||||
| hi | ✓ | ||||||||||||||||||||||||||||
| vi | ✓ | ||||||||||||||||||||||||||||
| tr | ✓ | ||||||||||||||||||||||||||||
| uk | ✓ | ✓ | |||||||||||||||||||||||||||
| pt | |||||||||||||||||||||||||||||
| nl | ✓ | ✓ | |||||||||||||||||||||||||||
| pl | ✓ | ||||||||||||||||||||||||||||
| da | ✓ | ✓ | |||||||||||||||||||||||||||
| sv | ✓ | ||||||||||||||||||||||||||||
| fi | ✓ | ✓ | |||||||||||||||||||||||||||
| cs | ✓ | ||||||||||||||||||||||||||||
| ro | ✓ | ✓ | |||||||||||||||||||||||||||
| hu | ✓ | ||||||||||||||||||||||||||||
| id | ✓ | ||||||||||||||||||||||||||||
| no | ✓ | ||||||||||||||||||||||||||||
| et | ✓ | ||||||||||||||||||||||||||||
| th | ✓ | ||||||||||||||||||||||||||||
| af | ✓ | ||||||||||||||||||||||||||||
| xh | ✓ |
TTS(文字转语音)模型
52 种语言共 136 个模型。全部通过 WASM 在 CPU 上运行 — 无需 GPU。由 Piper、Coqui、Mimic3、VITS 和 Matcha 引擎驱动。
TTS 设置
- 语速 — 控制合成语音的播放速度。调节语速滑块可以让输出语音变快或变慢,以满足您的需求。
- 说话人 ID — 控制合成语音的音色。许多模型支持多个说话人 ID,每个 ID 对应不同的音色。部分多说话人模型包含不同性别的音色,您可以通过选择不同的说话人 ID 来切换男声或女声。
| 语言 | 模型数 | 引擎 | 说话人 | 大小范围 |
|---|---|---|---|---|
| af | 1 | mimic3 | 1 | ~94 MB |
| ar | 2 | piper | 1 | 81–95 MB |
| bg | 1 | coqui | 1 | ~71 MB |
| bn | 2 | mimic3, coqui | 1 | 71–94 MB |
| ca | 3 | piper | 1 | 39–95 MB |
| cs | 2 | piper | 1 | 81–95 MB |
| cy | 2 | piper | 1–7 | ~95 MB |
| da | 1 | piper | 1 | ~95 MB |
| de | 8 | piper | 1 | 39–81 MB |
| el | 2 | piper, mimic3 | 1 | 81–94 MB |
| en | 13 | piper | 1–904 | 81–97 MB |
| es | 6 | piper | 1–2 | 39–95 MB |
| et | 1 | coqui | 1 | ~71 MB |
| fa | 8 | piper, mimic3, matcha | 1 | 81–146 MB |
| fi | 2 | piper | 1 | 81–95 MB |
| fr | 8 | piper | 1–16 | 39–95 MB |
| ga | 1 | coqui | 1 | ~71 MB |
| gu | 1 | mimic3 | 1 | ~94 MB |
| hi | 3 | piper | 1 | ~95 MB |
| hr | 1 | coqui | 1 | ~71 MB |
| hu | 3 | piper | 1 | ~95 MB |
| id | 1 | piper | 1 | ~95 MB |
| is | 4 | piper | 1 | ~95 MB |
| it | 2 | piper | 1 | 39–95 MB |
| ka | 1 | piper | 1 | ~95 MB |
| kk | 3 | piper | 1+ | 39–81 MB |
| ko | 1 | mimic3 | 1 | ~94 MB |
| lb | 1 | piper | 1 | ~95 MB |
| lt | 1 | coqui | 1 | ~71 MB |
| lv | 1 | piper | 1 | ~95 MB |
| ml | 2 | piper | 1 | ~95 MB |
| mt | 1 | coqui | 1 | ~71 MB |
| ne | 3 | piper | 1+ | 39–95 MB |
| nl | 4 | piper | 1 | 39–95 MB |
| no | 1 | piper | 1 | ~95 MB |
| pl | 7 | piper | 1 | ~95 MB |
| pt | 4 | piper | 1 | 81–95 MB |
| ro | 1 | piper | 1 | ~95 MB |
| ru | 4 | piper | 1 | ~95 MB |
| sk | 1 | piper | 1 | ~95 MB |
| sl | 1 | piper | 1 | ~95 MB |
| sr | 1 | piper | multi | ~95 MB |
| sv | 2 | piper | 1+ | ~95 MB |
| sw | 1 | piper | 1 | ~95 MB |
| tn | 1 | mimic3 | multi | ~94 MB |
| tr | 3 | piper | 1 | ~95 MB |
| uk | 2 | piper | 1+ | 39–95 MB |
| vi | 4 | piper, mimic3 | 1–65 | 46–95 MB |
| yue | 1 | vits | 1 | ~114 MB |
| zh | 3 | vits, piper, matcha | 1–218 | 81–213 MB |
故障排除
常见问题
模型下载失败: 请检查初次下载时的互联网连接。模型缓存在本地 IndexedDB 中,后续使用可离线工作。如果下载损坏,请尝试清除浏览器数据。
ASR 无法识别语音: 确保您为源语言选择了正确的 ASR 模型。尝试使用更大的模型以提高准确度。检查麦克风是否正常工作且已授予权限。
翻译质量低: Opus-MT 模型针对速度而非质量进行了优化。如果您的设备支持 WebGPU,请尝试 TranslateGemma 或 Qwen LLM 模型以获得更好的效果。确保选择了正确的语言对。
WebGPU 不可用: WebGPU 需要兼容的浏览器和 GPU。可回退到基于 WASM 的模型(sherpa-onnx、Opus-MT),这些模型在任何现代浏览器上都可以运行,无需 GPU。
性能优化建议
- 在可用时使用 WebGPU 模型以显著加快处理速度
- 关闭其他浏览器标签页以释放内存用于模型加载
- 在低端设备上或优先考虑速度时选择较小的模型
- WASM 模型(sherpa-onnx、Opus-MT)兼容性更好但比 WebGPU 替代方案更慢
- 监控浏览器内存使用 — 大型模型可能需要 2GB+ 的浏览器内存
需要更多帮助?请访问我们的 GitHub 仓库获取社区支持、模型兼容性指南和本地(离线)功能的最新更新。