返回 AI 提供商

本地(离线)设置教程

概述

本地(离线)模式让您可以在设备上完全本地运行 ASR(自动语音识别)、翻译和 TTS(文字转语音)。无需 API 密钥,无需互联网连接,数据不会离开您的设备。所有处理均通过 WebAssembly 和 WebGPU 在本地完成。

无需 API 密钥或互联网

隐私优先 — 所有音频和文本都保留在您的设备上。下载模型后,本地(离线)模式可完全离线工作。您的对话永远不会离开您的设备。

1选择"本地(离线)"作为提供商

打开 Sokuji 并导航到设置面板。从提供商下拉菜单中选择 "本地(离线)" 作为 AI 提供商。

2下载 ASR 模型

为您的源语言选择 ASR 模型。Sokuji 提供 42 个离线/流式模型,由 sherpa-onnx WASM 和 WebGPU(Cohere Transcribe、Voxtral Mini、Whisper)驱动,覆盖 99+ 种语言。模型大小从轻量级(约 5MB)到高精度(约 2GB+)不等。推荐使用 Cohere Transcribe 或 Voxtral Mini 4B Realtime 以获得最佳精度和速度。

3下载翻译模型

选择翻译语言对。选择 TranslateGemma 获得最佳质量和速度,选择 Opus-MT 进行快速 CPU 翻译,或选择 Qwen LLM 通过 WebGPU 进行更高质量的多语言翻译。

4下载 TTS 模型

下载 TTS 模型以获得语音输出。提供 136 个模型,覆盖 52 种语言,由 Piper、Coqui、Mimic3 和 Matcha 引擎驱动。

5开始翻译

点击 开始会话 按钮。无需互联网连接 — 翻译完全在您的设备上实时进行。

附加信息

什么是本地(离线)模式?

本地(离线)是完全在设备上运行的 AI 翻译管道,无需任何云服务即可运行 ASR、翻译和 TTS:

  • 完全隐私 — 所有音频和文本处理都在设备上完成
  • 初次下载模型后即可离线工作
  • 无需 API 密钥、账户或订阅
  • 由 WebAssembly (WASM) 和 WebGPU 驱动,提供接近原生的性能
  • 免费使用,无使用限制

可用模型

本地(离线)模式为翻译管道的每个阶段提供丰富的模型选择:

  • ASR:42 个模型,包括 Cohere Transcribe、Voxtral Mini 4B Realtime、Whisper、SenseVoice、Moonshine、NeMo 和 Zipformer — 覆盖 99+ 种语言
  • 翻译:74 个 Opus-MT 语言对用于快速 CPU 翻译,以及通过 WebGPU 运行的 TranslateGemma 和 Qwen LLM 支持多语言翻译
  • TTS:136 个模型,覆盖 52 种语言,使用 Piper、Coqui、Mimic3 和 Matcha 引擎

硬件要求

  • CPU (WASM):适用于任何现代浏览器 — 无需特殊硬件
  • WebGPU:可选 GPU 加速,用于 Cohere Transcribe、Voxtral Mini、Whisper ASR、TranslateGemma 和 Qwen 翻译模型 — 使用独立 GPU 可显著提升速度
  • 建议:4GB+ 内存以便舒适地加载模型
  • 存储空间:模型大小从 5MB 到 200MB+ 不等,取决于精度级别
  • 需要现代浏览器:Chrome 113+、Edge 113+ 或 Firefox 120+ 以支持 WebGPU

模型目录

ASR(语音识别)模型

根据源语言、精度需求和硬件能力选择语音识别模型。

离线模型(CPU/WASM)

23 个通过 WebAssembly 在 CPU 上运行的模型。无需 GPU。兼容性最好。

模型语言大小精度速度
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

流式模型(CPU/WASM)

10 个实时流式模型。边说边转录,低延迟。

模型语言大小精度速度
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

WebGPU 模型(需要 GPU)

9 个由 WebGPU 加速的模型,包括 Cohere Transcribe 和 Voxtral Mini 4B Realtime(推荐)以及 Whisper。精度和速度最佳,需要兼容的 GPU。

模型语言大小精度速度
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

翻译模型

选择 TranslateGemma 获得最佳质量和速度,选择 Opus-MT 进行快速 CPU 翻译,或选择 Qwen LLM 获得更广泛的多语言覆盖。

TranslateGemma 4B(WebGPU)— 推荐

Google 专为翻译打造的模型,在所有本地翻译模型中质量最高、速度最快。支持 51 种语言的任意方向双向翻译。需要 WebGPU。

模型语言大小质量速度
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM(WebGPU)

支持 119–201+ 种语言的大型语言模型。质量更高但需要 GPU。最适合灵活的多语言翻译。

模型语言大小质量速度
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT(CPU/WASM)

74 个语言对,每个约 110 MB。快速、轻量,可在任何设备上运行。最适合单向翻译。

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

TTS(文字转语音)模型

52 种语言共 136 个模型。全部通过 WASM 在 CPU 上运行 — 无需 GPU。由 Piper、Coqui、Mimic3、VITS 和 Matcha 引擎驱动。

TTS 设置

  • 语速 — 控制合成语音的播放速度。调节语速滑块可以让输出语音变快或变慢,以满足您的需求。
  • 说话人 ID — 控制合成语音的音色。许多模型支持多个说话人 ID,每个 ID 对应不同的音色。部分多说话人模型包含不同性别的音色,您可以通过选择不同的说话人 ID 来切换男声或女声。
语言模型数引擎说话人大小范围
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

故障排除

常见问题

模型下载失败: 请检查初次下载时的互联网连接。模型缓存在本地 IndexedDB 中,后续使用可离线工作。如果下载损坏,请尝试清除浏览器数据。

ASR 无法识别语音: 确保您为源语言选择了正确的 ASR 模型。尝试使用更大的模型以提高准确度。检查麦克风是否正常工作且已授予权限。

翻译质量低: Opus-MT 模型针对速度而非质量进行了优化。如果您的设备支持 WebGPU,请尝试 TranslateGemma 或 Qwen LLM 模型以获得更好的效果。确保选择了正确的语言对。

WebGPU 不可用: WebGPU 需要兼容的浏览器和 GPU。可回退到基于 WASM 的模型(sherpa-onnx、Opus-MT),这些模型在任何现代浏览器上都可以运行,无需 GPU。

性能优化建议

  1. 在可用时使用 WebGPU 模型以显著加快处理速度
  2. 关闭其他浏览器标签页以释放内存用于模型加载
  3. 在低端设备上或优先考虑速度时选择较小的模型
  4. WASM 模型(sherpa-onnx、Opus-MT)兼容性更好但比 WebGPU 替代方案更慢
  5. 监控浏览器内存使用 — 大型模型可能需要 2GB+ 的浏览器内存

需要更多帮助?请访问我们的 GitHub 仓库获取社区支持、模型兼容性指南和本地(离线)功能的最新更新。

GitHub Repository