Руководство по настройке локального (автономного) режима
Обзор
Локальный (автономный) режим позволяет запускать ASR (автоматическое распознавание речи), перевод и TTS (синтез речи) полностью на вашем устройстве. Без API-ключа, без подключения к Интернету, и данные не покидают ваш компьютер. Всё обрабатывается локально с помощью WebAssembly и WebGPU.
Не требуется API-ключ или Интернет
Конфиденциальность прежде всего — все аудио- и текстовые данные остаются на вашем устройстве. После загрузки моделей локальный (автономный) режим работает полностью в автономном режиме. Ваши разговоры никогда не покидают ваш компьютер.
1Выберите «Локальный (автономный)» как провайдера
Откройте Sokuji и перейдите в панель настроек. Выберите «Локальный (автономный)» в качестве провайдера ИИ в выпадающем списке провайдеров.
2Скачайте модель ASR
Выберите модель ASR для вашего исходного языка. Sokuji предлагает 42 автономных/потоковых модели на базе sherpa-onnx WASM и WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), поддерживающих более 99 языков. Размер моделей варьируется от лёгких (~5 МБ) до высокоточных (~2 ГБ+). Рекомендуем Cohere Transcribe или Voxtral Mini 4B Realtime для лучшей точности и скорости.
3Скачайте модель перевода
Выберите языковую пару для перевода. Выберите TranslateGemma для лучшего качества и скорости, 74 языковых пары Opus-MT для быстрого перевода на CPU или Qwen LLM через WebGPU для более качественного многоязычного перевода.
4Скачайте модель TTS
Скачайте модель TTS для голосового вывода. Доступно 136 моделей на 52 языках, работающих на движках Piper, Coqui, Mimic3 и Matcha.
5Начните переводить
Нажмите кнопку Начать сессию. Подключение к Интернету не требуется — перевод выполняется полностью на вашем устройстве в реальном времени.
Дополнительная информация
Что такое локальный (автономный) режим?
Локальный (автономный) — это полностью работающий на устройстве конвейер перевода ИИ, который выполняет ASR, перевод и TTS без каких-либо облачных сервисов:
- Полная конфиденциальность — вся обработка аудио и текста выполняется на вашем устройстве
- Работает автономно после первоначальной загрузки моделей
- Не требуются API-ключи, учётные записи или подписки
- Работает на WebAssembly (WASM) и WebGPU с производительностью, близкой к нативной
- Бесплатное использование без ограничений
Доступные модели
Локальный (автономный) режим поддерживает широкий спектр моделей для каждого этапа конвейера перевода:
- ASR: 42 модели, включая Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo и Zipformer — поддержка более 99 языков
- Перевод: 74 языковых пары Opus-MT для быстрого перевода на CPU, а также TranslateGemma и Qwen LLM через WebGPU для многоязычной поддержки
- TTS: 136 моделей на 52 языках с использованием движков Piper, Coqui, Mimic3 и Matcha
Требования к оборудованию
- CPU (WASM): Работает в любом современном браузере — специальное оборудование не требуется
- WebGPU: Опциональное ускорение GPU для моделей Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma и перевода Qwen — значительно быстрее с выделенным GPU
- Рекомендуется: 4 ГБ+ ОЗУ для комфортной загрузки моделей
- Хранилище: Размер моделей от 5 МБ до 200+ МБ в зависимости от уровня точности
- Требуется современный браузер: Chrome 113+, Edge 113+ или Firefox 120+ для поддержки WebGPU
Каталог моделей
Модели ASR (распознавание речи)
Выберите модель распознавания речи на основе исходного языка, требований к точности и аппаратных возможностей.
Автономные модели (CPU/WASM)
23 модели, работающие на CPU через WebAssembly. GPU не требуется. Лучшая совместимость.
| Модель | Языки | Размер | Точность | Скорость |
|---|---|---|---|---|
| SenseVoice (int8) | zh, en, ja, ko, yue | 238 MB | ★★★★☆ | ★★★★☆ |
| SenseVoice Nano (int8) | zh, en, ja, ko, yue | 265 MB | ★★★★★ | ★★★☆☆ |
| Moonshine Tiny EN (q) | en | 45 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny JA (q) | ja | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny KO (q) | ko | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Base ZH (q) | zh | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base JA (q) | ja | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base ES (q) | es | 66 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base AR (q) | ar | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base UK (q) | uk | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base VI (q) | vi | 142 MB | ★★★★☆ | ★★★★☆ |
| NeMo Canary (int8) | en, es, de, fr | 208 MB | ★★★★☆ | ★★★☆☆ |
| NeMo FastConformer Multi | be, de, en, es, fr, hr, it, pl, ru, uk | 133 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer DE | de | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer ES | es | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer PT | pt | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo Parakeet TDT 0.6B (int8) | 25 EU languages | 671 MB | ★★★★★ | ★★★☆☆ |
| Dolphin Base CTC Multi | zh, ja, ko, th, vi, ar, hi, bn, ru | 105 MB | ★★★★☆ | ★★★★☆ |
| Whisper Tiny (ONNX) | 99+ languages | 154 MB | ★★★☆☆ | ★★☆☆☆ |
| WenetSpeech Yue U2++ | zh, yue, en | 135 MB | ★★★★☆ | ★★★★☆ |
| Omnilingual 300M v2 | 1147 languages | 367 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer RU (int8) | ru | 74 MB | ★★★★☆ | ★★★★☆ |
| Zipformer VI 30M (int8) | vi | 35 MB | ★★★☆☆ | ★★★★★ |
Потоковые модели (CPU/WASM)
10 потоковых моделей в реальном времени. Транскрибируйте во время разговора с низкой задержкой.
| Модель | Языки | Размер | Точность | Скорость |
|---|---|---|---|---|
| Zipformer EN Kroko | en | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer FR Kroko | fr | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer DE Kroko | de | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ES Kroko | es | 156 MB | ★★★☆☆ | ★★★★☆ |
| Zipformer ZH (int8) | zh | 77 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ZH 2025 (int8) | zh | 167 MB | ★★★★☆ | ★★★★☆ |
| Zipformer RU Vosk (int8) | ru | 29 MB | ★★★☆☆ | ★★★★★ |
| Zipformer Multi (8 lang) | ar, en, id, ja, ru, th, vi, zh | 339 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer BN Vosk | bn | 94 MB | ★★★☆☆ | ★★★★☆ |
| NeMo CTC EN 80ms (int8) | en | 132 MB | ★★★★☆ | ★★★★★ |
Модели WebGPU (требуется GPU)
9 моделей с ускорением WebGPU, включая Cohere Transcribe и Voxtral Mini 4B Realtime (рекомендуются) и Whisper. Лучшая точность и скорость, требуется совместимый GPU.
| Модель | Языки | Размер | Точность | Скорость |
|---|---|---|---|---|
| Cohere Transcribe (q4) | 14 languages | ~2.1 GB | ★★★★★ | ★★★★☆ |
| Cohere Transcribe (q4f16) | 14 languages | ~1.5 GB | ★★★★★ | ★★★★☆ |
| Voxtral Mini 4B Realtime | 13 languages | ~2.3 GB | ★★★★★ | ★★★★★ |
| Whisper Tiny EN | en | 120 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Tiny | 99+ languages | 122 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Base | 99+ languages | 208 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Small | 99+ languages | 586 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Medium | 99+ languages | 680 MB | ★★★★★ | ★★☆☆☆ |
| Whisper Large V3 Turbo | 99+ languages | 759 MB | ★★★★★ | ★★☆☆☆ |
Модели перевода
Выберите TranslateGemma для лучшего качества и скорости, Opus-MT для быстрого перевода на CPU или Qwen LLM для широкого многоязычного охвата.
TranslateGemma 4B (WebGPU) — Рекомендуется
Специализированная модель перевода от Google с наивысшим качеством и скоростью среди всех локальных моделей перевода. Поддерживает 51 язык с двусторонним переводом. Требуется WebGPU.
| Модель | Языки | Размер | Качество | Скорость |
|---|---|---|---|---|
| TranslateGemma 4B (q4) | 51 languages | ~3.1 GB | ★★★★★ | ★★★★★ |
| TranslateGemma 4B (q4f16) | 51 languages | ~2.7 GB | ★★★★★ | ★★★★★ |
Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu
Qwen LLM (WebGPU)
Большие языковые модели с поддержкой 119–201+ языков. Более высокое качество, но требуется GPU. Лучший для гибкого многоязычного перевода.
| Модель | Языки | Размер | Качество | Скорость |
|---|---|---|---|---|
| Qwen 2.5 0.5B | 28 languages | ~400 MB | ★★★☆☆ | ★★★★☆ |
| Qwen 3 0.6B | 119+ languages | 919 MB | ★★★★☆ | ★★★☆☆ |
| Qwen 3.5 0.8B | 201+ languages | ~1.6 GB | ★★★★★ | ★★☆☆☆ |
| Qwen 3.5 2B | 201+ languages | ~1.8 GB | ★★★★★ | ★☆☆☆☆ |
Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans
Qwen 3/3.5: 119–201+ languages (multilingual)
Opus-MT (CPU/WASM)
74 языковых пары, ~110 МБ каждая. Быстрый, лёгкий, работает на любом устройстве. Лучший для однонаправленного перевода.
| src ↓ tgt → | en | ja | zh | ko | de | fr | es | it | ru | ar | hi | vi | tr | uk | pt | nl | pl | da | sv | fi | cs | ro | hu | id | no | et | th | af | xh |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| en | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||
| ja | ✓ | ||||||||||||||||||||||||||||
| zh | ✓ | ||||||||||||||||||||||||||||
| ko | ✓ | ||||||||||||||||||||||||||||
| de | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| fr | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| es | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| it | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| ru | ✓ | ✓ | ✓ | ✓ | |||||||||||||||||||||||||
| ar | ✓ | ||||||||||||||||||||||||||||
| hi | ✓ | ||||||||||||||||||||||||||||
| vi | ✓ | ||||||||||||||||||||||||||||
| tr | ✓ | ||||||||||||||||||||||||||||
| uk | ✓ | ✓ | |||||||||||||||||||||||||||
| pt | |||||||||||||||||||||||||||||
| nl | ✓ | ✓ | |||||||||||||||||||||||||||
| pl | ✓ | ||||||||||||||||||||||||||||
| da | ✓ | ✓ | |||||||||||||||||||||||||||
| sv | ✓ | ||||||||||||||||||||||||||||
| fi | ✓ | ✓ | |||||||||||||||||||||||||||
| cs | ✓ | ||||||||||||||||||||||||||||
| ro | ✓ | ✓ | |||||||||||||||||||||||||||
| hu | ✓ | ||||||||||||||||||||||||||||
| id | ✓ | ||||||||||||||||||||||||||||
| no | ✓ | ||||||||||||||||||||||||||||
| et | ✓ | ||||||||||||||||||||||||||||
| th | ✓ | ||||||||||||||||||||||||||||
| af | ✓ | ||||||||||||||||||||||||||||
| xh | ✓ |
Модели TTS (синтез речи)
136 моделей на 52 языках. Все работают на CPU через WASM — GPU не требуется. Используют движки Piper, Coqui, Mimic3, VITS и Matcha.
Настройки TTS
- Скорость речи — Контролирует скорость воспроизведения синтезированной речи. Отрегулируйте ползунок скорости, чтобы сделать вывод быстрее или медленнее по вашему предпочтению.
- ID говорящего — Контролирует тембр голоса синтезированной речи. Многие модели поддерживают несколько ID говорящих, каждый с разным голосом. Некоторые мультиспикерные модели включают голоса разных полов, поэтому вы можете выбрать мужской или женский голос, выбирая разные ID говорящих.
| Язык | Модели | Движок | Говорящие | Диапазон размера |
|---|---|---|---|---|
| af | 1 | mimic3 | 1 | ~94 MB |
| ar | 2 | piper | 1 | 81–95 MB |
| bg | 1 | coqui | 1 | ~71 MB |
| bn | 2 | mimic3, coqui | 1 | 71–94 MB |
| ca | 3 | piper | 1 | 39–95 MB |
| cs | 2 | piper | 1 | 81–95 MB |
| cy | 2 | piper | 1–7 | ~95 MB |
| da | 1 | piper | 1 | ~95 MB |
| de | 8 | piper | 1 | 39–81 MB |
| el | 2 | piper, mimic3 | 1 | 81–94 MB |
| en | 13 | piper | 1–904 | 81–97 MB |
| es | 6 | piper | 1–2 | 39–95 MB |
| et | 1 | coqui | 1 | ~71 MB |
| fa | 8 | piper, mimic3, matcha | 1 | 81–146 MB |
| fi | 2 | piper | 1 | 81–95 MB |
| fr | 8 | piper | 1–16 | 39–95 MB |
| ga | 1 | coqui | 1 | ~71 MB |
| gu | 1 | mimic3 | 1 | ~94 MB |
| hi | 3 | piper | 1 | ~95 MB |
| hr | 1 | coqui | 1 | ~71 MB |
| hu | 3 | piper | 1 | ~95 MB |
| id | 1 | piper | 1 | ~95 MB |
| is | 4 | piper | 1 | ~95 MB |
| it | 2 | piper | 1 | 39–95 MB |
| ka | 1 | piper | 1 | ~95 MB |
| kk | 3 | piper | 1+ | 39–81 MB |
| ko | 1 | mimic3 | 1 | ~94 MB |
| lb | 1 | piper | 1 | ~95 MB |
| lt | 1 | coqui | 1 | ~71 MB |
| lv | 1 | piper | 1 | ~95 MB |
| ml | 2 | piper | 1 | ~95 MB |
| mt | 1 | coqui | 1 | ~71 MB |
| ne | 3 | piper | 1+ | 39–95 MB |
| nl | 4 | piper | 1 | 39–95 MB |
| no | 1 | piper | 1 | ~95 MB |
| pl | 7 | piper | 1 | ~95 MB |
| pt | 4 | piper | 1 | 81–95 MB |
| ro | 1 | piper | 1 | ~95 MB |
| ru | 4 | piper | 1 | ~95 MB |
| sk | 1 | piper | 1 | ~95 MB |
| sl | 1 | piper | 1 | ~95 MB |
| sr | 1 | piper | multi | ~95 MB |
| sv | 2 | piper | 1+ | ~95 MB |
| sw | 1 | piper | 1 | ~95 MB |
| tn | 1 | mimic3 | multi | ~94 MB |
| tr | 3 | piper | 1 | ~95 MB |
| uk | 2 | piper | 1+ | 39–95 MB |
| vi | 4 | piper, mimic3 | 1–65 | 46–95 MB |
| yue | 1 | vits | 1 | ~114 MB |
| zh | 3 | vits, piper, matcha | 1–218 | 81–213 MB |
Устранение неполадок
Распространённые проблемы
Не удаётся скачать модель: Проверьте подключение к Интернету для первоначальной загрузки. Модели кешируются локально в IndexedDB, поэтому последующие использования работают автономно. Попробуйте очистить данные браузера, если загрузки повреждены.
ASR не распознаёт речь: Убедитесь, что вы выбрали правильную модель ASR для вашего исходного языка. Попробуйте более крупную модель для лучшей точности. Проверьте, что микрофон работает и разрешения предоставлены.
Низкое качество перевода: Модели Opus-MT оптимизированы для скорости, а не качества. Для лучших результатов попробуйте модели TranslateGemma или Qwen LLM, если ваше устройство поддерживает WebGPU. Убедитесь, что выбрана правильная языковая пара.
WebGPU недоступен: WebGPU требует совместимого браузера и GPU. Переключитесь на модели на основе WASM (sherpa-onnx, Opus-MT), которые работают в любом современном браузере без требований к GPU.
Советы по производительности
- Используйте модели WebGPU, когда они доступны, для значительно более быстрой обработки
- Закройте другие вкладки браузера, чтобы освободить память для загрузки моделей
- Выбирайте модели меньшего размера для устройств с низкой производительностью или когда скорость важнее
- Модели WASM (sherpa-onnx, Opus-MT) более совместимы, но медленнее, чем альтернативы WebGPU
- Следите за использованием памяти браузера — крупные модели могут потребовать 2 ГБ+ памяти браузера
Нужна дополнительная помощь? Посетите наш репозиторий GitHub для получения поддержки сообщества, руководств по совместимости моделей и последних обновлений функций локального (автономного) режима.