Назад к провайдерам ИИ

Руководство по настройке локального (автономного) режима

Обзор

Локальный (автономный) режим позволяет запускать ASR (автоматическое распознавание речи), перевод и TTS (синтез речи) полностью на вашем устройстве. Без API-ключа, без подключения к Интернету, и данные не покидают ваш компьютер. Всё обрабатывается локально с помощью WebAssembly и WebGPU.

Не требуется API-ключ или Интернет

Конфиденциальность прежде всего — все аудио- и текстовые данные остаются на вашем устройстве. После загрузки моделей локальный (автономный) режим работает полностью в автономном режиме. Ваши разговоры никогда не покидают ваш компьютер.

1Выберите «Локальный (автономный)» как провайдера

Откройте Sokuji и перейдите в панель настроек. Выберите «Локальный (автономный)» в качестве провайдера ИИ в выпадающем списке провайдеров.

2Скачайте модель ASR

Выберите модель ASR для вашего исходного языка. Sokuji предлагает 42 автономных/потоковых модели на базе sherpa-onnx WASM и WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), поддерживающих более 99 языков. Размер моделей варьируется от лёгких (~5 МБ) до высокоточных (~2 ГБ+). Рекомендуем Cohere Transcribe или Voxtral Mini 4B Realtime для лучшей точности и скорости.

3Скачайте модель перевода

Выберите языковую пару для перевода. Выберите TranslateGemma для лучшего качества и скорости, 74 языковых пары Opus-MT для быстрого перевода на CPU или Qwen LLM через WebGPU для более качественного многоязычного перевода.

4Скачайте модель TTS

Скачайте модель TTS для голосового вывода. Доступно 136 моделей на 52 языках, работающих на движках Piper, Coqui, Mimic3 и Matcha.

5Начните переводить

Нажмите кнопку Начать сессию. Подключение к Интернету не требуется — перевод выполняется полностью на вашем устройстве в реальном времени.

Дополнительная информация

Что такое локальный (автономный) режим?

Локальный (автономный) — это полностью работающий на устройстве конвейер перевода ИИ, который выполняет ASR, перевод и TTS без каких-либо облачных сервисов:

  • Полная конфиденциальность — вся обработка аудио и текста выполняется на вашем устройстве
  • Работает автономно после первоначальной загрузки моделей
  • Не требуются API-ключи, учётные записи или подписки
  • Работает на WebAssembly (WASM) и WebGPU с производительностью, близкой к нативной
  • Бесплатное использование без ограничений

Доступные модели

Локальный (автономный) режим поддерживает широкий спектр моделей для каждого этапа конвейера перевода:

  • ASR: 42 модели, включая Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo и Zipformer — поддержка более 99 языков
  • Перевод: 74 языковых пары Opus-MT для быстрого перевода на CPU, а также TranslateGemma и Qwen LLM через WebGPU для многоязычной поддержки
  • TTS: 136 моделей на 52 языках с использованием движков Piper, Coqui, Mimic3 и Matcha

Требования к оборудованию

  • CPU (WASM): Работает в любом современном браузере — специальное оборудование не требуется
  • WebGPU: Опциональное ускорение GPU для моделей Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma и перевода Qwen — значительно быстрее с выделенным GPU
  • Рекомендуется: 4 ГБ+ ОЗУ для комфортной загрузки моделей
  • Хранилище: Размер моделей от 5 МБ до 200+ МБ в зависимости от уровня точности
  • Требуется современный браузер: Chrome 113+, Edge 113+ или Firefox 120+ для поддержки WebGPU

Каталог моделей

Модели ASR (распознавание речи)

Выберите модель распознавания речи на основе исходного языка, требований к точности и аппаратных возможностей.

Автономные модели (CPU/WASM)

23 модели, работающие на CPU через WebAssembly. GPU не требуется. Лучшая совместимость.

МодельЯзыкиРазмерТочностьСкорость
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

Потоковые модели (CPU/WASM)

10 потоковых моделей в реальном времени. Транскрибируйте во время разговора с низкой задержкой.

МодельЯзыкиРазмерТочностьСкорость
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

Модели WebGPU (требуется GPU)

9 моделей с ускорением WebGPU, включая Cohere Transcribe и Voxtral Mini 4B Realtime (рекомендуются) и Whisper. Лучшая точность и скорость, требуется совместимый GPU.

МодельЯзыкиРазмерТочностьСкорость
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

Модели перевода

Выберите TranslateGemma для лучшего качества и скорости, Opus-MT для быстрого перевода на CPU или Qwen LLM для широкого многоязычного охвата.

TranslateGemma 4B (WebGPU) — Рекомендуется

Специализированная модель перевода от Google с наивысшим качеством и скоростью среди всех локальных моделей перевода. Поддерживает 51 язык с двусторонним переводом. Требуется WebGPU.

МодельЯзыкиРазмерКачествоСкорость
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM (WebGPU)

Большие языковые модели с поддержкой 119–201+ языков. Более высокое качество, но требуется GPU. Лучший для гибкого многоязычного перевода.

МодельЯзыкиРазмерКачествоСкорость
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT (CPU/WASM)

74 языковых пары, ~110 МБ каждая. Быстрый, лёгкий, работает на любом устройстве. Лучший для однонаправленного перевода.

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

Модели TTS (синтез речи)

136 моделей на 52 языках. Все работают на CPU через WASM — GPU не требуется. Используют движки Piper, Coqui, Mimic3, VITS и Matcha.

Настройки TTS

  • Скорость речи — Контролирует скорость воспроизведения синтезированной речи. Отрегулируйте ползунок скорости, чтобы сделать вывод быстрее или медленнее по вашему предпочтению.
  • ID говорящего — Контролирует тембр голоса синтезированной речи. Многие модели поддерживают несколько ID говорящих, каждый с разным голосом. Некоторые мультиспикерные модели включают голоса разных полов, поэтому вы можете выбрать мужской или женский голос, выбирая разные ID говорящих.
ЯзыкМоделиДвижокГоворящиеДиапазон размера
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

Устранение неполадок

Распространённые проблемы

Не удаётся скачать модель: Проверьте подключение к Интернету для первоначальной загрузки. Модели кешируются локально в IndexedDB, поэтому последующие использования работают автономно. Попробуйте очистить данные браузера, если загрузки повреждены.

ASR не распознаёт речь: Убедитесь, что вы выбрали правильную модель ASR для вашего исходного языка. Попробуйте более крупную модель для лучшей точности. Проверьте, что микрофон работает и разрешения предоставлены.

Низкое качество перевода: Модели Opus-MT оптимизированы для скорости, а не качества. Для лучших результатов попробуйте модели TranslateGemma или Qwen LLM, если ваше устройство поддерживает WebGPU. Убедитесь, что выбрана правильная языковая пара.

WebGPU недоступен: WebGPU требует совместимого браузера и GPU. Переключитесь на модели на основе WASM (sherpa-onnx, Opus-MT), которые работают в любом современном браузере без требований к GPU.

Советы по производительности

  1. Используйте модели WebGPU, когда они доступны, для значительно более быстрой обработки
  2. Закройте другие вкладки браузера, чтобы освободить память для загрузки моделей
  3. Выбирайте модели меньшего размера для устройств с низкой производительностью или когда скорость важнее
  4. Модели WASM (sherpa-onnx, Opus-MT) более совместимы, но медленнее, чем альтернативы WebGPU
  5. Следите за использованием памяти браузера — крупные модели могут потребовать 2 ГБ+ памяти браузера

Нужна дополнительная помощь? Посетите наш репозиторий GitHub для получения поддержки сообщества, руководств по совместимости моделей и последних обновлений функций локального (автономного) режима.

GitHub Repository