Назад до провайдерів ШІ

Посібник з налаштування локального (автономного) режиму

Огляд

Локальний (автономний) режим дозволяє запускати ASR (автоматичне розпізнавання мовлення), переклад і TTS (синтез мовлення) повністю на вашому пристрої. Без API-ключа, без підключення до Інтернету, і жодні дані не залишають ваш комп'ютер. Все обробляється локально за допомогою WebAssembly та WebGPU.

Не потрібен API-ключ або Інтернет

Конфіденційність понад усе — усі аудіо- та текстові дані залишаються на вашому пристрої. Після завантаження моделей локальний (автономний) режим працює повністю без підключення до мережі. Ваші розмови ніколи не залишають ваш комп'ютер.

1Виберіть «Локальний (автономний)» як провайдера

Відкрийте Sokuji та перейдіть до панелі налаштувань. Виберіть «Локальний (автономний)» як провайдера ШІ у випадаючому списку провайдерів.

2Завантажте модель ASR

Виберіть модель ASR для вашої мови джерела. Sokuji пропонує 42 автономних/потокових моделі на базі sherpa-onnx WASM та WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), що підтримують понад 99 мов. Розмір моделей варіюється від легких (~5 МБ) до високоточних (~2 ГБ+). Рекомендуємо Cohere Transcribe або Voxtral Mini 4B Realtime для найкращої точності та швидкості.

3Завантажте модель перекладу

Виберіть мовну пару для перекладу. Оберіть TranslateGemma для найкращої якості та швидкості, 74 мовних пари Opus-MT для швидкого перекладу на CPU або Qwen LLM через WebGPU для більш якісного багатомовного перекладу.

4Завантажте модель TTS

Завантажте модель TTS для голосового виведення. Доступні 136 моделей для 52 мов, що працюють на рушіях Piper, Coqui, Mimic3 та Matcha.

5Почніть перекладати

Натисніть кнопку Розпочати сесію. Підключення до Інтернету не потрібне — переклад виконується повністю на вашому пристрої в реальному часі.

Додаткова інформація

Що таке локальний (автономний) режим?

Локальний (автономний) — це повністю працюючий на пристрої конвеєр перекладу ШІ, який виконує ASR, переклад і TTS без будь-яких хмарних сервісів:

  • Повна конфіденційність — уся обробка аудіо та тексту виконується на вашому пристрої
  • Працює автономно після першого завантаження моделей
  • Не потрібні API-ключі, облікові записи або підписки
  • Працює на WebAssembly (WASM) та WebGPU з продуктивністю, близькою до нативної
  • Безкоштовне використання без обмежень

Доступні моделі

Локальний (автономний) режим підтримує широкий спектр моделей для кожного етапу конвеєра перекладу:

  • ASR: 42 моделі, включаючи Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo та Zipformer — підтримка понад 99 мов
  • Переклад: 74 мовних пари Opus-MT для швидкого перекладу на CPU, а також TranslateGemma і Qwen LLM через WebGPU для багатомовної підтримки
  • TTS: 136 моделей для 52 мов з використанням рушіїв Piper, Coqui, Mimic3 та Matcha

Вимоги до обладнання

  • CPU (WASM): Працює в будь-якому сучасному браузері — спеціальне обладнання не потрібне
  • WebGPU: Опціональне прискорення GPU для моделей Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma та перекладу Qwen — значно швидше з виділеним GPU
  • Рекомендовано: 4 ГБ+ ОЗП для комфортного завантаження моделей
  • Сховище: Розмір моделей від 5 МБ до 200+ МБ залежно від рівня точності
  • Потрібен сучасний браузер: Chrome 113+, Edge 113+ або Firefox 120+ для підтримки WebGPU

Каталог моделей

Моделі ASR (розпізнавання мовлення)

Виберіть модель розпізнавання мовлення на основі мови джерела, вимог до точності та апаратних можливостей.

Автономні моделі (CPU/WASM)

23 моделі, що працюють на CPU через WebAssembly. GPU не потрібен. Найкраща сумісність.

МодельМовиРозмірТочністьШвидкість
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

Потокові моделі (CPU/WASM)

10 потокових моделей у реальному часі. Транскрибуйте під час розмови з низькою затримкою.

МодельМовиРозмірТочністьШвидкість
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

Моделі WebGPU (потрібен GPU)

9 моделей з прискоренням WebGPU, включаючи Cohere Transcribe та Voxtral Mini 4B Realtime (рекомендовані) та Whisper. Найкраща точність і швидкість, потрібен сумісний GPU.

МодельМовиРозмірТочністьШвидкість
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

Моделі перекладу

Оберіть TranslateGemma для найкращої якості та швидкості, Opus-MT для швидкого перекладу на CPU або Qwen LLM для широкого багатомовного охоплення.

TranslateGemma 4B (WebGPU) — Рекомендовано

Спеціалізована модель перекладу від Google з найвищою якістю та швидкістю серед усіх локальних моделей перекладу. Підтримує 51 мову з двостороннім перекладом. Потрібен WebGPU.

МодельМовиРозмірЯкістьШвидкість
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM (WebGPU)

Великі мовні моделі з підтримкою 119–201+ мов. Вища якість, але потрібен GPU. Найкращий для гнучкого багатомовного перекладу.

МодельМовиРозмірЯкістьШвидкість
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT (CPU/WASM)

74 мовних пари, ~110 МБ кожна. Швидкий, легкий, працює на будь-якому пристрої. Найкращий для одностороннього перекладу.

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

Моделі TTS (синтез мовлення)

136 моделей для 52 мов. Усі працюють на CPU через WASM — GPU не потрібен. Використовують рушії Piper, Coqui, Mimic3, VITS та Matcha.

Налаштування TTS

  • Швидкість мовлення — Контролює швидкість відтворення синтезованого мовлення. Відрегулюйте повзунок швидкості, щоб зробити виведення швидшим або повільнішим за вашими уподобаннями.
  • ID мовця — Контролює тембр голосу синтезованого мовлення. Багато моделей підтримують кілька ID мовців, кожен з різним голосом. Деякі мультимовцеві моделі включають голоси різної статі, тому ви можете обрати чоловічий або жіночий голос, вибираючи різні ID мовців.
МоваМоделіРушійМовціДіапазон розміру
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

Усунення неполадок

Поширені проблеми

Не вдається завантажити модель: Перевірте підключення до Інтернету для першого завантаження. Моделі кешуються локально в IndexedDB, тому наступні використання працюють автономно. Спробуйте очистити дані браузера, якщо завантаження пошкоджені.

ASR не розпізнає мовлення: Переконайтеся, що ви обрали правильну модель ASR для вашої мови джерела. Спробуйте більшу модель для кращої точності. Перевірте, що мікрофон працює та дозволи надано.

Низька якість перекладу: Моделі Opus-MT оптимізовані для швидкості, а не якості. Для кращих результатів спробуйте моделі TranslateGemma або Qwen LLM, якщо ваш пристрій підтримує WebGPU. Переконайтеся, що обрана правильна мовна пара.

WebGPU недоступний: WebGPU потребує сумісного браузера та GPU. Перейдіть на моделі на основі WASM (sherpa-onnx, Opus-MT), які працюють у будь-якому сучасному браузері без вимог до GPU.

Поради щодо продуктивності

  1. Використовуйте моделі WebGPU, коли вони доступні, для значно швидшої обробки
  2. Закрийте інші вкладки браузера, щоб звільнити пам'ять для завантаження моделей
  3. Обирайте менші моделі для пристроїв з низькою продуктивністю або коли швидкість є пріоритетом
  4. Моделі WASM (sherpa-onnx, Opus-MT) більш сумісні, але повільніші за альтернативи WebGPU
  5. Слідкуйте за використанням пам'яті браузера — великі моделі можуть потребувати 2 ГБ+ пам'яті браузера

Потрібна додаткова допомога? Відвідайте наш репозиторій GitHub для отримання підтримки спільноти, посібників із сумісності моделей та останніх оновлень функцій локального (автономного) режиму.

GitHub Repository