Посібник з налаштування локального (автономного) режиму
Огляд
Локальний (автономний) режим дозволяє запускати ASR (автоматичне розпізнавання мовлення), переклад і TTS (синтез мовлення) повністю на вашому пристрої. Без API-ключа, без підключення до Інтернету, і жодні дані не залишають ваш комп'ютер. Все обробляється локально за допомогою WebAssembly та WebGPU.
Не потрібен API-ключ або Інтернет
Конфіденційність понад усе — усі аудіо- та текстові дані залишаються на вашому пристрої. Після завантаження моделей локальний (автономний) режим працює повністю без підключення до мережі. Ваші розмови ніколи не залишають ваш комп'ютер.
1Виберіть «Локальний (автономний)» як провайдера
Відкрийте Sokuji та перейдіть до панелі налаштувань. Виберіть «Локальний (автономний)» як провайдера ШІ у випадаючому списку провайдерів.
2Завантажте модель ASR
Виберіть модель ASR для вашої мови джерела. Sokuji пропонує 42 автономних/потокових моделі на базі sherpa-onnx WASM та WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), що підтримують понад 99 мов. Розмір моделей варіюється від легких (~5 МБ) до високоточних (~2 ГБ+). Рекомендуємо Cohere Transcribe або Voxtral Mini 4B Realtime для найкращої точності та швидкості.
3Завантажте модель перекладу
Виберіть мовну пару для перекладу. Оберіть TranslateGemma для найкращої якості та швидкості, 74 мовних пари Opus-MT для швидкого перекладу на CPU або Qwen LLM через WebGPU для більш якісного багатомовного перекладу.
4Завантажте модель TTS
Завантажте модель TTS для голосового виведення. Доступні 136 моделей для 52 мов, що працюють на рушіях Piper, Coqui, Mimic3 та Matcha.
5Почніть перекладати
Натисніть кнопку Розпочати сесію. Підключення до Інтернету не потрібне — переклад виконується повністю на вашому пристрої в реальному часі.
Додаткова інформація
Що таке локальний (автономний) режим?
Локальний (автономний) — це повністю працюючий на пристрої конвеєр перекладу ШІ, який виконує ASR, переклад і TTS без будь-яких хмарних сервісів:
- Повна конфіденційність — уся обробка аудіо та тексту виконується на вашому пристрої
- Працює автономно після першого завантаження моделей
- Не потрібні API-ключі, облікові записи або підписки
- Працює на WebAssembly (WASM) та WebGPU з продуктивністю, близькою до нативної
- Безкоштовне використання без обмежень
Доступні моделі
Локальний (автономний) режим підтримує широкий спектр моделей для кожного етапу конвеєра перекладу:
- ASR: 42 моделі, включаючи Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo та Zipformer — підтримка понад 99 мов
- Переклад: 74 мовних пари Opus-MT для швидкого перекладу на CPU, а також TranslateGemma і Qwen LLM через WebGPU для багатомовної підтримки
- TTS: 136 моделей для 52 мов з використанням рушіїв Piper, Coqui, Mimic3 та Matcha
Вимоги до обладнання
- CPU (WASM): Працює в будь-якому сучасному браузері — спеціальне обладнання не потрібне
- WebGPU: Опціональне прискорення GPU для моделей Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma та перекладу Qwen — значно швидше з виділеним GPU
- Рекомендовано: 4 ГБ+ ОЗП для комфортного завантаження моделей
- Сховище: Розмір моделей від 5 МБ до 200+ МБ залежно від рівня точності
- Потрібен сучасний браузер: Chrome 113+, Edge 113+ або Firefox 120+ для підтримки WebGPU
Каталог моделей
Моделі ASR (розпізнавання мовлення)
Виберіть модель розпізнавання мовлення на основі мови джерела, вимог до точності та апаратних можливостей.
Автономні моделі (CPU/WASM)
23 моделі, що працюють на CPU через WebAssembly. GPU не потрібен. Найкраща сумісність.
| Модель | Мови | Розмір | Точність | Швидкість |
|---|---|---|---|---|
| SenseVoice (int8) | zh, en, ja, ko, yue | 238 MB | ★★★★☆ | ★★★★☆ |
| SenseVoice Nano (int8) | zh, en, ja, ko, yue | 265 MB | ★★★★★ | ★★★☆☆ |
| Moonshine Tiny EN (q) | en | 45 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny JA (q) | ja | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny KO (q) | ko | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Base ZH (q) | zh | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base JA (q) | ja | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base ES (q) | es | 66 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base AR (q) | ar | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base UK (q) | uk | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base VI (q) | vi | 142 MB | ★★★★☆ | ★★★★☆ |
| NeMo Canary (int8) | en, es, de, fr | 208 MB | ★★★★☆ | ★★★☆☆ |
| NeMo FastConformer Multi | be, de, en, es, fr, hr, it, pl, ru, uk | 133 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer DE | de | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer ES | es | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer PT | pt | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo Parakeet TDT 0.6B (int8) | 25 EU languages | 671 MB | ★★★★★ | ★★★☆☆ |
| Dolphin Base CTC Multi | zh, ja, ko, th, vi, ar, hi, bn, ru | 105 MB | ★★★★☆ | ★★★★☆ |
| Whisper Tiny (ONNX) | 99+ languages | 154 MB | ★★★☆☆ | ★★☆☆☆ |
| WenetSpeech Yue U2++ | zh, yue, en | 135 MB | ★★★★☆ | ★★★★☆ |
| Omnilingual 300M v2 | 1147 languages | 367 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer RU (int8) | ru | 74 MB | ★★★★☆ | ★★★★☆ |
| Zipformer VI 30M (int8) | vi | 35 MB | ★★★☆☆ | ★★★★★ |
Потокові моделі (CPU/WASM)
10 потокових моделей у реальному часі. Транскрибуйте під час розмови з низькою затримкою.
| Модель | Мови | Розмір | Точність | Швидкість |
|---|---|---|---|---|
| Zipformer EN Kroko | en | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer FR Kroko | fr | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer DE Kroko | de | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ES Kroko | es | 156 MB | ★★★☆☆ | ★★★★☆ |
| Zipformer ZH (int8) | zh | 77 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ZH 2025 (int8) | zh | 167 MB | ★★★★☆ | ★★★★☆ |
| Zipformer RU Vosk (int8) | ru | 29 MB | ★★★☆☆ | ★★★★★ |
| Zipformer Multi (8 lang) | ar, en, id, ja, ru, th, vi, zh | 339 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer BN Vosk | bn | 94 MB | ★★★☆☆ | ★★★★☆ |
| NeMo CTC EN 80ms (int8) | en | 132 MB | ★★★★☆ | ★★★★★ |
Моделі WebGPU (потрібен GPU)
9 моделей з прискоренням WebGPU, включаючи Cohere Transcribe та Voxtral Mini 4B Realtime (рекомендовані) та Whisper. Найкраща точність і швидкість, потрібен сумісний GPU.
| Модель | Мови | Розмір | Точність | Швидкість |
|---|---|---|---|---|
| Cohere Transcribe (q4) | 14 languages | ~2.1 GB | ★★★★★ | ★★★★☆ |
| Cohere Transcribe (q4f16) | 14 languages | ~1.5 GB | ★★★★★ | ★★★★☆ |
| Voxtral Mini 4B Realtime | 13 languages | ~2.3 GB | ★★★★★ | ★★★★★ |
| Whisper Tiny EN | en | 120 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Tiny | 99+ languages | 122 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Base | 99+ languages | 208 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Small | 99+ languages | 586 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Medium | 99+ languages | 680 MB | ★★★★★ | ★★☆☆☆ |
| Whisper Large V3 Turbo | 99+ languages | 759 MB | ★★★★★ | ★★☆☆☆ |
Моделі перекладу
Оберіть TranslateGemma для найкращої якості та швидкості, Opus-MT для швидкого перекладу на CPU або Qwen LLM для широкого багатомовного охоплення.
TranslateGemma 4B (WebGPU) — Рекомендовано
Спеціалізована модель перекладу від Google з найвищою якістю та швидкістю серед усіх локальних моделей перекладу. Підтримує 51 мову з двостороннім перекладом. Потрібен WebGPU.
| Модель | Мови | Розмір | Якість | Швидкість |
|---|---|---|---|---|
| TranslateGemma 4B (q4) | 51 languages | ~3.1 GB | ★★★★★ | ★★★★★ |
| TranslateGemma 4B (q4f16) | 51 languages | ~2.7 GB | ★★★★★ | ★★★★★ |
Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu
Qwen LLM (WebGPU)
Великі мовні моделі з підтримкою 119–201+ мов. Вища якість, але потрібен GPU. Найкращий для гнучкого багатомовного перекладу.
| Модель | Мови | Розмір | Якість | Швидкість |
|---|---|---|---|---|
| Qwen 2.5 0.5B | 28 languages | ~400 MB | ★★★☆☆ | ★★★★☆ |
| Qwen 3 0.6B | 119+ languages | 919 MB | ★★★★☆ | ★★★☆☆ |
| Qwen 3.5 0.8B | 201+ languages | ~1.6 GB | ★★★★★ | ★★☆☆☆ |
| Qwen 3.5 2B | 201+ languages | ~1.8 GB | ★★★★★ | ★☆☆☆☆ |
Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans
Qwen 3/3.5: 119–201+ languages (multilingual)
Opus-MT (CPU/WASM)
74 мовних пари, ~110 МБ кожна. Швидкий, легкий, працює на будь-якому пристрої. Найкращий для одностороннього перекладу.
| src ↓ tgt → | en | ja | zh | ko | de | fr | es | it | ru | ar | hi | vi | tr | uk | pt | nl | pl | da | sv | fi | cs | ro | hu | id | no | et | th | af | xh |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| en | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||
| ja | ✓ | ||||||||||||||||||||||||||||
| zh | ✓ | ||||||||||||||||||||||||||||
| ko | ✓ | ||||||||||||||||||||||||||||
| de | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| fr | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| es | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| it | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| ru | ✓ | ✓ | ✓ | ✓ | |||||||||||||||||||||||||
| ar | ✓ | ||||||||||||||||||||||||||||
| hi | ✓ | ||||||||||||||||||||||||||||
| vi | ✓ | ||||||||||||||||||||||||||||
| tr | ✓ | ||||||||||||||||||||||||||||
| uk | ✓ | ✓ | |||||||||||||||||||||||||||
| pt | |||||||||||||||||||||||||||||
| nl | ✓ | ✓ | |||||||||||||||||||||||||||
| pl | ✓ | ||||||||||||||||||||||||||||
| da | ✓ | ✓ | |||||||||||||||||||||||||||
| sv | ✓ | ||||||||||||||||||||||||||||
| fi | ✓ | ✓ | |||||||||||||||||||||||||||
| cs | ✓ | ||||||||||||||||||||||||||||
| ro | ✓ | ✓ | |||||||||||||||||||||||||||
| hu | ✓ | ||||||||||||||||||||||||||||
| id | ✓ | ||||||||||||||||||||||||||||
| no | ✓ | ||||||||||||||||||||||||||||
| et | ✓ | ||||||||||||||||||||||||||||
| th | ✓ | ||||||||||||||||||||||||||||
| af | ✓ | ||||||||||||||||||||||||||||
| xh | ✓ |
Моделі TTS (синтез мовлення)
136 моделей для 52 мов. Усі працюють на CPU через WASM — GPU не потрібен. Використовують рушії Piper, Coqui, Mimic3, VITS та Matcha.
Налаштування TTS
- Швидкість мовлення — Контролює швидкість відтворення синтезованого мовлення. Відрегулюйте повзунок швидкості, щоб зробити виведення швидшим або повільнішим за вашими уподобаннями.
- ID мовця — Контролює тембр голосу синтезованого мовлення. Багато моделей підтримують кілька ID мовців, кожен з різним голосом. Деякі мультимовцеві моделі включають голоси різної статі, тому ви можете обрати чоловічий або жіночий голос, вибираючи різні ID мовців.
| Мова | Моделі | Рушій | Мовці | Діапазон розміру |
|---|---|---|---|---|
| af | 1 | mimic3 | 1 | ~94 MB |
| ar | 2 | piper | 1 | 81–95 MB |
| bg | 1 | coqui | 1 | ~71 MB |
| bn | 2 | mimic3, coqui | 1 | 71–94 MB |
| ca | 3 | piper | 1 | 39–95 MB |
| cs | 2 | piper | 1 | 81–95 MB |
| cy | 2 | piper | 1–7 | ~95 MB |
| da | 1 | piper | 1 | ~95 MB |
| de | 8 | piper | 1 | 39–81 MB |
| el | 2 | piper, mimic3 | 1 | 81–94 MB |
| en | 13 | piper | 1–904 | 81–97 MB |
| es | 6 | piper | 1–2 | 39–95 MB |
| et | 1 | coqui | 1 | ~71 MB |
| fa | 8 | piper, mimic3, matcha | 1 | 81–146 MB |
| fi | 2 | piper | 1 | 81–95 MB |
| fr | 8 | piper | 1–16 | 39–95 MB |
| ga | 1 | coqui | 1 | ~71 MB |
| gu | 1 | mimic3 | 1 | ~94 MB |
| hi | 3 | piper | 1 | ~95 MB |
| hr | 1 | coqui | 1 | ~71 MB |
| hu | 3 | piper | 1 | ~95 MB |
| id | 1 | piper | 1 | ~95 MB |
| is | 4 | piper | 1 | ~95 MB |
| it | 2 | piper | 1 | 39–95 MB |
| ka | 1 | piper | 1 | ~95 MB |
| kk | 3 | piper | 1+ | 39–81 MB |
| ko | 1 | mimic3 | 1 | ~94 MB |
| lb | 1 | piper | 1 | ~95 MB |
| lt | 1 | coqui | 1 | ~71 MB |
| lv | 1 | piper | 1 | ~95 MB |
| ml | 2 | piper | 1 | ~95 MB |
| mt | 1 | coqui | 1 | ~71 MB |
| ne | 3 | piper | 1+ | 39–95 MB |
| nl | 4 | piper | 1 | 39–95 MB |
| no | 1 | piper | 1 | ~95 MB |
| pl | 7 | piper | 1 | ~95 MB |
| pt | 4 | piper | 1 | 81–95 MB |
| ro | 1 | piper | 1 | ~95 MB |
| ru | 4 | piper | 1 | ~95 MB |
| sk | 1 | piper | 1 | ~95 MB |
| sl | 1 | piper | 1 | ~95 MB |
| sr | 1 | piper | multi | ~95 MB |
| sv | 2 | piper | 1+ | ~95 MB |
| sw | 1 | piper | 1 | ~95 MB |
| tn | 1 | mimic3 | multi | ~94 MB |
| tr | 3 | piper | 1 | ~95 MB |
| uk | 2 | piper | 1+ | 39–95 MB |
| vi | 4 | piper, mimic3 | 1–65 | 46–95 MB |
| yue | 1 | vits | 1 | ~114 MB |
| zh | 3 | vits, piper, matcha | 1–218 | 81–213 MB |
Усунення неполадок
Поширені проблеми
Не вдається завантажити модель: Перевірте підключення до Інтернету для першого завантаження. Моделі кешуються локально в IndexedDB, тому наступні використання працюють автономно. Спробуйте очистити дані браузера, якщо завантаження пошкоджені.
ASR не розпізнає мовлення: Переконайтеся, що ви обрали правильну модель ASR для вашої мови джерела. Спробуйте більшу модель для кращої точності. Перевірте, що мікрофон працює та дозволи надано.
Низька якість перекладу: Моделі Opus-MT оптимізовані для швидкості, а не якості. Для кращих результатів спробуйте моделі TranslateGemma або Qwen LLM, якщо ваш пристрій підтримує WebGPU. Переконайтеся, що обрана правильна мовна пара.
WebGPU недоступний: WebGPU потребує сумісного браузера та GPU. Перейдіть на моделі на основі WASM (sherpa-onnx, Opus-MT), які працюють у будь-якому сучасному браузері без вимог до GPU.
Поради щодо продуктивності
- Використовуйте моделі WebGPU, коли вони доступні, для значно швидшої обробки
- Закрийте інші вкладки браузера, щоб звільнити пам'ять для завантаження моделей
- Обирайте менші моделі для пристроїв з низькою продуктивністю або коли швидкість є пріоритетом
- Моделі WASM (sherpa-onnx, Opus-MT) більш сумісні, але повільніші за альтернативи WebGPU
- Слідкуйте за використанням пам'яті браузера — великі моделі можуть потребувати 2 ГБ+ пам'яті браузера
Потрібна додаткова допомога? Відвідайте наш репозиторій GitHub для отримання підтримки спільноти, посібників із сумісності моделей та останніх оновлень функцій локального (автономного) режиму.