Tutorial de configuração local (offline)
Visão geral
O modo Local (Offline) permite executar ASR (Reconhecimento Automático de Fala), tradução e TTS (Texto para Fala) inteiramente no seu dispositivo. Sem chave API, sem conexão com a Internet e nenhum dado sai da sua máquina. Tudo é processado localmente usando WebAssembly e WebGPU.
Sem necessidade de chave API ou Internet
Privacidade em primeiro lugar — todo o áudio e texto permanecem no seu dispositivo. Após baixar os modelos, o modo Local (Offline) funciona completamente offline. Suas conversas nunca saem da sua máquina.
1Selecione "Local (Offline)" como provedor
Abra o Sokuji e navegue até o painel de configurações. Selecione "Local (Offline)" como seu provedor de IA no menu suspenso de provedores.
2Baixe um modelo ASR
Escolha um modelo ASR para o seu idioma de origem. O Sokuji oferece 42 modelos offline/streaming alimentados por sherpa-onnx WASM e WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), cobrindo mais de 99 idiomas. Os modelos variam de leves (~5MB) a alta precisão (~2GB+). Recomendamos Cohere Transcribe ou Voxtral Mini 4B Realtime para a melhor precisão e velocidade.
3Baixe um modelo de tradução
Selecione um par de idiomas de tradução. Escolha TranslateGemma para a melhor qualidade e velocidade, 74 pares de idiomas Opus-MT para tradução rápida via CPU, ou Qwen LLMs via WebGPU para tradução multilíngue de maior qualidade.
4Baixe um modelo TTS
Baixe um modelo TTS para saída de voz. Estão disponíveis 136 modelos em 52 idiomas, alimentados pelos motores Piper, Coqui, Mimic3 e Matcha.
5Comece a traduzir
Clique no botão Iniciar Sessão. Não é necessária conexão com a Internet — a tradução acontece inteiramente no seu dispositivo em tempo real.
Informações adicionais
O que é o modo Local (Offline)?
Local (Offline) é um pipeline de tradução IA totalmente no dispositivo que executa ASR, tradução e TTS sem nenhum serviço em nuvem:
- Privacidade completa — todo o processamento de áudio e texto permanece no seu dispositivo
- Funciona offline após o download inicial do modelo
- Sem necessidade de chaves API, contas ou assinaturas
- Alimentado por WebAssembly (WASM) e WebGPU para desempenho próximo ao nativo
- Uso gratuito sem limites de uso
Modelos disponíveis
O modo Local (Offline) suporta uma ampla gama de modelos para cada etapa do pipeline de tradução:
- ASR: 42 modelos incluindo Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo e Zipformer — cobrindo mais de 99 idiomas
- Tradução: 74 pares de idiomas Opus-MT para tradução rápida via CPU, mais TranslateGemma e Qwen LLMs via WebGPU para suporte multilíngue
- TTS: 136 modelos em 52 idiomas usando motores Piper, Coqui, Mimic3 e Matcha
Requisitos de hardware
- CPU (WASM): Funciona em qualquer navegador moderno — nenhum hardware especial necessário
- WebGPU: Aceleração GPU opcional para modelos Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma e tradução Qwen — significativamente mais rápido com uma GPU dedicada
- Recomendado: 4GB+ de RAM para carregamento confortável de modelos
- Armazenamento: Os modelos variam de 5MB a 200MB+ dependendo do nível de precisão
- Navegador moderno necessário: Chrome 113+, Edge 113+ ou Firefox 120+ para suporte WebGPU
Catálogo de modelos
Modelos ASR (Reconhecimento de fala)
Escolha um modelo de reconhecimento de fala com base no seu idioma de origem, necessidades de precisão e capacidades de hardware.
Modelos offline (CPU/WASM)
23 modelos que rodam em CPU via WebAssembly. Sem necessidade de GPU. Melhor compatibilidade.
| Modelo | Idiomas | Tamanho | Precisão | Velocidade |
|---|---|---|---|---|
| SenseVoice (int8) | zh, en, ja, ko, yue | 238 MB | ★★★★☆ | ★★★★☆ |
| SenseVoice Nano (int8) | zh, en, ja, ko, yue | 265 MB | ★★★★★ | ★★★☆☆ |
| Moonshine Tiny EN (q) | en | 45 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny JA (q) | ja | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny KO (q) | ko | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Base ZH (q) | zh | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base JA (q) | ja | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base ES (q) | es | 66 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base AR (q) | ar | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base UK (q) | uk | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base VI (q) | vi | 142 MB | ★★★★☆ | ★★★★☆ |
| NeMo Canary (int8) | en, es, de, fr | 208 MB | ★★★★☆ | ★★★☆☆ |
| NeMo FastConformer Multi | be, de, en, es, fr, hr, it, pl, ru, uk | 133 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer DE | de | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer ES | es | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer PT | pt | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo Parakeet TDT 0.6B (int8) | 25 EU languages | 671 MB | ★★★★★ | ★★★☆☆ |
| Dolphin Base CTC Multi | zh, ja, ko, th, vi, ar, hi, bn, ru | 105 MB | ★★★★☆ | ★★★★☆ |
| Whisper Tiny (ONNX) | 99+ languages | 154 MB | ★★★☆☆ | ★★☆☆☆ |
| WenetSpeech Yue U2++ | zh, yue, en | 135 MB | ★★★★☆ | ★★★★☆ |
| Omnilingual 300M v2 | 1147 languages | 367 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer RU (int8) | ru | 74 MB | ★★★★☆ | ★★★★☆ |
| Zipformer VI 30M (int8) | vi | 35 MB | ★★★☆☆ | ★★★★★ |
Modelos de streaming (CPU/WASM)
10 modelos de streaming em tempo real. Transcreva enquanto fala com baixa latência.
| Modelo | Idiomas | Tamanho | Precisão | Velocidade |
|---|---|---|---|---|
| Zipformer EN Kroko | en | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer FR Kroko | fr | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer DE Kroko | de | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ES Kroko | es | 156 MB | ★★★☆☆ | ★★★★☆ |
| Zipformer ZH (int8) | zh | 77 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ZH 2025 (int8) | zh | 167 MB | ★★★★☆ | ★★★★☆ |
| Zipformer RU Vosk (int8) | ru | 29 MB | ★★★☆☆ | ★★★★★ |
| Zipformer Multi (8 lang) | ar, en, id, ja, ru, th, vi, zh | 339 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer BN Vosk | bn | 94 MB | ★★★☆☆ | ★★★★☆ |
| NeMo CTC EN 80ms (int8) | en | 132 MB | ★★★★☆ | ★★★★★ |
Modelos WebGPU (GPU necessária)
9 modelos acelerados por WebGPU incluindo Cohere Transcribe e Voxtral Mini 4B Realtime (recomendados) mais Whisper. Melhor precisão e velocidade, requer uma GPU compatível.
| Modelo | Idiomas | Tamanho | Precisão | Velocidade |
|---|---|---|---|---|
| Cohere Transcribe (q4) | 14 languages | ~2.1 GB | ★★★★★ | ★★★★☆ |
| Cohere Transcribe (q4f16) | 14 languages | ~1.5 GB | ★★★★★ | ★★★★☆ |
| Voxtral Mini 4B Realtime | 13 languages | ~2.3 GB | ★★★★★ | ★★★★★ |
| Whisper Tiny EN | en | 120 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Tiny | 99+ languages | 122 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Base | 99+ languages | 208 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Small | 99+ languages | 586 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Medium | 99+ languages | 680 MB | ★★★★★ | ★★☆☆☆ |
| Whisper Large V3 Turbo | 99+ languages | 759 MB | ★★★★★ | ★★☆☆☆ |
Modelos de tradução
Escolha TranslateGemma para a melhor qualidade e velocidade, Opus-MT para tradução rápida em CPU, ou Qwen LLM para ampla cobertura multilíngue.
TranslateGemma 4B (WebGPU) — Recomendado
Modelo de tradução especializado do Google com a maior qualidade e velocidade entre todos os modelos de tradução locais. Suporta 51 idiomas com tradução bidirecional. Requer WebGPU.
| Modelo | Idiomas | Tamanho | Qualidade | Velocidade |
|---|---|---|---|---|
| TranslateGemma 4B (q4) | 51 languages | ~3.1 GB | ★★★★★ | ★★★★★ |
| TranslateGemma 4B (q4f16) | 51 languages | ~2.7 GB | ★★★★★ | ★★★★★ |
Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu
Qwen LLM (WebGPU)
Modelos de linguagem grandes suportando 119–201+ idiomas. Maior qualidade, mas requer GPU. Melhor para tradução multilíngue flexível.
| Modelo | Idiomas | Tamanho | Qualidade | Velocidade |
|---|---|---|---|---|
| Qwen 2.5 0.5B | 28 languages | ~400 MB | ★★★☆☆ | ★★★★☆ |
| Qwen 3 0.6B | 119+ languages | 919 MB | ★★★★☆ | ★★★☆☆ |
| Qwen 3.5 0.8B | 201+ languages | ~1.6 GB | ★★★★★ | ★★☆☆☆ |
| Qwen 3.5 2B | 201+ languages | ~1.8 GB | ★★★★★ | ★☆☆☆☆ |
Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans
Qwen 3/3.5: 119–201+ languages (multilingual)
Opus-MT (CPU/WASM)
74 pares de idiomas, ~110 MB cada. Rápido, leve, funciona em qualquer dispositivo. Melhor para tradução unidirecional.
| src ↓ tgt → | en | ja | zh | ko | de | fr | es | it | ru | ar | hi | vi | tr | uk | pt | nl | pl | da | sv | fi | cs | ro | hu | id | no | et | th | af | xh |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| en | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||
| ja | ✓ | ||||||||||||||||||||||||||||
| zh | ✓ | ||||||||||||||||||||||||||||
| ko | ✓ | ||||||||||||||||||||||||||||
| de | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| fr | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| es | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| it | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| ru | ✓ | ✓ | ✓ | ✓ | |||||||||||||||||||||||||
| ar | ✓ | ||||||||||||||||||||||||||||
| hi | ✓ | ||||||||||||||||||||||||||||
| vi | ✓ | ||||||||||||||||||||||||||||
| tr | ✓ | ||||||||||||||||||||||||||||
| uk | ✓ | ✓ | |||||||||||||||||||||||||||
| pt | |||||||||||||||||||||||||||||
| nl | ✓ | ✓ | |||||||||||||||||||||||||||
| pl | ✓ | ||||||||||||||||||||||||||||
| da | ✓ | ✓ | |||||||||||||||||||||||||||
| sv | ✓ | ||||||||||||||||||||||||||||
| fi | ✓ | ✓ | |||||||||||||||||||||||||||
| cs | ✓ | ||||||||||||||||||||||||||||
| ro | ✓ | ✓ | |||||||||||||||||||||||||||
| hu | ✓ | ||||||||||||||||||||||||||||
| id | ✓ | ||||||||||||||||||||||||||||
| no | ✓ | ||||||||||||||||||||||||||||
| et | ✓ | ||||||||||||||||||||||||||||
| th | ✓ | ||||||||||||||||||||||||||||
| af | ✓ | ||||||||||||||||||||||||||||
| xh | ✓ |
Modelos TTS (Texto para fala)
136 modelos em 52 idiomas. Todos rodam em CPU via WASM — sem necessidade de GPU. Alimentados pelos motores Piper, Coqui, Mimic3, VITS e Matcha.
Configurações de TTS
- Velocidade da fala — Controla a velocidade de reprodução da fala sintetizada. Ajuste o controle deslizante de velocidade para tornar a saída mais rápida ou mais lenta de acordo com sua preferência.
- ID do falante — Controla o timbre vocal da fala sintetizada. Muitos modelos suportam múltiplos IDs de falante, cada um com uma voz diferente. Alguns modelos multi-falante incluem vozes de gêneros diferentes, então você pode escolher uma voz masculina ou feminina selecionando diferentes IDs de falante.
| Idioma | Modelos | Motor | Falantes | Faixa de tamanho |
|---|---|---|---|---|
| af | 1 | mimic3 | 1 | ~94 MB |
| ar | 2 | piper | 1 | 81–95 MB |
| bg | 1 | coqui | 1 | ~71 MB |
| bn | 2 | mimic3, coqui | 1 | 71–94 MB |
| ca | 3 | piper | 1 | 39–95 MB |
| cs | 2 | piper | 1 | 81–95 MB |
| cy | 2 | piper | 1–7 | ~95 MB |
| da | 1 | piper | 1 | ~95 MB |
| de | 8 | piper | 1 | 39–81 MB |
| el | 2 | piper, mimic3 | 1 | 81–94 MB |
| en | 13 | piper | 1–904 | 81–97 MB |
| es | 6 | piper | 1–2 | 39–95 MB |
| et | 1 | coqui | 1 | ~71 MB |
| fa | 8 | piper, mimic3, matcha | 1 | 81–146 MB |
| fi | 2 | piper | 1 | 81–95 MB |
| fr | 8 | piper | 1–16 | 39–95 MB |
| ga | 1 | coqui | 1 | ~71 MB |
| gu | 1 | mimic3 | 1 | ~94 MB |
| hi | 3 | piper | 1 | ~95 MB |
| hr | 1 | coqui | 1 | ~71 MB |
| hu | 3 | piper | 1 | ~95 MB |
| id | 1 | piper | 1 | ~95 MB |
| is | 4 | piper | 1 | ~95 MB |
| it | 2 | piper | 1 | 39–95 MB |
| ka | 1 | piper | 1 | ~95 MB |
| kk | 3 | piper | 1+ | 39–81 MB |
| ko | 1 | mimic3 | 1 | ~94 MB |
| lb | 1 | piper | 1 | ~95 MB |
| lt | 1 | coqui | 1 | ~71 MB |
| lv | 1 | piper | 1 | ~95 MB |
| ml | 2 | piper | 1 | ~95 MB |
| mt | 1 | coqui | 1 | ~71 MB |
| ne | 3 | piper | 1+ | 39–95 MB |
| nl | 4 | piper | 1 | 39–95 MB |
| no | 1 | piper | 1 | ~95 MB |
| pl | 7 | piper | 1 | ~95 MB |
| pt | 4 | piper | 1 | 81–95 MB |
| ro | 1 | piper | 1 | ~95 MB |
| ru | 4 | piper | 1 | ~95 MB |
| sk | 1 | piper | 1 | ~95 MB |
| sl | 1 | piper | 1 | ~95 MB |
| sr | 1 | piper | multi | ~95 MB |
| sv | 2 | piper | 1+ | ~95 MB |
| sw | 1 | piper | 1 | ~95 MB |
| tn | 1 | mimic3 | multi | ~94 MB |
| tr | 3 | piper | 1 | ~95 MB |
| uk | 2 | piper | 1+ | 39–95 MB |
| vi | 4 | piper, mimic3 | 1–65 | 46–95 MB |
| yue | 1 | vits | 1 | ~114 MB |
| zh | 3 | vits, piper, matcha | 1–218 | 81–213 MB |
Solução de problemas
Problemas comuns
Download do modelo falha: Verifique sua conexão com a Internet para o download inicial. Os modelos são armazenados em cache localmente no IndexedDB, então os usos subsequentes funcionam offline. Tente limpar os dados do navegador se os downloads estiverem corrompidos.
ASR não reconhece a fala: Certifique-se de ter selecionado o modelo ASR correto para o seu idioma de origem. Tente um modelo maior para melhor precisão. Verifique se o microfone está funcionando e as permissões foram concedidas.
Qualidade da tradução está baixa: Os modelos Opus-MT são otimizados para velocidade em detrimento da qualidade. Para melhores resultados, tente os modelos TranslateGemma ou Qwen LLM se o seu dispositivo suporta WebGPU. Certifique-se de ter selecionado o par de idiomas correto.
WebGPU não disponível: WebGPU requer um navegador e GPU compatíveis. Recorra aos modelos baseados em WASM (sherpa-onnx, Opus-MT) que funcionam em qualquer navegador moderno sem requisitos de GPU.
Dicas de desempenho
- Use modelos WebGPU quando disponíveis para processamento significativamente mais rápido
- Feche outras abas do navegador para liberar memória para o carregamento de modelos
- Escolha modelos menores para dispositivos de baixo desempenho ou quando a velocidade for prioridade
- Modelos WASM (sherpa-onnx, Opus-MT) são mais compatíveis, mas mais lentos que as alternativas WebGPU
- Monitore o uso de memória do navegador — modelos grandes podem exigir 2GB+ de memória do navegador
Precisa de mais ajuda? Visite nosso repositório GitHub para suporte da comunidade, guias de compatibilidade de modelos e as últimas atualizações sobre recursos do Local (Offline).