Voltar para provedores de IA

Tutorial de configuração local (offline)

Visão geral

O modo Local (Offline) permite executar ASR (Reconhecimento Automático de Fala), tradução e TTS (Texto para Fala) inteiramente no seu dispositivo. Sem chave API, sem conexão com a Internet e nenhum dado sai da sua máquina. Tudo é processado localmente usando WebAssembly e WebGPU.

Sem necessidade de chave API ou Internet

Privacidade em primeiro lugar — todo o áudio e texto permanecem no seu dispositivo. Após baixar os modelos, o modo Local (Offline) funciona completamente offline. Suas conversas nunca saem da sua máquina.

1Selecione "Local (Offline)" como provedor

Abra o Sokuji e navegue até o painel de configurações. Selecione "Local (Offline)" como seu provedor de IA no menu suspenso de provedores.

2Baixe um modelo ASR

Escolha um modelo ASR para o seu idioma de origem. O Sokuji oferece 42 modelos offline/streaming alimentados por sherpa-onnx WASM e WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), cobrindo mais de 99 idiomas. Os modelos variam de leves (~5MB) a alta precisão (~2GB+). Recomendamos Cohere Transcribe ou Voxtral Mini 4B Realtime para a melhor precisão e velocidade.

3Baixe um modelo de tradução

Selecione um par de idiomas de tradução. Escolha TranslateGemma para a melhor qualidade e velocidade, 74 pares de idiomas Opus-MT para tradução rápida via CPU, ou Qwen LLMs via WebGPU para tradução multilíngue de maior qualidade.

4Baixe um modelo TTS

Baixe um modelo TTS para saída de voz. Estão disponíveis 136 modelos em 52 idiomas, alimentados pelos motores Piper, Coqui, Mimic3 e Matcha.

5Comece a traduzir

Clique no botão Iniciar Sessão. Não é necessária conexão com a Internet — a tradução acontece inteiramente no seu dispositivo em tempo real.

Informações adicionais

O que é o modo Local (Offline)?

Local (Offline) é um pipeline de tradução IA totalmente no dispositivo que executa ASR, tradução e TTS sem nenhum serviço em nuvem:

  • Privacidade completa — todo o processamento de áudio e texto permanece no seu dispositivo
  • Funciona offline após o download inicial do modelo
  • Sem necessidade de chaves API, contas ou assinaturas
  • Alimentado por WebAssembly (WASM) e WebGPU para desempenho próximo ao nativo
  • Uso gratuito sem limites de uso

Modelos disponíveis

O modo Local (Offline) suporta uma ampla gama de modelos para cada etapa do pipeline de tradução:

  • ASR: 42 modelos incluindo Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo e Zipformer — cobrindo mais de 99 idiomas
  • Tradução: 74 pares de idiomas Opus-MT para tradução rápida via CPU, mais TranslateGemma e Qwen LLMs via WebGPU para suporte multilíngue
  • TTS: 136 modelos em 52 idiomas usando motores Piper, Coqui, Mimic3 e Matcha

Requisitos de hardware

  • CPU (WASM): Funciona em qualquer navegador moderno — nenhum hardware especial necessário
  • WebGPU: Aceleração GPU opcional para modelos Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma e tradução Qwen — significativamente mais rápido com uma GPU dedicada
  • Recomendado: 4GB+ de RAM para carregamento confortável de modelos
  • Armazenamento: Os modelos variam de 5MB a 200MB+ dependendo do nível de precisão
  • Navegador moderno necessário: Chrome 113+, Edge 113+ ou Firefox 120+ para suporte WebGPU

Catálogo de modelos

Modelos ASR (Reconhecimento de fala)

Escolha um modelo de reconhecimento de fala com base no seu idioma de origem, necessidades de precisão e capacidades de hardware.

Modelos offline (CPU/WASM)

23 modelos que rodam em CPU via WebAssembly. Sem necessidade de GPU. Melhor compatibilidade.

ModeloIdiomasTamanhoPrecisãoVelocidade
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

Modelos de streaming (CPU/WASM)

10 modelos de streaming em tempo real. Transcreva enquanto fala com baixa latência.

ModeloIdiomasTamanhoPrecisãoVelocidade
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

Modelos WebGPU (GPU necessária)

9 modelos acelerados por WebGPU incluindo Cohere Transcribe e Voxtral Mini 4B Realtime (recomendados) mais Whisper. Melhor precisão e velocidade, requer uma GPU compatível.

ModeloIdiomasTamanhoPrecisãoVelocidade
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

Modelos de tradução

Escolha TranslateGemma para a melhor qualidade e velocidade, Opus-MT para tradução rápida em CPU, ou Qwen LLM para ampla cobertura multilíngue.

TranslateGemma 4B (WebGPU) — Recomendado

Modelo de tradução especializado do Google com a maior qualidade e velocidade entre todos os modelos de tradução locais. Suporta 51 idiomas com tradução bidirecional. Requer WebGPU.

ModeloIdiomasTamanhoQualidadeVelocidade
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM (WebGPU)

Modelos de linguagem grandes suportando 119–201+ idiomas. Maior qualidade, mas requer GPU. Melhor para tradução multilíngue flexível.

ModeloIdiomasTamanhoQualidadeVelocidade
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT (CPU/WASM)

74 pares de idiomas, ~110 MB cada. Rápido, leve, funciona em qualquer dispositivo. Melhor para tradução unidirecional.

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

Modelos TTS (Texto para fala)

136 modelos em 52 idiomas. Todos rodam em CPU via WASM — sem necessidade de GPU. Alimentados pelos motores Piper, Coqui, Mimic3, VITS e Matcha.

Configurações de TTS

  • Velocidade da fala — Controla a velocidade de reprodução da fala sintetizada. Ajuste o controle deslizante de velocidade para tornar a saída mais rápida ou mais lenta de acordo com sua preferência.
  • ID do falante — Controla o timbre vocal da fala sintetizada. Muitos modelos suportam múltiplos IDs de falante, cada um com uma voz diferente. Alguns modelos multi-falante incluem vozes de gêneros diferentes, então você pode escolher uma voz masculina ou feminina selecionando diferentes IDs de falante.
IdiomaModelosMotorFalantesFaixa de tamanho
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

Solução de problemas

Problemas comuns

Download do modelo falha: Verifique sua conexão com a Internet para o download inicial. Os modelos são armazenados em cache localmente no IndexedDB, então os usos subsequentes funcionam offline. Tente limpar os dados do navegador se os downloads estiverem corrompidos.

ASR não reconhece a fala: Certifique-se de ter selecionado o modelo ASR correto para o seu idioma de origem. Tente um modelo maior para melhor precisão. Verifique se o microfone está funcionando e as permissões foram concedidas.

Qualidade da tradução está baixa: Os modelos Opus-MT são otimizados para velocidade em detrimento da qualidade. Para melhores resultados, tente os modelos TranslateGemma ou Qwen LLM se o seu dispositivo suporta WebGPU. Certifique-se de ter selecionado o par de idiomas correto.

WebGPU não disponível: WebGPU requer um navegador e GPU compatíveis. Recorra aos modelos baseados em WASM (sherpa-onnx, Opus-MT) que funcionam em qualquer navegador moderno sem requisitos de GPU.

Dicas de desempenho

  1. Use modelos WebGPU quando disponíveis para processamento significativamente mais rápido
  2. Feche outras abas do navegador para liberar memória para o carregamento de modelos
  3. Escolha modelos menores para dispositivos de baixo desempenho ou quando a velocidade for prioridade
  4. Modelos WASM (sherpa-onnx, Opus-MT) são mais compatíveis, mas mais lentos que as alternativas WebGPU
  5. Monitore o uso de memória do navegador — modelos grandes podem exigir 2GB+ de memória do navegador

Precisa de mais ajuda? Visite nosso repositório GitHub para suporte da comunidade, guias de compatibilidade de modelos e as últimas atualizações sobre recursos do Local (Offline).

GitHub Repository