Tutorial de configuración local (sin conexión)
Descripción general
El modo Local (Sin conexión) le permite ejecutar ASR (Reconocimiento automático de voz), traducción y TTS (Texto a voz) completamente en su dispositivo. Sin clave API, sin conexión a Internet y sin datos que salgan de su máquina. Todo se procesa localmente usando WebAssembly y WebGPU.
Sin clave API ni Internet necesarios
Privacidad primero — todo el audio y texto permanecen en su dispositivo. Después de descargar los modelos, el modo Local (Sin conexión) funciona completamente sin conexión. Sus conversaciones nunca salen de su máquina.
1Seleccione "Local (Sin conexión)" como proveedor
Abra Sokuji y navegue al panel de configuración. Seleccione "Local (Sin conexión)" como su proveedor de IA en el menú desplegable de proveedores.
2Descargue un modelo ASR
Elija un modelo ASR para su idioma de origen. Sokuji ofrece 42 modelos sin conexión/streaming impulsados por sherpa-onnx WASM y WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), cubriendo más de 99 idiomas. Los modelos varían desde ligeros (~5MB) hasta alta precisión (~2GB+). Recomendamos Cohere Transcribe o Voxtral Mini 4B Realtime para la mejor precisión y velocidad.
3Descargue un modelo de traducción
Seleccione un par de idiomas de traducción. Elija TranslateGemma para la mejor calidad y velocidad, 74 pares de idiomas Opus-MT para traducción rápida por CPU, o Qwen LLMs vía WebGPU para traducción multilingüe de mayor calidad.
4Descargue un modelo TTS
Descargue un modelo TTS para salida de voz. Hay 136 modelos disponibles en 52 idiomas, impulsados por los motores Piper, Coqui, Mimic3 y Matcha.
5Comience a traducir
Haga clic en el botón Iniciar sesión. No se necesita conexión a Internet — la traducción ocurre completamente en su dispositivo en tiempo real.
Información adicional
¿Qué es el modo Local (Sin conexión)?
Local (Sin conexión) es un pipeline de traducción IA completamente en el dispositivo que ejecuta ASR, traducción y TTS sin ningún servicio en la nube:
- Privacidad completa — todo el procesamiento de audio y texto permanece en su dispositivo
- Funciona sin conexión después de la descarga inicial del modelo
- No se requieren claves API, cuentas ni suscripciones
- Impulsado por WebAssembly (WASM) y WebGPU para rendimiento similar al nativo
- Uso gratuito sin límites de uso
Modelos disponibles
El modo Local (Sin conexión) soporta una amplia gama de modelos para cada etapa del pipeline de traducción:
- ASR: 42 modelos incluyendo Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo y Zipformer — cubriendo más de 99 idiomas
- Traducción: 74 pares de idiomas Opus-MT para traducción rápida por CPU, además de TranslateGemma y Qwen LLMs vía WebGPU para soporte multilingüe
- TTS: 136 modelos en 52 idiomas usando motores Piper, Coqui, Mimic3 y Matcha
Requisitos de hardware
- CPU (WASM): Funciona en cualquier navegador moderno — no se necesita hardware especial
- WebGPU: Aceleración GPU opcional para modelos Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma y traducción Qwen — significativamente más rápido con una GPU dedicada
- Recomendado: 4GB+ de RAM para carga cómoda de modelos
- Almacenamiento: Los modelos varían de 5MB a 200MB+ dependiendo del nivel de precisión
- Se requiere navegador moderno: Chrome 113+, Edge 113+ o Firefox 120+ para soporte WebGPU
Catálogo de modelos
Modelos ASR (Reconocimiento de voz)
Elija un modelo de reconocimiento de voz según su idioma de origen, necesidades de precisión y capacidades de hardware.
Modelos sin conexión (CPU/WASM)
23 modelos que se ejecutan en CPU vía WebAssembly. No se requiere GPU. Mejor compatibilidad.
| Modelo | Idiomas | Tamaño | Precisión | Velocidad |
|---|---|---|---|---|
| SenseVoice (int8) | zh, en, ja, ko, yue | 238 MB | ★★★★☆ | ★★★★☆ |
| SenseVoice Nano (int8) | zh, en, ja, ko, yue | 265 MB | ★★★★★ | ★★★☆☆ |
| Moonshine Tiny EN (q) | en | 45 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny JA (q) | ja | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny KO (q) | ko | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Base ZH (q) | zh | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base JA (q) | ja | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base ES (q) | es | 66 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base AR (q) | ar | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base UK (q) | uk | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base VI (q) | vi | 142 MB | ★★★★☆ | ★★★★☆ |
| NeMo Canary (int8) | en, es, de, fr | 208 MB | ★★★★☆ | ★★★☆☆ |
| NeMo FastConformer Multi | be, de, en, es, fr, hr, it, pl, ru, uk | 133 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer DE | de | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer ES | es | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer PT | pt | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo Parakeet TDT 0.6B (int8) | 25 EU languages | 671 MB | ★★★★★ | ★★★☆☆ |
| Dolphin Base CTC Multi | zh, ja, ko, th, vi, ar, hi, bn, ru | 105 MB | ★★★★☆ | ★★★★☆ |
| Whisper Tiny (ONNX) | 99+ languages | 154 MB | ★★★☆☆ | ★★☆☆☆ |
| WenetSpeech Yue U2++ | zh, yue, en | 135 MB | ★★★★☆ | ★★★★☆ |
| Omnilingual 300M v2 | 1147 languages | 367 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer RU (int8) | ru | 74 MB | ★★★★☆ | ★★★★☆ |
| Zipformer VI 30M (int8) | vi | 35 MB | ★★★☆☆ | ★★★★★ |
Modelos en streaming (CPU/WASM)
10 modelos de streaming en tiempo real. Transcriba mientras habla con baja latencia.
| Modelo | Idiomas | Tamaño | Precisión | Velocidad |
|---|---|---|---|---|
| Zipformer EN Kroko | en | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer FR Kroko | fr | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer DE Kroko | de | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ES Kroko | es | 156 MB | ★★★☆☆ | ★★★★☆ |
| Zipformer ZH (int8) | zh | 77 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ZH 2025 (int8) | zh | 167 MB | ★★★★☆ | ★★★★☆ |
| Zipformer RU Vosk (int8) | ru | 29 MB | ★★★☆☆ | ★★★★★ |
| Zipformer Multi (8 lang) | ar, en, id, ja, ru, th, vi, zh | 339 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer BN Vosk | bn | 94 MB | ★★★☆☆ | ★★★★☆ |
| NeMo CTC EN 80ms (int8) | en | 132 MB | ★★★★☆ | ★★★★★ |
Modelos WebGPU (GPU requerida)
9 modelos acelerados por WebGPU incluyendo Cohere Transcribe y Voxtral Mini 4B Realtime (recomendados) más Whisper. Mejor precisión y velocidad, requiere una GPU compatible.
| Modelo | Idiomas | Tamaño | Precisión | Velocidad |
|---|---|---|---|---|
| Cohere Transcribe (q4) | 14 languages | ~2.1 GB | ★★★★★ | ★★★★☆ |
| Cohere Transcribe (q4f16) | 14 languages | ~1.5 GB | ★★★★★ | ★★★★☆ |
| Voxtral Mini 4B Realtime | 13 languages | ~2.3 GB | ★★★★★ | ★★★★★ |
| Whisper Tiny EN | en | 120 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Tiny | 99+ languages | 122 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Base | 99+ languages | 208 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Small | 99+ languages | 586 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Medium | 99+ languages | 680 MB | ★★★★★ | ★★☆☆☆ |
| Whisper Large V3 Turbo | 99+ languages | 759 MB | ★★★★★ | ★★☆☆☆ |
Modelos de traducción
Elija TranslateGemma para la mejor calidad y velocidad, Opus-MT para traducción rápida en CPU, o Qwen LLM para amplia cobertura multilingüe.
TranslateGemma 4B (WebGPU) — Recomendado
Modelo de traducción especializado de Google con la mayor calidad y velocidad entre todos los modelos de traducción locales. Soporta 51 idiomas con traducción bidireccional. Requiere WebGPU.
| Modelo | Idiomas | Tamaño | Calidad | Velocidad |
|---|---|---|---|---|
| TranslateGemma 4B (q4) | 51 languages | ~3.1 GB | ★★★★★ | ★★★★★ |
| TranslateGemma 4B (q4f16) | 51 languages | ~2.7 GB | ★★★★★ | ★★★★★ |
Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu
Qwen LLM (WebGPU)
Modelos de lenguaje grandes que soportan 119–201+ idiomas. Mayor calidad pero requiere GPU. Ideal para traducción multilingüe flexible.
| Modelo | Idiomas | Tamaño | Calidad | Velocidad |
|---|---|---|---|---|
| Qwen 2.5 0.5B | 28 languages | ~400 MB | ★★★☆☆ | ★★★★☆ |
| Qwen 3 0.6B | 119+ languages | 919 MB | ★★★★☆ | ★★★☆☆ |
| Qwen 3.5 0.8B | 201+ languages | ~1.6 GB | ★★★★★ | ★★☆☆☆ |
| Qwen 3.5 2B | 201+ languages | ~1.8 GB | ★★★★★ | ★☆☆☆☆ |
Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans
Qwen 3/3.5: 119–201+ languages (multilingual)
Opus-MT (CPU/WASM)
74 pares de idiomas, ~110 MB cada uno. Rápido, ligero, funciona en cualquier dispositivo. Ideal para traducción unidireccional.
| src ↓ tgt → | en | ja | zh | ko | de | fr | es | it | ru | ar | hi | vi | tr | uk | pt | nl | pl | da | sv | fi | cs | ro | hu | id | no | et | th | af | xh |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| en | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||
| ja | ✓ | ||||||||||||||||||||||||||||
| zh | ✓ | ||||||||||||||||||||||||||||
| ko | ✓ | ||||||||||||||||||||||||||||
| de | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| fr | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| es | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| it | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| ru | ✓ | ✓ | ✓ | ✓ | |||||||||||||||||||||||||
| ar | ✓ | ||||||||||||||||||||||||||||
| hi | ✓ | ||||||||||||||||||||||||||||
| vi | ✓ | ||||||||||||||||||||||||||||
| tr | ✓ | ||||||||||||||||||||||||||||
| uk | ✓ | ✓ | |||||||||||||||||||||||||||
| pt | |||||||||||||||||||||||||||||
| nl | ✓ | ✓ | |||||||||||||||||||||||||||
| pl | ✓ | ||||||||||||||||||||||||||||
| da | ✓ | ✓ | |||||||||||||||||||||||||||
| sv | ✓ | ||||||||||||||||||||||||||||
| fi | ✓ | ✓ | |||||||||||||||||||||||||||
| cs | ✓ | ||||||||||||||||||||||||||||
| ro | ✓ | ✓ | |||||||||||||||||||||||||||
| hu | ✓ | ||||||||||||||||||||||||||||
| id | ✓ | ||||||||||||||||||||||||||||
| no | ✓ | ||||||||||||||||||||||||||||
| et | ✓ | ||||||||||||||||||||||||||||
| th | ✓ | ||||||||||||||||||||||||||||
| af | ✓ | ||||||||||||||||||||||||||||
| xh | ✓ |
Modelos TTS (Texto a voz)
136 modelos en 52 idiomas. Todos se ejecutan en CPU vía WASM — no se requiere GPU. Impulsados por motores Piper, Coqui, Mimic3, VITS y Matcha.
Configuración de TTS
- Velocidad de voz — Controla la velocidad de reproducción del habla sintetizada. Ajuste el control deslizante de velocidad para hacer la salida más rápida o más lenta según su preferencia.
- ID de hablante — Controla el timbre de voz del habla sintetizada. Muchos modelos soportan múltiples IDs de hablante, cada uno con una voz diferente. Algunos modelos multi-hablante incluyen voces de diferentes géneros, por lo que puede elegir una voz masculina o femenina seleccionando diferentes IDs de hablante.
| Idioma | Modelos | Motor | Hablantes | Rango de tamaño |
|---|---|---|---|---|
| af | 1 | mimic3 | 1 | ~94 MB |
| ar | 2 | piper | 1 | 81–95 MB |
| bg | 1 | coqui | 1 | ~71 MB |
| bn | 2 | mimic3, coqui | 1 | 71–94 MB |
| ca | 3 | piper | 1 | 39–95 MB |
| cs | 2 | piper | 1 | 81–95 MB |
| cy | 2 | piper | 1–7 | ~95 MB |
| da | 1 | piper | 1 | ~95 MB |
| de | 8 | piper | 1 | 39–81 MB |
| el | 2 | piper, mimic3 | 1 | 81–94 MB |
| en | 13 | piper | 1–904 | 81–97 MB |
| es | 6 | piper | 1–2 | 39–95 MB |
| et | 1 | coqui | 1 | ~71 MB |
| fa | 8 | piper, mimic3, matcha | 1 | 81–146 MB |
| fi | 2 | piper | 1 | 81–95 MB |
| fr | 8 | piper | 1–16 | 39–95 MB |
| ga | 1 | coqui | 1 | ~71 MB |
| gu | 1 | mimic3 | 1 | ~94 MB |
| hi | 3 | piper | 1 | ~95 MB |
| hr | 1 | coqui | 1 | ~71 MB |
| hu | 3 | piper | 1 | ~95 MB |
| id | 1 | piper | 1 | ~95 MB |
| is | 4 | piper | 1 | ~95 MB |
| it | 2 | piper | 1 | 39–95 MB |
| ka | 1 | piper | 1 | ~95 MB |
| kk | 3 | piper | 1+ | 39–81 MB |
| ko | 1 | mimic3 | 1 | ~94 MB |
| lb | 1 | piper | 1 | ~95 MB |
| lt | 1 | coqui | 1 | ~71 MB |
| lv | 1 | piper | 1 | ~95 MB |
| ml | 2 | piper | 1 | ~95 MB |
| mt | 1 | coqui | 1 | ~71 MB |
| ne | 3 | piper | 1+ | 39–95 MB |
| nl | 4 | piper | 1 | 39–95 MB |
| no | 1 | piper | 1 | ~95 MB |
| pl | 7 | piper | 1 | ~95 MB |
| pt | 4 | piper | 1 | 81–95 MB |
| ro | 1 | piper | 1 | ~95 MB |
| ru | 4 | piper | 1 | ~95 MB |
| sk | 1 | piper | 1 | ~95 MB |
| sl | 1 | piper | 1 | ~95 MB |
| sr | 1 | piper | multi | ~95 MB |
| sv | 2 | piper | 1+ | ~95 MB |
| sw | 1 | piper | 1 | ~95 MB |
| tn | 1 | mimic3 | multi | ~94 MB |
| tr | 3 | piper | 1 | ~95 MB |
| uk | 2 | piper | 1+ | 39–95 MB |
| vi | 4 | piper, mimic3 | 1–65 | 46–95 MB |
| yue | 1 | vits | 1 | ~114 MB |
| zh | 3 | vits, piper, matcha | 1–218 | 81–213 MB |
Solución de problemas
Problemas comunes
La descarga del modelo falla: Verifique su conexión a Internet para la descarga inicial. Los modelos se almacenan localmente en IndexedDB, por lo que los usos posteriores funcionan sin conexión. Intente borrar los datos del navegador si las descargas están corruptas.
ASR no reconoce el habla: Asegúrese de haber seleccionado el modelo ASR correcto para su idioma de origen. Pruebe un modelo más grande para mayor precisión. Verifique que su micrófono funcione y se hayan otorgado los permisos.
La calidad de traducción es baja: Los modelos Opus-MT están optimizados para velocidad sobre calidad. Para mejores resultados, pruebe los modelos TranslateGemma o Qwen LLM si su dispositivo soporta WebGPU. Asegúrese de haber seleccionado el par de idiomas correcto.
WebGPU no está disponible: WebGPU requiere un navegador y GPU compatibles. Recurra a modelos basados en WASM (sherpa-onnx, Opus-MT) que funcionan en cualquier navegador moderno sin requisitos de GPU.
Consejos de rendimiento
- Use modelos WebGPU cuando estén disponibles para un procesamiento significativamente más rápido
- Cierre otras pestañas del navegador para liberar memoria para la carga de modelos
- Elija modelos más pequeños para dispositivos de gama baja o cuando se priorice la velocidad
- Los modelos WASM (sherpa-onnx, Opus-MT) son más compatibles pero más lentos que las alternativas WebGPU
- Monitoree el uso de memoria del navegador — los modelos grandes pueden requerir 2GB+ de memoria del navegador
¿Necesita más ayuda? Visite nuestro repositorio de GitHub para soporte comunitario, guías de compatibilidad de modelos y las últimas actualizaciones sobre las funciones de Local (Sin conexión).