Volver a proveedores de IA

Tutorial de configuración local (sin conexión)

Descripción general

El modo Local (Sin conexión) le permite ejecutar ASR (Reconocimiento automático de voz), traducción y TTS (Texto a voz) completamente en su dispositivo. Sin clave API, sin conexión a Internet y sin datos que salgan de su máquina. Todo se procesa localmente usando WebAssembly y WebGPU.

Sin clave API ni Internet necesarios

Privacidad primero — todo el audio y texto permanecen en su dispositivo. Después de descargar los modelos, el modo Local (Sin conexión) funciona completamente sin conexión. Sus conversaciones nunca salen de su máquina.

1Seleccione "Local (Sin conexión)" como proveedor

Abra Sokuji y navegue al panel de configuración. Seleccione "Local (Sin conexión)" como su proveedor de IA en el menú desplegable de proveedores.

2Descargue un modelo ASR

Elija un modelo ASR para su idioma de origen. Sokuji ofrece 42 modelos sin conexión/streaming impulsados por sherpa-onnx WASM y WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), cubriendo más de 99 idiomas. Los modelos varían desde ligeros (~5MB) hasta alta precisión (~2GB+). Recomendamos Cohere Transcribe o Voxtral Mini 4B Realtime para la mejor precisión y velocidad.

3Descargue un modelo de traducción

Seleccione un par de idiomas de traducción. Elija TranslateGemma para la mejor calidad y velocidad, 74 pares de idiomas Opus-MT para traducción rápida por CPU, o Qwen LLMs vía WebGPU para traducción multilingüe de mayor calidad.

4Descargue un modelo TTS

Descargue un modelo TTS para salida de voz. Hay 136 modelos disponibles en 52 idiomas, impulsados por los motores Piper, Coqui, Mimic3 y Matcha.

5Comience a traducir

Haga clic en el botón Iniciar sesión. No se necesita conexión a Internet — la traducción ocurre completamente en su dispositivo en tiempo real.

Información adicional

¿Qué es el modo Local (Sin conexión)?

Local (Sin conexión) es un pipeline de traducción IA completamente en el dispositivo que ejecuta ASR, traducción y TTS sin ningún servicio en la nube:

  • Privacidad completa — todo el procesamiento de audio y texto permanece en su dispositivo
  • Funciona sin conexión después de la descarga inicial del modelo
  • No se requieren claves API, cuentas ni suscripciones
  • Impulsado por WebAssembly (WASM) y WebGPU para rendimiento similar al nativo
  • Uso gratuito sin límites de uso

Modelos disponibles

El modo Local (Sin conexión) soporta una amplia gama de modelos para cada etapa del pipeline de traducción:

  • ASR: 42 modelos incluyendo Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo y Zipformer — cubriendo más de 99 idiomas
  • Traducción: 74 pares de idiomas Opus-MT para traducción rápida por CPU, además de TranslateGemma y Qwen LLMs vía WebGPU para soporte multilingüe
  • TTS: 136 modelos en 52 idiomas usando motores Piper, Coqui, Mimic3 y Matcha

Requisitos de hardware

  • CPU (WASM): Funciona en cualquier navegador moderno — no se necesita hardware especial
  • WebGPU: Aceleración GPU opcional para modelos Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma y traducción Qwen — significativamente más rápido con una GPU dedicada
  • Recomendado: 4GB+ de RAM para carga cómoda de modelos
  • Almacenamiento: Los modelos varían de 5MB a 200MB+ dependiendo del nivel de precisión
  • Se requiere navegador moderno: Chrome 113+, Edge 113+ o Firefox 120+ para soporte WebGPU

Catálogo de modelos

Modelos ASR (Reconocimiento de voz)

Elija un modelo de reconocimiento de voz según su idioma de origen, necesidades de precisión y capacidades de hardware.

Modelos sin conexión (CPU/WASM)

23 modelos que se ejecutan en CPU vía WebAssembly. No se requiere GPU. Mejor compatibilidad.

ModeloIdiomasTamañoPrecisiónVelocidad
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

Modelos en streaming (CPU/WASM)

10 modelos de streaming en tiempo real. Transcriba mientras habla con baja latencia.

ModeloIdiomasTamañoPrecisiónVelocidad
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

Modelos WebGPU (GPU requerida)

9 modelos acelerados por WebGPU incluyendo Cohere Transcribe y Voxtral Mini 4B Realtime (recomendados) más Whisper. Mejor precisión y velocidad, requiere una GPU compatible.

ModeloIdiomasTamañoPrecisiónVelocidad
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

Modelos de traducción

Elija TranslateGemma para la mejor calidad y velocidad, Opus-MT para traducción rápida en CPU, o Qwen LLM para amplia cobertura multilingüe.

TranslateGemma 4B (WebGPU) — Recomendado

Modelo de traducción especializado de Google con la mayor calidad y velocidad entre todos los modelos de traducción locales. Soporta 51 idiomas con traducción bidireccional. Requiere WebGPU.

ModeloIdiomasTamañoCalidadVelocidad
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM (WebGPU)

Modelos de lenguaje grandes que soportan 119–201+ idiomas. Mayor calidad pero requiere GPU. Ideal para traducción multilingüe flexible.

ModeloIdiomasTamañoCalidadVelocidad
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT (CPU/WASM)

74 pares de idiomas, ~110 MB cada uno. Rápido, ligero, funciona en cualquier dispositivo. Ideal para traducción unidireccional.

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

Modelos TTS (Texto a voz)

136 modelos en 52 idiomas. Todos se ejecutan en CPU vía WASM — no se requiere GPU. Impulsados por motores Piper, Coqui, Mimic3, VITS y Matcha.

Configuración de TTS

  • Velocidad de voz — Controla la velocidad de reproducción del habla sintetizada. Ajuste el control deslizante de velocidad para hacer la salida más rápida o más lenta según su preferencia.
  • ID de hablante — Controla el timbre de voz del habla sintetizada. Muchos modelos soportan múltiples IDs de hablante, cada uno con una voz diferente. Algunos modelos multi-hablante incluyen voces de diferentes géneros, por lo que puede elegir una voz masculina o femenina seleccionando diferentes IDs de hablante.
IdiomaModelosMotorHablantesRango de tamaño
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

Solución de problemas

Problemas comunes

La descarga del modelo falla: Verifique su conexión a Internet para la descarga inicial. Los modelos se almacenan localmente en IndexedDB, por lo que los usos posteriores funcionan sin conexión. Intente borrar los datos del navegador si las descargas están corruptas.

ASR no reconoce el habla: Asegúrese de haber seleccionado el modelo ASR correcto para su idioma de origen. Pruebe un modelo más grande para mayor precisión. Verifique que su micrófono funcione y se hayan otorgado los permisos.

La calidad de traducción es baja: Los modelos Opus-MT están optimizados para velocidad sobre calidad. Para mejores resultados, pruebe los modelos TranslateGemma o Qwen LLM si su dispositivo soporta WebGPU. Asegúrese de haber seleccionado el par de idiomas correcto.

WebGPU no está disponible: WebGPU requiere un navegador y GPU compatibles. Recurra a modelos basados en WASM (sherpa-onnx, Opus-MT) que funcionan en cualquier navegador moderno sin requisitos de GPU.

Consejos de rendimiento

  1. Use modelos WebGPU cuando estén disponibles para un procesamiento significativamente más rápido
  2. Cierre otras pestañas del navegador para liberar memoria para la carga de modelos
  3. Elija modelos más pequeños para dispositivos de gama baja o cuando se priorice la velocidad
  4. Los modelos WASM (sherpa-onnx, Opus-MT) son más compatibles pero más lentos que las alternativas WebGPU
  5. Monitoree el uso de memoria del navegador — los modelos grandes pueden requerir 2GB+ de memoria del navegador

¿Necesita más ayuda? Visite nuestro repositorio de GitHub para soporte comunitario, guías de compatibilidad de modelos y las últimas actualizaciones sobre las funciones de Local (Sin conexión).

GitHub Repository