Habla tu propio idioma.
Que te oigan en el del otro.

Tu voz sale en el idioma de la otra persona. Lo que dice vuelve como subtítulos en el tuyo. Sokuji es un micrófono virtual entre tú y tu app de reuniones, así que la configuración se queda de tu lado: ellos hablan con normalidad, sin instalar nada y sin ningún enlace al que unirse.

Libre y de código abierto · IA en el dispositivo · sin suscripción
Sokuji

Instala la app o añádela a tu navegador

La app de escritorio no depende de una lista de sitios compatibles. Se registra como un micrófono en tu equipo, así que cualquier cosa que pueda elegir un micrófono puede usarla.

App de escritorio — a nivel de sistema

Sokuji aparece como un micrófono normal en tu sistema operativo. Apps de reuniones, navegadores, grabadoras, software de streaming, juegos: si te deja elegir micrófono, puede oír tu voz traducida.

En el sentido contrario no pide permiso a nadie: Sokuji lee lo que tu equipo esté reproduciendo, incluido el audio del sistema, así que un vídeo, una emisión o una grabación se subtitulan igual que una llamada.

Linux / integrado, en PulseAudio o PipeWire
macOS / el controlador viene con la app · Windows / mediante VB-CABLE

Extensión de navegador

Nada instalado en el sistema y ningún enrutamiento de audio que configurar. Hecha a medida para los sitios de reuniones que admite.

Zoom · Google Meet · Microsoft Teams · Slack · Discord · Jitsi Meet · Whereby · Gather · Yandex Telemost

Dentro de esas páginas tu voz traducida se ofrece al sitio como micrófono, y el audio de la propia pestaña es lo que se traduce de vuelta. En cualquier otro sitio —otra app, un vídeo fuera del navegador, el audio del sistema— el trabajo es de la app de escritorio.

¿Qué quieres hacer?

Sokuji está hecho para que el coste de cruzar un idioma recaiga en quien quiere que le entiendan. Eso es lo primero que construimos. Pero no siempre eres esa persona: a veces estás en una clase, escuchando una grabación, o en una llamada que montó otro.

Entender lo que dicen los demás

Reuniones, clases, charlas, vídeos, directos: lee una traducción en vivo de lo que oyes.

ellos hablan → tú lees

Subtitular lo que digo

Charlas, directos, presentaciones: tu público lee subtítulos traducidos, sin voz sintética.

tú hablas → ellos leen

Conversación en ambos sentidos

Oyen tu voz traducida; tú lees subtítulos de lo que dicen.

ambos sentidos · voz al salir, texto al entrar

Ambos sentidos, solo subtítulos

Subtítulos bilingües y actas de reunión: ambas partes como texto, sin ninguna voz sintética.

ambos sentidos · solo texto

Qué hace durante una llamada

Cualquiera puede meter voz en un modelo. Seguir siendo inteligible durante toda una reunión —mantener el ritmo, saber cuándo has terminado una idea, no devolverte tu propia voz— es ingeniería de audio.

Habla con tu propia voz

Graba un clip corto una vez y tu voz traducida sonará como tú y no como una voz de catálogo, o elige una de la biblioteca del proveedor. Qué voces puedes elegir depende del proveedor que uses.

Velocidad de habla adaptativa

La misma frase dura más en unos idiomas que en otros, así que a ritmo fijo la traducción se retrasa con cada una. Sokuji acelera lo justo para no quedarse atrás.

Detección semántica de turno

Espera a una idea terminada, no a una simple pausa, para no cortarte a mitad de frase.

Tus palabras, tus términos

Las instrucciones de sistema evitan que nombres, términos de producto y jerga interna acaben traducidos en papilla.

Subtítulos superpuestos

Una ventana aparte que puedes mover y redimensionar, o subtítulos encima de la propia página de la reunión.

Funciona con la red apagada

Sokuji detecta tu GPU, descarga el motor de inferencia hecho para ella y ejecuta reconocimiento, traducción y voz en tu máquina: sin clave, sin cuenta, sin contador. Aquí la ejecución en el dispositivo es una vía de primera clase, no un recurso para cuando se cae la conexión.

Además: traducir mientras pulsas, supresión de ruido, cancelación de eco, traducción de transcripciones parciales, ajuste del búfer de audio, cambio de dispositivos de audio en plena sesión, el micrófono virtual en sí y exportar una conversación como .txt o .json.

Lo que cargamos por ti y lo que sigue siendo tuyo

Sokuji es gratis y de código abierto, y seguirá siéndolo. Aparte de eso, una cuenta de Kizuna AI puede guardar la clave y pagar la factura de unos pocos proveedores de IA, para quien prefiere no lidiar con consolas de desarrollador. No ejecutamos los modelos, y es un servicio que quizá no toques nunca. Cada comodidad tiene una salida al lado.

esto lo cargamos nosotros

Una cuenta, sin consolas

Emitimos la credencial y pagamos la factura. El modelo lo sigue ejecutando OpenAI, Doubao o Soniox.

Una factura, medida

Nos ocupamos de la fontanería del pago y te cobramos lo que realmente usaste.

Modelos en la nube cuando hagan falta

La traducción más rápida y precisa disponible hoy, cuando la necesites.

Una app empaquetada

Compilaciones de escritorio y una extensión de navegador, en un par de clics.

esto siempre puedes hacerlo tú

Usa tu propia clave

Más de diez proveedores compatibles, cada uno con guía y capturas.

Paga al proveedor directamente

Déjanos completamente fuera. Sokuji funciona sin ninguna cuenta de Kizuna AI.

Ejecútalo en tu máquina

Inferencia local, gratis, capaz de funcionar sin red, y entregada como primera opción.

Compílalo desde el código

Clónalo, léelo, cámbialo, publica tu propia compilación. AGPL-3.0.

35+
idiomas de traducción
30
idiomas de la interfaz
9
sitios de reuniones en la extensión
10+
proveedores de IA, más tu propio endpoint

Tu audio no pasa por nosotros

Aunque la clave venga de tu cuenta de Kizuna AI, el audio va de tu dispositivo directo al proveedor que ejecuta el modelo; y si el modelo que elegiste es el local, no sale a ninguna parte. Nosotros emitimos la credencial y medimos el gasto, y lo único que guardamos de ti es una dirección de correo.

Todas las plataformas, y qué te pide cada una

Windows

Firmado, así que se instala sin los avisos de siempre, gracias a SignPath Foundation, que lo firma gratis. El enrutado usa VB-CABLE.

Descargar →

macOS

El controlador de audio viene con el instalador. La app no está firmada, así que Gatekeeper te detendrá: un proyecto gratuito no puede cargar con la cuota anual de Apple.

Descargar →

Linux

El micrófono virtual lo crea el propio Sokuji mediante PulseAudio o PipeWire: no hay nada más que instalar.

Descargar →

Si donaras una cuenta de Apple Developer para firmar y notarizar, la usaríamos → support@kizuna.ai

Por qué funciona así

Casi todas las preguntas que recibimos son en realidad preguntas sobre las decisiones detrás del producto. Aquí están, respondidas sin rodeos.

¿Os llega mi audio o el contenido de mis reuniones?

No. Tu audio va desde tu dispositivo directamente al proveedor de IA que elijas. Esto vale también cuando la clave viene de una cuenta de Kizuna AI: nosotros la emitimos y contamos el uso, y el proveedor hace el resto. El único dato de usuario que guardamos es una dirección de correo, para verificarte y conceder crédito de prueba.

¿Por qué debería creerlo?

En parte, no deberías — así que aquí está la línea. La app tiene licencia AGPL-3.0, y la app es la pieza que decide adónde va tu audio: está entera en github.com/kizuna-ai-lab/sokuji, puedes compilarla tú mismo y puedes observarla en la red. Nuestro servicio de cuentas no es de código abierto, así que lo que hace con una dirección de correo y un contador de uso es una promesa, no una prueba. Preferimos marcar esa línea a difuminarla.

¿Por qué la otra persona no tiene que instalar nada?

Porque creemos que cruzar un idioma es tarea de quien quiere que le entiendan, no de todos los que escuchan. Sokuji traduce de tu lado y habla por un micrófono virtual, así que a ellos les llega audio de llamada normal y corriente.

¿Puedo usarlo para traducir YouTube en tiempo real?

Puedes, y nada te lo impide — Sokuji traduce cualquier audio que llegue a tu máquina, un vídeo incluido. Sencillamente no es para lo que lo construimos. Un vídeo que ven cien mil personas, traducido en directo, es el mismo trabajo hecho cien mil veces; traducido una vez por quien lo publica, se hace una vez. Los creadores sí usan Sokuji para producir esas traducciones.

¿Tengo que usar vuestro servicio de IA?

No. Trae tu propia clave de cualquier proveedor compatible, apunta Sokuji a cualquier endpoint compatible con OpenAI, o ejecútalo en el dispositivo gratis. La cuenta de Kizuna AI existe para quien preferiría no lidiar con consolas de desarrollador, no para atar a nadie.

¿La IA local es solo un recurso para cuando no hay conexión?

No — es una vía de primera clase y siempre ha sido gratuita. Los modelos siguen encogiendo, los runtimes siguen mejorando y los aceleradores de consumo siguen acelerando. Nadie debería tener que entregar su conversación a una gran empresa de IA solo para usar IA.

¿Cuánto cuesta Sokuji?

Sokuji es libre y de código abierto, y la inferencia en el dispositivo es gratuita con él. Lo único que cuesta dinero es la cuenta opcional de Kizuna AI, y se mide por lo que realmente usas: nunca una suscripción mensual, y un mes tranquilo no cuesta nada. El saldo recargado vale un año: ese límite es contabilidad, no un empujón para gastar. Trae tu propia clave o ejecútalo en local y no nos pagas nada.

¿Por qué macOS me avisa y Windows no?

Ambas cosas se reducen a la firma de código, que cuesta dinero. Windows está firmado gracias a SignPath Foundation, que firma software libre sin coste. Apple no tiene un programa así y cobra una cuota anual de desarrollador que un proyecto sin ingresos no puede asumir: por eso la compilación de macOS no está firmada, Gatekeeper lo dice, y el rodeo está documentado en vez de escondido. Se agradecen donaciones de una cuenta de Apple Developer.

Habla tu propio idioma.
Que te oigan en el del otro.

libre y de código abierto · con IA en el dispositivo · sin suscripción