Cenários

O que você quer fazer?

São predefinições, não modos que prendem você: tudo o que elas configuram pode ser mudado depois.

O que cada um define

Cada um deles são as mesmas três decisões, respondidas de outro jeito: de quem é o áudio traduzido, se o resultado é falado em voz alta, e o que acaba na sua tela.

understand-others

Entender o que os outros dizem

Reuniões, aulas, palestras, vídeos, transmissões — leia uma tradução ao vivo do que você ouve. Nada é falado de volta.

Quem escolhe: Você é quem escuta, e quem fala não vai fazer meio caminho.

o que define
qual áudio
o outro lado
falado em voz alta
não
na tela
a tradução do que eles dizem
be-heard

Ser entendido numa reunião

Eles ouvem sua voz traduzida pelo microfone virtual e seguem falando normalmente — sem instalar nada, sem plugin, sem legenda para ler.

Quem escolhe: Quem fala num idioma que a sala não compartilha, numa chamada que não foi necessariamente ele quem marcou.

o que define
qual áudio
seu microfone
falado em voz alta
sim — uma voz sintética na chamada
na tela
suas palavras e a tradução juntas
subtitle-myself

Legendar a minha própria fala

Palestras, transmissões, apresentações — seu público lê legendas traduzidas enquanto você fala normalmente. Nenhuma voz sintética é gerada.

Quem escolhe: Palestrantes e streamers, onde uma segunda voz sobre a sua seria pior do que legendas.

o que define
qual áudio
seu microfone
falado em voz alta
não
na tela
a tradução, para o seu público
two-way-voice

Conversa nos dois sentidos

Eles ouvem sua voz traduzida; você lê legendas feitas do que eles dizem.

Quem escolhe: Uma conversa de verdade, em que nenhum dos lados compartilha um idioma.

o que define
qual áudio
os dois lados
falado em voz alta
sim — só o seu lado
na tela
original e tradução, os dois lados
two-way-text

Dois sentidos, só legendas

Legendas bilíngues e atas de reunião — os dois lados como texto, sem nenhuma voz sintética.

Quem escolhe: Reuniões gravadas, atas, ou qualquer sala onde acrescentar áudio não seria bem-vindo.

o que define
qual áudio
os dois lados
falado em voz alta
não
na tela
original e tradução, os dois lados

“Qualquer app” é literal. Na saída o Sokuji é um microfone comum, então qualquer coisa que deixe você escolher um pode levar sua voz traduzida — uma aba do navegador, um gravador, software de transmissão, um jogo. Na entrada ele trabalha com o que sua máquina estiver tocando, áudio do sistema incluído, então um vídeo, uma transmissão ou uma gravação se comportam exatamente como uma chamada.

Nem todo provedor dá conta de todos os cenários

Depende de uma única propriedade: se o provedor consegue produzir voz, e se dá para mantê-lo calado. Alguns devolvem só texto, então não conseguem falar o seu lado dentro da chamada. Outros sempre respondem com áudio, então não dá para limitá-los a legendas. O Sokuji verifica isso quando você escolhe o provedor, então um cenário que ele não atende fica fechado antes da chamada em vez de ser descoberto durante ela.

disponível · indisponível com esse provedor

devolve só textosempre falafaz os dois
Entender o que os outros dizem
Ser entendido numa reunião
Legendar a minha própria fala
Conversa nos dois sentidos
Dois sentidos, só legendas

Entender o que os outros dizem é o que funciona em todo lugar: aquele lado só vira texto, então se o provedor tem voz nem chega a ser questão.

Fale a sua própria língua.
Seja ouvido na língua do outro.

livre e de código aberto · com IA no dispositivo · sem assinatura