用自己的语言说。
以对方的语言被听懂。

你的声音以对方的语言传出去,对方说的话以你的语言作为字幕回来。Sokuji 是你与会议软件之间的一只虚拟麦克风,所以要设置的只有你这一边——对方照常说话,不用装任何东西,也不用点任何链接。

免费开源 · 端侧 AI · 无订阅
Sokuji

装应用,或者给浏览器加个扩展

桌面应用不绑定支持网站清单。它在系统里注册成一个普通麦克风,所以凡是能选麦克风的软件都能用。

桌面应用 — 系统级

Sokuji 在操作系统里就是一个普通麦克风。会议软件、浏览器、录音工具、直播软件、游戏——只要能选麦克风,就能听到你的译文语音。

反方向不需要任何人许可:Sokuji 读的是本机正在播放的声音,系统音也算,所以视频、直播、录音和通话一样能出字幕。

Linux / 内置支持,基于 PulseAudio 或 PipeWire
macOS / 驱动随应用一同安装 · Windows / 通过 VB-CABLE

浏览器扩展

系统里什么都不装,也不用配置音频路由。为它支持的会议网站专门做的。

Zoom · Google Meet · Microsoft Teams · Slack · Discord · Jitsi Meet · Whereby · Gather · Yandex Telemost

在这些页面里,你的译文语音以麦克风的形式交给网站,标签页自己的声音则被译回来。其他任何地方——别的应用、浏览器之外的视频、系统音——归桌面应用管。

你想做什么?

Sokuji 的设计前提是:跨越语言的成本,该由想被听懂的那个人来承担。我们最先做的就是这件事。但你并不总是那个人——有时你是在听讲座、在放一段录音,或者在别人开的会里。

听懂对方在说什么

会议、课堂、演讲、视频、直播——把你听到的内容实时读成译文。

对方说 → 你读

给自己的发言配字幕

演讲、直播、汇报——听众读翻译字幕,不用合成语音。

你说 → 对方读

双向对话

对方听到你的译文语音,你读对方发言的字幕。

双向 · 出去是语音,回来是文字

双向,仅字幕

双语字幕与会议记录——两边都是文字,完全不用合成语音。

双向 · 只有文字

通话过程中它在做什么

把语音丢给模型谁都会。难的是让它在整场会议里一直可听懂——跟得上节奏、判断你话说完了没有、不把你自己的声音又送回去——这是音频工程。

用你自己的声音

录一段短音频,译出的语音就带着你的声音而不是通用音色,也可以从提供商的音色库里挑。能选哪些音色取决于你在用哪家。

语速自适应

同一句话在不同语言里长度不同,固定语速下译文会一句比一句落后。Sokuji 只把语速提到刚好跟上的程度。

按语义断句

它等的是一个完整的意思,而不只是一次停顿——所以你不会被从句子中间切断。

你的说法,你的术语

系统指令会保住人名、产品名和内部行话,不让它们被译成一团糊。

字幕浮层

可以是一个能拖动、能缩放的独立窗口,也可以是盖在会议页面上的字幕。

断网也能用

Sokuji 检测你的 GPU,下载为它构建的推理引擎,在你自己的机器上完成识别、翻译和合成——无密钥、无账号、无计量。 在这里,端侧是一等公民,而不是断网时的备胎。

此外还有:按住即译、降噪、回声消除、部分转写即时翻译、音频缓冲调节、会话进行中切换音频设备、虚拟麦克风本身,以及把对话导出为 .txt 或 .json。

我们替你扛的,和留在你手里的

Sokuji 免费、开源,并且会一直如此。另一件相互独立的事是:Kizuna AI 账号可以替你保管几家 AI 厂商的密钥并结算账单——给不想折腾开发者控制台的人用。模型不是我们跑的,而且这项服务你可能一次都用不上。每一处便利旁边,都留着出口。

这些由我们扛

一个账号,不碰控制台

我们发放凭证并结算账单。跑模型的仍然是 OpenAI、Doubao 或 Soniox。

一份账单,按量计费

支付那套管道由我们接手,按你实际用掉的量收费。

需要时用云端模型

当下最快、最准的翻译,需要时才用。

打包好的应用

桌面版和浏览器扩展,几次点击就装好。

这些你随时可以自己来

用你自己的密钥

支持十余家提供商,每家都有配图的操作步骤。

直接付给提供商

完全把我们排除在外。没有 Kizuna AI 账号,Sokuji 照样能用。

在自己的机器上跑

本地推理,免费,可离线,并且是作为首选内置的。

从源码构建

克隆、阅读、修改、发布你自己的构建版本。AGPL-3.0。

35+
可翻译语言
30
界面语言
9
扩展支持的会议网站
10+
AI 服务商,也可指向自建端点

你的音频不经过我们

即使密钥来自你的 Kizuna AI 账号,音频也是从你的设备直接去运行模型的厂商——如果你选的是本地模型,它根本不出这台机器。我们做的只是发放凭证和计量用量,保存的只有一个邮箱地址。

每个平台,以及各自需要你做什么

Windows

已做代码签名,安装时不会弹出常见的警告——这要感谢免费为它签名的 SignPath Foundation。音频走 VB-CABLE。

下载 →

macOS

音频驱动随安装程序一起提供。应用本身未签名,所以 Gatekeeper 会拦你一下——一个免费项目扛不起 Apple 的年费。

下载 →

Linux

虚拟麦克风由 Sokuji 自己通过 PulseAudio 或 PipeWire 创建——不用再装别的。

下载 →

如果你愿意捐赠一个用于签名与公证的 Apple Developer 账号,我们会用上 → support@kizuna.ai

为什么是这样设计的

我们收到的问题,大多其实是在问产品背后的取舍。这里直说。

你们会拿到我的音频或会议内容吗?

不会。音频从你的设备直接发往你选定的 AI 服务商。即使密钥来自 Kizuna AI 账号也一样:我们只负责签发密钥和计量用量,其余都由服务商完成。我们保存的用户数据只有一个邮箱地址,用于验证你的身份和发放试用额度。

凭什么相信这一点?

有一半你不该相信——所以我们把界线画出来。应用采用 AGPL-3.0 许可,而决定音频去向的正是这个应用:全部代码在 github.com/kizuna-ai-lab/sokuji,你可以自己构建,也可以在网络层面亲自查看。我们的账号服务不开源,所以它如何处理一个邮箱地址和一个用量计数,是承诺,不是证明。这条线我们宁愿标出来,也不愿把它抹糊。

为什么对方什么都不用装?

因为我们认为,跨越语言是想被听懂的那个人的事,而不是所有听众的事。Sokuji 在你这一侧翻译,并通过虚拟麦克风说出来,所以传到对方那里的只是一段普通的通话音频。

能用它实时翻译 YouTube 吗?

可以,也没什么拦着你——Sokuji 会翻译任何传到你机器上的声音,视频也一样。只是我们不为这个场景而做。一个十万人看的视频,每人各自实时翻译一遍,等于同一件事做了十万次;由发布者翻译一次,就只做一次。创作者确实会用 Sokuji 来做这份翻译。

我必须用你们的 AI 服务吗?

不必。你可以自带任一受支持服务商的密钥,可以把 Sokuji 指向任何 OpenAI 兼容端点,也可以在本机免费运行。Kizuna AI 账号只是给不想折腾开发者控制台的人用的,不是为了把谁锁住。

本地 AI 只是断网时的备胎吗?

不是。它一开始就是一等公民,而且一直免费。模型在变小,运行时在变好,消费级加速器在变快。没有谁该为了用上 AI,就把自己的对话交给一家大型 AI 公司。

Sokuji 要多少钱?

Sokuji 免费且开源,端侧推理也随之免费。唯一要花钱的是可选的 Kizuna AI 账号,按实际用量计费——从不是月度订阅,没用的月份就是零。充值余额有效期一年:这个期限是记账需要,不是催你花钱。自带密钥或在本机运行,你不会付给我们任何费用。

为什么 macOS 会弹警告,Windows 不会?

两者都归结于代码签名,而签名要花钱。Windows 已签名,要感谢免费为自由软件签名的 SignPath Foundation。Apple 没有这样的项目,而且收年费,一个没有收入的项目扛不起——所以 macOS 版没有签名,Gatekeeper 会这么说,绕过的办法我们写在文档里而不是藏起来。欢迎捐赠 Apple Developer 账号。

用自己的语言说。
以对方的语言被听懂。

免费开源 · 含端侧 AI · 无订阅