支持的 AI 提供商

Sokuji 支持多个 AI 提供商进行实时语音翻译。每个提供商提供不同的功能、模型和定价结构。本地(离线)模式无需 API 密钥或互联网 — 完全在您的设备上免费运行。

设置说明

要使用云端 AI 提供商,请从提供商网站获取 API 密钥,并在 Sokuji 设置面板中配置。本地(离线)模式无需 API 密钥 — 只需下载模型即可开始翻译。

OpenAI

实时音频 API
  • GPT-4o 实时预览模型
  • 8 种优质语音选项
  • 高级轮次检测模式
  • 内置降噪
  • 支持 60+ 种语言
  • 自定义提示模板模式

Google Gemini

Gemini Live API
  • Gemini 2.0 Flash Live 模型
  • 30 种独特语音个性
  • 自动轮次检测
  • 35+ 种语言及地区变体
  • 内置转录
  • 高 token 限制 (8192)

PalabraAI

WebRTC 翻译服务
  • 实时 WebRTC 翻译
  • 60+ 种源语言
  • 40+ 种目标语言
  • 低延迟流式传输
  • 自动音频处理
  • 专为实时翻译优化

CometAPI

OpenAI 兼容 API
与 OpenAI 兼容,具有相同功能
  • OpenAI 实时 API 兼容
  • 与 OpenAI 相同的语音和模型选项
  • 替代定价结构
  • 完整功能对等
  • OpenAI 的直接替代品

OpenAI 兼容 API

自定义端点
适用于任何 OpenAI Realtime API 兼容端点
  • 任何 OpenAI Realtime API 兼容端点
  • 自定义基础 URL 和 API 密钥
  • 自托管和第三方服务
  • 灵活的提供商切换
  • 私有部署支持

豆包同声传译 2.0

语音到语音翻译
  • 端到端语音到语音翻译
  • 自动声音克隆
  • 低延迟同声传译
  • 支持中、英、日、印尼、西、葡、德、法
  • 自动和按键说话轮次检测
  • 字节跳动云基础设施

Soniox

语音到语音翻译
  • 实时语音到语音翻译
  • 在单个 API 调用中转写并翻译 60+ 种语言
  • 自动语言检测
  • 12 个多语种音色
  • 朗读翻译或仅字幕
  • Soniox 云基础设施

本地(离线)

设备端 AI(边缘计算)
  • 完全离线 — 无需 API 密钥或互联网
  • 40+ 个 ASR 模型覆盖 99+ 种语言
  • 55+ 翻译语言对 + Qwen LLM
  • 136 个 TTS 模型覆盖 53 种语言
  • CPU (WASM) 和 WebGPU 加速
  • 隐私优先 — 所有数据保留在设备上

选择提供商

OpenAI: 最适合高质量语音合成和高级功能

Gemini: 非常适合多语言支持和自动处理

PalabraAI: 针对最小延迟的实时翻译优化

CometAPI: 具有相同功能的 OpenAI 经济替代方案

OpenAI Compatible: 通过自定义端点连接到任何 OpenAI Realtime API 兼容服务

Doubao AST 2.0: 豆包语音到语音同声传译服务,支持自动声音克隆

Soniox: Soniox 实时语音到语音翻译,覆盖 60 多种语言,支持自动语言检测

Local Inference: 完全在您的设备上运行,数据不离开您的设备 — 非常适合对隐私敏感的使用场景

需要帮助?

有关设置指南、故障排除和提供商比较,请访问我们的 GitHub 仓库。 GitHub Repository