サポートされているAIプロバイダー

Sokujiはリアルタイム音声翻訳のために複数のAIプロバイダーをサポートしています。各プロバイダーは異なる機能、モデル、価格体系を提供しています。ローカル(オフライン)モードはAPIキーもインターネットも不要で、デバイス上で完全に無料で動作します。

セットアップ手順

クラウドAIプロバイダーを使用するには、プロバイダーのウェブサイトからAPIキーを取得し、Sokujiの設定パネルで設定してください。ローカル(オフライン)モードはAPIキー不要 — モデルをダウンロードするだけで翻訳を開始できます。

OpenAI

リアルタイムオーディオAPI
  • GPT-4o Realtime Previewモデル
  • 8種類のプレミアム音声オプション
  • 高度なターン検出モード
  • 内蔵ノイズリダクション
  • 60以上の言語をサポート
  • カスタムプロンプト用テンプレートモード

Google Gemini

Gemini Live API
  • Gemini 2.0 Flash Liveモデル
  • 30種類のユニークな音声パーソナリティ
  • 自動ターン検出
  • 35以上の言語と地域バリアント
  • 内蔵文字起こし
  • 高トークン制限 (8192)

PalabraAI

WebRTC翻訳サービス
  • リアルタイムWebRTC翻訳
  • 60以上のソース言語
  • 40以上のターゲット言語
  • 低遅延ストリーミング
  • 自動音声処理
  • ライブ翻訳に特化

CometAPI

OpenAI互換API
同じ機能を持つOpenAI互換プロバイダー
  • OpenAI Realtime API互換
  • OpenAIと同じ音声とモデルオプション
  • 代替価格体系
  • 完全な機能対等
  • OpenAIのドロップイン代替

OpenAI 互換 API

カスタムエンドポイント
OpenAI Realtime API 互換エンドポイントに対応
  • OpenAI Realtime API 互換エンドポイント対応
  • カスタムベース URL と API キー
  • セルフホストおよびサードパーティサービス
  • 柔軟なプロバイダー切り替え
  • プライベートデプロイメントサポート

Doubao AST 2.0

音声から音声への翻訳
  • エンドツーエンドの音声から音声への翻訳
  • 自動音声クローニング
  • 低遅延の同時通訳
  • 中、英、日、インドネシア、西、葡、独、仏をサポート
  • 自動およびプッシュ・トゥ・トークのターン検出
  • ByteDanceクラウドインフラ

Soniox

音声から音声への翻訳
  • リアルタイム音声から音声への翻訳
  • 1回のAPI呼び出しで60以上の言語を文字起こしと翻訳
  • 自動言語検出
  • 12の多言語音声
  • 音声翻訳または字幕のみ
  • Sonioxクラウドインフラ

ローカル(オフライン)

オンデバイスAI(エッジ)
  • 完全オフライン — APIキーもインターネットも不要
  • 40以上のASRモデルで99以上の言語をカバー
  • 55以上の翻訳言語ペア + Qwen LLM
  • 53言語の136のTTSモデル
  • CPU (WASM) とWebGPUアクセラレーション
  • プライバシー最優先 — すべてのデータはデバイス上に保持

プロバイダーの選び方

OpenAI: 高品質な音声合成と高度な機能に最適

Gemini: 多言語サポートと自動処理に最適

PalabraAI: 最小限の遅延でリアルタイム翻訳に最適化

CometAPI: OpenAIと同等の機能を持つコスト効率の良い代替

OpenAI Compatible: カスタムエンドポイントで任意の OpenAI Realtime API 互換サービスに接続

Doubao AST 2.0: Doubaoの自動音声クローニング機能付き音声から音声への同時通訳

Soniox: 60以上の言語に対応した Soniox のリアルタイム音声から音声への翻訳、自動言語検出付き

Local Inference: デバイス上ですべてを実行し、データが外部に出ない — プライバシーを重視するユースケースに最適

お困りですか?

セットアップガイド、トラブルシューティング、プロバイダー比較については、GitHubリポジトリをご覧ください。 GitHub Repository