サポートされているAIプロバイダー
Sokujiはリアルタイム音声翻訳のために複数のAIプロバイダーをサポートしています。各プロバイダーは異なる機能、モデル、価格体系を提供しています。ローカル(オフライン)モードはAPIキーもインターネットも不要で、デバイス上で完全に無料で動作します。
セットアップ手順
クラウドAIプロバイダーを使用するには、プロバイダーのウェブサイトからAPIキーを取得し、Sokujiの設定パネルで設定してください。ローカル(オフライン)モードはAPIキー不要 — モデルをダウンロードするだけで翻訳を開始できます。
OpenAI
リアルタイムオーディオAPI
- GPT-4o Realtime Previewモデル
- 8種類のプレミアム音声オプション
- 高度なターン検出モード
- 内蔵ノイズリダクション
- 60以上の言語をサポート
- カスタムプロンプト用テンプレートモード
Google Gemini
Gemini Live API
- Gemini 2.0 Flash Liveモデル
- 30種類のユニークな音声パーソナリティ
- 自動ターン検出
- 35以上の言語と地域バリアント
- 内蔵文字起こし
- 高トークン制限 (8192)
PalabraAI
WebRTC翻訳サービス
- リアルタイムWebRTC翻訳
- 60以上のソース言語
- 40以上のターゲット言語
- 低遅延ストリーミング
- 自動音声処理
- ライブ翻訳に特化
CometAPI
OpenAI互換API
同じ機能を持つOpenAI互換プロバイダー
- OpenAI Realtime API互換
- OpenAIと同じ音声とモデルオプション
- 代替価格体系
- 完全な機能対等
- OpenAIのドロップイン代替
OpenAI 互換 API
カスタムエンドポイント
OpenAI Realtime API 互換エンドポイントに対応
- OpenAI Realtime API 互換エンドポイント対応
- カスタムベース URL と API キー
- セルフホストおよびサードパーティサービス
- 柔軟なプロバイダー切り替え
- プライベートデプロイメントサポート
Doubao AST 2.0
音声から音声への翻訳
- エンドツーエンドの音声から音声への翻訳
- 自動音声クローニング
- 低遅延の同時通訳
- 中、英、日、インドネシア、西、葡、独、仏をサポート
- 自動およびプッシュ・トゥ・トークのターン検出
- ByteDanceクラウドインフラ
Soniox
音声から音声への翻訳
- リアルタイム音声から音声への翻訳
- 1回のAPI呼び出しで60以上の言語を文字起こしと翻訳
- 自動言語検出
- 12の多言語音声
- 音声翻訳または字幕のみ
- Sonioxクラウドインフラ
ローカル(オフライン)
オンデバイスAI(エッジ)
- 完全オフライン — APIキーもインターネットも不要
- 40以上のASRモデルで99以上の言語をカバー
- 55以上の翻訳言語ペア + Qwen LLM
- 53言語の136のTTSモデル
- CPU (WASM) とWebGPUアクセラレーション
- プライバシー最優先 — すべてのデータはデバイス上に保持
プロバイダーの選び方
OpenAI: 高品質な音声合成と高度な機能に最適
Gemini: 多言語サポートと自動処理に最適
PalabraAI: 最小限の遅延でリアルタイム翻訳に最適化
CometAPI: OpenAIと同等の機能を持つコスト効率の良い代替
OpenAI Compatible: カスタムエンドポイントで任意の OpenAI Realtime API 互換サービスに接続
Doubao AST 2.0: Doubaoの自動音声クローニング機能付き音声から音声への同時通訳
Soniox: 60以上の言語に対応した Soniox のリアルタイム音声から音声への翻訳、自動言語検出付き
Local Inference: デバイス上ですべてを実行し、データが外部に出ない — プライバシーを重視するユースケースに最適
お困りですか?
セットアップガイド、トラブルシューティング、プロバイダー比較については、GitHubリポジトリをご覧ください。 GitHub Repository