Lokale (Offline) Einrichtungsanleitung
Überblick
Der lokale (Offline-)Modus ermöglicht die Ausführung von ASR (Automatische Spracherkennung), Übersetzung und TTS (Text-zu-Sprache) vollständig auf Ihrem Gerät. Kein API-Schlüssel, keine Internetverbindung erforderlich, und keine Daten verlassen Ihren Computer. Alles wird lokal mit WebAssembly und WebGPU verarbeitet.
Kein API-Schlüssel oder Internet erforderlich
Datenschutz zuerst — alle Audio- und Textdaten verbleiben auf Ihrem Gerät. Nach dem Herunterladen der Modelle funktioniert der lokale (Offline-)Modus vollständig ohne Internetverbindung. Ihre Gespräche verlassen nie Ihren Computer.
1„Lokal (Offline)" als Anbieter auswählen
Öffnen Sie Sokuji und navigieren Sie zum Einstellungsbereich. Wählen Sie „Lokal (Offline)" als Ihren KI-Anbieter aus dem Anbieter-Dropdown.
2Ein ASR-Modell herunterladen
Wählen Sie ein ASR-Modell für Ihre Quellsprache. Sokuji bietet 42 Offline-/Streaming-Modelle, angetrieben von sherpa-onnx WASM und WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), die über 99 Sprachen abdecken. Die Modellgrößen reichen von leicht (~5 MB) bis hochgenau (~2 GB+). Wir empfehlen Cohere Transcribe oder Voxtral Mini 4B Realtime für die beste Genauigkeit und Geschwindigkeit.
3Ein Übersetzungsmodell herunterladen
Wählen Sie ein Übersetzungssprachpaar. Wählen Sie TranslateGemma für beste Qualität und Geschwindigkeit, 74 Opus-MT-Sprachpaare für schnelle CPU-Übersetzung oder Qwen LLMs über WebGPU für mehrsprachige Übersetzung höherer Qualität.
4Ein TTS-Modell herunterladen
Laden Sie ein TTS-Modell für die Sprachausgabe herunter. 136 Modelle sind in 52 Sprachen verfügbar, angetrieben von den Engines Piper, Coqui, Mimic3 und Matcha.
5Übersetzung starten
Klicken Sie auf die Schaltfläche Sitzung starten. Keine Internetverbindung erforderlich — die Übersetzung erfolgt vollständig auf Ihrem Gerät in Echtzeit.
Zusätzliche Informationen
Was ist der lokale (Offline-)Modus?
Lokal (Offline) ist eine vollständig auf dem Gerät laufende KI-Übersetzungspipeline, die ASR, Übersetzung und TTS ohne Cloud-Dienste ausführt:
- Vollständiger Datenschutz — alle Audio- und Textverarbeitung bleibt auf Ihrem Gerät
- Funktioniert nach dem erstmaligen Modell-Download offline
- Keine API-Schlüssel, Konten oder Abonnements erforderlich
- Angetrieben von WebAssembly (WASM) und WebGPU für nahezu native Leistung
- Kostenlose Nutzung ohne Nutzungsbeschränkungen
Verfügbare Modelle
Der lokale (Offline-)Modus unterstützt eine breite Palette von Modellen für jede Stufe der Übersetzungspipeline:
- ASR: 42 Modelle einschließlich Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo und Zipformer — über 99 Sprachen abdeckend
- Übersetzung: 74 Opus-MT-Sprachpaare für schnelle CPU-Übersetzung, plus TranslateGemma und Qwen LLMs über WebGPU für mehrsprachige Unterstützung
- TTS: 136 Modelle in 52 Sprachen mit Piper-, Coqui-, Mimic3- und Matcha-Engines
Hardwareanforderungen
- CPU (WASM): Funktioniert in jedem modernen Browser — keine spezielle Hardware erforderlich
- WebGPU: Optionale GPU-Beschleunigung für Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma und Qwen-Übersetzungsmodelle — deutlich schneller mit dedizierter GPU
- Empfohlen: 4 GB+ RAM für komfortables Laden der Modelle
- Speicher: Modellgrößen von 5 MB bis 200+ MB je nach Genauigkeitsstufe
- Moderner Browser erforderlich: Chrome 113+, Edge 113+ oder Firefox 120+ für WebGPU-Unterstützung
Modellkatalog
ASR (Spracherkennung) Modelle
Wählen Sie ein Spracherkennungsmodell basierend auf Ihrer Quellsprache, Genauigkeitsanforderungen und Hardwarefähigkeiten.
Offline-Modelle (CPU/WASM)
23 Modelle, die auf CPU über WebAssembly laufen. Kein GPU erforderlich. Beste Kompatibilität.
| Modell | Sprachen | Größe | Genauigkeit | Geschwindigkeit |
|---|---|---|---|---|
| SenseVoice (int8) | zh, en, ja, ko, yue | 238 MB | ★★★★☆ | ★★★★☆ |
| SenseVoice Nano (int8) | zh, en, ja, ko, yue | 265 MB | ★★★★★ | ★★★☆☆ |
| Moonshine Tiny EN (q) | en | 45 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny JA (q) | ja | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny KO (q) | ko | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Base ZH (q) | zh | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base JA (q) | ja | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base ES (q) | es | 66 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base AR (q) | ar | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base UK (q) | uk | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base VI (q) | vi | 142 MB | ★★★★☆ | ★★★★☆ |
| NeMo Canary (int8) | en, es, de, fr | 208 MB | ★★★★☆ | ★★★☆☆ |
| NeMo FastConformer Multi | be, de, en, es, fr, hr, it, pl, ru, uk | 133 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer DE | de | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer ES | es | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer PT | pt | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo Parakeet TDT 0.6B (int8) | 25 EU languages | 671 MB | ★★★★★ | ★★★☆☆ |
| Dolphin Base CTC Multi | zh, ja, ko, th, vi, ar, hi, bn, ru | 105 MB | ★★★★☆ | ★★★★☆ |
| Whisper Tiny (ONNX) | 99+ languages | 154 MB | ★★★☆☆ | ★★☆☆☆ |
| WenetSpeech Yue U2++ | zh, yue, en | 135 MB | ★★★★☆ | ★★★★☆ |
| Omnilingual 300M v2 | 1147 languages | 367 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer RU (int8) | ru | 74 MB | ★★★★☆ | ★★★★☆ |
| Zipformer VI 30M (int8) | vi | 35 MB | ★★★☆☆ | ★★★★★ |
Streaming-Modelle (CPU/WASM)
10 Echtzeit-Streaming-Modelle. Transkribieren Sie beim Sprechen mit niedriger Latenz.
| Modell | Sprachen | Größe | Genauigkeit | Geschwindigkeit |
|---|---|---|---|---|
| Zipformer EN Kroko | en | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer FR Kroko | fr | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer DE Kroko | de | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ES Kroko | es | 156 MB | ★★★☆☆ | ★★★★☆ |
| Zipformer ZH (int8) | zh | 77 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ZH 2025 (int8) | zh | 167 MB | ★★★★☆ | ★★★★☆ |
| Zipformer RU Vosk (int8) | ru | 29 MB | ★★★☆☆ | ★★★★★ |
| Zipformer Multi (8 lang) | ar, en, id, ja, ru, th, vi, zh | 339 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer BN Vosk | bn | 94 MB | ★★★☆☆ | ★★★★☆ |
| NeMo CTC EN 80ms (int8) | en | 132 MB | ★★★★☆ | ★★★★★ |
WebGPU-Modelle (GPU erforderlich)
9 durch WebGPU beschleunigte Modelle einschließlich Cohere Transcribe und Voxtral Mini 4B Realtime (empfohlen) plus Whisper. Beste Genauigkeit und Geschwindigkeit, erfordert eine kompatible GPU.
| Modell | Sprachen | Größe | Genauigkeit | Geschwindigkeit |
|---|---|---|---|---|
| Cohere Transcribe (q4) | 14 languages | ~2.1 GB | ★★★★★ | ★★★★☆ |
| Cohere Transcribe (q4f16) | 14 languages | ~1.5 GB | ★★★★★ | ★★★★☆ |
| Voxtral Mini 4B Realtime | 13 languages | ~2.3 GB | ★★★★★ | ★★★★★ |
| Whisper Tiny EN | en | 120 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Tiny | 99+ languages | 122 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Base | 99+ languages | 208 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Small | 99+ languages | 586 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Medium | 99+ languages | 680 MB | ★★★★★ | ★★☆☆☆ |
| Whisper Large V3 Turbo | 99+ languages | 759 MB | ★★★★★ | ★★☆☆☆ |
Übersetzungsmodelle
Wählen Sie TranslateGemma für beste Qualität und Geschwindigkeit, Opus-MT für schnelle CPU-Übersetzung oder Qwen LLM für breite mehrsprachige Abdeckung.
TranslateGemma 4B (WebGPU) — Empfohlen
Googles spezialisiertes Übersetzungsmodell mit der höchsten Qualität und schnellsten Geschwindigkeit unter allen lokalen Übersetzungsmodellen. Unterstützt 51 Sprachen mit bidirektionaler Übersetzung. WebGPU erforderlich.
| Modell | Sprachen | Größe | Qualität | Geschwindigkeit |
|---|---|---|---|---|
| TranslateGemma 4B (q4) | 51 languages | ~3.1 GB | ★★★★★ | ★★★★★ |
| TranslateGemma 4B (q4f16) | 51 languages | ~2.7 GB | ★★★★★ | ★★★★★ |
Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu
Qwen LLM (WebGPU)
Große Sprachmodelle mit Unterstützung für 119–201+ Sprachen. Höhere Qualität, erfordert aber GPU. Am besten für flexible mehrsprachige Übersetzung.
| Modell | Sprachen | Größe | Qualität | Geschwindigkeit |
|---|---|---|---|---|
| Qwen 2.5 0.5B | 28 languages | ~400 MB | ★★★☆☆ | ★★★★☆ |
| Qwen 3 0.6B | 119+ languages | 919 MB | ★★★★☆ | ★★★☆☆ |
| Qwen 3.5 0.8B | 201+ languages | ~1.6 GB | ★★★★★ | ★★☆☆☆ |
| Qwen 3.5 2B | 201+ languages | ~1.8 GB | ★★★★★ | ★☆☆☆☆ |
Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans
Qwen 3/3.5: 119–201+ languages (multilingual)
Opus-MT (CPU/WASM)
74 Sprachpaare, je ~110 MB. Schnell, leicht, läuft auf jedem Gerät. Am besten für unidirektionale Übersetzung.
| src ↓ tgt → | en | ja | zh | ko | de | fr | es | it | ru | ar | hi | vi | tr | uk | pt | nl | pl | da | sv | fi | cs | ro | hu | id | no | et | th | af | xh |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| en | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||
| ja | ✓ | ||||||||||||||||||||||||||||
| zh | ✓ | ||||||||||||||||||||||||||||
| ko | ✓ | ||||||||||||||||||||||||||||
| de | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| fr | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| es | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| it | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| ru | ✓ | ✓ | ✓ | ✓ | |||||||||||||||||||||||||
| ar | ✓ | ||||||||||||||||||||||||||||
| hi | ✓ | ||||||||||||||||||||||||||||
| vi | ✓ | ||||||||||||||||||||||||||||
| tr | ✓ | ||||||||||||||||||||||||||||
| uk | ✓ | ✓ | |||||||||||||||||||||||||||
| pt | |||||||||||||||||||||||||||||
| nl | ✓ | ✓ | |||||||||||||||||||||||||||
| pl | ✓ | ||||||||||||||||||||||||||||
| da | ✓ | ✓ | |||||||||||||||||||||||||||
| sv | ✓ | ||||||||||||||||||||||||||||
| fi | ✓ | ✓ | |||||||||||||||||||||||||||
| cs | ✓ | ||||||||||||||||||||||||||||
| ro | ✓ | ✓ | |||||||||||||||||||||||||||
| hu | ✓ | ||||||||||||||||||||||||||||
| id | ✓ | ||||||||||||||||||||||||||||
| no | ✓ | ||||||||||||||||||||||||||||
| et | ✓ | ||||||||||||||||||||||||||||
| th | ✓ | ||||||||||||||||||||||||||||
| af | ✓ | ||||||||||||||||||||||||||||
| xh | ✓ |
TTS (Text-zu-Sprache) Modelle
136 Modelle in 52 Sprachen. Alle laufen auf CPU über WASM — kein GPU erforderlich. Angetrieben von Piper-, Coqui-, Mimic3-, VITS- und Matcha-Engines.
TTS-Einstellungen
- Sprechgeschwindigkeit — Steuert die Wiedergabegeschwindigkeit der synthetisierten Sprache. Passen Sie den Geschwindigkeitsregler an, um die Ausgabe nach Ihren Wünschen schneller oder langsamer zu machen.
- Sprecher-ID — Steuert die Klangfarbe der synthetisierten Sprache. Viele Modelle unterstützen mehrere Sprecher-IDs, jede mit einer anderen Stimme. Einige Multi-Sprecher-Modelle enthalten Stimmen verschiedener Geschlechter, sodass Sie durch Auswahl verschiedener Sprecher-IDs eine männliche oder weibliche Stimme wählen können.
| Sprache | Modelle | Engine | Sprecher | Größenbereich |
|---|---|---|---|---|
| af | 1 | mimic3 | 1 | ~94 MB |
| ar | 2 | piper | 1 | 81–95 MB |
| bg | 1 | coqui | 1 | ~71 MB |
| bn | 2 | mimic3, coqui | 1 | 71–94 MB |
| ca | 3 | piper | 1 | 39–95 MB |
| cs | 2 | piper | 1 | 81–95 MB |
| cy | 2 | piper | 1–7 | ~95 MB |
| da | 1 | piper | 1 | ~95 MB |
| de | 8 | piper | 1 | 39–81 MB |
| el | 2 | piper, mimic3 | 1 | 81–94 MB |
| en | 13 | piper | 1–904 | 81–97 MB |
| es | 6 | piper | 1–2 | 39–95 MB |
| et | 1 | coqui | 1 | ~71 MB |
| fa | 8 | piper, mimic3, matcha | 1 | 81–146 MB |
| fi | 2 | piper | 1 | 81–95 MB |
| fr | 8 | piper | 1–16 | 39–95 MB |
| ga | 1 | coqui | 1 | ~71 MB |
| gu | 1 | mimic3 | 1 | ~94 MB |
| hi | 3 | piper | 1 | ~95 MB |
| hr | 1 | coqui | 1 | ~71 MB |
| hu | 3 | piper | 1 | ~95 MB |
| id | 1 | piper | 1 | ~95 MB |
| is | 4 | piper | 1 | ~95 MB |
| it | 2 | piper | 1 | 39–95 MB |
| ka | 1 | piper | 1 | ~95 MB |
| kk | 3 | piper | 1+ | 39–81 MB |
| ko | 1 | mimic3 | 1 | ~94 MB |
| lb | 1 | piper | 1 | ~95 MB |
| lt | 1 | coqui | 1 | ~71 MB |
| lv | 1 | piper | 1 | ~95 MB |
| ml | 2 | piper | 1 | ~95 MB |
| mt | 1 | coqui | 1 | ~71 MB |
| ne | 3 | piper | 1+ | 39–95 MB |
| nl | 4 | piper | 1 | 39–95 MB |
| no | 1 | piper | 1 | ~95 MB |
| pl | 7 | piper | 1 | ~95 MB |
| pt | 4 | piper | 1 | 81–95 MB |
| ro | 1 | piper | 1 | ~95 MB |
| ru | 4 | piper | 1 | ~95 MB |
| sk | 1 | piper | 1 | ~95 MB |
| sl | 1 | piper | 1 | ~95 MB |
| sr | 1 | piper | multi | ~95 MB |
| sv | 2 | piper | 1+ | ~95 MB |
| sw | 1 | piper | 1 | ~95 MB |
| tn | 1 | mimic3 | multi | ~94 MB |
| tr | 3 | piper | 1 | ~95 MB |
| uk | 2 | piper | 1+ | 39–95 MB |
| vi | 4 | piper, mimic3 | 1–65 | 46–95 MB |
| yue | 1 | vits | 1 | ~114 MB |
| zh | 3 | vits, piper, matcha | 1–218 | 81–213 MB |
Fehlerbehebung
Häufige Probleme
Modell-Download schlägt fehl: Überprüfen Sie Ihre Internetverbindung für den erstmaligen Download. Modelle werden lokal in IndexedDB zwischengespeichert, sodass nachfolgende Nutzungen offline funktionieren. Versuchen Sie, Browserdaten zu löschen, wenn Downloads beschädigt sind.
ASR erkennt keine Sprache: Stellen Sie sicher, dass Sie das richtige ASR-Modell für Ihre Quellsprache ausgewählt haben. Versuchen Sie ein größeres Modell für bessere Genauigkeit. Überprüfen Sie, ob Ihr Mikrofon funktioniert und die Berechtigungen erteilt wurden.
Übersetzungsqualität ist niedrig: Opus-MT-Modelle sind für Geschwindigkeit statt Qualität optimiert. Für bessere Ergebnisse versuchen Sie TranslateGemma oder Qwen LLM-Modelle, wenn Ihr Gerät WebGPU unterstützt. Stellen Sie sicher, dass Sie das richtige Sprachpaar ausgewählt haben.
WebGPU nicht verfügbar: WebGPU erfordert einen kompatiblen Browser und GPU. Wechseln Sie zu WASM-basierten Modellen (sherpa-onnx, Opus-MT), die in jedem modernen Browser ohne GPU-Anforderungen funktionieren.
Leistungstipps
- Verwenden Sie WebGPU-Modelle, wenn verfügbar, für deutlich schnellere Verarbeitung
- Schließen Sie andere Browser-Tabs, um Speicher für das Laden der Modelle freizugeben
- Wählen Sie kleinere Modelle für leistungsschwache Geräte oder wenn Geschwindigkeit Priorität hat
- WASM-Modelle (sherpa-onnx, Opus-MT) sind kompatibler, aber langsamer als WebGPU-Alternativen
- Überwachen Sie die Speichernutzung des Browsers — große Modelle können 2 GB+ Browserspeicher erfordern
Brauchen Sie weitere Hilfe? Besuchen Sie unser GitHub-Repository für Community-Support, Modellkompatibilitätsleitfäden und die neuesten Updates zu lokalen (Offline-)Funktionen.