Zurück zu KI-Anbietern

Lokale (Offline) Einrichtungsanleitung

Überblick

Der lokale (Offline-)Modus ermöglicht die Ausführung von ASR (Automatische Spracherkennung), Übersetzung und TTS (Text-zu-Sprache) vollständig auf Ihrem Gerät. Kein API-Schlüssel, keine Internetverbindung erforderlich, und keine Daten verlassen Ihren Computer. Alles wird lokal mit WebAssembly und WebGPU verarbeitet.

Kein API-Schlüssel oder Internet erforderlich

Datenschutz zuerst — alle Audio- und Textdaten verbleiben auf Ihrem Gerät. Nach dem Herunterladen der Modelle funktioniert der lokale (Offline-)Modus vollständig ohne Internetverbindung. Ihre Gespräche verlassen nie Ihren Computer.

1„Lokal (Offline)" als Anbieter auswählen

Öffnen Sie Sokuji und navigieren Sie zum Einstellungsbereich. Wählen Sie „Lokal (Offline)" als Ihren KI-Anbieter aus dem Anbieter-Dropdown.

2Ein ASR-Modell herunterladen

Wählen Sie ein ASR-Modell für Ihre Quellsprache. Sokuji bietet 42 Offline-/Streaming-Modelle, angetrieben von sherpa-onnx WASM und WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), die über 99 Sprachen abdecken. Die Modellgrößen reichen von leicht (~5 MB) bis hochgenau (~2 GB+). Wir empfehlen Cohere Transcribe oder Voxtral Mini 4B Realtime für die beste Genauigkeit und Geschwindigkeit.

3Ein Übersetzungsmodell herunterladen

Wählen Sie ein Übersetzungssprachpaar. Wählen Sie TranslateGemma für beste Qualität und Geschwindigkeit, 74 Opus-MT-Sprachpaare für schnelle CPU-Übersetzung oder Qwen LLMs über WebGPU für mehrsprachige Übersetzung höherer Qualität.

4Ein TTS-Modell herunterladen

Laden Sie ein TTS-Modell für die Sprachausgabe herunter. 136 Modelle sind in 52 Sprachen verfügbar, angetrieben von den Engines Piper, Coqui, Mimic3 und Matcha.

5Übersetzung starten

Klicken Sie auf die Schaltfläche Sitzung starten. Keine Internetverbindung erforderlich — die Übersetzung erfolgt vollständig auf Ihrem Gerät in Echtzeit.

Zusätzliche Informationen

Was ist der lokale (Offline-)Modus?

Lokal (Offline) ist eine vollständig auf dem Gerät laufende KI-Übersetzungspipeline, die ASR, Übersetzung und TTS ohne Cloud-Dienste ausführt:

  • Vollständiger Datenschutz — alle Audio- und Textverarbeitung bleibt auf Ihrem Gerät
  • Funktioniert nach dem erstmaligen Modell-Download offline
  • Keine API-Schlüssel, Konten oder Abonnements erforderlich
  • Angetrieben von WebAssembly (WASM) und WebGPU für nahezu native Leistung
  • Kostenlose Nutzung ohne Nutzungsbeschränkungen

Verfügbare Modelle

Der lokale (Offline-)Modus unterstützt eine breite Palette von Modellen für jede Stufe der Übersetzungspipeline:

  • ASR: 42 Modelle einschließlich Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo und Zipformer — über 99 Sprachen abdeckend
  • Übersetzung: 74 Opus-MT-Sprachpaare für schnelle CPU-Übersetzung, plus TranslateGemma und Qwen LLMs über WebGPU für mehrsprachige Unterstützung
  • TTS: 136 Modelle in 52 Sprachen mit Piper-, Coqui-, Mimic3- und Matcha-Engines

Hardwareanforderungen

  • CPU (WASM): Funktioniert in jedem modernen Browser — keine spezielle Hardware erforderlich
  • WebGPU: Optionale GPU-Beschleunigung für Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma und Qwen-Übersetzungsmodelle — deutlich schneller mit dedizierter GPU
  • Empfohlen: 4 GB+ RAM für komfortables Laden der Modelle
  • Speicher: Modellgrößen von 5 MB bis 200+ MB je nach Genauigkeitsstufe
  • Moderner Browser erforderlich: Chrome 113+, Edge 113+ oder Firefox 120+ für WebGPU-Unterstützung

Modellkatalog

ASR (Spracherkennung) Modelle

Wählen Sie ein Spracherkennungsmodell basierend auf Ihrer Quellsprache, Genauigkeitsanforderungen und Hardwarefähigkeiten.

Offline-Modelle (CPU/WASM)

23 Modelle, die auf CPU über WebAssembly laufen. Kein GPU erforderlich. Beste Kompatibilität.

ModellSprachenGrößeGenauigkeitGeschwindigkeit
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

Streaming-Modelle (CPU/WASM)

10 Echtzeit-Streaming-Modelle. Transkribieren Sie beim Sprechen mit niedriger Latenz.

ModellSprachenGrößeGenauigkeitGeschwindigkeit
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

WebGPU-Modelle (GPU erforderlich)

9 durch WebGPU beschleunigte Modelle einschließlich Cohere Transcribe und Voxtral Mini 4B Realtime (empfohlen) plus Whisper. Beste Genauigkeit und Geschwindigkeit, erfordert eine kompatible GPU.

ModellSprachenGrößeGenauigkeitGeschwindigkeit
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

Übersetzungsmodelle

Wählen Sie TranslateGemma für beste Qualität und Geschwindigkeit, Opus-MT für schnelle CPU-Übersetzung oder Qwen LLM für breite mehrsprachige Abdeckung.

TranslateGemma 4B (WebGPU) — Empfohlen

Googles spezialisiertes Übersetzungsmodell mit der höchsten Qualität und schnellsten Geschwindigkeit unter allen lokalen Übersetzungsmodellen. Unterstützt 51 Sprachen mit bidirektionaler Übersetzung. WebGPU erforderlich.

ModellSprachenGrößeQualitätGeschwindigkeit
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM (WebGPU)

Große Sprachmodelle mit Unterstützung für 119–201+ Sprachen. Höhere Qualität, erfordert aber GPU. Am besten für flexible mehrsprachige Übersetzung.

ModellSprachenGrößeQualitätGeschwindigkeit
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT (CPU/WASM)

74 Sprachpaare, je ~110 MB. Schnell, leicht, läuft auf jedem Gerät. Am besten für unidirektionale Übersetzung.

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

TTS (Text-zu-Sprache) Modelle

136 Modelle in 52 Sprachen. Alle laufen auf CPU über WASM — kein GPU erforderlich. Angetrieben von Piper-, Coqui-, Mimic3-, VITS- und Matcha-Engines.

TTS-Einstellungen

  • Sprechgeschwindigkeit — Steuert die Wiedergabegeschwindigkeit der synthetisierten Sprache. Passen Sie den Geschwindigkeitsregler an, um die Ausgabe nach Ihren Wünschen schneller oder langsamer zu machen.
  • Sprecher-ID — Steuert die Klangfarbe der synthetisierten Sprache. Viele Modelle unterstützen mehrere Sprecher-IDs, jede mit einer anderen Stimme. Einige Multi-Sprecher-Modelle enthalten Stimmen verschiedener Geschlechter, sodass Sie durch Auswahl verschiedener Sprecher-IDs eine männliche oder weibliche Stimme wählen können.
SpracheModelleEngineSprecherGrößenbereich
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

Fehlerbehebung

Häufige Probleme

Modell-Download schlägt fehl: Überprüfen Sie Ihre Internetverbindung für den erstmaligen Download. Modelle werden lokal in IndexedDB zwischengespeichert, sodass nachfolgende Nutzungen offline funktionieren. Versuchen Sie, Browserdaten zu löschen, wenn Downloads beschädigt sind.

ASR erkennt keine Sprache: Stellen Sie sicher, dass Sie das richtige ASR-Modell für Ihre Quellsprache ausgewählt haben. Versuchen Sie ein größeres Modell für bessere Genauigkeit. Überprüfen Sie, ob Ihr Mikrofon funktioniert und die Berechtigungen erteilt wurden.

Übersetzungsqualität ist niedrig: Opus-MT-Modelle sind für Geschwindigkeit statt Qualität optimiert. Für bessere Ergebnisse versuchen Sie TranslateGemma oder Qwen LLM-Modelle, wenn Ihr Gerät WebGPU unterstützt. Stellen Sie sicher, dass Sie das richtige Sprachpaar ausgewählt haben.

WebGPU nicht verfügbar: WebGPU erfordert einen kompatiblen Browser und GPU. Wechseln Sie zu WASM-basierten Modellen (sherpa-onnx, Opus-MT), die in jedem modernen Browser ohne GPU-Anforderungen funktionieren.

Leistungstipps

  1. Verwenden Sie WebGPU-Modelle, wenn verfügbar, für deutlich schnellere Verarbeitung
  2. Schließen Sie andere Browser-Tabs, um Speicher für das Laden der Modelle freizugeben
  3. Wählen Sie kleinere Modelle für leistungsschwache Geräte oder wenn Geschwindigkeit Priorität hat
  4. WASM-Modelle (sherpa-onnx, Opus-MT) sind kompatibler, aber langsamer als WebGPU-Alternativen
  5. Überwachen Sie die Speichernutzung des Browsers — große Modelle können 2 GB+ Browserspeicher erfordern

Brauchen Sie weitere Hilfe? Besuchen Sie unser GitHub-Repository für Community-Support, Modellkompatibilitätsleitfäden und die neuesten Updates zu lokalen (Offline-)Funktionen.

GitHub Repository