Retour aux fournisseurs d'IA

Tutoriel de configuration locale (hors ligne)

Aperçu

Le mode Local (Hors ligne) vous permet d'exécuter l'ASR (Reconnaissance automatique de la parole), la traduction et le TTS (Synthèse vocale) entièrement sur votre appareil. Pas de clé API, pas de connexion Internet et aucune donnée ne quitte votre machine. Tout est traité localement via WebAssembly et WebGPU.

Aucune clé API ni Internet requis

Confidentialité d'abord — tous les fichiers audio et textes restent sur votre appareil. Après le téléchargement des modèles, le mode Local (Hors ligne) fonctionne complètement hors ligne. Vos conversations ne quittent jamais votre machine.

1Sélectionnez "Local (Hors ligne)" comme fournisseur

Ouvrez Sokuji et accédez au panneau de paramètres. Sélectionnez "Local (Hors ligne)" comme fournisseur d'IA dans le menu déroulant des fournisseurs.

2Téléchargez un modèle ASR

Choisissez un modèle ASR pour votre langue source. Sokuji propose 42 modèles hors ligne/streaming alimentés par sherpa-onnx WASM et WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), couvrant plus de 99 langues. Les modèles vont de légers (~5 Mo) à haute précision (~2 Go+). Nous recommandons Cohere Transcribe ou Voxtral Mini 4B Realtime pour la meilleure précision et vitesse.

3Téléchargez un modèle de traduction

Sélectionnez une paire de langues de traduction. Choisissez TranslateGemma pour la meilleure qualité et vitesse, 74 paires de langues Opus-MT pour une traduction CPU rapide, ou les LLM Qwen via WebGPU pour une traduction multilingue de meilleure qualité.

4Téléchargez un modèle TTS

Téléchargez un modèle TTS pour la sortie vocale. 136 modèles sont disponibles dans 52 langues, alimentés par les moteurs Piper, Coqui, Mimic3 et Matcha.

5Commencez à traduire

Cliquez sur le bouton Démarrer la session. Aucune connexion Internet n'est nécessaire — la traduction s'effectue entièrement sur votre appareil en temps réel.

Informations complémentaires

Qu'est-ce que le mode Local (Hors ligne) ?

Local (Hors ligne) est un pipeline de traduction IA entièrement sur l'appareil qui exécute l'ASR, la traduction et le TTS sans aucun service cloud :

  • Confidentialité complète — tout le traitement audio et texte reste sur votre appareil
  • Fonctionne hors ligne après le téléchargement initial du modèle
  • Aucune clé API, compte ou abonnement requis
  • Alimenté par WebAssembly (WASM) et WebGPU pour des performances proches du natif
  • Utilisation gratuite sans limites d'utilisation

Modèles disponibles

Le mode Local (Hors ligne) prend en charge une large gamme de modèles pour chaque étape du pipeline de traduction :

  • ASR : 42 modèles dont Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo et Zipformer — couvrant plus de 99 langues
  • Traduction : 74 paires de langues Opus-MT pour la traduction CPU rapide, plus TranslateGemma et les LLM Qwen via WebGPU pour le support multilingue
  • TTS : 136 modèles dans 52 langues utilisant les moteurs Piper, Coqui, Mimic3 et Matcha

Configuration matérielle requise

  • CPU (WASM) : Fonctionne sur tout navigateur moderne — aucun matériel spécial nécessaire
  • WebGPU : Accélération GPU optionnelle pour les modèles Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma et traduction Qwen — significativement plus rapide avec un GPU dédié
  • Recommandé : 4 Go+ de RAM pour un chargement confortable des modèles
  • Stockage : Les modèles vont de 5 Mo à 200 Mo+ selon le niveau de précision
  • Navigateur moderne requis : Chrome 113+, Edge 113+ ou Firefox 120+ pour le support WebGPU

Catalogue de modèles

Modèles ASR (Reconnaissance vocale)

Choisissez un modèle de reconnaissance vocale en fonction de votre langue source, de vos besoins de précision et de vos capacités matérielles.

Modèles hors ligne (CPU/WASM)

23 modèles fonctionnant sur CPU via WebAssembly. Aucun GPU requis. Meilleure compatibilité.

ModèleLanguesTaillePrécisionVitesse
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

Modèles en streaming (CPU/WASM)

10 modèles de streaming en temps réel. Transcrivez en parlant avec une faible latence.

ModèleLanguesTaillePrécisionVitesse
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

Modèles WebGPU (GPU requis)

9 modèles accélérés par WebGPU dont Cohere Transcribe et Voxtral Mini 4B Realtime (recommandés) plus Whisper. Meilleure précision et vitesse, nécessite un GPU compatible.

ModèleLanguesTaillePrécisionVitesse
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

Modèles de traduction

Choisissez TranslateGemma pour la meilleure qualité et vitesse, Opus-MT pour une traduction CPU rapide, ou Qwen LLM pour une large couverture multilingue.

TranslateGemma 4B (WebGPU) — Recommandé

Modèle de traduction spécialisé de Google offrant la meilleure qualité et la vitesse la plus rapide parmi tous les modèles de traduction locaux. Prend en charge 51 langues avec traduction bidirectionnelle. Nécessite WebGPU.

ModèleLanguesTailleQualitéVitesse
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM (WebGPU)

Grands modèles de langage prenant en charge 119–201+ langues. Qualité supérieure mais nécessite un GPU. Idéal pour la traduction multilingue flexible.

ModèleLanguesTailleQualitéVitesse
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT (CPU/WASM)

74 paires de langues, ~110 Mo chacune. Rapide, léger, fonctionne sur tout appareil. Idéal pour la traduction unidirectionnelle.

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

Modèles TTS (Synthèse vocale)

136 modèles dans 52 langues. Tous fonctionnent sur CPU via WASM — aucun GPU requis. Alimentés par les moteurs Piper, Coqui, Mimic3, VITS et Matcha.

Paramètres TTS

  • Vitesse de parole — Contrôle la vitesse de lecture de la parole synthétisée. Ajustez le curseur de vitesse pour rendre la sortie plus rapide ou plus lente selon vos préférences.
  • ID du locuteur — Contrôle le timbre vocal de la parole synthétisée. De nombreux modèles prennent en charge plusieurs ID de locuteur, chacun avec une voix différente. Certains modèles multi-locuteurs incluent des voix de genres différents, vous pouvez donc choisir une voix masculine ou féminine en sélectionnant différents ID de locuteur.
LangueModèlesMoteurLocuteursPlage de taille
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

Dépannage

Problèmes courants

Le téléchargement du modèle échoue: Vérifiez votre connexion Internet pour le téléchargement initial. Les modèles sont mis en cache localement dans IndexedDB, les utilisations suivantes fonctionnent donc hors ligne. Essayez de vider les données du navigateur si les téléchargements sont corrompus.

L'ASR ne reconnaît pas la parole: Assurez-vous d'avoir sélectionné le bon modèle ASR pour votre langue source. Essayez un modèle plus grand pour une meilleure précision. Vérifiez que votre microphone fonctionne et que les permissions sont accordées.

La qualité de traduction est faible: Les modèles Opus-MT sont optimisés pour la vitesse plutôt que la qualité. Pour de meilleurs résultats, essayez les modèles TranslateGemma ou Qwen LLM si votre appareil prend en charge WebGPU. Assurez-vous d'avoir sélectionné la bonne paire de langues.

WebGPU non disponible: WebGPU nécessite un navigateur et un GPU compatibles. Utilisez les modèles basés sur WASM (sherpa-onnx, Opus-MT) qui fonctionnent sur tout navigateur moderne sans exigences GPU.

Conseils de performance

  1. Utilisez les modèles WebGPU lorsqu'ils sont disponibles pour un traitement significativement plus rapide
  2. Fermez les autres onglets du navigateur pour libérer de la mémoire pour le chargement des modèles
  3. Choisissez des modèles plus petits pour les appareils bas de gamme ou lorsque la vitesse est prioritaire
  4. Les modèles WASM (sherpa-onnx, Opus-MT) sont plus compatibles mais plus lents que les alternatives WebGPU
  5. Surveillez l'utilisation de la mémoire du navigateur — les grands modèles peuvent nécessiter 2 Go+ de mémoire navigateur

Besoin d'aide supplémentaire ? Visitez notre dépôt GitHub pour le support communautaire, les guides de compatibilité des modèles et les dernières mises à jour sur les fonctionnalités Local (Hors ligne).

GitHub Repository