Tutorial di configurazione locale (offline)
Panoramica
La modalità Locale (Offline) consente di eseguire ASR (Riconoscimento Automatico del Parlato), traduzione e TTS (Sintesi Vocale) interamente sul proprio dispositivo. Nessuna chiave API, nessuna connessione Internet e nessun dato lascia il computer. Tutto viene elaborato localmente utilizzando WebAssembly e WebGPU.
Nessuna chiave API o Internet richiesti
Privacy prima di tutto — tutti gli audio e i testi rimangono sul tuo dispositivo. Dopo aver scaricato i modelli, la modalità Locale (Offline) funziona completamente offline. Le tue conversazioni non lasciano mai il tuo computer.
1Seleziona "Locale (Offline)" come provider
Apri Sokuji e naviga al pannello delle impostazioni. Seleziona "Locale (Offline)" come provider di IA dal menu a tendina dei provider.
2Scarica un modello ASR
Scegli un modello ASR per la tua lingua di origine. Sokuji offre 42 modelli offline/streaming alimentati da sherpa-onnx WASM e WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), che coprono oltre 99 lingue. I modelli variano da leggeri (~5MB) ad alta precisione (~2GB+). Raccomandiamo Cohere Transcribe o Voxtral Mini 4B Realtime per la migliore precisione e velocità.
3Scarica un modello di traduzione
Seleziona una coppia di lingue per la traduzione. Scegli TranslateGemma per la migliore qualità e velocità, 74 coppie di lingue Opus-MT per la traduzione rapida via CPU, o Qwen LLM tramite WebGPU per una traduzione multilingue di qualità superiore.
4Scarica un modello TTS
Scarica un modello TTS per l'output vocale. Sono disponibili 136 modelli in 52 lingue, alimentati dai motori Piper, Coqui, Mimic3 e Matcha.
5Inizia a tradurre
Clicca il pulsante Avvia sessione. Non è necessaria alcuna connessione Internet — la traduzione avviene interamente sul tuo dispositivo in tempo reale.
Informazioni aggiuntive
Cos'è la modalità Locale (Offline)?
Locale (Offline) è una pipeline di traduzione IA completamente sul dispositivo che esegue ASR, traduzione e TTS senza alcun servizio cloud:
- Privacy completa — tutta l'elaborazione audio e testuale rimane sul tuo dispositivo
- Funziona offline dopo il download iniziale del modello
- Nessuna chiave API, account o abbonamento richiesto
- Alimentato da WebAssembly (WASM) e WebGPU per prestazioni quasi native
- Utilizzo gratuito senza limiti di utilizzo
Modelli disponibili
La modalità Locale (Offline) supporta un'ampia gamma di modelli per ogni fase della pipeline di traduzione:
- ASR: 42 modelli tra cui Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo e Zipformer — copertura di oltre 99 lingue
- Traduzione: 74 coppie di lingue Opus-MT per traduzione rapida via CPU, più TranslateGemma e Qwen LLM tramite WebGPU per supporto multilingue
- TTS: 136 modelli in 52 lingue utilizzando i motori Piper, Coqui, Mimic3 e Matcha
Requisiti hardware
- CPU (WASM): Funziona su qualsiasi browser moderno — nessun hardware speciale necessario
- WebGPU: Accelerazione GPU opzionale per modelli Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma e traduzione Qwen — significativamente più veloce con una GPU dedicata
- Consigliato: 4GB+ di RAM per un caricamento confortevole dei modelli
- Archiviazione: I modelli variano da 5MB a 200MB+ a seconda del livello di precisione
- Browser moderno richiesto: Chrome 113+, Edge 113+ o Firefox 120+ per il supporto WebGPU
Catalogo modelli
Modelli ASR (Riconoscimento vocale)
Scegli un modello di riconoscimento vocale in base alla lingua di origine, alle esigenze di precisione e alle capacità hardware.
Modelli offline (CPU/WASM)
23 modelli che funzionano su CPU tramite WebAssembly. Nessuna GPU richiesta. Migliore compatibilità.
| Modello | Lingue | Dimensione | Precisione | Velocità |
|---|---|---|---|---|
| SenseVoice (int8) | zh, en, ja, ko, yue | 238 MB | ★★★★☆ | ★★★★☆ |
| SenseVoice Nano (int8) | zh, en, ja, ko, yue | 265 MB | ★★★★★ | ★★★☆☆ |
| Moonshine Tiny EN (q) | en | 45 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny JA (q) | ja | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny KO (q) | ko | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Base ZH (q) | zh | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base JA (q) | ja | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base ES (q) | es | 66 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base AR (q) | ar | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base UK (q) | uk | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base VI (q) | vi | 142 MB | ★★★★☆ | ★★★★☆ |
| NeMo Canary (int8) | en, es, de, fr | 208 MB | ★★★★☆ | ★★★☆☆ |
| NeMo FastConformer Multi | be, de, en, es, fr, hr, it, pl, ru, uk | 133 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer DE | de | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer ES | es | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer PT | pt | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo Parakeet TDT 0.6B (int8) | 25 EU languages | 671 MB | ★★★★★ | ★★★☆☆ |
| Dolphin Base CTC Multi | zh, ja, ko, th, vi, ar, hi, bn, ru | 105 MB | ★★★★☆ | ★★★★☆ |
| Whisper Tiny (ONNX) | 99+ languages | 154 MB | ★★★☆☆ | ★★☆☆☆ |
| WenetSpeech Yue U2++ | zh, yue, en | 135 MB | ★★★★☆ | ★★★★☆ |
| Omnilingual 300M v2 | 1147 languages | 367 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer RU (int8) | ru | 74 MB | ★★★★☆ | ★★★★☆ |
| Zipformer VI 30M (int8) | vi | 35 MB | ★★★☆☆ | ★★★★★ |
Modelli in streaming (CPU/WASM)
10 modelli di streaming in tempo reale. Trascrivi mentre parli con bassa latenza.
| Modello | Lingue | Dimensione | Precisione | Velocità |
|---|---|---|---|---|
| Zipformer EN Kroko | en | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer FR Kroko | fr | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer DE Kroko | de | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ES Kroko | es | 156 MB | ★★★☆☆ | ★★★★☆ |
| Zipformer ZH (int8) | zh | 77 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ZH 2025 (int8) | zh | 167 MB | ★★★★☆ | ★★★★☆ |
| Zipformer RU Vosk (int8) | ru | 29 MB | ★★★☆☆ | ★★★★★ |
| Zipformer Multi (8 lang) | ar, en, id, ja, ru, th, vi, zh | 339 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer BN Vosk | bn | 94 MB | ★★★☆☆ | ★★★★☆ |
| NeMo CTC EN 80ms (int8) | en | 132 MB | ★★★★☆ | ★★★★★ |
Modelli WebGPU (GPU richiesta)
9 modelli accelerati da WebGPU tra cui Cohere Transcribe e Voxtral Mini 4B Realtime (consigliati) più Whisper. Migliore precisione e velocità, richiede una GPU compatibile.
| Modello | Lingue | Dimensione | Precisione | Velocità |
|---|---|---|---|---|
| Cohere Transcribe (q4) | 14 languages | ~2.1 GB | ★★★★★ | ★★★★☆ |
| Cohere Transcribe (q4f16) | 14 languages | ~1.5 GB | ★★★★★ | ★★★★☆ |
| Voxtral Mini 4B Realtime | 13 languages | ~2.3 GB | ★★★★★ | ★★★★★ |
| Whisper Tiny EN | en | 120 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Tiny | 99+ languages | 122 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Base | 99+ languages | 208 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Small | 99+ languages | 586 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Medium | 99+ languages | 680 MB | ★★★★★ | ★★☆☆☆ |
| Whisper Large V3 Turbo | 99+ languages | 759 MB | ★★★★★ | ★★☆☆☆ |
Modelli di traduzione
Scegli TranslateGemma per la migliore qualità e velocità, Opus-MT per traduzione CPU veloce, o Qwen LLM per un'ampia copertura multilingue.
TranslateGemma 4B (WebGPU) — Consigliato
Modello di traduzione specializzato di Google con la massima qualità e velocità tra tutti i modelli di traduzione locali. Supporta 51 lingue con traduzione bidirezionale. Richiede WebGPU.
| Modello | Lingue | Dimensione | Qualità | Velocità |
|---|---|---|---|---|
| TranslateGemma 4B (q4) | 51 languages | ~3.1 GB | ★★★★★ | ★★★★★ |
| TranslateGemma 4B (q4f16) | 51 languages | ~2.7 GB | ★★★★★ | ★★★★★ |
Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu
Qwen LLM (WebGPU)
Modelli linguistici di grandi dimensioni che supportano 119–201+ lingue. Qualità superiore ma richiede GPU. Ideale per la traduzione multilingue flessibile.
| Modello | Lingue | Dimensione | Qualità | Velocità |
|---|---|---|---|---|
| Qwen 2.5 0.5B | 28 languages | ~400 MB | ★★★☆☆ | ★★★★☆ |
| Qwen 3 0.6B | 119+ languages | 919 MB | ★★★★☆ | ★★★☆☆ |
| Qwen 3.5 0.8B | 201+ languages | ~1.6 GB | ★★★★★ | ★★☆☆☆ |
| Qwen 3.5 2B | 201+ languages | ~1.8 GB | ★★★★★ | ★☆☆☆☆ |
Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans
Qwen 3/3.5: 119–201+ languages (multilingual)
Opus-MT (CPU/WASM)
74 coppie di lingue, ~110 MB ciascuna. Veloce, leggero, funziona su qualsiasi dispositivo. Ideale per la traduzione unidirezionale.
| src ↓ tgt → | en | ja | zh | ko | de | fr | es | it | ru | ar | hi | vi | tr | uk | pt | nl | pl | da | sv | fi | cs | ro | hu | id | no | et | th | af | xh |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| en | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||
| ja | ✓ | ||||||||||||||||||||||||||||
| zh | ✓ | ||||||||||||||||||||||||||||
| ko | ✓ | ||||||||||||||||||||||||||||
| de | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| fr | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| es | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| it | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| ru | ✓ | ✓ | ✓ | ✓ | |||||||||||||||||||||||||
| ar | ✓ | ||||||||||||||||||||||||||||
| hi | ✓ | ||||||||||||||||||||||||||||
| vi | ✓ | ||||||||||||||||||||||||||||
| tr | ✓ | ||||||||||||||||||||||||||||
| uk | ✓ | ✓ | |||||||||||||||||||||||||||
| pt | |||||||||||||||||||||||||||||
| nl | ✓ | ✓ | |||||||||||||||||||||||||||
| pl | ✓ | ||||||||||||||||||||||||||||
| da | ✓ | ✓ | |||||||||||||||||||||||||||
| sv | ✓ | ||||||||||||||||||||||||||||
| fi | ✓ | ✓ | |||||||||||||||||||||||||||
| cs | ✓ | ||||||||||||||||||||||||||||
| ro | ✓ | ✓ | |||||||||||||||||||||||||||
| hu | ✓ | ||||||||||||||||||||||||||||
| id | ✓ | ||||||||||||||||||||||||||||
| no | ✓ | ||||||||||||||||||||||||||||
| et | ✓ | ||||||||||||||||||||||||||||
| th | ✓ | ||||||||||||||||||||||||||||
| af | ✓ | ||||||||||||||||||||||||||||
| xh | ✓ |
Modelli TTS (Sintesi vocale)
136 modelli in 52 lingue. Tutti funzionano su CPU tramite WASM — nessuna GPU richiesta. Alimentati dai motori Piper, Coqui, Mimic3, VITS e Matcha.
Impostazioni TTS
- Velocità del parlato — Controlla la velocità di riproduzione del parlato sintetizzato. Regola il cursore della velocità per rendere l'output più veloce o più lento secondo le tue preferenze.
- ID del parlante — Controlla il timbro vocale del parlato sintetizzato. Molti modelli supportano più ID parlante, ciascuno con una voce diversa. Alcuni modelli multi-parlante includono voci di generi diversi, quindi puoi scegliere una voce maschile o femminile selezionando diversi ID parlante.
| Lingua | Modelli | Motore | Parlanti | Intervallo dimensione |
|---|---|---|---|---|
| af | 1 | mimic3 | 1 | ~94 MB |
| ar | 2 | piper | 1 | 81–95 MB |
| bg | 1 | coqui | 1 | ~71 MB |
| bn | 2 | mimic3, coqui | 1 | 71–94 MB |
| ca | 3 | piper | 1 | 39–95 MB |
| cs | 2 | piper | 1 | 81–95 MB |
| cy | 2 | piper | 1–7 | ~95 MB |
| da | 1 | piper | 1 | ~95 MB |
| de | 8 | piper | 1 | 39–81 MB |
| el | 2 | piper, mimic3 | 1 | 81–94 MB |
| en | 13 | piper | 1–904 | 81–97 MB |
| es | 6 | piper | 1–2 | 39–95 MB |
| et | 1 | coqui | 1 | ~71 MB |
| fa | 8 | piper, mimic3, matcha | 1 | 81–146 MB |
| fi | 2 | piper | 1 | 81–95 MB |
| fr | 8 | piper | 1–16 | 39–95 MB |
| ga | 1 | coqui | 1 | ~71 MB |
| gu | 1 | mimic3 | 1 | ~94 MB |
| hi | 3 | piper | 1 | ~95 MB |
| hr | 1 | coqui | 1 | ~71 MB |
| hu | 3 | piper | 1 | ~95 MB |
| id | 1 | piper | 1 | ~95 MB |
| is | 4 | piper | 1 | ~95 MB |
| it | 2 | piper | 1 | 39–95 MB |
| ka | 1 | piper | 1 | ~95 MB |
| kk | 3 | piper | 1+ | 39–81 MB |
| ko | 1 | mimic3 | 1 | ~94 MB |
| lb | 1 | piper | 1 | ~95 MB |
| lt | 1 | coqui | 1 | ~71 MB |
| lv | 1 | piper | 1 | ~95 MB |
| ml | 2 | piper | 1 | ~95 MB |
| mt | 1 | coqui | 1 | ~71 MB |
| ne | 3 | piper | 1+ | 39–95 MB |
| nl | 4 | piper | 1 | 39–95 MB |
| no | 1 | piper | 1 | ~95 MB |
| pl | 7 | piper | 1 | ~95 MB |
| pt | 4 | piper | 1 | 81–95 MB |
| ro | 1 | piper | 1 | ~95 MB |
| ru | 4 | piper | 1 | ~95 MB |
| sk | 1 | piper | 1 | ~95 MB |
| sl | 1 | piper | 1 | ~95 MB |
| sr | 1 | piper | multi | ~95 MB |
| sv | 2 | piper | 1+ | ~95 MB |
| sw | 1 | piper | 1 | ~95 MB |
| tn | 1 | mimic3 | multi | ~94 MB |
| tr | 3 | piper | 1 | ~95 MB |
| uk | 2 | piper | 1+ | 39–95 MB |
| vi | 4 | piper, mimic3 | 1–65 | 46–95 MB |
| yue | 1 | vits | 1 | ~114 MB |
| zh | 3 | vits, piper, matcha | 1–218 | 81–213 MB |
Risoluzione dei problemi
Problemi comuni
Download del modello fallito: Controlla la connessione Internet per il download iniziale. I modelli vengono memorizzati localmente in IndexedDB, quindi gli utilizzi successivi funzionano offline. Prova a cancellare i dati del browser se i download sono corrotti.
ASR non riconosce il parlato: Assicurati di aver selezionato il modello ASR corretto per la tua lingua di origine. Prova un modello più grande per una maggiore precisione. Verifica che il microfono funzioni e che i permessi siano stati concessi.
La qualità della traduzione è bassa: I modelli Opus-MT sono ottimizzati per la velocità piuttosto che per la qualità. Per risultati migliori, prova i modelli TranslateGemma o Qwen LLM se il tuo dispositivo supporta WebGPU. Assicurati di aver selezionato la coppia di lingue corretta.
WebGPU non disponibile: WebGPU richiede un browser e una GPU compatibili. Passa ai modelli basati su WASM (sherpa-onnx, Opus-MT) che funzionano su qualsiasi browser moderno senza requisiti GPU.
Suggerimenti per le prestazioni
- Usa i modelli WebGPU quando disponibili per un'elaborazione significativamente più veloce
- Chiudi le altre schede del browser per liberare memoria per il caricamento dei modelli
- Scegli modelli più piccoli per dispositivi di fascia bassa o quando la velocità è prioritaria
- I modelli WASM (sherpa-onnx, Opus-MT) sono più compatibili ma più lenti delle alternative WebGPU
- Monitora l'utilizzo della memoria del browser — i modelli grandi possono richiedere 2GB+ di memoria del browser
Hai bisogno di ulteriore aiuto? Visita il nostro repository GitHub per il supporto della community, le guide alla compatibilità dei modelli e gli ultimi aggiornamenti sulle funzionalità Locale (Offline).