Torna ai provider di IA

Tutorial di configurazione locale (offline)

Panoramica

La modalità Locale (Offline) consente di eseguire ASR (Riconoscimento Automatico del Parlato), traduzione e TTS (Sintesi Vocale) interamente sul proprio dispositivo. Nessuna chiave API, nessuna connessione Internet e nessun dato lascia il computer. Tutto viene elaborato localmente utilizzando WebAssembly e WebGPU.

Nessuna chiave API o Internet richiesti

Privacy prima di tutto — tutti gli audio e i testi rimangono sul tuo dispositivo. Dopo aver scaricato i modelli, la modalità Locale (Offline) funziona completamente offline. Le tue conversazioni non lasciano mai il tuo computer.

1Seleziona "Locale (Offline)" come provider

Apri Sokuji e naviga al pannello delle impostazioni. Seleziona "Locale (Offline)" come provider di IA dal menu a tendina dei provider.

2Scarica un modello ASR

Scegli un modello ASR per la tua lingua di origine. Sokuji offre 42 modelli offline/streaming alimentati da sherpa-onnx WASM e WebGPU (Cohere Transcribe, Voxtral Mini, Whisper), che coprono oltre 99 lingue. I modelli variano da leggeri (~5MB) ad alta precisione (~2GB+). Raccomandiamo Cohere Transcribe o Voxtral Mini 4B Realtime per la migliore precisione e velocità.

3Scarica un modello di traduzione

Seleziona una coppia di lingue per la traduzione. Scegli TranslateGemma per la migliore qualità e velocità, 74 coppie di lingue Opus-MT per la traduzione rapida via CPU, o Qwen LLM tramite WebGPU per una traduzione multilingue di qualità superiore.

4Scarica un modello TTS

Scarica un modello TTS per l'output vocale. Sono disponibili 136 modelli in 52 lingue, alimentati dai motori Piper, Coqui, Mimic3 e Matcha.

5Inizia a tradurre

Clicca il pulsante Avvia sessione. Non è necessaria alcuna connessione Internet — la traduzione avviene interamente sul tuo dispositivo in tempo reale.

Informazioni aggiuntive

Cos'è la modalità Locale (Offline)?

Locale (Offline) è una pipeline di traduzione IA completamente sul dispositivo che esegue ASR, traduzione e TTS senza alcun servizio cloud:

  • Privacy completa — tutta l'elaborazione audio e testuale rimane sul tuo dispositivo
  • Funziona offline dopo il download iniziale del modello
  • Nessuna chiave API, account o abbonamento richiesto
  • Alimentato da WebAssembly (WASM) e WebGPU per prestazioni quasi native
  • Utilizzo gratuito senza limiti di utilizzo

Modelli disponibili

La modalità Locale (Offline) supporta un'ampia gamma di modelli per ogni fase della pipeline di traduzione:

  • ASR: 42 modelli tra cui Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo e Zipformer — copertura di oltre 99 lingue
  • Traduzione: 74 coppie di lingue Opus-MT per traduzione rapida via CPU, più TranslateGemma e Qwen LLM tramite WebGPU per supporto multilingue
  • TTS: 136 modelli in 52 lingue utilizzando i motori Piper, Coqui, Mimic3 e Matcha

Requisiti hardware

  • CPU (WASM): Funziona su qualsiasi browser moderno — nessun hardware speciale necessario
  • WebGPU: Accelerazione GPU opzionale per modelli Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma e traduzione Qwen — significativamente più veloce con una GPU dedicata
  • Consigliato: 4GB+ di RAM per un caricamento confortevole dei modelli
  • Archiviazione: I modelli variano da 5MB a 200MB+ a seconda del livello di precisione
  • Browser moderno richiesto: Chrome 113+, Edge 113+ o Firefox 120+ per il supporto WebGPU

Catalogo modelli

Modelli ASR (Riconoscimento vocale)

Scegli un modello di riconoscimento vocale in base alla lingua di origine, alle esigenze di precisione e alle capacità hardware.

Modelli offline (CPU/WASM)

23 modelli che funzionano su CPU tramite WebAssembly. Nessuna GPU richiesta. Migliore compatibilità.

ModelloLingueDimensionePrecisioneVelocità
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

Modelli in streaming (CPU/WASM)

10 modelli di streaming in tempo reale. Trascrivi mentre parli con bassa latenza.

ModelloLingueDimensionePrecisioneVelocità
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

Modelli WebGPU (GPU richiesta)

9 modelli accelerati da WebGPU tra cui Cohere Transcribe e Voxtral Mini 4B Realtime (consigliati) più Whisper. Migliore precisione e velocità, richiede una GPU compatibile.

ModelloLingueDimensionePrecisioneVelocità
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

Modelli di traduzione

Scegli TranslateGemma per la migliore qualità e velocità, Opus-MT per traduzione CPU veloce, o Qwen LLM per un'ampia copertura multilingue.

TranslateGemma 4B (WebGPU) — Consigliato

Modello di traduzione specializzato di Google con la massima qualità e velocità tra tutti i modelli di traduzione locali. Supporta 51 lingue con traduzione bidirezionale. Richiede WebGPU.

ModelloLingueDimensioneQualitàVelocità
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM (WebGPU)

Modelli linguistici di grandi dimensioni che supportano 119–201+ lingue. Qualità superiore ma richiede GPU. Ideale per la traduzione multilingue flessibile.

ModelloLingueDimensioneQualitàVelocità
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT (CPU/WASM)

74 coppie di lingue, ~110 MB ciascuna. Veloce, leggero, funziona su qualsiasi dispositivo. Ideale per la traduzione unidirezionale.

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

Modelli TTS (Sintesi vocale)

136 modelli in 52 lingue. Tutti funzionano su CPU tramite WASM — nessuna GPU richiesta. Alimentati dai motori Piper, Coqui, Mimic3, VITS e Matcha.

Impostazioni TTS

  • Velocità del parlato — Controlla la velocità di riproduzione del parlato sintetizzato. Regola il cursore della velocità per rendere l'output più veloce o più lento secondo le tue preferenze.
  • ID del parlante — Controlla il timbro vocale del parlato sintetizzato. Molti modelli supportano più ID parlante, ciascuno con una voce diversa. Alcuni modelli multi-parlante includono voci di generi diversi, quindi puoi scegliere una voce maschile o femminile selezionando diversi ID parlante.
LinguaModelliMotoreParlantiIntervallo dimensione
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

Risoluzione dei problemi

Problemi comuni

Download del modello fallito: Controlla la connessione Internet per il download iniziale. I modelli vengono memorizzati localmente in IndexedDB, quindi gli utilizzi successivi funzionano offline. Prova a cancellare i dati del browser se i download sono corrotti.

ASR non riconosce il parlato: Assicurati di aver selezionato il modello ASR corretto per la tua lingua di origine. Prova un modello più grande per una maggiore precisione. Verifica che il microfono funzioni e che i permessi siano stati concessi.

La qualità della traduzione è bassa: I modelli Opus-MT sono ottimizzati per la velocità piuttosto che per la qualità. Per risultati migliori, prova i modelli TranslateGemma o Qwen LLM se il tuo dispositivo supporta WebGPU. Assicurati di aver selezionato la coppia di lingue corretta.

WebGPU non disponibile: WebGPU richiede un browser e una GPU compatibili. Passa ai modelli basati su WASM (sherpa-onnx, Opus-MT) che funzionano su qualsiasi browser moderno senza requisiti GPU.

Suggerimenti per le prestazioni

  1. Usa i modelli WebGPU quando disponibili per un'elaborazione significativamente più veloce
  2. Chiudi le altre schede del browser per liberare memoria per il caricamento dei modelli
  3. Scegli modelli più piccoli per dispositivi di fascia bassa o quando la velocità è prioritaria
  4. I modelli WASM (sherpa-onnx, Opus-MT) sono più compatibili ma più lenti delle alternative WebGPU
  5. Monitora l'utilizzo della memoria del browser — i modelli grandi possono richiedere 2GB+ di memoria del browser

Hai bisogno di ulteriore aiuto? Visita il nostro repository GitHub per il supporto della community, le guide alla compatibilità dei modelli e gli ultimi aggiornamenti sulle funzionalità Locale (Offline).

GitHub Repository