로컬 (오프라인) 설정 튜토리얼
개요
로컬 (오프라인) 모드를 사용하면 ASR(자동 음성 인식), 번역, TTS(텍스트 음성 변환)를 완전히 기기에서 실행할 수 있습니다. API 키 불필요, 인터넷 연결 불필요, 데이터가 기기를 벗어나지 않습니다. 모든 처리는 WebAssembly와 WebGPU를 사용하여 로컬에서 수행됩니다.
API 키나 인터넷 불필요
프라이버시 최우선 — 모든 오디오와 텍스트가 기기에 유지됩니다. 모델 다운로드 후 로컬 (오프라인) 모드는 완전히 오프라인으로 작동합니다. 대화가 기기를 벗어나지 않습니다.
1제공자로 "로컬 (오프라인)" 선택
Sokuji를 열고 설정 패널로 이동하세요. 제공자 드롭다운에서 "로컬 (오프라인)"를 AI 제공자로 선택하세요.
2ASR 모델 다운로드
소스 언어에 맞는 ASR 모델을 선택하세요. Sokuji는 sherpa-onnx WASM과 WebGPU(Cohere Transcribe, Voxtral Mini, Whisper) 기반의 42개 오프라인/스트리밍 모델을 제공하며 99개 이상의 언어를 지원합니다. 모델 크기는 경량(약 5MB)부터 고정밀(약 2GB 이상)까지 다양합니다. 최고의 정확도와 속도를 위해 Cohere Transcribe 또는 Voxtral Mini 4B Realtime을 권장합니다.
3번역 모델 다운로드
번역 언어 쌍을 선택하세요. 최고의 품질과 속도를 위해 TranslateGemma, 빠른 CPU 기반 번역을 위한 74개의 Opus-MT 언어 쌍, 또는 WebGPU를 통한 Qwen LLM으로 더 높은 품질의 다국어 번역을 선택할 수 있습니다.
4TTS 모델 다운로드
음성 출력을 위한 TTS 모델을 다운로드하세요. Piper, Coqui, Mimic3, Matcha 엔진 기반의 136개 모델이 52개 언어에서 사용 가능합니다.
5번역 시작
세션 시작 버튼을 클릭하세요. 인터넷 연결이 필요 없습니다 — 번역이 기기에서 완전히 실시간으로 이루어집니다.
추가 정보
로컬 (오프라인) 모드란?
로컬 (오프라인)는 클라우드 서비스 없이 ASR, 번역, TTS를 실행하는 완전한 온디바이스 AI 번역 파이프라인입니다:
- 완전한 프라이버시 — 모든 오디오 및 텍스트 처리가 기기에서 수행
- 초기 모델 다운로드 후 오프라인 작동
- API 키, 계정 또는 구독 불필요
- WebAssembly (WASM) 및 WebGPU로 네이티브에 가까운 성능
- 사용 제한 없이 무료 사용 가능
사용 가능한 모델
로컬 (오프라인) 모드는 번역 파이프라인의 각 단계에 다양한 모델을 제공합니다:
- ASR: Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo, Zipformer를 포함한 42개 모델 — 99개 이상의 언어 지원
- 번역: 빠른 CPU 번역을 위한 74개의 Opus-MT 언어 쌍, WebGPU를 통한 TranslateGemma 및 Qwen LLM 다국어 지원
- TTS: Piper, Coqui, Mimic3, Matcha 엔진을 사용한 52개 언어 136개 모델
하드웨어 요구 사항
- CPU (WASM): 모든 최신 브라우저에서 작동 — 특별한 하드웨어 불필요
- WebGPU: Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma 및 Qwen 번역 모델용 선택적 GPU 가속 — 전용 GPU로 크게 빨라짐
- 권장: 편안한 모델 로딩을 위해 4GB 이상 RAM
- 저장 공간: 정확도 수준에 따라 모델 크기 5MB~200MB+
- 최신 브라우저 필요: WebGPU 지원을 위해 Chrome 113+, Edge 113+ 또는 Firefox 120+
모델 카탈로그
ASR(음성 인식) 모델
소스 언어, 정확도 요구 사항, 하드웨어 능력에 따라 음성 인식 모델을 선택하세요.
오프라인 모델 (CPU/WASM)
WebAssembly로 CPU에서 실행되는 23개 모델. GPU 불필요. 호환성이 가장 좋음.
| 모델 | 언어 | 크기 | 정확도 | 속도 |
|---|---|---|---|---|
| SenseVoice (int8) | zh, en, ja, ko, yue | 238 MB | ★★★★☆ | ★★★★☆ |
| SenseVoice Nano (int8) | zh, en, ja, ko, yue | 265 MB | ★★★★★ | ★★★☆☆ |
| Moonshine Tiny EN (q) | en | 45 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny JA (q) | ja | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Tiny KO (q) | ko | 73 MB | ★★★☆☆ | ★★★★★ |
| Moonshine Base ZH (q) | zh | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base JA (q) | ja | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base ES (q) | es | 66 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base AR (q) | ar | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base UK (q) | uk | 142 MB | ★★★★☆ | ★★★★☆ |
| Moonshine Base VI (q) | vi | 142 MB | ★★★★☆ | ★★★★☆ |
| NeMo Canary (int8) | en, es, de, fr | 208 MB | ★★★★☆ | ★★★☆☆ |
| NeMo FastConformer Multi | be, de, en, es, fr, hr, it, pl, ru, uk | 133 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer DE | de | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer ES | es | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo FastConformer PT | pt | 132 MB | ★★★★☆ | ★★★★☆ |
| NeMo Parakeet TDT 0.6B (int8) | 25 EU languages | 671 MB | ★★★★★ | ★★★☆☆ |
| Dolphin Base CTC Multi | zh, ja, ko, th, vi, ar, hi, bn, ru | 105 MB | ★★★★☆ | ★★★★☆ |
| Whisper Tiny (ONNX) | 99+ languages | 154 MB | ★★★☆☆ | ★★☆☆☆ |
| WenetSpeech Yue U2++ | zh, yue, en | 135 MB | ★★★★☆ | ★★★★☆ |
| Omnilingual 300M v2 | 1147 languages | 367 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer RU (int8) | ru | 74 MB | ★★★★☆ | ★★★★☆ |
| Zipformer VI 30M (int8) | vi | 35 MB | ★★★☆☆ | ★★★★★ |
스트리밍 모델 (CPU/WASM)
10개의 실시간 스트리밍 모델. 말하면서 낮은 지연으로 전사.
| 모델 | 언어 | 크기 | 정확도 | 속도 |
|---|---|---|---|---|
| Zipformer EN Kroko | en | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer FR Kroko | fr | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer DE Kroko | de | 71 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ES Kroko | es | 156 MB | ★★★☆☆ | ★★★★☆ |
| Zipformer ZH (int8) | zh | 77 MB | ★★★☆☆ | ★★★★★ |
| Zipformer ZH 2025 (int8) | zh | 167 MB | ★★★★☆ | ★★★★☆ |
| Zipformer RU Vosk (int8) | ru | 29 MB | ★★★☆☆ | ★★★★★ |
| Zipformer Multi (8 lang) | ar, en, id, ja, ru, th, vi, zh | 339 MB | ★★★☆☆ | ★★★☆☆ |
| Zipformer BN Vosk | bn | 94 MB | ★★★☆☆ | ★★★★☆ |
| NeMo CTC EN 80ms (int8) | en | 132 MB | ★★★★☆ | ★★★★★ |
WebGPU 모델 (GPU 필수)
WebGPU로 가속되는 9개 모델. Cohere Transcribe와 Voxtral Mini 4B Realtime(권장) 및 Whisper 포함. 최고의 정확도와 속도, 호환 GPU 필요.
| 모델 | 언어 | 크기 | 정확도 | 속도 |
|---|---|---|---|---|
| Cohere Transcribe (q4) | 14 languages | ~2.1 GB | ★★★★★ | ★★★★☆ |
| Cohere Transcribe (q4f16) | 14 languages | ~1.5 GB | ★★★★★ | ★★★★☆ |
| Voxtral Mini 4B Realtime | 13 languages | ~2.3 GB | ★★★★★ | ★★★★★ |
| Whisper Tiny EN | en | 120 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Tiny | 99+ languages | 122 MB | ★★★☆☆ | ★★★★☆ |
| Whisper Base | 99+ languages | 208 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Small | 99+ languages | 586 MB | ★★★★☆ | ★★★☆☆ |
| Whisper Medium | 99+ languages | 680 MB | ★★★★★ | ★★☆☆☆ |
| Whisper Large V3 Turbo | 99+ languages | 759 MB | ★★★★★ | ★★☆☆☆ |
번역 모델
최고의 품질과 속도를 위해 TranslateGemma, 빠른 CPU 번역을 위해 Opus-MT, 넓은 다국어 지원을 위해 Qwen LLM을 선택하세요.
TranslateGemma 4B (WebGPU) — 추천
Google의 번역 전용 모델로 모든 로컬 번역 모델 중 최고의 품질과 가장 빠른 속도를 제공합니다. 51개 언어의 양방향 번역을 지원합니다. WebGPU 필요.
| 모델 | 언어 | 크기 | 품질 | 속도 |
|---|---|---|---|---|
| TranslateGemma 4B (q4) | 51 languages | ~3.1 GB | ★★★★★ | ★★★★★ |
| TranslateGemma 4B (q4f16) | 51 languages | ~2.7 GB | ★★★★★ | ★★★★★ |
Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu
Qwen LLM (WebGPU)
119~201개 이상 언어를 지원하는 대규모 언어 모델. 더 높은 품질이지만 GPU 필요. 유연한 다국어 번역에 최적.
| 모델 | 언어 | 크기 | 품질 | 속도 |
|---|---|---|---|---|
| Qwen 2.5 0.5B | 28 languages | ~400 MB | ★★★☆☆ | ★★★★☆ |
| Qwen 3 0.6B | 119+ languages | 919 MB | ★★★★☆ | ★★★☆☆ |
| Qwen 3.5 0.8B | 201+ languages | ~1.6 GB | ★★★★★ | ★★☆☆☆ |
| Qwen 3.5 2B | 201+ languages | ~1.8 GB | ★★★★★ | ★☆☆☆☆ |
Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans
Qwen 3/3.5: 119–201+ languages (multilingual)
Opus-MT (CPU/WASM)
74개 언어 쌍, 각 약 110 MB. 빠르고 가벼우며 모든 기기에서 실행. 단방향 번역에 최적.
| src ↓ tgt → | en | ja | zh | ko | de | fr | es | it | ru | ar | hi | vi | tr | uk | pt | nl | pl | da | sv | fi | cs | ro | hu | id | no | et | th | af | xh |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| en | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||
| ja | ✓ | ||||||||||||||||||||||||||||
| zh | ✓ | ||||||||||||||||||||||||||||
| ko | ✓ | ||||||||||||||||||||||||||||
| de | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| fr | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| es | ✓ | ✓ | ✓ | ✓ | ✓ | ||||||||||||||||||||||||
| it | ✓ | ✓ | ✓ | ||||||||||||||||||||||||||
| ru | ✓ | ✓ | ✓ | ✓ | |||||||||||||||||||||||||
| ar | ✓ | ||||||||||||||||||||||||||||
| hi | ✓ | ||||||||||||||||||||||||||||
| vi | ✓ | ||||||||||||||||||||||||||||
| tr | ✓ | ||||||||||||||||||||||||||||
| uk | ✓ | ✓ | |||||||||||||||||||||||||||
| pt | |||||||||||||||||||||||||||||
| nl | ✓ | ✓ | |||||||||||||||||||||||||||
| pl | ✓ | ||||||||||||||||||||||||||||
| da | ✓ | ✓ | |||||||||||||||||||||||||||
| sv | ✓ | ||||||||||||||||||||||||||||
| fi | ✓ | ✓ | |||||||||||||||||||||||||||
| cs | ✓ | ||||||||||||||||||||||||||||
| ro | ✓ | ✓ | |||||||||||||||||||||||||||
| hu | ✓ | ||||||||||||||||||||||||||||
| id | ✓ | ||||||||||||||||||||||||||||
| no | ✓ | ||||||||||||||||||||||||||||
| et | ✓ | ||||||||||||||||||||||||||||
| th | ✓ | ||||||||||||||||||||||||||||
| af | ✓ | ||||||||||||||||||||||||||||
| xh | ✓ |
TTS(텍스트 음성 변환) 모델
52개 언어에 136개 모델. 모두 WASM을 통해 CPU에서 실행 — GPU 불필요. Piper, Coqui, Mimic3, VITS, Matcha 엔진 지원.
TTS 설정
- 음성 속도 — 합성 음성의 재생 속도를 조절합니다. 속도 슬라이더를 조정하여 출력 음성을 빠르게 또는 느리게 설정할 수 있습니다.
- 화자 ID — 합성 음성의 음색을 조절합니다. 많은 모델이 여러 화자 ID를 지원하며, 각 ID마다 다른 음색을 가집니다. 일부 다중 화자 모델에는 다른 성별의 음색이 포함되어 있어 화자 ID를 변경하여 남성 또는 여성 목소리를 선택할 수 있습니다.
| 언어 | 모델 수 | 엔진 | 화자 | 크기 범위 |
|---|---|---|---|---|
| af | 1 | mimic3 | 1 | ~94 MB |
| ar | 2 | piper | 1 | 81–95 MB |
| bg | 1 | coqui | 1 | ~71 MB |
| bn | 2 | mimic3, coqui | 1 | 71–94 MB |
| ca | 3 | piper | 1 | 39–95 MB |
| cs | 2 | piper | 1 | 81–95 MB |
| cy | 2 | piper | 1–7 | ~95 MB |
| da | 1 | piper | 1 | ~95 MB |
| de | 8 | piper | 1 | 39–81 MB |
| el | 2 | piper, mimic3 | 1 | 81–94 MB |
| en | 13 | piper | 1–904 | 81–97 MB |
| es | 6 | piper | 1–2 | 39–95 MB |
| et | 1 | coqui | 1 | ~71 MB |
| fa | 8 | piper, mimic3, matcha | 1 | 81–146 MB |
| fi | 2 | piper | 1 | 81–95 MB |
| fr | 8 | piper | 1–16 | 39–95 MB |
| ga | 1 | coqui | 1 | ~71 MB |
| gu | 1 | mimic3 | 1 | ~94 MB |
| hi | 3 | piper | 1 | ~95 MB |
| hr | 1 | coqui | 1 | ~71 MB |
| hu | 3 | piper | 1 | ~95 MB |
| id | 1 | piper | 1 | ~95 MB |
| is | 4 | piper | 1 | ~95 MB |
| it | 2 | piper | 1 | 39–95 MB |
| ka | 1 | piper | 1 | ~95 MB |
| kk | 3 | piper | 1+ | 39–81 MB |
| ko | 1 | mimic3 | 1 | ~94 MB |
| lb | 1 | piper | 1 | ~95 MB |
| lt | 1 | coqui | 1 | ~71 MB |
| lv | 1 | piper | 1 | ~95 MB |
| ml | 2 | piper | 1 | ~95 MB |
| mt | 1 | coqui | 1 | ~71 MB |
| ne | 3 | piper | 1+ | 39–95 MB |
| nl | 4 | piper | 1 | 39–95 MB |
| no | 1 | piper | 1 | ~95 MB |
| pl | 7 | piper | 1 | ~95 MB |
| pt | 4 | piper | 1 | 81–95 MB |
| ro | 1 | piper | 1 | ~95 MB |
| ru | 4 | piper | 1 | ~95 MB |
| sk | 1 | piper | 1 | ~95 MB |
| sl | 1 | piper | 1 | ~95 MB |
| sr | 1 | piper | multi | ~95 MB |
| sv | 2 | piper | 1+ | ~95 MB |
| sw | 1 | piper | 1 | ~95 MB |
| tn | 1 | mimic3 | multi | ~94 MB |
| tr | 3 | piper | 1 | ~95 MB |
| uk | 2 | piper | 1+ | 39–95 MB |
| vi | 4 | piper, mimic3 | 1–65 | 46–95 MB |
| yue | 1 | vits | 1 | ~114 MB |
| zh | 3 | vits, piper, matcha | 1–218 | 81–213 MB |
문제 해결
일반적인 문제
모델 다운로드 실패: 초기 다운로드 시 인터넷 연결을 확인하세요. 모델은 로컬 IndexedDB에 캐시되므로 이후 사용은 오프라인으로 가능합니다. 다운로드가 손상된 경우 브라우저 데이터 삭제를 시도하세요.
ASR이 음성을 인식하지 못함: 소스 언어에 맞는 올바른 ASR 모델을 선택했는지 확인하세요. 더 나은 정확도를 위해 더 큰 모델을 시도하세요. 마이크가 작동하고 권한이 부여되었는지 확인하세요.
번역 품질이 낮음: Opus-MT 모델은 품질보다 속도에 최적화되어 있습니다. 기기가 WebGPU를 지원하는 경우 TranslateGemma 또는 Qwen LLM 모델을 시도해 보세요. 올바른 언어 쌍을 선택했는지 확인하세요.
WebGPU 사용 불가: WebGPU에는 호환 브라우저와 GPU가 필요합니다. GPU 없이 모든 최신 브라우저에서 작동하는 WASM 기반 모델(sherpa-onnx, Opus-MT)로 대체하세요.
성능 팁
- 사용 가능한 경우 WebGPU 모델을 사용하여 처리 속도를 크게 향상
- 다른 브라우저 탭을 닫아 모델 로딩을 위한 메모리 확보
- 저사양 기기이거나 속도를 우선할 때는 더 작은 모델 선택
- WASM 모델(sherpa-onnx, Opus-MT)은 호환성이 높지만 WebGPU 대안보다 느림
- 브라우저 메모리 사용량 모니터링 — 큰 모델은 2GB 이상의 브라우저 메모리가 필요할 수 있음
더 많은 도움이 필요하신가요? 커뮤니티 지원, 모델 호환성 가이드, 로컬 (오프라인) 기능의 최신 업데이트는 GitHub 저장소를 방문하세요.