AI 제공자로 돌아가기

로컬 (오프라인) 설정 튜토리얼

개요

로컬 (오프라인) 모드를 사용하면 ASR(자동 음성 인식), 번역, TTS(텍스트 음성 변환)를 완전히 기기에서 실행할 수 있습니다. API 키 불필요, 인터넷 연결 불필요, 데이터가 기기를 벗어나지 않습니다. 모든 처리는 WebAssembly와 WebGPU를 사용하여 로컬에서 수행됩니다.

API 키나 인터넷 불필요

프라이버시 최우선 — 모든 오디오와 텍스트가 기기에 유지됩니다. 모델 다운로드 후 로컬 (오프라인) 모드는 완전히 오프라인으로 작동합니다. 대화가 기기를 벗어나지 않습니다.

1제공자로 "로컬 (오프라인)" 선택

Sokuji를 열고 설정 패널로 이동하세요. 제공자 드롭다운에서 "로컬 (오프라인)"를 AI 제공자로 선택하세요.

2ASR 모델 다운로드

소스 언어에 맞는 ASR 모델을 선택하세요. Sokuji는 sherpa-onnx WASM과 WebGPU(Cohere Transcribe, Voxtral Mini, Whisper) 기반의 42개 오프라인/스트리밍 모델을 제공하며 99개 이상의 언어를 지원합니다. 모델 크기는 경량(약 5MB)부터 고정밀(약 2GB 이상)까지 다양합니다. 최고의 정확도와 속도를 위해 Cohere Transcribe 또는 Voxtral Mini 4B Realtime을 권장합니다.

3번역 모델 다운로드

번역 언어 쌍을 선택하세요. 최고의 품질과 속도를 위해 TranslateGemma, 빠른 CPU 기반 번역을 위한 74개의 Opus-MT 언어 쌍, 또는 WebGPU를 통한 Qwen LLM으로 더 높은 품질의 다국어 번역을 선택할 수 있습니다.

4TTS 모델 다운로드

음성 출력을 위한 TTS 모델을 다운로드하세요. Piper, Coqui, Mimic3, Matcha 엔진 기반의 136개 모델이 52개 언어에서 사용 가능합니다.

5번역 시작

세션 시작 버튼을 클릭하세요. 인터넷 연결이 필요 없습니다 — 번역이 기기에서 완전히 실시간으로 이루어집니다.

추가 정보

로컬 (오프라인) 모드란?

로컬 (오프라인)는 클라우드 서비스 없이 ASR, 번역, TTS를 실행하는 완전한 온디바이스 AI 번역 파이프라인입니다:

  • 완전한 프라이버시 — 모든 오디오 및 텍스트 처리가 기기에서 수행
  • 초기 모델 다운로드 후 오프라인 작동
  • API 키, 계정 또는 구독 불필요
  • WebAssembly (WASM) 및 WebGPU로 네이티브에 가까운 성능
  • 사용 제한 없이 무료 사용 가능

사용 가능한 모델

로컬 (오프라인) 모드는 번역 파이프라인의 각 단계에 다양한 모델을 제공합니다:

  • ASR: Cohere Transcribe, Voxtral Mini 4B Realtime, Whisper, SenseVoice, Moonshine, NeMo, Zipformer를 포함한 42개 모델 — 99개 이상의 언어 지원
  • 번역: 빠른 CPU 번역을 위한 74개의 Opus-MT 언어 쌍, WebGPU를 통한 TranslateGemma 및 Qwen LLM 다국어 지원
  • TTS: Piper, Coqui, Mimic3, Matcha 엔진을 사용한 52개 언어 136개 모델

하드웨어 요구 사항

  • CPU (WASM): 모든 최신 브라우저에서 작동 — 특별한 하드웨어 불필요
  • WebGPU: Cohere Transcribe, Voxtral Mini, Whisper ASR, TranslateGemma 및 Qwen 번역 모델용 선택적 GPU 가속 — 전용 GPU로 크게 빨라짐
  • 권장: 편안한 모델 로딩을 위해 4GB 이상 RAM
  • 저장 공간: 정확도 수준에 따라 모델 크기 5MB~200MB+
  • 최신 브라우저 필요: WebGPU 지원을 위해 Chrome 113+, Edge 113+ 또는 Firefox 120+

모델 카탈로그

ASR(음성 인식) 모델

소스 언어, 정확도 요구 사항, 하드웨어 능력에 따라 음성 인식 모델을 선택하세요.

오프라인 모델 (CPU/WASM)

WebAssembly로 CPU에서 실행되는 23개 모델. GPU 불필요. 호환성이 가장 좋음.

모델언어크기정확도속도
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

스트리밍 모델 (CPU/WASM)

10개의 실시간 스트리밍 모델. 말하면서 낮은 지연으로 전사.

모델언어크기정확도속도
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

WebGPU 모델 (GPU 필수)

WebGPU로 가속되는 9개 모델. Cohere Transcribe와 Voxtral Mini 4B Realtime(권장) 및 Whisper 포함. 최고의 정확도와 속도, 호환 GPU 필요.

모델언어크기정확도속도
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

번역 모델

최고의 품질과 속도를 위해 TranslateGemma, 빠른 CPU 번역을 위해 Opus-MT, 넓은 다국어 지원을 위해 Qwen LLM을 선택하세요.

TranslateGemma 4B (WebGPU) — 추천

Google의 번역 전용 모델로 모든 로컬 번역 모델 중 최고의 품질과 가장 빠른 속도를 제공합니다. 51개 언어의 양방향 번역을 지원합니다. WebGPU 필요.

모델언어크기품질속도
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM (WebGPU)

119~201개 이상 언어를 지원하는 대규모 언어 모델. 더 높은 품질이지만 GPU 필요. 유연한 다국어 번역에 최적.

모델언어크기품질속도
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT (CPU/WASM)

74개 언어 쌍, 각 약 110 MB. 빠르고 가벼우며 모든 기기에서 실행. 단방향 번역에 최적.

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

TTS(텍스트 음성 변환) 모델

52개 언어에 136개 모델. 모두 WASM을 통해 CPU에서 실행 — GPU 불필요. Piper, Coqui, Mimic3, VITS, Matcha 엔진 지원.

TTS 설정

  • 음성 속도 — 합성 음성의 재생 속도를 조절합니다. 속도 슬라이더를 조정하여 출력 음성을 빠르게 또는 느리게 설정할 수 있습니다.
  • 화자 ID — 합성 음성의 음색을 조절합니다. 많은 모델이 여러 화자 ID를 지원하며, 각 ID마다 다른 음색을 가집니다. 일부 다중 화자 모델에는 다른 성별의 음색이 포함되어 있어 화자 ID를 변경하여 남성 또는 여성 목소리를 선택할 수 있습니다.
언어모델 수엔진화자크기 범위
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

문제 해결

일반적인 문제

모델 다운로드 실패: 초기 다운로드 시 인터넷 연결을 확인하세요. 모델은 로컬 IndexedDB에 캐시되므로 이후 사용은 오프라인으로 가능합니다. 다운로드가 손상된 경우 브라우저 데이터 삭제를 시도하세요.

ASR이 음성을 인식하지 못함: 소스 언어에 맞는 올바른 ASR 모델을 선택했는지 확인하세요. 더 나은 정확도를 위해 더 큰 모델을 시도하세요. 마이크가 작동하고 권한이 부여되었는지 확인하세요.

번역 품질이 낮음: Opus-MT 모델은 품질보다 속도에 최적화되어 있습니다. 기기가 WebGPU를 지원하는 경우 TranslateGemma 또는 Qwen LLM 모델을 시도해 보세요. 올바른 언어 쌍을 선택했는지 확인하세요.

WebGPU 사용 불가: WebGPU에는 호환 브라우저와 GPU가 필요합니다. GPU 없이 모든 최신 브라우저에서 작동하는 WASM 기반 모델(sherpa-onnx, Opus-MT)로 대체하세요.

성능 팁

  1. 사용 가능한 경우 WebGPU 모델을 사용하여 처리 속도를 크게 향상
  2. 다른 브라우저 탭을 닫아 모델 로딩을 위한 메모리 확보
  3. 저사양 기기이거나 속도를 우선할 때는 더 작은 모델 선택
  4. WASM 모델(sherpa-onnx, Opus-MT)은 호환성이 높지만 WebGPU 대안보다 느림
  5. 브라우저 메모리 사용량 모니터링 — 큰 모델은 2GB 이상의 브라우저 메모리가 필요할 수 있음

더 많은 도움이 필요하신가요? 커뮤니티 지원, 모델 호환성 가이드, 로컬 (오프라인) 기능의 최신 업데이트는 GitHub 저장소를 방문하세요.

GitHub Repository