العودة إلى مزودي الذكاء الاصطناعي

دليل إعداد الوضع المحلي (بدون اتصال)

نظرة عامة

يتيح لك الوضع المحلي (بدون اتصال) تشغيل ASR (التعرف التلقائي على الكلام) والترجمة وTTS (تحويل النص إلى كلام) بالكامل على جهازك. لا حاجة لمفتاح API، ولا اتصال بالإنترنت، ولا تغادر أي بيانات جهازك. تتم جميع العمليات محليًا باستخدام WebAssembly وWebGPU.

لا حاجة لمفتاح API أو الإنترنت

الخصوصية أولاً — جميع الملفات الصوتية والنصوص تبقى على جهازك. بعد تنزيل النماذج، يعمل الوضع المحلي (بدون اتصال) بشكل كامل دون اتصال. محادثاتك لا تغادر جهازك أبدًا.

1حدد "محلي (بدون اتصال)" كمزود

افتح Sokuji وانتقل إلى لوحة الإعدادات. حدد "محلي (بدون اتصال)" كمزود الذكاء الاصطناعي من القائمة المنسدلة للمزودين.

2قم بتنزيل نموذج ASR

اختر نموذج ASR للغة المصدر. يوفر Sokuji 42 نموذجًا للعمل بدون اتصال/البث المباشر مدعومًا بـ sherpa-onnx WASM وWebGPU (Cohere Transcribe، Voxtral Mini، Whisper)، يغطي أكثر من 99 لغة. تتراوح أحجام النماذج من خفيفة (~5MB) إلى عالية الدقة (~2GB+). نوصي بـ Cohere Transcribe أو Voxtral Mini 4B Realtime للحصول على أفضل دقة وسرعة.

3قم بتنزيل نموذج ترجمة

حدد زوج لغات الترجمة. اختر TranslateGemma للحصول على أفضل جودة وسرعة، أو 74 زوج لغة Opus-MT للترجمة السريعة عبر CPU، أو Qwen LLMs عبر WebGPU للترجمة متعددة اللغات بجودة أعلى.

4قم بتنزيل نموذج TTS

قم بتنزيل نموذج TTS للمخرجات الصوتية. يتوفر 136 نموذجًا عبر 52 لغة، مدعومة بمحركات Piper وCoqui وMimic3 وMatcha.

5ابدأ الترجمة

انقر على زر بدء الجلسة. لا حاجة لاتصال بالإنترنت — تتم الترجمة بالكامل على جهازك في الوقت الفعلي.

معلومات إضافية

ما هو الوضع المحلي (بدون اتصال)؟

المحلي (بدون اتصال) هو خط أنابيب ترجمة ذكاء اصطناعي يعمل بالكامل على الجهاز، ينفذ ASR والترجمة وTTS بدون أي خدمات سحابية:

  • خصوصية كاملة — جميع عمليات معالجة الصوت والنص تبقى على جهازك
  • يعمل بدون اتصال بعد التنزيل الأولي للنموذج
  • لا حاجة لمفاتيح API أو حسابات أو اشتراكات
  • مدعوم بـ WebAssembly (WASM) وWebGPU لأداء يشبه الأداء الأصلي
  • مجاني الاستخدام بدون حدود استخدام

النماذج المتاحة

يدعم الوضع المحلي (بدون اتصال) مجموعة واسعة من النماذج لكل مرحلة من مراحل خط أنابيب الترجمة:

  • ASR: 42 نموذجًا تشمل Cohere Transcribe وVoxtral Mini 4B Realtime وWhisper وSenseVoice وMoonshine وNeMo وZipformer — تغطي أكثر من 99 لغة
  • الترجمة: 74 زوج لغة Opus-MT للترجمة السريعة عبر CPU، بالإضافة إلى TranslateGemma وQwen LLMs عبر WebGPU للدعم متعدد اللغات
  • TTS: 136 نموذجًا عبر 52 لغة باستخدام محركات Piper وCoqui وMimic3 وMatcha

متطلبات الأجهزة

  • CPU (WASM): يعمل على أي متصفح حديث — لا حاجة لأجهزة خاصة
  • WebGPU: تسريع GPU اختياري لنماذج Cohere Transcribe وVoxtral Mini وWhisper ASR وTranslateGemma وترجمة Qwen — أسرع بشكل ملحوظ مع GPU مخصص
  • موصى به: 4GB+ من RAM لتحميل مريح للنماذج
  • التخزين: تتراوح أحجام النماذج من 5MB إلى 200MB+ حسب مستوى الدقة
  • يتطلب متصفح حديث: Chrome 113+ أو Edge 113+ أو Firefox 120+ لدعم WebGPU

كتالوج النماذج

نماذج ASR (التعرف على الكلام)

اختر نموذج التعرف على الكلام بناءً على لغة المصدر واحتياجات الدقة وقدرات الأجهزة.

نماذج بدون اتصال (CPU/WASM)

23 نموذجًا يعمل على CPU عبر WebAssembly. لا حاجة لـ GPU. أفضل توافق.

النموذجاللغاتالحجمالدقةالسرعة
SenseVoice (int8)zh, en, ja, ko, yue238 MB★★★★☆★★★★☆
SenseVoice Nano (int8)zh, en, ja, ko, yue265 MB★★★★★★★★☆☆
Moonshine Tiny EN (q)en45 MB★★★☆☆★★★★★
Moonshine Tiny JA (q)ja73 MB★★★☆☆★★★★★
Moonshine Tiny KO (q)ko73 MB★★★☆☆★★★★★
Moonshine Base ZH (q)zh142 MB★★★★☆★★★★☆
Moonshine Base JA (q)ja142 MB★★★★☆★★★★☆
Moonshine Base ES (q)es66 MB★★★★☆★★★★☆
Moonshine Base AR (q)ar142 MB★★★★☆★★★★☆
Moonshine Base UK (q)uk142 MB★★★★☆★★★★☆
Moonshine Base VI (q)vi142 MB★★★★☆★★★★☆
NeMo Canary (int8)en, es, de, fr208 MB★★★★☆★★★☆☆
NeMo FastConformer Multibe, de, en, es, fr, hr, it, pl, ru, uk133 MB★★★★☆★★★★☆
NeMo FastConformer DEde132 MB★★★★☆★★★★☆
NeMo FastConformer ESes132 MB★★★★☆★★★★☆
NeMo FastConformer PTpt132 MB★★★★☆★★★★☆
NeMo Parakeet TDT 0.6B (int8)25 EU languages671 MB★★★★★★★★☆☆
Dolphin Base CTC Multizh, ja, ko, th, vi, ar, hi, bn, ru105 MB★★★★☆★★★★☆
Whisper Tiny (ONNX)99+ languages154 MB★★★☆☆★★☆☆☆
WenetSpeech Yue U2++zh, yue, en135 MB★★★★☆★★★★☆
Omnilingual 300M v21147 languages367 MB★★★☆☆★★★☆☆
Zipformer RU (int8)ru74 MB★★★★☆★★★★☆
Zipformer VI 30M (int8)vi35 MB★★★☆☆★★★★★

نماذج البث المباشر (CPU/WASM)

10 نماذج بث مباشر في الوقت الفعلي. قم بالنسخ أثناء التحدث مع زمن استجابة منخفض.

النموذجاللغاتالحجمالدقةالسرعة
Zipformer EN Krokoen71 MB★★★☆☆★★★★★
Zipformer FR Krokofr71 MB★★★☆☆★★★★★
Zipformer DE Krokode71 MB★★★☆☆★★★★★
Zipformer ES Krokoes156 MB★★★☆☆★★★★☆
Zipformer ZH (int8)zh77 MB★★★☆☆★★★★★
Zipformer ZH 2025 (int8)zh167 MB★★★★☆★★★★☆
Zipformer RU Vosk (int8)ru29 MB★★★☆☆★★★★★
Zipformer Multi (8 lang)ar, en, id, ja, ru, th, vi, zh339 MB★★★☆☆★★★☆☆
Zipformer BN Voskbn94 MB★★★☆☆★★★★☆
NeMo CTC EN 80ms (int8)en132 MB★★★★☆★★★★★

نماذج WebGPU (يتطلب GPU)

9 نماذج مسرّعة بـ WebGPU تشمل Cohere Transcribe وVoxtral Mini 4B Realtime (موصى بها) وWhisper. أفضل دقة وسرعة، يتطلب GPU متوافق.

النموذجاللغاتالحجمالدقةالسرعة
Cohere Transcribe (q4)14 languages~2.1 GB★★★★★★★★★☆
Cohere Transcribe (q4f16)14 languages~1.5 GB★★★★★★★★★☆
Voxtral Mini 4B Realtime13 languages~2.3 GB★★★★★★★★★★
Whisper Tiny ENen120 MB★★★☆☆★★★★☆
Whisper Tiny99+ languages122 MB★★★☆☆★★★★☆
Whisper Base99+ languages208 MB★★★★☆★★★☆☆
Whisper Small99+ languages586 MB★★★★☆★★★☆☆
Whisper Medium99+ languages680 MB★★★★★★★☆☆☆
Whisper Large V3 Turbo99+ languages759 MB★★★★★★★☆☆☆

نماذج الترجمة

اختر TranslateGemma للحصول على أفضل جودة وسرعة، أو Opus-MT للترجمة السريعة على CPU، أو Qwen LLM للتغطية المتعددة اللغات الواسعة.

TranslateGemma 4B (WebGPU) — موصى به

نموذج ترجمة متخصص من Google يتميز بأعلى جودة وأسرع سرعة بين جميع نماذج الترجمة المحلية. يدعم 51 لغة مع ترجمة ثنائية الاتجاه. يتطلب WebGPU.

النموذجاللغاتالحجمالجودةالسرعة
TranslateGemma 4B (q4)51 languages~3.1 GB★★★★★★★★★★
TranslateGemma 4B (q4f16)51 languages~2.7 GB★★★★★★★★★★

Arabic, Bulgarian, Bengali, Catalan, Czech, Danish, German, Greek, English, Spanish, Estonian, Persian, Finnish, French, Gujarati, Hebrew, Hindi, Croatian, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Lithuanian, Latvian, Malayalam, Marathi, Dutch, Norwegian, Punjabi, Polish, Portuguese, Romanian, Russian, Slovak, Slovenian, Serbian, Swedish, Swahili, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, Chinese, Zulu

Qwen LLM (WebGPU)

نماذج لغوية كبيرة تدعم 119–201+ لغة. جودة أعلى لكن تتطلب GPU. الأفضل للترجمة المرنة متعددة اللغات.

النموذجاللغاتالحجمالجودةالسرعة
Qwen 2.5 0.5B28 languages~400 MB★★★☆☆★★★★☆
Qwen 3 0.6B119+ languages919 MB★★★★☆★★★☆☆
Qwen 3.5 0.8B201+ languages~1.6 GB★★★★★★★☆☆☆
Qwen 3.5 2B201+ languages~1.8 GB★★★★★★☆☆☆☆

Qwen 2.5: Japanese, Chinese, English, Korean, German, French, Spanish, Russian, Arabic, Portuguese, Thai, Vietnamese, Indonesian, Turkish, Dutch, Polish, Italian, Hindi, Swedish, Danish, Finnish, Hungarian, Romanian, Norwegian, Ukrainian, Czech, Estonian, Afrikaans

Qwen 3/3.5: 119–201+ languages (multilingual)

Opus-MT (CPU/WASM)

74 زوج لغة، ~110 MB لكل منها. سريع وخفيف، يعمل على أي جهاز. الأفضل للترجمة أحادية الاتجاه.

src ↓ tgt →enjazhkodefresitruarhivitrukptnlpldasvficsrohuidnoetthafxh
en✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
ja✓
zh✓
ko✓
de✓✓✓
fr✓✓✓✓✓
es✓✓✓✓✓
it✓✓✓
ru✓✓✓✓
ar✓
hi✓
vi✓
tr✓
uk✓✓
pt
nl✓✓
pl✓
da✓✓
sv✓
fi✓✓
cs✓
ro✓✓
hu✓
id✓
no✓
et✓
th✓
af✓
xh✓

نماذج TTS (تحويل النص إلى كلام)

136 نموذجًا عبر 52 لغة. جميعها تعمل على CPU عبر WASM — لا حاجة لـ GPU. مدعومة بمحركات Piper وCoqui وMimic3 وVITS وMatcha.

إعدادات TTS

  • سرعة الكلام — يتحكم في سرعة تشغيل الكلام المُركّب. اضبط شريط تمرير السرعة لجعل المخرجات أسرع أو أبطأ حسب تفضيلك.
  • معرّف المتحدث — يتحكم في نبرة صوت الكلام المُركّب. تدعم العديد من النماذج معرّفات متحدثين متعددة، لكل منها صوت مختلف. تتضمن بعض النماذج متعددة المتحدثين أصواتًا من أجناس مختلفة، بحيث يمكنك اختيار صوت ذكوري أو أنثوي من خلال تحديد معرّفات متحدثين مختلفة.
اللغةالنماذجالمحركالمتحدثوننطاق الحجم
af1mimic31~94 MB
ar2piper181–95 MB
bg1coqui1~71 MB
bn2mimic3, coqui171–94 MB
ca3piper139–95 MB
cs2piper181–95 MB
cy2piper1–7~95 MB
da1piper1~95 MB
de8piper139–81 MB
el2piper, mimic3181–94 MB
en13piper1–90481–97 MB
es6piper1–239–95 MB
et1coqui1~71 MB
fa8piper, mimic3, matcha181–146 MB
fi2piper181–95 MB
fr8piper1–1639–95 MB
ga1coqui1~71 MB
gu1mimic31~94 MB
hi3piper1~95 MB
hr1coqui1~71 MB
hu3piper1~95 MB
id1piper1~95 MB
is4piper1~95 MB
it2piper139–95 MB
ka1piper1~95 MB
kk3piper1+39–81 MB
ko1mimic31~94 MB
lb1piper1~95 MB
lt1coqui1~71 MB
lv1piper1~95 MB
ml2piper1~95 MB
mt1coqui1~71 MB
ne3piper1+39–95 MB
nl4piper139–95 MB
no1piper1~95 MB
pl7piper1~95 MB
pt4piper181–95 MB
ro1piper1~95 MB
ru4piper1~95 MB
sk1piper1~95 MB
sl1piper1~95 MB
sr1pipermulti~95 MB
sv2piper1+~95 MB
sw1piper1~95 MB
tn1mimic3multi~94 MB
tr3piper1~95 MB
uk2piper1+39–95 MB
vi4piper, mimic31–6546–95 MB
yue1vits1~114 MB
zh3vits, piper, matcha1–21881–213 MB

استكشاف الأخطاء وإصلاحها

مشاكل شائعة

فشل تنزيل النموذج: تحقق من اتصالك بالإنترنت للتنزيل الأولي. يتم تخزين النماذج محليًا في IndexedDB، لذا تعمل الاستخدامات اللاحقة بدون اتصال. حاول مسح بيانات المتصفح إذا كانت التنزيلات تالفة.

ASR لا يتعرف على الكلام: تأكد من اختيار نموذج ASR الصحيح للغة المصدر. جرّب نموذجًا أكبر لدقة أفضل. تحقق من أن الميكروفون يعمل وأن الأذونات قد مُنحت.

جودة الترجمة منخفضة: نماذج Opus-MT محسّنة للسرعة على حساب الجودة. للحصول على نتائج أفضل، جرّب نماذج TranslateGemma أو Qwen LLM إذا كان جهازك يدعم WebGPU. تأكد من اختيار زوج اللغات الصحيح.

WebGPU غير متاح: يتطلب WebGPU متصفحًا وGPU متوافقين. ارجع إلى النماذج القائمة على WASM (sherpa-onnx، Opus-MT) التي تعمل على أي متصفح حديث بدون متطلبات GPU.

نصائح الأداء

  1. استخدم نماذج WebGPU عند توفرها لمعالجة أسرع بشكل ملحوظ
  2. أغلق علامات تبويب المتصفح الأخرى لتوفير ذاكرة لتحميل النماذج
  3. اختر نماذج أصغر للأجهزة منخفضة الأداء أو عندما تكون السرعة هي الأولوية
  4. نماذج WASM (sherpa-onnx، Opus-MT) أكثر توافقًا ولكنها أبطأ من بدائل WebGPU
  5. راقب استخدام ذاكرة المتصفح — قد تتطلب النماذج الكبيرة 2GB+ من ذاكرة المتصفح

هل تحتاج مزيدًا من المساعدة؟ قم بزيارة مستودع GitHub الخاص بنا للحصول على دعم المجتمع وأدلة توافق النماذج وأحدث التحديثات حول ميزات الوضع المحلي (بدون اتصال).

GitHub Repository