كل شركة تقنية كبرى تشغّل نماذج تحويل الكلام إلى نص في السحابة، لكن يمكنك فعل الشيء نفسه محليًا على جهازك — بلا مفاتيح API، بلا حدود رفع، بلا مخاوف خصوصية. في هذا التمرين، ستستخدم Whisper، نموذج التعرّف على الكلام مفتوح المصدر من OpenAI، لتفريغ الصوت إلى نص.
ستستخدم whisper-cpp، منفذ C++ سريع للنموذج الأصلي المكتوب بـ Python. يعمل بالكامل على CPU (أو GPU إن توفّر)، وتثبيت Homebrew أمر واحد.
ثبّت الأدوات
ستحتاج إلى أداتين:
brew install whisper-cpp ffmpeg
whisper-cpp يشغّل نموذج التفريغ. FFMPEG يحوّل ملفات الصوت إلى تنسيق WAV بتردد 16kHz الذي يتطلبه Whisper. إن كنت قد أنجزت تمرين تحرير الفيديوهات، فـ FFMPEG مثبّت لديك بالفعل.
على Linux، ابنِ whisper-cpp من المصدر أو استخدم مدير حزم نظامك. راجع whisper.cpp repo للتعليمات.
نزّل نموذجًا
Whisper يأتي بأحجام متعددة — من tiny (75MB) إلى large (3GB). ستنزّل إصدارًا مُكمَّمًا من النموذج الكبير يقدّم توازنًا جيدًا بين الدقة وحجم الملف (~1GB):
curl -o ggml-large-v3-q5_0.bin -L \
'https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-large-v3-q5_0.bin?download=true'
احصل على صوت
تحتاج إلى صوت فيه كلام لتفريغه. اختر الخيار الأسهل بالنسبة لك:
- سجّل نفسك — استخدم QuickTime Player على macOS (File > New Audio Recording)، أو أي تطبيق تسجيل
- أعد استخدام الصوت من تمرين تحرير الفيديوهات — إن كان لديك مسار صوتي مستخرج بالفعل، استخدمه
- نزّل شيئًا — مقطع بودكاست، خطاب، محاضرة، أي شيء بكلام واضح
ما الذي ستفعله
- حوّل صوتك إلى تنسيق WAV بتردد 16kHz الذي يتوقعه Whisper
- شغّل التفريغ واحصل على مخرجات نصية بطوابع زمنية
- صدّر التفريغ كترجمات SRT أو VTT — التنسيقات القياسية المستخدمة لتسميات الفيديو
يمكن لـ Whisper أيضًا ترجمة الكلام من لغات أخرى إلى الإنجليزية. إن كان لديك صوت بلغة أخرى، يمكنك تجربة ذلك أيضًا.