Full transcript
Hugging Face's Real-Time Voice Loop
0:00طرحت Hugging Face المصدر
0:01المفتوح لحلقة الصوت
0:02بالكامل في الوقت
0:02الفعلي ، من التقاط
0:03الميكروفون إلى
0:04الإجابة الصوتية ، مع
0:05إمكانية استبدال كل
0:06مرحلة . يُطلق على
0:07المستودع اسم " من
0:08الكلام إلى الكلام " .
0:09برخصة Apache 2.0 وعملية
0:11تثبيت واحدة عبر pip .
0:12أربع مراحل تشغل هذا
0:14النظام . كشف الصوت ،
0:15وتحويل الكلام إلى نص ،
0:16ونموذج لغوي ، ثم تحويل
0:18النص إلى كلام . الجزء
0:19الذي جذب انتباهي هو
0:20البوابة الأمامية . فهو
0:21يتحدث ببروتوكول OpenAI
The 1-Line OpenAI Realtime API Hack
0:23في الوقت الفعلي . أنت
0:24توجه عميل Python الرسمي
0:25الخاص بـ OpenAI إلى
0:26حاسوبك المحمول . نفس
0:27كود العميل ، ونفس
0:29الأحداث . السطر الوحيد
0:30الذي تغيره هو عنوان URL
0:31الأساسي . ليصبح الآن
0:34127.0.0.1 . تطبيقك لا يدرك
0:36أنه توقف عن التحدث
0:38إلى OpenAI . إنه يتلقى
0:39الصوت فقط في المقابل .
0:40وكل مرحلة تحته هي
0:41عبارة عن " علامة " ( flag ) .
0:43مُعرف مختلف ، نموذج
0:44مختلف ، وصوت مختلف .
0:46وهذا يترك سؤالاً
0:47صادقاً واحداً . أي من
0:48تلك المراحل الأربع
0:49تجعل الشخص ينتظر ؟
0:50تغيرت هذه الإجابة في
0:52الأول من يوليو بمعامل
0:5435 ضعفاً و 7000 نجمة . 9000
0:56روبوت تشغل هذا النظام
0:57بالفعل . دعني أريك
0:58الأرقام . نبذة سريعة
1:00عن السياق لأن الاسم
1:01أقدم من الشيء نفسه . تم
1:02إطلاق هذا المستودع في
1:04أغسطس 2024 كعرض تجريبي
1:06ممتع . لقد أُعيد بناؤه
1:07منذ ذلك الحين ،
1:08والنسخة التي طُرحت
1:09هذا الأسبوع هي شيء
1:10مختلف تماماً . خادم
1:11websocket ، ووضع مقبس صوت
1:12خام ، ووضع ميكروفون
1:14عادي عندما تريد فقط
1:15التحدث إلى حاسوبك .
Silero VAD & Interruptible AI
1:17لنبدأ من حيث يبدأ
1:18الصوت . يأتي نظام كشف
1:20الصوت Salo الإصدار 5 في
1:21المقدمة ليقرر متى
1:22بدأت في التحدث ومتى
1:24توقفت . قد يبدو هذا
1:25مجرد تفاصيل تقنية .
1:27لكنه السبب الأكبر
1:28الذي يجعل الوكيل
1:28الصوتي يبدو مهذباً أو
1:30وقحاً . لديك أيضاً
1:31أدوات التحكم في
1:31الإعدادات . الحد
1:32الأدنى للصمت قبل أن
1:33يقرر انتهاء دورك هو 64
1:34مللي ثانية في
1:35الإعدادات الافتراضية
1:36. إذا رفعته ، سينتظرك
1:38المساعد بينما تفكر .
1:39وإذا خفضته ، سيقاطعك
1:40عند أي توقف . ذلك الرقم
1:42الواحد يشكل معظم
1:43شخصية النظام . كما أنه
1:44يتعامل مع المقاطعة
1:46أيضاً . عند تفعيل
1:47استجابة المقاطعة ،
1:47سيقوم التحدث فوق
1:48المساعد بإيقاف ما كان
1:49يقوله في منتصف الجملة
1:50، تماماً كما يتوقف
1:51الإنسان . حاول فعل ذلك
1:52مع واجهة برمجة
1:53تطبيقات الطلب
1:54والاستجابة العادية .
Speech-to-Text: NVIDIA Parakeet TDT vs Whisper
1:55المرحلة الثانية هي
1:56النسخ ، والافتراضي
1:58هنا ليس Whisper بعد الآن .
1:59إنه نموذج NVIDIA Parakeet TDT
2:01بـ 600 مليون معلمة ،
2:03الإصدار 3 . يدعم 25 لغة
2:05أوروبية ويكتشف اللغة
2:06التي تتحدث بها دون
2:08الحاجة لإخباره . معدل
2:09خطأ في الكلمات يبلغ
2:116.34 % في لوحة صدارة ASR
2:12المفتوحة ، بسرعة تزيد
2:14عن 3000 ضعف الوقت
2:15الفعلي . يتم نسخ 10
2:16دقائق من الصوت المسجل
2:18في حوالي خُمس ثانية
2:19من الحوسبة بواسطة
2:21نموذج بـ 600 مليون
2:22معلمة . لا يزال Whisper
2:23متاحاً إذا كنت تريده
2:25عبر transformers أو faster-whisper
2:27. على أجهزة Mac ، يوجد
2:28Lightning Whisper على MLX
2:29المصمم للغة الصينية .
2:31يمكنك تفعيل Perfimer
2:32باستخدام علامة واحدة
2:33فقط . نفس المسار ، لكن
2:34بآذان مختلفة . المرحلة
LLMs & TTS: Qwen3-TTS, Kokoro & Apple MLX
2:36الثالثة هي العقل .
2:37وهنا يرفض المستودع
2:38بشكل قاطع الاختيار
2:40نيابة عنك . أي نقطة
2:41نهاية متوافقة مع OpenAI
2:43تعمل . OpenAI نفسها ، أو
2:44مزودو استنتاج Hugging Face
2:46، أو OpenRouter ، أو خادم VLLM
2:48، أو خادم Llama.cpp الذي
2:49يعمل تحت مكتبك ، أو
2:51تخطي الخادم وتشغيل
2:53النموذج داخلياً عبر
2:54Transformers على وحدة
2:56معالجة رسومية أو MLXLM
2:57على رقائق Apple . هذه
2:59المرحلة عبارة عن منفذ
3:00( Socket ) . وما ترسله إليه
3:02هو شأنك الخاص .
3:03المرحلة الرابعة هي
3:04الصوت ، وقد حصل الخيار
3:05الافتراضي على ترقية
3:06كبيرة . نموذج Qwen2 - TTS ،
3:07وهو نموذج صوتي مخصص
3:09بتردد 12 هرتز و 1.7
3:10مليار معلمة ، والذي
3:11أطلقته علي بابا كمصدر
3:13مفتوح تحت رخصة Apache 2
3:14في يناير . ثلاث ثوانٍ
3:15من الصوت المرجعي
3:16كافية لاستنساخ أي
3:18نبرة . يبث الصوت في حزم
3:19بحوالي 320 مللي ثانية ،
3:21وتصل الحزمة الأولى في
3:23أقل من 120 . هذا الرقم
3:25يهم أكثر من المجموع
3:26الكلي لأن لحظة وصول
3:27المقطع الأول تجعل
3:28المستخدم يشعر
3:29بالاستجابة الفورية .
3:30ويمكنك استبداله بشيء
3:32أصغر في نفس اللحظة .
3:33مثل Cocooro ، أو Pocket TTS ، أو
3:35Chat TTS ، أو MetaMMS إذا كنت
3:37بحاجة إلى لغة لا
3:38تغطيها الخيارات
3:40الأخرى ؛ أي آذان ، أي
3:41عقل ، أي فم . لذا نعود
3:43إلى السؤال الذي بدأت
3:44به : احسب المجموع .
3:45الكشف يتم في أجزاء من
3:47الثانية ، و Parakeet فعال
3:48جداً في أجزاء من
3:49الثانية . يبدأ الصوت
3:50في أقل من عُشر ثانية .
3:52ثلاث من المراحل
3:53الأربع تكاد تكون
3:54مجانية ، مما يترك
3:55نموذج اللغة ليتحمل
3:56التأخير بالكامل
3:57بمفرده . في السلسلة
3:58المتتابعة ، لا يمكن
3:59نطق أي شيء حتى ينتج
4:00النموذج نصاً ، وهو
4:02يريد التفكير أولاً .
4:03في الأول من يوليو ،
Solving Latency: Gemma 4 on Cerebras Wafer-Scale
4:04نشرت Hugging Face وصفة مع
4:06Cerebras تستهدف هذه
4:07المرحلة مباشرة . Parakeet
4:09في المقدمة ، و Qwen2 - TTS في
4:10الخلفية ، وفي المنتصف
4:12نموذج Google DeepMind Gemma 2 بـ
4:1427 مليار معلمة يعمل
4:15على أجهزة Cerebras ذات
4:17الرقاقة الواحدة . تم
4:18قياس 1851 رمزاً في
4:20الثانية بواسطة Artificial
4:22Analysis ، أي حوالي 35 ضعف
4:23سرعة نقطة نهاية GPU
4:25العادية . أول رمز يعود
4:27في ثانية ونصف . وهذا
4:29الرقم يتضمن بالفعل
4:30وقت تفكير النموذج قبل
4:31أن يجيب . وهذا ليس
4:32نموذجاً صغيراً
4:34رخيصاً . Gemma 2 ينافس Claude
4:353.5 Sonnet على مؤشر Artificial
4:37Analysis Intelligence ، بينما
4:39يعمل بسرعة أكبر بـ 18
4:40مرة على تلك الرقاقة .
4:42أنت هنا لا تضحي
4:43بالذكاء من أجل السرعة
4:44. طريقة تشغيله تتطلب
4:46تعديل علامة واحدة فقط
4:47. اسم النموذج Google / Gemma -
4:492-27 b-it-Cerebras الموجه إلى
4:52موجه Hugging Face . لا شيء
4:54آخر في مسارك يتغير .
4:55هذا هو الغرض الحقيقي
4:56من التصميم المعياري .
4:58والصياغة التي
4:58تستخدمها Hugging Face أكثر
5:00دقة من مجرد السرعة
5:01الخام . إنهم يسعون
5:02لتحسين المئين الخامس
5:03والتسعين ، وليس
5:04المتوسط فقط . فالتوقف
5:05العرضي لمدة 3 ثوانٍ هو
5:06ما يجعل المساعد يبدو
5:08معطلاً . كان متوسطك
5:09جيداً . كانت نهايتك هي
Running Local Voice AI (llama.cpp & CPU-Only)
5:11المشكلة . الآن اعكس
5:12الأمر ، لأن أياً من
5:13هذا لا يسحبك إلى
5:15سحابة شخص آخر . شغّل
5:16خادم Llama مع Gemma 4E4B و GGUF .
5:19وجه خط الأنابيب إلى
5:21127.0.0.1 على المنفذ 8080 .
5:24وهذا هو الإعداد
5:25بالكامل . على جهاز Mac ،
5:27يختصر الأمر في علامة
5:28واحدة . إعدادات Mac
5:29المحلية المثالية .
5:30معدن ( Metal ) لكل النماذج
5:32الثلاثة . Parakeet للسمع .
5:34MLXLM للتفكير . QN3TS عبر MLX
5:37audio للنطق . يعمل في وضع
5:40الطيران . باستخدام
5:41المعالج فقط . Cocooro
5:42يحتوي على 82 مليون
5:43معلمة و 54 صوتاً ويعمل
5:45بستة أضعاف السرعة
5:46الحقيقية على حاسوب
5:47محمول بدون معالج
5:48رسومي . أو QI Pocket TTS ، بـ
5:50100 مليون معلمة ، ويخرج
5:52أول جزء صوتي في حوالي
5:54200 مللي ثانية . وهذا
5:55يقودنا إلى الجزء الذي
The OpenAI Cost Trap (32/64 Per Million Tokens)
5:57يهتم به فريقك المالي .
5:58نموذج OpenAI للوقت
5:59الفعلي يحاسب على
6:00الصوت بالرمز . 32
6:01دولاراً لكل مليون رمز
6:03دخل ، و 64 دولاراً
6:04للخرج . يُحاسب كلامك
6:06بمعدل رمز واحد لكل 100
6:07مللي ثانية . وكلامه
6:08بمعدل رمز واحد لكل 50 .
6:10لذا ، دقيقة من حديثك
6:12تساوي 600 رمز ، ودقيقة
6:13من رده تساوي 1200 .
6:15تتراوح الجلسات
6:16المقاسة بين 5 سنتات و
6:1746 سنتاً لكل دقيقة
6:19محادثة . والآن اضرب
6:20ذلك في قائمة انتظار
6:21دعم تعمل طوال اليوم .
6:22وقبل أن تصنف هذا
6:23كمشروع عطلة نهاية
6:25الأسبوع ، هناك أكثر من
6:269000 جهاز Reachi mini تشغل
6:27هذه الحزمة الآن . وهو
6:29روبوت مكتبي بسعر 299
6:30دولاراً تبنيه Hugging Face
6:32مع Pollen Robotics . تم بيع
6:3410,000 وحدة حتى شهر مايو .
Reachy Mini Robots & Pipeline Caveats
6:36سأكون صريحاً بشأن
6:37تكلفته عليك . هذه
6:38سلسلة متتالية ، وليست
6:39نموذج صوتياً واحداً
6:41متكاملاً . لذا فأنت
6:42تمتلك أربعة أجزاء
6:43متحركة وأربع طرق
6:44للفشل دون عقد دعم لأي
6:46منها . والأمور تتغير
6:47بسرعة . تشكيلة عام 2024 ،
6:49Parlor TTS و Melotise و Distill
6:51Whisper ، اختفت من ملف
6:53القراءة . ثبّت
6:54إصداراتك . إليك ما
6:56سأفعله في أمسية فراغ .
6:57قم بتثبيته ، وشغّل
6:59علامة إعدادات Mac أو
7:00وصفة llama.cpp ، وقس كل
7:01مرحلة من المراحل
7:03الأربع بنفسك على
7:04عتادك الخاص . الحجة
7:05الكاملة لهذا
7:06المستودع هي أنه يمكنك
7:07أخيراً قياس أي مرحلة
Final Verdict: Measure Your Audio Bottleneck
7:09هي البطيئة . حلقة
7:10صوتية كاملة ، بترخيص
7:11Apache ، وتستجيب لمكتبة
7:13عميل OpenAI نفسها . بدّل
7:15علامة واحدة وستصبح
7:16على شرائح wafer scale . بدّل
7:18أخرى وستصبح غير متصل
7:19بالإنترنت على حاسوب
7:20محمول . اذهب واكتشف
7:21عنق الزجاجة لديك .
7:22تتغير رموز السحابة
7:24وحزمة OpenAI كل أسبوع .