Free YouTube Transcribe

Video transcript

Run Local Real-Time Voice AI at 1,800+ Tokens/Sec

Cloud Codes · 1,378 words · 7 min read

Want to search this transcript, jump the video from any line, or download it as TXT, SRT, or VTT?

Open in the transcript tool

Full transcript

Hugging Face's Real-Time Voice Loop

0:00طرحت Hugging Face المصدر

0:01المفتوح لحلقة الصوت

0:02بالكامل في الوقت

0:02الفعلي ، من التقاط

0:03الميكروفون إلى

0:04الإجابة الصوتية ، مع

0:05إمكانية استبدال كل

0:06مرحلة . يُطلق على

0:07المستودع اسم " من

0:08الكلام إلى الكلام " .

0:09برخصة Apache 2.0 وعملية

0:11تثبيت واحدة عبر pip .

0:12أربع مراحل تشغل هذا

0:14النظام . كشف الصوت ،

0:15وتحويل الكلام إلى نص ،

0:16ونموذج لغوي ، ثم تحويل

0:18النص إلى كلام . الجزء

0:19الذي جذب انتباهي هو

0:20البوابة الأمامية . فهو

0:21يتحدث ببروتوكول OpenAI

The 1-Line OpenAI Realtime API Hack

0:23في الوقت الفعلي . أنت

0:24توجه عميل Python الرسمي

0:25الخاص بـ OpenAI إلى

0:26حاسوبك المحمول . نفس

0:27كود العميل ، ونفس

0:29الأحداث . السطر الوحيد

0:30الذي تغيره هو عنوان URL

0:31الأساسي . ليصبح الآن

0:34127.0.0.1 . تطبيقك لا يدرك

0:36أنه توقف عن التحدث

0:38إلى OpenAI . إنه يتلقى

0:39الصوت فقط في المقابل .

0:40وكل مرحلة تحته هي

0:41عبارة عن " علامة " ( flag ) .

0:43مُعرف مختلف ، نموذج

0:44مختلف ، وصوت مختلف .

0:46وهذا يترك سؤالاً

0:47صادقاً واحداً . أي من

0:48تلك المراحل الأربع

0:49تجعل الشخص ينتظر ؟

0:50تغيرت هذه الإجابة في

0:52الأول من يوليو بمعامل

0:5435 ضعفاً و 7000 نجمة . 9000

0:56روبوت تشغل هذا النظام

0:57بالفعل . دعني أريك

0:58الأرقام . نبذة سريعة

1:00عن السياق لأن الاسم

1:01أقدم من الشيء نفسه . تم

1:02إطلاق هذا المستودع في

1:04أغسطس 2024 كعرض تجريبي

1:06ممتع . لقد أُعيد بناؤه

1:07منذ ذلك الحين ،

1:08والنسخة التي طُرحت

1:09هذا الأسبوع هي شيء

1:10مختلف تماماً . خادم

1:11websocket ، ووضع مقبس صوت

1:12خام ، ووضع ميكروفون

1:14عادي عندما تريد فقط

1:15التحدث إلى حاسوبك .

Silero VAD & Interruptible AI

1:17لنبدأ من حيث يبدأ

1:18الصوت . يأتي نظام كشف

1:20الصوت Salo الإصدار 5 في

1:21المقدمة ليقرر متى

1:22بدأت في التحدث ومتى

1:24توقفت . قد يبدو هذا

1:25مجرد تفاصيل تقنية .

1:27لكنه السبب الأكبر

1:28الذي يجعل الوكيل

1:28الصوتي يبدو مهذباً أو

1:30وقحاً . لديك أيضاً

1:31أدوات التحكم في

1:31الإعدادات . الحد

1:32الأدنى للصمت قبل أن

1:33يقرر انتهاء دورك هو 64

1:34مللي ثانية في

1:35الإعدادات الافتراضية

1:36. إذا رفعته ، سينتظرك

1:38المساعد بينما تفكر .

1:39وإذا خفضته ، سيقاطعك

1:40عند أي توقف . ذلك الرقم

1:42الواحد يشكل معظم

1:43شخصية النظام . كما أنه

1:44يتعامل مع المقاطعة

1:46أيضاً . عند تفعيل

1:47استجابة المقاطعة ،

1:47سيقوم التحدث فوق

1:48المساعد بإيقاف ما كان

1:49يقوله في منتصف الجملة

1:50، تماماً كما يتوقف

1:51الإنسان . حاول فعل ذلك

1:52مع واجهة برمجة

1:53تطبيقات الطلب

1:54والاستجابة العادية .

Speech-to-Text: NVIDIA Parakeet TDT vs Whisper

1:55المرحلة الثانية هي

1:56النسخ ، والافتراضي

1:58هنا ليس Whisper بعد الآن .

1:59إنه نموذج NVIDIA Parakeet TDT

2:01بـ 600 مليون معلمة ،

2:03الإصدار 3 . يدعم 25 لغة

2:05أوروبية ويكتشف اللغة

2:06التي تتحدث بها دون

2:08الحاجة لإخباره . معدل

2:09خطأ في الكلمات يبلغ

2:116.34 % في لوحة صدارة ASR

2:12المفتوحة ، بسرعة تزيد

2:14عن 3000 ضعف الوقت

2:15الفعلي . يتم نسخ 10

2:16دقائق من الصوت المسجل

2:18في حوالي خُمس ثانية

2:19من الحوسبة بواسطة

2:21نموذج بـ 600 مليون

2:22معلمة . لا يزال Whisper

2:23متاحاً إذا كنت تريده

2:25عبر transformers أو faster-whisper

2:27. على أجهزة Mac ، يوجد

2:28Lightning Whisper على MLX

2:29المصمم للغة الصينية .

2:31يمكنك تفعيل Perfimer

2:32باستخدام علامة واحدة

2:33فقط . نفس المسار ، لكن

2:34بآذان مختلفة . المرحلة

LLMs & TTS: Qwen3-TTS, Kokoro & Apple MLX

2:36الثالثة هي العقل .

2:37وهنا يرفض المستودع

2:38بشكل قاطع الاختيار

2:40نيابة عنك . أي نقطة

2:41نهاية متوافقة مع OpenAI

2:43تعمل . OpenAI نفسها ، أو

2:44مزودو استنتاج Hugging Face

2:46، أو OpenRouter ، أو خادم VLLM

2:48، أو خادم Llama.cpp الذي

2:49يعمل تحت مكتبك ، أو

2:51تخطي الخادم وتشغيل

2:53النموذج داخلياً عبر

2:54Transformers على وحدة

2:56معالجة رسومية أو MLXLM

2:57على رقائق Apple . هذه

2:59المرحلة عبارة عن منفذ

3:00( Socket ) . وما ترسله إليه

3:02هو شأنك الخاص .

3:03المرحلة الرابعة هي

3:04الصوت ، وقد حصل الخيار

3:05الافتراضي على ترقية

3:06كبيرة . نموذج Qwen2 - TTS ،

3:07وهو نموذج صوتي مخصص

3:09بتردد 12 هرتز و 1.7

3:10مليار معلمة ، والذي

3:11أطلقته علي بابا كمصدر

3:13مفتوح تحت رخصة Apache 2

3:14في يناير . ثلاث ثوانٍ

3:15من الصوت المرجعي

3:16كافية لاستنساخ أي

3:18نبرة . يبث الصوت في حزم

3:19بحوالي 320 مللي ثانية ،

3:21وتصل الحزمة الأولى في

3:23أقل من 120 . هذا الرقم

3:25يهم أكثر من المجموع

3:26الكلي لأن لحظة وصول

3:27المقطع الأول تجعل

3:28المستخدم يشعر

3:29بالاستجابة الفورية .

3:30ويمكنك استبداله بشيء

3:32أصغر في نفس اللحظة .

3:33مثل Cocooro ، أو Pocket TTS ، أو

3:35Chat TTS ، أو MetaMMS إذا كنت

3:37بحاجة إلى لغة لا

3:38تغطيها الخيارات

3:40الأخرى ؛ أي آذان ، أي

3:41عقل ، أي فم . لذا نعود

3:43إلى السؤال الذي بدأت

3:44به : احسب المجموع .

3:45الكشف يتم في أجزاء من

3:47الثانية ، و Parakeet فعال

3:48جداً في أجزاء من

3:49الثانية . يبدأ الصوت

3:50في أقل من عُشر ثانية .

3:52ثلاث من المراحل

3:53الأربع تكاد تكون

3:54مجانية ، مما يترك

3:55نموذج اللغة ليتحمل

3:56التأخير بالكامل

3:57بمفرده . في السلسلة

3:58المتتابعة ، لا يمكن

3:59نطق أي شيء حتى ينتج

4:00النموذج نصاً ، وهو

4:02يريد التفكير أولاً .

4:03في الأول من يوليو ،

Solving Latency: Gemma 4 on Cerebras Wafer-Scale

4:04نشرت Hugging Face وصفة مع

4:06Cerebras تستهدف هذه

4:07المرحلة مباشرة . Parakeet

4:09في المقدمة ، و Qwen2 - TTS في

4:10الخلفية ، وفي المنتصف

4:12نموذج Google DeepMind Gemma 2 بـ

4:1427 مليار معلمة يعمل

4:15على أجهزة Cerebras ذات

4:17الرقاقة الواحدة . تم

4:18قياس 1851 رمزاً في

4:20الثانية بواسطة Artificial

4:22Analysis ، أي حوالي 35 ضعف

4:23سرعة نقطة نهاية GPU

4:25العادية . أول رمز يعود

4:27في ثانية ونصف . وهذا

4:29الرقم يتضمن بالفعل

4:30وقت تفكير النموذج قبل

4:31أن يجيب . وهذا ليس

4:32نموذجاً صغيراً

4:34رخيصاً . Gemma 2 ينافس Claude

4:353.5 Sonnet على مؤشر Artificial

4:37Analysis Intelligence ، بينما

4:39يعمل بسرعة أكبر بـ 18

4:40مرة على تلك الرقاقة .

4:42أنت هنا لا تضحي

4:43بالذكاء من أجل السرعة

4:44. طريقة تشغيله تتطلب

4:46تعديل علامة واحدة فقط

4:47. اسم النموذج Google / Gemma -

4:492-27 b-it-Cerebras الموجه إلى

4:52موجه Hugging Face . لا شيء

4:54آخر في مسارك يتغير .

4:55هذا هو الغرض الحقيقي

4:56من التصميم المعياري .

4:58والصياغة التي

4:58تستخدمها Hugging Face أكثر

5:00دقة من مجرد السرعة

5:01الخام . إنهم يسعون

5:02لتحسين المئين الخامس

5:03والتسعين ، وليس

5:04المتوسط فقط . فالتوقف

5:05العرضي لمدة 3 ثوانٍ هو

5:06ما يجعل المساعد يبدو

5:08معطلاً . كان متوسطك

5:09جيداً . كانت نهايتك هي

Running Local Voice AI (llama.cpp & CPU-Only)

5:11المشكلة . الآن اعكس

5:12الأمر ، لأن أياً من

5:13هذا لا يسحبك إلى

5:15سحابة شخص آخر . شغّل

5:16خادم Llama مع Gemma 4E4B و GGUF .

5:19وجه خط الأنابيب إلى

5:21127.0.0.1 على المنفذ 8080 .

5:24وهذا هو الإعداد

5:25بالكامل . على جهاز Mac ،

5:27يختصر الأمر في علامة

5:28واحدة . إعدادات Mac

5:29المحلية المثالية .

5:30معدن ( Metal ) لكل النماذج

5:32الثلاثة . Parakeet للسمع .

5:34MLXLM للتفكير . QN3TS عبر MLX

5:37audio للنطق . يعمل في وضع

5:40الطيران . باستخدام

5:41المعالج فقط . Cocooro

5:42يحتوي على 82 مليون

5:43معلمة و 54 صوتاً ويعمل

5:45بستة أضعاف السرعة

5:46الحقيقية على حاسوب

5:47محمول بدون معالج

5:48رسومي . أو QI Pocket TTS ، بـ

5:50100 مليون معلمة ، ويخرج

5:52أول جزء صوتي في حوالي

5:54200 مللي ثانية . وهذا

5:55يقودنا إلى الجزء الذي

The OpenAI Cost Trap (32/64 Per Million Tokens)

5:57يهتم به فريقك المالي .

5:58نموذج OpenAI للوقت

5:59الفعلي يحاسب على

6:00الصوت بالرمز . 32

6:01دولاراً لكل مليون رمز

6:03دخل ، و 64 دولاراً

6:04للخرج . يُحاسب كلامك

6:06بمعدل رمز واحد لكل 100

6:07مللي ثانية . وكلامه

6:08بمعدل رمز واحد لكل 50 .

6:10لذا ، دقيقة من حديثك

6:12تساوي 600 رمز ، ودقيقة

6:13من رده تساوي 1200 .

6:15تتراوح الجلسات

6:16المقاسة بين 5 سنتات و

6:1746 سنتاً لكل دقيقة

6:19محادثة . والآن اضرب

6:20ذلك في قائمة انتظار

6:21دعم تعمل طوال اليوم .

6:22وقبل أن تصنف هذا

6:23كمشروع عطلة نهاية

6:25الأسبوع ، هناك أكثر من

6:269000 جهاز Reachi mini تشغل

6:27هذه الحزمة الآن . وهو

6:29روبوت مكتبي بسعر 299

6:30دولاراً تبنيه Hugging Face

6:32مع Pollen Robotics . تم بيع

6:3410,000 وحدة حتى شهر مايو .

Reachy Mini Robots & Pipeline Caveats

6:36سأكون صريحاً بشأن

6:37تكلفته عليك . هذه

6:38سلسلة متتالية ، وليست

6:39نموذج صوتياً واحداً

6:41متكاملاً . لذا فأنت

6:42تمتلك أربعة أجزاء

6:43متحركة وأربع طرق

6:44للفشل دون عقد دعم لأي

6:46منها . والأمور تتغير

6:47بسرعة . تشكيلة عام 2024 ،

6:49Parlor TTS و Melotise و Distill

6:51Whisper ، اختفت من ملف

6:53القراءة . ثبّت

6:54إصداراتك . إليك ما

6:56سأفعله في أمسية فراغ .

6:57قم بتثبيته ، وشغّل

6:59علامة إعدادات Mac أو

7:00وصفة llama.cpp ، وقس كل

7:01مرحلة من المراحل

7:03الأربع بنفسك على

7:04عتادك الخاص . الحجة

7:05الكاملة لهذا

7:06المستودع هي أنه يمكنك

7:07أخيراً قياس أي مرحلة

Final Verdict: Measure Your Audio Bottleneck

7:09هي البطيئة . حلقة

7:10صوتية كاملة ، بترخيص

7:11Apache ، وتستجيب لمكتبة

7:13عميل OpenAI نفسها . بدّل

7:15علامة واحدة وستصبح

7:16على شرائح wafer scale . بدّل

7:18أخرى وستصبح غير متصل

7:19بالإنترنت على حاسوب

7:20محمول . اذهب واكتشف

7:21عنق الزجاجة لديك .

7:22تتغير رموز السحابة

7:24وحزمة OpenAI كل أسبوع .

Recently added transcripts

Browse the whole transcript library

This transcript was generated from the captions YouTube publishes for this video. Get the transcript of any YouTube video atfreeyoutubetranscribe.com, free, unlimited, no sign-up.