Full transcript
Introduction
0:00لا يقتصر السباق نحو
0:01بناء ذكاء اصطناعي
0:02أكثر قدرة على جعل
0:03النماذج اللغوية أضخم
0:04فحسب . بل أصبح التركيز
0:05بشكل متزايد على نماذج
0:07العالم ، وهي أنظمة
0:08تفهم المكان وتتنبأ
0:09بكيفية تغير البيئات
0:10وتتفاعل مع العالم من
0:12حولها . يساهم جاستن
0:13جونسون في تشكيل هذا
0:14التحول . لقد شارك في
0:16تأسيس " وورلد لابس " مع "
0:17فا لي " ، وهو أستاذ
0:19مشارك في علوم الحاسوب
0:20بجامعة ميشيغان . سألته
0:22لماذا يعتقد الكثير من
0:23الباحثين أن نماذج
0:24العالم هي الحدود
0:25التالية للذكاء
0:25الاصطناعي . هناك
0:26اعتقاد مشترك ضمني بين
0:27العديد من الباحثين في
0:29هذا المجال بأن هناك
0:30شيئاً لا تقوم به
0:30النماذج اللغوية ،
0:31وبأنه ينبغي علينا
0:32بناء أنواع أخرى من
0:33النماذج . نماذج تؤدي
0:35مهاماً من نوع آخر . وهي
0:36مهام تتعلق بفهم
0:37العالم ، وتوليد
0:38العوالم ، ومحاكاة
0:40العوالم ، وإعادة
0:41بنائها ، والتخطيط
0:42للأفعال داخل هذه
0:43العوالم . كل هذه قدرات
0:45نريد لنماذجنا أن
0:46تمتلكها . وسبب
0:47اهتمامنا بهذا هو
0:48رغبتنا في بناء أنظمة
0:50ليست محصورة في واجهة
0:51نصية أو مجرد وكيل
0:52افتراضي ، أليس كذلك ؟
0:54فنحن نتطلع إلى رؤية
0:55أنظمة ذكاء اصطناعي
0:56تعمل كروبوتات موجودة
0:57في العالم الحقيقي
0:58وتتفاعل معه ، أو ربما
0:59نريد بناء عوالم
1:00افتراضية والعيش فيها
1:01ومحاكاة أشياء مثيرة
1:03للاهتمام هناك . لذا ،
1:04فإن كل هذه القدرات لا
1:05تبدو كأنها نابعة بشكل
1:07طبيعي من نموذج
1:08النمذجة اللغوية . أنا
1:09سام شيرينغتون ، وهذا
1:10هو بودكاست " تويمل "
1:11للذكاء الاصطناعي .
1:13لأكثر من عقد من الزمن
1:14، كنت أستكشف الأفكار
1:15والابتكارات التي
1:16تشكل مستقبل الذكاء
1:17الاصطناعي من خلال
1:19محادثات كهذه ، والتي
1:20تساعدك على فهم ما هو
1:21حقيقي ، وما هو قادم ،
1:22وما هو مهم . لنبدأ الآن
1:24. على مدى السنوات
1:37القليلة الماضية ،
1:39كانت هناك فكرة يتم
1:41تبنيها بشكل أساسي ،
1:42وهي أن نموذج العالم
1:44قد يكون خاصية ناشئة
1:46إما عن النماذج
1:47اللغوية أو نماذج
1:49الانتشار ؛ فمثلاً
1:51يمكن لنماذج الانتشار
1:53توضيح بعض الخصائص
1:54الفيزيائية للعالم ،
1:56أو يمكن للنماذج
1:57اللغوية سرد قصص تبدو
1:59وكأنها تعرف شيئاً عن
2:01العالم . و أعتقد أن
2:11هناك بضعة أسئلة
2:13تتبادر إلى ذهني هنا :
2:15أحدها ربما يطلب
2:16تعريفاً محدداً
2:18وواضحاً لنموذج
2:19العالم ، لأنني أعتقد
2:21أنه في بداية تلك
2:23المحادثات ، كان
2:24المقصود بنموذج
2:26العالم هو امتلاك هذه
2:28النماذج لمعرفة
2:29جوهرية بالعالم
2:30الحقيقي ، أي العالم
2:32الذي نعيش فيه . آه
2:38مؤخراً ، كما تعلم ،
2:40أشعر أن النقاش حول
2:41نماذج العالم قد تحول
2:43للحديث عن القدرة على
2:45خلق عوالم اصطناعية ،
2:47لكن مع جعلها متسقة
2:48ذاتياً وقابلة للتنقل
2:50، وخصائص أخرى من هذا
2:52القبيل . لذا ، أود أن
2:56أسمع منك توضيحاً حول
2:58هذه العلاقة ، وهل ترى
3:00نفس التحول في
3:01المصطلحات ، وأيضاً
3:03فيما يتعلق بفكرة "
3:04الانبثاق " . وهل نحتاج
3:08إلى أشياء جديدة ، أم
3:09أنه إذا زودنا النماذج
3:11الحالية بما يكفي من
3:13البيانات وقوة
3:14الحوسبة ، هل سيؤدي ذلك
3:15إلى مبتغانا ، أم لماذا
3:17لن نصل إلى ذلك ؟
3:18>> أعتقد أن هناك الكثير
Defining World Models
3:19من الأسئلة المثيرة
3:20للاهتمام التي تحتاج
3:21إلى تفكيك هنا . أعني ،
3:22أهم سؤال هو دعنا
3:24نتجاوزه أولاً . لا
3:25يوجد تعريف واضح
3:26لنماذج العالم يتفق
3:27عليه الجميع في هذا
3:28المجال . وأعتقد أن هذا
3:29يسبب جزءاً من
3:30الارتباك ، أليس كذلك ؟
3:32لا يوجد شيء يمكننا
3:33القول إنه نموذج يمتلك
3:35الخاصية " س " أو ينتج
3:37مدخلات ومخرجات معينة
3:38، ليكون نموذج عالم
3:40بالتعريف . أعتقد أننا
3:41كمجال لا نملك ذلك
3:43التعريف الدقيق لما
3:44نعنيه ، وهو ما يؤدي
3:45إلى هذا الغموض . لكن
3:46بالنسبة لنقطتك ،
3:47أعتقد أن هناك بضع نسخ
3:49لهذا الأمر ؛ فهناك
3:50مفهوم المعرفة
3:51الضمنية بالعالم الذي
3:52ذكرته ، وهناك أنواع
3:54أخرى من النماذج التي
3:55تنتج أنواعاً معينة من
3:57المدخلات والمخرجات .
3:58ربما إذا كان النموذج
3:59ينتج نصاً ، وإذا أنتج
4:01النوع الصحيح من
4:02النصوص ، فإن الطريقة
4:03الوحيدة التي مكنته من
4:05ذلك هي معرفته بشيء عن
4:06العالم الحقيقي أو
4:08كونه يصيغ نوعاً من
4:09العالم الضمني داخل
4:10أوزان شبكته العصبية .
4:12أو الأمر مشابه لنماذج
4:13الفيديو ، أليس كذلك ؟
4:15إذا كنت قادراً على
4:16إنشاء فيديو فائق
4:18الواقعية ، وتفصيلي ،
4:19ويحتوي على فيزياء ،
4:20وتدفق مياه بطرق دقيقة
4:22، فربما يكون النموذج
4:24قد صاغ ضمنياً شيئاً
4:25عن العالم الحقيقي
4:27ليتمكن من إنتاج مخرج
4:28من هذا النوع . لذا
4:30أعتقد أن هذا هو مفهوم
4:32نموذج العالم الضمني ،
4:34حيث قد تؤدي مهاماً
4:36عديدة ، لكن هناك
4:37أنواعاً معينة من
4:39الإجابات التي تتطلب
4:41صياغة ضمنية لشيء ما
4:42عن العالم . لكنني
4:44أعتقد أيضاً أن هناك
4:45خيطين آخرين مثيرين
4:46للاهتمام في هذا الصدد
4:48. أعتقد أن مصطلح "
4:49نموذج العالم " في حد
4:50ذاته يعود في الواقع
4:51إلى أدبيات التعلم
4:52التعزيزي ، وهناك
4:53تعريف تقني محدد يتعلق
4:54بعمليات اتخاذ القرار
4:55ماركوف الجزئية ( POMDPs )
4:56قد نتطرق إليه لاحقاً .
4:57أجل ، ولكن هناك مصطلح
4:59تقني محدد لنمذجة
5:00العالم يعود لأدبيات
5:01التعلم التعزيزي منذ
5:03فترة طويلة . وهناك خيط
5:04آخر أعتقد أنه انتهى
5:06بنا إلى أننا نتحدث
5:07كثيراً عن النماذج
5:08التوليدية خلال
5:09العامين الماضيين .
5:10فنموذج الصورة هو
5:12نموذج ينتج صوراً .
5:13ونموذج الفيديو هو
5:14نموذج ينتج مقاطع
5:15فيديو . وربما ينبغي أن
5:17يكون نموذج العالم
5:18نموذجاً ينتج عوالم .
5:19ولكن ماذا يعني إنتاج
5:20أو توليد عالم ؟ لذا
5:22أعتقد الآن أن لدينا
5:23هذه الخيوط الثلاثة
5:24المختلفة التي
5:24يستخدمها أشخاص
5:25مختلفون في المجتمع .
5:26وهي تدور حول مفهوم
5:27نمذجة العالم الضمني ،
5:28أي هل يمكنني الإجابة
5:30على مسائل صعبة للغاية
5:31، ولكن لا بد أنني
5:32أنمذج شيئاً عن العالم
5:33للحصول على الإجابة
5:34الصحيحة ؟ أو ربما هناك
5:36صياغة التعلم
5:37التعزيزي المحددة
5:38لنموذج العالم ، ثم
5:40هناك نموذج توليدي
5:41ينشئ أو يولد عوالم . هل
5:44ترى هذا النموذج
5:45الضمني للعالم مجرد
5:47تعريف آخر أم مجموعة
5:49معتقدات غير دقيقة ؟
5:51عندما تسمع ذلك ، هل
5:53تشعر أنها نماذج عالم
5:55فعلاً ؟ هل تعتقد أن
5:58هذه طريقة صائبة
5:59للتفكير في نماذج
6:01العالم ، أم تعتقد أن
6:02نماذج العالم لها
6:04خصائص لا تميز النماذج
6:06الحالية التي نتحدث
6:08عنها مثل الرؤية
6:09واللغة ؟ أعتقد
6:11تقريباً أنها جميعاً
6:13صالحة . أعني أن
6:14الصعوبة تكمن في أن
6:15الأشياء الثلاثة التي
6:16ذكرتها للتو هي أنظمة
6:17مثيرة للاهتمام
6:18للغاية . إنها نماذج
6:19مثيرة للاهتمام حقاً .
6:21وجميعها تمتلك خصائص
6:22تجعلنا كمجتمع ملزمين
6:24ببنائها جميعاً . ولكن
6:25ربما ينبغي علينا
6:26ابتكار مصطلحات أفضل
6:27حتى لا نربك بعضنا
6:28البعض بإطلاق نفس
6:29المصطلح على أنظمة
6:30مختلفة . وأعتقد أن هذا
6:32هو لب الموضوع . لذا ،
6:34أرى أنه ربما في
6:35الأدبيات الأكاديمية
6:36خلال العام الماضي ،
6:37تبلور مصطلح " نموذج
6:38العالم " بشكل أكبر
6:39ليصبح نوعاً خاصاً من
6:41نماذج الفيديو
6:42التفاعلية في الوقت
6:43الفعلي ، وهذا هو ما
6:44بات يُطلق عليه عادةً "
6:45نماذج العالم " في
6:46الأدبيات خلال العام
6:48الماضي أو نحو ذلك .
6:49لكنني أعتقد أن كل
6:50الخصائص الأخرى التي
6:52ناقشناها مثيرة
6:53للاهتمام ومفيدة حقاً
6:54، وخاصة مفهوم نموذج
6:55العالم الضمني . أعتقد
6:57أن هذا يمكن تطبيقه
6:58على أي شيء . وبغض النظر
7:00عن نوع البيانات التي
7:01تعالجها ، وبغض النظر
7:02عن نوع النظام الذي
7:03تبنيه ، أعتقد أنه إذا
7:04وصل إلى مستوى معين من
7:05التعقيد المثير
7:06للاهتمام ، فسينتهي به
7:07الأمر بامتلاك فكرة
7:08ضمنية عن نموذج العالم
7:09في مكان ما داخل
7:10النظام . وهذا أمر مثير
7:11للاهتمام حقًا . إحدى
7:13الطرق التي يتبادر بها
7:15ذلك إلى ذهني هي
7:16التفكير فيه في سياق
7:18السؤال الذي تعاملنا
7:20معه ، أو ما زلنا
7:21نتعامل معه ، حول
7:22النماذج اللغوية
7:24الكبيرة : هل تفهم
7:25اللغة حقًا ؟ هل هي ،
7:27كما تعلم ، توقع الرمز
7:29التالي ، هل هو مجرد
7:30تزييف لفهم اللغة أم
7:32أنه فهم حقيقي لها ؟
7:34وأعتقد أننا في الغالب
7:36قد تجاوزنا هذا السؤال
7:37وقلنا إن هذه الأشياء
7:39مذهلة للغاية ، فهل يهم
7:41الأمر حقًا ؟ ومن هذا
7:45المنظور ، إذا طبقنا
7:47ذلك على مسألة نموذج
7:49العالم ، فإذا أصبحت
7:50تلك الأنواع من
7:52النماذج جيدة جدًا في
7:54توليد نتائج متسقة مع
7:56عالم أساسي ، فربما لا
7:58يهم الأمر حقًا . لكنني
8:02لا أزال أجدها مسألة
8:04فلسفية مثيرة
8:05للاهتمام ، إن لم يكن
8:07لأي شيء آخر . أتفق معك ،
8:09هناك سؤال فلسفي مثير
World Models as Theory Builders
8:10للاهتمام هنا ، لكنه في
8:11مرحلة ما يبدو غير
8:12قابل للإجابة ، أليس
8:13كذلك ؟ كعالم ، تود أن
8:15تكون ، على الأقل
8:15بالنسبة لي ، أحب
8:16التفكير في : " ما هي
8:17الأشياء التي يمكنني
8:18قياسها حول هذا النظام
8:19؟ " " ما هي الأسئلة
8:20الملموسة التي يمكنني
8:21طرحها ، أو من الناحية
8:22المثالية ، إثبات
8:23زيفها حول نظام ما ؟ "
8:24ولكن أعتقد أن هناك
8:26شيئًا آخر تشير إليه ،
8:27وهو فكرة أخرى يمتلكها
8:29بعض الناس أحيانًا عند
8:30الحديث عن نماذج
8:32العالم ، وهي مختلفة
8:33تمامًا ، ولا أعتقد
8:34أننا نعرف كيف نصل
8:36إليها ، وهي أقرب إلى
8:37نموذج العالم كباني
8:38للنظريات ، أليس كذلك ؟
8:40لأن لدينا هذه الفكرة
8:42بأننا كبشر ، نوعًا ما
8:43نجوب هذا العالم
8:44المعقد للغاية من
8:45حولنا ونخوض هذه
8:46التجارب ، لكننا لا
8:47نكتفي بترك الفوتونات
8:49تسقط على شبكية أعيننا
8:50وندع الأمر يحدث فحسب .
8:52نحن نبني باستمرار
8:53نظريات في أذهاننا لما
8:54يحدث ، أليس كذلك ؟ نحن
8:56نتوصل إلى هذه
8:57النظريات العظيمة حول
8:58كيفية عمل الجاذبية
8:58وكيف تعمل الفيزياء
8:59وكيف تعمل ديناميكا
9:00الموائع . ولا يقتصر
9:01الأمر على مراقبتنا
9:02لهذه الأشياء فقط . هو
9:04أننا ننتهي في الواقع
9:06بنظريات مدمجة وقوية
9:07للغاية تفسر كل
9:08الآليات وراء ما يحدث
9:10هناك . أم ، وأعتقد أن
9:12جزءاً من السؤال
9:13الجوهري حول الذكاء
9:14الاصطناعي هو كيف نجعل
9:15الآلات تقوم بهذا
9:16النوع من الأشياء
9:17أيضاً ؟ وربما توجد هذه
9:19الفكرة القائلة بأن
9:20نموذج العالم لا ينبغي
9:21أن يكتفي بالتفكير
9:23المباشر في الملاحظات
9:24، بل يجب أن يبني
9:25نظريات تفسيرية عميقة
9:26عن العالم . أم ، وأعتقد
9:28أن هذا الأمر صعب
9:29للغاية حقاً . آه ، ولا
9:31أعرف إن كان لدى أي شخص
9:32رؤية ممتازة لكيفية
9:34الوصول إلى ذلك ، لكنني
9:35أعتقد أن هذا مفهوم
9:37مختلف قليلاً عن
9:38السؤال الذي يختلط
9:39أحياناً بالأمر . أجل ،
9:42يمكنك القول إنه حتى
9:43قبل العوالم ، سيكون من
9:46الرائع لو تمكنا من
9:47الحصول على نموذج
9:49يمكنه بناء نظرية
9:51عميقة حول اللغة مثلاً
9:53، أو أي مجال آخر
9:54تتعامل معه النماذج
9:56الحالية ، مثل اللغة أو
9:58الفنون الرسومية . آه ،
10:02أجل . مثير للاهتمام .
10:03مثير للاهتمام . حسناً .
10:05لكن هناك شيء ما ، ماذا
10:06لو كان لدي نموذج
10:07مثالي ، أعني أن نموذج
10:09اللغة الكبير ( LLM ) مثال
10:10، تخيل نموذجاً
10:10مثالياً ، ربما LLM مثال
10:12خاطئ ، لكن لنفترض أن
10:13لديك نموذج فيديو
10:14مثالياً يمكنه توليد
10:15أي فيديو تطلبه . أم ،
10:16لكن ربما ما أردته لم
10:18يكن في الواقع فيديو .
10:19ما أردته كإنسان
10:21وكمُعالم هو أن أتعلم
10:23شيئاً عن العالم . أم ،
10:24وحتى لو تمكنت من
10:25توليد فيديو من أي نوع
10:27أو بأي بنية ، إذا لم
10:28أتعلم ما أريده عن
10:29العالم ، فربما
10:30الفيديو الذي أريده هو
10:32لأينشتاين يلقي
10:33محاضرة تشرح نظرية
10:34جديدة للجاذبية
10:35الكمية أو شيء من هذا
10:37القبيل . وحينها لن
10:38تكون البكسلات نفسها
10:39هي المهمة ، ولا القدرة
10:41على توليد الفيديو .
10:42هذا ما كنت أريده حقاً .
10:43كنت أرغب في اكتساب
10:45فهم جديد للعالم من
10:46هذا النموذج بطريقة ما
10:47. وهذه مسألة صعبة حقاً
10:49.
10:49>> أجل . ولا أعتقد أن
10:50نماذج اللغة الكبيرة
10:52مثال سيئ ، أليس كذلك ؟
10:53لو كان لدى نموذج
10:54اللغة القدرة على
10:56توليد نظريات ، يمكنك
10:57القول إنه لن يهذي
10:59لأنه سيفكر بعمق أكبر
11:01في العلاقة بين
11:02الأشياء التي يولدها
11:04وسيقوم بتصحيح نفسه أو
11:06يمكنه تصحيح نفسه . أم ،
11:09لذا فإن آه ، لذا
11:13تحدثنا عن نماذج
11:14العالم الضمنية ،
11:15وتحدثنا عن نماذج
11:17العالم التوليدية . أوه
11:18، هناك تفسير " آلة
11:20الحالة " الذي ذكرته ، "
11:22عمليات اتخاذ القرار
11:24المار ков ية القابلة
11:26للملاحظة جزئياً " ( POMDP ) .
11:28تحدث قليلاً عن ذلك
11:29وعن كيفية تأثير هذا
11:31التاريخ على الطريقة
11:32التي تفكر بها أنت
11:34والآخرون في نماذج
11:35العالم .
11:36>> هناك هذا التجريد
POMDPs and Agent–World Interaction
11:37المسمى بعمليات اتخاذ
11:39القرار المار ков ية
11:40القابلة للملاحظة
11:41جزئياً ( POMDPs ) والذي
11:42يعود تاريخه إلى فترة
11:44طويلة ، وهو صيغة
11:45رياضية رائعة حقاً
11:46للتفكير في كيفية
11:47تفاعل الوكلاء مع
11:48العوالم . إذن ، هناك في
11:50الأساس جزأين ؛ تخيل
11:52أنك تقوم بفك نظامك
11:53إلى جزأين . أحدهما هو
11:55العالم ، وهو كل ما
11:56يحدث من حولك . ثم هناك
11:58وكيل ، والوكيل هو شيء
12:00يمكنه اتخاذ إجراءات
12:01في العالم . يمكنهم
12:02التحرك ، وربما التقاط
12:04الأشياء ، ويمكنهم
12:05القيام بأشياء في
12:06العالم أو تجاه العالم
12:07. إذن ، أنت تقسم الكون
12:09بأكمله إلى وكيل يتحرك
12:11ويفعل أشياء ، وعالم
12:12تُمارس عليه الأفعال
12:13أو يمارسها الوكيل ،
12:15وربما يتطور أيضاً
12:16بمرور الوقت . لديك
12:18العالم والوكيل ، ثم
12:19تتحدث عن هذه الصيغة
12:20لكيفية تفاعل الاثنين
12:22مع بعضهما البعض . ثم
12:23سيقوم الوكيل باتخاذ
12:25إجراءات ، وفي مواقف
12:26مختلفة قد تكون مجموعة
12:28أفعالك مختلفة ، أليس
12:29كذلك ؟ ربما تكون
12:31روبوتاً ويمكنني
12:32تشغيل محركاتي بطريقة
12:33معينة . ربما أكون في
12:35لعبة فيديو ويمكنني
12:36الضغط على أزرار وحدة
12:37التحكم . إذن ، في مواقف
12:39مختلفة ، قد تتوفر
12:40للوكيل أنواع مختلفة
12:42من الإجراءات . ولكن
12:43مهما كان الموقف ،
12:44عندما يتخذ الوكيل
12:46إجراءات تجاه العالم ،
12:47سيتغير العالم بطريقة
12:49ما . الطريقة التي نعبر
12:50بها عن ذلك هي القول
12:51بأن العالم لديه حالة
12:53داخلية خاصة به . وهذه
12:54الحالة تحدد نوعاً ما
12:55كل ما يجعل العالم على
12:57ما هو عليه . وقد تكون
12:58الحالة كبيرة جداً
12:59ومعقدة للغاية . وقد لا
13:01تكون مفهومة . قد تكون
13:03كبيرة جداً وذات أبعاد
13:04عالية ، لكنها بمثابة
13:06التفسير الكامل لما
13:07يحدث في العالم . إذن ،
13:08يقوم الوكيل باتخاذ
13:10إجراءات تجاه العالم ،
13:11ولأن الإجراء يغير
13:12العالم ، فهذا يعني أن
13:14الإجراء سيؤدي إلى
13:15تغير الحالة أو
13:16انتقالها بطريقة ما
13:17داخل العالم . لكن الآن
13:19، الحالة كبيرة جداً
13:20ومعقدة لدرجة أنك قد
13:22لا تستطيع ملاحظتها
13:23بشكل مباشر . لذا ، ما
13:24يحصل عليه الوكيل في
13:26المقابل هو ملاحظات ،
13:27والملاحظات هي نوع من
13:28الإسقاط منخفض
13:29الأبعاد لحالة العالم
13:31الكاملة . ومرة أخرى ،
13:32ما يعنيه ذلك يختلف
13:33باختلاف السياقات .
13:35ربما كبشر ، الملاحظات
13:36التي نحصل عليها هي
13:37الصور التي نراها
13:38بأعيننا ، والأصوات
13:39التي تصل إلى آذاننا ،
13:40وأحاسيس اللمس التي
13:42نشعر بها على أجسامنا .
13:43تلك هي كل الإشارات
13:44الحسية التي نتلقاها .
13:46وهذه الإشارات الحسية
13:47تخبرنا شيئًا عن
13:48العالم ، لكنها لا
13:49تخبرنا سوى شيء محدود
13:50ومحلي جدًا عن كل ما
13:51يحدث في العالم من
13:52حولنا . إذًا ، حلقة
13:53عملية اتخاذ القرار
13:54المتسلسلة الجزئية (
13:55POMDP ) هي أنك تمتلك
13:56وكيلاً . يقوم بإجراءات
13:58في العالم تؤدي إلى
13:59انتقال الحالة ؛ ثم ،
14:00بناءً على الحالة ،
14:01يحصل الوكيل على
14:02ملاحظة تخبره بشيء عن
14:03العالم . وبعد ذلك ،
14:05سيحدث هذا للوكيل في
14:06حلقة مفرغة مرارًا
14:07وتكرارًا بينما يحاول
14:08الوكيل القيام بأشياء
14:09في العالم .
14:10>> هذا يبدو كثيرًا مثل
14:11إعداد التعلم
14:12التعزيزي . الوكيل يعمل
14:14في العالم ، أمم ، إنه
14:16يقوم بإجراء ملاحظات .
14:18هناك بعض المكافآت
14:19المرتبطة بأفعاله وما
14:21إلى ذلك . أمم . هل يعني
14:25هذا أنك بحاجة إلى
14:26إعداد من نوع التعلم
14:28التعزيزي لامتلاك
14:30نموذج عالمي قوي ، أم
14:32ما هي العلاقة
14:33الملموسة بين عمليات
14:35POMDP والنماذج ؟
14:36>> لقد أصبت في هذه
14:38النقطة . إذًا ، الجزء
14:39التقني المهم الذي
14:40أغفلته في التعريف
14:41الأولي هو المكافأة ،
14:42أليس كذلك ؟ لذا ، في
14:44سياق أوسع ، تم تطوير
14:45هذا الشكل الصوري
14:46بالكامل في إطار
14:47التعلم التعزيزي . أمم ،
14:49وهناك يكون للوكيل هدف
14:50يحاول تحقيقه ، وكيف
14:52يحصل على إشارة عما
14:53إذا كان يحقق الهدف أم
14:55لا ؟ يحصل على إشارة
14:56مكافأة . إذًا الفكرة
14:58هي أن الوكيل يريد
14:59محاولة اتخاذ إجراءات
15:00من شأنها تعظيم
15:01مكافأته . وبمجرد وصولك
15:02إلى هذا المستوى ، فهذا
15:04هو بالضبط إعداد
15:04التعلم التعزيزي . أمم ،
15:06وأنت تعلم ، هذا هو
15:07المكان الذي يأتي منه
15:08هذا الشكل الصوري . أمم
15:09، لكن السبب الذي
15:10جعلني أختار عدم
15:11الحديث عن المكافأة
15:12قبل قليل هو أنني
15:13أعتقد أننا نستطيع أخذ
15:15ذلك التجريد الأصلي لـ
15:16POMDP واستخدامه في
15:17سياقات أخرى . لذا
15:18أعتقد أن هذا المفهوم
15:19حول التفكير في
15:20الوكلاء والحالات
15:21والملاحظات يصبح
15:22قابلاً للتطبيق
15:23ومفيدًا في الكثير من
15:24السياقات الأخرى حتى
15:25خارج نطاق التعلم
15:26التعزيزي تحديدًا . أمم
15:27، والتعلم التعزيزي قد
15:29يكون إطارًا واحدًا تم
15:30تطوير هذا الشكل فيه
15:31في الأصل وهو مفيد
15:32للغاية ، لكن يمكننا
15:33تطبيقه في أماكن أخرى
15:34أيضًا في الوقت الحاضر
15:35.
15:36>> أعطنا مثالاً على
15:37كيفية تطبيقه خارج هذا
15:38السياق .
15:39>> إذًا ، أحد الأمثلة ،
Training Agents with Behavior Cloning
15:40مثال ملموس جدًا ، قد
15:41يكون استنساخ السلوك
15:42في الروبوتات . صحيح .
15:44أليس كذلك ؟ لنفترض أنك
15:46تبني روبوتًا ، وهدفك
15:47في نهاية المطاف هو
15:48بناء هذا الروبوت
15:49ليتجول في العالم
15:50ويؤدي مهامًا ، مثل
15:51ترتيب سريري أو تنظيف
15:52المطبخ أو أي شيء آخر .
15:54وبمجرد أن يصبح هذا
15:55الروبوت في الخارج ،
15:56فإنه يعتبر " عاملًا " .
15:57إنه يتفاعل مع العالم .
15:58والعالم له حالة معينة
16:00. والروبوت يحصل على
16:01ملاحظات حول هذا
16:02العالم . لذا ، فهو يعمل
16:03نوعًا ما ضمن تلك
16:04الحلقة بمجرد تدريبه .
16:06لكن يظل السؤال
16:07مطروحاً : ما هي إشارة
16:08التدريب التي استخدمت
16:09؟ يمكنك تدريب هذا
16:10الشيء عبر التعلم
16:12التعزيزي ، حيث يحصل
16:13على مكافأة في كل مرة
16:14يقوم فيها بإجراء معين
16:16. أو يمكنك تدريبه عبر
16:17استنساخ السلوك ، أليس
16:19كذلك ؟ ربما امتلكت
16:20مجموعة بيانات كبيرة
16:21مُشرفة ، تخبره فيها :
16:23عند تلقي هذه الملاحظة
16:24، يجب عليك اتخاذ هذا
16:25الإجراء . ومن ثم يمكنك
16:27تدريب نموذج تعلم
16:28مُشرف مختلف تماماً لا
16:29يعتمد على إشارة
16:30مكافأة صريحة . حيث
16:32ستستخدم مثلاً
16:32خوارزمية الانحدار
16:33المتدرج وبعض دوال
16:34الخسارة المُشرفة . لذا
16:35، على الرغم من أنك في
16:36النهاية تحصل على نظام
16:38يعمل ضمن حلقة تشبه
16:39عمليات اتخاذ القرار
16:40الماركوڤية الجزئية (
16:41POMDP ) ، إلا أن هدف
16:42التدريب كان مجرد تعلم
16:43مُشرف لا يتطلب تعلمًا
16:44تعزيزيًا .
16:45>> الخلاصة هي أن هناك
16:46جزأين لعمليات اتخاذ
16:48القرار الماركوڤية
16:50الجزئية ( POMDP ) . أحدهما
16:52يجسد العلاقة بين
16:53العامل والعالم ،
16:55وفكرة أن العامل يمكنه
16:57ملاحظة أشياء تعكس
16:58حالة تجريدية معينة ،
17:00لكنه لا يمكنه معرفة
17:02تلك الحالة التجريدية
17:04بشكل كامل . ويحتاج
17:07للعمل بناءً على
17:08ملاحظاته . والمكافأة
17:14والتدريب يتعلقان
17:15بكيفية تحويل تلك
17:17الملاحظات إلى أفعال ،
17:19لكن هذا لا يجب
17:20بالضرورة أن يكون حول
17:22تعظيم المكافأة بحد
17:23ذاته . قد يتعلق الأمر
17:26بأشياء أخرى .
17:27>> بالضبط . والسبب وراء
17:28ارتباط هذا بنمذجة
17:29العالم هو أن هذا هو
17:30المكان الذي جاء منه
17:32المصطلح في الأصل .
17:33صحيح . إن التعريف
17:34التقني الأصلي لنموذج
17:36العالم هو أنه إذا كنا
17:38في إطار عمل POMDP ، فإن
17:39نموذج العالم هو شيء
17:41يتلقى حالة العالم
17:43وإجراء العامل ، ثم
17:44يتنبأ بحالة العالم
17:46التالية . لذا ، هذا هو
17:47السياق التقني الأصلي
17:49الذي استُخدم فيه
17:50مصطلح " نموذج العالم " .
17:52>> ولا أعرف كيف ، كما
17:53تعلم ، مع وضع ذلك في
17:55الاعتبار ، بأن هذا في
17:57سياق أوسع نوعاً ما ،
17:58أو ربما ذو أهمية
17:59تاريخية وليس
18:00بالضرورة يتعلق
18:02بالوجهة التي نتجه
18:03إليها مع نماذج العالم
18:05اليوم . لكن كان لدي
18:07سؤال حول " الحالة " :
18:09كثيراً ما نسمع الحديث
18:11عن الحالة كتمثيل ،
18:13أشبه بكيفية ارتباط
18:15الملاحظة بالحالة في
18:17إطار عمل " بوم دي بي " (
18:19POMDP ) . همم . غالباً ما
18:26تكون الحالة تمثيلاً
18:28منخفض الأبعاد لشيء
18:30آخر يمثل الحقيقة
18:31المطلقة . آه . هل تعتقد
18:36أن هذا التمييز مفيد
18:38لنا لاستكشافه ؟
18:39>> ربما قليلاً . أعتقد أن
Ground-Truth State and Learned State
18:41هناك في الواقع
18:41مفهومين مختلفين
18:42للحالة يتحدث عنهما
18:43الناس أحياناً ويتم
18:44الخلط بينهما . لذا قد
18:46يكون من المفيد محاولة
18:47توضيح ذلك . أحد
18:48المفهومين ، في ذهني
18:49عندما أقول " حالة " ، هو
18:50أنني أفكر في الحالة
18:52الحقيقية المطلقة
18:53للعالم . وهي بمثابة
18:54وصف كامل لكل شيء في
18:55العالم يكون مطلوباً
18:57للإجابة على أي سؤال
18:58حوله .
18:58>> هذه طريقة أخرى لتناول
19:00الأمر أو سؤال تبادر
19:02إلى ذهني سابقاً
19:03وسأطرحه الآن . عندما
19:05كنت تتحدث عن الحالة
19:07في سياق الحلقة ، كنت
19:08أفكر في أن ... مثالاً
19:13متطرفاً على العلاقة
19:15بين الحالة والملاحظة
19:17هو عندما تجلس عند
19:18إشارة مرور . يمكن
19:20اختزال الملاحظة إلى
19:22بُعد واحد ، أحمر ، أخضر
19:25، أو أصفر ، أو بُعدين ،
19:27أياً كان . همم . آه ، الـ
19:32... بينما الحالة ، وفقاً
19:38لتعريف " بوم دي بي " ، هي
19:40مثل كل ذرة في العالم .
19:45وسؤالي هو حقاً : عندما
19:51تتحدث عن نماذج العالم
19:53، هل تتكون الحالة
19:55بالضرورة من كل ذرة في
19:57العالم ، أم أنها مجرد
19:59تمثيل ؟ وربما تكون هذه
20:01طريقة أخرى لطرح هذا
20:02السؤال .
20:03>> أعتقد ذلك . لذا ، أعتقد
20:04أن الأمر كله يتعلق
20:05بمسألة ما هو التجريد
20:06الذي يخدم المشكلة
20:07المطروحة ، أليس كذلك ؟
20:08وحتى الفيزيائيون
20:09يستخدمون تمثيلات
20:10مختلفة اعتماداً على
20:11السؤال الذي تطرحه ،
20:13أليس كذلك ؟ على سبيل
20:14المثال ، في بعض
20:15المسائل ، أحتاج إلى
20:16الدالة الموجية لهذا
20:17النظام الكمي ، أمم ،
20:18وبالنسبة لأنظمة أخرى
20:20، ربما يكون النظام
20:21عيانياً ولا تظهر فيه
20:22التأثيرات الكمية ،
20:23حينها يمكنك اعتباره
20:24نظاماً نيوتنياً ،
20:25وتصبح الحالة هنا
20:26عبارة عن مجموعة من
20:28الجسيمات : ما هي كتلها
20:29، وما هي مواقعها
20:30وزخمها ؟ أو ربما تتحدث
20:31عن نظام كيميائي ،
20:33وربما يكون مجرد
20:34محاليل تحتوي على
20:35أيونات بتركيز معين .
20:37أو ربما تتحدث عن نظام
20:38ديناميكي حراري
20:39وتعتبره ، كما تعلم ،
20:40غازاً مثالياً ، وهذا
20:41يكفي لوصف حالة النظام
20:43. إذن ،
20:44>> لكنه لا يشمل أبداً كل
20:45ذرة في العالم .
20:46>> لا ، لا . أعتقد أن الأمر
20:48دائماً ، حتى عندما
20:49نتحدث عن حالة الحقيقة
20:50الأساسية ، يرتبط
20:51دائماً بالتجريد ، أي
20:53التجريد الضروري لحل
20:54المشكلات التي تهتم
20:55بها . أمم ، لكن أعتقد أن
20:56هناك مفهوماً آخر وهو
20:57الحالة المكتسبة ، وهو
20:59أمر مثير للاهتمام
21:00يتحدث عنه الناس الآن ،
21:01وهو أننا على الأرجح
21:02لن نتمكن من الوصول
21:03المباشر إلى حالة
21:04الحقيقة الأساسية في
21:05العالم المادي ، أليس
21:06كذلك ؟ مثل ، حتى لو
21:08فكرنا في كل ذرة ، أو
21:09غاز مثالي ، في كثير من
21:11المواقف ، لن تلاحظ ذلك
21:13في العالم الحقيقي .
21:14لذا ، بدلاً من ذلك ،
21:15هناك سؤال آخر : هل
21:16يمكنني الحصول على
21:17نموذج أقوم بتعلمه ،
21:19بحيث يتعلم أخذ
21:20الملاحظات والتنبؤ
21:21بنوع من المتجهات
21:22العصبية ؟ وهذا المتجه
21:23المكتسب ، رغم أنه شيء
21:25تعلمه النموذج ، يتصرف
21:26كما لو كان حالة حقيقة
21:28أساسية ، حيث يمكنني
21:29التنبؤ بالأفعال
21:31والتنبؤ بالملاحظات
21:32التي قد تنتج عن تلك
21:34الحالة . يمكنني تخيل
21:35كيف ستنتقل تلك الحالة
21:37استجابةً للأفعال ،
21:38لكنه نوع من التمثيل
21:39المتجهي الداخلي
21:41المكتسب من شبكة عصبية
21:42. وهو ليس مثل حالة
21:43الحقيقة الأساسية
21:44المستمدة من الفيزياء
21:45، لكنه يتصرف نوعاً ما
21:46مثل تلك الحالة .
21:47>> هل هذا مشابه لفكرة
21:48التعلم المعزز القائم
21:49على النموذج والتعلم
21:50المعزز الخالي من
21:51النموذج ؟
21:52>> قليلاً ، نعم . إذاً ،
21:53إذا كنت تقوم بتعلم
21:54معزز قائم على نموذج ،
21:55فأنت تمتلك نموذجاً
21:56صريحاً للحالة ، وهنا
21:57يكون لديك نموذج
21:58للعالم ، أليس كذلك ؟
21:59إذن ، لدي جزء صريح في
22:00نظام التعلم التعزيزي
22:01الخاص بي ، في النهج
22:02القائم على النموذج ،
22:03حيث يوجد مكون يحاول
22:04التنبؤ بالحالة
22:05التالية بناءً على
22:06الحالة الحالية
22:07والإجراء المتخذ . أو
22:08في النهج الخالي من
22:09النماذج ، لا أملك ذلك
22:10المفهوم الصريح . ربما
22:11أحصل فقط على
22:12الملاحظات ، وأغذيها
22:13مباشرة للنموذج ،
22:15فيقوم بإخراج
22:15الإجراءات ، ولا يوجد
22:17نمذجة صريحة للحالة .
22:18لكن ، بالعودة إلى
22:19نماذج العالم الضمنية
22:20التي تحدثنا عنها
22:21سابقاً ، ربما تقوم تلك
22:23الشبكة العصبية ، إذا
22:24كانت كبيرة ومعقدة بما
22:25يكفي ، بنوع من نمذجة
22:26الحالة داخل أوزانها
22:27إذا كانت قادرة على
22:28التنبؤ بإجراءات جيدة
22:30جداً في الظروف
22:30المناسبة .
22:31>> أعتقد أننا نوضح هنا
22:33غموض مصطلح " الحالة " .
22:37يمكن أن يكون ، كما
22:39تعلم ، أي تمثيل أو
22:41تجريد للعالم ، أو في
22:43بعض الإعدادات ، قد
22:45يكون بديلاً لذلك
22:50ينشئه الوكيل ويتنبأ
22:52به ويقارنه عند اختيار
22:54الإجراءات .
22:55>> وأعتقد أن الحكم لا
22:56يزال معلقاً بشأن أي
22:57من هذه هو النهج
22:58الصحيح . لكن هذا أمر
23:00مثير ، أليس كذلك ؟ وهذا
23:01أحد الأسباب التي
23:02تجعلني أعتقد أن
23:03الكثير من الناس
23:04ينجذبون لهذا المجال
23:05الآن ، هو أن نمذجة
23:06اللغة تبدو وكأن لدينا
23:07مجموعة من أفضل
23:08الممارسات التي تعمل
23:09بشكل جيد جداً . وكما
23:10تعلم ، هناك أمور تستحق
23:12الاستكشاف ، لكن لدينا
23:13وصفة تعمل بشكل جيد
23:14إلى حد ما . لكن إذا
23:15أردت الحديث عن كيفية
23:17بناء أو كيفية نمذجة
23:18البيئات ؟ كيف ننمذج
23:19العوالم ؟ كيف ننمذج
23:20الوكلاء الذين
23:21يتفاعلون مع العوالم ؟
23:23هناك الكثير من
23:23الأسئلة التقنية
23:24الأساسية ، أو مناهج
23:25الهندسة الأساسية ،
23:26حيث يمكنك القيام
23:27بالأمر بهذه الطريقة
23:29أو تلك ، ولا نعرف حقاً
23:30ما هي الطريقة الأفضل .
23:31وهذا مجال مثير للغاية
23:33للعمل فيه وإجراء
Explicit 3D vs. Implicit 3D
23:34الأبحاث . إذاً ، دعنا
23:35نغير المسار قليلاً
23:37ونتحدث عن الجانب
23:38الرسومي للأمور . كما
23:41ذكرت ، عندما نتحدث عن
23:43نماذج العالم ، يركز
23:44الكثير من ذلك الحديث
23:46على توليد العوالم
23:48الرسومية . وأحد
23:54التقنيات الأساسية في
23:56هذا المجال هو فكرة "
23:57التلطيخ الغاوسي " ( Gaussian
23:59splat ) . لذا ، تحدث قليلاً
24:02عن الطريقة التي يقارب
24:03بها الناس هذا النوع
24:05من توليد العالم ، ودور
24:07" التلطيخ الغاوسي "
24:09وكيف تطور ذلك على مدى
24:11السنوات القليلة
24:12الماضية أيضاً .
24:13>> أعتقد في الواقع أن
24:15هناك نقطة تفرع جوهرية
24:16يجب أن نشير إليها قبل
24:18أن نخوض في هذا المسار .
24:20وهي ، هل تعمل على
24:21نمذجة ثلاثية الأبعاد
24:23صريحة أم ضمنية ؟ تعد
24:25تقنية " Gaussian splats "
24:26مثالاً على النهج
24:28ثلاثي الأبعاد الصريح
24:30، حيث سأمتلك تمثيلاً
24:31صريحاً للعالم عندما
24:33أقوم بتوليده أو
24:34نمذجته . وبعد ذلك ،
24:35سأقوم بإجراء عمليات
24:37على هذا التمثيل ثلاثي
24:38الأبعاد الصريح
24:38للعالم . قد تكون إحدى
24:40هذه العمليات هي
24:40تحويله إلى وحدات
24:41البكسل التي تراها .
24:42وهناك نهج مختلف يعتبر
24:44ضمنياً نوعاً ما . حيث
24:45سأمتلك نموذجاً يولد
24:46وحدات البكسل بشكل
24:47مباشر . كما لو أنه
24:48نموذج فيديو . إنه يولد
24:50وحدات بكسل . إنه يولد
24:52الملاحظات مباشرة ولا
24:53يمر أبداً عبر عنق
24:54الزجاجة المتمثل في
24:55التمثيل ثلاثي
24:55الأبعاد الصريح
24:56الوسيط . وأعتقد أن كلا
24:58المسارين قد تطورا
24:59كثيراً خلال العامين
25:00الماضيين . لذا ، فإن
25:02هذه نقطة تفرع مثيرة
25:03للاهتمام حتى عند
25:05الحديث في هذه المرحلة
25:06.
25:06>> هذا صحيح . وهل ، هل
25:08تتبنى " World Labs " على سبيل
25:11المثال ، حسناً ، هل من
25:13الدقيق القول إنكم
25:15تتبعون نهج " Gaussian splats "
25:17كما في " Marble " وبعض
25:19الأعمال التي
25:20تنشرونها وتستعرضونها
25:23؟ لكن هل تشعر أن هذا
25:25النهج أساسي ، أم أنه
25:27مجرد ما أظهرتموه حتى
25:29الآن وأنكم منفتحون
25:30على أفكار أخرى ؟ حسناً
25:32، أعتقد أننا قمنا
25:33بالأمرين معاً بالفعل
25:35، أليس كذلك ؟ إذن ، هذا
25:36صحيح . لقد أطلقنا
25:38منتجاً يسمى " Marble "
25:39يعتمد نهج " Gaussian splatting "
25:41، وما يفعله " Marble " هو
25:42السماح للمستخدم
25:44بإدخال صورة أو سلسلة
25:45من الصور أو نص توجيهي
25:47، ثم يولد عالماً يتم
25:49تمثيله كمجموعة من "
25:50Gaussian splats " . وهو تمثيل
25:52ثلاثي الأبعاد صريح ،
25:53وبمجرد الحصول على هذا
25:55التمثيل ، يمكنك
25:56تقديمه لعرض صور جميلة
25:58للعالم ، أو يمكنك تخيل
26:00دمج كائنات بداخله ، أو
26:01تصديره إلى محرك
26:03رسوميات أو شيء من هذا
26:04القبيل . لكننا قمنا
26:06أيضاً بنشر تدوينة
26:07بحثية في أواخر العام
26:08الماضي حول " RTFM " الذي
26:10يتبنى نهجاً مختلفاً
26:11تماماً يسمى " نموذج
26:13الإطار في الوقت
26:14الفعلي " . وهذا يتناقض
26:15مع نهج " Marble " الخاص بنا
26:17، حيث يتجه بشكل أكبر
26:18نحو الاتجاه المباشر
26:20للفيديو ووحدات
26:21البكسل فقط . إذ لا يوجد
26:23تمثيل صريح للعالم
26:24ثلاثي الأبعاد . لدينا
26:26نموذج يعمل في الوقت
26:27الفعلي يقوم بتوليد
26:29الصور استجابةً
26:30لمدخلات المستخدم .
26:31فالمستخدم يطلب
26:32التحرك ، فيرى صورة
26:34للعالم وهي تتحرك ؛
26:35فمثلاً تقول " تحرك
26:37يساراً " فترى مقطع
26:38فيديو لنفسك وأنت
26:40تتحرك يساراً ، وكل هذا
26:41يحدث فورياً دون وجود
26:43تمثيل ثلاثي الأبعاد
26:45صريح . إنها مجرد
26:46إطارات يتم إنشاؤها
26:47بواسطة نموذج في الوقت
26:48الفعلي . لذا ، كانت "
26:49وورلد لابس " تعمل في
26:51كلا الاتجاهين . لدينا "
26:52ماربل " ، وهو نموذجنا
26:54الصريح للعالم القائم
26:55على تقنية " Gaussian splat " ،
26:57ولدينا " RTFM " كنموذج
26:58عالم ضمني يولد
26:59الإطارات فورياً . وهذا
27:02يطرح تساؤلاً لدي يعود
27:04بنا إلى نقاشنا
27:05الأساسي حول ماهية
27:07نموذج العالم . أنا
27:13أفكر في ... عمل " ميتا "
27:17الأولي حول " Gaussian splat "
27:19والعروض التوضيحية
27:20والأدوات التي أعتقد
27:22أنها جعلت هذه التقنية
27:24شائعة قبل أن تصبح
27:26ركيزة أساسية لفكرة
27:28نموذج العالم . كانت
27:30تسمح لك بالتقاط
27:32مجموعة من الصور
27:34وربطها معاً —
27:35باستخدام مصطلح " ربط "
27:37بشكل فضفاض — لإنشاء
27:39نموذج ثلاثي الأبعاد
27:41قابل للتنقل فيه . وحتى
27:44قبل ذلك ، لا أعتقد
27:46أنها استخدمت تقنية "
27:48Gaussian splat " ، لكن أدوات
27:50مثل " AR Kit " من أبل أنتجت
27:52شيئاً مشابهاً . نماذج
27:55ثلاثية الأبعاد قابلة
27:57للتنقل بشكل متواضع .
28:00أحاول تجنب تسميتها "
28:02عوالم " ، لأن السؤال
28:04هنا هو : كيف نرسم الخط
28:06الفاصل بين ذلك الشيء
28:08وبين " العالم " ؟ أريد أن
28:10أقول " ثابت " مقابل "
28:11ديناميكي " ، لكن هذا لا
28:12يبدو صحيحاً تماماً .
Reconstruction vs. Generative World Modeling
28:14>> لا ، أنا أفهم ما تعنيه .
28:16هناك تمييز مثير
28:17للاهتمام هنا يعتقد
28:18الكثيرون أنه مربك
28:19فيما يتعلق بـ " Gaussian
28:21splatting " تحديداً ، أليس
28:22كذلك ؟ لأن " Gaussian splat " هو
28:24في الواقع مجرد تمثيل
28:25للبيانات . إنه يشبه
28:27إلى حد كبير سحابة
28:28نقاط ثلاثية الأبعاد .
28:30لدي مجموعة من النقاط
28:32في الفضاء ، ولكل منها
28:33موقع ولون وربما خصائص
28:35أخرى مرتبطة بها .
28:36>> وإذا كانت سحابة
28:37النقاط كبيرة بما يكفي
28:39، يمكنك التحرك داخلها
28:41من منظور نقطة معينة .
28:42>> لكن السؤال المثير
28:43للاهتمام هو : من أين
28:45أتت سحابة نقاط الـ "
28:46Gaussian splat " هذه ؟ هناك
28:47انقسامان كبيران
28:49يسببان ارتباكاً
28:50للناس ، لأن أصل تقنية "
28:52Gaussian splatting " كان
28:53مرتبطاً بعملية إعادة
28:55البناء . الفكرة هنا هي
28:57أنني سأقوم بالتقاط
28:58الكثير من المشاهد
29:00لمكان ما ، مئات أو حتى
29:01آلاف الصور التي تغطي
29:03هذا المكان بتفاصيل
29:04دقيقة للغاية . ثم
29:05سأقوم بمطابقة هذه
29:07الصور مع تمثيل سحابي
29:08نقطي ثلاثي الأبعاد
29:10يُعرف بـ Gaussian Splat .
29:11>> حسناً ، عند وضع الأمر
29:12بهذا الشكل ، يبدو
29:13الفرق واضحاً ، فهو ليس
29:14مجرد عالم ، بل نموذج
29:15عالمي .
29:16>> بالضبط . لا يوجد نموذج
29:17عالمي هنا ، أليس كذلك ؟
29:19لم يكن هناك نموذج
29:20كبير وقوي هنا تعلم من
29:21كميات هائلة من
29:22البيانات . إن أساليب
29:24إعادة البناء القائمة
29:25على التحسين لتقنية
29:26Gaussian Splat تشبه قول : " لدي
29:28ألف صورة " . الكون
29:29بأكمله يتلخص في هذه
29:30الألف صورة ، وأنا أقوم
29:31بمطابقة Gaussian Splat
29:32لتناسبها . لا توجد
29:34معرفة عامة هنا . وهذا
29:35يختلف تماماً عما نقوم
29:37به في Marble . في Marble ،
29:38قمنا بتدريب نموذج
29:40كبير وقوي على الكثير
29:41من البيانات المتنوعة .
29:43وهذا النموذج يقوم
29:44بإنتاج تمثيلات Gaussian
29:46Splat . إذاً ، نموذج Marble
29:47العالمي هو النموذج
29:49الذي يعرف كيف يصيغ
29:50العوالم . إنه يستقبل
29:52صوراً ونصوصاً ، ويخرج
29:53تمثيلات Gaussian Splat . وهذا
29:55مختلف تماماً عن الوضع
29:57الذي أقوم فيه بمطابقة
29:58سحابة نقطية مع هذه
30:00الألف صورة بشكل بسيط ،
30:01دون وجود نموذج تعلم
30:02من كم هائل من
30:03البيانات . لقد تطرقنا
30:06لهذا قبل البدء
30:07بالتسجيل ، لكنني كنت
30:09أعتقد دائماً أن Gaussian
30:11Splat هو مجرد فكرة أو
30:13عملية عامة ، أي
30:15العملية الرياضية
30:16التقنية لإنشاء سحب
30:18النقاط هذه . لكن يبدو
30:22أن الأمر تطور كثيراً ،
30:24وأصبحت هناك الآن
30:26تنسيقات ملفات قياسية
30:28وأشياء أخرى . حدثنا
30:30قليلاً عن هذا النظام
30:32البيئي والأدوات
30:34المستخدمة في التعامل
30:35مع Gaussian Splats .
30:37>> أجل . غالباً ما تكون
Gaussian Splat Anatomy and File Formats
30:39تقنية Gaussian Splats شيئاً
30:40محدداً للغاية . إنها
30:42عبارة عن مجموعة من
30:43النقاط . كل نقطة لها
30:44موقع في الفضاء ثلاثي
30:46الأبعاد يتحدد بثلاث
30:47إحداثيات ( X ، Y ، Z ) . كما
30:48أن لها درجة عتامة ،
30:50وهي رقم بين صفر وواحد
30:52يحدد مدى شفافية أو
30:53عتامة هذه النقطة .
30:55وعادة ما يكون لديك
30:56لون يُمثل بقيم RGB ، وهي
30:58أيضاً ثلاثة أرقام .
31:00وغالباً ما ستجد
31:01مفهوماً إضافياً
31:02يُعرف بالتوافقيات
31:03الكروية ( Spherical Harmonics ) .
31:05وهذا يخبرك بما يبدو
31:06عليه الأمر ، وما هو
31:07لونه عند النظر إليه
31:08من زوايا مختلفة ، فأنت
31:09تريد نمذجة هذه الفكرة
31:11، حيث قد تكون لهذه
31:12النقطة لون معين إذا
31:13نظرت إليها من الأسفل ،
31:14ولون مختلف إذا نظرت
31:15إليها من الأعلى . وهذا
31:17يساعدك على نمذجة
31:18الانعكاسات ، فإذا كان
31:19لدي سطح لامع مثل
31:21المرآة أو سطح صقيل ،
31:22فعند النظر إليه من
31:23زاوية معينة ، قد أرى
31:25انعكاساً لضوء يرتد من
31:26الأعلى . أما إذا نظرت
31:28إليه من زاوية مختلفة ،
31:29فأنا أرى لوناً
31:30مختلفاً . وهذه
31:31التوافقيات الكروية
31:32هي وسيلة ملموسة
31:33ومحددة لالتقاط مفهوم
31:34اللون المعتمد على
31:35زاوية الرؤية . إذن ، "
31:37اللطخة الغاوسية " ( Gaussian
31:38splat ) هي عبارة عن
31:39مجموعة من النقاط . كل
31:40نقطة لها موقع ( xyz ) ،
31:41وشفافية ، ولون ،
31:42وأيضاً تحتوي على هذه
31:43التوافقيات الكروية
31:44التي تخبرك بكيفية
31:45تغير اللون عند النظر
31:46إليها من زوايا مختلفة
31:47. وهناك طرق مختلفة
31:49لتعبئة هذه البيانات
31:50في ملف . أليس كذلك ؟
31:52تُعد صيغة PLY تنسيق ملف
31:53شائعاً جداً لللطخات
31:55الغاوسية ، وهي سهلة
31:56القراءة والكتابة
31:57نسبياً ، لكنها غير
31:59فعالة إلى حد كبير .
32:00وهناك أيضاً تمثيلات
32:01مضغوطة مثل SPZ ، التي
32:03تضغط بعض تلك البيانات
32:05وتستخدم دقة أقل
32:06لأجزاء منها ، مما يسمح
32:08لك بتخزين شيء يبدو
32:09متشابهاً جداً ، ويبدو
32:11جيداً حقاً ، لكن بحجم
32:13ملف أصغر بكثير . يمكنك
32:15اعتبار صيغة PLY بمثابة
32:17ملف GIF أو PNG ، فهي غير
32:19مضغوطة إلى حد كبير .
32:21أما SPZ فهي أشبه بملف
32:23JPEG ، حيث يتم ضغط بعض
32:24أجزاء البيانات . سوف
32:26تتخلص من بعض أجزاء
32:28البيانات ، لكننا
32:29نعتقد أنها أجزاء لن
32:31يلاحظها البشر ، خاصة
32:32عند مقارنتها
32:34بالطريقة التي نفكر
32:35بها في الصور
32:36التقليدية ثنائية
32:38وثلاثية الأبعاد .
32:40اللطخات الغاوسية لا
32:42تعتمد على شبكة . وهل هي
32:46متناثرة بشكل عام
32:47بالنسبة لأبعاد
32:49المساحة التي نمثلها ؟
32:51>> نعم ، أعني أنها لا
32:52تعتمد على شبكة . أي من
32:54هذه النقاط يمكن أن
32:54تتواجد في أي مكان في
32:55الفضاء . لكنها عادةً ،
32:57أعني أن إحدى ... أوه . آه
32:58صحيح ، الشيء الآخر
32:59المهم الذي نسيته ، يا
33:00لي من أحمق لعدم وجود
33:01ملاحظاتي أمامي ، لكن
33:02الـ Gaussian Splat له حجم
33:03أيضاً ، أليس كذلك ؟ إنه
33:04ليس نقطة متناهية
33:06الصغر . امم ، الـ Gaussian
33:07Splat له حجم . امم ، إنه
33:08ليس مجرد نقطة في
33:09الفضاء . لديه نوع من
33:11نصف القطر . امم ،
33:12وأيضاً مصفوفة تباين
33:14لأنها قد لا تكون كرة .
33:16قد تكون شكلاً
33:17بيضاوياً . امم ،
33:18ومصفوفة التباين ونصف
33:19القطر ، أو في الواقع
33:21مصفوفة التباين فقط ،
33:22تخبرك بمدى كبر حجمها
33:23ومدى تمددها أو
33:24انضغاطها على طول
33:26الأبعاد المختلفة . امم
33:27، لذا فإن جزءاً من
33:28الفكرة الأصلية لـ
33:30Gaussian Splats هو أنها قد
33:31تكون متباعدة جداً ، أو
33:32ربما تكون متباعدة
33:33نوعاً ما ، وينتهي بك
33:35الأمر بـ Gaussian Splats
33:36كبيرة جداً لتغطية جزء
33:37كبير من الجدار . امم ،
33:39لكن من الناحية
33:40العملية ، يؤدي هذا
33:41عادةً إلى جودة منخفضة
33:42جداً . لذا ، عادةً ما
33:43تريد أن يكون الـ Splat
33:45كثيفاً إلى حد ما فوق
33:46الهندسة التي تريد
33:47تغطيتها ، وهذا يؤدي في
33:49النهاية إلى إنتاج صور
33:50أجمل بشكل عام . مع ذلك ،
Why Gaussian Splats Work with Neural Networks
33:56هل جزء من التقنية أو
33:58ما يجعل Gaussian Splats تعمل
34:00هو أن العارض قادر على
34:02التركيز على ما يراه
34:04المستخدم مقارنة
34:05بالأشياء الخارجية ؟
34:12أو ربما السؤال الأوسع
34:14هو : ما الذي يجعل Gaussian
34:16Splats مثيرة للاهتمام
34:17للغاية ؟ ربما تذكير
34:19سريع بذلك مقارنة
34:20بالطريقة التي
34:22تعاملنا بها مع هذا من
34:23قبل .
34:24>> أعتقد أن التباين الذي
34:25يجب أن تفكر فيه مع
34:26Gaussian Splats هو الشبكات
34:27المثلثية . امم ،
34:28الشبكات المثلثية هي
34:30التمثيل القياسي في
34:31رسومات الحاسوب ، وهذا
34:32يعني أننا سنمثل
34:33العالم كله كمثلثات
34:34صغيرة في الأساس . امم ،
34:36وكل شيء يتكون من
34:37مثلثات صغيرة ،
34:38وتقريباً أي لعبة
34:39لعبتها ، أو أي لقطة
34:40مؤثرات بصرية رأيتها ،
34:42أو أي صور تم إنشاؤها
34:43بواسطة الحاسوب ،
34:44فإنها جميعاً تصمم
34:45العالم كالكثير من
34:46المثلثات الصغيرة . امم
34:48، وهذا يعمل ، وقد نجح
34:49بشكل مذهل في رسومات
34:51الحاسوب لعقود . امم ،
34:52لكن المشكلة هي أن
34:53المثلثات لا تتناسب مع
34:54الشبكات العصبية بشكل
34:55جيد . امم ، لأن الجزء
34:57المهم هو القابلية
34:58للاشتقاق . أنت بحاجة
34:59إلى أن تكون قادراً
35:00على إجراء التفاضل من
35:01خلال هذا التمثيل ،
35:02وتمرير التدرجات ،
35:03وهذا يعني تحديداً أنك
35:04تريد لتمثيلك خاصية
35:05مفادها أنني إذا قمت
35:07بتغيير المدخلات
35:07قليلاً ، فإن المخرجات
35:09تتغير أيضاً قليلاً .
35:10وهذا ليس هو الحال مع
35:11المثلث ، لأنه إذا كان
35:12لدي مثلث هنا وقمت
35:14بتحريكه قليلاً ، فجأة
35:15يصبح الشيء الذي كان
35:16غير مرئي مرئياً الآن .
35:18إذن ، لدي الآن تغيير
35:19حاد ، تغيير غير مستمر
35:21في الصورة التي سأراها
35:23كدالة للمعاملات . لذا ،
35:25كما تعلم ، لا تمتلك "
35:26غاوسيان سبلاتس " ( Gaussian
35:28splats ) هذه الخاصية لأن
35:29كل شيء سلس وكل شيء
35:31شفاف جزئياً . لذا ،
35:32الصورة التي تراها
35:33تتغير بشكل مستمر كلما
35:35قمت بتغيير أي من
35:36معاملات " غاوسيان
35:37سبلاتس " بشكل ضئيل
35:38للغاية . وما يعنيه ذلك
35:39هو أنها تتكامل مع
35:40الشبكات العصبية بشكل
35:41جيد جداً . فالشبكات
35:42العصبية كلها متعلمة
35:43تعتمد على التدرج ،
35:44أليس كذلك ؟ سيكون لدي
35:45دالة هدف . سأقوم
35:46بتقليل دالة الهدف تلك
35:47عن طريق خوارزمية
35:48انحدار التدرج .
35:49وللقيام بذلك ، أحتاج
35:50إلى أن أكون قادراً
35:51على تمرير إشارة
35:52التدرج من خلال أي
35:52تمثيل أستخدمه . و "
35:53غاوسيان سبلاتس " تمرر
35:55التدرجات بشكل جيد
35:56جداً . وهذا يعني أنه
35:57يمكن توصيلها
35:58بمحسّنات تعتمد على
35:59التدرج ، وإما تحسينها
36:00مباشرة مقابل مجموعة
36:01من الصور ، وهو ما يحدث
36:02في حالة إعادة البناء .
36:04أو يمكن توصيلها
36:05بمخرجات شبكة عصبية ،
36:06وهو ما نفعله أكثر في
36:08حالة " ماربل " ( marble ) . هناك
36:09، الإعداد هو أن لدي
36:10شبكة عصبية تخرج "
36:11غاوسيان " ، ويتم ربط
36:12تلك الـ " غاوسيان "
36:13بدالة خسارة ما . ثم
36:14يمكنني إجراء
36:15الانتشار العكسي
36:16للخسارة وصولاً إلى
36:17معاملات الشبكة
36:18العصبية . إذن هذا هو
36:19الفارق الأكبر نوعاً
36:20ما . هذا هو الابتكار
36:21الكبير في " غاوسيان
36:22سبلاتس " ، وسبب حماس
36:23الناس تجاهها على مدى
36:25السنوات القليلة
36:25الماضية هو أنها تمثيل
36:27رسومي يتكامل مع
36:28الشبكات العصبية بشكل
36:29نظيف للغاية . بربط ذلك
36:32ببعض الخصائص
36:34الأساسية لنماذج
36:35العالم ، وتحديداً
36:37الاتساق ، هل هي القدرة
36:39على الانتشار العكسي
36:40أم كيف نحصل على هذا
36:42الاتساق ؟ هل يأتي ذلك
36:48من النمذجة ؟ هل يأتي
36:51من النطاق ( الحجم ) ؟ من
36:53أين يأتي ذلك ؟ هل هو
36:55أمر يتعلق بالبنية
36:57المعمارية ؟ من أين
36:58يأتي ؟
36:59>> أعتقد أنه يمكن أن
Consistency by Construction and at Scale
37:00يأتي من أماكن كثيرة ،
37:01وهذه في الواقع نقطة
37:02انطلاق مثيرة
37:02للاهتمام للغاية ، لأن
37:03هناك خاصية للعالم من
37:04حولنا وهي أنه متسق ،
37:05أليس كذلك ؟ إذا نظرت
37:07إليك ، تبدو متشابهًا
37:08نوعًا ما من لحظة
37:09لأخرى ، أو إذا ذهبت
37:11إلى غرفة أخرى وعدت ،
37:12فستظل موجودًا هنا .
37:14أمم ، وهذا هو مفهوم
37:15الاتساق . أمم ، وهناك
37:17طرق مختلفة ، وتعتبر
37:18Gaussian Splats متسقة
37:19بطبيعتها ، أليس كذلك ؟
37:20لأن لدي هذا التمثيل
37:21ثلاثي الأبعاد الصريح
37:22للعالم . لذا إذا نظرت
37:23إليه ، ثم نظرت بعيدًا ،
37:24ثم عدت للنظر إليه ،
37:25فكل شيء موجود هناك في
37:27صورة ثلاثية الأبعاد ،
37:28لذا سيبدو كما هو . أمم ،
37:29ولكن يمكنك أيضًا
37:30الحصول على الاتساق
37:30عبر البيانات واسعة
37:31النطاق والتدريب واسع
37:32النطاق والحوسبة
37:33واسعة النطاق . وهذا
37:34يميل أكثر نحو
37:35التمثيلات الضمنية
37:36التي قمنا بها في RTFM
37:38وفي أماكن أخرى . إذن
37:39الفكرة هنا هي ماذا لو
37:41كان لدي نموذج لا
37:42يحتوي على Gaussian Splats
37:44ولا يحتوي على أبعاد
37:45ثلاثية ولا نقاط صريحة
37:47، فقط نموذج يخرج قيم
37:48بكسل RGB للعالم . أمم ،
37:50ولكن إذا كان هذا
37:51النموذج ذكيًا وقويًا
37:52للغاية وتم تدريبه على
37:54الكثير من البيانات
37:55وربما بهيكل معبر صحيح
37:56، فعلى الرغم من أنه
37:57غير مضمون رياضيًا ،
37:59ولا يوجد شيء يضمن
38:00رياضيًا أن يكون
38:01متسقًا ، فأنت تعلم ،
38:02أنه ينتهي به الأمر
38:03متسقًا . وأعتقد أن
38:05الأمر ليس في أن
38:06أحدهما أفضل من الآخر .
38:07إنهما مجرد نقطتين
38:08مختلفتين على منحنى
38:09التكنولوجيا ، أليس
38:10كذلك ؟ إذا كانت لديك
38:12ميزانية حوسبة منخفضة
38:13نسبيًا وتريد تشغيل
38:14الأشياء بشكل مدمج ،
38:16ولا تريد تدريب نماذج
38:17عملاقة ، فإن Gaussian Splats
38:19جذابة لأنها متسقة
38:20بطبيعتها . ولكن إذا
38:21كان بإمكانك التوسع
38:22واستخدام الكثير من
38:23البيانات والكثير من
38:24الحوسبة ، فأنا أعتقد
38:25حقًا أن مسار الأبعاد
38:26الثلاثية الضمني
38:27سيكون هو الشيء الذي
38:28يتوسع إلى ما لا نهاية .
38:29أمم ، لذا فهي مسألة
38:30هندسية تتعلق
38:31بمتطلبات التصميم
38:32للمشكلة التي تواجهني
38:33الآن ، وليست انقسامًا
38:35فلسفيًا بالنسبة لي .
38:36أليس كذلك ؟ إذا كنت
38:38تريد شيئًا رخيصًا
38:39ومتسقًا بطبيعته ، فإن
38:40Gaussian Splats جذابة للغاية
38:41. إذا كنت تريد شيئًا
38:43يتوسع إلى ما لا نهاية
38:44ويعتمد على بيانات لا
38:45نهائية وحوسبة لا
38:46نهائية ، ولكنك على
38:47استعداد لدفع تكلفة
38:48الحوسبة اللانهائية
38:49في وقت الاستدلال ،
38:50وعلى استعداد لدفع
38:51تكاليف التدريب
38:52الكبيرة ، فأعتقد أن
38:53نهج البكسلات الضمنية
38:54فقط جذاب للغاية . وهذا
38:56بالضبط سبب قيامنا
38:57بكلا الأمرين في World Labs
38:58. أعتقد أن الاتجاه
39:00الذي كنت أحاول المضي
39:02فيه بهذا السؤال هو
39:04التركيز أكثر على
39:05منظور النموذج
39:06والتوليد ، وفكرة أننا
39:08نصف عالماً يتم إنشاؤه
39:10أثناء التنقل . يمكن
39:14للمستخدم التنقل عبر
39:16هذا العالم ،
39:17والالتفات بعيداً ، ثم
39:19العودة ، ونحن نولد
39:21إطارات متسقة في حالة
39:23RTFM أو نقاط " سبيلاتس "
39:25في حالة Marble . والسؤال
39:28هو ، أعتقد أن جزءاً
39:30مما تقوله هو أن
39:32الاتساق يعتبر أمراً
39:33مستقلاً عما إذا كنا
39:35نتحدث عن توليد بكسلات
39:37أو توليد نقاط .
39:39وبالتالي ، فإن الجزء
39:40التالي من هذا السؤال
39:42هو أتعلم ، يبدو أن
39:43الاتساق جزء مهم جداً
39:45من كل هذا ، فمن أين
39:47يأتي ؟ أعني ، أعتقد أنه
39:48يأتي بشكل أساسي من
39:49بياناتك في النهاية ،
39:50أليس كذلك ؟ بمعنى ، بغض
39:52النظر عن التمثيل الذي
39:53تستخدمه ، سواء كان
39:54بكسلات خام أو نقاط
39:56غاوسية ، في نهاية
39:57المطاف ، يجب أن يكون
39:58لديك شبكة عصبية في
39:59النظام تم تدريبها على
40:01إنشاء بيانات متسقة .
40:02والنقاط الغاوسية
40:03تسهل على الشبكة
40:04العصبية إنتاج مخرجات
40:06متسقة لأنها أكثر
40:07اتساقاً بطبيعتها ،
40:09لكن في النهاية يجب أن
40:10يأتي ذلك من بيانات
40:11تعكس وجهات نظر للعالم
40:13متسقة بالطريقة التي
40:14تريد لنموذجك أن
40:16يتعلمها . أعتقد أن
40:17السؤال هنا أو الفرصة
40:19تكمن في التعمق في Marble
40:21والتحدث قليلاً عن "
40:23الوصفة " وكيف يخلق ذلك
40:25نموذجاً للعالم ، كيف
40:26يتم بناء نماذج عالم
40:28Marble .
40:29>> أعني أننا لم نتحدث
40:30صراحة عن بنية نموذج
How Marble Generates 3D Worlds
40:32Marble ، ولكن على مستوى
40:33عالٍ ، هو يسمح لك
40:35كمستخدم بإدخال أنواع
40:36مختلفة من الأشياء .
40:38يمكنك إدخال نص توجيهي
40:40، أو صورة ، أو صور
40:41متعددة ، أو حتى مقطع
40:43فيديو . ثم نقوم من ذلك
40:44بتوليد عالم من النقاط
40:46الغاوسية ثلاثي
40:47الأبعاد . وهناك خطوة
40:48وسيطة في ذلك تتمثل في
40:50توليد صورة بانورامية
40:52بزاوية 360 درجة . وهنا ،
40:54بالنظر إلى تلك
40:55المدخلات ، يكون لديك
40:57نوع من نموذج أو جزء من
40:59نموذج يولد رؤية
41:00بانورامية 360 درجة
41:02للعالم الذي توشك على
41:03إنشائه . وهذا نموذج
41:05توليدي كبير وقوي
41:06يحتاج إلى أخذ أي
41:07مدخلات من المستخدم
41:09ورسمها أولاً في
41:10بانوراما 360 درجة ، ثم
41:12من هناك تحويلها إلى
41:13عالم كامل من النقاط
41:14الغاوسية ثلاثي
41:16الأبعاد . هل يعني هذا
41:18أن مدخلات المستخدم
41:20تكون إما نقطة واحدة
41:21أو صورة واحدة أو ... أظن
41:29أنني أفكر في أنه إذا
41:31قدم المستخدم مجموعة
41:33متنوعة مكانيًا من
41:34الصور ، فهل يعني ذلك
41:36أن النطاق يصبح أكبر
41:38بكثير ؟
41:40>> أوه لا . لذا ، ما نقوم
41:41به في الأساس هو أن
41:42حالة الاستخدام
41:43الأبرز هي الاعتماد
41:44على صورة واحدة ، وهذا
41:45على الأرجح ما يعمل
41:46بشكل أفضل في ماربل
41:47اليوم . فالأمر يشبه
41:49أنني سأدخل صورة واحدة
41:51، وبالنسبة للعناصر
41:52التي أراها في تلك
41:54الصورة ، يجب أن يطابق
41:55عالمي المولد ما أراه
41:57في صورتي المدخلة ؛ ثم
41:59سيحاول النموذج إكمال
42:01ما لا يظهر في الصورة
42:02بطريقة منطقية . أليس
42:04كذلك ؟ لذا ، إذا كنت
42:06ألتقط صورة لسبورة في
42:07مقدمة فصل دراسي ، فيجب
42:09أن يعرف النموذج أن
42:10خلف السبورة توجد تلك
42:12الكراسي حيث يجلس
42:13الناس ، حيث يجلس
42:14الطلاب . ومن ثم يجب أن
42:16يكون النموذج قادرًا
42:17على أخذ صورة للسبورة
42:18وتكملتها ، مثل توليد
42:19الكراسي خلف السبورة ،
42:20ثم تحويل كل ذلك إلى
42:21ثلاثي أبعاد يمكنك
42:22التنقل فيه .
42:23>> وهل يقدم المستخدم
42:24مطالبات نصية أيضًا ؟
42:25>> أم ، يمكنهم ذلك . نعم ،
42:27يمكن للمستخدم توجيه
42:28هذا مباشرة من خلال
42:29النص . أم ، هذا اختياري
42:31نوعًا ما . إذا كنت ، كما
42:32تعلم ، ترغب في توليد
42:33عالمك من النص فقط ،
42:34يمكننا القيام بذلك .
42:35وإذا كنت ترغب في
42:36تقديم نص كمدخل إضافي
42:38لتقديم توجيه إضافي
42:39لما يحدث في صورتك
42:40المدخلة ، فهذا ممكن
42:41أيضًا . لكننا أردنا
42:42اتباع هذا النهج مع
42:43مارفل لتوفير أقصى قدر
42:45من المرونة
42:45للمستخدمين : بغض النظر
42:47عن نوع الإشارة التي
42:48لديك ، أو نوع التعديل
42:49الذي تقوم به ، أو أين
42:50تريد أن تأخذ الأمر
42:52بعد توليده ، نريد منحك
42:53الكثير من المسارات
42:54لاستخدام هذه الأداة
42:55وعدم محاولة توجيه
42:56الجميع عبر مسار واحد
42:58جامد حول كيفية توليد
42:59الأشياء أو مكان
43:00استخدامها لاحقًا . أظن
43:02أن أسئلتي أو افتراضي
43:04حول تعدد الصور نابع
43:06من أنني رأيت بعض
43:07عوالم ماربل . عوالم
43:11كانت عبارة عن غرف
43:12كلاسيكية ، حيث يمكنك
43:14الدوران حول الغرفة
43:16وتجد الكثير من
43:17التفاصيل ، وهي مثيرة
43:19للإعجاب للغاية . لكنني
43:22رأيت أخرى تبدو أشبه
43:24بعوالم ألعاب الفيديو
43:26الغامرة ، حيث يمكنك
43:28التنقل عبر ما يشبه
43:29قرية خيالية . وأعتقد
43:35هل يتم توليد كل ذلك
43:37بشكل عام من صورة
43:39واحدة وربما بعض
43:40التوجيه النصي ؟ أجل ،
43:42أعني أن هذا هو جمال
43:43وجود نموذج للعالم ضمن
43:45الحلقة ؛ إذ تمتلك
43:46نموذجاً توليدياً
43:47ضخماً وقوياً تم
43:48تدريبه على كم هائل من
43:50البيانات ، سواء كانت
43:51بيانات واقعية أو
43:52خيالية ، أو صوراً
43:53واقعية أو غير واقعية .
43:55إذن ، لديك هذا النموذج
43:56الضخم والقوي في
43:58الخلفية ، وبغض النظر
43:59عن نوع الصورة أو النص
44:00الذي تقدمه ، سواء كانت
44:02الصورة لغرفة في منزلك
44:03أو بيئة خيالية تشبه
44:05ألعاب الفيديو ، فلديك
44:06نموذج يعرف كل هذه
44:07الأنواع المختلفة من
44:09العوالم ويمكنه
44:10توليدها حسب الضرورة
44:11للمهمة المطلوبة . وهذا
44:13هو الفرق الجوهري بين
44:14وجود هذه النماذج
44:15التوليدية المدعومة
44:17بنموذج عالمي ضخم وبين
44:18تقنيات " التبقيع
44:20الغاوسي " التقليدية
44:21التي تكتفي بمطابقة
44:22ألف صورة لدي . وماذا
44:24يمكنك أن تقول عن
Training Data and Output Representations
44:25مجموعات البيانات
44:26المستخدمة لإنشاء هذه
44:27النماذج وعن نهج
44:28التدريب وطريقته ؟
44:29>> أجل ، أعني أنك بحاجة
44:30إلى التدريب على
44:31الكثير من البيانات .
44:32ومن الأمور المهمة
44:33حقاً القدرة على
44:34التدريب على مجموعة
44:35متنوعة من البيانات
44:36المختلفة ، أليس كذلك ؟
44:38لأن العالم في نهاية
44:39المطاف ثلاثي الأبعاد
44:40ويحتوي على الكثير من
44:41البنية ثلاثية
44:42الأبعاد . لكن لا توجد
44:43الكثير من البيانات
44:44ثلاثية الأبعاد
44:45الصريحة التي يمكنك
44:46التعلم منها . إنه نوع
44:47نادر جداً من البيانات
44:48. لكن هناك الكثير من
44:49الصور المتاحة . وهناك
44:51الكثير من مقاطع
44:51الفيديو المتاحة .
44:52والصور ومقاطع
44:53الفيديو كلاهما
44:54إسقاطات ثنائية
44:55الأبعاد لعالم ثلاثي
44:56الأبعاد . لذا ، حتى لو
44:57كنت تريد نموذجاً ينتج
44:59في النهاية محتوى
45:00ثلاثي الأبعاد ، فمن
45:01القوي جداً أن يتعلم
45:02من كميات كبيرة من
45:03بيانات الصور
45:04والفيديو ، لأنك
45:05تستطيع الحصول عليها
45:06بكميات ضخمة جداً .
45:07وعندما تحصل على
45:08بيانات ثلاثية
45:09الأبعاد صريحة ، فهذا
45:10مفيد جداً للتعلم ،
45:11لكنك لا تريد أن يقتصر
45:13تعلمك على البيانات
45:14ثلاثية الأبعاد فقط .
45:15أفترض أنك تحاول
45:16التدريب على أي بيانات
45:18متاحة لديك بشكلها
45:20الأصلي بدلاً من أخذ
45:21صورة وإسقاطها في بعد
45:23ثالث ، وهو أمر يبدو
45:25مكلفاً للغاية
45:26ومشوهاً .
45:27>> أجل . أعني ، أحد الدروس
45:28التي تعلمناها من
45:29التعلم العميق على
45:30مدار العقد الماضي هو
45:31أنك تحتاج إلى نماذج
45:32كبيرة مدربة على
45:32الكثير من البيانات
45:33ومدربة من البداية إلى
45:34النهاية . لذا ، إذا كان
45:35لديك نموذج ، فما هي
45:36مهمتك ؟ هل مهمتك هي
45:38توليد عوالم " غاوسيان
45:39سبلات " اليوم ، أم
45:40توليد إطارات متسقة
45:41ثلاثية الأبعاد قوية
45:42حقاً في اليوم التالي ؟
45:43فكر فقط في المهمة
45:44التي تريد حلها ، وكيف
45:45يمكنني حشد كميات
45:46كبيرة جداً من
45:47البيانات للسماح
45:48لنموذج ما بتعلم كيفية
45:50حل تلك المهمة بطريقة
45:51عامة جداً . هل مخرجات
45:53النموذج هي " سبلاتس "
45:54مباشرة أم هناك شيء ما
45:56؟ أعتقد أن هذا يشبه ما
45:59كنت تقوله للتو ، هل
46:01ينتج نوعاً من التمثيل
46:03ثلاثي الأبعاد الموحد
46:04أياً كان ، ويمكنك
46:06تحويله إلى وحدات بكسل
46:08أو " سبلاتس " ، أم أنه
46:09يخرج " سبلاتس " مباشرة ؟
46:11نعم ، المخرج الأكثر
46:12دقة من هذا النموذج هو
46:14" سبلاتس " بطريقة أو
46:15بأخرى . وبمجرد حصولك
46:16على " سبلاتس " ، فهذا هو
46:18نوع صيغة الثلاثية
46:19الأبعاد الأقل
46:19تعقيداً لدينا . لذا
46:20بمجرد امتلاكك للـ "
46:22سبلاتس " ، يمكنك
46:22تصييرها إلى صورة ،
46:23وهذا يمكن أن يمنحك
46:25صوراً أو مقاطع فيديو
46:26من هذه العوالم .
46:27يمكننا أيضاً ، يمكنك
46:28أيضاً ملاءمة تمثيل
46:30شبكي للعالم . وفي بعض
46:31السياقات ، مثل رغبتك
46:33في استيراد هذا إلى
46:34محرك ألعاب أو محرك
46:35مؤثرات بصرية ،
46:36أحياناً لا تعمل هذه
46:37المحركات بشكل جيد مع
46:38الـ " سبلاتس " حالياً .
46:40ومن المفيد امتلاك
46:41شبكة مثلثات ثلاثية
46:42الأبعاد أكثر
46:43كلاسيكية للعالم . لذا
46:44فإن الـ " سبلات " هو نوع
46:45مخرجاتنا الأكثر دقة
46:46من نماذج " ماربل " ، ومن
46:48ثم يمكنك الانتقال من
46:49ذلك إلى صور أو
46:50فيديوهات أو شبكات .
46:51ولكن مرة أخرى ، هذا
46:53يتناقض بشكل صارخ مع
46:54نموذج " RTFM " حيث لا توجد
46:56" سبلاتس " . إنه يخرج
46:57وحدات البكسل مباشرة .
46:59لقد أشرنا في وقت سابق
47:00إلى منشور المدونة
47:03الذي كتبته مؤخراً أو
47:05الذي نشره فريقك
47:07مؤخراً . واعتقدت أن ما
47:11كان مثيراً للاهتمام
47:13حقاً في ذلك هو أنني
47:15كمحلل ، في أي وقت أرى
47:17فيه تصنيفاً يحاول
47:18تفكيك الفروق في مجال
47:20ما والحديث عنها ، أكون
47:22مهتماً . وهذا هو ما
47:27حاولت القيام به على
47:28الأقل في بُعد معين
47:30لنماذج العالم . أعتقد
47:32أننا قدمنا ثلاث أو
47:34أربع تصنيفات أخرى في
47:35هذه المحادثة حتى الآن
47:37. ولكن تحدث قليلاً عن
47:40الطريقة التي قسمت بها
47:42ذلك البعد الخاص من
47:44نماذج العالم . كما قلت
47:46، وكما تحدثنا عدة
47:47مرات ، أعتقد أن هناك
World Models as Renderers, Planners, and Simulators
47:49الكثير من الأنواع
47:50المختلفة لما يدربه
47:51الناس ويطلقون عليه
47:52نماذج العالم ، والتي
47:54تبدو مختلفة تماماً من
47:55الخارج . وعندما فكرنا
47:56في الأمر بجدية ،
47:58أدركنا أن هناك إطاراً
47:59تظهر فيه جميعها في
48:01الواقع كوجهات نظر
48:02مختلفة لشيء واحد .
48:04وهناك أدركنا أنه
48:05يمكننا ربط هذا مجدداً
48:07بنظام POMDP الذي تحدثنا
48:08عنه من قبل . لأنك في
48:10نظام POMDP هذا ، تذكر أن
48:12هناك ثلاثة أشياء
48:13تتحرك في النظام . لديك
48:15الوكيل في العالم ، ثم
48:16يقوم الوكيل بإنتاج
48:18الإجراءات ، ويقوم
48:19العالم بتغيير حالاته
48:21، ثم يتلقى الوكيل
48:22الملاحظات . وقد أدركنا
48:24أنه إذا فكرت في الأمر
48:25بهذه الطريقة ، فإن كل
48:27ما يدربه الناس اليوم
48:28ويسمونه نماذج العالم
48:30، يقوم عادةً بإخراج
48:31واحد من ثلاثة أشياء
48:33في تلك الحلقة . إما أنك
48:35تبني نموذجاً يُخرج
48:36إجراءات ، أو تبني
48:38نموذجاً يُخرج حالات ،
48:39أو تبني نموذجاً يُخرج
48:41ملاحظات . وبمجرد أن
48:43أدركنا ذلك ، كانت لحظة
48:44إدراك مفاجئة ، وهي أن
48:46هؤلاء الأشخاص لا
48:47يبنون أشياء مختلفة
48:48تماماً . إنهم يركزون
48:50فقط على أجزاء مختلفة
48:51من حلقة POMDP الأساسية
48:53هذه . وجميعها مترابطة
48:54معاً لمحاولة نمذجة
48:55العالم وفهم كيفية
48:56استجابة العوالم
48:57وتطورها وتغيرها
48:58بمرور الوقت ، لكن
49:00الأشخاص يركزون على
49:01أجزاء مختلفة من تلك
49:02الحلقة لتطبيقات
49:03مختلفة .
49:04>> فهمت . إذاً شيء مثل "
49:06جيني " ( Genie ) الذي ينتج
49:08تدفقاً من البكسلات
49:10سيكون ملاحظات في هذا
49:12النموذج ، وشيء مثل
49:14نظام روبوتي ينتج
49:15إجراءات ليقوم بها
49:17الروبوت في العالم
49:19يكون أكثر تركيزاً على
49:21ذلك كمخرجات .
49:23>> بالضبط . إذاً ، قمنا
49:26بتصنيف هذه إلى هذه
49:28الفئات الثلاث
49:29المختلفة لنماذج
49:30العالم بناءً على ما
49:32تنتجه . فكما قلت ، إذا
49:34كنت تُخرج الملاحظة
49:35مثل " جيني " أو " RTFM " ،
49:37فإننا نسمي ذلك نموذج
49:38عالم تصييري ( rendering ) أو
49:40مجرد مصيّر ، لأنه ينتج
49:42ملاحظة نهائية يمكن
49:44لشخص أو ربما لوكيل
49:45استهلاكها . إذاً هذا
49:47ما نطلق عليه اسم "
49:48المصيّر " كنموذج
49:50للعالم . ثم النوع
49:51الآخر ، والنوع الرائع
49:52الآخر ، هو كل هؤلاء
49:53الأشخاص الذين يدربون
49:55سياسات الروبوتات ،
49:56أليس كذلك ؟ أي أن
49:57الناس يدربون نماذج
49:58تقوم بتشغيل جسم روبوت
49:59، ثم يقوم جسم الروبوت
50:01بفعل شيء رائع في
50:02العالم . ولكن ماذا
50:03يفعل ذلك النموذج إذن ؟
50:04هذا النموذج يقع
50:05تقريباً على الجانب
50:06الآخر من حلقة POMDP ،
50:07أليس كذلك ؟ إنه يتلقى
50:08ملاحظات من العالم
50:09الحقيقي ، والآن يحتاج
50:11النموذج لاتخاذ
50:11إجراءات ، كما تعلم ،
50:12لمحاولة إحداث تغيير
50:13في العالم . ومن ثم
50:14لديهم نموذج عالم
50:16يستقبل ملاحظات
50:16العالم الحقيقي ويخرج
50:18إجراءات ليتم تنفيذها
50:19في العالم الحقيقي .
50:20وهذا ما نسميه المخطط ،
50:22أي نموذج العالم كمخطط
50:23، لأنه يخطط لسلسلة من
50:25الإجراءات التي يجب
50:26اتخاذها في العالم .
50:28وهذا يكاد يكون
50:29مماثلاً تماماً
50:30لنموذج العالم كعارض ،
50:31لأن العارض يتلقى
50:33نوعاً ما إجراءات ،
50:34ربما من مستخدم بشري ،
50:35ثم يخرج ملاحظات لما
50:37قد يبدو عليه العالم
50:38في ظل تلك السلسلة من
50:40الإجراءات . لذا ،
50:41العارض والمخطط هما
50:42تقريباً متقابلان
50:43بشكل مثالي لبعضهما
50:44البعض . والثالث هو ،
50:46ماذا عن الحالة ؟ هذه
50:47نقطة صعبة نواصل
50:48العودة إليها . حسناً ،
50:50نحن نسمي ذلك نموذج
50:51العالم كمحاكي ، لأن
50:53خاصية أخرى مهمة
50:54لنماذج العالم هي أنها
50:56ربما يجب أن تقوم بنوع
50:58من محاكاة الحالة . في
50:59بعض السياقات ، أنت
51:00تهتم فقط بإجراء
51:02الملاحظة ، ولكن في
51:03سياقات أخرى قد ترغب
51:04في معرفة شيء ما عن
51:06حالة العالم قيد النظر
51:07، وربما تفهم أو تحاكي
51:09كيف قد تتطور تلك
51:10الحالة استجابةً
51:11للإجراءات بطريقة
51:12صريحة أو شبه صريحة .
51:14هذا هو نموذج العالم
51:15كمحاكي ، وقد أدركنا
51:17أننا عندما نحلل الأمر
51:18إلى هذه المصطلحات ،
51:20فإن معظم نماذج العالم
51:21التي يتدرب عليها
51:23الناس هذه الأيام يمكن
51:24تصنيفها عادةً في
51:25واحدة من هذه الفئات
51:27الثلاث . وجدت أن
When Rendering and Simulation Overlap
51:31المحاكي مثير
51:32للاهتمام لأنني عادة
51:33ما أفكر في المحاكاة
51:35كأداة خارجية
51:36نستخدمها لتطوير
51:38النماذج ، بدلاً من هذا
51:40الإطار الذي يكون فيه
51:42النموذج نفسه في
51:43الأساس محاكياً .
51:47>> وهناك شيء آخر مثير
51:48للاهتمام هو أن هذه
51:49المفاهيم تبدأ في
51:50التداخل ، وأعتقد أن
51:52ماربل ( Marble ) هو في
51:53الواقع مثال لشيء يقع
51:54إلى حد ما على الحدود
51:55بين نموذج العالم
51:57كعارض ونموذج العالم
51:58كمحاكي ، أليس كذلك ؟
51:59لأنه عندما تتفاعل
52:01كمستخدم مع ماربل ،
52:03أليس كذلك ؟ أنت ترى
52:04بكسلات على الشاشة ،
52:06أليس كذلك ؟ وتلك
52:07البكسلات ، كما تعلم ،
52:08من هذا المنطلق ، أنت
52:09ترى ملاحظة ، لكن تلك
52:11الملاحظة لم تأتِ
52:11مباشرة من الشبكة
52:12العصبية . تلك الملاحظة
52:14جاءت من مجموعة من
52:15التلطيخات الغاوسية (
52:16Gaussian splats ) . وتُعد
52:16الغاوسية المبعثرة (
52:17Gaussian splats ) نوعاً من
52:18تمثيل الحالة ، هذا
52:19التمثيل الصريح
52:20للحالة الذي نمتلكه
52:21للعالم . وبمجرد حصولك
52:22على هذا التمثيل
52:23الصريح للحالة ، يمكنك
52:24القيام بأشياء أخرى
52:25بها بخلاف العرض
52:26الرسومي . أليس كذلك ؟
52:28ولأنه تمثيل ثلاثي
52:29الأبعاد صريح ، يمكنك
52:30قياس المسافة بين
52:32نقطتين أو يمكنني
52:33التلاعب بالحالة بشكل
52:34مباشر عن طريق جلب أصل
52:35كائن آخر ووضعه في ذلك
52:37العالم . لذا ، فإن عالم
52:38مثل نسخة ماربل ( Marble )
52:39التي لدينا اليوم ،
52:40تبدو تجربة المستخدم
52:42فيه شاملة ( end-to-end ) حيث
52:43ترى الملاحظات وترى
52:44البكسلات على الشاشة .
52:45وهكذا فهو أشبه
52:47بمُصيّر ( renderer ) ، لكن
52:48النموذج نفسه يخرج
52:49حالة عالم صريحة أو
52:51شبه صريحة يمكنك
52:52استخدامها لأغراض
52:53أخرى .
52:54>> يبدو هذا تمييزاً أكثر
52:56دقة بكثير من مجرد
52:57مُصيّر ومخطط . فإذا
53:01فكرت في مُصيّر بدلاً
53:03من إخراج إطارات
53:04ثنائية الأبعاد ، كان
53:06يخرج بطريقة ما
53:07أبعاداً ثلاثية
53:09مباشرة ، حينها يمكنك
53:11قياس المسافات بين
53:12النقاط ، وهذا تمثيل
53:14ولكنه أيضاً ملاحظة في
53:16نفس الوقت .
53:19>> بالضبط ، وهذه هي
53:20النقطة الأخرى التي
53:21أردنا توضيحها هنا ،
53:22وهي أنه على الرغم من
53:24وجود هذا التصنيف ، إلا
53:25أنه ليس جامداً جداً ،
53:26وأعتقد أن التمسك به
53:28بصرامة سيكون مضراً
53:29لنا جميعاً ، أليس كذلك
53:30؟ فالعالم الحقيقي
53:31فوضوي وكل تصنيفاتنا
53:33تنهار ، لكنه يظل إطار
53:34عمل مفيداً للتفكير .
53:36لكن في الواقع ، أعتقد
53:37أن نماذج العالم التي
53:38ستقودنا في نهاية
53:39المطاف ستمزج كل هذه
53:41الجوانب معاً ، أليس
53:42كذلك ؟ نحن نريد في
53:43النهاية الحصول على
53:44نظام موحد يمكنه
53:45القيام بكل هذه
53:46الأشياء .
53:47>> أجل . لكنني أعتقد أنني
53:49أطلب أيضاً المزيد من
53:51التوضيح حول المحاكي و
53:53... هل هناك أمثلة أخرى
54:00تتجاوز مثال ماربل
54:02تجسد فكرة النموذج
54:03كمحاكي ؟
54:05>> نعم ، أعتقد أن هناك
54:07بضعة أمثلة . في الواقع
54:08، لا أعتقد أن أحداً قد
54:09أتقن ذلك تماماً في
54:10الوقت الحالي . وهذا هو
54:11السبب ، لكنني أعتقد أن
54:12هناك بضعة أنماط من
54:13الأنظمة المستقبلية
54:14التي يمكنني تخيلها
54:15هنا . أحدها قد يكون
54:16نسخة مستقبلية من حالة
54:18ماربل الصريحة . لا
54:19يعني هذا أن هذا ما
54:21سنفعله بالفعل ، ولكن
54:22هذا ما يمكن للمرء
54:23فعله . كما لا يعني أننا
54:25لا نفعله أيضاً ، أليس
54:27كذلك ؟ لكن . لكن يمكنك
54:29تخيل نسخة من هذا
54:30تتعامل مع شيء مثل "
54:32التمثيل الغاوسي "
54:33كحالة للعالم ، ولكنها
54:35تمتلك نموذجاً يطور
54:36هذه الحالة بمرور
54:37الوقت . لذا يمكنك
54:38الحصول على نموذج
54:39يتلقى صورة كمدخل ،
54:41ويخرج " تمثيلاً
54:42غاوسياً " للعالم ، ثم
54:43يقوم المستخدم بإجراء
54:44ما مثل التقاط زجاجة
54:46أو تحريك شيء ما ،
54:47وعندها سيكون لديك
54:48نموذج يقوم بتحديث هذا
54:49العالم الغاوسي
54:50باستخدام شبكة عصبية
54:52قوية . إذاً ، سيكون هذا
54:53نموذجاً يعمل مع حالة
54:54العالم الصريحة أو شبه
54:55الصريحة هذه ، ويكون
54:56قادراً فعلياً على
54:58تطوير حالة العالم هذه
54:59بمرور الوقت استجابةً
55:00للإجراءات . لا أعتقد
55:01أن أحداً قد بنى
55:02نظاماً كهذا حقاً ، لكن
55:04يمكنهم ذلك . والخيار
55:05الآخر سيكون نوعاً من
55:06حالة العالم الضمنية .
55:08وربما يمكننا بناء
55:09أنظمة لا تعمل على
55:10التمثيل الغاوسي
55:11مباشرة ، بل تمتلك
55:12نوعاً من التمثيل
55:13المتجهي الضمني لحالة
55:15العالم . وهي تتصرف
55:16بالطريقة التي تجعل
55:18الحالة الصريحة تُخرج
55:19ملاحظات منها . يمكنك
55:21امتلاك شبكات تتنبأ
55:22بكيفية تطور تلك
55:23الحالة استجابةً
55:24للأفعال ، وتتنبأ
55:25بكيفية تطورها بمرور
55:27الوقت ، وبنوع من
55:28الشبكات العصبية
55:29المماثلة لحالة
55:30العالم الصريحة تلك .
55:31أعتقد أن الناس يعملون
55:33على ذلك ، لكن يبدو أنه
55:34لا يزال سؤالاً بحثياً
55:36مفتوحاً تماماً حول
55:37الوصفة الدقيقة لجعل
55:38ذلك يعمل .
55:39>> نعم . الشيء الآخر الذي
55:42يتبادر إلى ذهني عند
55:43التفكير في المحاكاة
55:45هو أن التعبير المثالي
55:47عنها ربما يكون " باني
55:49النظريات " الذي تحدثنا
55:51عنه . إذ يأخذ هذه
55:53الأفكار المجردة
55:55ويختزلها ، في هذه
55:56الحالة ، تصبح الحالة
55:58عبارة عن مجموعة من
55:59النظريات حول العالم .
56:01>> نعم . أعني حينها عليك
56:03التحدث عن الحالات
56:04والحالات الفوقية ،
56:05والنظريات والنظريات
56:06الفوقية ، والارتقاء
56:07بمستوى التجريد ،
56:08يمكنك القول ربما أن
56:09باني النظريات هو من
56:11يكتب قوانين الفيزياء
56:12في الحالات . لذا
56:13فالنظرية تغلف نوعاً
56:14ما أنواع العوالم التي
56:15قد توجد وكيف يُسمح
56:17لهذه العوالم بالتطور .
56:18ومن ثم تكون الحالة
56:19عبارة عن تجسيد واحد
56:20محدد للنظرية يخبرك عن
56:22عالم معين . لكنني لا
56:23أعتقد أن لدى أي شخص
56:24أدنى فكرة عن كيفية
56:25القيام بذلك .
56:26>> نعم . نعم . حسناً . لقد
The Path to Unified World Models
56:28أصبحنا أكثر تجريداً
56:29مما ينبغي هنا . هلا
56:30تحدثت قليلاً عن فكرة
56:32نموذج العالم الموحد ؟
56:35أعتقد أننا التقطنا
56:37ذلك قليلاً ، وهي مجرد
56:39فكرة أنها تجريد غير
56:40محكم نوعاً ما ، وأنت
56:42لا تتوقع ، بل تتوقع
56:44نوعاً من التداخل في
56:46المنتجات الواقعية .
56:49>> بالضبط . ما أعتقد أننا
56:51سنصل إليه كمجال هو
56:52نماذج يمكنها القيام
56:53بكل هذه المهام بشكل
56:54مشترك . وأنها جميعاً
56:55ستستفيد من بعضها
56:56البعض . ولماذا هذا ؟
56:58لأنها جميعاً تطرح
56:59أسئلة متشابهة ، فهي
57:00تريد أن تفهم ما هي
57:01أنواع العوالم التي
57:02يمكن أن توجد ؟ كيف
57:04يمكن لتلك العوالم أن
57:05تستجيب للفعل ؟ كيف
57:06تبدو تلك العوالم ؟ ما
57:07نوع الملاحظات التي
57:08تنشأ من تلك العوالم ؟
57:10كيف تتطور عبر الزمن ؟
57:11ما الذي يمكنك فعله
57:12بها ؟ هذه كلها أسئلة
57:14جوهرية ترتبط ببعضها
57:15البعض . أليس كذلك ؟ إذا
57:17أصبحت أفضل في فهم
57:18كيفية تطور حالة
57:19العالم ، فمن المحتمل
57:20أنني سأصبح أفضل أيضاً
57:21في توقع كيف ستبدو من
57:22زوايا مختلفة كعارض (
57:23Renderer ) . وإذا كنت جيداً
57:24حقاً في التخيل وكيف
57:25ستتطور حالة العالم
57:26الضمنية ، فمن المحتمل
57:28أن يكون ذلك جيداً
57:28للتخطيط ، أليس كذلك ؟
57:30إذا كنت أعرف ، إذا كان
57:31بإمكاني ضمناً تطوير
57:32حالة عالمي ، فمن
57:32المحتمل أنني أستطيع
57:33أيضاً التخطيط بناءً
57:34على تلك الحالة ومعرفة
57:35كيفية اتخاذ إجراءات
57:36للتأثير على العالم .
57:37لذا ، لا أعتقد أننا
57:38وصلنا إلى هناك بعد ،
57:39لكنني أعتقد أننا خلال
57:41العامين المقبلين ،
57:42سنبدأ في رؤية نماذج
57:43تجمع المزيد والمزيد
57:44من هذه القدرات في
57:45نموذج واحد موحد وقوي .
57:47ومن ثم ، فإن نوع
57:48المخرجات التي تريدها
57:49في لحظة معينة لا
57:50يعتمد على وجود نماذج
57:52متخصصة كعارضات أو
57:53محاكيات أو مخططات ، بل
57:54يتعلق أكثر بـ : اليوم
57:55أريد تشغيل روبوت ، لذا
57:57سيعمل في وضع المخطط ؛
57:58وغداً أريد تشغيل لعبة
58:00فيديو افتراضية ، لذا
58:01سيعمل في وضع العارض ؛
58:02أو في اليوم التالي
58:04أريد محاكاة احتمالات
58:05افتراضية في عالم ما ،
58:06والآن أريده أن يعمل
58:08في وضع المحاكي . لذا
58:09أعتقد أن هذا هو
58:10الاتجاه الذي سيتجه
58:11إليه المجال في
58:12العامين المقبلين . هذا
58:13يجعلني أفكر في فكرة
58:15أن طبقة المخرجات في
58:17الشبكة العصبية ، يمكن
58:19أن تكون تصنيفاً أو
58:20انحداراً أو شيئاً آخر
58:22. لكن ، التمثيل
58:24الأساسي ، كما تعلم ، هو
58:26نفسه في الغالب ، ونحن
58:28نستخدمه بطرق مختلفة
58:30فقط .
58:31>> نعم ، بالضبط . أعتقد أن
58:33هذا ما سنصل إليه .
58:34سيكون لدينا نماذج
58:35عالمية موحدة ضخمة
58:36تحتوي ربما على رؤوس
58:37إدخال وإخراج مختلفة
58:38تعرف كيفية التعامل مع
58:39أنواع مختلفة من
58:40البيانات . لكن في
58:41النهاية ، كل الحوسبة
58:43والمعلمات لهذا
58:44النموذج ستكون عبارة
58:45عن هيكل مشترك يمثل
58:46هذا النموذج العالمي
58:47الذي يعرف كيف يحاكي
58:48أي شيء ضمنياً في
58:49أوزانه . بعد ذلك ،
58:51يمكنه إظهار هذه
58:52المعرفة بالعالم
58:53كأفعال أو حالات أو
58:54ملاحظات حسب الحاجة
58:56للتطبيق . أعتقد أن
58:57السؤال التالي الذي
58:59أردت طرحه ، وهو بمثابة
59:01سؤال ختامي ، هو : هل
59:02توصلنا البنى الحالية
59:04إلى ذلك ؟ لقد قلت للتو
59:06، كما تعلم ، نوعاً ما
59:09لا . البنية تتطور ،
59:12لكنها متسقة مع
59:13الطريقة التي نفكر بها
59:15في نماذج اليوم مثل
59:17المحولات وغيرها . هل
59:21تتوقع الحاجة إلى قفزة
59:23معمارية كبيرة لتحقيق
59:25إمكانات النماذج
59:26العالمية ؟
59:27>> ربما نعم ، لكن ليس
59:28قفزة كبيرة جداً ، على
Architectures, Loss Functions, and Long Contexts
59:30الأرجح ليست ضخمة .
59:31أعتقد أن المحولات
59:32قوية جداً حقاً .
59:33>> نعم ، أحصل على هذا
59:34السؤال كثيراً : هل
59:35يعني ذلك أن المحولات
59:36قد انتهت ؟ هل نحتاج
59:37إلى بنى جديدة ؟ لا ،
59:38المحولات رائعة .
59:39المحولات فائقة القوة .
59:41إنها تتوسع بشكل جيد
59:42جداً . يمكنها العمل
59:43على جميع أنواع
59:44البيانات المختلفة .
59:45لذا ، المحولات قوية
59:47للغاية . يمكن
59:48استخدامها في جميع
59:49أنواع المشكلات
59:49المختلفة . أعتقد أن
59:51هناك سؤالاً حول دالة
59:52الخسارة المناسبة
59:53لتدريب هذه الأنواع من
59:54النماذج التوليدية ،
59:55وهذا الأمر لا يزال
59:56غير محسوم . هل نريد
59:58تدريب هذه الأشياء
59:59كنموذج توليدي ؟ إذا
1:00:00كان نموذجاً توليدياً
1:00:01، هل تدربه عبر
1:00:02الانتشار أو التدفق
1:00:03المصحح ؟ هل تدربه
1:00:04كنموذج انحدار ذاتي
1:00:06منفصل أم بشيء آخر ؟
1:00:07لذا هناك مسألة تتعلق
1:00:08بدالة الخسارة تنطبق
1:00:10على أي نموذج توليدي ،
1:00:11وأعتقد أنها ستتطور
1:00:12وقد حدث ذلك بالفعل ،
1:00:13فكنا نستخدم شبكات GANs ،
1:00:14والآن نستخدم
1:00:15الانتشار . هذا تغيير
1:00:16في دالة الخسارة أكثر
1:00:18منه تغييراً في البنية
1:00:19. مم ، لكن ، كما تعلم ،
1:00:20هناك مجال آخر أعتقد
1:00:22أننا بحاجة إلى رؤية
1:00:23بعض التطور المعماري
1:00:24فيه ، وهو كيف نتعامل
1:00:25مع سياق طويل جداً
1:00:26جداً وعدد كبير جداً
1:00:28جداً من الرموز (
1:00:29التوكنز ) . حسناً ، هذا
1:00:30أمر يظهر بالفعل في
1:00:31النماذج اللغوية
1:00:32الكبيرة ( LLMs ) ، فهي
1:00:33تعتمد على معمارية
1:00:34المحولات ( Transformers ) .
1:00:35إنها تعمل على الرموز ،
1:00:36لكن يمكنك حل الكثير
1:00:37من المشكلات . ربما
1:00:38يكون هذا أقل صحة الآن
1:00:39في عصر الوكلاء
1:00:40الأذكياء ، لكن قبل بضع
1:00:41سنوات ، كان من الصعب
1:00:43تخيل مواقف تحتاج فيها
1:00:44النماذج اللغوية
1:00:45للعمل على مليون أو 10
1:00:46ملايين رمز ، لأن هذا
1:00:47يعادل كتباً كاملة .
1:00:48نعم ، من حيث المبدأ
1:00:50هناك مشكلات تتطلب حشر
1:00:51كتب كاملة في سياقك ،
1:00:53ولكن ربما يمكنك فعل
1:00:54الكثير باللغة دون
1:00:55الحاجة إلى سياق بهذا
1:00:57الحجم . لكن الآن ، إذا
1:00:58أردنا الحديث عن
1:00:59العوالم ، مثل الحاجة
1:01:01إلى توليد أو نمذجة
1:01:02الكثير من الصور عالية
1:01:04الأبعاد أو الكثير من
1:01:05المساحات ثلاثية
1:01:06الأبعاد ، فمن السهل
1:01:07جداً الوصول لمواقف
1:01:09تحتاج فيها مئات
1:01:10الآلاف أو الملايين أو
1:01:11عشرات الملايين من
1:01:13الرموز كـسياق
1:01:14لمشكلات نمذجة العالم .
1:01:15لذا أعتقد أننا بحاجة
1:01:17إلى رؤية تطور في
1:01:18كيفية تكييف المحولات
1:01:20للعمل بأطوال سياق
1:01:22طويلة جداً ، لأن ما
1:01:23كان يعتبر ميزة إضافية
1:01:25في النماذج اللغوية ،
1:01:27أصبح مشكلة يومية لأي
1:01:29نموذج عالم واسع
1:01:30النطاق . هذا يطرح
1:01:32السؤال : كيف يجب أن
1:01:33نفكر في الرموز
1:01:35والسياقات في نماذج
1:01:36العالم ؟ هل يحد طول
1:01:39السياق من حجم العالم ؟
1:01:41أم أننا نقوم بترحيل
1:01:42أجزاء من العالم بحيث
1:01:44لا يكون قيداً صارماً ؟
1:01:46وهل يتوافق الرمز مع "
1:01:48سبلات " أو هيكل آخر ؟
1:01:50كيف ترتبط هذه الأشياء
1:01:51ببعضها ؟
1:01:52>> أعتقد أن هذا هو
1:01:53المجال الذي تحدث فيه
1:01:54الكثير من الأشياء
1:01:55المختلفة ، وهو المكان
1:01:56الذي أرى فيه الكثير
1:01:57من التطور . ففي بعض
1:01:58المعماريات ، قد يكون
1:02:00الرمز عبارة عن جزء
1:02:02صغير من مقطع فيديو ،
1:02:04ربما 16 في 16 بكسل
1:02:05مكانياً وأربعة
1:02:06إطارات زمنية . لذا ، في
1:02:08بعض المعماريات ،
1:02:09الرمز هو حرفياً رقعة
1:02:11صغيرة من مقطع فيديو .
1:02:12وفي بعض المعماريات
1:02:13الأخرى ، قد يكون ذلك
1:02:14الرمز حزمة صغيرة من "
1:02:16السبلات " في مكان ما من
1:02:17العالم . وفي بعض
1:02:18المعماريات ، قد يكون
1:02:19ذلك الرمز جزءاً
1:02:20صغيراً من مساحة
1:02:21ثلاثية الأبعاد . ربما
1:02:23قمت بتقسيم مساحتي
1:02:24ثلاثية الأبعاد إلى "
1:02:25فوكسلات " ، والآن
1:02:25يتوافق كل رمز مع جزء
1:02:26من تلك المساحة ثلاثية
1:02:28الأبعاد . أم ، أو ربما
1:02:29تكون هذه الرموز شيئاً
1:02:31مجرداً وكامناً ، ربما
1:02:32لدي حالة عالم كامنة
1:02:34هي مجرد رقم ، أو ربما
1:02:35خصصت ألف رمز لحالة
1:02:37عالمي . ماذا تعني ؟ إنه
1:02:38نموذج غامض توصل إلى
1:02:40حل . أعتقد أن هذا هو
1:02:41المجال الذي نرى فيه
1:02:42الكثير من التطور
1:02:43والعديد من الأساليب
1:02:44المختلفة التي تقوم
1:02:44بأشياء متنوعة من
1:02:45الناحية الهيكلية . وفي
1:02:46إطار هذا السياق
Where to Learn More
1:02:48الهيكلي أيضاً ، هل ترى
1:02:49دوراً لهذه الأفكار
1:02:51المتعلقة بالتعلم
1:02:52العميق الهندسي أو
1:02:54النماذج المختلفة
1:02:55التي تدمج التماثل ؟
1:02:57كما تعلم ، كانت هناك
1:02:59مجموعة متنوعة من
1:03:00الأعمال التي تحاول
1:03:02دمج الهندسة في التعلم
1:03:04العميق ، ومن منظور
1:03:06معين على الأقل ، يبدو
1:03:08أنه إذا كنا نتحدث عن
1:03:10المعلومات المكانية ،
1:03:12فقد يكون هناك دور
1:03:13لذلك .
1:03:14>> ربما . لكنني أعتقد أن
1:03:15الدرس الذي تعلمناه
1:03:16مراراً وتكراراً في
1:03:17التعلم العميق هو أنك
1:03:18بحاجة إلى تمثيلات
1:03:19بسيطة ، ثم توسيع نطاق
1:03:21النموذج خلف هذه
1:03:21التمثيلات البسيطة .
1:03:23لذا ، عندما تختار
1:03:24تمثيلاً مناسباً
1:03:25للمهمة المطلوبة ،
1:03:27أليس كذلك ؟ إذا كان ما
1:03:29تريده حقاً هو إطارات
1:03:30فيديو أو صور ، فافعل
1:03:32ذلك مباشرة . لست بحاجة
1:03:33إلى تقييد نفسك عبر
1:03:35تمثيل ثلاثي الأبعاد
1:03:36صريح . إذا كنت تريد
1:03:37تمثيلاً ثلاثي
1:03:38الأبعاد ، سواء كان "
1:03:40سبرات " أو " شبكة " ، ابحث
1:03:41عن طريقة بسيطة لربط
1:03:42هذا التمثيل الهيكلي
1:03:44بالشبكة العصبية .
1:03:45وكلما زدت من
1:03:46التماثلات والتمثيلات
1:03:48المعقدة ، غالباً ما
1:03:49يصبح التحسين أكثر
1:03:50صعوبة ، وتزداد
1:03:52الافتراضات التي
1:03:53تضعها . وبالتالي ، سيقل
1:03:54نجاحها على نطاق واسع ،
1:03:56أليس كذلك ؟ مثلاً ،
1:03:57عندما تضع مفهوماً
1:03:58للتماثل . حسناً ، البشر
1:04:00عادة ما يكونون
1:04:01متماثلين نوعاً ما .
1:04:02لدينا ساقان وذراعان ،
1:04:03لكن ليس الجميع لديهم
1:04:04ساقان وذراعان . لذا
1:04:05فإن هذه الافتراضات
1:04:07الصارمة حول التماثل
1:04:08قد توصلك إلى 80 % أو 90 % من
1:04:10الطريق ، لكنها ستنهار
1:04:11في النهاية . وعندها
1:04:12تود أن تكون في وضع
1:04:14يسمح لهيكلك أو نموذجك
1:04:15بأن يكون معبراً بما
1:04:17يكفي للتعامل مع
1:04:18الحالات التي تنهار
1:04:19فيها هذه الاختصارات .
1:04:21>> إلى أين يجب أن يذهب
1:04:22الناس لتعلم المزيد عن
1:04:24هذا ؟ هل هناك أي موارد
1:04:25أساسية تحب توجيه
1:04:27الأشخاص إليها ممن هم
1:04:28جدد في هذا المجال
1:04:29ويريدون التعمق أكثر ؟
1:04:31>> أجل . يمكنك بالتأكيد
1:04:33تجربة " مارفل " . إنه
1:04:34منتجنا الموجود على
1:04:35الرابط marble.worldlabs.ai .
1:04:36يمكنك التسجيل
1:04:37وتجربته اليوم . أمم ،
1:04:39أتمنى لو كان بإمكاني
1:04:40ترشيح سلسلة محاضرات
1:04:41أو كتاب أفضل أو شيء من
1:04:42هذا القبيل حول
1:04:43النماذج العالمية ،
1:04:44لكنني لا أعتقد أن
1:04:45أحداً قد كتب شيئاً
1:04:47رائعاً للغاية بعد ،
1:04:48وهذا جزء مما حاولنا
1:04:49حله في تدوينتنا .
1:04:50لكنني أعتقد أن بإمكان
1:04:51شخص ما التعمق أكثر
1:04:52وتفكيك الكثير من هذه
1:04:54الأفكار بطريقة أفضل .
1:04:55لذا ، إذا فاتني شيء ما
1:04:57، أود حقاً من
1:04:58المشاهدين أو
1:04:59المستمعين إخباري
1:05:00بذلك . جاستن ، شكراً
1:05:01جزيلاً لك على تخصيص
1:05:03الوقت لمشاركتنا
1:05:04القليل عما كنت تعمل
1:05:05عليه . أنت والفريق في "
1:05:06وورلد لابس " . أشياء
1:05:08رائعة جداً .
1:05:09>> أجل ، شكراً جزيلاً
1:05:10لاستضافتي . لقد كان
1:05:11هذا ممتعاً للغاية .