Free YouTube Transcribe

Video transcript

Nobody Agrees What a 'World Model' Is — Justin Johnson (World Labs) Explains Why

The TWIML AI Podcast with Sam Charrington · 11,023 words · 51 min read

Want to search this transcript, jump the video from any line, or download it as TXT, SRT, or VTT?

Open in the transcript tool

Full transcript

Introduction

0:00لا يقتصر السباق نحو

0:01بناء ذكاء اصطناعي

0:02أكثر قدرة على جعل

0:03النماذج اللغوية أضخم

0:04فحسب . بل أصبح التركيز

0:05بشكل متزايد على نماذج

0:07العالم ، وهي أنظمة

0:08تفهم المكان وتتنبأ

0:09بكيفية تغير البيئات

0:10وتتفاعل مع العالم من

0:12حولها . يساهم جاستن

0:13جونسون في تشكيل هذا

0:14التحول . لقد شارك في

0:16تأسيس " وورلد لابس " مع "

0:17فا لي " ، وهو أستاذ

0:19مشارك في علوم الحاسوب

0:20بجامعة ميشيغان . سألته

0:22لماذا يعتقد الكثير من

0:23الباحثين أن نماذج

0:24العالم هي الحدود

0:25التالية للذكاء

0:25الاصطناعي . هناك

0:26اعتقاد مشترك ضمني بين

0:27العديد من الباحثين في

0:29هذا المجال بأن هناك

0:30شيئاً لا تقوم به

0:30النماذج اللغوية ،

0:31وبأنه ينبغي علينا

0:32بناء أنواع أخرى من

0:33النماذج . نماذج تؤدي

0:35مهاماً من نوع آخر . وهي

0:36مهام تتعلق بفهم

0:37العالم ، وتوليد

0:38العوالم ، ومحاكاة

0:40العوالم ، وإعادة

0:41بنائها ، والتخطيط

0:42للأفعال داخل هذه

0:43العوالم . كل هذه قدرات

0:45نريد لنماذجنا أن

0:46تمتلكها . وسبب

0:47اهتمامنا بهذا هو

0:48رغبتنا في بناء أنظمة

0:50ليست محصورة في واجهة

0:51نصية أو مجرد وكيل

0:52افتراضي ، أليس كذلك ؟

0:54فنحن نتطلع إلى رؤية

0:55أنظمة ذكاء اصطناعي

0:56تعمل كروبوتات موجودة

0:57في العالم الحقيقي

0:58وتتفاعل معه ، أو ربما

0:59نريد بناء عوالم

1:00افتراضية والعيش فيها

1:01ومحاكاة أشياء مثيرة

1:03للاهتمام هناك . لذا ،

1:04فإن كل هذه القدرات لا

1:05تبدو كأنها نابعة بشكل

1:07طبيعي من نموذج

1:08النمذجة اللغوية . أنا

1:09سام شيرينغتون ، وهذا

1:10هو بودكاست " تويمل "

1:11للذكاء الاصطناعي .

1:13لأكثر من عقد من الزمن

1:14، كنت أستكشف الأفكار

1:15والابتكارات التي

1:16تشكل مستقبل الذكاء

1:17الاصطناعي من خلال

1:19محادثات كهذه ، والتي

1:20تساعدك على فهم ما هو

1:21حقيقي ، وما هو قادم ،

1:22وما هو مهم . لنبدأ الآن

1:24. على مدى السنوات

1:37القليلة الماضية ،

1:39كانت هناك فكرة يتم

1:41تبنيها بشكل أساسي ،

1:42وهي أن نموذج العالم

1:44قد يكون خاصية ناشئة

1:46إما عن النماذج

1:47اللغوية أو نماذج

1:49الانتشار ؛ فمثلاً

1:51يمكن لنماذج الانتشار

1:53توضيح بعض الخصائص

1:54الفيزيائية للعالم ،

1:56أو يمكن للنماذج

1:57اللغوية سرد قصص تبدو

1:59وكأنها تعرف شيئاً عن

2:01العالم . و أعتقد أن

2:11هناك بضعة أسئلة

2:13تتبادر إلى ذهني هنا :

2:15أحدها ربما يطلب

2:16تعريفاً محدداً

2:18وواضحاً لنموذج

2:19العالم ، لأنني أعتقد

2:21أنه في بداية تلك

2:23المحادثات ، كان

2:24المقصود بنموذج

2:26العالم هو امتلاك هذه

2:28النماذج لمعرفة

2:29جوهرية بالعالم

2:30الحقيقي ، أي العالم

2:32الذي نعيش فيه . آه

2:38مؤخراً ، كما تعلم ،

2:40أشعر أن النقاش حول

2:41نماذج العالم قد تحول

2:43للحديث عن القدرة على

2:45خلق عوالم اصطناعية ،

2:47لكن مع جعلها متسقة

2:48ذاتياً وقابلة للتنقل

2:50، وخصائص أخرى من هذا

2:52القبيل . لذا ، أود أن

2:56أسمع منك توضيحاً حول

2:58هذه العلاقة ، وهل ترى

3:00نفس التحول في

3:01المصطلحات ، وأيضاً

3:03فيما يتعلق بفكرة "

3:04الانبثاق " . وهل نحتاج

3:08إلى أشياء جديدة ، أم

3:09أنه إذا زودنا النماذج

3:11الحالية بما يكفي من

3:13البيانات وقوة

3:14الحوسبة ، هل سيؤدي ذلك

3:15إلى مبتغانا ، أم لماذا

3:17لن نصل إلى ذلك ؟

3:18>> أعتقد أن هناك الكثير

Defining World Models

3:19من الأسئلة المثيرة

3:20للاهتمام التي تحتاج

3:21إلى تفكيك هنا . أعني ،

3:22أهم سؤال هو دعنا

3:24نتجاوزه أولاً . لا

3:25يوجد تعريف واضح

3:26لنماذج العالم يتفق

3:27عليه الجميع في هذا

3:28المجال . وأعتقد أن هذا

3:29يسبب جزءاً من

3:30الارتباك ، أليس كذلك ؟

3:32لا يوجد شيء يمكننا

3:33القول إنه نموذج يمتلك

3:35الخاصية " س " أو ينتج

3:37مدخلات ومخرجات معينة

3:38، ليكون نموذج عالم

3:40بالتعريف . أعتقد أننا

3:41كمجال لا نملك ذلك

3:43التعريف الدقيق لما

3:44نعنيه ، وهو ما يؤدي

3:45إلى هذا الغموض . لكن

3:46بالنسبة لنقطتك ،

3:47أعتقد أن هناك بضع نسخ

3:49لهذا الأمر ؛ فهناك

3:50مفهوم المعرفة

3:51الضمنية بالعالم الذي

3:52ذكرته ، وهناك أنواع

3:54أخرى من النماذج التي

3:55تنتج أنواعاً معينة من

3:57المدخلات والمخرجات .

3:58ربما إذا كان النموذج

3:59ينتج نصاً ، وإذا أنتج

4:01النوع الصحيح من

4:02النصوص ، فإن الطريقة

4:03الوحيدة التي مكنته من

4:05ذلك هي معرفته بشيء عن

4:06العالم الحقيقي أو

4:08كونه يصيغ نوعاً من

4:09العالم الضمني داخل

4:10أوزان شبكته العصبية .

4:12أو الأمر مشابه لنماذج

4:13الفيديو ، أليس كذلك ؟

4:15إذا كنت قادراً على

4:16إنشاء فيديو فائق

4:18الواقعية ، وتفصيلي ،

4:19ويحتوي على فيزياء ،

4:20وتدفق مياه بطرق دقيقة

4:22، فربما يكون النموذج

4:24قد صاغ ضمنياً شيئاً

4:25عن العالم الحقيقي

4:27ليتمكن من إنتاج مخرج

4:28من هذا النوع . لذا

4:30أعتقد أن هذا هو مفهوم

4:32نموذج العالم الضمني ،

4:34حيث قد تؤدي مهاماً

4:36عديدة ، لكن هناك

4:37أنواعاً معينة من

4:39الإجابات التي تتطلب

4:41صياغة ضمنية لشيء ما

4:42عن العالم . لكنني

4:44أعتقد أيضاً أن هناك

4:45خيطين آخرين مثيرين

4:46للاهتمام في هذا الصدد

4:48. أعتقد أن مصطلح "

4:49نموذج العالم " في حد

4:50ذاته يعود في الواقع

4:51إلى أدبيات التعلم

4:52التعزيزي ، وهناك

4:53تعريف تقني محدد يتعلق

4:54بعمليات اتخاذ القرار

4:55ماركوف الجزئية ( POMDPs )

4:56قد نتطرق إليه لاحقاً .

4:57أجل ، ولكن هناك مصطلح

4:59تقني محدد لنمذجة

5:00العالم يعود لأدبيات

5:01التعلم التعزيزي منذ

5:03فترة طويلة . وهناك خيط

5:04آخر أعتقد أنه انتهى

5:06بنا إلى أننا نتحدث

5:07كثيراً عن النماذج

5:08التوليدية خلال

5:09العامين الماضيين .

5:10فنموذج الصورة هو

5:12نموذج ينتج صوراً .

5:13ونموذج الفيديو هو

5:14نموذج ينتج مقاطع

5:15فيديو . وربما ينبغي أن

5:17يكون نموذج العالم

5:18نموذجاً ينتج عوالم .

5:19ولكن ماذا يعني إنتاج

5:20أو توليد عالم ؟ لذا

5:22أعتقد الآن أن لدينا

5:23هذه الخيوط الثلاثة

5:24المختلفة التي

5:24يستخدمها أشخاص

5:25مختلفون في المجتمع .

5:26وهي تدور حول مفهوم

5:27نمذجة العالم الضمني ،

5:28أي هل يمكنني الإجابة

5:30على مسائل صعبة للغاية

5:31، ولكن لا بد أنني

5:32أنمذج شيئاً عن العالم

5:33للحصول على الإجابة

5:34الصحيحة ؟ أو ربما هناك

5:36صياغة التعلم

5:37التعزيزي المحددة

5:38لنموذج العالم ، ثم

5:40هناك نموذج توليدي

5:41ينشئ أو يولد عوالم . هل

5:44ترى هذا النموذج

5:45الضمني للعالم مجرد

5:47تعريف آخر أم مجموعة

5:49معتقدات غير دقيقة ؟

5:51عندما تسمع ذلك ، هل

5:53تشعر أنها نماذج عالم

5:55فعلاً ؟ هل تعتقد أن

5:58هذه طريقة صائبة

5:59للتفكير في نماذج

6:01العالم ، أم تعتقد أن

6:02نماذج العالم لها

6:04خصائص لا تميز النماذج

6:06الحالية التي نتحدث

6:08عنها مثل الرؤية

6:09واللغة ؟ أعتقد

6:11تقريباً أنها جميعاً

6:13صالحة . أعني أن

6:14الصعوبة تكمن في أن

6:15الأشياء الثلاثة التي

6:16ذكرتها للتو هي أنظمة

6:17مثيرة للاهتمام

6:18للغاية . إنها نماذج

6:19مثيرة للاهتمام حقاً .

6:21وجميعها تمتلك خصائص

6:22تجعلنا كمجتمع ملزمين

6:24ببنائها جميعاً . ولكن

6:25ربما ينبغي علينا

6:26ابتكار مصطلحات أفضل

6:27حتى لا نربك بعضنا

6:28البعض بإطلاق نفس

6:29المصطلح على أنظمة

6:30مختلفة . وأعتقد أن هذا

6:32هو لب الموضوع . لذا ،

6:34أرى أنه ربما في

6:35الأدبيات الأكاديمية

6:36خلال العام الماضي ،

6:37تبلور مصطلح " نموذج

6:38العالم " بشكل أكبر

6:39ليصبح نوعاً خاصاً من

6:41نماذج الفيديو

6:42التفاعلية في الوقت

6:43الفعلي ، وهذا هو ما

6:44بات يُطلق عليه عادةً "

6:45نماذج العالم " في

6:46الأدبيات خلال العام

6:48الماضي أو نحو ذلك .

6:49لكنني أعتقد أن كل

6:50الخصائص الأخرى التي

6:52ناقشناها مثيرة

6:53للاهتمام ومفيدة حقاً

6:54، وخاصة مفهوم نموذج

6:55العالم الضمني . أعتقد

6:57أن هذا يمكن تطبيقه

6:58على أي شيء . وبغض النظر

7:00عن نوع البيانات التي

7:01تعالجها ، وبغض النظر

7:02عن نوع النظام الذي

7:03تبنيه ، أعتقد أنه إذا

7:04وصل إلى مستوى معين من

7:05التعقيد المثير

7:06للاهتمام ، فسينتهي به

7:07الأمر بامتلاك فكرة

7:08ضمنية عن نموذج العالم

7:09في مكان ما داخل

7:10النظام . وهذا أمر مثير

7:11للاهتمام حقًا . إحدى

7:13الطرق التي يتبادر بها

7:15ذلك إلى ذهني هي

7:16التفكير فيه في سياق

7:18السؤال الذي تعاملنا

7:20معه ، أو ما زلنا

7:21نتعامل معه ، حول

7:22النماذج اللغوية

7:24الكبيرة : هل تفهم

7:25اللغة حقًا ؟ هل هي ،

7:27كما تعلم ، توقع الرمز

7:29التالي ، هل هو مجرد

7:30تزييف لفهم اللغة أم

7:32أنه فهم حقيقي لها ؟

7:34وأعتقد أننا في الغالب

7:36قد تجاوزنا هذا السؤال

7:37وقلنا إن هذه الأشياء

7:39مذهلة للغاية ، فهل يهم

7:41الأمر حقًا ؟ ومن هذا

7:45المنظور ، إذا طبقنا

7:47ذلك على مسألة نموذج

7:49العالم ، فإذا أصبحت

7:50تلك الأنواع من

7:52النماذج جيدة جدًا في

7:54توليد نتائج متسقة مع

7:56عالم أساسي ، فربما لا

7:58يهم الأمر حقًا . لكنني

8:02لا أزال أجدها مسألة

8:04فلسفية مثيرة

8:05للاهتمام ، إن لم يكن

8:07لأي شيء آخر . أتفق معك ،

8:09هناك سؤال فلسفي مثير

World Models as Theory Builders

8:10للاهتمام هنا ، لكنه في

8:11مرحلة ما يبدو غير

8:12قابل للإجابة ، أليس

8:13كذلك ؟ كعالم ، تود أن

8:15تكون ، على الأقل

8:15بالنسبة لي ، أحب

8:16التفكير في : " ما هي

8:17الأشياء التي يمكنني

8:18قياسها حول هذا النظام

8:19؟ " " ما هي الأسئلة

8:20الملموسة التي يمكنني

8:21طرحها ، أو من الناحية

8:22المثالية ، إثبات

8:23زيفها حول نظام ما ؟ "

8:24ولكن أعتقد أن هناك

8:26شيئًا آخر تشير إليه ،

8:27وهو فكرة أخرى يمتلكها

8:29بعض الناس أحيانًا عند

8:30الحديث عن نماذج

8:32العالم ، وهي مختلفة

8:33تمامًا ، ولا أعتقد

8:34أننا نعرف كيف نصل

8:36إليها ، وهي أقرب إلى

8:37نموذج العالم كباني

8:38للنظريات ، أليس كذلك ؟

8:40لأن لدينا هذه الفكرة

8:42بأننا كبشر ، نوعًا ما

8:43نجوب هذا العالم

8:44المعقد للغاية من

8:45حولنا ونخوض هذه

8:46التجارب ، لكننا لا

8:47نكتفي بترك الفوتونات

8:49تسقط على شبكية أعيننا

8:50وندع الأمر يحدث فحسب .

8:52نحن نبني باستمرار

8:53نظريات في أذهاننا لما

8:54يحدث ، أليس كذلك ؟ نحن

8:56نتوصل إلى هذه

8:57النظريات العظيمة حول

8:58كيفية عمل الجاذبية

8:58وكيف تعمل الفيزياء

8:59وكيف تعمل ديناميكا

9:00الموائع . ولا يقتصر

9:01الأمر على مراقبتنا

9:02لهذه الأشياء فقط . هو

9:04أننا ننتهي في الواقع

9:06بنظريات مدمجة وقوية

9:07للغاية تفسر كل

9:08الآليات وراء ما يحدث

9:10هناك . أم ، وأعتقد أن

9:12جزءاً من السؤال

9:13الجوهري حول الذكاء

9:14الاصطناعي هو كيف نجعل

9:15الآلات تقوم بهذا

9:16النوع من الأشياء

9:17أيضاً ؟ وربما توجد هذه

9:19الفكرة القائلة بأن

9:20نموذج العالم لا ينبغي

9:21أن يكتفي بالتفكير

9:23المباشر في الملاحظات

9:24، بل يجب أن يبني

9:25نظريات تفسيرية عميقة

9:26عن العالم . أم ، وأعتقد

9:28أن هذا الأمر صعب

9:29للغاية حقاً . آه ، ولا

9:31أعرف إن كان لدى أي شخص

9:32رؤية ممتازة لكيفية

9:34الوصول إلى ذلك ، لكنني

9:35أعتقد أن هذا مفهوم

9:37مختلف قليلاً عن

9:38السؤال الذي يختلط

9:39أحياناً بالأمر . أجل ،

9:42يمكنك القول إنه حتى

9:43قبل العوالم ، سيكون من

9:46الرائع لو تمكنا من

9:47الحصول على نموذج

9:49يمكنه بناء نظرية

9:51عميقة حول اللغة مثلاً

9:53، أو أي مجال آخر

9:54تتعامل معه النماذج

9:56الحالية ، مثل اللغة أو

9:58الفنون الرسومية . آه ،

10:02أجل . مثير للاهتمام .

10:03مثير للاهتمام . حسناً .

10:05لكن هناك شيء ما ، ماذا

10:06لو كان لدي نموذج

10:07مثالي ، أعني أن نموذج

10:09اللغة الكبير ( LLM ) مثال

10:10، تخيل نموذجاً

10:10مثالياً ، ربما LLM مثال

10:12خاطئ ، لكن لنفترض أن

10:13لديك نموذج فيديو

10:14مثالياً يمكنه توليد

10:15أي فيديو تطلبه . أم ،

10:16لكن ربما ما أردته لم

10:18يكن في الواقع فيديو .

10:19ما أردته كإنسان

10:21وكمُعالم هو أن أتعلم

10:23شيئاً عن العالم . أم ،

10:24وحتى لو تمكنت من

10:25توليد فيديو من أي نوع

10:27أو بأي بنية ، إذا لم

10:28أتعلم ما أريده عن

10:29العالم ، فربما

10:30الفيديو الذي أريده هو

10:32لأينشتاين يلقي

10:33محاضرة تشرح نظرية

10:34جديدة للجاذبية

10:35الكمية أو شيء من هذا

10:37القبيل . وحينها لن

10:38تكون البكسلات نفسها

10:39هي المهمة ، ولا القدرة

10:41على توليد الفيديو .

10:42هذا ما كنت أريده حقاً .

10:43كنت أرغب في اكتساب

10:45فهم جديد للعالم من

10:46هذا النموذج بطريقة ما

10:47. وهذه مسألة صعبة حقاً

10:49.

10:49>> أجل . ولا أعتقد أن

10:50نماذج اللغة الكبيرة

10:52مثال سيئ ، أليس كذلك ؟

10:53لو كان لدى نموذج

10:54اللغة القدرة على

10:56توليد نظريات ، يمكنك

10:57القول إنه لن يهذي

10:59لأنه سيفكر بعمق أكبر

11:01في العلاقة بين

11:02الأشياء التي يولدها

11:04وسيقوم بتصحيح نفسه أو

11:06يمكنه تصحيح نفسه . أم ،

11:09لذا فإن آه ، لذا

11:13تحدثنا عن نماذج

11:14العالم الضمنية ،

11:15وتحدثنا عن نماذج

11:17العالم التوليدية . أوه

11:18، هناك تفسير " آلة

11:20الحالة " الذي ذكرته ، "

11:22عمليات اتخاذ القرار

11:24المار ков ية القابلة

11:26للملاحظة جزئياً " ( POMDP ) .

11:28تحدث قليلاً عن ذلك

11:29وعن كيفية تأثير هذا

11:31التاريخ على الطريقة

11:32التي تفكر بها أنت

11:34والآخرون في نماذج

11:35العالم .

11:36>> هناك هذا التجريد

POMDPs and Agent–World Interaction

11:37المسمى بعمليات اتخاذ

11:39القرار المار ков ية

11:40القابلة للملاحظة

11:41جزئياً ( POMDPs ) والذي

11:42يعود تاريخه إلى فترة

11:44طويلة ، وهو صيغة

11:45رياضية رائعة حقاً

11:46للتفكير في كيفية

11:47تفاعل الوكلاء مع

11:48العوالم . إذن ، هناك في

11:50الأساس جزأين ؛ تخيل

11:52أنك تقوم بفك نظامك

11:53إلى جزأين . أحدهما هو

11:55العالم ، وهو كل ما

11:56يحدث من حولك . ثم هناك

11:58وكيل ، والوكيل هو شيء

12:00يمكنه اتخاذ إجراءات

12:01في العالم . يمكنهم

12:02التحرك ، وربما التقاط

12:04الأشياء ، ويمكنهم

12:05القيام بأشياء في

12:06العالم أو تجاه العالم

12:07. إذن ، أنت تقسم الكون

12:09بأكمله إلى وكيل يتحرك

12:11ويفعل أشياء ، وعالم

12:12تُمارس عليه الأفعال

12:13أو يمارسها الوكيل ،

12:15وربما يتطور أيضاً

12:16بمرور الوقت . لديك

12:18العالم والوكيل ، ثم

12:19تتحدث عن هذه الصيغة

12:20لكيفية تفاعل الاثنين

12:22مع بعضهما البعض . ثم

12:23سيقوم الوكيل باتخاذ

12:25إجراءات ، وفي مواقف

12:26مختلفة قد تكون مجموعة

12:28أفعالك مختلفة ، أليس

12:29كذلك ؟ ربما تكون

12:31روبوتاً ويمكنني

12:32تشغيل محركاتي بطريقة

12:33معينة . ربما أكون في

12:35لعبة فيديو ويمكنني

12:36الضغط على أزرار وحدة

12:37التحكم . إذن ، في مواقف

12:39مختلفة ، قد تتوفر

12:40للوكيل أنواع مختلفة

12:42من الإجراءات . ولكن

12:43مهما كان الموقف ،

12:44عندما يتخذ الوكيل

12:46إجراءات تجاه العالم ،

12:47سيتغير العالم بطريقة

12:49ما . الطريقة التي نعبر

12:50بها عن ذلك هي القول

12:51بأن العالم لديه حالة

12:53داخلية خاصة به . وهذه

12:54الحالة تحدد نوعاً ما

12:55كل ما يجعل العالم على

12:57ما هو عليه . وقد تكون

12:58الحالة كبيرة جداً

12:59ومعقدة للغاية . وقد لا

13:01تكون مفهومة . قد تكون

13:03كبيرة جداً وذات أبعاد

13:04عالية ، لكنها بمثابة

13:06التفسير الكامل لما

13:07يحدث في العالم . إذن ،

13:08يقوم الوكيل باتخاذ

13:10إجراءات تجاه العالم ،

13:11ولأن الإجراء يغير

13:12العالم ، فهذا يعني أن

13:14الإجراء سيؤدي إلى

13:15تغير الحالة أو

13:16انتقالها بطريقة ما

13:17داخل العالم . لكن الآن

13:19، الحالة كبيرة جداً

13:20ومعقدة لدرجة أنك قد

13:22لا تستطيع ملاحظتها

13:23بشكل مباشر . لذا ، ما

13:24يحصل عليه الوكيل في

13:26المقابل هو ملاحظات ،

13:27والملاحظات هي نوع من

13:28الإسقاط منخفض

13:29الأبعاد لحالة العالم

13:31الكاملة . ومرة أخرى ،

13:32ما يعنيه ذلك يختلف

13:33باختلاف السياقات .

13:35ربما كبشر ، الملاحظات

13:36التي نحصل عليها هي

13:37الصور التي نراها

13:38بأعيننا ، والأصوات

13:39التي تصل إلى آذاننا ،

13:40وأحاسيس اللمس التي

13:42نشعر بها على أجسامنا .

13:43تلك هي كل الإشارات

13:44الحسية التي نتلقاها .

13:46وهذه الإشارات الحسية

13:47تخبرنا شيئًا عن

13:48العالم ، لكنها لا

13:49تخبرنا سوى شيء محدود

13:50ومحلي جدًا عن كل ما

13:51يحدث في العالم من

13:52حولنا . إذًا ، حلقة

13:53عملية اتخاذ القرار

13:54المتسلسلة الجزئية (

13:55POMDP ) هي أنك تمتلك

13:56وكيلاً . يقوم بإجراءات

13:58في العالم تؤدي إلى

13:59انتقال الحالة ؛ ثم ،

14:00بناءً على الحالة ،

14:01يحصل الوكيل على

14:02ملاحظة تخبره بشيء عن

14:03العالم . وبعد ذلك ،

14:05سيحدث هذا للوكيل في

14:06حلقة مفرغة مرارًا

14:07وتكرارًا بينما يحاول

14:08الوكيل القيام بأشياء

14:09في العالم .

14:10>> هذا يبدو كثيرًا مثل

14:11إعداد التعلم

14:12التعزيزي . الوكيل يعمل

14:14في العالم ، أمم ، إنه

14:16يقوم بإجراء ملاحظات .

14:18هناك بعض المكافآت

14:19المرتبطة بأفعاله وما

14:21إلى ذلك . أمم . هل يعني

14:25هذا أنك بحاجة إلى

14:26إعداد من نوع التعلم

14:28التعزيزي لامتلاك

14:30نموذج عالمي قوي ، أم

14:32ما هي العلاقة

14:33الملموسة بين عمليات

14:35POMDP والنماذج ؟

14:36>> لقد أصبت في هذه

14:38النقطة . إذًا ، الجزء

14:39التقني المهم الذي

14:40أغفلته في التعريف

14:41الأولي هو المكافأة ،

14:42أليس كذلك ؟ لذا ، في

14:44سياق أوسع ، تم تطوير

14:45هذا الشكل الصوري

14:46بالكامل في إطار

14:47التعلم التعزيزي . أمم ،

14:49وهناك يكون للوكيل هدف

14:50يحاول تحقيقه ، وكيف

14:52يحصل على إشارة عما

14:53إذا كان يحقق الهدف أم

14:55لا ؟ يحصل على إشارة

14:56مكافأة . إذًا الفكرة

14:58هي أن الوكيل يريد

14:59محاولة اتخاذ إجراءات

15:00من شأنها تعظيم

15:01مكافأته . وبمجرد وصولك

15:02إلى هذا المستوى ، فهذا

15:04هو بالضبط إعداد

15:04التعلم التعزيزي . أمم ،

15:06وأنت تعلم ، هذا هو

15:07المكان الذي يأتي منه

15:08هذا الشكل الصوري . أمم

15:09، لكن السبب الذي

15:10جعلني أختار عدم

15:11الحديث عن المكافأة

15:12قبل قليل هو أنني

15:13أعتقد أننا نستطيع أخذ

15:15ذلك التجريد الأصلي لـ

15:16POMDP واستخدامه في

15:17سياقات أخرى . لذا

15:18أعتقد أن هذا المفهوم

15:19حول التفكير في

15:20الوكلاء والحالات

15:21والملاحظات يصبح

15:22قابلاً للتطبيق

15:23ومفيدًا في الكثير من

15:24السياقات الأخرى حتى

15:25خارج نطاق التعلم

15:26التعزيزي تحديدًا . أمم

15:27، والتعلم التعزيزي قد

15:29يكون إطارًا واحدًا تم

15:30تطوير هذا الشكل فيه

15:31في الأصل وهو مفيد

15:32للغاية ، لكن يمكننا

15:33تطبيقه في أماكن أخرى

15:34أيضًا في الوقت الحاضر

15:35.

15:36>> أعطنا مثالاً على

15:37كيفية تطبيقه خارج هذا

15:38السياق .

15:39>> إذًا ، أحد الأمثلة ،

Training Agents with Behavior Cloning

15:40مثال ملموس جدًا ، قد

15:41يكون استنساخ السلوك

15:42في الروبوتات . صحيح .

15:44أليس كذلك ؟ لنفترض أنك

15:46تبني روبوتًا ، وهدفك

15:47في نهاية المطاف هو

15:48بناء هذا الروبوت

15:49ليتجول في العالم

15:50ويؤدي مهامًا ، مثل

15:51ترتيب سريري أو تنظيف

15:52المطبخ أو أي شيء آخر .

15:54وبمجرد أن يصبح هذا

15:55الروبوت في الخارج ،

15:56فإنه يعتبر " عاملًا " .

15:57إنه يتفاعل مع العالم .

15:58والعالم له حالة معينة

16:00. والروبوت يحصل على

16:01ملاحظات حول هذا

16:02العالم . لذا ، فهو يعمل

16:03نوعًا ما ضمن تلك

16:04الحلقة بمجرد تدريبه .

16:06لكن يظل السؤال

16:07مطروحاً : ما هي إشارة

16:08التدريب التي استخدمت

16:09؟ يمكنك تدريب هذا

16:10الشيء عبر التعلم

16:12التعزيزي ، حيث يحصل

16:13على مكافأة في كل مرة

16:14يقوم فيها بإجراء معين

16:16. أو يمكنك تدريبه عبر

16:17استنساخ السلوك ، أليس

16:19كذلك ؟ ربما امتلكت

16:20مجموعة بيانات كبيرة

16:21مُشرفة ، تخبره فيها :

16:23عند تلقي هذه الملاحظة

16:24، يجب عليك اتخاذ هذا

16:25الإجراء . ومن ثم يمكنك

16:27تدريب نموذج تعلم

16:28مُشرف مختلف تماماً لا

16:29يعتمد على إشارة

16:30مكافأة صريحة . حيث

16:32ستستخدم مثلاً

16:32خوارزمية الانحدار

16:33المتدرج وبعض دوال

16:34الخسارة المُشرفة . لذا

16:35، على الرغم من أنك في

16:36النهاية تحصل على نظام

16:38يعمل ضمن حلقة تشبه

16:39عمليات اتخاذ القرار

16:40الماركوڤية الجزئية (

16:41POMDP ) ، إلا أن هدف

16:42التدريب كان مجرد تعلم

16:43مُشرف لا يتطلب تعلمًا

16:44تعزيزيًا .

16:45>> الخلاصة هي أن هناك

16:46جزأين لعمليات اتخاذ

16:48القرار الماركوڤية

16:50الجزئية ( POMDP ) . أحدهما

16:52يجسد العلاقة بين

16:53العامل والعالم ،

16:55وفكرة أن العامل يمكنه

16:57ملاحظة أشياء تعكس

16:58حالة تجريدية معينة ،

17:00لكنه لا يمكنه معرفة

17:02تلك الحالة التجريدية

17:04بشكل كامل . ويحتاج

17:07للعمل بناءً على

17:08ملاحظاته . والمكافأة

17:14والتدريب يتعلقان

17:15بكيفية تحويل تلك

17:17الملاحظات إلى أفعال ،

17:19لكن هذا لا يجب

17:20بالضرورة أن يكون حول

17:22تعظيم المكافأة بحد

17:23ذاته . قد يتعلق الأمر

17:26بأشياء أخرى .

17:27>> بالضبط . والسبب وراء

17:28ارتباط هذا بنمذجة

17:29العالم هو أن هذا هو

17:30المكان الذي جاء منه

17:32المصطلح في الأصل .

17:33صحيح . إن التعريف

17:34التقني الأصلي لنموذج

17:36العالم هو أنه إذا كنا

17:38في إطار عمل POMDP ، فإن

17:39نموذج العالم هو شيء

17:41يتلقى حالة العالم

17:43وإجراء العامل ، ثم

17:44يتنبأ بحالة العالم

17:46التالية . لذا ، هذا هو

17:47السياق التقني الأصلي

17:49الذي استُخدم فيه

17:50مصطلح " نموذج العالم " .

17:52>> ولا أعرف كيف ، كما

17:53تعلم ، مع وضع ذلك في

17:55الاعتبار ، بأن هذا في

17:57سياق أوسع نوعاً ما ،

17:58أو ربما ذو أهمية

17:59تاريخية وليس

18:00بالضرورة يتعلق

18:02بالوجهة التي نتجه

18:03إليها مع نماذج العالم

18:05اليوم . لكن كان لدي

18:07سؤال حول " الحالة " :

18:09كثيراً ما نسمع الحديث

18:11عن الحالة كتمثيل ،

18:13أشبه بكيفية ارتباط

18:15الملاحظة بالحالة في

18:17إطار عمل " بوم دي بي " (

18:19POMDP ) . همم . غالباً ما

18:26تكون الحالة تمثيلاً

18:28منخفض الأبعاد لشيء

18:30آخر يمثل الحقيقة

18:31المطلقة . آه . هل تعتقد

18:36أن هذا التمييز مفيد

18:38لنا لاستكشافه ؟

18:39>> ربما قليلاً . أعتقد أن

Ground-Truth State and Learned State

18:41هناك في الواقع

18:41مفهومين مختلفين

18:42للحالة يتحدث عنهما

18:43الناس أحياناً ويتم

18:44الخلط بينهما . لذا قد

18:46يكون من المفيد محاولة

18:47توضيح ذلك . أحد

18:48المفهومين ، في ذهني

18:49عندما أقول " حالة " ، هو

18:50أنني أفكر في الحالة

18:52الحقيقية المطلقة

18:53للعالم . وهي بمثابة

18:54وصف كامل لكل شيء في

18:55العالم يكون مطلوباً

18:57للإجابة على أي سؤال

18:58حوله .

18:58>> هذه طريقة أخرى لتناول

19:00الأمر أو سؤال تبادر

19:02إلى ذهني سابقاً

19:03وسأطرحه الآن . عندما

19:05كنت تتحدث عن الحالة

19:07في سياق الحلقة ، كنت

19:08أفكر في أن ... مثالاً

19:13متطرفاً على العلاقة

19:15بين الحالة والملاحظة

19:17هو عندما تجلس عند

19:18إشارة مرور . يمكن

19:20اختزال الملاحظة إلى

19:22بُعد واحد ، أحمر ، أخضر

19:25، أو أصفر ، أو بُعدين ،

19:27أياً كان . همم . آه ، الـ

19:32... بينما الحالة ، وفقاً

19:38لتعريف " بوم دي بي " ، هي

19:40مثل كل ذرة في العالم .

19:45وسؤالي هو حقاً : عندما

19:51تتحدث عن نماذج العالم

19:53، هل تتكون الحالة

19:55بالضرورة من كل ذرة في

19:57العالم ، أم أنها مجرد

19:59تمثيل ؟ وربما تكون هذه

20:01طريقة أخرى لطرح هذا

20:02السؤال .

20:03>> أعتقد ذلك . لذا ، أعتقد

20:04أن الأمر كله يتعلق

20:05بمسألة ما هو التجريد

20:06الذي يخدم المشكلة

20:07المطروحة ، أليس كذلك ؟

20:08وحتى الفيزيائيون

20:09يستخدمون تمثيلات

20:10مختلفة اعتماداً على

20:11السؤال الذي تطرحه ،

20:13أليس كذلك ؟ على سبيل

20:14المثال ، في بعض

20:15المسائل ، أحتاج إلى

20:16الدالة الموجية لهذا

20:17النظام الكمي ، أمم ،

20:18وبالنسبة لأنظمة أخرى

20:20، ربما يكون النظام

20:21عيانياً ولا تظهر فيه

20:22التأثيرات الكمية ،

20:23حينها يمكنك اعتباره

20:24نظاماً نيوتنياً ،

20:25وتصبح الحالة هنا

20:26عبارة عن مجموعة من

20:28الجسيمات : ما هي كتلها

20:29، وما هي مواقعها

20:30وزخمها ؟ أو ربما تتحدث

20:31عن نظام كيميائي ،

20:33وربما يكون مجرد

20:34محاليل تحتوي على

20:35أيونات بتركيز معين .

20:37أو ربما تتحدث عن نظام

20:38ديناميكي حراري

20:39وتعتبره ، كما تعلم ،

20:40غازاً مثالياً ، وهذا

20:41يكفي لوصف حالة النظام

20:43. إذن ،

20:44>> لكنه لا يشمل أبداً كل

20:45ذرة في العالم .

20:46>> لا ، لا . أعتقد أن الأمر

20:48دائماً ، حتى عندما

20:49نتحدث عن حالة الحقيقة

20:50الأساسية ، يرتبط

20:51دائماً بالتجريد ، أي

20:53التجريد الضروري لحل

20:54المشكلات التي تهتم

20:55بها . أمم ، لكن أعتقد أن

20:56هناك مفهوماً آخر وهو

20:57الحالة المكتسبة ، وهو

20:59أمر مثير للاهتمام

21:00يتحدث عنه الناس الآن ،

21:01وهو أننا على الأرجح

21:02لن نتمكن من الوصول

21:03المباشر إلى حالة

21:04الحقيقة الأساسية في

21:05العالم المادي ، أليس

21:06كذلك ؟ مثل ، حتى لو

21:08فكرنا في كل ذرة ، أو

21:09غاز مثالي ، في كثير من

21:11المواقف ، لن تلاحظ ذلك

21:13في العالم الحقيقي .

21:14لذا ، بدلاً من ذلك ،

21:15هناك سؤال آخر : هل

21:16يمكنني الحصول على

21:17نموذج أقوم بتعلمه ،

21:19بحيث يتعلم أخذ

21:20الملاحظات والتنبؤ

21:21بنوع من المتجهات

21:22العصبية ؟ وهذا المتجه

21:23المكتسب ، رغم أنه شيء

21:25تعلمه النموذج ، يتصرف

21:26كما لو كان حالة حقيقة

21:28أساسية ، حيث يمكنني

21:29التنبؤ بالأفعال

21:31والتنبؤ بالملاحظات

21:32التي قد تنتج عن تلك

21:34الحالة . يمكنني تخيل

21:35كيف ستنتقل تلك الحالة

21:37استجابةً للأفعال ،

21:38لكنه نوع من التمثيل

21:39المتجهي الداخلي

21:41المكتسب من شبكة عصبية

21:42. وهو ليس مثل حالة

21:43الحقيقة الأساسية

21:44المستمدة من الفيزياء

21:45، لكنه يتصرف نوعاً ما

21:46مثل تلك الحالة .

21:47>> هل هذا مشابه لفكرة

21:48التعلم المعزز القائم

21:49على النموذج والتعلم

21:50المعزز الخالي من

21:51النموذج ؟

21:52>> قليلاً ، نعم . إذاً ،

21:53إذا كنت تقوم بتعلم

21:54معزز قائم على نموذج ،

21:55فأنت تمتلك نموذجاً

21:56صريحاً للحالة ، وهنا

21:57يكون لديك نموذج

21:58للعالم ، أليس كذلك ؟

21:59إذن ، لدي جزء صريح في

22:00نظام التعلم التعزيزي

22:01الخاص بي ، في النهج

22:02القائم على النموذج ،

22:03حيث يوجد مكون يحاول

22:04التنبؤ بالحالة

22:05التالية بناءً على

22:06الحالة الحالية

22:07والإجراء المتخذ . أو

22:08في النهج الخالي من

22:09النماذج ، لا أملك ذلك

22:10المفهوم الصريح . ربما

22:11أحصل فقط على

22:12الملاحظات ، وأغذيها

22:13مباشرة للنموذج ،

22:15فيقوم بإخراج

22:15الإجراءات ، ولا يوجد

22:17نمذجة صريحة للحالة .

22:18لكن ، بالعودة إلى

22:19نماذج العالم الضمنية

22:20التي تحدثنا عنها

22:21سابقاً ، ربما تقوم تلك

22:23الشبكة العصبية ، إذا

22:24كانت كبيرة ومعقدة بما

22:25يكفي ، بنوع من نمذجة

22:26الحالة داخل أوزانها

22:27إذا كانت قادرة على

22:28التنبؤ بإجراءات جيدة

22:30جداً في الظروف

22:30المناسبة .

22:31>> أعتقد أننا نوضح هنا

22:33غموض مصطلح " الحالة " .

22:37يمكن أن يكون ، كما

22:39تعلم ، أي تمثيل أو

22:41تجريد للعالم ، أو في

22:43بعض الإعدادات ، قد

22:45يكون بديلاً لذلك

22:50ينشئه الوكيل ويتنبأ

22:52به ويقارنه عند اختيار

22:54الإجراءات .

22:55>> وأعتقد أن الحكم لا

22:56يزال معلقاً بشأن أي

22:57من هذه هو النهج

22:58الصحيح . لكن هذا أمر

23:00مثير ، أليس كذلك ؟ وهذا

23:01أحد الأسباب التي

23:02تجعلني أعتقد أن

23:03الكثير من الناس

23:04ينجذبون لهذا المجال

23:05الآن ، هو أن نمذجة

23:06اللغة تبدو وكأن لدينا

23:07مجموعة من أفضل

23:08الممارسات التي تعمل

23:09بشكل جيد جداً . وكما

23:10تعلم ، هناك أمور تستحق

23:12الاستكشاف ، لكن لدينا

23:13وصفة تعمل بشكل جيد

23:14إلى حد ما . لكن إذا

23:15أردت الحديث عن كيفية

23:17بناء أو كيفية نمذجة

23:18البيئات ؟ كيف ننمذج

23:19العوالم ؟ كيف ننمذج

23:20الوكلاء الذين

23:21يتفاعلون مع العوالم ؟

23:23هناك الكثير من

23:23الأسئلة التقنية

23:24الأساسية ، أو مناهج

23:25الهندسة الأساسية ،

23:26حيث يمكنك القيام

23:27بالأمر بهذه الطريقة

23:29أو تلك ، ولا نعرف حقاً

23:30ما هي الطريقة الأفضل .

23:31وهذا مجال مثير للغاية

23:33للعمل فيه وإجراء

Explicit 3D vs. Implicit 3D

23:34الأبحاث . إذاً ، دعنا

23:35نغير المسار قليلاً

23:37ونتحدث عن الجانب

23:38الرسومي للأمور . كما

23:41ذكرت ، عندما نتحدث عن

23:43نماذج العالم ، يركز

23:44الكثير من ذلك الحديث

23:46على توليد العوالم

23:48الرسومية . وأحد

23:54التقنيات الأساسية في

23:56هذا المجال هو فكرة "

23:57التلطيخ الغاوسي " ( Gaussian

23:59splat ) . لذا ، تحدث قليلاً

24:02عن الطريقة التي يقارب

24:03بها الناس هذا النوع

24:05من توليد العالم ، ودور

24:07" التلطيخ الغاوسي "

24:09وكيف تطور ذلك على مدى

24:11السنوات القليلة

24:12الماضية أيضاً .

24:13>> أعتقد في الواقع أن

24:15هناك نقطة تفرع جوهرية

24:16يجب أن نشير إليها قبل

24:18أن نخوض في هذا المسار .

24:20وهي ، هل تعمل على

24:21نمذجة ثلاثية الأبعاد

24:23صريحة أم ضمنية ؟ تعد

24:25تقنية " Gaussian splats "

24:26مثالاً على النهج

24:28ثلاثي الأبعاد الصريح

24:30، حيث سأمتلك تمثيلاً

24:31صريحاً للعالم عندما

24:33أقوم بتوليده أو

24:34نمذجته . وبعد ذلك ،

24:35سأقوم بإجراء عمليات

24:37على هذا التمثيل ثلاثي

24:38الأبعاد الصريح

24:38للعالم . قد تكون إحدى

24:40هذه العمليات هي

24:40تحويله إلى وحدات

24:41البكسل التي تراها .

24:42وهناك نهج مختلف يعتبر

24:44ضمنياً نوعاً ما . حيث

24:45سأمتلك نموذجاً يولد

24:46وحدات البكسل بشكل

24:47مباشر . كما لو أنه

24:48نموذج فيديو . إنه يولد

24:50وحدات بكسل . إنه يولد

24:52الملاحظات مباشرة ولا

24:53يمر أبداً عبر عنق

24:54الزجاجة المتمثل في

24:55التمثيل ثلاثي

24:55الأبعاد الصريح

24:56الوسيط . وأعتقد أن كلا

24:58المسارين قد تطورا

24:59كثيراً خلال العامين

25:00الماضيين . لذا ، فإن

25:02هذه نقطة تفرع مثيرة

25:03للاهتمام حتى عند

25:05الحديث في هذه المرحلة

25:06.

25:06>> هذا صحيح . وهل ، هل

25:08تتبنى " World Labs " على سبيل

25:11المثال ، حسناً ، هل من

25:13الدقيق القول إنكم

25:15تتبعون نهج " Gaussian splats "

25:17كما في " Marble " وبعض

25:19الأعمال التي

25:20تنشرونها وتستعرضونها

25:23؟ لكن هل تشعر أن هذا

25:25النهج أساسي ، أم أنه

25:27مجرد ما أظهرتموه حتى

25:29الآن وأنكم منفتحون

25:30على أفكار أخرى ؟ حسناً

25:32، أعتقد أننا قمنا

25:33بالأمرين معاً بالفعل

25:35، أليس كذلك ؟ إذن ، هذا

25:36صحيح . لقد أطلقنا

25:38منتجاً يسمى " Marble "

25:39يعتمد نهج " Gaussian splatting "

25:41، وما يفعله " Marble " هو

25:42السماح للمستخدم

25:44بإدخال صورة أو سلسلة

25:45من الصور أو نص توجيهي

25:47، ثم يولد عالماً يتم

25:49تمثيله كمجموعة من "

25:50Gaussian splats " . وهو تمثيل

25:52ثلاثي الأبعاد صريح ،

25:53وبمجرد الحصول على هذا

25:55التمثيل ، يمكنك

25:56تقديمه لعرض صور جميلة

25:58للعالم ، أو يمكنك تخيل

26:00دمج كائنات بداخله ، أو

26:01تصديره إلى محرك

26:03رسوميات أو شيء من هذا

26:04القبيل . لكننا قمنا

26:06أيضاً بنشر تدوينة

26:07بحثية في أواخر العام

26:08الماضي حول " RTFM " الذي

26:10يتبنى نهجاً مختلفاً

26:11تماماً يسمى " نموذج

26:13الإطار في الوقت

26:14الفعلي " . وهذا يتناقض

26:15مع نهج " Marble " الخاص بنا

26:17، حيث يتجه بشكل أكبر

26:18نحو الاتجاه المباشر

26:20للفيديو ووحدات

26:21البكسل فقط . إذ لا يوجد

26:23تمثيل صريح للعالم

26:24ثلاثي الأبعاد . لدينا

26:26نموذج يعمل في الوقت

26:27الفعلي يقوم بتوليد

26:29الصور استجابةً

26:30لمدخلات المستخدم .

26:31فالمستخدم يطلب

26:32التحرك ، فيرى صورة

26:34للعالم وهي تتحرك ؛

26:35فمثلاً تقول " تحرك

26:37يساراً " فترى مقطع

26:38فيديو لنفسك وأنت

26:40تتحرك يساراً ، وكل هذا

26:41يحدث فورياً دون وجود

26:43تمثيل ثلاثي الأبعاد

26:45صريح . إنها مجرد

26:46إطارات يتم إنشاؤها

26:47بواسطة نموذج في الوقت

26:48الفعلي . لذا ، كانت "

26:49وورلد لابس " تعمل في

26:51كلا الاتجاهين . لدينا "

26:52ماربل " ، وهو نموذجنا

26:54الصريح للعالم القائم

26:55على تقنية " Gaussian splat " ،

26:57ولدينا " RTFM " كنموذج

26:58عالم ضمني يولد

26:59الإطارات فورياً . وهذا

27:02يطرح تساؤلاً لدي يعود

27:04بنا إلى نقاشنا

27:05الأساسي حول ماهية

27:07نموذج العالم . أنا

27:13أفكر في ... عمل " ميتا "

27:17الأولي حول " Gaussian splat "

27:19والعروض التوضيحية

27:20والأدوات التي أعتقد

27:22أنها جعلت هذه التقنية

27:24شائعة قبل أن تصبح

27:26ركيزة أساسية لفكرة

27:28نموذج العالم . كانت

27:30تسمح لك بالتقاط

27:32مجموعة من الصور

27:34وربطها معاً —

27:35باستخدام مصطلح " ربط "

27:37بشكل فضفاض — لإنشاء

27:39نموذج ثلاثي الأبعاد

27:41قابل للتنقل فيه . وحتى

27:44قبل ذلك ، لا أعتقد

27:46أنها استخدمت تقنية "

27:48Gaussian splat " ، لكن أدوات

27:50مثل " AR Kit " من أبل أنتجت

27:52شيئاً مشابهاً . نماذج

27:55ثلاثية الأبعاد قابلة

27:57للتنقل بشكل متواضع .

28:00أحاول تجنب تسميتها "

28:02عوالم " ، لأن السؤال

28:04هنا هو : كيف نرسم الخط

28:06الفاصل بين ذلك الشيء

28:08وبين " العالم " ؟ أريد أن

28:10أقول " ثابت " مقابل "

28:11ديناميكي " ، لكن هذا لا

28:12يبدو صحيحاً تماماً .

Reconstruction vs. Generative World Modeling

28:14>> لا ، أنا أفهم ما تعنيه .

28:16هناك تمييز مثير

28:17للاهتمام هنا يعتقد

28:18الكثيرون أنه مربك

28:19فيما يتعلق بـ " Gaussian

28:21splatting " تحديداً ، أليس

28:22كذلك ؟ لأن " Gaussian splat " هو

28:24في الواقع مجرد تمثيل

28:25للبيانات . إنه يشبه

28:27إلى حد كبير سحابة

28:28نقاط ثلاثية الأبعاد .

28:30لدي مجموعة من النقاط

28:32في الفضاء ، ولكل منها

28:33موقع ولون وربما خصائص

28:35أخرى مرتبطة بها .

28:36>> وإذا كانت سحابة

28:37النقاط كبيرة بما يكفي

28:39، يمكنك التحرك داخلها

28:41من منظور نقطة معينة .

28:42>> لكن السؤال المثير

28:43للاهتمام هو : من أين

28:45أتت سحابة نقاط الـ "

28:46Gaussian splat " هذه ؟ هناك

28:47انقسامان كبيران

28:49يسببان ارتباكاً

28:50للناس ، لأن أصل تقنية "

28:52Gaussian splatting " كان

28:53مرتبطاً بعملية إعادة

28:55البناء . الفكرة هنا هي

28:57أنني سأقوم بالتقاط

28:58الكثير من المشاهد

29:00لمكان ما ، مئات أو حتى

29:01آلاف الصور التي تغطي

29:03هذا المكان بتفاصيل

29:04دقيقة للغاية . ثم

29:05سأقوم بمطابقة هذه

29:07الصور مع تمثيل سحابي

29:08نقطي ثلاثي الأبعاد

29:10يُعرف بـ Gaussian Splat .

29:11>> حسناً ، عند وضع الأمر

29:12بهذا الشكل ، يبدو

29:13الفرق واضحاً ، فهو ليس

29:14مجرد عالم ، بل نموذج

29:15عالمي .

29:16>> بالضبط . لا يوجد نموذج

29:17عالمي هنا ، أليس كذلك ؟

29:19لم يكن هناك نموذج

29:20كبير وقوي هنا تعلم من

29:21كميات هائلة من

29:22البيانات . إن أساليب

29:24إعادة البناء القائمة

29:25على التحسين لتقنية

29:26Gaussian Splat تشبه قول : " لدي

29:28ألف صورة " . الكون

29:29بأكمله يتلخص في هذه

29:30الألف صورة ، وأنا أقوم

29:31بمطابقة Gaussian Splat

29:32لتناسبها . لا توجد

29:34معرفة عامة هنا . وهذا

29:35يختلف تماماً عما نقوم

29:37به في Marble . في Marble ،

29:38قمنا بتدريب نموذج

29:40كبير وقوي على الكثير

29:41من البيانات المتنوعة .

29:43وهذا النموذج يقوم

29:44بإنتاج تمثيلات Gaussian

29:46Splat . إذاً ، نموذج Marble

29:47العالمي هو النموذج

29:49الذي يعرف كيف يصيغ

29:50العوالم . إنه يستقبل

29:52صوراً ونصوصاً ، ويخرج

29:53تمثيلات Gaussian Splat . وهذا

29:55مختلف تماماً عن الوضع

29:57الذي أقوم فيه بمطابقة

29:58سحابة نقطية مع هذه

30:00الألف صورة بشكل بسيط ،

30:01دون وجود نموذج تعلم

30:02من كم هائل من

30:03البيانات . لقد تطرقنا

30:06لهذا قبل البدء

30:07بالتسجيل ، لكنني كنت

30:09أعتقد دائماً أن Gaussian

30:11Splat هو مجرد فكرة أو

30:13عملية عامة ، أي

30:15العملية الرياضية

30:16التقنية لإنشاء سحب

30:18النقاط هذه . لكن يبدو

30:22أن الأمر تطور كثيراً ،

30:24وأصبحت هناك الآن

30:26تنسيقات ملفات قياسية

30:28وأشياء أخرى . حدثنا

30:30قليلاً عن هذا النظام

30:32البيئي والأدوات

30:34المستخدمة في التعامل

30:35مع Gaussian Splats .

30:37>> أجل . غالباً ما تكون

Gaussian Splat Anatomy and File Formats

30:39تقنية Gaussian Splats شيئاً

30:40محدداً للغاية . إنها

30:42عبارة عن مجموعة من

30:43النقاط . كل نقطة لها

30:44موقع في الفضاء ثلاثي

30:46الأبعاد يتحدد بثلاث

30:47إحداثيات ( X ، Y ، Z ) . كما

30:48أن لها درجة عتامة ،

30:50وهي رقم بين صفر وواحد

30:52يحدد مدى شفافية أو

30:53عتامة هذه النقطة .

30:55وعادة ما يكون لديك

30:56لون يُمثل بقيم RGB ، وهي

30:58أيضاً ثلاثة أرقام .

31:00وغالباً ما ستجد

31:01مفهوماً إضافياً

31:02يُعرف بالتوافقيات

31:03الكروية ( Spherical Harmonics ) .

31:05وهذا يخبرك بما يبدو

31:06عليه الأمر ، وما هو

31:07لونه عند النظر إليه

31:08من زوايا مختلفة ، فأنت

31:09تريد نمذجة هذه الفكرة

31:11، حيث قد تكون لهذه

31:12النقطة لون معين إذا

31:13نظرت إليها من الأسفل ،

31:14ولون مختلف إذا نظرت

31:15إليها من الأعلى . وهذا

31:17يساعدك على نمذجة

31:18الانعكاسات ، فإذا كان

31:19لدي سطح لامع مثل

31:21المرآة أو سطح صقيل ،

31:22فعند النظر إليه من

31:23زاوية معينة ، قد أرى

31:25انعكاساً لضوء يرتد من

31:26الأعلى . أما إذا نظرت

31:28إليه من زاوية مختلفة ،

31:29فأنا أرى لوناً

31:30مختلفاً . وهذه

31:31التوافقيات الكروية

31:32هي وسيلة ملموسة

31:33ومحددة لالتقاط مفهوم

31:34اللون المعتمد على

31:35زاوية الرؤية . إذن ، "

31:37اللطخة الغاوسية " ( Gaussian

31:38splat ) هي عبارة عن

31:39مجموعة من النقاط . كل

31:40نقطة لها موقع ( xyz ) ،

31:41وشفافية ، ولون ،

31:42وأيضاً تحتوي على هذه

31:43التوافقيات الكروية

31:44التي تخبرك بكيفية

31:45تغير اللون عند النظر

31:46إليها من زوايا مختلفة

31:47. وهناك طرق مختلفة

31:49لتعبئة هذه البيانات

31:50في ملف . أليس كذلك ؟

31:52تُعد صيغة PLY تنسيق ملف

31:53شائعاً جداً لللطخات

31:55الغاوسية ، وهي سهلة

31:56القراءة والكتابة

31:57نسبياً ، لكنها غير

31:59فعالة إلى حد كبير .

32:00وهناك أيضاً تمثيلات

32:01مضغوطة مثل SPZ ، التي

32:03تضغط بعض تلك البيانات

32:05وتستخدم دقة أقل

32:06لأجزاء منها ، مما يسمح

32:08لك بتخزين شيء يبدو

32:09متشابهاً جداً ، ويبدو

32:11جيداً حقاً ، لكن بحجم

32:13ملف أصغر بكثير . يمكنك

32:15اعتبار صيغة PLY بمثابة

32:17ملف GIF أو PNG ، فهي غير

32:19مضغوطة إلى حد كبير .

32:21أما SPZ فهي أشبه بملف

32:23JPEG ، حيث يتم ضغط بعض

32:24أجزاء البيانات . سوف

32:26تتخلص من بعض أجزاء

32:28البيانات ، لكننا

32:29نعتقد أنها أجزاء لن

32:31يلاحظها البشر ، خاصة

32:32عند مقارنتها

32:34بالطريقة التي نفكر

32:35بها في الصور

32:36التقليدية ثنائية

32:38وثلاثية الأبعاد .

32:40اللطخات الغاوسية لا

32:42تعتمد على شبكة . وهل هي

32:46متناثرة بشكل عام

32:47بالنسبة لأبعاد

32:49المساحة التي نمثلها ؟

32:51>> نعم ، أعني أنها لا

32:52تعتمد على شبكة . أي من

32:54هذه النقاط يمكن أن

32:54تتواجد في أي مكان في

32:55الفضاء . لكنها عادةً ،

32:57أعني أن إحدى ... أوه . آه

32:58صحيح ، الشيء الآخر

32:59المهم الذي نسيته ، يا

33:00لي من أحمق لعدم وجود

33:01ملاحظاتي أمامي ، لكن

33:02الـ Gaussian Splat له حجم

33:03أيضاً ، أليس كذلك ؟ إنه

33:04ليس نقطة متناهية

33:06الصغر . امم ، الـ Gaussian

33:07Splat له حجم . امم ، إنه

33:08ليس مجرد نقطة في

33:09الفضاء . لديه نوع من

33:11نصف القطر . امم ،

33:12وأيضاً مصفوفة تباين

33:14لأنها قد لا تكون كرة .

33:16قد تكون شكلاً

33:17بيضاوياً . امم ،

33:18ومصفوفة التباين ونصف

33:19القطر ، أو في الواقع

33:21مصفوفة التباين فقط ،

33:22تخبرك بمدى كبر حجمها

33:23ومدى تمددها أو

33:24انضغاطها على طول

33:26الأبعاد المختلفة . امم

33:27، لذا فإن جزءاً من

33:28الفكرة الأصلية لـ

33:30Gaussian Splats هو أنها قد

33:31تكون متباعدة جداً ، أو

33:32ربما تكون متباعدة

33:33نوعاً ما ، وينتهي بك

33:35الأمر بـ Gaussian Splats

33:36كبيرة جداً لتغطية جزء

33:37كبير من الجدار . امم ،

33:39لكن من الناحية

33:40العملية ، يؤدي هذا

33:41عادةً إلى جودة منخفضة

33:42جداً . لذا ، عادةً ما

33:43تريد أن يكون الـ Splat

33:45كثيفاً إلى حد ما فوق

33:46الهندسة التي تريد

33:47تغطيتها ، وهذا يؤدي في

33:49النهاية إلى إنتاج صور

33:50أجمل بشكل عام . مع ذلك ،

Why Gaussian Splats Work with Neural Networks

33:56هل جزء من التقنية أو

33:58ما يجعل Gaussian Splats تعمل

34:00هو أن العارض قادر على

34:02التركيز على ما يراه

34:04المستخدم مقارنة

34:05بالأشياء الخارجية ؟

34:12أو ربما السؤال الأوسع

34:14هو : ما الذي يجعل Gaussian

34:16Splats مثيرة للاهتمام

34:17للغاية ؟ ربما تذكير

34:19سريع بذلك مقارنة

34:20بالطريقة التي

34:22تعاملنا بها مع هذا من

34:23قبل .

34:24>> أعتقد أن التباين الذي

34:25يجب أن تفكر فيه مع

34:26Gaussian Splats هو الشبكات

34:27المثلثية . امم ،

34:28الشبكات المثلثية هي

34:30التمثيل القياسي في

34:31رسومات الحاسوب ، وهذا

34:32يعني أننا سنمثل

34:33العالم كله كمثلثات

34:34صغيرة في الأساس . امم ،

34:36وكل شيء يتكون من

34:37مثلثات صغيرة ،

34:38وتقريباً أي لعبة

34:39لعبتها ، أو أي لقطة

34:40مؤثرات بصرية رأيتها ،

34:42أو أي صور تم إنشاؤها

34:43بواسطة الحاسوب ،

34:44فإنها جميعاً تصمم

34:45العالم كالكثير من

34:46المثلثات الصغيرة . امم

34:48، وهذا يعمل ، وقد نجح

34:49بشكل مذهل في رسومات

34:51الحاسوب لعقود . امم ،

34:52لكن المشكلة هي أن

34:53المثلثات لا تتناسب مع

34:54الشبكات العصبية بشكل

34:55جيد . امم ، لأن الجزء

34:57المهم هو القابلية

34:58للاشتقاق . أنت بحاجة

34:59إلى أن تكون قادراً

35:00على إجراء التفاضل من

35:01خلال هذا التمثيل ،

35:02وتمرير التدرجات ،

35:03وهذا يعني تحديداً أنك

35:04تريد لتمثيلك خاصية

35:05مفادها أنني إذا قمت

35:07بتغيير المدخلات

35:07قليلاً ، فإن المخرجات

35:09تتغير أيضاً قليلاً .

35:10وهذا ليس هو الحال مع

35:11المثلث ، لأنه إذا كان

35:12لدي مثلث هنا وقمت

35:14بتحريكه قليلاً ، فجأة

35:15يصبح الشيء الذي كان

35:16غير مرئي مرئياً الآن .

35:18إذن ، لدي الآن تغيير

35:19حاد ، تغيير غير مستمر

35:21في الصورة التي سأراها

35:23كدالة للمعاملات . لذا ،

35:25كما تعلم ، لا تمتلك "

35:26غاوسيان سبلاتس " ( Gaussian

35:28splats ) هذه الخاصية لأن

35:29كل شيء سلس وكل شيء

35:31شفاف جزئياً . لذا ،

35:32الصورة التي تراها

35:33تتغير بشكل مستمر كلما

35:35قمت بتغيير أي من

35:36معاملات " غاوسيان

35:37سبلاتس " بشكل ضئيل

35:38للغاية . وما يعنيه ذلك

35:39هو أنها تتكامل مع

35:40الشبكات العصبية بشكل

35:41جيد جداً . فالشبكات

35:42العصبية كلها متعلمة

35:43تعتمد على التدرج ،

35:44أليس كذلك ؟ سيكون لدي

35:45دالة هدف . سأقوم

35:46بتقليل دالة الهدف تلك

35:47عن طريق خوارزمية

35:48انحدار التدرج .

35:49وللقيام بذلك ، أحتاج

35:50إلى أن أكون قادراً

35:51على تمرير إشارة

35:52التدرج من خلال أي

35:52تمثيل أستخدمه . و "

35:53غاوسيان سبلاتس " تمرر

35:55التدرجات بشكل جيد

35:56جداً . وهذا يعني أنه

35:57يمكن توصيلها

35:58بمحسّنات تعتمد على

35:59التدرج ، وإما تحسينها

36:00مباشرة مقابل مجموعة

36:01من الصور ، وهو ما يحدث

36:02في حالة إعادة البناء .

36:04أو يمكن توصيلها

36:05بمخرجات شبكة عصبية ،

36:06وهو ما نفعله أكثر في

36:08حالة " ماربل " ( marble ) . هناك

36:09، الإعداد هو أن لدي

36:10شبكة عصبية تخرج "

36:11غاوسيان " ، ويتم ربط

36:12تلك الـ " غاوسيان "

36:13بدالة خسارة ما . ثم

36:14يمكنني إجراء

36:15الانتشار العكسي

36:16للخسارة وصولاً إلى

36:17معاملات الشبكة

36:18العصبية . إذن هذا هو

36:19الفارق الأكبر نوعاً

36:20ما . هذا هو الابتكار

36:21الكبير في " غاوسيان

36:22سبلاتس " ، وسبب حماس

36:23الناس تجاهها على مدى

36:25السنوات القليلة

36:25الماضية هو أنها تمثيل

36:27رسومي يتكامل مع

36:28الشبكات العصبية بشكل

36:29نظيف للغاية . بربط ذلك

36:32ببعض الخصائص

36:34الأساسية لنماذج

36:35العالم ، وتحديداً

36:37الاتساق ، هل هي القدرة

36:39على الانتشار العكسي

36:40أم كيف نحصل على هذا

36:42الاتساق ؟ هل يأتي ذلك

36:48من النمذجة ؟ هل يأتي

36:51من النطاق ( الحجم ) ؟ من

36:53أين يأتي ذلك ؟ هل هو

36:55أمر يتعلق بالبنية

36:57المعمارية ؟ من أين

36:58يأتي ؟

36:59>> أعتقد أنه يمكن أن

Consistency by Construction and at Scale

37:00يأتي من أماكن كثيرة ،

37:01وهذه في الواقع نقطة

37:02انطلاق مثيرة

37:02للاهتمام للغاية ، لأن

37:03هناك خاصية للعالم من

37:04حولنا وهي أنه متسق ،

37:05أليس كذلك ؟ إذا نظرت

37:07إليك ، تبدو متشابهًا

37:08نوعًا ما من لحظة

37:09لأخرى ، أو إذا ذهبت

37:11إلى غرفة أخرى وعدت ،

37:12فستظل موجودًا هنا .

37:14أمم ، وهذا هو مفهوم

37:15الاتساق . أمم ، وهناك

37:17طرق مختلفة ، وتعتبر

37:18Gaussian Splats متسقة

37:19بطبيعتها ، أليس كذلك ؟

37:20لأن لدي هذا التمثيل

37:21ثلاثي الأبعاد الصريح

37:22للعالم . لذا إذا نظرت

37:23إليه ، ثم نظرت بعيدًا ،

37:24ثم عدت للنظر إليه ،

37:25فكل شيء موجود هناك في

37:27صورة ثلاثية الأبعاد ،

37:28لذا سيبدو كما هو . أمم ،

37:29ولكن يمكنك أيضًا

37:30الحصول على الاتساق

37:30عبر البيانات واسعة

37:31النطاق والتدريب واسع

37:32النطاق والحوسبة

37:33واسعة النطاق . وهذا

37:34يميل أكثر نحو

37:35التمثيلات الضمنية

37:36التي قمنا بها في RTFM

37:38وفي أماكن أخرى . إذن

37:39الفكرة هنا هي ماذا لو

37:41كان لدي نموذج لا

37:42يحتوي على Gaussian Splats

37:44ولا يحتوي على أبعاد

37:45ثلاثية ولا نقاط صريحة

37:47، فقط نموذج يخرج قيم

37:48بكسل RGB للعالم . أمم ،

37:50ولكن إذا كان هذا

37:51النموذج ذكيًا وقويًا

37:52للغاية وتم تدريبه على

37:54الكثير من البيانات

37:55وربما بهيكل معبر صحيح

37:56، فعلى الرغم من أنه

37:57غير مضمون رياضيًا ،

37:59ولا يوجد شيء يضمن

38:00رياضيًا أن يكون

38:01متسقًا ، فأنت تعلم ،

38:02أنه ينتهي به الأمر

38:03متسقًا . وأعتقد أن

38:05الأمر ليس في أن

38:06أحدهما أفضل من الآخر .

38:07إنهما مجرد نقطتين

38:08مختلفتين على منحنى

38:09التكنولوجيا ، أليس

38:10كذلك ؟ إذا كانت لديك

38:12ميزانية حوسبة منخفضة

38:13نسبيًا وتريد تشغيل

38:14الأشياء بشكل مدمج ،

38:16ولا تريد تدريب نماذج

38:17عملاقة ، فإن Gaussian Splats

38:19جذابة لأنها متسقة

38:20بطبيعتها . ولكن إذا

38:21كان بإمكانك التوسع

38:22واستخدام الكثير من

38:23البيانات والكثير من

38:24الحوسبة ، فأنا أعتقد

38:25حقًا أن مسار الأبعاد

38:26الثلاثية الضمني

38:27سيكون هو الشيء الذي

38:28يتوسع إلى ما لا نهاية .

38:29أمم ، لذا فهي مسألة

38:30هندسية تتعلق

38:31بمتطلبات التصميم

38:32للمشكلة التي تواجهني

38:33الآن ، وليست انقسامًا

38:35فلسفيًا بالنسبة لي .

38:36أليس كذلك ؟ إذا كنت

38:38تريد شيئًا رخيصًا

38:39ومتسقًا بطبيعته ، فإن

38:40Gaussian Splats جذابة للغاية

38:41. إذا كنت تريد شيئًا

38:43يتوسع إلى ما لا نهاية

38:44ويعتمد على بيانات لا

38:45نهائية وحوسبة لا

38:46نهائية ، ولكنك على

38:47استعداد لدفع تكلفة

38:48الحوسبة اللانهائية

38:49في وقت الاستدلال ،

38:50وعلى استعداد لدفع

38:51تكاليف التدريب

38:52الكبيرة ، فأعتقد أن

38:53نهج البكسلات الضمنية

38:54فقط جذاب للغاية . وهذا

38:56بالضبط سبب قيامنا

38:57بكلا الأمرين في World Labs

38:58. أعتقد أن الاتجاه

39:00الذي كنت أحاول المضي

39:02فيه بهذا السؤال هو

39:04التركيز أكثر على

39:05منظور النموذج

39:06والتوليد ، وفكرة أننا

39:08نصف عالماً يتم إنشاؤه

39:10أثناء التنقل . يمكن

39:14للمستخدم التنقل عبر

39:16هذا العالم ،

39:17والالتفات بعيداً ، ثم

39:19العودة ، ونحن نولد

39:21إطارات متسقة في حالة

39:23RTFM أو نقاط " سبيلاتس "

39:25في حالة Marble . والسؤال

39:28هو ، أعتقد أن جزءاً

39:30مما تقوله هو أن

39:32الاتساق يعتبر أمراً

39:33مستقلاً عما إذا كنا

39:35نتحدث عن توليد بكسلات

39:37أو توليد نقاط .

39:39وبالتالي ، فإن الجزء

39:40التالي من هذا السؤال

39:42هو أتعلم ، يبدو أن

39:43الاتساق جزء مهم جداً

39:45من كل هذا ، فمن أين

39:47يأتي ؟ أعني ، أعتقد أنه

39:48يأتي بشكل أساسي من

39:49بياناتك في النهاية ،

39:50أليس كذلك ؟ بمعنى ، بغض

39:52النظر عن التمثيل الذي

39:53تستخدمه ، سواء كان

39:54بكسلات خام أو نقاط

39:56غاوسية ، في نهاية

39:57المطاف ، يجب أن يكون

39:58لديك شبكة عصبية في

39:59النظام تم تدريبها على

40:01إنشاء بيانات متسقة .

40:02والنقاط الغاوسية

40:03تسهل على الشبكة

40:04العصبية إنتاج مخرجات

40:06متسقة لأنها أكثر

40:07اتساقاً بطبيعتها ،

40:09لكن في النهاية يجب أن

40:10يأتي ذلك من بيانات

40:11تعكس وجهات نظر للعالم

40:13متسقة بالطريقة التي

40:14تريد لنموذجك أن

40:16يتعلمها . أعتقد أن

40:17السؤال هنا أو الفرصة

40:19تكمن في التعمق في Marble

40:21والتحدث قليلاً عن "

40:23الوصفة " وكيف يخلق ذلك

40:25نموذجاً للعالم ، كيف

40:26يتم بناء نماذج عالم

40:28Marble .

40:29>> أعني أننا لم نتحدث

40:30صراحة عن بنية نموذج

How Marble Generates 3D Worlds

40:32Marble ، ولكن على مستوى

40:33عالٍ ، هو يسمح لك

40:35كمستخدم بإدخال أنواع

40:36مختلفة من الأشياء .

40:38يمكنك إدخال نص توجيهي

40:40، أو صورة ، أو صور

40:41متعددة ، أو حتى مقطع

40:43فيديو . ثم نقوم من ذلك

40:44بتوليد عالم من النقاط

40:46الغاوسية ثلاثي

40:47الأبعاد . وهناك خطوة

40:48وسيطة في ذلك تتمثل في

40:50توليد صورة بانورامية

40:52بزاوية 360 درجة . وهنا ،

40:54بالنظر إلى تلك

40:55المدخلات ، يكون لديك

40:57نوع من نموذج أو جزء من

40:59نموذج يولد رؤية

41:00بانورامية 360 درجة

41:02للعالم الذي توشك على

41:03إنشائه . وهذا نموذج

41:05توليدي كبير وقوي

41:06يحتاج إلى أخذ أي

41:07مدخلات من المستخدم

41:09ورسمها أولاً في

41:10بانوراما 360 درجة ، ثم

41:12من هناك تحويلها إلى

41:13عالم كامل من النقاط

41:14الغاوسية ثلاثي

41:16الأبعاد . هل يعني هذا

41:18أن مدخلات المستخدم

41:20تكون إما نقطة واحدة

41:21أو صورة واحدة أو ... أظن

41:29أنني أفكر في أنه إذا

41:31قدم المستخدم مجموعة

41:33متنوعة مكانيًا من

41:34الصور ، فهل يعني ذلك

41:36أن النطاق يصبح أكبر

41:38بكثير ؟

41:40>> أوه لا . لذا ، ما نقوم

41:41به في الأساس هو أن

41:42حالة الاستخدام

41:43الأبرز هي الاعتماد

41:44على صورة واحدة ، وهذا

41:45على الأرجح ما يعمل

41:46بشكل أفضل في ماربل

41:47اليوم . فالأمر يشبه

41:49أنني سأدخل صورة واحدة

41:51، وبالنسبة للعناصر

41:52التي أراها في تلك

41:54الصورة ، يجب أن يطابق

41:55عالمي المولد ما أراه

41:57في صورتي المدخلة ؛ ثم

41:59سيحاول النموذج إكمال

42:01ما لا يظهر في الصورة

42:02بطريقة منطقية . أليس

42:04كذلك ؟ لذا ، إذا كنت

42:06ألتقط صورة لسبورة في

42:07مقدمة فصل دراسي ، فيجب

42:09أن يعرف النموذج أن

42:10خلف السبورة توجد تلك

42:12الكراسي حيث يجلس

42:13الناس ، حيث يجلس

42:14الطلاب . ومن ثم يجب أن

42:16يكون النموذج قادرًا

42:17على أخذ صورة للسبورة

42:18وتكملتها ، مثل توليد

42:19الكراسي خلف السبورة ،

42:20ثم تحويل كل ذلك إلى

42:21ثلاثي أبعاد يمكنك

42:22التنقل فيه .

42:23>> وهل يقدم المستخدم

42:24مطالبات نصية أيضًا ؟

42:25>> أم ، يمكنهم ذلك . نعم ،

42:27يمكن للمستخدم توجيه

42:28هذا مباشرة من خلال

42:29النص . أم ، هذا اختياري

42:31نوعًا ما . إذا كنت ، كما

42:32تعلم ، ترغب في توليد

42:33عالمك من النص فقط ،

42:34يمكننا القيام بذلك .

42:35وإذا كنت ترغب في

42:36تقديم نص كمدخل إضافي

42:38لتقديم توجيه إضافي

42:39لما يحدث في صورتك

42:40المدخلة ، فهذا ممكن

42:41أيضًا . لكننا أردنا

42:42اتباع هذا النهج مع

42:43مارفل لتوفير أقصى قدر

42:45من المرونة

42:45للمستخدمين : بغض النظر

42:47عن نوع الإشارة التي

42:48لديك ، أو نوع التعديل

42:49الذي تقوم به ، أو أين

42:50تريد أن تأخذ الأمر

42:52بعد توليده ، نريد منحك

42:53الكثير من المسارات

42:54لاستخدام هذه الأداة

42:55وعدم محاولة توجيه

42:56الجميع عبر مسار واحد

42:58جامد حول كيفية توليد

42:59الأشياء أو مكان

43:00استخدامها لاحقًا . أظن

43:02أن أسئلتي أو افتراضي

43:04حول تعدد الصور نابع

43:06من أنني رأيت بعض

43:07عوالم ماربل . عوالم

43:11كانت عبارة عن غرف

43:12كلاسيكية ، حيث يمكنك

43:14الدوران حول الغرفة

43:16وتجد الكثير من

43:17التفاصيل ، وهي مثيرة

43:19للإعجاب للغاية . لكنني

43:22رأيت أخرى تبدو أشبه

43:24بعوالم ألعاب الفيديو

43:26الغامرة ، حيث يمكنك

43:28التنقل عبر ما يشبه

43:29قرية خيالية . وأعتقد

43:35هل يتم توليد كل ذلك

43:37بشكل عام من صورة

43:39واحدة وربما بعض

43:40التوجيه النصي ؟ أجل ،

43:42أعني أن هذا هو جمال

43:43وجود نموذج للعالم ضمن

43:45الحلقة ؛ إذ تمتلك

43:46نموذجاً توليدياً

43:47ضخماً وقوياً تم

43:48تدريبه على كم هائل من

43:50البيانات ، سواء كانت

43:51بيانات واقعية أو

43:52خيالية ، أو صوراً

43:53واقعية أو غير واقعية .

43:55إذن ، لديك هذا النموذج

43:56الضخم والقوي في

43:58الخلفية ، وبغض النظر

43:59عن نوع الصورة أو النص

44:00الذي تقدمه ، سواء كانت

44:02الصورة لغرفة في منزلك

44:03أو بيئة خيالية تشبه

44:05ألعاب الفيديو ، فلديك

44:06نموذج يعرف كل هذه

44:07الأنواع المختلفة من

44:09العوالم ويمكنه

44:10توليدها حسب الضرورة

44:11للمهمة المطلوبة . وهذا

44:13هو الفرق الجوهري بين

44:14وجود هذه النماذج

44:15التوليدية المدعومة

44:17بنموذج عالمي ضخم وبين

44:18تقنيات " التبقيع

44:20الغاوسي " التقليدية

44:21التي تكتفي بمطابقة

44:22ألف صورة لدي . وماذا

44:24يمكنك أن تقول عن

Training Data and Output Representations

44:25مجموعات البيانات

44:26المستخدمة لإنشاء هذه

44:27النماذج وعن نهج

44:28التدريب وطريقته ؟

44:29>> أجل ، أعني أنك بحاجة

44:30إلى التدريب على

44:31الكثير من البيانات .

44:32ومن الأمور المهمة

44:33حقاً القدرة على

44:34التدريب على مجموعة

44:35متنوعة من البيانات

44:36المختلفة ، أليس كذلك ؟

44:38لأن العالم في نهاية

44:39المطاف ثلاثي الأبعاد

44:40ويحتوي على الكثير من

44:41البنية ثلاثية

44:42الأبعاد . لكن لا توجد

44:43الكثير من البيانات

44:44ثلاثية الأبعاد

44:45الصريحة التي يمكنك

44:46التعلم منها . إنه نوع

44:47نادر جداً من البيانات

44:48. لكن هناك الكثير من

44:49الصور المتاحة . وهناك

44:51الكثير من مقاطع

44:51الفيديو المتاحة .

44:52والصور ومقاطع

44:53الفيديو كلاهما

44:54إسقاطات ثنائية

44:55الأبعاد لعالم ثلاثي

44:56الأبعاد . لذا ، حتى لو

44:57كنت تريد نموذجاً ينتج

44:59في النهاية محتوى

45:00ثلاثي الأبعاد ، فمن

45:01القوي جداً أن يتعلم

45:02من كميات كبيرة من

45:03بيانات الصور

45:04والفيديو ، لأنك

45:05تستطيع الحصول عليها

45:06بكميات ضخمة جداً .

45:07وعندما تحصل على

45:08بيانات ثلاثية

45:09الأبعاد صريحة ، فهذا

45:10مفيد جداً للتعلم ،

45:11لكنك لا تريد أن يقتصر

45:13تعلمك على البيانات

45:14ثلاثية الأبعاد فقط .

45:15أفترض أنك تحاول

45:16التدريب على أي بيانات

45:18متاحة لديك بشكلها

45:20الأصلي بدلاً من أخذ

45:21صورة وإسقاطها في بعد

45:23ثالث ، وهو أمر يبدو

45:25مكلفاً للغاية

45:26ومشوهاً .

45:27>> أجل . أعني ، أحد الدروس

45:28التي تعلمناها من

45:29التعلم العميق على

45:30مدار العقد الماضي هو

45:31أنك تحتاج إلى نماذج

45:32كبيرة مدربة على

45:32الكثير من البيانات

45:33ومدربة من البداية إلى

45:34النهاية . لذا ، إذا كان

45:35لديك نموذج ، فما هي

45:36مهمتك ؟ هل مهمتك هي

45:38توليد عوالم " غاوسيان

45:39سبلات " اليوم ، أم

45:40توليد إطارات متسقة

45:41ثلاثية الأبعاد قوية

45:42حقاً في اليوم التالي ؟

45:43فكر فقط في المهمة

45:44التي تريد حلها ، وكيف

45:45يمكنني حشد كميات

45:46كبيرة جداً من

45:47البيانات للسماح

45:48لنموذج ما بتعلم كيفية

45:50حل تلك المهمة بطريقة

45:51عامة جداً . هل مخرجات

45:53النموذج هي " سبلاتس "

45:54مباشرة أم هناك شيء ما

45:56؟ أعتقد أن هذا يشبه ما

45:59كنت تقوله للتو ، هل

46:01ينتج نوعاً من التمثيل

46:03ثلاثي الأبعاد الموحد

46:04أياً كان ، ويمكنك

46:06تحويله إلى وحدات بكسل

46:08أو " سبلاتس " ، أم أنه

46:09يخرج " سبلاتس " مباشرة ؟

46:11نعم ، المخرج الأكثر

46:12دقة من هذا النموذج هو

46:14" سبلاتس " بطريقة أو

46:15بأخرى . وبمجرد حصولك

46:16على " سبلاتس " ، فهذا هو

46:18نوع صيغة الثلاثية

46:19الأبعاد الأقل

46:19تعقيداً لدينا . لذا

46:20بمجرد امتلاكك للـ "

46:22سبلاتس " ، يمكنك

46:22تصييرها إلى صورة ،

46:23وهذا يمكن أن يمنحك

46:25صوراً أو مقاطع فيديو

46:26من هذه العوالم .

46:27يمكننا أيضاً ، يمكنك

46:28أيضاً ملاءمة تمثيل

46:30شبكي للعالم . وفي بعض

46:31السياقات ، مثل رغبتك

46:33في استيراد هذا إلى

46:34محرك ألعاب أو محرك

46:35مؤثرات بصرية ،

46:36أحياناً لا تعمل هذه

46:37المحركات بشكل جيد مع

46:38الـ " سبلاتس " حالياً .

46:40ومن المفيد امتلاك

46:41شبكة مثلثات ثلاثية

46:42الأبعاد أكثر

46:43كلاسيكية للعالم . لذا

46:44فإن الـ " سبلات " هو نوع

46:45مخرجاتنا الأكثر دقة

46:46من نماذج " ماربل " ، ومن

46:48ثم يمكنك الانتقال من

46:49ذلك إلى صور أو

46:50فيديوهات أو شبكات .

46:51ولكن مرة أخرى ، هذا

46:53يتناقض بشكل صارخ مع

46:54نموذج " RTFM " حيث لا توجد

46:56" سبلاتس " . إنه يخرج

46:57وحدات البكسل مباشرة .

46:59لقد أشرنا في وقت سابق

47:00إلى منشور المدونة

47:03الذي كتبته مؤخراً أو

47:05الذي نشره فريقك

47:07مؤخراً . واعتقدت أن ما

47:11كان مثيراً للاهتمام

47:13حقاً في ذلك هو أنني

47:15كمحلل ، في أي وقت أرى

47:17فيه تصنيفاً يحاول

47:18تفكيك الفروق في مجال

47:20ما والحديث عنها ، أكون

47:22مهتماً . وهذا هو ما

47:27حاولت القيام به على

47:28الأقل في بُعد معين

47:30لنماذج العالم . أعتقد

47:32أننا قدمنا ثلاث أو

47:34أربع تصنيفات أخرى في

47:35هذه المحادثة حتى الآن

47:37. ولكن تحدث قليلاً عن

47:40الطريقة التي قسمت بها

47:42ذلك البعد الخاص من

47:44نماذج العالم . كما قلت

47:46، وكما تحدثنا عدة

47:47مرات ، أعتقد أن هناك

World Models as Renderers, Planners, and Simulators

47:49الكثير من الأنواع

47:50المختلفة لما يدربه

47:51الناس ويطلقون عليه

47:52نماذج العالم ، والتي

47:54تبدو مختلفة تماماً من

47:55الخارج . وعندما فكرنا

47:56في الأمر بجدية ،

47:58أدركنا أن هناك إطاراً

47:59تظهر فيه جميعها في

48:01الواقع كوجهات نظر

48:02مختلفة لشيء واحد .

48:04وهناك أدركنا أنه

48:05يمكننا ربط هذا مجدداً

48:07بنظام POMDP الذي تحدثنا

48:08عنه من قبل . لأنك في

48:10نظام POMDP هذا ، تذكر أن

48:12هناك ثلاثة أشياء

48:13تتحرك في النظام . لديك

48:15الوكيل في العالم ، ثم

48:16يقوم الوكيل بإنتاج

48:18الإجراءات ، ويقوم

48:19العالم بتغيير حالاته

48:21، ثم يتلقى الوكيل

48:22الملاحظات . وقد أدركنا

48:24أنه إذا فكرت في الأمر

48:25بهذه الطريقة ، فإن كل

48:27ما يدربه الناس اليوم

48:28ويسمونه نماذج العالم

48:30، يقوم عادةً بإخراج

48:31واحد من ثلاثة أشياء

48:33في تلك الحلقة . إما أنك

48:35تبني نموذجاً يُخرج

48:36إجراءات ، أو تبني

48:38نموذجاً يُخرج حالات ،

48:39أو تبني نموذجاً يُخرج

48:41ملاحظات . وبمجرد أن

48:43أدركنا ذلك ، كانت لحظة

48:44إدراك مفاجئة ، وهي أن

48:46هؤلاء الأشخاص لا

48:47يبنون أشياء مختلفة

48:48تماماً . إنهم يركزون

48:50فقط على أجزاء مختلفة

48:51من حلقة POMDP الأساسية

48:53هذه . وجميعها مترابطة

48:54معاً لمحاولة نمذجة

48:55العالم وفهم كيفية

48:56استجابة العوالم

48:57وتطورها وتغيرها

48:58بمرور الوقت ، لكن

49:00الأشخاص يركزون على

49:01أجزاء مختلفة من تلك

49:02الحلقة لتطبيقات

49:03مختلفة .

49:04>> فهمت . إذاً شيء مثل "

49:06جيني " ( Genie ) الذي ينتج

49:08تدفقاً من البكسلات

49:10سيكون ملاحظات في هذا

49:12النموذج ، وشيء مثل

49:14نظام روبوتي ينتج

49:15إجراءات ليقوم بها

49:17الروبوت في العالم

49:19يكون أكثر تركيزاً على

49:21ذلك كمخرجات .

49:23>> بالضبط . إذاً ، قمنا

49:26بتصنيف هذه إلى هذه

49:28الفئات الثلاث

49:29المختلفة لنماذج

49:30العالم بناءً على ما

49:32تنتجه . فكما قلت ، إذا

49:34كنت تُخرج الملاحظة

49:35مثل " جيني " أو " RTFM " ،

49:37فإننا نسمي ذلك نموذج

49:38عالم تصييري ( rendering ) أو

49:40مجرد مصيّر ، لأنه ينتج

49:42ملاحظة نهائية يمكن

49:44لشخص أو ربما لوكيل

49:45استهلاكها . إذاً هذا

49:47ما نطلق عليه اسم "

49:48المصيّر " كنموذج

49:50للعالم . ثم النوع

49:51الآخر ، والنوع الرائع

49:52الآخر ، هو كل هؤلاء

49:53الأشخاص الذين يدربون

49:55سياسات الروبوتات ،

49:56أليس كذلك ؟ أي أن

49:57الناس يدربون نماذج

49:58تقوم بتشغيل جسم روبوت

49:59، ثم يقوم جسم الروبوت

50:01بفعل شيء رائع في

50:02العالم . ولكن ماذا

50:03يفعل ذلك النموذج إذن ؟

50:04هذا النموذج يقع

50:05تقريباً على الجانب

50:06الآخر من حلقة POMDP ،

50:07أليس كذلك ؟ إنه يتلقى

50:08ملاحظات من العالم

50:09الحقيقي ، والآن يحتاج

50:11النموذج لاتخاذ

50:11إجراءات ، كما تعلم ،

50:12لمحاولة إحداث تغيير

50:13في العالم . ومن ثم

50:14لديهم نموذج عالم

50:16يستقبل ملاحظات

50:16العالم الحقيقي ويخرج

50:18إجراءات ليتم تنفيذها

50:19في العالم الحقيقي .

50:20وهذا ما نسميه المخطط ،

50:22أي نموذج العالم كمخطط

50:23، لأنه يخطط لسلسلة من

50:25الإجراءات التي يجب

50:26اتخاذها في العالم .

50:28وهذا يكاد يكون

50:29مماثلاً تماماً

50:30لنموذج العالم كعارض ،

50:31لأن العارض يتلقى

50:33نوعاً ما إجراءات ،

50:34ربما من مستخدم بشري ،

50:35ثم يخرج ملاحظات لما

50:37قد يبدو عليه العالم

50:38في ظل تلك السلسلة من

50:40الإجراءات . لذا ،

50:41العارض والمخطط هما

50:42تقريباً متقابلان

50:43بشكل مثالي لبعضهما

50:44البعض . والثالث هو ،

50:46ماذا عن الحالة ؟ هذه

50:47نقطة صعبة نواصل

50:48العودة إليها . حسناً ،

50:50نحن نسمي ذلك نموذج

50:51العالم كمحاكي ، لأن

50:53خاصية أخرى مهمة

50:54لنماذج العالم هي أنها

50:56ربما يجب أن تقوم بنوع

50:58من محاكاة الحالة . في

50:59بعض السياقات ، أنت

51:00تهتم فقط بإجراء

51:02الملاحظة ، ولكن في

51:03سياقات أخرى قد ترغب

51:04في معرفة شيء ما عن

51:06حالة العالم قيد النظر

51:07، وربما تفهم أو تحاكي

51:09كيف قد تتطور تلك

51:10الحالة استجابةً

51:11للإجراءات بطريقة

51:12صريحة أو شبه صريحة .

51:14هذا هو نموذج العالم

51:15كمحاكي ، وقد أدركنا

51:17أننا عندما نحلل الأمر

51:18إلى هذه المصطلحات ،

51:20فإن معظم نماذج العالم

51:21التي يتدرب عليها

51:23الناس هذه الأيام يمكن

51:24تصنيفها عادةً في

51:25واحدة من هذه الفئات

51:27الثلاث . وجدت أن

When Rendering and Simulation Overlap

51:31المحاكي مثير

51:32للاهتمام لأنني عادة

51:33ما أفكر في المحاكاة

51:35كأداة خارجية

51:36نستخدمها لتطوير

51:38النماذج ، بدلاً من هذا

51:40الإطار الذي يكون فيه

51:42النموذج نفسه في

51:43الأساس محاكياً .

51:47>> وهناك شيء آخر مثير

51:48للاهتمام هو أن هذه

51:49المفاهيم تبدأ في

51:50التداخل ، وأعتقد أن

51:52ماربل ( Marble ) هو في

51:53الواقع مثال لشيء يقع

51:54إلى حد ما على الحدود

51:55بين نموذج العالم

51:57كعارض ونموذج العالم

51:58كمحاكي ، أليس كذلك ؟

51:59لأنه عندما تتفاعل

52:01كمستخدم مع ماربل ،

52:03أليس كذلك ؟ أنت ترى

52:04بكسلات على الشاشة ،

52:06أليس كذلك ؟ وتلك

52:07البكسلات ، كما تعلم ،

52:08من هذا المنطلق ، أنت

52:09ترى ملاحظة ، لكن تلك

52:11الملاحظة لم تأتِ

52:11مباشرة من الشبكة

52:12العصبية . تلك الملاحظة

52:14جاءت من مجموعة من

52:15التلطيخات الغاوسية (

52:16Gaussian splats ) . وتُعد

52:16الغاوسية المبعثرة (

52:17Gaussian splats ) نوعاً من

52:18تمثيل الحالة ، هذا

52:19التمثيل الصريح

52:20للحالة الذي نمتلكه

52:21للعالم . وبمجرد حصولك

52:22على هذا التمثيل

52:23الصريح للحالة ، يمكنك

52:24القيام بأشياء أخرى

52:25بها بخلاف العرض

52:26الرسومي . أليس كذلك ؟

52:28ولأنه تمثيل ثلاثي

52:29الأبعاد صريح ، يمكنك

52:30قياس المسافة بين

52:32نقطتين أو يمكنني

52:33التلاعب بالحالة بشكل

52:34مباشر عن طريق جلب أصل

52:35كائن آخر ووضعه في ذلك

52:37العالم . لذا ، فإن عالم

52:38مثل نسخة ماربل ( Marble )

52:39التي لدينا اليوم ،

52:40تبدو تجربة المستخدم

52:42فيه شاملة ( end-to-end ) حيث

52:43ترى الملاحظات وترى

52:44البكسلات على الشاشة .

52:45وهكذا فهو أشبه

52:47بمُصيّر ( renderer ) ، لكن

52:48النموذج نفسه يخرج

52:49حالة عالم صريحة أو

52:51شبه صريحة يمكنك

52:52استخدامها لأغراض

52:53أخرى .

52:54>> يبدو هذا تمييزاً أكثر

52:56دقة بكثير من مجرد

52:57مُصيّر ومخطط . فإذا

53:01فكرت في مُصيّر بدلاً

53:03من إخراج إطارات

53:04ثنائية الأبعاد ، كان

53:06يخرج بطريقة ما

53:07أبعاداً ثلاثية

53:09مباشرة ، حينها يمكنك

53:11قياس المسافات بين

53:12النقاط ، وهذا تمثيل

53:14ولكنه أيضاً ملاحظة في

53:16نفس الوقت .

53:19>> بالضبط ، وهذه هي

53:20النقطة الأخرى التي

53:21أردنا توضيحها هنا ،

53:22وهي أنه على الرغم من

53:24وجود هذا التصنيف ، إلا

53:25أنه ليس جامداً جداً ،

53:26وأعتقد أن التمسك به

53:28بصرامة سيكون مضراً

53:29لنا جميعاً ، أليس كذلك

53:30؟ فالعالم الحقيقي

53:31فوضوي وكل تصنيفاتنا

53:33تنهار ، لكنه يظل إطار

53:34عمل مفيداً للتفكير .

53:36لكن في الواقع ، أعتقد

53:37أن نماذج العالم التي

53:38ستقودنا في نهاية

53:39المطاف ستمزج كل هذه

53:41الجوانب معاً ، أليس

53:42كذلك ؟ نحن نريد في

53:43النهاية الحصول على

53:44نظام موحد يمكنه

53:45القيام بكل هذه

53:46الأشياء .

53:47>> أجل . لكنني أعتقد أنني

53:49أطلب أيضاً المزيد من

53:51التوضيح حول المحاكي و

53:53... هل هناك أمثلة أخرى

54:00تتجاوز مثال ماربل

54:02تجسد فكرة النموذج

54:03كمحاكي ؟

54:05>> نعم ، أعتقد أن هناك

54:07بضعة أمثلة . في الواقع

54:08، لا أعتقد أن أحداً قد

54:09أتقن ذلك تماماً في

54:10الوقت الحالي . وهذا هو

54:11السبب ، لكنني أعتقد أن

54:12هناك بضعة أنماط من

54:13الأنظمة المستقبلية

54:14التي يمكنني تخيلها

54:15هنا . أحدها قد يكون

54:16نسخة مستقبلية من حالة

54:18ماربل الصريحة . لا

54:19يعني هذا أن هذا ما

54:21سنفعله بالفعل ، ولكن

54:22هذا ما يمكن للمرء

54:23فعله . كما لا يعني أننا

54:25لا نفعله أيضاً ، أليس

54:27كذلك ؟ لكن . لكن يمكنك

54:29تخيل نسخة من هذا

54:30تتعامل مع شيء مثل "

54:32التمثيل الغاوسي "

54:33كحالة للعالم ، ولكنها

54:35تمتلك نموذجاً يطور

54:36هذه الحالة بمرور

54:37الوقت . لذا يمكنك

54:38الحصول على نموذج

54:39يتلقى صورة كمدخل ،

54:41ويخرج " تمثيلاً

54:42غاوسياً " للعالم ، ثم

54:43يقوم المستخدم بإجراء

54:44ما مثل التقاط زجاجة

54:46أو تحريك شيء ما ،

54:47وعندها سيكون لديك

54:48نموذج يقوم بتحديث هذا

54:49العالم الغاوسي

54:50باستخدام شبكة عصبية

54:52قوية . إذاً ، سيكون هذا

54:53نموذجاً يعمل مع حالة

54:54العالم الصريحة أو شبه

54:55الصريحة هذه ، ويكون

54:56قادراً فعلياً على

54:58تطوير حالة العالم هذه

54:59بمرور الوقت استجابةً

55:00للإجراءات . لا أعتقد

55:01أن أحداً قد بنى

55:02نظاماً كهذا حقاً ، لكن

55:04يمكنهم ذلك . والخيار

55:05الآخر سيكون نوعاً من

55:06حالة العالم الضمنية .

55:08وربما يمكننا بناء

55:09أنظمة لا تعمل على

55:10التمثيل الغاوسي

55:11مباشرة ، بل تمتلك

55:12نوعاً من التمثيل

55:13المتجهي الضمني لحالة

55:15العالم . وهي تتصرف

55:16بالطريقة التي تجعل

55:18الحالة الصريحة تُخرج

55:19ملاحظات منها . يمكنك

55:21امتلاك شبكات تتنبأ

55:22بكيفية تطور تلك

55:23الحالة استجابةً

55:24للأفعال ، وتتنبأ

55:25بكيفية تطورها بمرور

55:27الوقت ، وبنوع من

55:28الشبكات العصبية

55:29المماثلة لحالة

55:30العالم الصريحة تلك .

55:31أعتقد أن الناس يعملون

55:33على ذلك ، لكن يبدو أنه

55:34لا يزال سؤالاً بحثياً

55:36مفتوحاً تماماً حول

55:37الوصفة الدقيقة لجعل

55:38ذلك يعمل .

55:39>> نعم . الشيء الآخر الذي

55:42يتبادر إلى ذهني عند

55:43التفكير في المحاكاة

55:45هو أن التعبير المثالي

55:47عنها ربما يكون " باني

55:49النظريات " الذي تحدثنا

55:51عنه . إذ يأخذ هذه

55:53الأفكار المجردة

55:55ويختزلها ، في هذه

55:56الحالة ، تصبح الحالة

55:58عبارة عن مجموعة من

55:59النظريات حول العالم .

56:01>> نعم . أعني حينها عليك

56:03التحدث عن الحالات

56:04والحالات الفوقية ،

56:05والنظريات والنظريات

56:06الفوقية ، والارتقاء

56:07بمستوى التجريد ،

56:08يمكنك القول ربما أن

56:09باني النظريات هو من

56:11يكتب قوانين الفيزياء

56:12في الحالات . لذا

56:13فالنظرية تغلف نوعاً

56:14ما أنواع العوالم التي

56:15قد توجد وكيف يُسمح

56:17لهذه العوالم بالتطور .

56:18ومن ثم تكون الحالة

56:19عبارة عن تجسيد واحد

56:20محدد للنظرية يخبرك عن

56:22عالم معين . لكنني لا

56:23أعتقد أن لدى أي شخص

56:24أدنى فكرة عن كيفية

56:25القيام بذلك .

56:26>> نعم . نعم . حسناً . لقد

The Path to Unified World Models

56:28أصبحنا أكثر تجريداً

56:29مما ينبغي هنا . هلا

56:30تحدثت قليلاً عن فكرة

56:32نموذج العالم الموحد ؟

56:35أعتقد أننا التقطنا

56:37ذلك قليلاً ، وهي مجرد

56:39فكرة أنها تجريد غير

56:40محكم نوعاً ما ، وأنت

56:42لا تتوقع ، بل تتوقع

56:44نوعاً من التداخل في

56:46المنتجات الواقعية .

56:49>> بالضبط . ما أعتقد أننا

56:51سنصل إليه كمجال هو

56:52نماذج يمكنها القيام

56:53بكل هذه المهام بشكل

56:54مشترك . وأنها جميعاً

56:55ستستفيد من بعضها

56:56البعض . ولماذا هذا ؟

56:58لأنها جميعاً تطرح

56:59أسئلة متشابهة ، فهي

57:00تريد أن تفهم ما هي

57:01أنواع العوالم التي

57:02يمكن أن توجد ؟ كيف

57:04يمكن لتلك العوالم أن

57:05تستجيب للفعل ؟ كيف

57:06تبدو تلك العوالم ؟ ما

57:07نوع الملاحظات التي

57:08تنشأ من تلك العوالم ؟

57:10كيف تتطور عبر الزمن ؟

57:11ما الذي يمكنك فعله

57:12بها ؟ هذه كلها أسئلة

57:14جوهرية ترتبط ببعضها

57:15البعض . أليس كذلك ؟ إذا

57:17أصبحت أفضل في فهم

57:18كيفية تطور حالة

57:19العالم ، فمن المحتمل

57:20أنني سأصبح أفضل أيضاً

57:21في توقع كيف ستبدو من

57:22زوايا مختلفة كعارض (

57:23Renderer ) . وإذا كنت جيداً

57:24حقاً في التخيل وكيف

57:25ستتطور حالة العالم

57:26الضمنية ، فمن المحتمل

57:28أن يكون ذلك جيداً

57:28للتخطيط ، أليس كذلك ؟

57:30إذا كنت أعرف ، إذا كان

57:31بإمكاني ضمناً تطوير

57:32حالة عالمي ، فمن

57:32المحتمل أنني أستطيع

57:33أيضاً التخطيط بناءً

57:34على تلك الحالة ومعرفة

57:35كيفية اتخاذ إجراءات

57:36للتأثير على العالم .

57:37لذا ، لا أعتقد أننا

57:38وصلنا إلى هناك بعد ،

57:39لكنني أعتقد أننا خلال

57:41العامين المقبلين ،

57:42سنبدأ في رؤية نماذج

57:43تجمع المزيد والمزيد

57:44من هذه القدرات في

57:45نموذج واحد موحد وقوي .

57:47ومن ثم ، فإن نوع

57:48المخرجات التي تريدها

57:49في لحظة معينة لا

57:50يعتمد على وجود نماذج

57:52متخصصة كعارضات أو

57:53محاكيات أو مخططات ، بل

57:54يتعلق أكثر بـ : اليوم

57:55أريد تشغيل روبوت ، لذا

57:57سيعمل في وضع المخطط ؛

57:58وغداً أريد تشغيل لعبة

58:00فيديو افتراضية ، لذا

58:01سيعمل في وضع العارض ؛

58:02أو في اليوم التالي

58:04أريد محاكاة احتمالات

58:05افتراضية في عالم ما ،

58:06والآن أريده أن يعمل

58:08في وضع المحاكي . لذا

58:09أعتقد أن هذا هو

58:10الاتجاه الذي سيتجه

58:11إليه المجال في

58:12العامين المقبلين . هذا

58:13يجعلني أفكر في فكرة

58:15أن طبقة المخرجات في

58:17الشبكة العصبية ، يمكن

58:19أن تكون تصنيفاً أو

58:20انحداراً أو شيئاً آخر

58:22. لكن ، التمثيل

58:24الأساسي ، كما تعلم ، هو

58:26نفسه في الغالب ، ونحن

58:28نستخدمه بطرق مختلفة

58:30فقط .

58:31>> نعم ، بالضبط . أعتقد أن

58:33هذا ما سنصل إليه .

58:34سيكون لدينا نماذج

58:35عالمية موحدة ضخمة

58:36تحتوي ربما على رؤوس

58:37إدخال وإخراج مختلفة

58:38تعرف كيفية التعامل مع

58:39أنواع مختلفة من

58:40البيانات . لكن في

58:41النهاية ، كل الحوسبة

58:43والمعلمات لهذا

58:44النموذج ستكون عبارة

58:45عن هيكل مشترك يمثل

58:46هذا النموذج العالمي

58:47الذي يعرف كيف يحاكي

58:48أي شيء ضمنياً في

58:49أوزانه . بعد ذلك ،

58:51يمكنه إظهار هذه

58:52المعرفة بالعالم

58:53كأفعال أو حالات أو

58:54ملاحظات حسب الحاجة

58:56للتطبيق . أعتقد أن

58:57السؤال التالي الذي

58:59أردت طرحه ، وهو بمثابة

59:01سؤال ختامي ، هو : هل

59:02توصلنا البنى الحالية

59:04إلى ذلك ؟ لقد قلت للتو

59:06، كما تعلم ، نوعاً ما

59:09لا . البنية تتطور ،

59:12لكنها متسقة مع

59:13الطريقة التي نفكر بها

59:15في نماذج اليوم مثل

59:17المحولات وغيرها . هل

59:21تتوقع الحاجة إلى قفزة

59:23معمارية كبيرة لتحقيق

59:25إمكانات النماذج

59:26العالمية ؟

59:27>> ربما نعم ، لكن ليس

59:28قفزة كبيرة جداً ، على

Architectures, Loss Functions, and Long Contexts

59:30الأرجح ليست ضخمة .

59:31أعتقد أن المحولات

59:32قوية جداً حقاً .

59:33>> نعم ، أحصل على هذا

59:34السؤال كثيراً : هل

59:35يعني ذلك أن المحولات

59:36قد انتهت ؟ هل نحتاج

59:37إلى بنى جديدة ؟ لا ،

59:38المحولات رائعة .

59:39المحولات فائقة القوة .

59:41إنها تتوسع بشكل جيد

59:42جداً . يمكنها العمل

59:43على جميع أنواع

59:44البيانات المختلفة .

59:45لذا ، المحولات قوية

59:47للغاية . يمكن

59:48استخدامها في جميع

59:49أنواع المشكلات

59:49المختلفة . أعتقد أن

59:51هناك سؤالاً حول دالة

59:52الخسارة المناسبة

59:53لتدريب هذه الأنواع من

59:54النماذج التوليدية ،

59:55وهذا الأمر لا يزال

59:56غير محسوم . هل نريد

59:58تدريب هذه الأشياء

59:59كنموذج توليدي ؟ إذا

1:00:00كان نموذجاً توليدياً

1:00:01، هل تدربه عبر

1:00:02الانتشار أو التدفق

1:00:03المصحح ؟ هل تدربه

1:00:04كنموذج انحدار ذاتي

1:00:06منفصل أم بشيء آخر ؟

1:00:07لذا هناك مسألة تتعلق

1:00:08بدالة الخسارة تنطبق

1:00:10على أي نموذج توليدي ،

1:00:11وأعتقد أنها ستتطور

1:00:12وقد حدث ذلك بالفعل ،

1:00:13فكنا نستخدم شبكات GANs ،

1:00:14والآن نستخدم

1:00:15الانتشار . هذا تغيير

1:00:16في دالة الخسارة أكثر

1:00:18منه تغييراً في البنية

1:00:19. مم ، لكن ، كما تعلم ،

1:00:20هناك مجال آخر أعتقد

1:00:22أننا بحاجة إلى رؤية

1:00:23بعض التطور المعماري

1:00:24فيه ، وهو كيف نتعامل

1:00:25مع سياق طويل جداً

1:00:26جداً وعدد كبير جداً

1:00:28جداً من الرموز (

1:00:29التوكنز ) . حسناً ، هذا

1:00:30أمر يظهر بالفعل في

1:00:31النماذج اللغوية

1:00:32الكبيرة ( LLMs ) ، فهي

1:00:33تعتمد على معمارية

1:00:34المحولات ( Transformers ) .

1:00:35إنها تعمل على الرموز ،

1:00:36لكن يمكنك حل الكثير

1:00:37من المشكلات . ربما

1:00:38يكون هذا أقل صحة الآن

1:00:39في عصر الوكلاء

1:00:40الأذكياء ، لكن قبل بضع

1:00:41سنوات ، كان من الصعب

1:00:43تخيل مواقف تحتاج فيها

1:00:44النماذج اللغوية

1:00:45للعمل على مليون أو 10

1:00:46ملايين رمز ، لأن هذا

1:00:47يعادل كتباً كاملة .

1:00:48نعم ، من حيث المبدأ

1:00:50هناك مشكلات تتطلب حشر

1:00:51كتب كاملة في سياقك ،

1:00:53ولكن ربما يمكنك فعل

1:00:54الكثير باللغة دون

1:00:55الحاجة إلى سياق بهذا

1:00:57الحجم . لكن الآن ، إذا

1:00:58أردنا الحديث عن

1:00:59العوالم ، مثل الحاجة

1:01:01إلى توليد أو نمذجة

1:01:02الكثير من الصور عالية

1:01:04الأبعاد أو الكثير من

1:01:05المساحات ثلاثية

1:01:06الأبعاد ، فمن السهل

1:01:07جداً الوصول لمواقف

1:01:09تحتاج فيها مئات

1:01:10الآلاف أو الملايين أو

1:01:11عشرات الملايين من

1:01:13الرموز كـسياق

1:01:14لمشكلات نمذجة العالم .

1:01:15لذا أعتقد أننا بحاجة

1:01:17إلى رؤية تطور في

1:01:18كيفية تكييف المحولات

1:01:20للعمل بأطوال سياق

1:01:22طويلة جداً ، لأن ما

1:01:23كان يعتبر ميزة إضافية

1:01:25في النماذج اللغوية ،

1:01:27أصبح مشكلة يومية لأي

1:01:29نموذج عالم واسع

1:01:30النطاق . هذا يطرح

1:01:32السؤال : كيف يجب أن

1:01:33نفكر في الرموز

1:01:35والسياقات في نماذج

1:01:36العالم ؟ هل يحد طول

1:01:39السياق من حجم العالم ؟

1:01:41أم أننا نقوم بترحيل

1:01:42أجزاء من العالم بحيث

1:01:44لا يكون قيداً صارماً ؟

1:01:46وهل يتوافق الرمز مع "

1:01:48سبلات " أو هيكل آخر ؟

1:01:50كيف ترتبط هذه الأشياء

1:01:51ببعضها ؟

1:01:52>> أعتقد أن هذا هو

1:01:53المجال الذي تحدث فيه

1:01:54الكثير من الأشياء

1:01:55المختلفة ، وهو المكان

1:01:56الذي أرى فيه الكثير

1:01:57من التطور . ففي بعض

1:01:58المعماريات ، قد يكون

1:02:00الرمز عبارة عن جزء

1:02:02صغير من مقطع فيديو ،

1:02:04ربما 16 في 16 بكسل

1:02:05مكانياً وأربعة

1:02:06إطارات زمنية . لذا ، في

1:02:08بعض المعماريات ،

1:02:09الرمز هو حرفياً رقعة

1:02:11صغيرة من مقطع فيديو .

1:02:12وفي بعض المعماريات

1:02:13الأخرى ، قد يكون ذلك

1:02:14الرمز حزمة صغيرة من "

1:02:16السبلات " في مكان ما من

1:02:17العالم . وفي بعض

1:02:18المعماريات ، قد يكون

1:02:19ذلك الرمز جزءاً

1:02:20صغيراً من مساحة

1:02:21ثلاثية الأبعاد . ربما

1:02:23قمت بتقسيم مساحتي

1:02:24ثلاثية الأبعاد إلى "

1:02:25فوكسلات " ، والآن

1:02:25يتوافق كل رمز مع جزء

1:02:26من تلك المساحة ثلاثية

1:02:28الأبعاد . أم ، أو ربما

1:02:29تكون هذه الرموز شيئاً

1:02:31مجرداً وكامناً ، ربما

1:02:32لدي حالة عالم كامنة

1:02:34هي مجرد رقم ، أو ربما

1:02:35خصصت ألف رمز لحالة

1:02:37عالمي . ماذا تعني ؟ إنه

1:02:38نموذج غامض توصل إلى

1:02:40حل . أعتقد أن هذا هو

1:02:41المجال الذي نرى فيه

1:02:42الكثير من التطور

1:02:43والعديد من الأساليب

1:02:44المختلفة التي تقوم

1:02:44بأشياء متنوعة من

1:02:45الناحية الهيكلية . وفي

1:02:46إطار هذا السياق

Where to Learn More

1:02:48الهيكلي أيضاً ، هل ترى

1:02:49دوراً لهذه الأفكار

1:02:51المتعلقة بالتعلم

1:02:52العميق الهندسي أو

1:02:54النماذج المختلفة

1:02:55التي تدمج التماثل ؟

1:02:57كما تعلم ، كانت هناك

1:02:59مجموعة متنوعة من

1:03:00الأعمال التي تحاول

1:03:02دمج الهندسة في التعلم

1:03:04العميق ، ومن منظور

1:03:06معين على الأقل ، يبدو

1:03:08أنه إذا كنا نتحدث عن

1:03:10المعلومات المكانية ،

1:03:12فقد يكون هناك دور

1:03:13لذلك .

1:03:14>> ربما . لكنني أعتقد أن

1:03:15الدرس الذي تعلمناه

1:03:16مراراً وتكراراً في

1:03:17التعلم العميق هو أنك

1:03:18بحاجة إلى تمثيلات

1:03:19بسيطة ، ثم توسيع نطاق

1:03:21النموذج خلف هذه

1:03:21التمثيلات البسيطة .

1:03:23لذا ، عندما تختار

1:03:24تمثيلاً مناسباً

1:03:25للمهمة المطلوبة ،

1:03:27أليس كذلك ؟ إذا كان ما

1:03:29تريده حقاً هو إطارات

1:03:30فيديو أو صور ، فافعل

1:03:32ذلك مباشرة . لست بحاجة

1:03:33إلى تقييد نفسك عبر

1:03:35تمثيل ثلاثي الأبعاد

1:03:36صريح . إذا كنت تريد

1:03:37تمثيلاً ثلاثي

1:03:38الأبعاد ، سواء كان "

1:03:40سبرات " أو " شبكة " ، ابحث

1:03:41عن طريقة بسيطة لربط

1:03:42هذا التمثيل الهيكلي

1:03:44بالشبكة العصبية .

1:03:45وكلما زدت من

1:03:46التماثلات والتمثيلات

1:03:48المعقدة ، غالباً ما

1:03:49يصبح التحسين أكثر

1:03:50صعوبة ، وتزداد

1:03:52الافتراضات التي

1:03:53تضعها . وبالتالي ، سيقل

1:03:54نجاحها على نطاق واسع ،

1:03:56أليس كذلك ؟ مثلاً ،

1:03:57عندما تضع مفهوماً

1:03:58للتماثل . حسناً ، البشر

1:04:00عادة ما يكونون

1:04:01متماثلين نوعاً ما .

1:04:02لدينا ساقان وذراعان ،

1:04:03لكن ليس الجميع لديهم

1:04:04ساقان وذراعان . لذا

1:04:05فإن هذه الافتراضات

1:04:07الصارمة حول التماثل

1:04:08قد توصلك إلى 80 % أو 90 % من

1:04:10الطريق ، لكنها ستنهار

1:04:11في النهاية . وعندها

1:04:12تود أن تكون في وضع

1:04:14يسمح لهيكلك أو نموذجك

1:04:15بأن يكون معبراً بما

1:04:17يكفي للتعامل مع

1:04:18الحالات التي تنهار

1:04:19فيها هذه الاختصارات .

1:04:21>> إلى أين يجب أن يذهب

1:04:22الناس لتعلم المزيد عن

1:04:24هذا ؟ هل هناك أي موارد

1:04:25أساسية تحب توجيه

1:04:27الأشخاص إليها ممن هم

1:04:28جدد في هذا المجال

1:04:29ويريدون التعمق أكثر ؟

1:04:31>> أجل . يمكنك بالتأكيد

1:04:33تجربة " مارفل " . إنه

1:04:34منتجنا الموجود على

1:04:35الرابط marble.worldlabs.ai .

1:04:36يمكنك التسجيل

1:04:37وتجربته اليوم . أمم ،

1:04:39أتمنى لو كان بإمكاني

1:04:40ترشيح سلسلة محاضرات

1:04:41أو كتاب أفضل أو شيء من

1:04:42هذا القبيل حول

1:04:43النماذج العالمية ،

1:04:44لكنني لا أعتقد أن

1:04:45أحداً قد كتب شيئاً

1:04:47رائعاً للغاية بعد ،

1:04:48وهذا جزء مما حاولنا

1:04:49حله في تدوينتنا .

1:04:50لكنني أعتقد أن بإمكان

1:04:51شخص ما التعمق أكثر

1:04:52وتفكيك الكثير من هذه

1:04:54الأفكار بطريقة أفضل .

1:04:55لذا ، إذا فاتني شيء ما

1:04:57، أود حقاً من

1:04:58المشاهدين أو

1:04:59المستمعين إخباري

1:05:00بذلك . جاستن ، شكراً

1:05:01جزيلاً لك على تخصيص

1:05:03الوقت لمشاركتنا

1:05:04القليل عما كنت تعمل

1:05:05عليه . أنت والفريق في "

1:05:06وورلد لابس " . أشياء

1:05:08رائعة جداً .

1:05:09>> أجل ، شكراً جزيلاً

1:05:10لاستضافتي . لقد كان

1:05:11هذا ممتعاً للغاية .

Recently added transcripts

Browse the whole transcript library

This transcript was generated from the captions YouTube publishes for this video. Get the transcript of any YouTube video atfreeyoutubetranscribe.com, free, unlimited, no sign-up.