Full transcript
Welcome to DEEPLIZARD - Go to deeplizard.com for learning resources
0:00أهلًا بكم جميعًا !
0:02مرحبًا بكم مجددًا في
0:03هذه السلسلة حول
0:04التعلّم المعزز . في
0:06هذا الفيديو ، سنبني
0:07على طريقة تفكيرنا في
0:08المكافآت التراكمية
0:10التي يحصل عليها
0:11العامل في عملية اتخاذ
0:12القرار ماركوف .
0:13ولتحقيق ذلك ، سنقدم
0:15مفهومًا مهمًا وهو
0:17العائد . سنرى أن
0:18العائد هو ما يدفع
0:19العامل تحديدًا
0:21لاتخاذ القرارات التي
0:22يتخذها . فلنبدأ .
Help deeplizard add video timestamps - See example in the description
0:32تذكروا في الفيديو
0:33السابق أننا ذكرنا أن
0:35هدف العامل في عملية
0:36اتخاذ القرار ماركوف
0:37هو تعظيم مكافآته
0:38التراكمية . حسنًا ، نحن
0:40بحاجة إلى طريقة
0:41لتجميع هذه المكافآت
0:43التراكمية وصياغتها
0:44بشكل رسمي . لذلك ، نقدم
0:46مفهوم العائد المتوقع
0:48للمكافآت عند خطوة
0:50زمنية معينة . في الوقت
0:52الحالي ، يمكننا
0:53ببساطة اعتبار العائد
0:54هو مجموع المكافآت
0:56المستقبلية . رياضيًا ،
0:57نُعرّف العائد G عند
0:59الزمن t بأنه مجموع
1:01المكافأة عند الزمن t +
1:031 زائد المكافأة عند
1:05الزمن t + 2 وصولًا إلى
1:06المكافأة عند الزمن t ،
1:08حيث t هو الخطوة
1:10الزمنية الأخيرة .
1:13يُعدّ مفهوم العائد
1:14المتوقع بالغ الأهمية
1:16، إذ يهدف العامل إلى
1:18تعظيم هذا العائد .
1:20وبالتالي ، يُشكّل
1:21العائد المتوقع
1:23أساسًا الدافع وراء
1:24قرارات العامل . في
1:26تعريفنا للعائد
1:27المتوقع ، عرّفنا
1:28الزمن t بأنه الخطوة
1:30الزمنية الأخيرة .
1:31عندما يكون وجود خطوة
1:33زمنية أخيرة منطقيًا ،
1:35ينقسم تفاعل العامل مع
1:36البيئة بشكل طبيعي إلى
1:38تسلسلات فرعية تُسمى
1:40حلقات . على سبيل
1:41المثال ، تخيّل لعب
1:42لعبة بونغ . يُمكن
1:44اعتبار كل جولة جديدة
1:46حلقة ، وتحدث الخطوة
1:47الزمنية الأخيرة لكل
1:49حلقة عندما يُسجّل أحد
1:51اللاعبين نقطة . تنتهي
1:53كل حلقة بحالة نهائية
1:55عند الزمن t ، يليها
1:57إعادة ضبط البيئة إلى
1:58حالة بداية قياسية أو
2:00إلى عينة عشوائية من
2:02توزيع حالات البداية
2:04الممكنة . ثم تبدأ
2:06الحلقة التالية بشكل
2:08مستقل عن كيفية انتهاء
2:10الحلقة السابقة . تُسمى
2:12المهام ذات الحلقات
2:14رسميًا بالمهام
2:15الحلقية . مع ذلك ، توجد
2:17أنواع أخرى من المهام
2:19لا ينقسم فيها تفاعل
2:21العامل مع البيئة بشكل
2:22طبيعي إلى حلقات ، بل
2:24يستمر بلا حدود . تُسمى
2:25هذه الأنواع من المهام
2:27بالمهام المستمرة . هل
2:28يمكنك ذكر أمثلة على
2:30المهام المستمرة ؟
2:31أخبرني برأيك في
2:32التعليقات . تُشكّل
2:34المهام المتواصلة
2:35مشكلةً في تعريفنا
2:36للعائد في كل لحظة
2:38زمنية t ، لأنّ خطوتنا
2:39الزمنية الأخيرة t
2:40ستكون مساويةً لما لا
2:42نهاية ، وبالتالي قد
2:43يكون العائد نفسه
2:44لانهائيًا . لهذا السبب
2:46، نحتاج إلى تحسين
2:48طريقة تعاملنا مع
2:49العائد . سيستفيد
2:50تعديلنا لطريقة
2:52تفكيرنا في العائد من
2:53الخصم . فبدلًا من أن
2:55يكون هدف الوكيل هو
2:57تعظيم العائد المتوقع
2:58للمكافآت ، سيكون هدفه
3:00هو تعظيم العائد
3:02المتوقع المخصوم
3:03للمكافآت . تحديدًا ،
3:05سيختار الوكيل إجراءً
3:07في كل خطوة زمنية
3:08لتعظيم العائد
3:10المتوقع المخصوم .
3:12لتعريف العائد
3:13المخصوم ، نُعرّف
3:15أولًا معدل الخصم γ
3:17كرقم بين 0 و 1 . سيكون
3:19معدل الخصم هو المعدل
3:21الذي نخصم به المكافآت
3:22المستقبلية ، وسيُحدد
3:24القيمة الحالية لهذه
3:25المكافآت . بناءً على
3:27ذلك ، نُعرّف العائد
3:29المخصوم g < sub > subt < / sub >
3:30بأنه مجموع المكافآت
3:32المخصومة في كل خطوة
3:33زمنية . إذا سبق لك
3:35دراسة دورة في التمويل
3:36أو تعلمت عن القيمة
3:37الزمنية للنقود ، فقد
3:39تكون هذه الفكرة
3:40مألوفةً لديك . يُشير
3:41هذا التعريف للعائد
3:42المُخصوم إلى أن
3:44الوكيل سيهتم
3:44بالمكافأة الفورية
3:46أكثر من المكافآت
3:47المستقبلية ، نظرًا
3:48لأن المكافآت
3:49المستقبلية ستكون
3:50مُخصومة بشكل أكبر .
3:52لذا ، فبينما يأخذ
3:53الوكيل في الاعتبار
3:54المكافآت التي يتوقع
3:56الحصول عليها في
3:57المستقبل ، إلا أن
3:58المكافآت الفورية لها
3:59تأثير أكبر عند اتخاذ
4:01قرار بشأن القيام بفعل
4:02مُعين . الآن ، انظر إلى
4:04هذه العلاقة التي
4:05تُوضح كيفية ارتباط
4:06العوائد في الخطوات
4:08الزمنية المُتتالية
4:09ببعضها البعض . سنستخدم
4:10هذه العلاقة لاحقًا ،
4:12ولكن بشكل عام ،
4:13يُمكننا أن نرى أن
4:14العائد في الوقت t
4:16يساوي المكافأة في
4:17الوقت t + 1 زائد العائد
4:19المُخصوم في الوقت t + 1.
4:20في المدونة المُصاحبة
4:22لهذا الفيديو ، نتوسع
4:23قليلًا في شرح العائد
4:25المُخصوم لمناقشة كيف
4:27أنه على الرغم من أن
4:28العائد في الوقت t هو
4:30مجموع عدد لا نهائي من
4:31الحدود ، إلا أن العائد
4:33نفسه محدود في الواقع .
4:35لذا ، إذا كنت مهتمًا
4:36بمعرفة هذه التفاصيل ،
4:38فتأكد من قراءتها هناك
4:39. وبينما أنت هنا ، ألقِ
4:41نظرة أيضًا على منجم
4:42خلية العاصفة الثلجية
4:43العميقة لمعرفة أنواع
4:44المزايا والمكافآت
4:45المتاحة للانضمام .
4:46حسنًا ، يفترض أننا
4:47الآن قد فهمنا جيدًا
4:49مفهوم العائد المخفّض .
4:50الفكرة الأساسية هنا
4:52هي أن هدف الوكيل هو
4:53تعظيم العائد المخفّض
4:55المتوقع للمكافآت . مع
4:57أن الوكيل يأخذ في
4:58الاعتبار جميع
4:59المكافآت المستقبلية
5:01المتوقعة عند اختيار
5:02إجراء ما ، إلا أن
5:03المكافآت الفورية
5:04تؤثر عليه أكثر من
5:06المكافآت التي يُتوقع
5:07الحصول عليها لاحقًا
5:09بسبب عامل الخصم . في
5:10المرة القادمة ، سنبني
5:11على الأفكار التي
5:13طرحناها في مقدمتنا
5:14حول عمليات ماركوف
5:15القرار والعائد
5:16المخفّض لنرى كيف
5:17يمكننا قياس مدى جودة
5:19أي حالة معينة أو أي
5:20إجراء معين بالنسبة
5:21للوكيل . شكرًا
5:22لمساهمتكم في الذكاء
5:23الجماعي ، وأراكم في
5:24المرة القادمة .
5:25عرض توضيحي مباشر .
5:26عرض توضيحي مباشر .
5:28هيا بنا . هذا عرض
5:29توضيحي مباشر . لست
5:31متأكدًا تمامًا من
5:32أننا سنفوز ، لكن سنرى .
5:33إذًا ، اللون البني على
5:34هذا الجانب هو الدواسة
5:35التي يتحكم بها
5:36الكمبيوتر . خوارزمية
5:37بسيطة للغاية . إنها
5:39تبقى أمام الكرة طوال
5:40الوقت . على اليمين
5:41باللون الأخضر ، لدينا
5:43وكيلنا الذي يتحكم به
5:44شبكة عصبية ، وهو متأخر
5:45قليلاً الآن . سنرى إن
5:47كان سيفوز . الذكاء
5:48الاصطناعي يفوز .
5:49الذكاء الاصطناعي
5:50يفوز . أنا سعيد لأن هذا
5:51عرض تجريبي مباشر . لا
5:52يوجد ضمان بأن الذكاء
5:53الاصطناعي سيفوز
5:54فعلاً . إنه يتعلم من
5:55البكسلات فقط . في
5:56البداية ، لم يكن لدى
5:57الذكاء الاصطناعي أي
5:58فكرة عن اللعبة التي
5:59يلعبها ، أو قواعدها .
6:01لم يكن لديه حتى فكرة
6:02عن المضرب الذي
6:03يستخدمه . حسناً ؟ ولم
6:04نكن بحاجة لشرح ذلك .
6:06نحن فقط نعطي البكسلات
6:07، وعند تسجيل النقاط
6:08نحصل على مكافأة ، إما
6:10إيجابية أو سلبية ،
6:11وهذا كل شيء . من ذلك
6:12يتعلم ، وترى تلك
6:13الاستراتيجيات
6:14الناشئة ، مثل ما قلته ،
6:15ضرب الكرة على الجانب
6:17وإرسالها بزاوية حادة
Collective Intelligence and the DEEPLIZARD HIVEMIND
6:18للغاية هو الطريقة
6:19الوحيدة للفوز ، وقد
6:20التقطها . لم نشرح ذلك
6:22أبداً . إنها مجرد
6:23استراتيجية ناشئة .