Free YouTube Transcribe

Video transcript

Expected Return - What Drives a Reinforcement Learning Agent in an MDP

deeplizard · 981 words · 5 min read

Want to search this transcript, jump the video from any line, or download it as TXT, SRT, or VTT?

Open in the transcript tool

Full transcript

Welcome to DEEPLIZARD - Go to deeplizard.com for learning resources

0:00أهلًا بكم جميعًا !

0:02مرحبًا بكم مجددًا في

0:03هذه السلسلة حول

0:04التعلّم المعزز . في

0:06هذا الفيديو ، سنبني

0:07على طريقة تفكيرنا في

0:08المكافآت التراكمية

0:10التي يحصل عليها

0:11العامل في عملية اتخاذ

0:12القرار ماركوف .

0:13ولتحقيق ذلك ، سنقدم

0:15مفهومًا مهمًا وهو

0:17العائد . سنرى أن

0:18العائد هو ما يدفع

0:19العامل تحديدًا

0:21لاتخاذ القرارات التي

0:22يتخذها . فلنبدأ .

Help deeplizard add video timestamps - See example in the description

0:32تذكروا في الفيديو

0:33السابق أننا ذكرنا أن

0:35هدف العامل في عملية

0:36اتخاذ القرار ماركوف

0:37هو تعظيم مكافآته

0:38التراكمية . حسنًا ، نحن

0:40بحاجة إلى طريقة

0:41لتجميع هذه المكافآت

0:43التراكمية وصياغتها

0:44بشكل رسمي . لذلك ، نقدم

0:46مفهوم العائد المتوقع

0:48للمكافآت عند خطوة

0:50زمنية معينة . في الوقت

0:52الحالي ، يمكننا

0:53ببساطة اعتبار العائد

0:54هو مجموع المكافآت

0:56المستقبلية . رياضيًا ،

0:57نُعرّف العائد G عند

0:59الزمن t بأنه مجموع

1:01المكافأة عند الزمن t +

1:031 زائد المكافأة عند

1:05الزمن t + 2 وصولًا إلى

1:06المكافأة عند الزمن t ،

1:08حيث t هو الخطوة

1:10الزمنية الأخيرة .

1:13يُعدّ مفهوم العائد

1:14المتوقع بالغ الأهمية

1:16، إذ يهدف العامل إلى

1:18تعظيم هذا العائد .

1:20وبالتالي ، يُشكّل

1:21العائد المتوقع

1:23أساسًا الدافع وراء

1:24قرارات العامل . في

1:26تعريفنا للعائد

1:27المتوقع ، عرّفنا

1:28الزمن t بأنه الخطوة

1:30الزمنية الأخيرة .

1:31عندما يكون وجود خطوة

1:33زمنية أخيرة منطقيًا ،

1:35ينقسم تفاعل العامل مع

1:36البيئة بشكل طبيعي إلى

1:38تسلسلات فرعية تُسمى

1:40حلقات . على سبيل

1:41المثال ، تخيّل لعب

1:42لعبة بونغ . يُمكن

1:44اعتبار كل جولة جديدة

1:46حلقة ، وتحدث الخطوة

1:47الزمنية الأخيرة لكل

1:49حلقة عندما يُسجّل أحد

1:51اللاعبين نقطة . تنتهي

1:53كل حلقة بحالة نهائية

1:55عند الزمن t ، يليها

1:57إعادة ضبط البيئة إلى

1:58حالة بداية قياسية أو

2:00إلى عينة عشوائية من

2:02توزيع حالات البداية

2:04الممكنة . ثم تبدأ

2:06الحلقة التالية بشكل

2:08مستقل عن كيفية انتهاء

2:10الحلقة السابقة . تُسمى

2:12المهام ذات الحلقات

2:14رسميًا بالمهام

2:15الحلقية . مع ذلك ، توجد

2:17أنواع أخرى من المهام

2:19لا ينقسم فيها تفاعل

2:21العامل مع البيئة بشكل

2:22طبيعي إلى حلقات ، بل

2:24يستمر بلا حدود . تُسمى

2:25هذه الأنواع من المهام

2:27بالمهام المستمرة . هل

2:28يمكنك ذكر أمثلة على

2:30المهام المستمرة ؟

2:31أخبرني برأيك في

2:32التعليقات . تُشكّل

2:34المهام المتواصلة

2:35مشكلةً في تعريفنا

2:36للعائد في كل لحظة

2:38زمنية t ، لأنّ خطوتنا

2:39الزمنية الأخيرة t

2:40ستكون مساويةً لما لا

2:42نهاية ، وبالتالي قد

2:43يكون العائد نفسه

2:44لانهائيًا . لهذا السبب

2:46، نحتاج إلى تحسين

2:48طريقة تعاملنا مع

2:49العائد . سيستفيد

2:50تعديلنا لطريقة

2:52تفكيرنا في العائد من

2:53الخصم . فبدلًا من أن

2:55يكون هدف الوكيل هو

2:57تعظيم العائد المتوقع

2:58للمكافآت ، سيكون هدفه

3:00هو تعظيم العائد

3:02المتوقع المخصوم

3:03للمكافآت . تحديدًا ،

3:05سيختار الوكيل إجراءً

3:07في كل خطوة زمنية

3:08لتعظيم العائد

3:10المتوقع المخصوم .

3:12لتعريف العائد

3:13المخصوم ، نُعرّف

3:15أولًا معدل الخصم γ

3:17كرقم بين 0 و 1 . سيكون

3:19معدل الخصم هو المعدل

3:21الذي نخصم به المكافآت

3:22المستقبلية ، وسيُحدد

3:24القيمة الحالية لهذه

3:25المكافآت . بناءً على

3:27ذلك ، نُعرّف العائد

3:29المخصوم g < sub > subt < / sub >

3:30بأنه مجموع المكافآت

3:32المخصومة في كل خطوة

3:33زمنية . إذا سبق لك

3:35دراسة دورة في التمويل

3:36أو تعلمت عن القيمة

3:37الزمنية للنقود ، فقد

3:39تكون هذه الفكرة

3:40مألوفةً لديك . يُشير

3:41هذا التعريف للعائد

3:42المُخصوم إلى أن

3:44الوكيل سيهتم

3:44بالمكافأة الفورية

3:46أكثر من المكافآت

3:47المستقبلية ، نظرًا

3:48لأن المكافآت

3:49المستقبلية ستكون

3:50مُخصومة بشكل أكبر .

3:52لذا ، فبينما يأخذ

3:53الوكيل في الاعتبار

3:54المكافآت التي يتوقع

3:56الحصول عليها في

3:57المستقبل ، إلا أن

3:58المكافآت الفورية لها

3:59تأثير أكبر عند اتخاذ

4:01قرار بشأن القيام بفعل

4:02مُعين . الآن ، انظر إلى

4:04هذه العلاقة التي

4:05تُوضح كيفية ارتباط

4:06العوائد في الخطوات

4:08الزمنية المُتتالية

4:09ببعضها البعض . سنستخدم

4:10هذه العلاقة لاحقًا ،

4:12ولكن بشكل عام ،

4:13يُمكننا أن نرى أن

4:14العائد في الوقت t

4:16يساوي المكافأة في

4:17الوقت t + 1 زائد العائد

4:19المُخصوم في الوقت t + 1.

4:20في المدونة المُصاحبة

4:22لهذا الفيديو ، نتوسع

4:23قليلًا في شرح العائد

4:25المُخصوم لمناقشة كيف

4:27أنه على الرغم من أن

4:28العائد في الوقت t هو

4:30مجموع عدد لا نهائي من

4:31الحدود ، إلا أن العائد

4:33نفسه محدود في الواقع .

4:35لذا ، إذا كنت مهتمًا

4:36بمعرفة هذه التفاصيل ،

4:38فتأكد من قراءتها هناك

4:39. وبينما أنت هنا ، ألقِ

4:41نظرة أيضًا على منجم

4:42خلية العاصفة الثلجية

4:43العميقة لمعرفة أنواع

4:44المزايا والمكافآت

4:45المتاحة للانضمام .

4:46حسنًا ، يفترض أننا

4:47الآن قد فهمنا جيدًا

4:49مفهوم العائد المخفّض .

4:50الفكرة الأساسية هنا

4:52هي أن هدف الوكيل هو

4:53تعظيم العائد المخفّض

4:55المتوقع للمكافآت . مع

4:57أن الوكيل يأخذ في

4:58الاعتبار جميع

4:59المكافآت المستقبلية

5:01المتوقعة عند اختيار

5:02إجراء ما ، إلا أن

5:03المكافآت الفورية

5:04تؤثر عليه أكثر من

5:06المكافآت التي يُتوقع

5:07الحصول عليها لاحقًا

5:09بسبب عامل الخصم . في

5:10المرة القادمة ، سنبني

5:11على الأفكار التي

5:13طرحناها في مقدمتنا

5:14حول عمليات ماركوف

5:15القرار والعائد

5:16المخفّض لنرى كيف

5:17يمكننا قياس مدى جودة

5:19أي حالة معينة أو أي

5:20إجراء معين بالنسبة

5:21للوكيل . شكرًا

5:22لمساهمتكم في الذكاء

5:23الجماعي ، وأراكم في

5:24المرة القادمة .

5:25عرض توضيحي مباشر .

5:26عرض توضيحي مباشر .

5:28هيا بنا . هذا عرض

5:29توضيحي مباشر . لست

5:31متأكدًا تمامًا من

5:32أننا سنفوز ، لكن سنرى .

5:33إذًا ، اللون البني على

5:34هذا الجانب هو الدواسة

5:35التي يتحكم بها

5:36الكمبيوتر . خوارزمية

5:37بسيطة للغاية . إنها

5:39تبقى أمام الكرة طوال

5:40الوقت . على اليمين

5:41باللون الأخضر ، لدينا

5:43وكيلنا الذي يتحكم به

5:44شبكة عصبية ، وهو متأخر

5:45قليلاً الآن . سنرى إن

5:47كان سيفوز . الذكاء

5:48الاصطناعي يفوز .

5:49الذكاء الاصطناعي

5:50يفوز . أنا سعيد لأن هذا

5:51عرض تجريبي مباشر . لا

5:52يوجد ضمان بأن الذكاء

5:53الاصطناعي سيفوز

5:54فعلاً . إنه يتعلم من

5:55البكسلات فقط . في

5:56البداية ، لم يكن لدى

5:57الذكاء الاصطناعي أي

5:58فكرة عن اللعبة التي

5:59يلعبها ، أو قواعدها .

6:01لم يكن لديه حتى فكرة

6:02عن المضرب الذي

6:03يستخدمه . حسناً ؟ ولم

6:04نكن بحاجة لشرح ذلك .

6:06نحن فقط نعطي البكسلات

6:07، وعند تسجيل النقاط

6:08نحصل على مكافأة ، إما

6:10إيجابية أو سلبية ،

6:11وهذا كل شيء . من ذلك

6:12يتعلم ، وترى تلك

6:13الاستراتيجيات

6:14الناشئة ، مثل ما قلته ،

6:15ضرب الكرة على الجانب

6:17وإرسالها بزاوية حادة

Collective Intelligence and the DEEPLIZARD HIVEMIND

6:18للغاية هو الطريقة

6:19الوحيدة للفوز ، وقد

6:20التقطها . لم نشرح ذلك

6:22أبداً . إنها مجرد

6:23استراتيجية ناشئة .

Recently added transcripts

Browse the whole transcript library

This transcript was generated from the captions YouTube publishes for this video. Get the transcript of any YouTube video atfreeyoutubetranscribe.com, free, unlimited, no sign-up.