Free YouTube Transcribe

Video transcript

Beyond Benchmarks - Lessons from Building AI Evals in the Real World

Elicit · 6,345 words · 29 min read

Want to search this transcript, jump the video from any line, or download it as TXT, SRT, or VTT?

Open in the transcript tool

Full transcript

0:00أهلًا بكم جميعًا في

0:01ندوتنا الإلكترونية

0:02اليوم حول بناء

0:03تقييمات الذكاء

0:04الاصطناعي في العالم

0:05الحقيقي . اسمي شينا

0:06بالاباكا ، وأنا عضوة

0:08في فريق التسويق في

0:09شركة إليسيت ، وينضم

0:10إليّ اليوم اثنان من

0:12أعضاء فريق التقييم ،

0:13وهما بن وبراديو .

0:14سأمنحهما فرصة لتقديم

0:16نفسيهما ، ولكن لمن لا

0:18يعرف إليسيت أو من نحن

0:19، فهي منصة ذكاء

0:21اصطناعي مُصممة

0:22خصيصًا لتجميع الأدلة

0:24بدقة . هدفنا كشركة هو

0:25تمكين التجميع الدقيق

0:27واتخاذ القرارات

0:28المعقدة في العالم .

0:30لذا ، أنا متحمسة جدًا

0:31لانضمامكم إلينا

0:33اليوم . الآن ، سأترك

0:34المجال لبن وبراديو

0:36لتقديم أنفسهما

0:37بإيجاز .

0:38>> رائع . شكرًا لكِ يا

0:40شينا . أجل ، أنا بن .

0:42أقود فريق التقييمات

0:43في إليسيت ، وأعمل في

0:45هذا المجال منذ ثلاث

0:46أو أربع سنوات . تفضل يا

0:48براديو .

0:49>> أهلًا بكم جميعًا ، أنا

0:50براديو . أعمل في شركة

0:52Elicit منذ أغسطس الماضي ،

0:53وأعمل على تقييمات

0:55منتج مراجعة الأدبيات

0:56لدينا .

0:57>> رائع ! حسنًا ، لدينا

0:58اليوم ندوة عبر

0:59الإنترنت من Genpact .

1:01هدفنا هنا هو أن تكون

1:02هذه الندوة تفاعلية

1:03قدر الإمكان . سنتحدث

1:04عن بعض النقاط التي

1:05أعددناها ، ولكن إذا

1:07كانت لديكم أي أسئلة ،

1:08فلا تترددوا في طرحها

1:09في الدردشة على الجانب

1:10الأيمن . سنخصص بعض

1:11الوقت في النهاية

1:12للإجابة على بعض

1:14أسئلتكم . لا تترددوا ،

1:15فليس هناك سؤال سيئ ،

1:16لذا تفضلوا باستخدام

1:18الدردشة وقتما تشاؤون .

1:19رائع ! لنبدأ . ربما فقط

1:21لتوضيح السياق ، نسمع

1:23كلمة " تقييم " تُستخدم

1:24كثيرًا ، خاصة مع

1:25ازدياد استخدام

1:26الذكاء الاصطناعي ،

1:28ولكن كنت أتساءل ، يا

1:29بن ، هل يمكنك شرح ما هي

1:30التقييمات ؟

1:31>> حسنًا ، أستخدم مصطلح "

1:33elicit " للإشارة إلى

1:35محاولتنا معرفة مدى

1:37جودة نموذج أو نظام

1:39ذكاء اصطناعي لمهمة

1:40معينة . وقد يكون ذلك

1:42مجرد كتابة شيء ما في

1:44أداة ذكاء اصطناعي

1:45والاطلاع على الإجابة

1:47، أو قد يصل الأمر إلى

1:48إجراء نوع من التقييم

1:50الآلي المعقد والقابل

1:51لإعادة التشغيل

1:53باستخدام الذكاء

1:54الاصطناعي لتقييم

1:55المخرجات .

1:58>> رائع ! هل لديك أي إضافة

2:00يا براديب ، أم أنه قد

2:01أوضح ذلك جيدًا ؟

2:02>> أعتقد أن بن قد فهم ذلك

2:04.

2:04>> أحسنت يا بن . رائع !

2:06حسنًا ، بالنظر إلى

2:07رسائل البريد

2:08الإلكتروني في سياق

2:09تطوير الذكاء

2:10الاصطناعي ، ومع

2:11استمرار تحسن نماذج

2:12البنية التحتية

2:13باستمرار ، كيف تعتقد

2:14أن الفرق التي تعمل

2:15على رسائل البريد

2:16الإلكتروني اليوم

2:17يمكنها تحقيق أفضل

2:18أداء ممكن في المهمة

2:19الأكثر أهمية بالنسبة

2:21لها ؟ هل ينبغي عليهم

2:22استخدام نموذج أفضل ؟

2:23هل ينبغي عليهم

2:24استخدام بنية تحتية

2:25أفضل ؟ وهل يمكنك وصف

2:26ما هي البنية التحتية ؟

2:27أم أن هناك أي شيء آخر

2:29ينبغي عليهم مراعاته ؟

2:30>> نعم ، البنية التحتية

2:32هي في الأساس الهيكل

2:33المحيط بالنموذج . إنها

2:35جميع التعليمات التي

2:36تُعطى للنماذج ، وجميع

2:37الأدوات التي تُعطى

2:39للنموذج . إنها كل شيء

2:40يحيط بالنموذج . وبشكل

2:42عام ، لاحظنا في هذا

2:43المجال أن النماذج

2:45تتحسن باستمرار ، بل

2:46وتتطور بسرعة كبيرة .

2:48لذا ، ينبغي أن يكون

2:50هذا هو توقعك الأساسي

2:51بأن هذه النماذج تتحسن

2:53. وإلى حد ما ، يمكن

2:54للأدوات الأفضل أن

2:56تُحسّن أداء النماذج .

2:58فمن الممكن تزويد

2:59النموذج بأدوات لأمور

3:01يستطيع القيام بها

3:02وأخرى لا يستطيع . ومن

3:04الممكن توجيهه بطرق

3:08تُحسّن أداءه ، وهكذا .

3:10ولكن مع مرور الوقت

3:12وتحسن النماذج ، يصبح

3:14أداء النموذج أهم

3:16بكثير من الأدوات التي

3:18تُزوّده بها . لذا ، فإن

3:20الأهم من مجرد أداء

3:21النموذج هو قدرتك على

3:23معرفة ما تريده من

3:25النماذج ، وقياس ذلك ،

3:27وتوجيه أدائها نحو

3:29النتائج المرجوة . وهنا

3:31تكمن أهمية التقييمات

3:33، لأن الخطوة الأولى

3:35لتحسين أداء النماذج

3:37هي قياسه . ولقياس أداء

3:39النموذج ، عليك أن تعرف

3:42النتيجة المرجوة منه

3:43بدقة . لذا ، أعتقد أن

3:46خطوتك الأولى لحل

3:47مشكلتك هي معرفة ما

3:49تريده ، وقياسه ، ثم

3:51النظر في كيفية توظيف

3:52الأدوات لتسخير

3:54النموذج ، مما يُحفز

3:56استخدام جميع

3:57التقنيات الأخرى هنا .

4:00>> ممتاز . هذا مفيد

4:02للغاية . إذا فكرت في

4:03الأمر عمليًا ، هل هناك

4:05حالات يكون فيها فريق

4:06ما واثقًا من نظام

4:07الذكاء الاصطناعي

4:08أكثر مما ينبغي ؟ كأن

4:09يكون لديه ثقة زائفة .

4:11وإذا كان الأمر كذلك ،

4:12فلماذا تعتقد أن هذا

4:13قد يكون ؟ ربما سأُحيل

4:14الأمر إلى بن .

4:15>> أجل . أعتقد أنني رأيت

4:17هذا ، وأعتقد أن أحد

4:19الأسباب الرئيسية هو

4:20أن شركات الذكاء

4:21الاصطناعي ، عندما

4:23تُدرّب هذه النماذج ،

4:24تُحاول جعل الإجابات

4:26تبدو جيدة قدر الإمكان

4:28للمستخدم . وهي تفعل

4:29ذلك بناءً على ملاحظات

4:30المُعلّقين الذين

4:32يُراجعون إجاباتهم ،

4:33والذين ربما لا

4:34يُدقّقون في الإجابة

4:35بعمق كامل . إنهم

4:36يُعطونها فقط إشارة

4:38سريعة بالموافقة أو

4:39الرفض . لذلك أعتقد أنه

4:40من السهل الحصول على

4:41إجابات تبدو جيدة جدًا

4:43ولكنها ليست كذلك ، بل

4:44بها نقاط ضعف . على سبيل

4:45المثال ، سأتزوج بعد

4:47أسبوعين ، وكنت أستخدم

4:48برنامج Claude مؤخرًا

4:49لكتابة بعض عهود

4:50الزواج . كنت أستخدمه

4:51مع خطيبي ، وفي البداية

4:53أعجبنا كثيرًا ، وقلنا :

4:54" لنقل هذا بالضبط في

4:55حفل زفافنا " . ثم دققنا

4:56النظر ، وقلنا : " لحظة !

4:58النصّان الثاني

4:59والثالث هما نفس الشيء

5:00ولكن بصياغة مختلفة " .

5:02وهكذا . أعتقد ،

5:03وبالتأكيد مررت بهذه

5:04التجربة مع ميزة "

5:05العمق " في برنامج Word

5:06أيضًا . من

5:07>> المضحك أن برنامج Claude

5:09أو Copilot يجبرك على

5:10الالتزام بأشياء

5:11يريدها منك . هذا مثال

5:13رائع . ولننتقل إلى

5:15أمثلة واقعية ، عندما

5:16نفكر في قياس الأداء ،

5:18غالبًا ما تبدأ الفرق

5:19بقياس الأداء ثم تفترض

5:21أنها انتهت بمجرد

5:22الانتهاء من ذلك .

5:23برأيك ، ما الذي تعلمته

5:25عن الفجوة بين قياس

5:26الأداء بهذه الطريقة

5:27والأداء الفعلي ؟ أين

5:29تكمن الفجوات

5:30والمفاضلات ؟ بارت ،

5:31ربما يمكنك مناقشة هذا

5:32الأمر .

5:33>> أجل ، أعتقد أنه عند

5:34التفكير في الأمر ، فإن

5:36الخطوة الأولى هي

5:37إنشاء معيار مرجعي .

5:38ويتكون هذا المعيار من

5:39جزأين : الأول هو تحديد

5:41الأسئلة التي تطرحها

5:42على أنظمة الذكاء

5:43الاصطناعي ، والثاني

5:44هو التأكد من امتلاكك

5:46للإجابات الصحيحة

5:47للتحقق منها . وكلا

5:48هذين الأمرين قد يؤدي

5:50إلى خطأ المعيار

5:51المرجعي . ومن الأخطاء

5:55الشائعة أن تكون

5:56الأسئلة المطروحة في

5:58المعيار المرجعي غير

5:59مرتبطة أو غير مطابقة

6:01لتلك التي يتوقع

6:02المستخدمون استخدامها

6:04في بيئة الإنتاج . فإذا

6:06كان المستخدمون

6:07يسألون عن مواضيع

6:08معقدة ، بينما أسئلة

6:10المعيار المرجعي

6:11بسيطة للغاية ، فهذا

6:13مؤشر على أن المعيار

6:14لا يؤدي الغرض المطلوب

6:16منه . وهذا ما يُسمى

6:17بالصلاحية الخارجية .

6:19هل معيارك صالح

6:20للاستخدام في العالم

6:21الخارجي ؟ بعد ذلك ، حتى

6:23لو كانت أسئلتك صحيحة ،

6:25عليك التأكد من اختبار

6:27ما تريد اختباره فعلاً

6:29. لنفترض أنك تطلب من

6:30النموذج أو نظام

6:31الذكاء الاصطناعي

6:32البحث عن بعض الأبحاث .

6:34لكن في الواقع ، إذا

6:35كان الذكاء الاصطناعي

6:36يعرف جميع المعلومات

6:37بنفسه ولم يبحث فعليًا

6:38في تلك الأوراق ، فأنت

6:39تختبر فقط قدرته على

6:40استرجاع معلوماته

6:41السابقة وليس قدرته

6:42على البحث . وهذا ما

6:44يُسمى بصحة البناء . هل

6:46يقيس مقياسك الشيء

6:47الذي تريد اختباره

6:49فعلاً أم تختبر شيئًا

6:50آخر ؟ وهاتان طريقتان

6:52شائعتان للخطأ . من

6:53الواضح أن قياس الأداء

6:55ليس علمًا دقيقًا .

6:59أفضّل تسميته حرفة

7:00أكثر من كونه علمًا ،

7:02لكن هاتين الطريقتان

7:03الأكثر شيوعًا للخطأ .

7:05نعم ،

7:06>> أتفق تمامًا ، إنه إطار

7:08عمل عام ، وأعتقد أن

7:09الصلاحية الخارجية

7:10وصحة البناء أداتان

7:11مفاهيميتان مفيدتان

7:13للغاية . ولنأخذ مثالًا

7:14واحدًا على نوع الخطأ

7:16الذي قد يحدث هنا .

7:18أعتقد أن شركات الذكاء

7:19الاصطناعي تركز نوعًا

7:21ما على معايير بسيطة ،

7:22مثل الإجابة على

7:23الأسئلة البسيطة أو حل

7:25المهام التي يمكن

7:26التحقق من مخرجاتها

7:28بطريقة بسيطة ، مثل

7:29أنواع معينة من مهام

7:30البرمجة ، على سبيل

7:31المثال . لكن المهام

7:33الحقيقية التي تؤديها

7:34في وظيفتك على الأرجح

7:35أكثر تعقيدًا من ذلك ،

7:37وكذلك الطرق التي ترغب

7:38في استخدام الذكاء

7:39الاصطناعي فيها . وإذا

7:40ركزت على تلك المهام

7:42المعيارية ، فقد

7:43تُعطيك انطباعًا

7:44خاطئًا عن مدى فائدة

7:46الذكاء الاصطناعي لما

7:47تحاول القيام به .

7:49وأعتقد أن هذا يتفاقم

7:50أيضًا لسهولة تدريب

7:51الذكاء الاصطناعي على

7:53هذه المهام البسيطة

7:54لأن التغذية الراجعة

7:55للتدريب تكون أكثر

7:56مباشرة . لذا ، من

7:57الممكن أن تنغمس في

7:59عالم المهام

7:59المعيارية دون أن

8:01تتعرف على مدى فعالية

8:02الذكاء الاصطناعي في

8:04وظيفتك الحقيقية .

8:06>> حسنًا ، في هذا السياق ،

8:08إذا كنت تُقدم نصيحة

8:10لفريق يُنشئ أول

8:11مجموعة تقييم له ، كيف

8:13ستساعدهم على التفكير

8:15في اختيار أمثلة

8:16وحالات اختبار

8:17تمثيلية لبناء تلك

8:19المجموعة بشكل صحيح ؟

8:22>> سأبدأ بتكرار ما قاله

8:24برادي سابقًا ، وهو أن

8:26أول شيء هو تحديد

8:27كيفية استخدام الذكاء

8:29الاصطناعي في وظيفتك .

8:31لذا ، أعتقد أن الطريقة

8:33المثلى للقيام بذلك ،

8:34سواء كنت تُطوّر أو

8:35تُقيّم أداةً ما لنفسك

8:37أو لزملائك في العمل

8:38كمستخدم نهائي ، هي

8:39البدء باستخدام أداة

8:40الذكاء الاصطناعي

8:42بشكل يومي والتفكير

8:43باستمرار : " أثناء عملي

8:44على هذه المهمة ، هل

8:45يُمكنني الاعتماد على

8:47الذكاء الاصطناعي

8:48لإنجازها ؟ " وتجربة

8:49أكبر عدد ممكن من

8:51الأشياء . كنقطة انطلاق

8:54، ستحصل على مجموعة من

8:56الأمثلة التي يُمكنك

8:57استخدامها لاختبار

8:58أدوات مختلفة . أعتقد

9:00أن الأمر أصعب إذا كنت

9:02في وضعنا ، أو ربما

9:03وضعك أنت إذا كنت تعمل

9:05في مجال المشتريات أو

9:07ما شابه في مؤسستك ،

9:08حيث لا تُطوّر أداةً

9:10لنفسك ، بل تُطوّرها

9:12لعميل داخلي أو خارجي .

9:14في هذه الحالة ، أعتقد

9:15أنه عليك التحدث معهم

9:17كثيرًا ، ومحاولة

9:18إقناعهم باستخدامها

9:19بشكل يومي ، والاطلاع

9:21على الأمثلة العملية .

9:23>> نعم ، لذا ، من المهم

9:25التركيز على

9:26الاستخدام الواقعي

9:27لبناء حالات الاختبار .

9:29أعتقد أننا في إليسا

9:30نتعامل في كثير من

9:32أعمالنا مع مؤسسات

9:33بالغة التعقيد تستخدم

9:35إليسا لاتخاذ قرارات

9:37بالغة الأهمية ، وإن لم

9:38تكن بسيطة . ومن

9:40التحديات التي

9:41نواجهها أن أساليب

9:42العمل المتبعة لا تضمن

9:44بالضرورة الإجابة

9:46الصحيحة ، فالأمر معقد

9:47للغاية . فكيف نقيّم

9:50النتائج عندما تكون

9:52جودتها أو مخرجاتها

9:54ذاتية أو متعددة

9:55الأبعاد ؟

9:58>> نعم ، أعتقد أن هذا

10:00سؤال صعب . أحد الحلول ،

10:02وإن كان بسيطًا ، هو

10:03اختيار إجابتين

10:05محتملتين ثم القول إن (

10:07أ ) أفضل من ( ب ) أو العكس

10:09، ونلجأ أحيانًا إلى

10:11هذا الحل عندما يكون

10:12لدينا قرار واضح بعد

10:14حصر الخيارات في اثنين

10:16. وهذا أبسط مثال . لكن

10:19معظم الحالات التي

10:20نواجهها ليست كذلك ،

10:22وقد تتضمن أسئلة أكثر

10:23تعقيدًا . ومن الحلول

10:25الممكنة وضع معايير

10:26تقييم . إذا كنت خبيرًا

10:28، يمكنك أن تسأل نفسك : "

10:29ما هي معايير الإجابة

10:31الجيدة هنا ؟ ما معنى

10:32أن نقول إن هذه

10:33الإجابة جيدة مقابل

10:34أنها سيئة ؟ " أو إذا لم

10:36تكن كذلك ، يمكنك

10:36التحدث إلى خبراء في

10:37المجال للحصول على هذه

10:39المعلومات . يمكنك

10:40تحويل هذه المعايير

10:41إلى خطة تقييم لنموذج

10:42اللغة الخاص بك ، وطلب

10:44تقييم الإجابة بناءً

10:45عليها . من الأمور

10:46المهمة جدًا التأكد من

10:48معايرة نموذج التقييم

10:49الخاص بك ليتوافق مع

10:50آراء الخبراء . إذا رأى

10:51الخبراء أن إجابة ما

10:52جيدة ، فيجب أن يؤكد

10:53نموذج التقييم أنها

10:54جيدة أيضًا . وإذا رأى

10:55الخبير أنها سيئة ،

10:56فيجب أن يؤكد نموذج

10:57التقييم أنها سيئة .

10:58يجب أن يكون هناك رابط

10:59بين ما يقوله مُقيّم

11:01نموذج التقييم وما

11:02يقوله الخبراء .

11:03وبالطبع ، هناك الكثير

11:04من التفاصيل الدقيقة

11:05في صياغة هذه المعايير

11:06بشكل جيد . عليك توضيح

11:07ماهية هذه المعايير ،

11:09وعدم منح النموذج

11:10احتمالات كثيرة . لذا ،

11:11عادةً ما يكون الجواب

11:13الواضح بنعم أو لا

11:14أفضل من مقياس من 20

11:15نقطة ، حيث يكون تقييم

11:17شيء ما بخمس أو عشر أو

11:18ست نقاط من 20 غير واضح

11:20تمامًا . وعمومًا ، نرغب

11:22في التأكد من أن هذه

11:23المعايير تتوافق مع

11:25الواقع . فكلما زادت

11:27دقة تقييمنا لشيء

11:28حقيقي ، شيء يؤثر على

11:30النتائج التي تهمنا ،

11:32زادت ثقتنا في فعالية

11:34معاييرنا .

11:35>> نعم . وربما للمتابعة

11:37في هذا ، أتفق تمامًا

11:38مع كل ما سبق . وآمل

11:39أنكم تجرون هذا

11:40التقييم على تلك

11:41الأمثلة الواقعية

11:42التي جمعتموها . وآمل

11:43أن يكون لديكم فهم جيد

11:44لكل مثال منها ، بحيث

11:46تعرفون ما الذي أحتاجه

11:47من الذكاء الاصطناعي

11:48لدعم عملي ، ولتحسين

11:51أدائي أو تسريعه .

11:53وبالتالي ، يصبح من

11:54الواضح لكم ما إذا كان

11:56الذكاء الاصطناعي قد

11:57أدى المهمة بشكل صحيح

11:58أم لا ، على الرغم من

11:59تعقيدها . إما أن هذا

12:01سيساهم في تطوير عملي

12:02أو لا .

12:03>> رائع . نعم ، هذا منطقي

12:05جدًا . وأعلم أننا في

12:07شركة إليسيت نؤمن

12:08إيمانًا راسخًا بأن

12:10التقييم لا ينبغي أن

12:11يقتصر على المخرجات

12:13فحسب ، بل يجب أن يشمل

12:14أيضًا تقييم العملية

12:16التي يتبعها النموذج

12:17للوصول إلى تلك

12:18المخرجات . وأود أن

12:20أعرف المزيد عن سبب

12:21اعتقادك بضرورة تقييم

12:23العملية بنفس القدر ،

12:25إن لم يكن أكثر ، من

12:26تقييم المخرجات

12:27النهائية . حسنًا ،

12:30>> على المستوى العام ،

12:32يصعب تقييم المخرجات ،

12:34ويصبح ذلك مستحيلاً

12:35كلما ازدادت تعقيدًا ،

12:37وكلما ازداد دمج

12:39الذكاء الاصطناعي في

12:41عملية صنع القرار .

12:42فعند محاولة اتخاذ

12:44قرار معقد بشأن المضي

12:46قدمًا في مشروع ما ،

12:47نعلم نحن البشر ، عند

12:49تقييم مخرجاتنا أو

12:51مخرجات زملائنا ، أننا

12:52لا نستطيع الجزم

12:54بالنتيجة النهائية ،

12:55وفي النهاية نتخذ أفضل

12:57قرار ممكن . وينطبق

12:59الأمر نفسه على مخرجات

13:00الذكاء الاصطناعي .

13:02بالطبع ، يمكن للذكاء

13:03الاصطناعي أن يكون

13:04مفيدًا للغاية في

13:05اتخاذ القرارات

13:06المصيرية ، ولذلك نسعى

13:08إلى إيجاد طريقة

13:09لتقييمه . لذا ، يُعدّ

13:11تقييم عملية الذكاء

13:12الاصطناعي طريقةً

13:13جيدةً لفهم مدى فائدة

13:15مخرجاته التفاعلية .

13:17لنأخذ مثالًا واحدًا

13:19لتوضيح الأمر بشكلٍ

13:20ملموس . هذا مثال بسيط

13:22جدًا ، لكننا نؤمن بشدة

13:24بأهمية توثيق الذكاء

13:26الاصطناعي لمصادره

13:28بدقة في إجابته .

13:30ستلاحظ ، عند استخدام

13:32Illicit ، أنه يُقدّم

13:33اقتباساتٍ من المصادر

13:35لدعم كل ادعاء يُقدّمه

13:37. نعتقد أن هذا مهمٌ

13:43جدًا لأنه يُظهر عملية

13:45جمع المعلومات من

13:47المصادر ، وتحليلها ،

13:49ثمّ تركيبها بطريقةٍ

13:51واضحةٍ تُتيح لك معرفة

13:53مصدر كل معلومة . لذا ،

13:56هذا ما نرغب في تقييمه

13:58من حيث العمليات : هل

13:59الادعاءات مدعومةٌ

14:00بالفعل بالاقتباسات ؟

14:02هل جميع الادعاءات

14:03مدعومةٌ باقتباسات ؟

14:04هذا جانبٌ مهم . ثم ،

14:06أعتقد أن من مزايا

14:08استخدام الاقتباسات

14:09تحديدًا ، والتي تنطبق

14:10أيضًا على العديد من

14:11العمليات الأخرى التي

14:13قد تُقيّمها ، أنها

14:14تُساعدك على التحقق من

14:15صحة الإجابة . قبل أن

14:16تقول : حسنًا ، هذه

14:17الاقتباسات تدعم هذا

14:19الادعاء ، يمكنك أولًا

14:20أن تسأل : هل تدعم

14:21الاقتباسات هذا

14:22الادعاء فعلاً ؟ ثم

14:23يمكنك أن تقول : ثق

14:24بالاقتباسات . بالتالي

14:26، يمكنك التحقق من صحة

14:27الإجابة والقدرة على

14:29تأكيدها أو رفضها .

14:32ولعلّ هناك سببًا آخر

14:34لتقييم العمليات ، وهو

14:36أنك قد تضطر أحيانًا

14:38إلى ذلك . أحد الأسباب

14:39هو أنك تحاول استخدام

14:41الذكاء الاصطناعي ، أو

14:42أنك تستخدمه بالفعل ،

14:44في أمر له عملية محددة

14:45، ربما تفرضها الجهات

14:47التنظيمية . على سبيل

14:48المثال ، إذا كنت

14:49تستخدم الذكاء

14:50الاصطناعي لإجراء

14:51مراجعة منهجية

14:52للأدبيات . سبب آخر قد

14:53يكون إذا كان لدى

14:54فريقك عملية تعتقد

14:55أنها فعّالة للغاية ،

14:56وتريد التأكد من أن

14:58الذكاء الاصطناعي

14:59يُطبّق هذه العملية .

15:00قد يكون هذا سببًا آخر

15:02يدفعك إلى التأكد من

15:03أنه اتبعها بالفعل

15:04بدلًا من مجرد ذكرها

15:05ظاهريًا .

15:07>> نعم ، إنها أمثلة مفيدة

15:08للغاية ، خاصةً فيما

15:09يتعلق بالمتطلبات

15:11التنظيمية . أعلم أن

15:12هذا الموضوع طُرح

15:13كثيرًا مع سعي

15:14الصناعات الجديدة

15:15لفهم كيفية استخدام

15:16الذكاء الاصطناعي في

15:17سياق اللوائح القائمة

15:19التي يجب عليها

15:20الالتزام بها . أعلم أن

15:21لدينا بعض الأسئلة من

15:22الحضور ، وسأؤجل

15:23الإجابة عليها إلى

15:25النهاية . أعتقد أن

15:26لدينا سؤالين آخرين

15:27سأجيب عليهما ، شكرًا

15:28جزيلًا لكم على إرسال

15:30أسئلتكم . استمروا في

15:31إرسالها ، وسنحرص

15:32بالتأكيد على الإجابة

15:33عليها . حسنًا ، عندما

15:34تتحدثون عن العودة إلى

15:36القصص والتقييمات ،

15:37يبدو أنها مفيدة ، لكن

15:39هل سبق لكم أن واجهتم

15:40موقفًا أعطاكم فيه

15:41التقييم معلومات

15:42خاطئة ؟ كأن يكون

15:44التقييم قد ضللكم .

15:45أتساءل إن كان هذا قد

15:47حدث لكم ، وماذا حدث ،

15:49وماذا تعلمتم من ذلك ؟

15:50>> نعم ، بالتأكيد . مرات

15:53عديدة . وأعتقد أن أحد

15:58الأنماط التي

15:59لاحظناها هو أننا نحصل

16:01على بيانات من مصادر

16:03متخصصة ، ربما من معيار

16:05مرجعي أو من خبير

16:07نتعاون معه . وسنفترض ،

16:09أجل ، أن هذا الشخص

16:11خبير أو أنه بذل جهدًا

16:12كبيرًا في هذا المعيار

16:13. لقد حاول أن يؤدي

16:14عملًا جيدًا للغاية .

16:15لا بد أن يكون صحيحًا .

16:17إذا اختلف الذكاء

16:18الاصطناعي ، فذلك

16:18ببساطة لأنه مخطئ . هذا

16:20ما نفترضه . ثم سننظر في

16:21الأمر بتمعن ، وسنقول :

16:22حسنًا ، لنُمعن النظر

16:24فيه قليلًا . سننظر في

16:25إجابة الذكاء

16:25الاصطناعي وإجابة

16:27الإنسان . سنقول : في

16:28الواقع ، أغفل الإنسان

16:29شيئًا ما لاحظه الذكاء

16:31الاصطناعي . عندها

16:33سنحتاج إلى إعادة

16:35تقييم الإجابة . لذا ،

16:36أعتقد أن هذا نمط شائع

16:38ومفيد عند تصميم

16:39الصمامات ، فمن الرائع

16:41بالطبع الحصول على

16:42إجابات معيارية من

16:44الخبراء . ولكن مع

16:45التطور الكبير الذي

16:46وصلت إليه تقنيات

16:47الذكاء الاصطناعي هذه

16:48الأيام ، أعتقد أنه من

16:50المهم جدًا إعادة

16:51تقييم صحة واكتمال تلك

16:52الإجابات بعد الاطلاع

16:53على إجابة الذكاء

16:54الاصطناعي .

16:55>> مثير للاهتمام . حسنًا ،

16:57تمامًا مثل التحقق من

16:59دقة الخبراء أنفسهم في

17:01المقام الأول . رائع .

17:03حسنًا ، لنختتم حديثنا

17:05ببعض النصائح للجمهور

17:06بناءً على خبرتك . ما هي

17:08إحدى ممارسات التقييم

17:10التي تعتقد أنها حققت

17:12قيمة كبيرة من حيث

17:13الجهد المبذول فيها ؟

17:16>> نعم . أحد الأمور التي

17:18نصر عليها هو أنه عند

17:20مشاركة نتيجة تقييم

17:21داخليًا على الأقل ،

17:22يجب مشاركة جميع

17:24مستويات التحليل

17:25والبيانات التي

17:26استندت إليها تلك

17:27النتيجة . قد تكون

17:28النتيجة الرئيسية مثل :

17:30" الإصدار أ أفضل بنسبة

17:325 % من الإصدار ب " . ولكن

17:34يجب أن يرتبط ذلك بشرح

17:36ما قمت به ، ثم التحليل

17:38، وأخيرًا البيانات

17:40الأولية . وجدنا أن هذا

17:42مهم لأنه يحقق عائدًا

17:43جيدًا على الاستثمار ،

17:45لأنه سهل نسبيًا ، أو

17:46يجب أن يكون سهلًا

17:47نسبيًا . إذا لم يكن

17:49كذلك ، فربما تقوم

17:50بتخزين بياناتك

17:51بطريقة غير فعالة .

17:54وهذا يسمح ، ولكن من

17:55السهل جدًا ارتكاب خطأ

17:57ما في التقييم . سواء

17:59كان ذلك خطأ في اتجاه

18:01البناء كما ذكر

18:02المشروع سابقًا ، أو

18:03مجرد خطأ في

18:04الإحصائيات أو عكس بعض

18:06الإشارات . من المهم

18:07جدًا التحقق من نتائج

18:09التقييم . أعتقد أننا

18:10نتخذ موقفًا متشككًا

18:12للغاية عندما يقول أي

18:13شخص ، سواء داخليًا أو

18:15خارجيًا ، أن تقييمنا

18:16يُظهر أن ( أ ) أفضل من ( ب )

18:18. ومشاركة كل هذه

18:19البيانات والتحليلات

18:21تُمكّننا من القيام

18:22بذلك ، خاصةً الآن بعد

18:24أن أصبح بإمكانك

18:25الاعتماد على وكيلك في

18:27تتبع هذه الوثائق .

18:28إنها

18:29>> ملاحظة أو نصيحة جيدة .

18:31في هذا السياق ، ما هو

18:33الخطأ الذي ارتكبته أو

18:35رأيته يتكرر عدة مرات

18:37داخليًا أو في تجربتك

18:39والذي تنصح الفرق

18:40بتجنبه منذ البداية ؟

18:43>> نعم ، أعتقد أن أحد

18:44الأشياء التي فعلناها

18:46هو مشاركة المقارنات

18:47الخام فقط . على سبيل

18:49المثال ، حصل ( أ ) على 50 %

18:50وحصل ( ب ) على 55 % دون أي

18:52إحصائيات . تمامًا كما

18:53لو كانت نسخة أولية من

18:54البريد الإلكتروني .

18:55لكنني أعتقد ، خاصةً في

18:57هذه الأيام ، أن ذلك

18:58غير ضروري . من السهل

19:00جدًا ، مرة أخرى ، العمل

19:01مع وكيلك لإجراء بعض

19:03التحليلات الإحصائية

19:05للمقارنة ومعرفة ما

19:06إذا كان الفرق ذا

19:07دلالة إحصائية . وقد

19:09يكون ذلك خطيرًا جدًا

19:10أيضًا ، لأنه قد يبدأ

19:12بعض الأشخاص في مؤسستك

19:13، على سبيل المثال ،

19:15بالتحمس قائلين : " أوه ،

19:16نعم ، إنه رائع " . ولكن

19:18بعد بضعة أيام ، تُجري

19:19التحليلات الإحصائية

19:20وتقول : " في الواقع ، أو

19:21تُعيد التقييم وتقول : "

19:22أوه ، هذه المرة كان

19:23أداء المجموعة ( ب ) أفضل

19:24لأن الأمر كان مجرد

19:25تباين عشوائي " .

19:28>> فهمت . رائع . حسنًا ، في

19:30الختام ، ربما لكليكما

19:31، ما هو الشيء الذي

19:33تعتقدان ، بالنظر إلى

19:34الماضي ، أن تقييمات

19:35الذكاء الاصطناعي يجب

19:37أن تقوم به اليوم ولم

19:38تكونا تعتقدانه قبل

19:40عامين ؟

19:41>> نعم ، أعتقد أن هناك

19:43أشياء كثيرة ، لكن

19:44أحدها هو النظر إلى

19:47مستويات أعلى من

19:49التجريد . قبل عامين ،

19:52لم نكن نفكر في مدى

19:53ضخامة الوكلاء ،

19:54وبالتالي لم نفكر في

19:55مدى ضرورة تقييم هذه

19:57المفاهيم التي لا وجود

19:58لها حتى في استدعاءات

20:00النماذج الفردية . الآن

20:02، في استدعاء نموذج

20:03فردي ، ما يهمك هو : هل

20:04هو وهم ؟ هل هو صحيح ؟

20:06أما في الوكيل ، ما

20:07يهمك هو : هل العملية

20:08صحيحة ؟ هل هذه النتيجة

20:09ذات المستوى الأعلى

20:10التي أهتم بها صحيحة ؟

20:12هذه أشياء لم أفكر

20:13فيها قبل عامين . وربما

20:15هناك شيء ثانٍ تأكدت

20:16منه من خلال التجربة

20:18والخطأ مرارًا

20:18وتكرارًا ، وهو النظر

20:20إلى البيانات . كما قال

20:21بن ، من المهم جدًا

20:22النظر إلى ما ما تفعله

20:24صحيح . ورغم أنني كنت

20:25أعرف ذلك قبل عامين ،

20:27لم أكن أؤمن به بشدة ،

20:28أما الآن فأنا أؤمن به

20:29إيمانًا راسخًا . ماذا

20:32عنك يا إيفان ؟ أجل ،

20:34أعتقد أنه حتى بعد

20:35مرور أكثر من عامين ،

20:37لاحظت خلال السنوات

20:38الثماني أو التسع أو

20:40العشر الماضية من عملي

20:41في شركة Ought والمنظمة

20:43السابقة لها ، أن

20:44الذكاء الاصطناعي

20:45أصبح أكثر فأكثر فائدة

20:47في عمليات التقييم . في

20:48البداية ، كنا نعتمد

20:50على البشر في كل شيء ،

20:51بالطبع . كان ذلك في

20:53أيام GPT - 2 . ثم وصلنا إلى

20:55مرحلة أصبح فيها

20:56الذكاء الاصطناعي

20:57مفيدًا إذا أعطيناه

20:59تعليمات واضحة جدًا .

21:00مثلًا : " هذا هو المعيار

21:02الذهبي لإجابة مهمة

21:03استخراج البيانات هذه .

21:04أخبرني ما إذا كانت

21:05هذه الإجابة الأخرى

21:07متطابقة معه إلى حد

21:08كبير . " الآن وصلنا إلى

21:09مرحلة ، وأعتقد أن هذا

21:11حدث خلال العامين

21:12الماضيين ، حيث أصبح من

21:13المفيد أن نقول للذكاء

21:15الاصطناعي : " هذا هو

21:16السؤال الذي طرحناه .

21:18وهذه هي الإجابة . فقط

21:20تحقق منها . " ومن المهم

21:21أن يتمتع القاضي بميزة

21:23ما على نموذج الإجابة

21:24الأصلي ليتمكن من

21:25القيام بذلك . وإلا ،

21:27فسيكون الأمر بلا جدوى

21:28. ولكن إذا منحنا

21:29القاضي ، على سبيل

21:31المثال ، معيارًا

21:32ذهبيًا ، أو نموذجًا

21:33أكثر قوة ، أو منحناه

21:34وقتًا أطول للتفكير ،

21:35فسنحصل بالتأكيد على

21:37رؤى قيّمة من هذا

21:38النوع من التحليل . لذا

21:39، نعم ، يمكنك القيام

21:40بأشياء ، وأنا متأكد من

21:41أنها ليست جديدة على

21:42أحد هنا ، ولكن يمكنك

21:43القيام بأشياء أخرى ،

21:45بما في ذلك أي شيء آخر ،

21:46الآن كما كان بإمكانك

21:47القيام به مؤخرًا .

21:48>> نعم ، قبل عامين كان

21:49العالم يبدو مختلفًا

21:50تمامًا ، على ما أعتقد .

21:52بالتأكيد . إنه لأمر

21:53رائع . شكرًا جزيلًا

21:55لكم على استيعاب بعض

21:56أسئلتي . أعلم أن لدى

21:57الحضور بالفعل بعض

21:58الأسئلة ، لذا ربما

21:59يمكننا استعراض بعضها

22:00ومعرفة ما إذا كان

22:01لديكم أي أفكار . إذن ،

22:02السؤال الأول هو : هل

22:03لديكم أي نصائح أو رؤى

22:05للاستفادة من أداء

22:06النموذج على معايير

22:07العالم الحقيقي

22:08لتحقيق نتائج أفضل

22:09للمستخدمين ؟ لا أعرف

22:11ما إذا كان أي منكما

22:12يريد الإجابة على هذا

22:13السؤال .

22:13>> يمكنني الإجابة عليه .

22:15أعتقد أنه يجب عليك

22:15استخدام Elicit بغض النظر

22:17عن نتائج المعايير .

22:18هذه نصيحتي الشخصية .

22:19لكنني أرى أن معايير

22:21مثل تقييم الناتج

22:22المحلي الإجمالي ليست

22:23بالضرورة أفضل مقياس

22:25لما يمكنك فعله

22:26كمستخدم لـ Elicit ، لأن

22:27لدينا هيكلنا الخاص ،

22:28وموجهاتنا الخاصة ،

22:30ونماذجنا المتخصصة

22:31داخل Elicit . وإذا كان

22:32تقييم الناتج المحلي

22:34الإجمالي ينطبق ، فإنه

22:35ينطبق على المهام

22:37المحددة فيه ، وهي مهام

22:38مهنية محددة . ثانيًا ،

22:40لا ينبغي دائمًا ،

22:41خاصةً مع تطور قدرات

22:43النماذج ، حيث أن

22:44النماذج " الأصغر " تُعد

22:45أيضًا جيدة جدًا في

22:46أداء المهام ، أن

22:48تستخلص استنتاجات من

22:49معايير عامة مثل تقييم

22:50الناتج المحلي

22:51الإجمالي بشأن المهمة

22:53المحددة التي تريد

22:54القيام بها . لذا ، أقول

22:56إنه يمكنك اعتبار هذا

22:57مثالًا على حدود قدرات

22:59الذكاء الاصطناعي . إذا

23:00كنت تحاول معرفة أفضل

23:01نموذج لمهمة معينة ،

23:02فسيكون تقييم الناتج

23:04المحلي الإجمالي

23:04مفيدًا جدًا . ولكن ،

23:06إذا كنت تحاول معرفة

23:07أفضل نموذج لمهمتك

23:08المحددة ، فربما عليك

23:10إنشاء بعض الأمثلة

23:11الخاصة بك ثم إجراء

23:12التقييمات عليها .

23:15>> يبدو هذا جيدًا . حسنًا .

23:17بالنسبة للسؤال

23:18الثاني ، لست متأكدًا

23:20من مدى إمكانية

23:20مناقشته ، لكن لنحاول .

23:22هل شركة Elucid من بين

23:23الشركاء المؤسسيين

23:24الذين استعادوا

23:25الوصول إلى برنامج Claude

23:263 5 التابع لشركة Anthropic

23:28بعد إغلاق الحكومة ؟

23:29وبشكل أعم ، كيف يمكن

23:30لأدوات أبحاث الذكاء

23:31الاصطناعي التي تجمع

23:32نماذج متعددة

23:33ديناميكيًا تحقيق

23:34الشفافية الكاملة لكي

23:35يعرف المستخدمون

23:36النموذج الذي يعالج

23:37طلباتهم تحديدًا ؟

23:39>> مثير للاهتمام .

23:40بالتأكيد ، يمكنني

23:41الإجابة على هذا

23:41السؤال . للإجابة على

23:42السؤال الأول ، أعتقد

23:43أنه من المقبول ببساطة

23:44أن تكون الإجابة

23:45بالنفي . سيكون ذلك

23:46رائعًا لو كان الأمر

23:47كذلك . أما بالنسبة

23:48للسؤال الثاني

23:49المتعلق بالشفافية ،

23:53فأعتقد أنني سأختلف

23:55قليلًا مع الفرضية ، إذ

23:57أعتقد أنه من المهم

23:59لنا كشركة أن نقطع

24:01وعودًا معينة

24:02لمستخدمينا ونفي بها .

24:05لكنني أعتقد أن الوعود

24:07التي نريد قطعها والتي

24:08نعتبرها الأكثر أهمية

24:10تتمحور أساسًا حول

24:11العملية التي سيتبعها

24:13نظام الذكاء

24:14الاصطناعي وجودة

24:15المخرجات . لقد تحدثنا

24:16عن بعض معايير ذلك

24:18بالفعل في هذه

24:19المحادثة . لكن على

24:20سبيل المثال ، فيما

24:21يتعلق بالعملية ،

24:22ستكون الادعاءات

24:23مدعومة باقتباسات ،

24:24وسنتبع عملية بحث

24:26دقيقة ، وما إلى ذلك .

24:27أما بالنسبة للمخرجات

24:29، فستكون دقيقة ومفيدة

24:31. لذا ، أعتقد أن هذا هو

24:35ما نريد التأكد من

24:36تقديمه ، وأعتقد أن

24:38علينا تحديد النماذج

24:40التي سنستخدمها

24:42لتحقيق ذلك ، وشرح آلية

24:44عمل هذه النماذج كجزء

24:46من شفافية العملية .

24:52حسنًا .

24:53>> سؤال آخر . هل تفكرون في

24:56استخدام المناهج

24:57القياسية النفسية في

24:59تقييم معايير الذكاء

25:01الاصطناعي ؟

25:02>> نعم ، أعتقد ذلك . من

25:05الصعب الربط بين مجال

25:06ذي خبرة واسعة

25:08كالتقييمات القياسية

25:09النفسية والذكاء

25:11الاصطناعي ، الذي

25:12يمتلك إطارًا

25:13مفاهيميًا مختلفًا

25:15تمامًا . أعتقد أن هناك

25:16بعض النقاط المشتركة .

25:18أكثر ما يهمني هو

25:19نظرية استجابة البنود

25:21، حيث يمكنك اختيار

25:22أسئلة المعيار التي

25:23تُعطى للنموذج بناءً

25:25على أدائه في الأسئلة

25:26السابقة . كما هو الحال

25:27عند إجراء اختبارات

25:28الذكاء ، حيث يُطرح

25:29عليك بعض الأسئلة . إذا

25:30أجبت عليها بشكل صحيح ،

25:32سيُطرح عليك أسئلة

25:33أصعب . لكن هذا مجرد

25:35مثال واحد . أعتقد

25:36عمومًا أنه ينبغي

25:37علينا التفكير من

25:39منظور كيفية تقييم

25:40النموذج ، واستخدام

25:41مناهج من علم القياس

25:43النفسي ، ومن مجالات

25:44أخرى في العلوم

25:45الاجتماعية ، فقط

25:46بالقدر الذي تنطبق

25:48عليه فعليًا . من

25:49المغالطات الشائعة

25:50لدينا أننا نعتقد : " هذا

25:51يُعطي نصًا مثل

25:52الإنسان . سأفعل ما

25:53يفعله الإنسان . " وهذا

25:55قد يكون صحيحًا في بعض

25:57الحالات ، لكن من المهم

25:58دائمًا التفكير في كل

26:00حالة على حدة . حسنًا ،

26:03هذا سؤال رائع يتعلق

26:04بالذكاء الاصطناعي

26:06والرياضيات . يقول هذا

26:07الشخص : " لقد لاحظتُ أن

26:08الذكاء الاصطناعي

26:09يرتكب أخطاءً كبيرة ،

26:11أو أخطاءً رياضية

26:12كبيرة ، عند تحليل

26:13الأبحاث . هل لديكم أي

26:14توصيات ، أو أي مناهج

26:15لإخراج الرياضيات من

26:16الذكاء الاصطناعي

26:17وإجراء العمليات

26:18الحسابية بأساليب غير

26:20متعلقة بالذكاء

26:21الاصطناعي ؟ "

26:24>> أعتقد أنني أستطيع

26:26الإجابة على هذا .

26:27أعتقد أن الحل يكمن في

26:28استخدام أفضل النماذج

26:30المتاحة ، واستخدام

26:31التحقق الرسمي ،

26:32ومحاولة استخدام

26:33منهجيات مثل Lean أو Arc

26:34أو ما شابه . لكن هذا

26:36ليس مجال تخصص Ellicit ،

26:37فنحن لا نتعامل مع

26:38الرياضيات . أتحدث هنا

26:40من واقع خبرتي الشخصية

26:42.

26:44>> حسنًا ، سؤالان آخران .

26:46كيف نأخذ في الحسبان

26:47التباين بين عمليات

26:48التشغيل في النموذج

26:50الاحتمالي ، أو ما

26:51يرتبط به من انحراف في

26:52الأداء مع مرور الوقت ؟

26:55حسنًا ، لنرَ . أعتقد

26:57أنه من الأفضل الإجابة

26:58بشكل مباشر . كيف نأخذ

26:59في الحسبان التباين

27:00بين عمليات التشغيل ؟

27:01نعم ، بطريقة بسيطة في

27:03معظم الأحيان في

27:04منهجنا الحالي . لذا ،

27:06من المؤكد أننا نرغب

27:07في مراعاة ذلك . أعتقد

27:09أن إحدى المغالطات

27:10التي وقعنا فيها

27:12أحيانًا ، والتي من

27:13المهم الانتباه إليها

27:15، هي افتراضنا الخاطئ

27:16بأن أداء الذكاء

27:17الاصطناعي في كل تشغيل

27:19هو نفسه أداء النظام

27:20ككل ، وأن كل التباين

27:22ناتج عن معايير النظام

27:24وما إلى ذلك ، بدلًا من

27:25كونه تباينًا

27:26عشوائيًا أو غير معروف

27:28بين التشغيلات . لذا ،

27:30نعم ، من المهم جدًا

27:31نمذجة هذا الأمر ، ونحن

27:34نستخدم نماذج بسيطة أو

27:36هرمية لهذا الغرض . أما

27:38بالنسبة لانحراف

27:39الأداء بمرور الوقت ،

27:40فلا أعتقد أن لديّ

27:41إجابة أكثر تعقيدًا .

27:43ربما لدى براشي إجابة

27:44أكثر تعقيدًا ، لكن

27:45أعتقد أن أفضل إجابة

27:46لديّ هي الاستمرار في

27:48القياس بمرور الوقت

27:49ومراقبة تغير الأداء .

27:50>> نعم ، هذا أشبه بـ " افعل

27:52دائمًا أبسط شيء " ، وهو

27:54تكرار القياسات بمرور

27:56الوقت . رائع !

27:59>> مذهل ! حسنًا ، هناك بعض

28:00النقاط الأخرى . ربما

28:01نستطيع تغطية كل هذه

28:02النقاط . انظر هنا . هل

28:04تستخدمون مقاييس ثقة

28:05الذكاء الاصطناعي

28:06للإجابات ؟ وإذا كانت

28:07الإجابة بنعم ، فما

28:09رأيكم في ذلك من حيث

28:10الدقة ؟

28:13>> هل تعتقدون أن هذا

28:14يقيس مدى ثقة الذكاء

28:16الاصطناعي بإجابته ؟

28:19>> لست متأكدًا . إذا كان

28:21بإمكان هذا الشخص

28:23توضيح ذلك ، فربما

28:25يمكنكم الإجابة على

28:26هذا السؤال .

28:28>> نعم ، يمكنكم أخذ هذا

28:30السؤال بعين الاعتبار .

28:31>> هناك طرق عديدة لقياس

28:33ثقة الذكاء الاصطناعي

28:34، والعديد من الأدوات

28:35مفتوحة المصدر

28:36والتجارية لهذا الغرض .

28:37يمكنكم استخدام

28:38احتمالات اللوغاريتم

28:40لمعرفة مدى ثقة

28:41النموذج ، أي الاحتمال

28:42الذي يقدمه لكل رمز .

28:44هناك العديد من الطرق .

28:45أعتقد شخصيًا ، ربما

28:46يكون لدى بن وجهة نظر

28:48مختلفة هنا ، أنني

28:49متشكك في قدرة هذه

28:50الطرق على التوسع

28:51لتشمل نماذج أفضل .

28:52معظم أفضل النماذج

28:53التي تحتاجون إلى هذه

28:54الثقة لها مغلقة

28:55المصدر ولا تقدم

28:56دائمًا رموزًا . وإذا

28:57قدمتها ، فإنها تقدم

28:58فقط أفضل 20 احتمالًا

29:00لوغاريتميًا . هذا هو

29:01الحد الأقصى . الأمر

29:03الثاني هو أنه حتى لو

29:04تم تزويدك

29:05بالاحتمالات ، فليس من

29:07الواضح مدى دقة

29:08معايرتها . هناك العديد

29:10من الدراسات التي

29:11تُظهر أن هذه

29:12الاحتمالات تتغير

29:13بشكل كبير بسبب التعلم

29:15المعزز من خلال

29:16التغذية الراجعة

29:17البشرية . لذا ، أقول

29:18إنها مشكلة لم تُحل في

29:20هذا المجال ، وهي : كيف

29:21نعرف مدى دقة معايرة

29:23الذكاء الاصطناعي ؟

29:24ولكن في الواقع ، هذا

29:26هو سبب استخدامك لـ

29:27Elicit ، لأننا نتخذ خطوات

29:28عديدة لضمان توضيح

29:29الأمور لك عندما تكون

29:31نماذجنا غير متأكدة .

29:32عندما تُقدم بعض

29:33الادعاءات ، نُسهل

29:34عليك التحقق من وجودها

29:36في النصوص المصدرية .

29:37لذا ، نعم ، إنها مشكلة

29:39تقنية لم تُحل ، لكننا

29:41حللناها بطرق أخرى لا

29:42تعتمد على سؤال

29:44النموذج نفسه ، بل على

29:45بناء بيئة حوله

29:47للمساعدة في حل

29:48المشكلة باستخدام

29:49أسلوب مختلف .

29:51>> نعم . أجل ، وأعتقد أن

29:52السؤال الذي طرحته كان

29:53صحيحًا ، وكنتُ أؤيده

29:54تمامًا ، وفي جوهره ،

29:55نجيب تقريبًا على

29:56السؤال الصحيح . لذا ،

29:57ربما هناك نقطة أخرى

29:59أود إضافتها . أوافقك

30:00الرأي تمامًا . أكثر ما

30:04يُثير حماسي هنا هو أن

30:05نظام الذكاء

30:06الاصطناعي يُعطي

30:08إجابة أولية ، ثم - وهذا

30:09ما نفعله في برنامج

30:11Elicit - نجعله يُشكك في

30:12تلك الإجابة . حسنًا ،

30:14ما هي الادعاءات

30:15الرئيسية ؟ ما هي

30:16الادعاءات البديلة

30:17التي قد تكون صحيحة ؟

30:18ما هي الأدلة المؤيدة

30:20والمعارضة لكل منها ؟

30:21أجل ، أعتقد أنني مهتم

30:22بشكل أساسي باستخدام

30:24الشك كأساس لمزيد من

30:26البحث ، ونأمل أن

30:27يُساعد ذلك في تحسين

30:28الإجابة أو إدراك

30:30خطئها .

30:32>> حسنًا . سؤال آخر : ما

30:34الأدلة التي تُفند

30:35ادعاءاتك الأساسية ،

30:37وكيف تُميز بين فشل

30:39الفكرة الأساسية وفشل

30:41شيء ما ، مثل قياس

30:42التقييم أو تنفيذه أو

30:44سياقه أو توقيته ؟

30:46>> لديّ فكرة حول هذا

30:47الموضوع ، وهي فكرة

30:49أخرى تتطلب بالتأكيد

30:50بعض التفسير ، ولكن

30:51لديّ فكرة سأطرحها من

30:53وجهة نظري . أعتقد أن

30:55أحد المبادئ الأساسية

30:57لمنهجية الاستنباط هو

30:58أنك تريد ، كما ذكرنا

31:00سابقًا ، التحقق من

31:01العملية أو تقييمها ،

31:03وفي النهاية تريد

31:04تدريب الذكاء

31:05الاصطناعي بناءً على

31:07تقييمات لعمليته وليس

31:09فقط بناءً على تقييمات

31:10نتائجه . لذا ، بدلاً من

31:12مجرد النظر إلى

31:13النتيجة للحصول على

31:14الإجابة الصحيحة ،

31:15تريد أن تنظر إلى

31:16كيفية وصوله إلى

31:17الإجابة وتتدرب على

31:18ذلك . نعم ، أعتقد أن سبب

31:20تفسيري للأمر بهذه

31:22الطريقة هو أن هذا شيء

31:24نحاول قياسه الآن ،

31:25ولكن لا يمكننا قياسه

31:27بشكل كامل لأنه مفهوم

31:29واسع جدًا . فعلى سبيل

31:30المثال ، نعمل حاليًا

31:32على هذا المعيار حيث

31:33نقيس مدى صحة الإجابات

31:35، ولدينا تقييم يقول : "

31:36هذه هي الإجابات

31:37الصحيحة ، هل حصل على

31:39الإجابة الصحيحة ؟ " ،

31:40وتقييم آخر يقول : " هذه

31:41هي العملية الصحيحة ،

31:43هل اتبع العملية

31:44الصحيحة ؟ " . وما نرغب

31:46برؤيته ، في الوضع

31:47الأمثل ، هو وجود ترابط

31:49قوي بين هذين الأمرين .

31:50حتى الآن ، لم نلحظ ذلك .

31:54وأعتقد أن السبب هو

31:56أننا لم نُحسن تحديد

31:58ماهية العملية

31:59المطلوبة . لذا ، هذا ما

32:01أبحث فيه حاليًا في

32:02هذا التقييم : ما هي

32:03العملية المطلوبة

32:04تحديدًا ، ومحاولة

32:06تحديدها بطريقة

32:07تُمكّننا من تقييمها

32:08بدقة . أعتقد أن ما الذي

32:11سيُبطل الفكرة

32:13الأساسية ، كما يُمكن

32:14القول ، هو أن يتمكن

32:19الناس من حل المشكلات

32:20بتقييمات قائمة على

32:22النتائج دون إجراء

32:23تقييمات قائمة على

32:25العملية . إذن ، المشكلة

32:26، كما ذكرنا سابقًا في

32:28هذا النقاش ، هي إنتاج

32:30إجابات تبدو جيدة

32:31ويعتقد الناس أنها

32:32جيدة ، لكنها في الواقع

32:34سيئة ، لأنه لا توجد

32:35طريقة لمعرفة ما إذا

32:37كانت سيئة حقًا . إذا

32:39اكتشف أحدهم ذلك

32:40بطريقة لا تُقيّم

32:41العملية ، فأعتقد

32:43حينها أننا كنا مخطئين

32:45في الأمر برمته .

32:47>> بالتأكيد ، أخبرنا إن

32:49كان لدى أحدكم نهج

32:50مختلف . حسنًا . بقي

32:52لدينا حوالي 5 دقائق .

32:54لنبدأ بهذا السؤال .

32:56كيف تتعاملون مع

32:57المعايير الذهبية

32:58للمهام التي لا تملك

32:59إجابات صحيحة واضحة ؟

33:01هل في هذه الحالات

33:02يكون نموذجكم أفضل مما

33:04يستطيع المُقيّم فهمه

33:05؟

33:06>> حسنًا ، إذا كان

33:07نموذجكم أفضل مما

33:08يستطيع المُقيّم فهمه

33:09، فعليكم ببساطة

33:10استخدام النموذج

33:11كمُقيّم . هذا هو

33:12الواقع . لكنني لا

33:13أعتقد أن هذا يحدث

33:14كثيرًا ، لكن منطقيًا

33:16هذه هي النتيجة . أعتقد

33:17أننا تحدثنا كثيرًا ،

33:19وسأحيلكم إلى تسجيل

33:20الندوة الإلكترونية

33:22حول كيفية بناء معايير

33:23تقييم جيدة . عليكم

33:25بناء معايير تقييم

33:26جيدة والتأكد من

33:27معايرتها وفقًا لما

33:29يقوله خبراؤكم . هذا هو

33:30الجواب المختصر . أما

33:32بالنسبة للإجابة

33:33المطولة ، فلا أريد

33:34تكرار ما قلتموه

33:35بالفعل ، لكن الأسئلة

33:36البسيطة والمقاييس

33:38الصغيرة ، وتخيل نفسك

33:39مكان النموذج ، كلها

33:40أمور مهمة .

33:42>> نعم ، ربما أود إضافة

33:43شيء واحد ، وهو أن

33:44الجزء الأول من هذا ،

33:46على الأقل ، يتعلق

33:47بمعايير المهام التي

33:48لها إجابات صحيحة جيدة

33:50، وهو أمر واجهناه في

33:51التقييم الذي ذكرته

33:53للتو والذي نعمل عليه .

33:55وأعتقد أن هناك بعض

33:56الأمور المفيدة في هذا

33:58الصدد . أحدها هو

33:59الحصول على آراء من

34:00عدة خبراء مختلفين .

34:02وبالتحديد ، أعتقد أنه

34:03من المفيد معرفة رأيهم

34:05في الإجابة الصحيحة ،

34:06بشكل أساسي . ولكن من

34:08المفيد أيضًا معرفة

34:09رأيهم في تقييم

34:10الإجابة ، مثلاً : " هذا

34:12تقييم ، عفواً ، حكم أحد

34:13الحكام على هذه

34:14الإجابة . ما رأيك في

34:16هذا التقييم ؟ " لأن هذا

34:17النوع من التقييم أسهل

34:19بالنسبة للمُعلِّق

34:21الخبير من " ما هي إجابة

34:22هذه المهمة الكبيرة ؟ "

34:24على أي حال ، هذه مجرد

34:26فكرة سريعة .

34:28>> رائع . حسنًا ، ما مدى

34:30فائدة اختبارات

34:31الخصومة أو أسوأ

34:32الحالات مقارنةً

34:34بمحاولة تحسين

34:35الصلاحية الخارجية ؟

34:36>> حسنًا ، أنا بحاجة إلى

34:38هذا . لست متأكدًا من

34:40وجود تناقض بين هذين

34:41الأمرين . الكثير من

34:42أمثلة المستخدمين

34:43الخارجيين ، إذا نظرت

34:44إلى ما يسألك الناس

34:45عنه بالفعل ، قد تكون

34:46أسئلة أسوأ الحالات .

34:47جزء من محاولتك

34:48الخارجية لمطابقة

34:49توزيع أسئلة

34:50المستخدمين سيكون

34:51معرفة كيف يمكن أن

34:52يتعطل هذا . ربما تكون

34:54إحدى الطرق المختلفة

34:55لتفسير السؤال هي : ما

34:56مقدار الوقت الذي يجب

34:57أن تقضيه في محاولة

34:58كسر نموذجك أو القيام

34:59بذلك ؟ هذا يشبه تمامًا

35:01سؤال ما هو الخطر الذي

35:03تراه . إذا كنت تعمل ،

35:04كما نفعل ، مع الكثير

35:05من العملاء الذين

35:06لديهم أسئلة تنظيمية

35:08أو علمية كبيرة حول

35:09هذا الأمر ، فمن المفيد

35:10التفكير في ذلك ، أليس

35:12كذلك ؟ ولكن مع ذلك ،

35:13هناك تناقص في

35:14العائدات لهذا . يجب أن

35:16تفكر في الأشياء

35:17القليلة التي قد تكسره

35:18وترى أن هناك حلولًا

35:19شاملة . لكن بعيدًا عن

35:20ذلك ، فإن محاولة قضاء

35:22كل وقتك في اختبار

35:22أسوأ الحالات ، وربما

35:23تنجح في إصلاح أسوأ

35:24الحالات ، لكن يبقى

35:25الوضع في الحالة

35:26المتوسطة سيئًا ، هي

35:27نتيجة سيئة للغاية .

35:28لذا ، أقول إن الأمر

35:29يعتمد بشكل كبير على

35:31تقديرك لعائدات إجراء

35:32المزيد من اختبارات

35:33أسوأ الحالات . وفي

35:34معظم الحالات ، تتراجع

35:36هذه العائدات بشكل حاد

35:37بعد بذل جهد بسيط .

35:39>> نعم ، أود أن أضيف

35:40باختصار ، أعتقد أنه

35:41يجب أن يكون لديك

35:43نموذجك الخاص الذي

35:44يوضح سبب أهمية

35:45التركيز بشكل غير

35:46متناسب على أسوأ

35:47الحالات . وأعتقد أن

35:49هذا ينطبق علينا ،

35:50وخاصةً في شركة إليسيت

35:52، عندما تكون أسوأ

35:54الحالات هي تلقينا

35:55نصائح سيئة للغاية حول

35:57كيفية اتخاذ قرار مهم .

35:59وأعتقد أننا سنكون أقل

36:01قلقًا بشأن تعطل

36:02النظام فجأة . نعم ،

36:04تعطل النظام فجأة

36:05وظهور رسالة " عذرًا ،

36:06خطأ " . لأن هذا كل ما في

36:08الأمر . في النهاية ، من

36:09الواضح أنك لا تريد

36:10إظهار ذلك لمستخدميك ،

36:11لكنها ليست نهاية

36:12العالم . حسنًا ، أعتقد

36:13أننا نريد فقط اختيار

36:15أسوأ الحالات .

36:17>> رائع . أعتقد أن لدينا

36:19وقتًا لسؤال أخير ،

36:20وسأختار هذا السؤال

36:21لأنه قد يكون أسهل أو

36:23أسرع في الإجابة . هل

36:24تُجرى القياسات بناءً

36:25على نتائج البحث غير

36:27المشروع مقابل Gemini و

36:28ChatGPT ؟ ربما سأجيب . نعم .

36:30إذا كنتم ترغبون في

36:31الإجابة على هذا

36:32السؤال .

36:32>> بالتأكيد .

36:33>> نعم .

36:34>> بالتأكيد . وقد

36:35>> نشرنا بعض المقالات

36:36على مدونتنا حول هذا

36:37الموضوع خلال العامين

36:38الماضيين . نعم ، والتي

36:40ربما يمكننا إرسالها

36:41مع هذا التسجيل أو شيء

36:42من هذا القبيل . نعم .

36:44>> ممتاز . حسنًا ، ربما

36:46سؤال أخير . دعوني أرى .

36:49حسنًا ، بالترتيب الذي

36:50قدمه الأشخاص ، كيف

36:51تقيسون قدرة الوكيل

36:53على إدراك التشبع ،

36:54والوصول إلى المستوى

36:56الأمثل من البحث مقابل

36:57ميله إلى التوقف قبل

36:59الأوان بسبب حدود

37:00نافذة السياق ، أو

37:01الاستمرار لفترة

37:03طويلة جدًا وإجراء بحث

37:04زائد ؟

37:05>> نعم ، ربما يمكنني

37:07الإجابة على هذا

37:08السؤال . أعتقد أن أفضل

37:11طريقة وجدتها للقيام

37:12بذلك هي ببساطة وجود

37:14معيار ذهبي جيد قدر

37:15الإمكان . ربما يكون

37:17هذا تهربًا ، وربما

37:17تكون هذه دائمًا أفضل

37:19طريقة لإجراء أي نوع

37:19من التقييم ، ولكن على

37:21أي حال ، إذا كانت هذه

37:22تحديدًا ، أولًا وقبل

37:23كل شيء ، أمورًا مهمة

37:24يجب مراعاتها في

37:24الإجابة ، فهذا مفيد

37:25حقًا لأنه إما أنك قد

37:26حققتها أو لم تحققها .

37:27أيضًا ، إذا كانت

37:29النتيجة سلبية ، مثلًا

37:30، إذا كان من المستحيل

37:32معرفة الإجابة

37:33الصحيحة من البيانات

37:35المتاحة ، أو إذا كانت

37:36الإجابة الصحيحة غير

37:38متوفرة ، فمن المفيد

37:39جدًا تضمينها في

37:40معايير التقييم أو

37:42أيًا كان . إليك الأمور

37:43التي يجب عليك التحقق

37:45منها للتأكد من أنها

37:46سلبية بالفعل . وأخيرًا

37:48، نعم ، أعتقد أن هذا

37:49بديهي أيضًا ، ولكن

37:51بافتراض أن لديك

37:52نظامًا ما ، فإنه سيشهد

37:54تحولات أو سيطور

37:55الإجابة بمرور الوقت .

37:56لذا ، بالطبع ، ما عليك

37:58سوى التحقق من الإجابة

37:59بعد دورة واحدة ، أو

38:00دورتين ، أو ثلاث دورات

38:02، أو بعد خمس دقائق ، أو

38:03عشر دقائق ، أو خمس

38:04عشرة دقيقة ، وملاحظة

38:06ما إذا كانت الإجابات

38:07تتحسن بمرور الوقت .

38:09>> حسنًا . ممتاز . أعتقد أن

38:11هناك سؤالين آخرين ،

38:12لكن أعتقد أننا وصلنا

38:13إلى نهاية الوقت . لذا ،

38:14نأمل أن يكون هذا

38:15مفيدًا للجميع . نقدر

38:17حقًا وقتكم الذي

38:18خصصتموه للمشاركة .

38:19نأمل أن نقدم المزيد

38:20من هذه الدورات ، لذا

38:21يُرجى إخبارنا إذا

38:21كانت هذه الدورة مفيدة

38:22، وأي ملاحظات لديكم .

38:23نود أن نجعلها أفضل

38:25لكم . شكرًا لكم مجددًا

38:26، وسنرسل التسجيل ،

38:27وندعوكم للانضمام

38:27إلينا في الندوة

38:28الإلكترونية القادمة .

38:29شكرًا جزيلًا لكم

38:30جميعًا .

Recently added transcripts

Browse the whole transcript library

This transcript was generated from the captions YouTube publishes for this video. Get the transcript of any YouTube video atfreeyoutubetranscribe.com, free, unlimited, no sign-up.