Full transcript
0:00أهلًا بكم جميعًا في
0:01ندوتنا الإلكترونية
0:02اليوم حول بناء
0:03تقييمات الذكاء
0:04الاصطناعي في العالم
0:05الحقيقي . اسمي شينا
0:06بالاباكا ، وأنا عضوة
0:08في فريق التسويق في
0:09شركة إليسيت ، وينضم
0:10إليّ اليوم اثنان من
0:12أعضاء فريق التقييم ،
0:13وهما بن وبراديو .
0:14سأمنحهما فرصة لتقديم
0:16نفسيهما ، ولكن لمن لا
0:18يعرف إليسيت أو من نحن
0:19، فهي منصة ذكاء
0:21اصطناعي مُصممة
0:22خصيصًا لتجميع الأدلة
0:24بدقة . هدفنا كشركة هو
0:25تمكين التجميع الدقيق
0:27واتخاذ القرارات
0:28المعقدة في العالم .
0:30لذا ، أنا متحمسة جدًا
0:31لانضمامكم إلينا
0:33اليوم . الآن ، سأترك
0:34المجال لبن وبراديو
0:36لتقديم أنفسهما
0:37بإيجاز .
0:38>> رائع . شكرًا لكِ يا
0:40شينا . أجل ، أنا بن .
0:42أقود فريق التقييمات
0:43في إليسيت ، وأعمل في
0:45هذا المجال منذ ثلاث
0:46أو أربع سنوات . تفضل يا
0:48براديو .
0:49>> أهلًا بكم جميعًا ، أنا
0:50براديو . أعمل في شركة
0:52Elicit منذ أغسطس الماضي ،
0:53وأعمل على تقييمات
0:55منتج مراجعة الأدبيات
0:56لدينا .
0:57>> رائع ! حسنًا ، لدينا
0:58اليوم ندوة عبر
0:59الإنترنت من Genpact .
1:01هدفنا هنا هو أن تكون
1:02هذه الندوة تفاعلية
1:03قدر الإمكان . سنتحدث
1:04عن بعض النقاط التي
1:05أعددناها ، ولكن إذا
1:07كانت لديكم أي أسئلة ،
1:08فلا تترددوا في طرحها
1:09في الدردشة على الجانب
1:10الأيمن . سنخصص بعض
1:11الوقت في النهاية
1:12للإجابة على بعض
1:14أسئلتكم . لا تترددوا ،
1:15فليس هناك سؤال سيئ ،
1:16لذا تفضلوا باستخدام
1:18الدردشة وقتما تشاؤون .
1:19رائع ! لنبدأ . ربما فقط
1:21لتوضيح السياق ، نسمع
1:23كلمة " تقييم " تُستخدم
1:24كثيرًا ، خاصة مع
1:25ازدياد استخدام
1:26الذكاء الاصطناعي ،
1:28ولكن كنت أتساءل ، يا
1:29بن ، هل يمكنك شرح ما هي
1:30التقييمات ؟
1:31>> حسنًا ، أستخدم مصطلح "
1:33elicit " للإشارة إلى
1:35محاولتنا معرفة مدى
1:37جودة نموذج أو نظام
1:39ذكاء اصطناعي لمهمة
1:40معينة . وقد يكون ذلك
1:42مجرد كتابة شيء ما في
1:44أداة ذكاء اصطناعي
1:45والاطلاع على الإجابة
1:47، أو قد يصل الأمر إلى
1:48إجراء نوع من التقييم
1:50الآلي المعقد والقابل
1:51لإعادة التشغيل
1:53باستخدام الذكاء
1:54الاصطناعي لتقييم
1:55المخرجات .
1:58>> رائع ! هل لديك أي إضافة
2:00يا براديب ، أم أنه قد
2:01أوضح ذلك جيدًا ؟
2:02>> أعتقد أن بن قد فهم ذلك
2:04.
2:04>> أحسنت يا بن . رائع !
2:06حسنًا ، بالنظر إلى
2:07رسائل البريد
2:08الإلكتروني في سياق
2:09تطوير الذكاء
2:10الاصطناعي ، ومع
2:11استمرار تحسن نماذج
2:12البنية التحتية
2:13باستمرار ، كيف تعتقد
2:14أن الفرق التي تعمل
2:15على رسائل البريد
2:16الإلكتروني اليوم
2:17يمكنها تحقيق أفضل
2:18أداء ممكن في المهمة
2:19الأكثر أهمية بالنسبة
2:21لها ؟ هل ينبغي عليهم
2:22استخدام نموذج أفضل ؟
2:23هل ينبغي عليهم
2:24استخدام بنية تحتية
2:25أفضل ؟ وهل يمكنك وصف
2:26ما هي البنية التحتية ؟
2:27أم أن هناك أي شيء آخر
2:29ينبغي عليهم مراعاته ؟
2:30>> نعم ، البنية التحتية
2:32هي في الأساس الهيكل
2:33المحيط بالنموذج . إنها
2:35جميع التعليمات التي
2:36تُعطى للنماذج ، وجميع
2:37الأدوات التي تُعطى
2:39للنموذج . إنها كل شيء
2:40يحيط بالنموذج . وبشكل
2:42عام ، لاحظنا في هذا
2:43المجال أن النماذج
2:45تتحسن باستمرار ، بل
2:46وتتطور بسرعة كبيرة .
2:48لذا ، ينبغي أن يكون
2:50هذا هو توقعك الأساسي
2:51بأن هذه النماذج تتحسن
2:53. وإلى حد ما ، يمكن
2:54للأدوات الأفضل أن
2:56تُحسّن أداء النماذج .
2:58فمن الممكن تزويد
2:59النموذج بأدوات لأمور
3:01يستطيع القيام بها
3:02وأخرى لا يستطيع . ومن
3:04الممكن توجيهه بطرق
3:08تُحسّن أداءه ، وهكذا .
3:10ولكن مع مرور الوقت
3:12وتحسن النماذج ، يصبح
3:14أداء النموذج أهم
3:16بكثير من الأدوات التي
3:18تُزوّده بها . لذا ، فإن
3:20الأهم من مجرد أداء
3:21النموذج هو قدرتك على
3:23معرفة ما تريده من
3:25النماذج ، وقياس ذلك ،
3:27وتوجيه أدائها نحو
3:29النتائج المرجوة . وهنا
3:31تكمن أهمية التقييمات
3:33، لأن الخطوة الأولى
3:35لتحسين أداء النماذج
3:37هي قياسه . ولقياس أداء
3:39النموذج ، عليك أن تعرف
3:42النتيجة المرجوة منه
3:43بدقة . لذا ، أعتقد أن
3:46خطوتك الأولى لحل
3:47مشكلتك هي معرفة ما
3:49تريده ، وقياسه ، ثم
3:51النظر في كيفية توظيف
3:52الأدوات لتسخير
3:54النموذج ، مما يُحفز
3:56استخدام جميع
3:57التقنيات الأخرى هنا .
4:00>> ممتاز . هذا مفيد
4:02للغاية . إذا فكرت في
4:03الأمر عمليًا ، هل هناك
4:05حالات يكون فيها فريق
4:06ما واثقًا من نظام
4:07الذكاء الاصطناعي
4:08أكثر مما ينبغي ؟ كأن
4:09يكون لديه ثقة زائفة .
4:11وإذا كان الأمر كذلك ،
4:12فلماذا تعتقد أن هذا
4:13قد يكون ؟ ربما سأُحيل
4:14الأمر إلى بن .
4:15>> أجل . أعتقد أنني رأيت
4:17هذا ، وأعتقد أن أحد
4:19الأسباب الرئيسية هو
4:20أن شركات الذكاء
4:21الاصطناعي ، عندما
4:23تُدرّب هذه النماذج ،
4:24تُحاول جعل الإجابات
4:26تبدو جيدة قدر الإمكان
4:28للمستخدم . وهي تفعل
4:29ذلك بناءً على ملاحظات
4:30المُعلّقين الذين
4:32يُراجعون إجاباتهم ،
4:33والذين ربما لا
4:34يُدقّقون في الإجابة
4:35بعمق كامل . إنهم
4:36يُعطونها فقط إشارة
4:38سريعة بالموافقة أو
4:39الرفض . لذلك أعتقد أنه
4:40من السهل الحصول على
4:41إجابات تبدو جيدة جدًا
4:43ولكنها ليست كذلك ، بل
4:44بها نقاط ضعف . على سبيل
4:45المثال ، سأتزوج بعد
4:47أسبوعين ، وكنت أستخدم
4:48برنامج Claude مؤخرًا
4:49لكتابة بعض عهود
4:50الزواج . كنت أستخدمه
4:51مع خطيبي ، وفي البداية
4:53أعجبنا كثيرًا ، وقلنا :
4:54" لنقل هذا بالضبط في
4:55حفل زفافنا " . ثم دققنا
4:56النظر ، وقلنا : " لحظة !
4:58النصّان الثاني
4:59والثالث هما نفس الشيء
5:00ولكن بصياغة مختلفة " .
5:02وهكذا . أعتقد ،
5:03وبالتأكيد مررت بهذه
5:04التجربة مع ميزة "
5:05العمق " في برنامج Word
5:06أيضًا . من
5:07>> المضحك أن برنامج Claude
5:09أو Copilot يجبرك على
5:10الالتزام بأشياء
5:11يريدها منك . هذا مثال
5:13رائع . ولننتقل إلى
5:15أمثلة واقعية ، عندما
5:16نفكر في قياس الأداء ،
5:18غالبًا ما تبدأ الفرق
5:19بقياس الأداء ثم تفترض
5:21أنها انتهت بمجرد
5:22الانتهاء من ذلك .
5:23برأيك ، ما الذي تعلمته
5:25عن الفجوة بين قياس
5:26الأداء بهذه الطريقة
5:27والأداء الفعلي ؟ أين
5:29تكمن الفجوات
5:30والمفاضلات ؟ بارت ،
5:31ربما يمكنك مناقشة هذا
5:32الأمر .
5:33>> أجل ، أعتقد أنه عند
5:34التفكير في الأمر ، فإن
5:36الخطوة الأولى هي
5:37إنشاء معيار مرجعي .
5:38ويتكون هذا المعيار من
5:39جزأين : الأول هو تحديد
5:41الأسئلة التي تطرحها
5:42على أنظمة الذكاء
5:43الاصطناعي ، والثاني
5:44هو التأكد من امتلاكك
5:46للإجابات الصحيحة
5:47للتحقق منها . وكلا
5:48هذين الأمرين قد يؤدي
5:50إلى خطأ المعيار
5:51المرجعي . ومن الأخطاء
5:55الشائعة أن تكون
5:56الأسئلة المطروحة في
5:58المعيار المرجعي غير
5:59مرتبطة أو غير مطابقة
6:01لتلك التي يتوقع
6:02المستخدمون استخدامها
6:04في بيئة الإنتاج . فإذا
6:06كان المستخدمون
6:07يسألون عن مواضيع
6:08معقدة ، بينما أسئلة
6:10المعيار المرجعي
6:11بسيطة للغاية ، فهذا
6:13مؤشر على أن المعيار
6:14لا يؤدي الغرض المطلوب
6:16منه . وهذا ما يُسمى
6:17بالصلاحية الخارجية .
6:19هل معيارك صالح
6:20للاستخدام في العالم
6:21الخارجي ؟ بعد ذلك ، حتى
6:23لو كانت أسئلتك صحيحة ،
6:25عليك التأكد من اختبار
6:27ما تريد اختباره فعلاً
6:29. لنفترض أنك تطلب من
6:30النموذج أو نظام
6:31الذكاء الاصطناعي
6:32البحث عن بعض الأبحاث .
6:34لكن في الواقع ، إذا
6:35كان الذكاء الاصطناعي
6:36يعرف جميع المعلومات
6:37بنفسه ولم يبحث فعليًا
6:38في تلك الأوراق ، فأنت
6:39تختبر فقط قدرته على
6:40استرجاع معلوماته
6:41السابقة وليس قدرته
6:42على البحث . وهذا ما
6:44يُسمى بصحة البناء . هل
6:46يقيس مقياسك الشيء
6:47الذي تريد اختباره
6:49فعلاً أم تختبر شيئًا
6:50آخر ؟ وهاتان طريقتان
6:52شائعتان للخطأ . من
6:53الواضح أن قياس الأداء
6:55ليس علمًا دقيقًا .
6:59أفضّل تسميته حرفة
7:00أكثر من كونه علمًا ،
7:02لكن هاتين الطريقتان
7:03الأكثر شيوعًا للخطأ .
7:05نعم ،
7:06>> أتفق تمامًا ، إنه إطار
7:08عمل عام ، وأعتقد أن
7:09الصلاحية الخارجية
7:10وصحة البناء أداتان
7:11مفاهيميتان مفيدتان
7:13للغاية . ولنأخذ مثالًا
7:14واحدًا على نوع الخطأ
7:16الذي قد يحدث هنا .
7:18أعتقد أن شركات الذكاء
7:19الاصطناعي تركز نوعًا
7:21ما على معايير بسيطة ،
7:22مثل الإجابة على
7:23الأسئلة البسيطة أو حل
7:25المهام التي يمكن
7:26التحقق من مخرجاتها
7:28بطريقة بسيطة ، مثل
7:29أنواع معينة من مهام
7:30البرمجة ، على سبيل
7:31المثال . لكن المهام
7:33الحقيقية التي تؤديها
7:34في وظيفتك على الأرجح
7:35أكثر تعقيدًا من ذلك ،
7:37وكذلك الطرق التي ترغب
7:38في استخدام الذكاء
7:39الاصطناعي فيها . وإذا
7:40ركزت على تلك المهام
7:42المعيارية ، فقد
7:43تُعطيك انطباعًا
7:44خاطئًا عن مدى فائدة
7:46الذكاء الاصطناعي لما
7:47تحاول القيام به .
7:49وأعتقد أن هذا يتفاقم
7:50أيضًا لسهولة تدريب
7:51الذكاء الاصطناعي على
7:53هذه المهام البسيطة
7:54لأن التغذية الراجعة
7:55للتدريب تكون أكثر
7:56مباشرة . لذا ، من
7:57الممكن أن تنغمس في
7:59عالم المهام
7:59المعيارية دون أن
8:01تتعرف على مدى فعالية
8:02الذكاء الاصطناعي في
8:04وظيفتك الحقيقية .
8:06>> حسنًا ، في هذا السياق ،
8:08إذا كنت تُقدم نصيحة
8:10لفريق يُنشئ أول
8:11مجموعة تقييم له ، كيف
8:13ستساعدهم على التفكير
8:15في اختيار أمثلة
8:16وحالات اختبار
8:17تمثيلية لبناء تلك
8:19المجموعة بشكل صحيح ؟
8:22>> سأبدأ بتكرار ما قاله
8:24برادي سابقًا ، وهو أن
8:26أول شيء هو تحديد
8:27كيفية استخدام الذكاء
8:29الاصطناعي في وظيفتك .
8:31لذا ، أعتقد أن الطريقة
8:33المثلى للقيام بذلك ،
8:34سواء كنت تُطوّر أو
8:35تُقيّم أداةً ما لنفسك
8:37أو لزملائك في العمل
8:38كمستخدم نهائي ، هي
8:39البدء باستخدام أداة
8:40الذكاء الاصطناعي
8:42بشكل يومي والتفكير
8:43باستمرار : " أثناء عملي
8:44على هذه المهمة ، هل
8:45يُمكنني الاعتماد على
8:47الذكاء الاصطناعي
8:48لإنجازها ؟ " وتجربة
8:49أكبر عدد ممكن من
8:51الأشياء . كنقطة انطلاق
8:54، ستحصل على مجموعة من
8:56الأمثلة التي يُمكنك
8:57استخدامها لاختبار
8:58أدوات مختلفة . أعتقد
9:00أن الأمر أصعب إذا كنت
9:02في وضعنا ، أو ربما
9:03وضعك أنت إذا كنت تعمل
9:05في مجال المشتريات أو
9:07ما شابه في مؤسستك ،
9:08حيث لا تُطوّر أداةً
9:10لنفسك ، بل تُطوّرها
9:12لعميل داخلي أو خارجي .
9:14في هذه الحالة ، أعتقد
9:15أنه عليك التحدث معهم
9:17كثيرًا ، ومحاولة
9:18إقناعهم باستخدامها
9:19بشكل يومي ، والاطلاع
9:21على الأمثلة العملية .
9:23>> نعم ، لذا ، من المهم
9:25التركيز على
9:26الاستخدام الواقعي
9:27لبناء حالات الاختبار .
9:29أعتقد أننا في إليسا
9:30نتعامل في كثير من
9:32أعمالنا مع مؤسسات
9:33بالغة التعقيد تستخدم
9:35إليسا لاتخاذ قرارات
9:37بالغة الأهمية ، وإن لم
9:38تكن بسيطة . ومن
9:40التحديات التي
9:41نواجهها أن أساليب
9:42العمل المتبعة لا تضمن
9:44بالضرورة الإجابة
9:46الصحيحة ، فالأمر معقد
9:47للغاية . فكيف نقيّم
9:50النتائج عندما تكون
9:52جودتها أو مخرجاتها
9:54ذاتية أو متعددة
9:55الأبعاد ؟
9:58>> نعم ، أعتقد أن هذا
10:00سؤال صعب . أحد الحلول ،
10:02وإن كان بسيطًا ، هو
10:03اختيار إجابتين
10:05محتملتين ثم القول إن (
10:07أ ) أفضل من ( ب ) أو العكس
10:09، ونلجأ أحيانًا إلى
10:11هذا الحل عندما يكون
10:12لدينا قرار واضح بعد
10:14حصر الخيارات في اثنين
10:16. وهذا أبسط مثال . لكن
10:19معظم الحالات التي
10:20نواجهها ليست كذلك ،
10:22وقد تتضمن أسئلة أكثر
10:23تعقيدًا . ومن الحلول
10:25الممكنة وضع معايير
10:26تقييم . إذا كنت خبيرًا
10:28، يمكنك أن تسأل نفسك : "
10:29ما هي معايير الإجابة
10:31الجيدة هنا ؟ ما معنى
10:32أن نقول إن هذه
10:33الإجابة جيدة مقابل
10:34أنها سيئة ؟ " أو إذا لم
10:36تكن كذلك ، يمكنك
10:36التحدث إلى خبراء في
10:37المجال للحصول على هذه
10:39المعلومات . يمكنك
10:40تحويل هذه المعايير
10:41إلى خطة تقييم لنموذج
10:42اللغة الخاص بك ، وطلب
10:44تقييم الإجابة بناءً
10:45عليها . من الأمور
10:46المهمة جدًا التأكد من
10:48معايرة نموذج التقييم
10:49الخاص بك ليتوافق مع
10:50آراء الخبراء . إذا رأى
10:51الخبراء أن إجابة ما
10:52جيدة ، فيجب أن يؤكد
10:53نموذج التقييم أنها
10:54جيدة أيضًا . وإذا رأى
10:55الخبير أنها سيئة ،
10:56فيجب أن يؤكد نموذج
10:57التقييم أنها سيئة .
10:58يجب أن يكون هناك رابط
10:59بين ما يقوله مُقيّم
11:01نموذج التقييم وما
11:02يقوله الخبراء .
11:03وبالطبع ، هناك الكثير
11:04من التفاصيل الدقيقة
11:05في صياغة هذه المعايير
11:06بشكل جيد . عليك توضيح
11:07ماهية هذه المعايير ،
11:09وعدم منح النموذج
11:10احتمالات كثيرة . لذا ،
11:11عادةً ما يكون الجواب
11:13الواضح بنعم أو لا
11:14أفضل من مقياس من 20
11:15نقطة ، حيث يكون تقييم
11:17شيء ما بخمس أو عشر أو
11:18ست نقاط من 20 غير واضح
11:20تمامًا . وعمومًا ، نرغب
11:22في التأكد من أن هذه
11:23المعايير تتوافق مع
11:25الواقع . فكلما زادت
11:27دقة تقييمنا لشيء
11:28حقيقي ، شيء يؤثر على
11:30النتائج التي تهمنا ،
11:32زادت ثقتنا في فعالية
11:34معاييرنا .
11:35>> نعم . وربما للمتابعة
11:37في هذا ، أتفق تمامًا
11:38مع كل ما سبق . وآمل
11:39أنكم تجرون هذا
11:40التقييم على تلك
11:41الأمثلة الواقعية
11:42التي جمعتموها . وآمل
11:43أن يكون لديكم فهم جيد
11:44لكل مثال منها ، بحيث
11:46تعرفون ما الذي أحتاجه
11:47من الذكاء الاصطناعي
11:48لدعم عملي ، ولتحسين
11:51أدائي أو تسريعه .
11:53وبالتالي ، يصبح من
11:54الواضح لكم ما إذا كان
11:56الذكاء الاصطناعي قد
11:57أدى المهمة بشكل صحيح
11:58أم لا ، على الرغم من
11:59تعقيدها . إما أن هذا
12:01سيساهم في تطوير عملي
12:02أو لا .
12:03>> رائع . نعم ، هذا منطقي
12:05جدًا . وأعلم أننا في
12:07شركة إليسيت نؤمن
12:08إيمانًا راسخًا بأن
12:10التقييم لا ينبغي أن
12:11يقتصر على المخرجات
12:13فحسب ، بل يجب أن يشمل
12:14أيضًا تقييم العملية
12:16التي يتبعها النموذج
12:17للوصول إلى تلك
12:18المخرجات . وأود أن
12:20أعرف المزيد عن سبب
12:21اعتقادك بضرورة تقييم
12:23العملية بنفس القدر ،
12:25إن لم يكن أكثر ، من
12:26تقييم المخرجات
12:27النهائية . حسنًا ،
12:30>> على المستوى العام ،
12:32يصعب تقييم المخرجات ،
12:34ويصبح ذلك مستحيلاً
12:35كلما ازدادت تعقيدًا ،
12:37وكلما ازداد دمج
12:39الذكاء الاصطناعي في
12:41عملية صنع القرار .
12:42فعند محاولة اتخاذ
12:44قرار معقد بشأن المضي
12:46قدمًا في مشروع ما ،
12:47نعلم نحن البشر ، عند
12:49تقييم مخرجاتنا أو
12:51مخرجات زملائنا ، أننا
12:52لا نستطيع الجزم
12:54بالنتيجة النهائية ،
12:55وفي النهاية نتخذ أفضل
12:57قرار ممكن . وينطبق
12:59الأمر نفسه على مخرجات
13:00الذكاء الاصطناعي .
13:02بالطبع ، يمكن للذكاء
13:03الاصطناعي أن يكون
13:04مفيدًا للغاية في
13:05اتخاذ القرارات
13:06المصيرية ، ولذلك نسعى
13:08إلى إيجاد طريقة
13:09لتقييمه . لذا ، يُعدّ
13:11تقييم عملية الذكاء
13:12الاصطناعي طريقةً
13:13جيدةً لفهم مدى فائدة
13:15مخرجاته التفاعلية .
13:17لنأخذ مثالًا واحدًا
13:19لتوضيح الأمر بشكلٍ
13:20ملموس . هذا مثال بسيط
13:22جدًا ، لكننا نؤمن بشدة
13:24بأهمية توثيق الذكاء
13:26الاصطناعي لمصادره
13:28بدقة في إجابته .
13:30ستلاحظ ، عند استخدام
13:32Illicit ، أنه يُقدّم
13:33اقتباساتٍ من المصادر
13:35لدعم كل ادعاء يُقدّمه
13:37. نعتقد أن هذا مهمٌ
13:43جدًا لأنه يُظهر عملية
13:45جمع المعلومات من
13:47المصادر ، وتحليلها ،
13:49ثمّ تركيبها بطريقةٍ
13:51واضحةٍ تُتيح لك معرفة
13:53مصدر كل معلومة . لذا ،
13:56هذا ما نرغب في تقييمه
13:58من حيث العمليات : هل
13:59الادعاءات مدعومةٌ
14:00بالفعل بالاقتباسات ؟
14:02هل جميع الادعاءات
14:03مدعومةٌ باقتباسات ؟
14:04هذا جانبٌ مهم . ثم ،
14:06أعتقد أن من مزايا
14:08استخدام الاقتباسات
14:09تحديدًا ، والتي تنطبق
14:10أيضًا على العديد من
14:11العمليات الأخرى التي
14:13قد تُقيّمها ، أنها
14:14تُساعدك على التحقق من
14:15صحة الإجابة . قبل أن
14:16تقول : حسنًا ، هذه
14:17الاقتباسات تدعم هذا
14:19الادعاء ، يمكنك أولًا
14:20أن تسأل : هل تدعم
14:21الاقتباسات هذا
14:22الادعاء فعلاً ؟ ثم
14:23يمكنك أن تقول : ثق
14:24بالاقتباسات . بالتالي
14:26، يمكنك التحقق من صحة
14:27الإجابة والقدرة على
14:29تأكيدها أو رفضها .
14:32ولعلّ هناك سببًا آخر
14:34لتقييم العمليات ، وهو
14:36أنك قد تضطر أحيانًا
14:38إلى ذلك . أحد الأسباب
14:39هو أنك تحاول استخدام
14:41الذكاء الاصطناعي ، أو
14:42أنك تستخدمه بالفعل ،
14:44في أمر له عملية محددة
14:45، ربما تفرضها الجهات
14:47التنظيمية . على سبيل
14:48المثال ، إذا كنت
14:49تستخدم الذكاء
14:50الاصطناعي لإجراء
14:51مراجعة منهجية
14:52للأدبيات . سبب آخر قد
14:53يكون إذا كان لدى
14:54فريقك عملية تعتقد
14:55أنها فعّالة للغاية ،
14:56وتريد التأكد من أن
14:58الذكاء الاصطناعي
14:59يُطبّق هذه العملية .
15:00قد يكون هذا سببًا آخر
15:02يدفعك إلى التأكد من
15:03أنه اتبعها بالفعل
15:04بدلًا من مجرد ذكرها
15:05ظاهريًا .
15:07>> نعم ، إنها أمثلة مفيدة
15:08للغاية ، خاصةً فيما
15:09يتعلق بالمتطلبات
15:11التنظيمية . أعلم أن
15:12هذا الموضوع طُرح
15:13كثيرًا مع سعي
15:14الصناعات الجديدة
15:15لفهم كيفية استخدام
15:16الذكاء الاصطناعي في
15:17سياق اللوائح القائمة
15:19التي يجب عليها
15:20الالتزام بها . أعلم أن
15:21لدينا بعض الأسئلة من
15:22الحضور ، وسأؤجل
15:23الإجابة عليها إلى
15:25النهاية . أعتقد أن
15:26لدينا سؤالين آخرين
15:27سأجيب عليهما ، شكرًا
15:28جزيلًا لكم على إرسال
15:30أسئلتكم . استمروا في
15:31إرسالها ، وسنحرص
15:32بالتأكيد على الإجابة
15:33عليها . حسنًا ، عندما
15:34تتحدثون عن العودة إلى
15:36القصص والتقييمات ،
15:37يبدو أنها مفيدة ، لكن
15:39هل سبق لكم أن واجهتم
15:40موقفًا أعطاكم فيه
15:41التقييم معلومات
15:42خاطئة ؟ كأن يكون
15:44التقييم قد ضللكم .
15:45أتساءل إن كان هذا قد
15:47حدث لكم ، وماذا حدث ،
15:49وماذا تعلمتم من ذلك ؟
15:50>> نعم ، بالتأكيد . مرات
15:53عديدة . وأعتقد أن أحد
15:58الأنماط التي
15:59لاحظناها هو أننا نحصل
16:01على بيانات من مصادر
16:03متخصصة ، ربما من معيار
16:05مرجعي أو من خبير
16:07نتعاون معه . وسنفترض ،
16:09أجل ، أن هذا الشخص
16:11خبير أو أنه بذل جهدًا
16:12كبيرًا في هذا المعيار
16:13. لقد حاول أن يؤدي
16:14عملًا جيدًا للغاية .
16:15لا بد أن يكون صحيحًا .
16:17إذا اختلف الذكاء
16:18الاصطناعي ، فذلك
16:18ببساطة لأنه مخطئ . هذا
16:20ما نفترضه . ثم سننظر في
16:21الأمر بتمعن ، وسنقول :
16:22حسنًا ، لنُمعن النظر
16:24فيه قليلًا . سننظر في
16:25إجابة الذكاء
16:25الاصطناعي وإجابة
16:27الإنسان . سنقول : في
16:28الواقع ، أغفل الإنسان
16:29شيئًا ما لاحظه الذكاء
16:31الاصطناعي . عندها
16:33سنحتاج إلى إعادة
16:35تقييم الإجابة . لذا ،
16:36أعتقد أن هذا نمط شائع
16:38ومفيد عند تصميم
16:39الصمامات ، فمن الرائع
16:41بالطبع الحصول على
16:42إجابات معيارية من
16:44الخبراء . ولكن مع
16:45التطور الكبير الذي
16:46وصلت إليه تقنيات
16:47الذكاء الاصطناعي هذه
16:48الأيام ، أعتقد أنه من
16:50المهم جدًا إعادة
16:51تقييم صحة واكتمال تلك
16:52الإجابات بعد الاطلاع
16:53على إجابة الذكاء
16:54الاصطناعي .
16:55>> مثير للاهتمام . حسنًا ،
16:57تمامًا مثل التحقق من
16:59دقة الخبراء أنفسهم في
17:01المقام الأول . رائع .
17:03حسنًا ، لنختتم حديثنا
17:05ببعض النصائح للجمهور
17:06بناءً على خبرتك . ما هي
17:08إحدى ممارسات التقييم
17:10التي تعتقد أنها حققت
17:12قيمة كبيرة من حيث
17:13الجهد المبذول فيها ؟
17:16>> نعم . أحد الأمور التي
17:18نصر عليها هو أنه عند
17:20مشاركة نتيجة تقييم
17:21داخليًا على الأقل ،
17:22يجب مشاركة جميع
17:24مستويات التحليل
17:25والبيانات التي
17:26استندت إليها تلك
17:27النتيجة . قد تكون
17:28النتيجة الرئيسية مثل :
17:30" الإصدار أ أفضل بنسبة
17:325 % من الإصدار ب " . ولكن
17:34يجب أن يرتبط ذلك بشرح
17:36ما قمت به ، ثم التحليل
17:38، وأخيرًا البيانات
17:40الأولية . وجدنا أن هذا
17:42مهم لأنه يحقق عائدًا
17:43جيدًا على الاستثمار ،
17:45لأنه سهل نسبيًا ، أو
17:46يجب أن يكون سهلًا
17:47نسبيًا . إذا لم يكن
17:49كذلك ، فربما تقوم
17:50بتخزين بياناتك
17:51بطريقة غير فعالة .
17:54وهذا يسمح ، ولكن من
17:55السهل جدًا ارتكاب خطأ
17:57ما في التقييم . سواء
17:59كان ذلك خطأ في اتجاه
18:01البناء كما ذكر
18:02المشروع سابقًا ، أو
18:03مجرد خطأ في
18:04الإحصائيات أو عكس بعض
18:06الإشارات . من المهم
18:07جدًا التحقق من نتائج
18:09التقييم . أعتقد أننا
18:10نتخذ موقفًا متشككًا
18:12للغاية عندما يقول أي
18:13شخص ، سواء داخليًا أو
18:15خارجيًا ، أن تقييمنا
18:16يُظهر أن ( أ ) أفضل من ( ب )
18:18. ومشاركة كل هذه
18:19البيانات والتحليلات
18:21تُمكّننا من القيام
18:22بذلك ، خاصةً الآن بعد
18:24أن أصبح بإمكانك
18:25الاعتماد على وكيلك في
18:27تتبع هذه الوثائق .
18:28إنها
18:29>> ملاحظة أو نصيحة جيدة .
18:31في هذا السياق ، ما هو
18:33الخطأ الذي ارتكبته أو
18:35رأيته يتكرر عدة مرات
18:37داخليًا أو في تجربتك
18:39والذي تنصح الفرق
18:40بتجنبه منذ البداية ؟
18:43>> نعم ، أعتقد أن أحد
18:44الأشياء التي فعلناها
18:46هو مشاركة المقارنات
18:47الخام فقط . على سبيل
18:49المثال ، حصل ( أ ) على 50 %
18:50وحصل ( ب ) على 55 % دون أي
18:52إحصائيات . تمامًا كما
18:53لو كانت نسخة أولية من
18:54البريد الإلكتروني .
18:55لكنني أعتقد ، خاصةً في
18:57هذه الأيام ، أن ذلك
18:58غير ضروري . من السهل
19:00جدًا ، مرة أخرى ، العمل
19:01مع وكيلك لإجراء بعض
19:03التحليلات الإحصائية
19:05للمقارنة ومعرفة ما
19:06إذا كان الفرق ذا
19:07دلالة إحصائية . وقد
19:09يكون ذلك خطيرًا جدًا
19:10أيضًا ، لأنه قد يبدأ
19:12بعض الأشخاص في مؤسستك
19:13، على سبيل المثال ،
19:15بالتحمس قائلين : " أوه ،
19:16نعم ، إنه رائع " . ولكن
19:18بعد بضعة أيام ، تُجري
19:19التحليلات الإحصائية
19:20وتقول : " في الواقع ، أو
19:21تُعيد التقييم وتقول : "
19:22أوه ، هذه المرة كان
19:23أداء المجموعة ( ب ) أفضل
19:24لأن الأمر كان مجرد
19:25تباين عشوائي " .
19:28>> فهمت . رائع . حسنًا ، في
19:30الختام ، ربما لكليكما
19:31، ما هو الشيء الذي
19:33تعتقدان ، بالنظر إلى
19:34الماضي ، أن تقييمات
19:35الذكاء الاصطناعي يجب
19:37أن تقوم به اليوم ولم
19:38تكونا تعتقدانه قبل
19:40عامين ؟
19:41>> نعم ، أعتقد أن هناك
19:43أشياء كثيرة ، لكن
19:44أحدها هو النظر إلى
19:47مستويات أعلى من
19:49التجريد . قبل عامين ،
19:52لم نكن نفكر في مدى
19:53ضخامة الوكلاء ،
19:54وبالتالي لم نفكر في
19:55مدى ضرورة تقييم هذه
19:57المفاهيم التي لا وجود
19:58لها حتى في استدعاءات
20:00النماذج الفردية . الآن
20:02، في استدعاء نموذج
20:03فردي ، ما يهمك هو : هل
20:04هو وهم ؟ هل هو صحيح ؟
20:06أما في الوكيل ، ما
20:07يهمك هو : هل العملية
20:08صحيحة ؟ هل هذه النتيجة
20:09ذات المستوى الأعلى
20:10التي أهتم بها صحيحة ؟
20:12هذه أشياء لم أفكر
20:13فيها قبل عامين . وربما
20:15هناك شيء ثانٍ تأكدت
20:16منه من خلال التجربة
20:18والخطأ مرارًا
20:18وتكرارًا ، وهو النظر
20:20إلى البيانات . كما قال
20:21بن ، من المهم جدًا
20:22النظر إلى ما ما تفعله
20:24صحيح . ورغم أنني كنت
20:25أعرف ذلك قبل عامين ،
20:27لم أكن أؤمن به بشدة ،
20:28أما الآن فأنا أؤمن به
20:29إيمانًا راسخًا . ماذا
20:32عنك يا إيفان ؟ أجل ،
20:34أعتقد أنه حتى بعد
20:35مرور أكثر من عامين ،
20:37لاحظت خلال السنوات
20:38الثماني أو التسع أو
20:40العشر الماضية من عملي
20:41في شركة Ought والمنظمة
20:43السابقة لها ، أن
20:44الذكاء الاصطناعي
20:45أصبح أكثر فأكثر فائدة
20:47في عمليات التقييم . في
20:48البداية ، كنا نعتمد
20:50على البشر في كل شيء ،
20:51بالطبع . كان ذلك في
20:53أيام GPT - 2 . ثم وصلنا إلى
20:55مرحلة أصبح فيها
20:56الذكاء الاصطناعي
20:57مفيدًا إذا أعطيناه
20:59تعليمات واضحة جدًا .
21:00مثلًا : " هذا هو المعيار
21:02الذهبي لإجابة مهمة
21:03استخراج البيانات هذه .
21:04أخبرني ما إذا كانت
21:05هذه الإجابة الأخرى
21:07متطابقة معه إلى حد
21:08كبير . " الآن وصلنا إلى
21:09مرحلة ، وأعتقد أن هذا
21:11حدث خلال العامين
21:12الماضيين ، حيث أصبح من
21:13المفيد أن نقول للذكاء
21:15الاصطناعي : " هذا هو
21:16السؤال الذي طرحناه .
21:18وهذه هي الإجابة . فقط
21:20تحقق منها . " ومن المهم
21:21أن يتمتع القاضي بميزة
21:23ما على نموذج الإجابة
21:24الأصلي ليتمكن من
21:25القيام بذلك . وإلا ،
21:27فسيكون الأمر بلا جدوى
21:28. ولكن إذا منحنا
21:29القاضي ، على سبيل
21:31المثال ، معيارًا
21:32ذهبيًا ، أو نموذجًا
21:33أكثر قوة ، أو منحناه
21:34وقتًا أطول للتفكير ،
21:35فسنحصل بالتأكيد على
21:37رؤى قيّمة من هذا
21:38النوع من التحليل . لذا
21:39، نعم ، يمكنك القيام
21:40بأشياء ، وأنا متأكد من
21:41أنها ليست جديدة على
21:42أحد هنا ، ولكن يمكنك
21:43القيام بأشياء أخرى ،
21:45بما في ذلك أي شيء آخر ،
21:46الآن كما كان بإمكانك
21:47القيام به مؤخرًا .
21:48>> نعم ، قبل عامين كان
21:49العالم يبدو مختلفًا
21:50تمامًا ، على ما أعتقد .
21:52بالتأكيد . إنه لأمر
21:53رائع . شكرًا جزيلًا
21:55لكم على استيعاب بعض
21:56أسئلتي . أعلم أن لدى
21:57الحضور بالفعل بعض
21:58الأسئلة ، لذا ربما
21:59يمكننا استعراض بعضها
22:00ومعرفة ما إذا كان
22:01لديكم أي أفكار . إذن ،
22:02السؤال الأول هو : هل
22:03لديكم أي نصائح أو رؤى
22:05للاستفادة من أداء
22:06النموذج على معايير
22:07العالم الحقيقي
22:08لتحقيق نتائج أفضل
22:09للمستخدمين ؟ لا أعرف
22:11ما إذا كان أي منكما
22:12يريد الإجابة على هذا
22:13السؤال .
22:13>> يمكنني الإجابة عليه .
22:15أعتقد أنه يجب عليك
22:15استخدام Elicit بغض النظر
22:17عن نتائج المعايير .
22:18هذه نصيحتي الشخصية .
22:19لكنني أرى أن معايير
22:21مثل تقييم الناتج
22:22المحلي الإجمالي ليست
22:23بالضرورة أفضل مقياس
22:25لما يمكنك فعله
22:26كمستخدم لـ Elicit ، لأن
22:27لدينا هيكلنا الخاص ،
22:28وموجهاتنا الخاصة ،
22:30ونماذجنا المتخصصة
22:31داخل Elicit . وإذا كان
22:32تقييم الناتج المحلي
22:34الإجمالي ينطبق ، فإنه
22:35ينطبق على المهام
22:37المحددة فيه ، وهي مهام
22:38مهنية محددة . ثانيًا ،
22:40لا ينبغي دائمًا ،
22:41خاصةً مع تطور قدرات
22:43النماذج ، حيث أن
22:44النماذج " الأصغر " تُعد
22:45أيضًا جيدة جدًا في
22:46أداء المهام ، أن
22:48تستخلص استنتاجات من
22:49معايير عامة مثل تقييم
22:50الناتج المحلي
22:51الإجمالي بشأن المهمة
22:53المحددة التي تريد
22:54القيام بها . لذا ، أقول
22:56إنه يمكنك اعتبار هذا
22:57مثالًا على حدود قدرات
22:59الذكاء الاصطناعي . إذا
23:00كنت تحاول معرفة أفضل
23:01نموذج لمهمة معينة ،
23:02فسيكون تقييم الناتج
23:04المحلي الإجمالي
23:04مفيدًا جدًا . ولكن ،
23:06إذا كنت تحاول معرفة
23:07أفضل نموذج لمهمتك
23:08المحددة ، فربما عليك
23:10إنشاء بعض الأمثلة
23:11الخاصة بك ثم إجراء
23:12التقييمات عليها .
23:15>> يبدو هذا جيدًا . حسنًا .
23:17بالنسبة للسؤال
23:18الثاني ، لست متأكدًا
23:20من مدى إمكانية
23:20مناقشته ، لكن لنحاول .
23:22هل شركة Elucid من بين
23:23الشركاء المؤسسيين
23:24الذين استعادوا
23:25الوصول إلى برنامج Claude
23:263 5 التابع لشركة Anthropic
23:28بعد إغلاق الحكومة ؟
23:29وبشكل أعم ، كيف يمكن
23:30لأدوات أبحاث الذكاء
23:31الاصطناعي التي تجمع
23:32نماذج متعددة
23:33ديناميكيًا تحقيق
23:34الشفافية الكاملة لكي
23:35يعرف المستخدمون
23:36النموذج الذي يعالج
23:37طلباتهم تحديدًا ؟
23:39>> مثير للاهتمام .
23:40بالتأكيد ، يمكنني
23:41الإجابة على هذا
23:41السؤال . للإجابة على
23:42السؤال الأول ، أعتقد
23:43أنه من المقبول ببساطة
23:44أن تكون الإجابة
23:45بالنفي . سيكون ذلك
23:46رائعًا لو كان الأمر
23:47كذلك . أما بالنسبة
23:48للسؤال الثاني
23:49المتعلق بالشفافية ،
23:53فأعتقد أنني سأختلف
23:55قليلًا مع الفرضية ، إذ
23:57أعتقد أنه من المهم
23:59لنا كشركة أن نقطع
24:01وعودًا معينة
24:02لمستخدمينا ونفي بها .
24:05لكنني أعتقد أن الوعود
24:07التي نريد قطعها والتي
24:08نعتبرها الأكثر أهمية
24:10تتمحور أساسًا حول
24:11العملية التي سيتبعها
24:13نظام الذكاء
24:14الاصطناعي وجودة
24:15المخرجات . لقد تحدثنا
24:16عن بعض معايير ذلك
24:18بالفعل في هذه
24:19المحادثة . لكن على
24:20سبيل المثال ، فيما
24:21يتعلق بالعملية ،
24:22ستكون الادعاءات
24:23مدعومة باقتباسات ،
24:24وسنتبع عملية بحث
24:26دقيقة ، وما إلى ذلك .
24:27أما بالنسبة للمخرجات
24:29، فستكون دقيقة ومفيدة
24:31. لذا ، أعتقد أن هذا هو
24:35ما نريد التأكد من
24:36تقديمه ، وأعتقد أن
24:38علينا تحديد النماذج
24:40التي سنستخدمها
24:42لتحقيق ذلك ، وشرح آلية
24:44عمل هذه النماذج كجزء
24:46من شفافية العملية .
24:52حسنًا .
24:53>> سؤال آخر . هل تفكرون في
24:56استخدام المناهج
24:57القياسية النفسية في
24:59تقييم معايير الذكاء
25:01الاصطناعي ؟
25:02>> نعم ، أعتقد ذلك . من
25:05الصعب الربط بين مجال
25:06ذي خبرة واسعة
25:08كالتقييمات القياسية
25:09النفسية والذكاء
25:11الاصطناعي ، الذي
25:12يمتلك إطارًا
25:13مفاهيميًا مختلفًا
25:15تمامًا . أعتقد أن هناك
25:16بعض النقاط المشتركة .
25:18أكثر ما يهمني هو
25:19نظرية استجابة البنود
25:21، حيث يمكنك اختيار
25:22أسئلة المعيار التي
25:23تُعطى للنموذج بناءً
25:25على أدائه في الأسئلة
25:26السابقة . كما هو الحال
25:27عند إجراء اختبارات
25:28الذكاء ، حيث يُطرح
25:29عليك بعض الأسئلة . إذا
25:30أجبت عليها بشكل صحيح ،
25:32سيُطرح عليك أسئلة
25:33أصعب . لكن هذا مجرد
25:35مثال واحد . أعتقد
25:36عمومًا أنه ينبغي
25:37علينا التفكير من
25:39منظور كيفية تقييم
25:40النموذج ، واستخدام
25:41مناهج من علم القياس
25:43النفسي ، ومن مجالات
25:44أخرى في العلوم
25:45الاجتماعية ، فقط
25:46بالقدر الذي تنطبق
25:48عليه فعليًا . من
25:49المغالطات الشائعة
25:50لدينا أننا نعتقد : " هذا
25:51يُعطي نصًا مثل
25:52الإنسان . سأفعل ما
25:53يفعله الإنسان . " وهذا
25:55قد يكون صحيحًا في بعض
25:57الحالات ، لكن من المهم
25:58دائمًا التفكير في كل
26:00حالة على حدة . حسنًا ،
26:03هذا سؤال رائع يتعلق
26:04بالذكاء الاصطناعي
26:06والرياضيات . يقول هذا
26:07الشخص : " لقد لاحظتُ أن
26:08الذكاء الاصطناعي
26:09يرتكب أخطاءً كبيرة ،
26:11أو أخطاءً رياضية
26:12كبيرة ، عند تحليل
26:13الأبحاث . هل لديكم أي
26:14توصيات ، أو أي مناهج
26:15لإخراج الرياضيات من
26:16الذكاء الاصطناعي
26:17وإجراء العمليات
26:18الحسابية بأساليب غير
26:20متعلقة بالذكاء
26:21الاصطناعي ؟ "
26:24>> أعتقد أنني أستطيع
26:26الإجابة على هذا .
26:27أعتقد أن الحل يكمن في
26:28استخدام أفضل النماذج
26:30المتاحة ، واستخدام
26:31التحقق الرسمي ،
26:32ومحاولة استخدام
26:33منهجيات مثل Lean أو Arc
26:34أو ما شابه . لكن هذا
26:36ليس مجال تخصص Ellicit ،
26:37فنحن لا نتعامل مع
26:38الرياضيات . أتحدث هنا
26:40من واقع خبرتي الشخصية
26:42.
26:44>> حسنًا ، سؤالان آخران .
26:46كيف نأخذ في الحسبان
26:47التباين بين عمليات
26:48التشغيل في النموذج
26:50الاحتمالي ، أو ما
26:51يرتبط به من انحراف في
26:52الأداء مع مرور الوقت ؟
26:55حسنًا ، لنرَ . أعتقد
26:57أنه من الأفضل الإجابة
26:58بشكل مباشر . كيف نأخذ
26:59في الحسبان التباين
27:00بين عمليات التشغيل ؟
27:01نعم ، بطريقة بسيطة في
27:03معظم الأحيان في
27:04منهجنا الحالي . لذا ،
27:06من المؤكد أننا نرغب
27:07في مراعاة ذلك . أعتقد
27:09أن إحدى المغالطات
27:10التي وقعنا فيها
27:12أحيانًا ، والتي من
27:13المهم الانتباه إليها
27:15، هي افتراضنا الخاطئ
27:16بأن أداء الذكاء
27:17الاصطناعي في كل تشغيل
27:19هو نفسه أداء النظام
27:20ككل ، وأن كل التباين
27:22ناتج عن معايير النظام
27:24وما إلى ذلك ، بدلًا من
27:25كونه تباينًا
27:26عشوائيًا أو غير معروف
27:28بين التشغيلات . لذا ،
27:30نعم ، من المهم جدًا
27:31نمذجة هذا الأمر ، ونحن
27:34نستخدم نماذج بسيطة أو
27:36هرمية لهذا الغرض . أما
27:38بالنسبة لانحراف
27:39الأداء بمرور الوقت ،
27:40فلا أعتقد أن لديّ
27:41إجابة أكثر تعقيدًا .
27:43ربما لدى براشي إجابة
27:44أكثر تعقيدًا ، لكن
27:45أعتقد أن أفضل إجابة
27:46لديّ هي الاستمرار في
27:48القياس بمرور الوقت
27:49ومراقبة تغير الأداء .
27:50>> نعم ، هذا أشبه بـ " افعل
27:52دائمًا أبسط شيء " ، وهو
27:54تكرار القياسات بمرور
27:56الوقت . رائع !
27:59>> مذهل ! حسنًا ، هناك بعض
28:00النقاط الأخرى . ربما
28:01نستطيع تغطية كل هذه
28:02النقاط . انظر هنا . هل
28:04تستخدمون مقاييس ثقة
28:05الذكاء الاصطناعي
28:06للإجابات ؟ وإذا كانت
28:07الإجابة بنعم ، فما
28:09رأيكم في ذلك من حيث
28:10الدقة ؟
28:13>> هل تعتقدون أن هذا
28:14يقيس مدى ثقة الذكاء
28:16الاصطناعي بإجابته ؟
28:19>> لست متأكدًا . إذا كان
28:21بإمكان هذا الشخص
28:23توضيح ذلك ، فربما
28:25يمكنكم الإجابة على
28:26هذا السؤال .
28:28>> نعم ، يمكنكم أخذ هذا
28:30السؤال بعين الاعتبار .
28:31>> هناك طرق عديدة لقياس
28:33ثقة الذكاء الاصطناعي
28:34، والعديد من الأدوات
28:35مفتوحة المصدر
28:36والتجارية لهذا الغرض .
28:37يمكنكم استخدام
28:38احتمالات اللوغاريتم
28:40لمعرفة مدى ثقة
28:41النموذج ، أي الاحتمال
28:42الذي يقدمه لكل رمز .
28:44هناك العديد من الطرق .
28:45أعتقد شخصيًا ، ربما
28:46يكون لدى بن وجهة نظر
28:48مختلفة هنا ، أنني
28:49متشكك في قدرة هذه
28:50الطرق على التوسع
28:51لتشمل نماذج أفضل .
28:52معظم أفضل النماذج
28:53التي تحتاجون إلى هذه
28:54الثقة لها مغلقة
28:55المصدر ولا تقدم
28:56دائمًا رموزًا . وإذا
28:57قدمتها ، فإنها تقدم
28:58فقط أفضل 20 احتمالًا
29:00لوغاريتميًا . هذا هو
29:01الحد الأقصى . الأمر
29:03الثاني هو أنه حتى لو
29:04تم تزويدك
29:05بالاحتمالات ، فليس من
29:07الواضح مدى دقة
29:08معايرتها . هناك العديد
29:10من الدراسات التي
29:11تُظهر أن هذه
29:12الاحتمالات تتغير
29:13بشكل كبير بسبب التعلم
29:15المعزز من خلال
29:16التغذية الراجعة
29:17البشرية . لذا ، أقول
29:18إنها مشكلة لم تُحل في
29:20هذا المجال ، وهي : كيف
29:21نعرف مدى دقة معايرة
29:23الذكاء الاصطناعي ؟
29:24ولكن في الواقع ، هذا
29:26هو سبب استخدامك لـ
29:27Elicit ، لأننا نتخذ خطوات
29:28عديدة لضمان توضيح
29:29الأمور لك عندما تكون
29:31نماذجنا غير متأكدة .
29:32عندما تُقدم بعض
29:33الادعاءات ، نُسهل
29:34عليك التحقق من وجودها
29:36في النصوص المصدرية .
29:37لذا ، نعم ، إنها مشكلة
29:39تقنية لم تُحل ، لكننا
29:41حللناها بطرق أخرى لا
29:42تعتمد على سؤال
29:44النموذج نفسه ، بل على
29:45بناء بيئة حوله
29:47للمساعدة في حل
29:48المشكلة باستخدام
29:49أسلوب مختلف .
29:51>> نعم . أجل ، وأعتقد أن
29:52السؤال الذي طرحته كان
29:53صحيحًا ، وكنتُ أؤيده
29:54تمامًا ، وفي جوهره ،
29:55نجيب تقريبًا على
29:56السؤال الصحيح . لذا ،
29:57ربما هناك نقطة أخرى
29:59أود إضافتها . أوافقك
30:00الرأي تمامًا . أكثر ما
30:04يُثير حماسي هنا هو أن
30:05نظام الذكاء
30:06الاصطناعي يُعطي
30:08إجابة أولية ، ثم - وهذا
30:09ما نفعله في برنامج
30:11Elicit - نجعله يُشكك في
30:12تلك الإجابة . حسنًا ،
30:14ما هي الادعاءات
30:15الرئيسية ؟ ما هي
30:16الادعاءات البديلة
30:17التي قد تكون صحيحة ؟
30:18ما هي الأدلة المؤيدة
30:20والمعارضة لكل منها ؟
30:21أجل ، أعتقد أنني مهتم
30:22بشكل أساسي باستخدام
30:24الشك كأساس لمزيد من
30:26البحث ، ونأمل أن
30:27يُساعد ذلك في تحسين
30:28الإجابة أو إدراك
30:30خطئها .
30:32>> حسنًا . سؤال آخر : ما
30:34الأدلة التي تُفند
30:35ادعاءاتك الأساسية ،
30:37وكيف تُميز بين فشل
30:39الفكرة الأساسية وفشل
30:41شيء ما ، مثل قياس
30:42التقييم أو تنفيذه أو
30:44سياقه أو توقيته ؟
30:46>> لديّ فكرة حول هذا
30:47الموضوع ، وهي فكرة
30:49أخرى تتطلب بالتأكيد
30:50بعض التفسير ، ولكن
30:51لديّ فكرة سأطرحها من
30:53وجهة نظري . أعتقد أن
30:55أحد المبادئ الأساسية
30:57لمنهجية الاستنباط هو
30:58أنك تريد ، كما ذكرنا
31:00سابقًا ، التحقق من
31:01العملية أو تقييمها ،
31:03وفي النهاية تريد
31:04تدريب الذكاء
31:05الاصطناعي بناءً على
31:07تقييمات لعمليته وليس
31:09فقط بناءً على تقييمات
31:10نتائجه . لذا ، بدلاً من
31:12مجرد النظر إلى
31:13النتيجة للحصول على
31:14الإجابة الصحيحة ،
31:15تريد أن تنظر إلى
31:16كيفية وصوله إلى
31:17الإجابة وتتدرب على
31:18ذلك . نعم ، أعتقد أن سبب
31:20تفسيري للأمر بهذه
31:22الطريقة هو أن هذا شيء
31:24نحاول قياسه الآن ،
31:25ولكن لا يمكننا قياسه
31:27بشكل كامل لأنه مفهوم
31:29واسع جدًا . فعلى سبيل
31:30المثال ، نعمل حاليًا
31:32على هذا المعيار حيث
31:33نقيس مدى صحة الإجابات
31:35، ولدينا تقييم يقول : "
31:36هذه هي الإجابات
31:37الصحيحة ، هل حصل على
31:39الإجابة الصحيحة ؟ " ،
31:40وتقييم آخر يقول : " هذه
31:41هي العملية الصحيحة ،
31:43هل اتبع العملية
31:44الصحيحة ؟ " . وما نرغب
31:46برؤيته ، في الوضع
31:47الأمثل ، هو وجود ترابط
31:49قوي بين هذين الأمرين .
31:50حتى الآن ، لم نلحظ ذلك .
31:54وأعتقد أن السبب هو
31:56أننا لم نُحسن تحديد
31:58ماهية العملية
31:59المطلوبة . لذا ، هذا ما
32:01أبحث فيه حاليًا في
32:02هذا التقييم : ما هي
32:03العملية المطلوبة
32:04تحديدًا ، ومحاولة
32:06تحديدها بطريقة
32:07تُمكّننا من تقييمها
32:08بدقة . أعتقد أن ما الذي
32:11سيُبطل الفكرة
32:13الأساسية ، كما يُمكن
32:14القول ، هو أن يتمكن
32:19الناس من حل المشكلات
32:20بتقييمات قائمة على
32:22النتائج دون إجراء
32:23تقييمات قائمة على
32:25العملية . إذن ، المشكلة
32:26، كما ذكرنا سابقًا في
32:28هذا النقاش ، هي إنتاج
32:30إجابات تبدو جيدة
32:31ويعتقد الناس أنها
32:32جيدة ، لكنها في الواقع
32:34سيئة ، لأنه لا توجد
32:35طريقة لمعرفة ما إذا
32:37كانت سيئة حقًا . إذا
32:39اكتشف أحدهم ذلك
32:40بطريقة لا تُقيّم
32:41العملية ، فأعتقد
32:43حينها أننا كنا مخطئين
32:45في الأمر برمته .
32:47>> بالتأكيد ، أخبرنا إن
32:49كان لدى أحدكم نهج
32:50مختلف . حسنًا . بقي
32:52لدينا حوالي 5 دقائق .
32:54لنبدأ بهذا السؤال .
32:56كيف تتعاملون مع
32:57المعايير الذهبية
32:58للمهام التي لا تملك
32:59إجابات صحيحة واضحة ؟
33:01هل في هذه الحالات
33:02يكون نموذجكم أفضل مما
33:04يستطيع المُقيّم فهمه
33:05؟
33:06>> حسنًا ، إذا كان
33:07نموذجكم أفضل مما
33:08يستطيع المُقيّم فهمه
33:09، فعليكم ببساطة
33:10استخدام النموذج
33:11كمُقيّم . هذا هو
33:12الواقع . لكنني لا
33:13أعتقد أن هذا يحدث
33:14كثيرًا ، لكن منطقيًا
33:16هذه هي النتيجة . أعتقد
33:17أننا تحدثنا كثيرًا ،
33:19وسأحيلكم إلى تسجيل
33:20الندوة الإلكترونية
33:22حول كيفية بناء معايير
33:23تقييم جيدة . عليكم
33:25بناء معايير تقييم
33:26جيدة والتأكد من
33:27معايرتها وفقًا لما
33:29يقوله خبراؤكم . هذا هو
33:30الجواب المختصر . أما
33:32بالنسبة للإجابة
33:33المطولة ، فلا أريد
33:34تكرار ما قلتموه
33:35بالفعل ، لكن الأسئلة
33:36البسيطة والمقاييس
33:38الصغيرة ، وتخيل نفسك
33:39مكان النموذج ، كلها
33:40أمور مهمة .
33:42>> نعم ، ربما أود إضافة
33:43شيء واحد ، وهو أن
33:44الجزء الأول من هذا ،
33:46على الأقل ، يتعلق
33:47بمعايير المهام التي
33:48لها إجابات صحيحة جيدة
33:50، وهو أمر واجهناه في
33:51التقييم الذي ذكرته
33:53للتو والذي نعمل عليه .
33:55وأعتقد أن هناك بعض
33:56الأمور المفيدة في هذا
33:58الصدد . أحدها هو
33:59الحصول على آراء من
34:00عدة خبراء مختلفين .
34:02وبالتحديد ، أعتقد أنه
34:03من المفيد معرفة رأيهم
34:05في الإجابة الصحيحة ،
34:06بشكل أساسي . ولكن من
34:08المفيد أيضًا معرفة
34:09رأيهم في تقييم
34:10الإجابة ، مثلاً : " هذا
34:12تقييم ، عفواً ، حكم أحد
34:13الحكام على هذه
34:14الإجابة . ما رأيك في
34:16هذا التقييم ؟ " لأن هذا
34:17النوع من التقييم أسهل
34:19بالنسبة للمُعلِّق
34:21الخبير من " ما هي إجابة
34:22هذه المهمة الكبيرة ؟ "
34:24على أي حال ، هذه مجرد
34:26فكرة سريعة .
34:28>> رائع . حسنًا ، ما مدى
34:30فائدة اختبارات
34:31الخصومة أو أسوأ
34:32الحالات مقارنةً
34:34بمحاولة تحسين
34:35الصلاحية الخارجية ؟
34:36>> حسنًا ، أنا بحاجة إلى
34:38هذا . لست متأكدًا من
34:40وجود تناقض بين هذين
34:41الأمرين . الكثير من
34:42أمثلة المستخدمين
34:43الخارجيين ، إذا نظرت
34:44إلى ما يسألك الناس
34:45عنه بالفعل ، قد تكون
34:46أسئلة أسوأ الحالات .
34:47جزء من محاولتك
34:48الخارجية لمطابقة
34:49توزيع أسئلة
34:50المستخدمين سيكون
34:51معرفة كيف يمكن أن
34:52يتعطل هذا . ربما تكون
34:54إحدى الطرق المختلفة
34:55لتفسير السؤال هي : ما
34:56مقدار الوقت الذي يجب
34:57أن تقضيه في محاولة
34:58كسر نموذجك أو القيام
34:59بذلك ؟ هذا يشبه تمامًا
35:01سؤال ما هو الخطر الذي
35:03تراه . إذا كنت تعمل ،
35:04كما نفعل ، مع الكثير
35:05من العملاء الذين
35:06لديهم أسئلة تنظيمية
35:08أو علمية كبيرة حول
35:09هذا الأمر ، فمن المفيد
35:10التفكير في ذلك ، أليس
35:12كذلك ؟ ولكن مع ذلك ،
35:13هناك تناقص في
35:14العائدات لهذا . يجب أن
35:16تفكر في الأشياء
35:17القليلة التي قد تكسره
35:18وترى أن هناك حلولًا
35:19شاملة . لكن بعيدًا عن
35:20ذلك ، فإن محاولة قضاء
35:22كل وقتك في اختبار
35:22أسوأ الحالات ، وربما
35:23تنجح في إصلاح أسوأ
35:24الحالات ، لكن يبقى
35:25الوضع في الحالة
35:26المتوسطة سيئًا ، هي
35:27نتيجة سيئة للغاية .
35:28لذا ، أقول إن الأمر
35:29يعتمد بشكل كبير على
35:31تقديرك لعائدات إجراء
35:32المزيد من اختبارات
35:33أسوأ الحالات . وفي
35:34معظم الحالات ، تتراجع
35:36هذه العائدات بشكل حاد
35:37بعد بذل جهد بسيط .
35:39>> نعم ، أود أن أضيف
35:40باختصار ، أعتقد أنه
35:41يجب أن يكون لديك
35:43نموذجك الخاص الذي
35:44يوضح سبب أهمية
35:45التركيز بشكل غير
35:46متناسب على أسوأ
35:47الحالات . وأعتقد أن
35:49هذا ينطبق علينا ،
35:50وخاصةً في شركة إليسيت
35:52، عندما تكون أسوأ
35:54الحالات هي تلقينا
35:55نصائح سيئة للغاية حول
35:57كيفية اتخاذ قرار مهم .
35:59وأعتقد أننا سنكون أقل
36:01قلقًا بشأن تعطل
36:02النظام فجأة . نعم ،
36:04تعطل النظام فجأة
36:05وظهور رسالة " عذرًا ،
36:06خطأ " . لأن هذا كل ما في
36:08الأمر . في النهاية ، من
36:09الواضح أنك لا تريد
36:10إظهار ذلك لمستخدميك ،
36:11لكنها ليست نهاية
36:12العالم . حسنًا ، أعتقد
36:13أننا نريد فقط اختيار
36:15أسوأ الحالات .
36:17>> رائع . أعتقد أن لدينا
36:19وقتًا لسؤال أخير ،
36:20وسأختار هذا السؤال
36:21لأنه قد يكون أسهل أو
36:23أسرع في الإجابة . هل
36:24تُجرى القياسات بناءً
36:25على نتائج البحث غير
36:27المشروع مقابل Gemini و
36:28ChatGPT ؟ ربما سأجيب . نعم .
36:30إذا كنتم ترغبون في
36:31الإجابة على هذا
36:32السؤال .
36:32>> بالتأكيد .
36:33>> نعم .
36:34>> بالتأكيد . وقد
36:35>> نشرنا بعض المقالات
36:36على مدونتنا حول هذا
36:37الموضوع خلال العامين
36:38الماضيين . نعم ، والتي
36:40ربما يمكننا إرسالها
36:41مع هذا التسجيل أو شيء
36:42من هذا القبيل . نعم .
36:44>> ممتاز . حسنًا ، ربما
36:46سؤال أخير . دعوني أرى .
36:49حسنًا ، بالترتيب الذي
36:50قدمه الأشخاص ، كيف
36:51تقيسون قدرة الوكيل
36:53على إدراك التشبع ،
36:54والوصول إلى المستوى
36:56الأمثل من البحث مقابل
36:57ميله إلى التوقف قبل
36:59الأوان بسبب حدود
37:00نافذة السياق ، أو
37:01الاستمرار لفترة
37:03طويلة جدًا وإجراء بحث
37:04زائد ؟
37:05>> نعم ، ربما يمكنني
37:07الإجابة على هذا
37:08السؤال . أعتقد أن أفضل
37:11طريقة وجدتها للقيام
37:12بذلك هي ببساطة وجود
37:14معيار ذهبي جيد قدر
37:15الإمكان . ربما يكون
37:17هذا تهربًا ، وربما
37:17تكون هذه دائمًا أفضل
37:19طريقة لإجراء أي نوع
37:19من التقييم ، ولكن على
37:21أي حال ، إذا كانت هذه
37:22تحديدًا ، أولًا وقبل
37:23كل شيء ، أمورًا مهمة
37:24يجب مراعاتها في
37:24الإجابة ، فهذا مفيد
37:25حقًا لأنه إما أنك قد
37:26حققتها أو لم تحققها .
37:27أيضًا ، إذا كانت
37:29النتيجة سلبية ، مثلًا
37:30، إذا كان من المستحيل
37:32معرفة الإجابة
37:33الصحيحة من البيانات
37:35المتاحة ، أو إذا كانت
37:36الإجابة الصحيحة غير
37:38متوفرة ، فمن المفيد
37:39جدًا تضمينها في
37:40معايير التقييم أو
37:42أيًا كان . إليك الأمور
37:43التي يجب عليك التحقق
37:45منها للتأكد من أنها
37:46سلبية بالفعل . وأخيرًا
37:48، نعم ، أعتقد أن هذا
37:49بديهي أيضًا ، ولكن
37:51بافتراض أن لديك
37:52نظامًا ما ، فإنه سيشهد
37:54تحولات أو سيطور
37:55الإجابة بمرور الوقت .
37:56لذا ، بالطبع ، ما عليك
37:58سوى التحقق من الإجابة
37:59بعد دورة واحدة ، أو
38:00دورتين ، أو ثلاث دورات
38:02، أو بعد خمس دقائق ، أو
38:03عشر دقائق ، أو خمس
38:04عشرة دقيقة ، وملاحظة
38:06ما إذا كانت الإجابات
38:07تتحسن بمرور الوقت .
38:09>> حسنًا . ممتاز . أعتقد أن
38:11هناك سؤالين آخرين ،
38:12لكن أعتقد أننا وصلنا
38:13إلى نهاية الوقت . لذا ،
38:14نأمل أن يكون هذا
38:15مفيدًا للجميع . نقدر
38:17حقًا وقتكم الذي
38:18خصصتموه للمشاركة .
38:19نأمل أن نقدم المزيد
38:20من هذه الدورات ، لذا
38:21يُرجى إخبارنا إذا
38:21كانت هذه الدورة مفيدة
38:22، وأي ملاحظات لديكم .
38:23نود أن نجعلها أفضل
38:25لكم . شكرًا لكم مجددًا
38:26، وسنرسل التسجيل ،
38:27وندعوكم للانضمام
38:27إلينا في الندوة
38:28الإلكترونية القادمة .
38:29شكرًا جزيلًا لكم
38:30جميعًا .