تقييم استدلال الوكلاء: قياس المنطق متعدد الخطوات ومعدلات الهلوسة في البيئات الإنتاجية
مع تطور نماذج اللغات الكبيرة (LLMs) من روبوتات الدردشة البسيطة إلى وكلاء مستقلين قادرين على تنفيذ سير عمل معقد، تغيرت مقاييس النجاح بشكل كبير. في الأيام الأولى للذكاء الاصطناعي التوليدي، كانت الدقة في الأسئلة ذات الدوران الواحد كافية. اليوم، في البيئات الإنتاجية، نحتاج إلى تقييم سلسلة التفكير التي تؤدي إلى إجراء نهائي. كيف نضمن أن الوكيل لا يقوم بالتخمين فقط؟ وكيف نقيس قدرته على الحفاظ على الحالة والمنطق عبر خطوات متعددة مع تقليل الهلوسة الخطيرة؟