التقييم البشري القابل للتوسع: التخفيف من تحيز نماذج اللغة الكبيرة
مع تزايد دور نماذج اللغة الكبيرة (LLMs) في سير عمل المؤسسات، تزداد الحاجة إلى تقييم بشري صارم. غالبًا ما تفشل المقاييس الآلية مثل الاحتمالية أو BLEU في التقاط الدقة أو السمية أو الدقة الواقعية. يوفر التقييم البشري في الحلقة (HITL) الحقيقة المرجعية، لكن توسيع نطاقه ي...