صعود التتبع الدلالي: تقييم قدرات التفكير في الذكاء الاصطناعي بما يتجاوز الرموز
قيود المقاييس التقليدية لطالما كانت المقاييس القياسية لتقييم أداء نماذج اللغات الكبيرة (LLM) بدائية. اعتمدنا بشكل كبير على عدد الرموز، وزمن الاستجابة، ومطابقة السلاسل النصية البسيطة لتحديد ما إذا كان النموذج "صحيحًا". ومع ذلك، مع تطور تطبيقات الذكاء الاصطناعي من...