المقاييس الثابتة مقابل الديناميكية: لماذا تفشل لوحات المتصدرين في التنبؤ بأداء نماذج اللغات الكبيرة في العالم الحقيقي
إذا كنت مهندس ذكاء اصطناعي أو مطوراً، فمن المرجح أنك تقضي وقتاً طويلاً في الاطلاع على لوحات المتصدرين مثل Hugging Face Open LLM Leaderboard أو BigCodeBench. توفر هذه المقاييس طريقة موحدة ومريحة لمقارنة نماذج اللغات الكبيرة (LLMs). ومع ذلك، فإن الاعتماد عليها وحدها...