بنچمارکهای ایستا در برابر پویا: چرا جدولهای رتبهبندی استاندارد عملکرد مدلهای زبانی بزرگ در دنیای واقعی را پیشبینی نمیکنند
اگر مهندس یا توسعهدهنده هوش مصنوعی هستید، احتمالاً زمان زیادی را صرف بررسی جدولهای رتبهبندی مانند Hugging Face Open LLM Leaderboard یا BigCodeBench میکنید. این معیارها راهی راحت و استاندارد برای مقایسه مدلهای زبانی بزرگ (LLMs) ارائه میدهند. با این حال، تکیه صرف بر این امتیازات ایستا...