ارزیابی انسانی مقیاسپذیر: کاهش سوگیری مدلهای زبانی بزرگ
با مرکزی شدن مدلهای زبانی بزرگ (LLM) در جریانهای کاری سازمانی، نیاز به ارزیابی انسانی دقیق افزایش مییابد. معیارهای خودکار مانند perplexity یا BLEU اغلب در درک ظرافت، سمیت یا دقت واقعی شکست میخورند. ارزیابی انسانی در حلقه (HITL) واقعیت را ارائه میدهد، اما مقیاسپذیری آن...