هندسة الفوضى لاستدلال نماذج اللغة الكبيرة
مقدمة: ما وراء خدمات الميكروستندارد تعمل أنظمة استدلال نماذج اللغة الكبيرة (LLM) تحت قيود فريدة تختلف عن خدمات الميكروستندارد التقليدية. على عكس واجهات برمجة التطبيقات (APIs) غير الحية (stateless)، تعتمد نقاط نهاية LLM بشكل كبير على ذاكرة GPU المحدودة لإدارة ذاكرة KV cache، وغالبًا ما تحافظ على اتصالات طويلة الأمد...