مهندسی آشوب برای استنتاج مدلهای زبانی بزرگ
مقدمه: فراتر از میکروسرویسهای استاندارد سیستمهای استنتاج مدلهای زبانی بزرگ (LLM) تحت محدودیتهای منحصربهفردی عمل میکنند که با میکروسرویسهای سنتی متفاوت است. برخلاف APIهای وب بدون حالت، نقاط پایانی LLM به شدت به حافظه محدود GPU برای مدیریت کش KV تکیه دارند و اغلب اتصالات طولانیمدت را برای پاسخهای پخش زنده (Streaming) حفظ میکنند...