بهینهسازی تأخیر استنتاج LLM با استفاده از Offloading حافظه KV و یکپارچهسازی با Redis
با گسترش کاربرد مدلهای زبانی بزرگ (LLM) در برنامههای عملیاتی، گلوگاه تأخیر استنتاج از آموزش مدل به کارایی استقرار منتقل شده است. در حالی که GPUهای مدرن مانند H100 از طریقبیت عظیمی ارائه میدهند، پهنای باند حافظه همچنان یک محدودیت حیاتی است. هر توکن تولید شده نیازمند خواندن کل پنجره زمینه است که با افزایش طول مکالمات، باعث افزایش قابل توجه تأخیر میشود. این مقاله یک الگوی معماری قوی برای کاهش این مشکل را بررسی میکند: Offloading حافظه KV به یک انبار حافظه توزیعشده مانند Redis.