LLM Çıkarımı için Kaos Mühendisliği
Giriş: Standart Mikro Servislerin Ötesinde Büyük Dil Modeli (LLM) çıkarım sistemleri, geleneksel mikro servislerden farklı olarak benzersiz kısıtlamalar altında çalışır. Durumsuz web API'lerinin aksine, LLM uç noktaları KV önbellek yönetimi için büyük ölçüde sınırlı GPU belleğine bağımlıdır ve genellikle akışkan yanıtlar için uzun ömürlü bağlantılar...