Génie du chaos pour l'inférence LLM
Introduction : Au-delà des microservices standard Les systèmes d'inférence de grands modèles de langage (LLM) fonctionnent sous des contraintes uniques, distinctes des microservices traditionnels. Contrairement aux API web sans état, les points de terminaison LLM s'appuient fortement sur la mémoire GPU limitée pour la gestion du cache KV et maintiennent souvent des connexions de longue durée pour...