La pile réseau de l'IA : Comparaison de TCP, UDP et RDMA pour les charges de travail d'inférence et d'entraînement des LLM
À mesure que les grands modèles de langage (LLM) atteignent des centaines de milliards de paramètres, le goulot d'étranglement se déplace du calcul vers la communication. Dans l'infrastructure IA, la latence et la bande passante réseau deviennent les facteurs déterminants du temps d'entraînement et d'inférence.