Maîtriser l'évaluation des agents : au-delà de la simple précision
Alors que les grands modèles de langage (LLM) évoluent de simples chatbots vers des agents autonomes capables d'utiliser des outils, de planifier et de raisonner en plusieurs étapes, le paradigme d'évaluation doit changer. Nous n'évaluons plus seulement la qualité d'un texte généré, mais la fiabilité d'un système qui interagit avec le monde extérieur.