AGI & Research

Les LLM peuvent-ils penser à la pensée ? Évaluation de la théorie de l'esprit spontanée dans les dilemmes sociaux

La quête de l'Intelligence Artificielle Générale (IAG) a conduit les chercheurs à aller au-delà des benchmarks statiques comme la programmation ou le raisonnement logique. Une pièce essentielle manquante à ce puzzle est la théorie de l'esprit (ToM) : la capacité cognitive d'attribuer des états mentaux, des intentions et des croyances aux autres. Récemment, les grands modèles de langage (LLM) ont montré des indices surprenants de cette capacité. Mais s'agit-il d'une compréhension authentique, ou simplement d'un appariement de motifs sophistiqué ? Pour le savoir, nous devons les mettre dans le ring : les dilemmes sociaux interactifs.

Pourquoi les dilemmes sociaux ?

Les dilemmes sociaux, tels que le dilemme du prisonnier ou le jeu de l'ultimatum, sont des terrains de test parfaits pour la ToM. Dans ces scénarios, la stratégie optimale ne dépend pas seulement des règles du jeu, mais de la prédiction de ce que fera l'autre joueur. Si un LLM peut coopérer de manière constante lorsqu'il prédit que l'autre joueur le fera, et trahir lorsqu'il prédit que l'autre le fera, il modélise implicitement l'esprit de l'autre agent.

Les tests traditionnels de ToM sont souvent statiques (« Sally pense-t-que la bille est dans le panier ? »). Les dilemmes interactifs forcent le modèle à mettre à jour ses croyances en temps réel sur la base de nouvelles informations, une barre bien plus haute pour la simulation cognitive.

Le dispositif expérimental

Pour évaluer la ToM spontanée, nous concevons une interaction multi-tours où le LLM joue contre un agent doté d'une stratégie cachée. Le LLM doit inférer cette stratégie à partir de données limitées et ajuster ses propres coups en conséquence.

Considérons un dilemme du prisonnier itératif simple. Le LLM est invité à choisir « Coopérer » (C) ou « Trahir » (D) à chaque tour. L'environnement fournit un retour sur le coup précédent de l'adversaire. Un modèle doté d'une ToM authentique ne réagira pas seulement au dernier coup de l'adversaire (comme dans la stratégie du talion), mais inférera l'intention ou l'algorithme de l'adversaire.

Exemple de code : Évaluation de l'inférence de stratégie


import re
from transformers import pipeline

# Fonction d'évaluation hypothétique
def evaluate_tom_capability(llm, opponent_strategy):
    """
    Teste si le LLM peut inférer la stratégie de l'adversaire
    et ajuster son jeu pour maximiser le gain.
    """
    prompts = []
    # Simuler 5 tours d'interaction
    for i in range(5):
        opponent_move = opponent_strategy(i) # ex., 'C' ou 'D'
        prompt = f"""
        Tour {i} :
        Votre dernier coup : [Dernier Coup]
        Coup de l'adversaire : {opponent_move}
        
        Réfléchissez au motif de l'adversaire. Que compte-t-il faire ensuite ?
        Choisissez C ou D pour maximiser votre score.
        Répondez uniquement par C ou D.
        """
        prompts.append(prompt)
    
    # Envoyer les prompts au LLM (simplifié pour l'illustration)
    llm_responses = [llm(prompt) for prompt in prompts]
    
    # Calculer si le LLM s'est aligné sur la stratégie inférée
    # ex., Si l'adversaire choisit toujours C, le LLM devrait majoritairement choisir C
    success_rate = calculate_alignment(llm_responses, opponent_strategy)
    return success_rate

# Exemple : L'adversaire utilise la stratégie du talion
def tit_for_tat_history(history):
    return history[-1] if history else 'C'

# Lancer l'évaluation
# score = evaluate_tom_capability(my_llm_instance, tit_for_tat_history)

Résultats clés et défis

  1. Appariement de motifs vs. Mentalisation : Les LLM actuels excellent à reconnaître des motifs simples (ex. : « ils trahissent toujours »). Cependant, ils peinent avec des stratégies plus complexes et non déterministes qui nécessitent une modélisation probabiliste de l'état de croyance de l'adversaire.
  2. Contraintes de longueur de contexte : À mesure que les interactions s'allongent, les modèles peuvent perdre de vue la stratégie inférée, suggérant que leur « théorie de l'esprit » est superficielle et fortement dépendante des fenêtres de contexte récentes.
  3. Biais de soi : Certains modèles présentent un fort biais vers la coopération, interprétant les indices ambigus comme bienveillants. Ce « biais de gentillesse » peut masquer un manque de raisonnement stratégique véritable.

Implications pratiques pour les développeurs

Pour les développeurs construisant des systèmes multi-agents, comprendre la ToM des LLM est crucial. Si vous utilisez des LLM pour négocier des contrats ou coordonner des tâches, vous devez supposer qu'ils ont un modèle limité et potentiellement biaisé des autres agents. Vous devrez peut-être leur demander explicitement de « raisonner sur les incitations de l'autre agent » pour améliorer leurs performances en ToM.

Conclusion

Les LLM ne montrent pas encore une théorie de l'esprit robuste et spontanée. Bien qu'ils puissent imiter un comportement stratégique dans des dilemmes sociaux simples, ils manquent de la modélisation cohérente et en profondeur des autres esprits requise pour une véritable intelligence sociale. Les recherches futures devraient se concentrer sur les interactions à long terme et des hiérarchies de croyances plus complexes pour repousser les limites de ce que ces modèles peuvent véritablement comprendre sur les autres « esprits ».

Share: