AGI & Research

Supervision évolutive : Évaluer le débat et la modélisation récursive des récompenses pour la sécurité de l'IA générale

Alors que nous nous approchons de la création de l'Intelligence Artificielle Générale (IAG), le problème de l'alignement reste notre obstacle le plus redoutable. Nous pouvons entraîner des modèles à générer du code ou rédiger des essais, mais garantir qu'ils agissent de manière véritablement bénéfique, robuste et honnête par rapport aux valeurs humaines est un défi d'ingénierie bien plus complexe. La difficulté fondamentale réside dans la supervision évolutive : comment superviser un système d'IA qui est plus intelligent que ses superviseurs ? Cet article examine deux cadres théoriques de premier plan pour résoudre ce problème : le Débat IA et la Modélisation Récursive des Récompenses (RRM).

La crise de l'évolutivité

L'apprentissage par renforcement à partir de retours humains (RLHF) fonctionne bien lorsque les réviseurs humains peuvent vérifier la sortie. Cependant, à mesure que les modèles deviennent plus performants, les sorties peuvent devenir trop subtiles ou complexes pour que les humains puissent les évaluer avec précision. C'est ce que l'on appelle le « goulot d'étranglement de l'évaluation ». Si nous ne pouvons pas vérifier qu'une IA dit la vérité sur une découverte scientifique complexe ou un plan stratégique, nous ne pouvons pas lui faire confiance. Nous avons besoin de méthodes qui nous permettent d'exploiter le jugement humain plus efficacement, en faisant évoluer nos capacités de supervision sans avoir besoin d'un milliard d'humains pour examiner chaque sortie.

Débat IA : La vérité par le processus adversarial

Proposé par Paul Christiano, le Débat IA présente le problème comme un jeu. Deux agents IA, $A_0$ et $A_1$, sont chargés de répondre à une question. Ils défendent leurs positions respectives — généralement l'une pour « Oui » et l'autre pour « Non ». Un juge humain décide ensuite quel argument est le meilleur. L'idée clé est que si le juge commet une erreur, l'agent opposé peut souligner cette erreur lors du tour suivant.

Ce processus converge théoriquement vers la vérité à mesure que la profondeur du débat augmente. Pour les agents hautement performants, la capacité à repérer les sophismes ou les erreurs factuelles dans l'argument de l'adversaire dépasse la capacité du juge à vérifier les faits directement. En effet, la structure du débat amplifie la compétence du juge.

Bien que purement théorique jusqu'à présent, des expériences de simulation avec des modèles de langage montrent des résultats prometteurs. Cependant, mettre cela à l'échelle pour une IAG réelle nécessite d'énormes ressources informatiques pour chaque instance de débat et un réglage minutieux du signal de récompense.

Modélisation Récursive des Récompenses (RRM)

La Modélisation Récursive des Récompenses offre une approche différente. Au lieu d'un débat, le RRM se concentre sur l'entraînement d'une hiérarchie de modèles de récompense. Le modèle de niveau supérieur est entraîné sur les préférences humaines pour des tâches simples. Crucialement, ce modèle de niveau supérieur est ensuite utilisé pour générer un jeu de données synthétique afin d'entraîner le niveau suivant du modèle, et ainsi de suite.

L'objectif est de créer une « hiérarchie de récompenses » où les modèles de niveau supérieur peuvent évaluer des résultats plus complexes, abstraits ou à long terme que les humains ne peuvent pas facilement juger. Les modèles de niveau inférieur fournissent un ancrage dans les valeurs humaines, tandis que les niveaux supérieurs généralisent ces valeurs à des scénarios nouveaux et complexes.

# Pseudo-code illustrant la boucle d'entraînement récursive
class RewardModel:
    def __init__(self, level):
        self.level = level
        self.model = load_base_model()

    def train_recursive(self, base_dataset, depth):
        if depth == 0:
            return self.train_on_human_preferences(base_dataset)
        
        # Entraîner le niveau actuel sur les prédictions du niveau précédent
        synthetic_data = self.generate_predictions()
        self.model = fine_tune(self.model, synthetic_data)
        
        # Récursion vers le niveau suivant
        child_model = RewardModel(level + 1)
        return child_model.train_recursive(synthetic_data, depth - 1)

# Utilisation
reward_system = RewardModel(level=0)
final_policy = reward_system.train_recursive(human_prefs_data, depth=3)

Comparaison des approches

Le Débat repose sur des dynamiques adversariales et est potentiellement plus robuste face à la tromperie si le juge est robuste. Cependant, il est coûteux en calcul et sensible au biais du juge. Le RRM est plus efficace sur le plan computationnel, mais comporte le risque de « piratage de la récompense » ou de dérive par rapport aux valeurs humaines si la profondeur de récursion est trop grande ou si le signal d'alignement est faible.

Conclusion

Ni le Débat ni le RRM ne sont une solution miracle. Ils représentent différents compromis entre le coût computationnel, la robustesse et la facilité de mise en œuvre. À mesure que la recherche sur l'IA générale progresse, des approches hybrides combinant vérification adversariale et modélisation de récompenses hiérarchique pourraient émerger comme la norme. Pour les développeurs et les chercheurs, comprendre ces mécanismes n'est plus une option — c'est essentiel pour construire des systèmes d'IA sûrs et dignes de confiance.

Share: