Constitutional AI vs DPO vs Autres Méthodes — Le Paysage de l'Alignement
Introduction
Le domaine de l'alignement des IA a connu une explosion de méthodes ces dernières années. RLHF, RLAIF, DPO, KTO, IPO... autant d'acronymes qui reflètent une recherche intense vers la meilleure façon de rendre les modèles de langage à la fois sûrs et utiles.
🎧 Podcast : Constitutional AI - Partie 2 (Articles 6-10) (~12 min) — Ce podcast couvre les articles 6 à 10, y compris cet article.
Dans ce huitième article de notre série sur la Constitutional AI, nous comparons les principales méthodes d'alignement, leurs avantages, leurs limites, et les hybridations qui émergent pour combiner le meilleur de chaque approche.
1. RLHF — La Méthode Pionnière
Reinforcement Learning from Human Feedback — La méthode qui a rendu possible ChatGPT et Claude.
Mécanisme
- Des humains annotent des paires de réponses (A vs B)
- Un modèle de récompense apprend à prédire les préférences humaines
- Le modèle est optimisé pour maximiser cette récompense
Avantages
✅ Preuve de concept — Démontré comme fonctionnant à l'échelle (GPT-4, Claude) ✅ Alignement direct — Les données viennent directement d'humains ✅ Transparence — Le signal de récompense est explicable
Limites
❌ Coût prohibitif — Milliers d'heures d'annotation humaine ❌ Incohérence — Les annotateurs humains varient dans leurs jugements ❌ Évitements excessifs — Les modèles deviennent trop prudents ❌ Opacité du raisonnement — Le modèle voit "A > B" mais pas pourquoi
2. RLAIF — Constitutional AI
Reinforcement Learning from AI Feedback — L'approche d'Anthropic.
Mécanisme
- Une constitution explicite définit les principes
- Un modèle IA critique et révise ses propres réponses
- Le feedback IA remplace les annotations humaines
Avantages
✅ Scalabilité — L'IA peut générer des millions de critiques ✅ Cohérence — Application uniforme des principes ✅ Transparence — La constitution est publique et explicite ✅ Chaîne de raisonnement — Le modèle explique pourquoi une réponse est meilleure
Limites
❌ Dépendance au modèle initial — Le modèle critique doit lui-même être aligné ❌ Risque de boucle — Le modèle peut amplifier ses propres biais ❌ Complexité — Deux phases (supervised + RL) à gérer
3. DPO — L'Alternative Élégante
Direct Preference Optimization — Introduit en 2023 par Stanford et Berkeley.
Mécanisme
DPO élimine l'étape intermédiaire du modèle de récompense. Il optimise directement le modèle pour qu'il assigne une probabilité plus élevée aux réponses préférées.
Idée clé : Au lieu d'apprendre un modèle de récompense séparé, DPO utilise une propriété mathématique pour lier directement les préférences aux probabilités du modèle.
Avantages
✅ Simplicité — Un seul modèle à entraîner, pas de reward model ✅ Stabilité — Moins de problèmes de convergence que RLHF ✅ Efficacité — Moins de calcul, entraînement plus rapide
Limites
❌ Dépend aux données de préférences — Nécessite toujours des annotations humaines ❌ Moins flexible — Difficile d'ajuster les préférences après entraînement ❌ Moins étudié — Moins de déploiements à grande échelle que RLHF
4. KTO — L'Approche Kahneman-Tversky
Kahneman-Tversky Optimization — Introduit en 2024, inspiré de la théorie des perspectives.
Mécanisme
KTO est basé sur la théorie des perspectives de Kahneman et Tversky, qui modélise comment les humains prennent des décisions sous incertitude. Au lieu de comparer des paires de réponses, KTO modélise la perte d'utilité perçue par l'humain face à une sortie donnée.
Idée clé : Les humains perçoivent les pertes plus intensément que les gains. KTO applique ce principe pour pénaliser sévèrement les mauvaises réponses tout en récompensant modérément les bonnes.
Avantages
✅ Ne nécessite pas de paires comparées — Peut travailler avec des réponses isolées ✅ Psychologiquement fondé — Basé sur des théories éprouvées de décision humaine ✅ Moins de données — Pas besoin de collecter des milliers de comparaisons
Limites
❌ Nouveau — Moins de recul que RLHF/DPO ❌ Modélisation complexe — La théorie des perspectives est difficile à implémenter ❌ Moins éprouvé — Peu de déploiements en production
5. Tableau Comparatif
| Méthode | Données requises | Complexité | Scalabilité | Transparence | Déploiement |
|---|---|---|---|---|---|
| RLHF | Paires annotées (A vs B) | Élevée (2 modèles) | Faible (coût humain) | Moyenne | ✅ GPT-4, Claude |
| RLAIF | Constitution + modèle critique | Élevée (2 phases) | Élevée (auto-génération) | Élevée (constit. publique) | ✅ Claude |
| DPO | Paires annotées (A vs B) | Moyenne (1 modèle) | Moyenne (coût humain) | Moyenne | 🔄 Expérimental |
| KTO | Réponses isolées | Moyenne | Élevée | Moyenne | 🔬 Recherche |
6. Quand Utiliser Quoi ?
RLHF — Pour les équipes avec budget humain
Cas d'usage : - Vous avez les ressources pour payer des annotateurs - Vous voulez un alignement très précis sur vos préférences - Vous avez besoin d'une méthode éprouvée
Exemple : Une entreprise veut aligner un assistant sur son tone of voice spécifique.
RLAIF — Pour la scalabilité et la transparence
Cas d'usage : - Vous devez déployer à très grande échelle - Vous voulez des principes explicites et auditables - Vous avez déjà un modèle RLHF pour initialiser le critique
Exemple : Un modèle d'assistant général comme Claude qui doit servir des millions d'utilisateurs.
DPO — Pour la simplicité et la stabilité
Cas d'usage : - Vous voulez une implémentation plus simple que RLHF - Vous avez des problèmes de stabilité avec RLHF - Vous avez déjà des données de préférences
Exemple : Une startup qui veut affiner un modèle existant sans infrastructure RL complexe.
KTO — Pour des données limitées
Cas d'usage : - Vous ne pouvez pas collecter des milliers de paires comparées - Vous voulez une méthode psychologiquement fondée - Vous êtes en phase de recherche
Exemple : Un laboratoire de recherche explorant de nouvelles méthodes d'alignement.
7. Hybridations — L'Avenir de l'Alignement
En pratique, les meilleures systèmes combinent plusieurs approches.
Constitutional AI + DPO
Anthropic expérimente l'utilisation de DPO pour la phase RL de Constitutional AI :
Avantage : Simplicité de DPO + scalabilité de RLAIF
RLHF initial + RLAIF continu
Une approche hybride pour combiner précision humaine et scalabilité :
- Phase initiale : RLHF avec humains pour établir un bon modèle de base
- Phase continue : RLAIF pour affiner et adapter le modèle
Avantage : Précision humaine au démarrage + scalabilité IA ensuite
KTO pour l'évaluation
Utiliser KTO comme métrique d'évaluation, pas comme méthode d'entraînement :
Avantage : Évaluation plus alignée avec la perception humaine
8. Limites Communes — Ce qu'Aucune Méthode Ne Résout
Toutes ces méthodes partagent des limites fondamentales :
8.1 Dépendance aux données d'entraînement
Quel que soit l'alignement, si les données de base sont biaisées, le modèle le sera aussi.
"Garbage in, garbage out — même avec une constitution."
8.2 Évolution des normes sociales
Les valeurs changent. Une méthode alignée sur les normes de 2024 peut être obsolète en 2026.
Défi : Comment mettre à jour l'alignement sans réentraînement complet ?
8.3 Contexte et nuance
Toutes les méthodes peinent avec les cas limites où les valeurs entrent en conflit.
Exemple : Un journaliste enquêtant sur des extrémistes. L'aider peut sembler "aider des groupes nuisibles", mais refuser serait de la censure.
8.4 Mesure de l'alignement
Comment mesurer qu'un modèle est "bien aligné" ? Les métriques actuelles sont imparfaites :
- Taux de refus (trop élevé = modèle trop prudent)
- Évaluations humaines (coûteuses, subjectives)
- Benchmarks de sécurité (peuvent être "gamed")
9. L'Avenir — Vers des Méthodes Plus Sophistiquées
Plusieurs directions de recherche émergent :
9.1 Constitutional AI itérative
Au lieu d'une constitution fixe, la constitution elle-même évolue en fonction du feedback :
Défi : Comment éviter la dérive et la corruption de la constitution ?
9.2 Multi-constitutionalité
Différentes constitutions pour différents cas d'usage :
- Constitution "assistant créatif" : Plus permissive, encourage l'expérimentation
- Constitution "assistant médical" : Plus conservatrice, priorité à la sécurité
- Constitution "assistant éducatif" : Équilibre entre exactitude et accessibilité
Défi : Comment choisir automatiquement la bonne constitution ?
9.3 Apprentissage continuel sans dérive
Des méthodes pour affiner le modèle en production sans qu'il ne perde ses alignements initiaux :
- Elastic Weight Consolidation : Protéger les paramètres critiques pour l'alignement
- Experience Replay : Mélanger les nouvelles données avec des données d'alignement historiques
- Regularization par constitution : Pénaliser les dérives par rapport à la constitution
10. Conclusion — Il n'y a Pas de "Meilleure" Méthode
RLHF, RLAIF, DPO, KTO — chaque méthode a ses avantages et ses limites. Le choix dépend :
- De vos ressources (budget humain, infrastructure)
- De vos cas d'usage (général vs spécifique)
- De vos besoins (transparence, scalabilité, simplicité)
Ce qui est clair, c'est que l'alignement est devenu un domaine de recherche à part entière, avec des méthodes de plus en plus sophistiquées pour résoudre un problème fondamental : comment faire en sorte que des systèmes extrêmement puissants servent les intérêts humains plutôt que de les détourner.
La Constitutional AI d'Anthropic représente une approche particulièrement prometteuse, car elle combine :
- Explicitation (une constitution publique)
- Scalabilité (feedback IA)
- Transparence (raisonnement étape par étape)
- Adaptabilité (possibilité de réviser la constitution)
Les prochaines années verront probablement émerger des hybridations encore plus sophistiquées, combinant le meilleur de chaque méthode pour créer des IA à la fois puissantes, sûres, et véritablement alignées avec les valeurs humaines.
Sources
- Direct Preference Optimization — arXiv:2305.18290
- Kahneman-Tversky Optimization — Anthropic Research (2024)
- Constitutional AI — Anthropic Research (2022)
- RLHF+DPO Hybrids — Stanford CRFM (2024)
Article suivant : Collective Constitutional AI — La Dimension Démocratique