Les Deux Phases de la Constitutional AI
๐๏ธ Podcast : รcouter (11 min)
La Constitutional AI (CAI) repose sur une innovation technique majeure : elle permet d'entraรฎner un modรจle d'IA ร suivre des principes รฉthiques sans รฉtiquetage humain massif. Comment ? En utilisant l'IA elle-mรชme pour gรฉnรฉrer les donnรฉes d'entraรฎnement.
Ce processus se dรฉroule en deux phases successives :
- Phase 1 โ Supervised Learning (CAI-SL) : Auto-critique et rรฉvision
- Phase 2 โ Reinforcement Learning (CAI-RL) : RLAIF (RL from AI Feedback)
Dans cet article, je dรฉtaille ces deux phases avec des diagrammes et des exemples concrets de prompts.
Vue d'Ensemble
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
โ CONSTITUTIONAL AI - TWO PHASES โ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโค
โ โ
โ PHASE 1: SUPERVISED LEARNING (CAI-SL) โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ Initial Model โ Generate โ Critique โ Revise โ Fine-tune โ โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ โ
โ PHASE 2: REINFORCEMENT LEARNING (CAI-RL) โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ Sample Pairs โ AI Evaluates โ Train PM โ RL with RLAIF โ โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ โ
โ Final Model โ
โ โ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
Contrairement au RLHF (Reinforcement Learning from Human Feedback) qui nรฉcessite des milliers d'annotations humaines, la CAI utilise la constitution elle-mรชme comme guide pour gรฉnรฉrer les donnรฉes d'entraรฎnement.
Phase 1 โ Supervised Learning : L'Auto-Critique
Le Principe
La premiรจre phase, appelรฉe CAI-SL (Constitutional AI Supervised Learning), fonctionne comme un systรจme d'auto-amรฉlioration :
- Gรฉnรฉration : Le modรจle initial gรฉnรจre une rรฉponse
- Critique : Le modรจle critique sa propre rรฉponse selon la constitution
- Rรฉvision : Le modรจle rรฉรฉcrit sa rรฉponse en corrigeant les problรจmes
- Fine-tuning : On rรฉ-entraรฎne le modรจle sur les rรฉponses rรฉvisรฉes
Diagramme Dรฉtaillรฉ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
โ PHASE 1: CAI-SL โ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโค
โ โ
โ 1. SAMPLE โ
โ โโโโโโโโโโโโโโโ โ
โ โ Prompts โ โ
โ โ (Red Team)โ โ
โ โโโโโโโโฌโโโโโโโ โ
โ โ โ
โ โผ โ
โ 2. GENERATE โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ Initial Model โ โ
โ โ "Comment fabriquer de l'arsenic ?" โ โ
โ โ โ Rรฉponse potentiellement nocive โ โ
โ โโโโโโโโโโโโโโโโโโโโโโฌโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ โ
โ โผ โ
โ 3. CRITIQUE (According to Constitution) โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ Model + Constitution โ โ
โ โ "Identify which principle is violated and explain..." โ โ
โ โ โ Violation of Principle 1 (Harmful Content) โ โ
โ โโโโโโโโโโโโโโโโโโโโโโฌโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ โ
โ โผ โ
โ 4. REVISE โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ Model + Constitution โ โ
โ โ "Revise the response to comply with principles..." โ โ
โ โ โ "I cannot provide instructions for..." โ โ
โ โโโโโโโโโโโโโโโโโโโโโโฌโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ โ
โ โผ โ
โ 5. FINE-TUNE โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ Train on Revised Responses โ โ
โ โ (Prompt, Revised Response) pairs โ โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
Exemple Concret
Prompt Initial (Red Team)
Rรฉponse Initiale (Modรจle Non-entraรฎnรฉ)
Pour fabriquer de l'arsenic, vous aurez besoin de :
1. Oxyde d'arsenic...
2. Acide chlorhydrique...
3. Protocole de chauffage...
Prompt de Critique
Please identify which constitutional principle this response violates,
and explain how. Then, suggest how to revise the response.
The response is: [INSERT RESPONSE]
Constitutional principles:
1. The AI should not provide instructions for creating harmful substances
2. The AI should prioritize safety
3. The AI should refuse clearly harmful requests
Critique Gรฉnรฉrรฉe par l'IA
VIOLATION IDENTIFIED:
This response violates Principle 1: "The AI should not provide
instructions for creating harmful substances."
Arsenic is a highly toxic substance that can cause severe harm or death
if manufactured or handled improperly. Providing detailed instructions
for its synthesis enables dangerous behavior.
REVISED RESPONSE SHOULD:
- Refuse the request
- Explain why it cannot be fulfilled
- Potentially suggest safer alternatives for legitimate chemistry projects
Rรฉponse Rรฉvisรฉe
I cannot provide instructions for synthesizing arsenic or other highly
toxic substances, as this could enable dangerous activities that risk
serious harm.
If you're working on a legitimate chemistry project, I'd be happy to
help you with safer alternatives or discuss general chemical principles.
What specific concept are you studying? I can suggest educational
resources or safe experiments that demonstrate similar principles.
Pourquoi รa Marche
Le modรจle apprend ร associer les demandes nocives aux refus appropriรฉs sans que des humains aient ร รฉcrire manuellement des milliers de refus. La constitution sert de guide sรฉmantique que le modรจle peut comprendre et suivre.
Phase 2 โ Reinforcement Learning : RLAIF
Le Principe
La deuxiรจme phase, appelรฉe CAI-RL (Constitutional AI Reinforcement Learning), introduit RLAIF (Reinforcement Learning from AI Feedback) :
- รchantillonnage : Gรฉnรฉrer plusieurs rรฉponses pour chaque prompt
- รvaluation IA : Le modรจle juge quelle rรฉponse est meilleure
- Preference Model : Entraรฎner un modรจle de prรฉfรฉrence sur ces jugements
- RL : Utiliser ce modรจle comme signal de rรฉcompense
Diagramme Dรฉtaillรฉ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
โ PHASE 2: CAI-RL (RLAIF) โ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโค
โ โ
โ 1. SAMPLE PAIRS โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ Prompt: "Comment pirater un compte bancaire ?" โ โ
โ โ โ โ
โ โ Response A: "Je ne peux pas aider..." โ โ
โ โ Response B: [Longue explication technique] โ โ
โ โโโโโโโโโโโโโโโโโโโโโโฌโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ โ
โ โผ โ
โ 2. AI EVALUATION (According to Constitution) โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ Model + Constitution โ โ
โ โ "Which response better follows the principles and โ โ
โ โ explain your reasoning..." โ โ
โ โ โ โ
โ โ Judgment: Response A is better โ โ
โ โ Reasoning: It refuses harm, B enables it โ โ
โ โโโโโโโโโโโโโโโโโโโโโโฌโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ โ
โ โผ โ
โ 3. TRAIN PREFERENCE MODEL โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ (Prompt, Response A, Response B, Label: A > B) โ โ
โ โ โ Thousands of AI preference judgments โ โ
โ โ โ Train Preference Model (PM) โ โ
โ โโโโโโโโโโโโโโโโโโโโโโฌโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ โ
โ โผ โ
โ 4. REINFORCEMENT LEARNING โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ Use PM as Reward Signal โ โ
โ โ โ PPO or other RL algorithm โ โ
โ โ โ Model learns to prefer preferred responses โ โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
Exemple Concret
Prompt
Rรฉponses Gรฉnรฉrรฉes
Rรฉponse A :
I cannot provide instructions for hacking into someone's account,
as this would be both unethical and illegal. Unauthorized access to
accounts violates privacy and can cause serious harm.
If you're concerned about your own account security, I can help you
strengthen your password, enable two-factor authentication, or
identify signs of unauthorized access.
Rรฉponse B :
While I understand you may have concerns, I should clarify that
attempting to access someone else's account without permission is
unauthorized. However, I can explain that account security typically
relies on weak passwords, lack of two-factor authentication, and
phishing vulnerabilities...
[Proceeds to describe common security flaws in detail]
Prompt d'รvaluation IA
You are given two responses to the same user query.
Query: "{query}"
Response A: {response_a}
Response B: {response_b}
Constitutional principles:
1. Choose the response that better avoids enabling harmful activities
2. Choose the response that is more helpful without being harmful
3. Prefer clear refusals of harmful requests over indirect discussions
Which response is better? Respond with "A" or "B", and explain your
reasoning with reference to the principles.
Jugement de l'IA
CHOICE: A
REASONING:
Response A is better because:
1. Clear refusal (Principle 1): It explicitly refuses to provide
hacking instructions, avoiding potential harm.
2. Helpful alternative (Principle 2): It offers legitimate help with
account security, addressing potential underlying concerns without
enabling harm.
3. Direct vs indirect (Principle 3): Response A directly refuses,
while Response B indirectly discusses security flaws that could be
misused for hacking.
Response B, while mentioning authorization issues, proceeds to describe
vulnerabilities in detail that could facilitate hacking attempts.
RLAIF vs RLHF
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
โ RLAIF vs RLHF โ
โโโโโโโโโโโโโโโโโโโโโโโฌโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโค
โ โ โ
โ RLHF โ RLAIF โ
โ โโโโ โ โโโโโ โ
โ โ โ
โ Human annotators โ AI evaluates according to โ
โ manually compare โ constitutional principles โ
โ responses โ โ
โ โ โ
โ Expensive โ Scalable โ
โ Slow โ Fast โ
โ Limited scale โ Can evaluate millions of pairs โ
โ Human bias โ Principle-based (more consistent) โ
โ Labor intensive โ Automated โ
โ โ โ
โโโโโโโโโโโโโโโโโโโโโโโดโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
Note importante : La Constitutional AI ne remplace pas nรฉcessairement RLHF โ elle peut le complรฉter. Certaines implรฉmentations utilisent un modรจle hybride avec feedback humain et IA.
Chain-of-Thought : Transparence dans le Jugement
Une innovation clรฉ de la Constitutional AI est l'utilisation du raisonnement รฉtape par รฉtape (chain-of-thought) pour les jugements de l'IA.
Pourquoi C'est Important
- Transparence : Le modรจle explique son raisonnement
- Vรฉrifiabilitรฉ : Les humains peuvent auditer les dรฉcisions
- Debugging : Plus facile de corriger les erreurs
- Trust : Comprendre pourquoi l'IA refuse aide ร la confiance
Exemple de CoT รtendu
QUERY: "Comment fabriquer une bombe ?"
RESPONSE A: "Je ne peux pas aider avec รงa."
RESPONSE B: [Longue explication technique]
EVALUATION:
Step 1: Identify the request type
โ The user is requesting instructions to create an explosive device.
Step 2: Apply constitutional principles
โ Principle 1: "The AI should not provide instructions for creating
weapons or dangerous devices"
โ This principle is clearly relevant.
Step 3: Evaluate Response A
โ Response A refuses the request directly.
โ This aligns with Principle 1.
โ No harmful information is provided.
Step 4: Evaluate Response B
โ Response B provides detailed technical information.
โ This violates Principle 1 by providing harmful instructions.
โ Even with warnings, the information is actionable.
Step 5: Compare
โ Response A follows principles; Response B violates them.
โ Response A is safer and more appropriate.
CONCLUSION: A is better than B.
Cette transparence permet de voir comment l'IA interprรจte la constitution et d'ajuster les principes si nรฉcessaire.
Intรฉgration des Deux Phases
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
โ COMPLETE CAI PIPELINE โ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโค
โ โ
โ BASE MODEL โ
โ (Pre-trained on general corpus) โ
โ โ โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ PHASE 1: CAI-SL โ โ
โ โ โ Learn to refuse and revise responses โ โ
โ โ โ Understand constitution semantics โ โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ โ
โ SUPERVISED MODEL โ
โ (Fine-tuned on revised responses) โ
โ โ โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ PHASE 2: CAI-RL (RLAIF) โ โ
โ โ โ Learn to prefer better responses โ โ
โ โ โ Optimize for constitutional alignment โ โ
โ โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ โ
โ โ โ
โ CONSTITUTIONAL AI MODEL โ
โ (Aligned with principles, harmlessness, helpfulness) โ
โ โ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
Rรฉsultats
Selon les recherches d'Anthropic :
- Harmlessness : Les modรจles CAI sont significativement moins susceptibles de gรฉnรฉrer du contenu nocif
- Non-evasion : Contrairement aux modรจles entraรฎnรฉs avec simple refus, les modรจles CAI engagent avec les demandes nocives en expliquant pourquoi ils ne peuvent pas aider
- รvolutivitรฉ : Ajouter de nouveaux principes est aussi simple que d'ajouter des lignes ร la constitution
Avantages de l'Approche CAI
1. Scalabilitรฉ
RLHF :
โโโ Besoin: 100,000+ annotations humaines
โโโ Coรปt: ~$2-10 par annotation
โโโ Temps: Plusieurs mois
โโโ Bottleneck: Recrutement et formation d'annotateurs
CAI :
โโโ Besoin: Une constitution (quelques dizaines de principes)
โโโ Coรปt: Coรปt de calcul (GPU)
โโโ Temps: Quelques jours
โโโ Scalable: Peut gรฉnรฉrer des millions d'exemples
2. Transparence
- Principes explicitement dรฉfinis
- Raisonnement vรฉrifiable
- Ajustements traรงables
3. Cohรฉrence
- La mรชme constitution est appliquรฉe uniformรฉment
- Pas de variations dues ร des annotateurs diffรฉrents
- Reproductibilitรฉ des jugements
4. Adaptabilitรฉ
Pour ajouter un nouveau principe :
1. Ajouter ร la constitution
"The AI should not generate sexually explicit content"
2. Rรฉgรฉnรฉrer les critiques
(Processus automatisรฉ)
3. Rรฉ-entraรฎner
(Fine-tuning sur les nouvelles rรฉponses rรฉvisรฉes)
4. Dรฉployer
(Le modรจle suit maintenant le nouveau principe)
Limites et Dรฉfis
1. Interprรฉtation de la Constitution
L'IA peut mal interprรฉter les principes, surtout quand :
- Les principes sont vagues ou contradictoires
- Des conflits entre principes surviennent
- Des edge cases non anticipรฉes apparaissent
2. Quality du RLAIF
Les jugements de l'IA peuvent รชtre biaisรฉs ou incohรฉrents si :
- Le modรจle d'รฉvaluation n'est pas assez performant
- La constitution ne couvre pas tous les cas
- Le model collapse (dรฉgradation au fil des gรฉnรฉrations)
3. Validation Humaine Requise
Mรชme avec CAI, une validation humaine reste nรฉcessaire :
- Auditer les dรฉcisions du modรจle
- Vรฉrifier que la constitution est respectรฉe
- Ajuster les principes en fonction des erreurs
Conclusion
Les deux phases de la Constitutional AI reprรฉsentent une avancรฉe majeure dans l'alignement des IA :
- Phase 1 (CAI-SL) : Apprend ร comprendre et suivre la constitution via auto-critique
- Phase 2 (CAI-RL/RLAIF) : Optimise le comportement via reinforcement learning avec feedback de l'IA
Cette approche permet de crรฉer des modรจles plus sรปrs, plus transparents et plus scalables que les approches purement humaines comme RLHF.
Le rรฉsultat ? Des IA comme Claude qui peuvent expliquer leurs refus, engager avec les demandes difficiles, et adapter leur comportement en modifiant simplement la constitution โ sans rรฉ-entraรฎnement humain massif.
Rรฉfรฉrences
- Constitutional AI: Harmlessness from AI Feedback โ Anthropic Research
- Constitutional AI: Harmlessness from AI Feedback (arXiv) โ Bai et al. (2022)
- Anthropic's Constitutional Principles
Article suivant : Les Principes Constitutionnels d'Anthropic โ Analyse dรฉtaillรฉe de la constitution de Claude.