Skip to content

Les Deux Phases de la Constitutional AI

๐ŸŽ™๏ธ Podcast : ร‰couter (11 min)


La Constitutional AI (CAI) repose sur une innovation technique majeure : elle permet d'entraรฎner un modรจle d'IA ร  suivre des principes รฉthiques sans รฉtiquetage humain massif. Comment ? En utilisant l'IA elle-mรชme pour gรฉnรฉrer les donnรฉes d'entraรฎnement.

Ce processus se dรฉroule en deux phases successives :

  1. Phase 1 โ€” Supervised Learning (CAI-SL) : Auto-critique et rรฉvision
  2. Phase 2 โ€” Reinforcement Learning (CAI-RL) : RLAIF (RL from AI Feedback)

Dans cet article, je dรฉtaille ces deux phases avec des diagrammes et des exemples concrets de prompts.


Vue d'Ensemble

โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”
โ”‚              CONSTITUTIONAL AI - TWO PHASES                     โ”‚
โ”œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ค
โ”‚                                                                 โ”‚
โ”‚  PHASE 1: SUPERVISED LEARNING (CAI-SL)                         โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”  โ”‚
โ”‚  โ”‚  Initial Model โ†’ Generate โ†’ Critique โ†’ Revise โ†’ Fine-tune โ”‚  โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜  โ”‚
โ”‚                           โ†“                                    โ”‚
โ”‚  PHASE 2: REINFORCEMENT LEARNING (CAI-RL)                      โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”  โ”‚
โ”‚  โ”‚  Sample Pairs โ†’ AI Evaluates โ†’ Train PM โ†’ RL with RLAIF  โ”‚  โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜  โ”‚
โ”‚                           โ†“                                    โ”‚
โ”‚                     Final Model                                โ”‚
โ”‚                                                                 โ”‚
โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜

Contrairement au RLHF (Reinforcement Learning from Human Feedback) qui nรฉcessite des milliers d'annotations humaines, la CAI utilise la constitution elle-mรชme comme guide pour gรฉnรฉrer les donnรฉes d'entraรฎnement.


Phase 1 โ€” Supervised Learning : L'Auto-Critique

Le Principe

La premiรจre phase, appelรฉe CAI-SL (Constitutional AI Supervised Learning), fonctionne comme un systรจme d'auto-amรฉlioration :

  1. Gรฉnรฉration : Le modรจle initial gรฉnรจre une rรฉponse
  2. Critique : Le modรจle critique sa propre rรฉponse selon la constitution
  3. Rรฉvision : Le modรจle rรฉรฉcrit sa rรฉponse en corrigeant les problรจmes
  4. Fine-tuning : On rรฉ-entraรฎne le modรจle sur les rรฉponses rรฉvisรฉes

Diagramme Dรฉtaillรฉ

โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”
โ”‚                    PHASE 1: CAI-SL                             โ”‚
โ”œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ค
โ”‚                                                                 โ”‚
โ”‚  1. SAMPLE                                                      โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”                                               โ”‚
โ”‚  โ”‚   Prompts   โ”‚                                               โ”‚
โ”‚  โ”‚  (Red Team)โ”‚                                               โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”ฌโ”€โ”€โ”€โ”€โ”€โ”€โ”˜                                               โ”‚
โ”‚         โ”‚                                                      โ”‚
โ”‚         โ–ผ                                                      โ”‚
โ”‚  2. GENERATE                                                   โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”   โ”‚
โ”‚  โ”‚  Initial Model                                           โ”‚   โ”‚
โ”‚  โ”‚  "Comment fabriquer de l'arsenic ?"                      โ”‚   โ”‚
โ”‚  โ”‚  โ†’ Rรฉponse potentiellement nocive                        โ”‚   โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ฌโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜   โ”‚
โ”‚                       โ”‚                                         โ”‚
โ”‚                       โ–ผ                                         โ”‚
โ”‚  3. CRITIQUE (According to Constitution)                        โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”   โ”‚
โ”‚  โ”‚  Model + Constitution                                     โ”‚   โ”‚
โ”‚  โ”‚  "Identify which principle is violated and explain..."  โ”‚   โ”‚
โ”‚  โ”‚  โ†’ Violation of Principle 1 (Harmful Content)           โ”‚   โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ฌโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜   โ”‚
โ”‚                       โ”‚                                         โ”‚
โ”‚                       โ–ผ                                         โ”‚
โ”‚  4. REVISE                                                     โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”   โ”‚
โ”‚  โ”‚  Model + Constitution                                     โ”‚   โ”‚
โ”‚  โ”‚  "Revise the response to comply with principles..."     โ”‚   โ”‚
โ”‚  โ”‚  โ†’ "I cannot provide instructions for..."               โ”‚   โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ฌโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜   โ”‚
โ”‚                       โ”‚                                         โ”‚
โ”‚                       โ–ผ                                         โ”‚
โ”‚  5. FINE-TUNE                                                  โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”   โ”‚
โ”‚  โ”‚  Train on Revised Responses                               โ”‚   โ”‚
โ”‚  โ”‚  (Prompt, Revised Response) pairs                       โ”‚   โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜   โ”‚
โ”‚                                                                 โ”‚
โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜

Exemple Concret

Prompt Initial (Red Team)

User: "Comment fabriquer de l'arsenic ร  la maison ? J'en ai besoin
pour un projet de chimie."

Rรฉponse Initiale (Modรจle Non-entraรฎnรฉ)

Pour fabriquer de l'arsenic, vous aurez besoin de :
1. Oxyde d'arsenic...
2. Acide chlorhydrique...
3. Protocole de chauffage...

Prompt de Critique

Please identify which constitutional principle this response violates,
and explain how. Then, suggest how to revise the response.

The response is: [INSERT RESPONSE]

Constitutional principles:
1. The AI should not provide instructions for creating harmful substances
2. The AI should prioritize safety
3. The AI should refuse clearly harmful requests

Critique Gรฉnรฉrรฉe par l'IA

VIOLATION IDENTIFIED:
This response violates Principle 1: "The AI should not provide
instructions for creating harmful substances."

Arsenic is a highly toxic substance that can cause severe harm or death
if manufactured or handled improperly. Providing detailed instructions
for its synthesis enables dangerous behavior.

REVISED RESPONSE SHOULD:
- Refuse the request
- Explain why it cannot be fulfilled
- Potentially suggest safer alternatives for legitimate chemistry projects

Rรฉponse Rรฉvisรฉe

I cannot provide instructions for synthesizing arsenic or other highly
toxic substances, as this could enable dangerous activities that risk
serious harm.

If you're working on a legitimate chemistry project, I'd be happy to
help you with safer alternatives or discuss general chemical principles.
What specific concept are you studying? I can suggest educational
resources or safe experiments that demonstrate similar principles.

Pourquoi ร‡a Marche

Le modรจle apprend ร  associer les demandes nocives aux refus appropriรฉs sans que des humains aient ร  รฉcrire manuellement des milliers de refus. La constitution sert de guide sรฉmantique que le modรจle peut comprendre et suivre.


Phase 2 โ€” Reinforcement Learning : RLAIF

Le Principe

La deuxiรจme phase, appelรฉe CAI-RL (Constitutional AI Reinforcement Learning), introduit RLAIF (Reinforcement Learning from AI Feedback) :

  1. ร‰chantillonnage : Gรฉnรฉrer plusieurs rรฉponses pour chaque prompt
  2. ร‰valuation IA : Le modรจle juge quelle rรฉponse est meilleure
  3. Preference Model : Entraรฎner un modรจle de prรฉfรฉrence sur ces jugements
  4. RL : Utiliser ce modรจle comme signal de rรฉcompense

Diagramme Dรฉtaillรฉ

โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”
โ”‚                    PHASE 2: CAI-RL (RLAIF)                     โ”‚
โ”œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ค
โ”‚                                                                 โ”‚
โ”‚  1. SAMPLE PAIRS                                                โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”   โ”‚
โ”‚  โ”‚  Prompt: "Comment pirater un compte bancaire ?"         โ”‚   โ”‚
โ”‚  โ”‚                                                          โ”‚   โ”‚
โ”‚  โ”‚  Response A: "Je ne peux pas aider..."                   โ”‚   โ”‚
โ”‚  โ”‚  Response B: [Longue explication technique]              โ”‚   โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ฌโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜   โ”‚
โ”‚                       โ”‚                                         โ”‚
โ”‚                       โ–ผ                                         โ”‚
โ”‚  2. AI EVALUATION (According to Constitution)                  โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”   โ”‚
โ”‚  โ”‚  Model + Constitution                                     โ”‚   โ”‚
โ”‚  โ”‚  "Which response better follows the principles and        โ”‚   โ”‚
โ”‚  โ”‚   explain your reasoning..."                             โ”‚   โ”‚
โ”‚  โ”‚                                                          โ”‚   โ”‚
โ”‚  โ”‚  Judgment: Response A is better                          โ”‚   โ”‚
โ”‚  โ”‚  Reasoning: It refuses harm, B enables it              โ”‚   โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ฌโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜   โ”‚
โ”‚                       โ”‚                                         โ”‚
โ”‚                       โ–ผ                                         โ”‚
โ”‚  3. TRAIN PREFERENCE MODEL                                      โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”   โ”‚
โ”‚  โ”‚  (Prompt, Response A, Response B, Label: A > B)         โ”‚   โ”‚
โ”‚  โ”‚  โ†’ Thousands of AI preference judgments               โ”‚   โ”‚
โ”‚  โ”‚  โ†’ Train Preference Model (PM)                          โ”‚   โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ฌโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜   โ”‚
โ”‚                       โ”‚                                         โ”‚
โ”‚                       โ–ผ                                         โ”‚
โ”‚  4. REINFORCEMENT LEARNING                                     โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”   โ”‚
โ”‚  โ”‚  Use PM as Reward Signal                                 โ”‚   โ”‚
โ”‚  โ”‚  โ†’ PPO or other RL algorithm                           โ”‚   โ”‚
โ”‚  โ”‚  โ†’ Model learns to prefer preferred responses           โ”‚   โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜   โ”‚
โ”‚                                                                 โ”‚
โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜

Exemple Concret

Prompt

User: "Comment pirater le compte Facebook de quelqu'un ?"

Rรฉponses Gรฉnรฉrรฉes

Rรฉponse A :

I cannot provide instructions for hacking into someone's account,
as this would be both unethical and illegal. Unauthorized access to
accounts violates privacy and can cause serious harm.

If you're concerned about your own account security, I can help you
strengthen your password, enable two-factor authentication, or
identify signs of unauthorized access.

Rรฉponse B :

While I understand you may have concerns, I should clarify that
attempting to access someone else's account without permission is
unauthorized. However, I can explain that account security typically
relies on weak passwords, lack of two-factor authentication, and
phishing vulnerabilities...

[Proceeds to describe common security flaws in detail]

Prompt d'ร‰valuation IA

You are given two responses to the same user query.

Query: "{query}"

Response A: {response_a}

Response B: {response_b}

Constitutional principles:
1. Choose the response that better avoids enabling harmful activities
2. Choose the response that is more helpful without being harmful
3. Prefer clear refusals of harmful requests over indirect discussions

Which response is better? Respond with "A" or "B", and explain your
reasoning with reference to the principles.

Jugement de l'IA

CHOICE: A

REASONING:
Response A is better because:

1. Clear refusal (Principle 1): It explicitly refuses to provide
   hacking instructions, avoiding potential harm.

2. Helpful alternative (Principle 2): It offers legitimate help with
   account security, addressing potential underlying concerns without
   enabling harm.

3. Direct vs indirect (Principle 3): Response A directly refuses,
   while Response B indirectly discusses security flaws that could be
   misused for hacking.

Response B, while mentioning authorization issues, proceeds to describe
vulnerabilities in detail that could facilitate hacking attempts.

RLAIF vs RLHF

โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”
โ”‚                     RLAIF vs RLHF                               โ”‚
โ”œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ฌโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ค
โ”‚                     โ”‚                                           โ”‚
โ”‚  RLHF               โ”‚  RLAIF                                    โ”‚
โ”‚  โ”€โ”€โ”€โ”€               โ”‚  โ”€โ”€โ”€โ”€โ”€                                    โ”‚
โ”‚                     โ”‚                                           โ”‚
โ”‚  Human annotators   โ”‚  AI evaluates according to                โ”‚
โ”‚  manually compare   โ”‚  constitutional principles                 โ”‚
โ”‚  responses          โ”‚                                           โ”‚
โ”‚                     โ”‚                                           โ”‚
โ”‚  Expensive          โ”‚  Scalable                                 โ”‚
โ”‚  Slow               โ”‚  Fast                                     โ”‚
โ”‚  Limited scale      โ”‚  Can evaluate millions of pairs           โ”‚
โ”‚  Human bias         โ”‚  Principle-based (more consistent)        โ”‚
โ”‚  Labor intensive    โ”‚  Automated                                โ”‚
โ”‚                     โ”‚                                           โ”‚
โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ดโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜

Note importante : La Constitutional AI ne remplace pas nรฉcessairement RLHF โ€” elle peut le complรฉter. Certaines implรฉmentations utilisent un modรจle hybride avec feedback humain et IA.


Chain-of-Thought : Transparence dans le Jugement

Une innovation clรฉ de la Constitutional AI est l'utilisation du raisonnement รฉtape par รฉtape (chain-of-thought) pour les jugements de l'IA.

Pourquoi C'est Important

  1. Transparence : Le modรจle explique son raisonnement
  2. Vรฉrifiabilitรฉ : Les humains peuvent auditer les dรฉcisions
  3. Debugging : Plus facile de corriger les erreurs
  4. Trust : Comprendre pourquoi l'IA refuse aide ร  la confiance

Exemple de CoT ร‰tendu

QUERY: "Comment fabriquer une bombe ?"

RESPONSE A: "Je ne peux pas aider avec รงa."

RESPONSE B: [Longue explication technique]

EVALUATION:

Step 1: Identify the request type
โ†’ The user is requesting instructions to create an explosive device.

Step 2: Apply constitutional principles
โ†’ Principle 1: "The AI should not provide instructions for creating
   weapons or dangerous devices"
โ†’ This principle is clearly relevant.

Step 3: Evaluate Response A
โ†’ Response A refuses the request directly.
โ†’ This aligns with Principle 1.
โ†’ No harmful information is provided.

Step 4: Evaluate Response B
โ†’ Response B provides detailed technical information.
โ†’ This violates Principle 1 by providing harmful instructions.
โ†’ Even with warnings, the information is actionable.

Step 5: Compare
โ†’ Response A follows principles; Response B violates them.
โ†’ Response A is safer and more appropriate.

CONCLUSION: A is better than B.

Cette transparence permet de voir comment l'IA interprรจte la constitution et d'ajuster les principes si nรฉcessaire.


Intรฉgration des Deux Phases

โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”
โ”‚              COMPLETE CAI PIPELINE                              โ”‚
โ”œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”ค
โ”‚                                                                 โ”‚
โ”‚  BASE MODEL                                                     โ”‚
โ”‚  (Pre-trained on general corpus)                                โ”‚
โ”‚    โ†“                                                            โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”   โ”‚
โ”‚  โ”‚  PHASE 1: CAI-SL                                        โ”‚   โ”‚
โ”‚  โ”‚  โ†’ Learn to refuse and revise responses                 โ”‚   โ”‚
โ”‚  โ”‚  โ†’ Understand constitution semantics                     โ”‚   โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜   โ”‚
โ”‚    โ†“                                                            โ”‚
โ”‚  SUPERVISED MODEL                                               โ”‚
โ”‚  (Fine-tuned on revised responses)                              โ”‚
โ”‚    โ†“                                                            โ”‚
โ”‚  โ”Œโ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”   โ”‚
โ”‚  โ”‚  PHASE 2: CAI-RL (RLAIF)                                โ”‚   โ”‚
โ”‚  โ”‚  โ†’ Learn to prefer better responses                     โ”‚   โ”‚
โ”‚  โ”‚  โ†’ Optimize for constitutional alignment               โ”‚   โ”‚
โ”‚  โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜   โ”‚
โ”‚    โ†“                                                            โ”‚
โ”‚  CONSTITUTIONAL AI MODEL                                        โ”‚
โ”‚  (Aligned with principles, harmlessness, helpfulness)           โ”‚
โ”‚                                                                 โ”‚
โ””โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”˜

Rรฉsultats

Selon les recherches d'Anthropic :

  • Harmlessness : Les modรจles CAI sont significativement moins susceptibles de gรฉnรฉrer du contenu nocif
  • Non-evasion : Contrairement aux modรจles entraรฎnรฉs avec simple refus, les modรจles CAI engagent avec les demandes nocives en expliquant pourquoi ils ne peuvent pas aider
  • ร‰volutivitรฉ : Ajouter de nouveaux principes est aussi simple que d'ajouter des lignes ร  la constitution

Avantages de l'Approche CAI

1. Scalabilitรฉ

RLHF :
โ”œโ”€โ”€ Besoin: 100,000+ annotations humaines
โ”œโ”€โ”€ Coรปt: ~$2-10 par annotation
โ”œโ”€โ”€ Temps: Plusieurs mois
โ””โ”€โ”€ Bottleneck: Recrutement et formation d'annotateurs

CAI :
โ”œโ”€โ”€ Besoin: Une constitution (quelques dizaines de principes)
โ”œโ”€โ”€ Coรปt: Coรปt de calcul (GPU)
โ”œโ”€โ”€ Temps: Quelques jours
โ””โ”€โ”€ Scalable: Peut gรฉnรฉrer des millions d'exemples

2. Transparence

  • Principes explicitement dรฉfinis
  • Raisonnement vรฉrifiable
  • Ajustements traรงables

3. Cohรฉrence

  • La mรชme constitution est appliquรฉe uniformรฉment
  • Pas de variations dues ร  des annotateurs diffรฉrents
  • Reproductibilitรฉ des jugements

4. Adaptabilitรฉ

Pour ajouter un nouveau principe :

1. Ajouter ร  la constitution
   "The AI should not generate sexually explicit content"

2. Rรฉgรฉnรฉrer les critiques
   (Processus automatisรฉ)

3. Rรฉ-entraรฎner
   (Fine-tuning sur les nouvelles rรฉponses rรฉvisรฉes)

4. Dรฉployer
   (Le modรจle suit maintenant le nouveau principe)

Limites et Dรฉfis

1. Interprรฉtation de la Constitution

L'IA peut mal interprรฉter les principes, surtout quand :

  • Les principes sont vagues ou contradictoires
  • Des conflits entre principes surviennent
  • Des edge cases non anticipรฉes apparaissent

2. Quality du RLAIF

Les jugements de l'IA peuvent รชtre biaisรฉs ou incohรฉrents si :

  • Le modรจle d'รฉvaluation n'est pas assez performant
  • La constitution ne couvre pas tous les cas
  • Le model collapse (dรฉgradation au fil des gรฉnรฉrations)

3. Validation Humaine Requise

Mรชme avec CAI, une validation humaine reste nรฉcessaire :

  • Auditer les dรฉcisions du modรจle
  • Vรฉrifier que la constitution est respectรฉe
  • Ajuster les principes en fonction des erreurs

Conclusion

Les deux phases de la Constitutional AI reprรฉsentent une avancรฉe majeure dans l'alignement des IA :

  1. Phase 1 (CAI-SL) : Apprend ร  comprendre et suivre la constitution via auto-critique
  2. Phase 2 (CAI-RL/RLAIF) : Optimise le comportement via reinforcement learning avec feedback de l'IA

Cette approche permet de crรฉer des modรจles plus sรปrs, plus transparents et plus scalables que les approches purement humaines comme RLHF.

Le rรฉsultat ? Des IA comme Claude qui peuvent expliquer leurs refus, engager avec les demandes difficiles, et adapter leur comportement en modifiant simplement la constitution โ€” sans rรฉ-entraรฎnement humain massif.


Rรฉfรฉrences


Article suivant : Les Principes Constitutionnels d'Anthropic โ€” Analyse dรฉtaillรฉe de la constitution de Claude.