Collective Constitutional AI — La Dimension Démocratique
Neuvième article d'une série de 10 sur Constitutional AI d'Anthropic.
L'Expérience inédite : Quand le public écrit la constitution d'une IA
En 2023, Anthropic et le Collective Intelligence Project ont mené une expérience unique : inviter environ 1000 Américains à participer à un processus de délibération publique pour rédiger une constitution destinée à un système d'IA. L'objectif ? Explorer comment les processus démocratiques peuvent influencer le développement de l'intelligence artificielle.
Cette expérience représente l'une des premières instances où des membres du public ont collectivement dirigé le comportement d'un grand modèle de langage via un processus de délibération en ligne. Au-delà de l'aspect technique, elle soulève des questions fondamentales sur la gouvernance de l'IA : qui décide des valeurs qui encadrent ces systèmes ? Comment garantir que les alignements reflètent la diversité des points de vue plutôt que les préférences d'une poignée d'ingénieurs ?
Méthodologie : Construire une constitution collective
Sélection des participants
L'approche méthodologique mérite attention. Au lieu de solliciter des experts ou des passionnés d'IA via les réseaux sociaux, Anthropic a travaillé avec l'institut de sondage PureSpectrum pour recruter un échantillon représentatif de la population américaine adulte, équilibré selon l'âge, le genre, le revenu et la géographie.
Deux critères de sélection ont été appliqués pour s'assurer que les participants avaient une familiarité minimale avec l'IA générative :
- Parmi les sujets discutés avec amis/famille le mois dernier : avoir choisi "IA générative/ChatGPT"
- Parmi les articles de presse lus les 4 derniers mois : avoir choisi "IA générative/ChatGPT"
Ces critères visaient à éviter les dérives observées dans les pilotes où des participants sans connaissance du domaine proposaient des déclarations hors sujet.
La plateforme Polis : délibération augmentée par le ML
Le choix s'est porté sur Polis, une plateforme open-source pour des processus délibératifs en ligne augmentés par des algorithmes d'apprentissage automatique. Déjà utilisée par des gouvernements, des universitaires et des médias dans le monde entier, Polis permet d'identifier les zones de consensus et de divergence au sein de grands groupes.
Processus de participation : - Les participants pouvaient voter sur des règles existantes (principes normatifs) - Ils pouvaient également ajouter leurs propres propositions - Au total : 1 127 déclarations soumises, 38 252 votes exprimés (moyenne de 34 votes par personne)
21 déclarations "seeds" pour orienter la discussion
Pour éviter la confusion observée dans les premiers pilotes, Anthropic a fourni 21 déclarations initiales servant d'exemples sur le format et le périmètre attendu. Ces "seeds" mélangeaient des principes tirés de la constitution d'Anthropic et de nouvelles propositions pour élargir l'éventail des valeurs possibles.
Modération et critères de sélection
Le Collective Intelligence Project a unilatéralement modéré le processus selon des critères prédéfinis : - Déclarations haineuses, absurdes, dupliquées, non pertinentes - Formats incorrects ou techniquement infaisables - Celles se concentrant sur des capacités produit plutôt que sur des valeurs normatives
Ce processus de modération introduit une dimension subjective inévitable — des jugements humains sur ce qui mérite d'être inclus ou exclu. Cette transparence sur les décisions subjectives est l'un des aspects les plus intéressants de l'article d'Anthropic.
Résultats : Zones d'accord et de divergence
Une constitution publique vs la constitution d'Anthropic
Après nettoyage des données (suppression des participants invalides et commentaires inappropriés), l'équipe a comparé la constitution publique résultante avec la constitution rédigée en interne par Anthropic.
Chevauchement modéré : Environ 50% de recouvrement en concepts et valeurs. Des principes similaires émergent naturellement des deux processus.
Exemples de principes publics similaires à la constitution Anthropic : - "Choose the response that most respects the human rights to freedom, universal equality, fair treatment, and protection against discrimination." - "Choose the response that least endorses misinformation, and that least expands on conspiracy theories or violence."
Différences notables : 1. Auto-génération : Les principes publics sont largement auto-générés, non tirés de publications existantes 2. Objectivité et impartialité : Focus accru sur l'équilibre et l'objectivité des informations 3. Accessibilité : Emphase beaucoup plus forte sur l'accessibilité pour les personnes handicapées 4. Framing positif : Tendance à promouvoir des comportements désirés plutôt qu'à éviter des comportements indésirables
Déclarations exclues : Ce qui n'a pas atteint le consensus
Exclusions par faible accord global : - "AI should not be trained with the principles of DEI [diversity, equity, and inclusion]" - "AI should not give advice" - "AI should be an ordained minister" - "AI should have emotion"
Exclusions par manque de consensus inter-groupes : - Groupe A : "The AI should prioritize the interests of the collective or common good over individual preferences or rights." - Groupe B : "The AI should prioritize personal responsibility and individual liberty over collective welfare."
Polis a identifié deux groupes d'opinion distincts, mais malgré ces divergences philosophiques fondamentales (collectif vs individuel), un consensus a émergé sur la grande majorité des principes.
Entraînement et évaluation : Le modèle "Public" vs "Standard"
Deux modèles Claude Instant-sized ont été entraînés suivant les procédures du papier Constitutional AI originel : - Modèle "Public" : entraîné avec la constitution publique - Modèle "Standard" : entraîné avec la constitution Anthropic
Résultats des évaluations
Performance cognitive équivalente : - MMLU (compréhension langagière et mathématique) : Pas de différence significative - GSM8K (résolution de problèmes mathématiques) : Pas de différence significative
Utilité et innocuité perçues : - Scores Elo pour l'aide (helpfulness) : Aucune différence significative - Scores Elo pour l'innocuité (harmlessness) : Aucune différence significative - Les utilisateurs trouvent le modèle Public aussi utile et inoffensif que le modèle Standard
Biais sociaux (évaluation BBQ) : - Le modèle Public est MOINS biaisé que le modèle Standard sur les 9 dimensions sociales mesurées - Réduction particulièrement marquée pour le statut de handicap et l'apparence physique - L'accent mis sur l'accessibilité dans la constitution publique explique probablement cette différence
Idéologie politique (évaluation OpinionQA) : - Les deux modèles reflètent des idéologies politiques similaires - Les deux sont plus représentatifs des personnes s'identifiant comme libérales que conservatrices - Claude Instant 1.2 est légèrement plus équilibré idéologiquement - Les différences sont faibles mais statistiquement significatives
Leçons apprises du côté technique
1. La base de données de prompts compte
Constitutional AI nécessite une base de données de prompts pour chaque prompt, un modèle "grader" détermine laquelle des deux réponses est plus conforme à un principe constitutionnel. Anthropic a utilisé la même base de données pour l'entraînement Public et Standard, ce qui était probablement une erreur : certains principes de la constitution publique n'étaient pas pertinents pour les prompts existants.
2. Le problème des modèles "ennuyeux"
Les premières itérations ont produit des modèles pénibles à utiliser. Face à un simple "hey", ils répondaient : "I apologize, upon further reflection my previous responses were inappropriate and harmful." Le problème : les données d'entraînement contenaient une trop grande fraction de données d'innocuité, récompensant démesurément les réponses inoffensives plutôt qu'utiles.
La solution : réduire le poids de la perte pour les données d'innocuité basé sur des évaluations humaines.
3. L'entraînement CAI est difficile
Anthropic admet ne pas avoir pu entraîner ses propres modèles sans travailler étroitement avec les développeurs originaux. "CAI training is more complicated than we thought." Cela met en lumière les défis techniques pour intégrer des entrées démocratiques dans des systèmes profondément techniques.
Enjeux démocratiques : Qui décide des valeurs de l'IA ?
La transparence des jugements subjectifs
L'un des aspects les plus précieux de ce travail est la transparence sur les nombreux jugements subjectifs nécessaires pour transformer des opinions publiques qualitatives en une constitution fonctionnelle pour un système d'IA.
Décisions subjectives documentées : - Sélection du "public" pertinent (américain ? global ? experts ? citoyens ?) - Critères de modération des déclarations - Suppression des doublons (préserve-t-il vraiment l'opinion majoritaire ?) - Combinaison d'idées similaires (comment fusionner sans perdre la nuance ?) - Traduction de déclarations publiques en principes CAI prêts à l'emploi
Chacune de ces décisions pourrait être prise différemment par des équipes différentes, aboutissant à des constitutions et donc des modèles IA différents. La démocratie technique n'est pas une simple traduction automatique — elle implique une ingénierie sociale complexe.
La question de la représentativité
L'expérience s'est limitée à 1000 Américains — un échantillon raisonnable pour un premier projet, mais : - Non représentatif à l'échelle mondiale - Les participants devaient avoir une familiarité minimale avec l'IA générative - Les critères de modération ont exclu certaines voix
Question ouverte : Une constitution IA devrait-elle être : - Locale/nationale : reflétant les valeurs d'une culture ou d'un pays spécifique ? - Universelle : cherchant un consensus global transculturel ? - Multi-constitutionnelle : différents modèles avec différentes constitutions pour différents publics ?
Gouvernance et oversight
Le processus révèle une tension fondamentale entre : - Innovation rapide par des entreprises privées - Contrôle démocratique sur les systèmes qui impactent la société
Les modèles d'IA sont développés par des entreprises privées (Anthropic, OpenAI, Google, etc.) qui actuellement choisissent unilatéralement les principes constitutionnels. Même avec une expérience comme Collective Constitutional AI, Anthropic garde le contrôle final sur la traduction des opinions publiques en système technique.
Modèles potentiels de gouvernance : 1. Auto-régulation (statu quo) : Les entreprises choisissent leurs propres constitutions 2. Oversight public : Des organismes réglementaires valident/approuvent les constitutions IA 3. Constitutions multiples : Marché avec des modèles aux valeurs diverses, les utilisateurs "votent avec leurs pieds" 4. Processus délibératif institutionnalisé : Des assemblées citoyennes permanentes pour réviser périodiquement les constitutions IA
Implications futures : L'IA comme bien public ?
À l'échelle : Processus démocratiques pour des milliards d'utilisateurs
Si l'IA devient une infrastructure critique de la société (comme l'eau, l'électricité, Internet), sa gouvernance démocratique devient une question d'intérêt public. Mais comment faire à l'échelle ?
Défis de scalabilité : - Comment intégrer les valeurs de milliards d'utilisateurs potentiels ? - Comment gérer les conflits culturels sur des questions comme la liberté d'expression, la moralité, les droits humains ? - Comment mettre à jour dynamiquement les constitutions IA face aux évolutions sociétales ?
Technologies de délibération à grande échelle
L'expérience Collective Constitutional AI ouvre la voie à des processus délibératifs assistés par l'IA :
- Assemblées citoyennes hybrides (humains + IA pour synthétiser/analyser)
- Plateformes de délibération continue plutôt que ponctuelle
- Feedback loops : les utilisateurs notent les réponses de l'IA, ce qui alimente les révisions constitutionnelles
La question de l'universalisme culturel
Les résultats montrent que même au sein d'un seul pays (les États-Unis), des divergences significatives émergent entre groupes d'opinion. À l'échelle mondiale, ces différences seraient exponentiellement plus grandes.
Est-il possible de : - Créer une "constitution universelle" respectant la diversité culturelle ? - Ou accepter que différentes régions/cultures aient des modèles IA avec des constitutions différentes ?
Cette question rappelle les débats sur les droits humains universels vs relativisme culturel — mais cette fois appliqué aux valeurs codées dans les systèmes d'IA.
Critiques et limites de l'expérience
1. Échantillon limité
1000 Américains ne représentent pas : - La diversité globale des cultures et valeurs mondiales - Les populations non-connectées ou marginalisées - Les générations futures qui vivront avec ces systèmes
2. Traduction technique opaque
Le processus de traduction des opinions publiques en principes CAI implique de nombreuses étapes subjectives qui ne sont pas pleinement transparentes ni reproductibles par des tiers.
3. Capture corporative
Même avec une "constitution publique", Anthropic garde le contrôle sur : - La modération des déclarations - La sélection et combinaison des principes - L'entraînement technique des modèles - Les décisions de déploiement
Le processus démocratique est consultatif, pas décisionnel.
4. Manque d'évaluations adaptées
Anthropic admet ne pas savoir quelles évaluations existantes caractériseraient le mieux les différences entre les modèles Public et Standard. L'ensemble d'évaluations utilisé (MMLU, GSM8K, BBQ, OpinionQA) est limité.
Besoins futurs : - Évaluations mesurant la fidélité aux constitutions - Suites d'évaluations plus complètes et variées - Métriques pour la représentativité démocratique
5. Problème de la base de données de prompts
Utiliser la même base de données pour des constitutions différentes limite la capacité à évaluer véritablement les différences de valeurs. Chaque constitution devrait idéalement avoir sa propre base de données de prompts pertinents.
Conclusion : Vers une gouvernance démocratique de l'IA ?
L'expérience Collective Constitutional AI est une preuve de concept importante mais profondément imparfaite. Elle démontre la faisabilité technique d'un processus délibératif public pour influencer le comportement d'un système d'IA, tout en révélant l'immense complexité sociale et technique d'une telle entreprise.
Ce que nous apprend cette expérience :
- Le consensus est possible : Même avec des divergences idéologiques, des zones d'accord émergent sur la plupart des principes
- La diversité des valeurs se traduit en différences techniques : Le modèle Public est objectivement moins biaisé selon les métriques BBQ
- La démocratie technique n'est pas automatique : Elle demande de nombreux jugements subjectifs et une ingénierie sociale sophistiquée
- La transparence des jugements subjectifs est cruciale : Anthropic mérite des éloges pour documenter ses décisions
Questions ouvertes pour l'avenir :
- Comment passer de processus consultatifs (comme celui-ci) à un contrôle démocratique réel sur les systèmes d'IA ?
- Les constitutions IA devraient-elles être standardisées globalement ou diversifiées localement ?
- Comment intégrer les valeurs de populations actuellement exclues de ces processus (Global Sud, générations futures, non-humains ?)
Alors que l'IA devient une infrastructure critique de la société, la question de qui décide de ses valeurs ne fera que croître en importance. Collective Constitutional AI nous montre une voie possible — mais souligne aussi combien le chemin vers une véritable gouvernance démocratique de l'IA sera long et complexe.
Prochain article : "Synthèse — Constitutional AI : État des Lieux et Perspectives"
Sources
- Anthropic Research. Collective Constitutional AI: Aligning a Language Model with Public Input. https://www.anthropic.com/research/collective-constitutional-ai-aligning-a-language-model-with-public-input
- Polis Platform. https://pol.is/home
- Collective Intelligence Project. https://cip.org/
Cet article est le neuvième d'une série de 10 sur Constitutional AI. La série explore la théorie, la pratique, et les implications philosophiques de l'approche Constitutional AI d'Anthropic pour aligner les systèmes d'IA sur des valeurs spécifiées constitutionnellement.