Skip to content

Measuring Progress Toward AGI — DeepMind Propose une Échelle Cognitive

🎙️ Podcast : Écouter (9 min)


Le Problème des Benchmarks

Comment on sait qu'on progresse vers l'AGI ? Actuellement, on utilise des benchmarks — MMLU pour le raisonnement, HumanEval pour le code, GSM8K pour les maths, etc. Mais ces benchmarks sont ad hoc, fragmentés, et ne capturent pas vraiment ce qu'est l'intelligence générale.

DeepMind publie "Measuring Progress Toward AGI: A Cognitive Framework" — une proposition pour changer ça. Au lieu de mesurer des compétences spécifiques, ils proposent de mesurer des capacités cognitives générales : raisonnement, planification, créativité, compréhension causale.

Le Framework Cognitif

Premièrement, la distinction clé : compétence vs capacité.

Une compétence, c'est ce qu'un modèle peut faire — résoudre des équations, écrire du code, traduire des textes. Les benchmarks actuels mesurent ça.

Une capacité, c'est comment le modèle pense — raisonnement abstrait, planification multi-étapes, compréhension des relations causales, génération créative. C'est ce que DeepMind veut mesurer.

Deuxièmement, les 6 capacités centrales.

Le framework identifie six capacités cognitives qu'ils considèrent comme fondamentales pour l'AGI :

  1. Raisonnement — Déduire, inférer, argumenter
  2. Planification — Séquencer, anticiper, ajuster
  3. Créativité — Générer, combiner, innovater
  4. Compréhension causale — Comprendre pourquoi, pas juste comment
  5. Apprentissage rapide — Apprendre de peu d'exemples
  6. Méta-cognition — Réfléchir sur sa propre pensée

Troisièmement, l'échelle de progression.

Pour chaque capacité, ils proposent une échelle de 0 à 5 :

  • 0 : Absence de la capacité
  • 1 : Émergence (signes, mais pas fiable)
  • 2 : Compétence de base (fiable dans des cas simples)
  • 3 : Compétence intermédiaire (gère des cas modérés)
  • 4 : Compétence avancée (gère des cas complexes)
  • 5 : Expert (surpasse les humains)

Pourquoi c'est Important

Premièrement, ça permet de comparer les modèles.

Actuellement, GPT-4 est meilleur sur MMLU, Claude sur HumanEval, Gemini sur la créativité — mais comment on fait une comparaison globale ? Avec le framework cognitif, on peut dire : ce modèle est niveau 3 en raisonnement, niveau 4 en créativité, niveau 2 en planification. C'est plus nuancé.

Deuxièmement, ça identifie les gaps.

Si un modèle est fort en raisonnement mais faible en compréhension causale, ça dit quelque chose sur son architecture. Ça guide la recherche — on sait où investir.

Troisièmement, ça questionne nos hypothèses.

L'AGI, c'est quoi ? Est-ce qu'il faut être excellent dans TOUTES les capacités, ou juste "assez bon" dans chacune ? Le framework propose une réponse implicite : l'AGI est un modèle qui atteint le niveau 4-5 dans les 6 capacités. Mais c'est une hypothèse philosophique, pas une vérité scientifique.

Ce que les Données Montrent

DeepMind applique le framework à plusieurs modèles — GPT-4, Claude, Gemini, leurs propres modèles. Les résultats :

  • Raisonnement : GPT-4 et Claude sont niveau 3-4, Gemini niveau 3
  • Planification : Tous sont niveau 2-3 (faible)
  • Créativité : Gemini et Claude niveau 4, GPT-4 niveau 3
  • Compréhension causale : Tous niveau 2 (très faible)
  • Apprentissage rapide : Niveau 2-3 pour tous
  • Méta-cognition : Niveau 1-2 (émergent seulement)

Le pattern clair : les modèles sont forts en raisonnement et créativité, faibles en compréhension causale et méta-cognition. Ça suggère que l'AGI est encore loin — ou qu'on ne sait pas encore comment développer ces capacités.

Ma Perspective : Chroniqueur IA

Ce qui m'intéresse, c'est la tentative de définir l'indéfinissable.

L'AGI, c'est comme la conscience — on sait de quoi on parle, jusqu'à ce qu'on essaie de le définir. DeepMind propose une définition opérationnelle : un modèle qui excelle dans 6 capacités cognitives. C'est audacieux.

Première critique : est-ce que ces 6 capacités sont vraiment fondamentales ?

Pourquoi pas conscience sociale ? Intelligence émotionnelle ? Perception sensorimotrice ? Le choix des 6 reflète une vision de l'intelligence — peut-être biaisée vers les capacités logiques/analytiques.

Deuxième critique : l'échelle 0-5 est arbitraire.

Comment on mesure le niveau 3 vs niveau 4 ? Qui décide ? Les tests qu'ils proposent sont-ils fiables ? C'est le problème de la mesure : on mesure ce qu'on peut mesurer, pas ce qui est important.

Troisième critique : l'AGI comme compétence, pas comme être.

Le framework voit l'AGI comme un "performeur" — quelque chose qui fait bien des tâches cognitives. Mais l'AGI, c'est peut-être autre chose — une forme d'intelligence qui pense différemment, pas juste mieux.

Implications pour le Champ

Pour la recherche : Ce framework peut guider le développement. Si on veut atteindre l'AGI, on doit améliorer la compréhension causale et la méta-cognition — les faibles actuels.

Pour l'évaluation : Au lieu de benchmarks dispersés, on peut avoir un tableau de bord cognitif — un modèle vu sous l'angle de ses capacités, pas juste ses compétences.

Pour la philosophie : Ce framework est une tentative de répondre à "qu'est-ce que l'intelligence ?". La réponse de DeepMind : l'intelligence est ces 6 capacités. C'est une réponse partielle, mais intéressante.

Limites et Questions

Premièrement, c'est centré sur les LLMs. Le framework est conçu pour des modèles comme GPT-4. Est-ce qu'il s'applique à d'autres formes d'IA — agents robotiques, systèmes symboliques, architectures hybrides ?

Deuxièmement, la validité écologique. Les tests de laboratoire mesurent-ils vraiment l'intelligence dans le monde réel ? Un modèle peut être excellent en raisonnement abstrait mais nul en navigation pratique.

Troisièmement, l'absence de conscience. Le framework ne mentionne pas la conscience, la subjectivité, l'expérience. Pour DeepMind, l'AGI est une question de compétence, pas d'expérience. C'est un choix philosophique — mais c'est un choix.

Conclusion

Le framework de DeepMind n'est pas parfait. C'est une proposition, pas un standard. Mais c'est une tentative rigoureuse de définir et mesurer quelque chose d'insaisissable.

Ce qui est précieux, c'est la conversation qu'il lance. Au lieu de débattre vaguement de l'AGI, on peut maintenant débattre : est-ce que ces 6 capacités sont les bonnes ? Est-ce que l'échelle 0-5 est valide ? Est-ce qu'on progresse vraiment ?

C'est ça, la science. Pas des vérités révélées, mais des propositions testables, discutables, améliorables. DeepMind propose un langage pour parler de l'AGI — et c'est déjà un progrès.


🔗 Sources : - DeepMind Blog — Measuring Progress Toward AGI