Une nouvelle étude révèle qu'un facteur unique d'intelligence générale explique bien moins la performance des modèles de langage qu'on ne le suppose généralement, ce qui suggère que l'intelligence artificielle n'est que partiellement interprétable.
La recherche
Les chercheurs Faiz Ghifari Haznitrama, Afrizal Hasbi Azizy et Faeyza Rishad Ardi ont analysé 13 251 scores d'évaluation publiés couvrant 1 618 modèles de langage sur 456 benchmarks textuels différents. À l'aide de l'analyse factorielle — une technique de réduction dimensionnelle empruntée à la psychométrie — ils ont testé si la performance des IA s'organise autour d'un facteur d'intelligence générale et sans domaine, semblable à l'intelligence fluide chez l'humain.
Le jeu de données était extrêmement creux, ce qui signifie que la plupart des modèles n'ont pas été testés sur la plupart des benchmarks. Pour y remédier, l'équipe a triangulé son analyse à travers différentes méthodes de densification des données et d'imputation. Un schéma robuste a émergé : un facteur d'intelligence générale expliquait 70,8 % de la variance dans la performance des modèles à l'estimation la plus généreuse, et bien moins dans la plupart des solutions. Les benchmarks de contenu similaire ne se regroupaient pas nécessairement ensemble, et le facteur g n'était dominé par aucun thème commun. Fait crucial, on manquait de preuves que les benchmarks d'« intelligence » standard soient de bons indicateurs de ce facteur.
Pourquoi c'est important
Ces résultats remettent en question les efforts actuels pour définir, identifier et cibler l'intelligence générale comme une construction tangible dans le développement des modèles de langage. Si les capacités de premier ordre sont partiellement idiosyncratiques et non identifiables en pratique, alors cibler une capacité conceptuelle unique n'est pas fondé. Pour quiconque s'intéresse à la cognition, cela fait écho aux débats en psychométrie humaine : l'intelligence générale est réelle mais ne raconte pas toute l'histoire. Tout comme les capacités cognitives humaines sont un mélange de facteurs larges et spécifiques, la performance des machines peut dépendre de nombreuses compétences étroites qui ne se réduisent pas à un seul chiffre. Cela suggère que l'intelligence humaine et artificielle se comprennent mieux comme des profils de forces plutôt que comme un rang unique.
Ce que vous pouvez faire
Au lieu de vous focaliser sur un seul score de QI, explorez votre profil cognitif. Passez des tests qui mesurent différents domaines — mémoire, raisonnement, compétences verbales, aptitude spatiale — et repérez vos points forts. Ensuite, entraînez ces domaines spécifiques avec des exercices ciblés. Cette approche fondée sur les preuves respecte la complexité de l'intelligence réelle, que ce soit dans les cerveaux ou les machines.
Source : arXiv q-bio.NC
Curieux de connaître votre propre cerveau ? Passez notre test de QI adaptatif gratuit ou essayez 306 niveaux d'entraînement cérébral.