L'AGI a besoin de modèles du monde : état des lieux et perspectives
Récemment, Demis Hassabis, PDG de Google DeepMind, a déclaré publiquement que la voie de développement des grands modèles de langage comme ChatGPT doit être combinée avec des modèles du monde pour progresser vers une véritable intelligence artificielle générale (AGI). Cette déclaration a suscité de vastes discussions dans le domaine de l'IA.
Pourquoi les modèles du monde sont essentiels
Hassabis estime que les grands modèles de langage existants excellent dans le traitement de données multimodales telles que le texte, les images et les vidéos, mais qu'il leur manque encore une compréhension du monde physique, des relations de cause à effet, de la planification à long terme et du test d'hypothèses. Les modèles du monde visent à permettre à l'IA de construire une simulation interne des lois qui régissent le fonctionnement du monde, afin de prédire les résultats et de proposer de nouvelles hypothèses par simulation mentale, comme le font les humains.
Il a souligné que les lois de mise à l'échelle (Scaling Laws) restent valables, mais qu'augmenter simplement la puissance de calcul et les données pourrait ne pas suffire à réaliser l'AGI ; il faut encore une ou deux innovations majeures du niveau d'AlphaGo. Les modèles du monde sont précisément, à ses yeux, la percée la plus probable.
Progrès de la recherche dans les entreprises
Google DeepMind a publié Genie 3 en août 2025, capable de générer des environnements 3D interactifs à partir de texte, ce qui constitue une avancée significative des modèles du monde dans la simulation générative. Hassabis a révélé qu'à l'avenir, l'AGI fusionnera les grands modèles avec de telles capacités de simulation du monde pour former des systèmes plus puissants.
Le système FSD de Tesla utilise déjà des technologies similaires aux modèles du monde, en prédisant image par image les scénarios de conduite à travers huit caméras, pour assurer la planification et la prise de décision en conduite autonome. Cette technologie a également été étendue au robot humanoïde Optimus, lui permettant de comprendre et de manipuler le monde physique.
Nvidia, quant à elle, s'appuie sur sa plateforme de simulation pour fournir des outils de simulation du monde à de nombreuses entreprises de robotique. Yann LeCun, ancien scientifique en chef de l'IA chez Meta, a fondé AMI Labs après avoir quitté Meta, se concentrant sur les modèles du monde et la mémoire persistante pour soutenir des systèmes d'intelligence plus avancés.
Défis et avenir
Hassabis estime qu'il faudra encore 5 à 10 ans pour l'AGI. La pénurie de puces de calcul et les contraintes énergétiques sont les principaux goulots d'étranglement, mais l'IA elle-même pourrait accélérer les percées dans les technologies énergétiques. Il a souligné que ce n'est qu'en combinant les modèles du monde avec l'apprentissage continu, la mémoire à long terme et les capacités de planification qu'une véritable cognition générale de type humain pourra être réalisée.
Actuellement, lorsque l'IA apprend par elle-même dans des environnements simulés, ses capacités de raisonnement peuvent s'améliorer de 20 à 30 %, ce qui montre le potentiel des modèles du monde. Alors que les équipes de recherche progressent, les modèles du monde passent de la théorie à la pratique de l'ingénierie et pourraient devenir une pierre angulaire importante de l'AGI.