Introduction
Alors que les récents prix Nobel ont récompensé les contributions de l'intelligence artificielle à la science, les grands modèles de langage (LLMs) transforment la recherche scientifique en augmentant la productivité et en remodelant les méthodes scientifiques. Aujourd'hui, les LLMs participent déjà à la conception d'expériences, à l'analyse de données et aux flux de travail, en particulier dans les domaines de la chimie et de la biologie.
Les progrès récents de l'intelligence artificielle ont transformé de nombreux aspects de la société, l'économie mondiale et les pratiques de recherche académique. L'IA générative et les LLMs offrent des opportunités sans précédent pour transformer les pratiques scientifiques, faire progresser la science et accélérer l'innovation technologique. Les prix Nobel de physique et de chimie ont été décernés à plusieurs leaders de l'IA, récompensant leurs contributions à l'IA et aux modèles de pointe (tels que les LLMs). Cela présage que les LLMs transformeront ou feront progresser la recherche scientifique en augmentant la productivité et en soutenant toutes les étapes de la méthode scientifique. L'application de l'IA dans les sciences est en plein essor, couvrant de nombreux domaines scientifiques et influençant différentes parties de la méthode scientifique.
Bien que les LLMs aient un grand potentiel dans la génération d'hypothèses et la synthèse de données, l'IA et les LLMs sont encore confrontés à des défis en science fondamentale et en découverte scientifique. Par conséquent, notre point de vue est que, jusqu'à présent, l'IA a eu un impact limité sur la science fondamentale — la science fondamentale étant ici définie comme la découverte de nouveaux principes ou de nouvelles lois scientifiques. Cet article examine comment les LLMs sont actuellement utilisés comme outils techniques pour améliorer le processus scientifique, et comment ils pourraient être utilisés à l'avenir à mesure qu'ils deviennent plus puissants et se transforment en assistants scientifiques puissants. En combinant des techniques basées sur les données avec des systèmes symboliques, de tels systèmes peuvent fusionner en moteurs hybrides, ce qui pourrait ouvrir de nouvelles voies de recherche. Nous visons à décrire l'écart entre les LLMs en tant qu'outils techniques et en tant que « moteurs créatifs » capables de générer de nouvelles découvertes scientifiques de haute qualité et de proposer de nouvelles questions et hypothèses aux scientifiques humains. Nous commençons par passer en revue les applications actuelles des LLMs dans la science, afin d'identifier les limitations à surmonter pour progresser vers un moteur créatif.
Applications actuelles
Les LLMs sont déjà largement utilisés pour l'analyse de la littérature scientifique, la génération de protocoles expérimentaux, l'interprétation des données et la formulation d'hypothèses préliminaires. Par exemple, dans la découverte de médicaments, les LLMs peuvent aider à prédire les propriétés moléculaires ; en science des matériaux, ils peuvent recommander des voies de synthèse. Cependant, ces applications restent pour la plupart au niveau d'outils d'assistance et ne sont pas encore capables de produire de manière indépendante des insights scientifiques originaux.
Défis et limites
Les défis centraux auxquels sont confrontés les LLMs comprennent : le manque de compréhension causale du monde physique, une tendance à générer des « hallucinations », une dépendance à la qualité et aux biais des données d'entraînement, ainsi que des insuffisances en raisonnement interdisciplinaire. En science fondamentale, pour découvrir des principes entièrement nouveaux, il est nécessaire de dépasser la capacité de raisonnement abstrait basée sur la reconnaissance de motifs, ce qui constitue précisément la faiblesse actuelle des LLMs.
Directions futures
Pour permettre aux LLMs de passer du statut d'outil à celui de moteur créatif, il est nécessaire de développer des systèmes hybrides : combiner les capacités linguistiques des LLMs avec le raisonnement symbolique, les graphes de connaissances et la simulation physique. De plus, il est crucial d'établir des indicateurs d'évaluation clairs pour garantir que les résultats des LLMs sont alignés sur les objectifs scientifiques humains. La collaboration interdisciplinaire et un alignement continu homme-machine seront essentiels.