Introduction
Au cours des dernières années, les avancées majeures des grands modèles de langage (LLM) ont favorisé leur large application dans le domaine médical, notamment pour le question-réponse médical, la génération de dossiers de santé électroniques et l’aide à la décision clinique. Dans le même temps, les agents IA basés sur les LLM sont en plein essor. Dans la pratique clinique, les professionnels de santé sont souvent confrontés à des données multimodales et hautement hétérogènes, à de lourdes charges de travail et à des besoins urgents de décision clinique. Les agents IA, capables non seulement de comprendre et de générer le langage humain, mais aussi d’orchestrer de manière autonome des tâches en plusieurs étapes via l’appel d’outils, manifestent des capacités de raisonnement et de prise de décision orientées vers des objectifs. Ils sont ainsi considérés comme étant à la pointe de la technologie médicale.
Des études antérieures ont commencé à explorer le potentiel des agents IA en médecine. Par exemple, Qiu et al. ont étudié leurs applications dans le soutien au diagnostic et l’optimisation des flux de travail, tout en soulignant des défis tels que la confidentialité des données et la dépendance excessive. Karunanayake a analysé les fonctions clés de l’IA agentique dans le diagnostic, les opérations cliniques, le développement de médicaments et les interventions assistées par robot. Moritz et al. ont quant à eux proposé un paradigme de coordination de systèmes multi-agents, soulignant le potentiel d’agents pilotés par LLM, décentralisés mais interopérables, dans l’optimisation des processus cliniques et opérationnels, et ont exposé les défis de mise en œuvre tels que la communication sécurisée, l’interopérabilité et la validation clinique. Cependant, la recherche spécifiquement dédiée aux agents IA basés sur les LLM reste limitée comparée à la littérature médicale sur les LLM en pleine croissance, et les revues existantes présentent des lacunes en termes de portée, de profondeur d’évaluation et de cadre théorique. La présente revue vise à combler ces lacunes en offrant une perspective plus complète et structurée sur le développement et le déploiement des agents IA en médecine.
Évolution historique des agents IA
Le concept d’« agent » remonte à la réflexion philosophique, parcourant un chemin allant de la spéculation théorique à la réalisation technique. Les philosophes de la Grèce antique décrivaient déjà des entités dotées de désirs, de croyances, d’intentions et de capacités d’action. La « téléologie » d’Aristote a fourni la base philosophique des caractéristiques orientées vers des objectifs des agents ultérieurs.
À l’époque contemporaine, avec le développement des sciences naturelles et des technologies informatiques, la recherche en intelligence artificielle est passée de la spéculation philosophique aux applications pratiques. Dans les années 1950, le test de Turing est devenu une norme importante pour évaluer l’intelligence des machines. Dans les années 1970, les systèmes experts utilisaient les connaissances d’experts humains pour le raisonnement et la prise de décision. L’avènement de l’apprentissage automatique a permis aux agents d’acquérir des connaissances et des compétences à partir des données, améliorant nettement leur niveau d’intelligence. Au XXIe siècle, l’apprentissage profond a réalisé des avancées majeures dans les capacités de perception, de prise de décision et d’exécution, élargissant ainsi les scénarios d’application. L’apprentissage par renforcement, en particulier l’apprentissage par renforcement multi-agents (MARL), a progressé dans les problèmes de décision séquentielle, permettant aux agents de prendre de meilleures décisions dans des environnements complexes.
Après 2022, la diffusion des LLM a ouvert de nouvelles voies pour le développement des agents. Par rapport aux agents d’apprentissage par renforcement, les agents IA basés sur les LLM disposent d’une base de connaissances plus riche, de capacités d’interaction homme-machine plus naturelles et d’une meilleure explicabilité. Par exemple, des organismes comme OpenAI lancent continuellement des modèles plus puissants, ce qui a stimulé le développement accéléré des agents.
Principaux scénarios d’application## Principaux scénarios d'application
L'application des agents IA basés sur les LLM dans le domaine de la santé couvre plusieurs domaines :
Aide au diagnostic : L'agent analyse les symptômes, les antécédents médicaux et les données d'examen du patient pour fournir des recommandations diagnostiques, aidant ainsi les médecins à réduire les erreurs de diagnostic.
Aide à la décision clinique : En ce qui concerne le choix du traitement, les recommandations médicamenteuses et la prédiction des risques, l'agent peut fournir une aide à la décision personnalisée sur la base des dernières preuves et des données du patient.
Génération de rapports médicaux : Génère automatiquement des rapports de radiologie, des résumés de sortie et d'autres documents, réduisant la charge administrative des médecins et améliorant la précision des dossiers.
Chatbots pour patients : Fournissent aux patients des conseils de santé 24h/24 et 7j/7, un dépistage préliminaire des symptômes et des conseils de prise de rendez-vous, améliorant ainsi l'expérience du patient.
Gestion des systèmes de santé : Optimise les processus opérationnels tels que l'allocation des ressources hospitalières, la gestion des lits et la planification du personnel, améliorant ainsi l'efficacité.
Éducation médicale : Simule des scénarios cliniques pour aider les étudiants en médecine à s'entraîner au diagnostic et à améliorer leurs compétences, offrant une expérience d'apprentissage interactive.
Ces applications démontrent le potentiel considérable des agents IA pour améliorer la qualité, l'efficacité et l'accessibilité des soins de santé.
Cadre d'évaluation
La mise en place d'un cadre d'évaluation multidimensionnel est essentielle pour garantir la sécurité et l'efficacité des agents IA. L'évaluation devrait couvrir les dimensions clés suivantes :
Performance clinique : Comprend la précision du diagnostic, l'exactitude des recommandations décisionnelles, la précision de la génération de rapports, etc.
Sécurité et fiabilité : Évalue le comportement de l'agent dans des cas limites, afin d'éviter les conseils nocifs ou les sorties hallucinées.
Expérience utilisateur : Inclut la satisfaction des médecins et des patients, le caractère naturel de l'interaction, la confiance, etc.
Éthique et équité : Examine les biais algorithmiques, la protection de la vie privée, la transparence et l'attribution des responsabilités.
Efficacité et coût : Mesure le temps gagné et l'efficacité de l'utilisation des ressources apportés par l'agent dans les flux de travail réels.
L'évaluation doit combiner des indicateurs quantitatifs (tels que la précision, le rappel, le score F1) et des évaluations qualitatives (telles que l'examen par des experts, les enquêtes auprès des utilisateurs). En outre, une validation dans un environnement clinique réel est nécessaire pour garantir la capacité de généralisation.
Orientations futures de développement
À l'avenir, nous proposons sept orientations clés de développement :1. Intégration avec les systèmes physiques : associer les agents d'IA à des systèmes physiques tels que les robots et les dispositifs portables, afin de réaliser une boucle fermée allant de la décision virtuelle à l'exécution physique.
2. Modèles d'experts mixtes : combiner des LLM généraux et des modèles spécialisés par domaine pour améliorer les performances et la fiabilité dans les tâches médicales spécialisées.
3. Extension des paradigmes d'évaluation : développer des méthodes d'évaluation dynamiques plus proches de la pratique clinique réelle et couvrant les scénarios de longue traîne, plutôt que de s'appuyer uniquement sur des ensembles de tests statiques.
4. Garantie de sécurité et de contrôlabilité : concevoir des mécanismes d'agent explicables et auditables, permettant aux opérateurs de comprendre et d'intervenir dans le processus de décision de l'agent.
5. Gouvernance éthique et confiance des utilisateurs : établir des principes éthiques clairs, des cadres de transparence et de responsabilité, afin de renforcer la confiance des patients et du personnel soignant.
6. Accompagnement de l'évolution du rôle du personnel médical : clarifier la répartition des tâches entre l'IA et les humains, former le personnel médical à collaborer efficacement avec les agents, et adapter le contenu de l'enseignement médical.
7. Collaboration interdisciplinaire : promouvoir la coopération entre l'informatique, la médecine clinique, l'éthique, le droit et d'autres domaines, afin de stimuler une innovation responsable.
Ces orientations fourniront un soutien théorique et des lignes directrices pratiques pour le développement durable et le déploiement des agents d'IA dans le domaine médical.
Conclusion
Les agents d'IA sont en train de transformer profondément le paysage des soins de santé, de l'aide au diagnostic à la gestion des opérations hospitalières, démontrant un large éventail de perspectives d'application. Cependant, leur évaluation de la sécurité, leur gouvernance éthique et leur intégration approfondie dans les processus médicaux restent des défis à relever. Cette revue, en passant en revue l'évolution historique, les scénarios d'application, les cadres d'évaluation et les orientations futures, offre une référence systématique aux chercheurs, aux cliniciens et aux décideurs politiques. Nous appelons à accorder une importance égale à la sécurité et à la responsabilité parallèlement à l'innovation technologique, afin de promouvoir des agents d'IA qui servent la santé humaine de manière fiable et digne de confiance.