El modelo del mundo (World Model) se está convirtiendo en una de las direcciones más seguidas en el campo de la inteligencia artificial. Demis Hassabis, CEO de Google DeepMind, afirmó recientemente que la ruta actual de los grandes modelos de lenguaje, representada por ChatGPT, necesita la complementación de los modelos del mundo. Aunque empresas como OpenAI, Google, xAI y Anthropic están apostando por los LLM, Hassabis considera que, para lograr una verdadera inteligencia artificial general (AGI), la IA debe comprender el mundo físico, las relaciones causales, y poseer capacidad de planificación a largo plazo y de verificación de hipótesis.
¿Qué es un modelo del mundo?
Un modelo del mundo se refiere a que la IA construye internamente una simulación de la dinámica del mundo externo, capaz de predecir escenarios físicos, movimiento de objetos, cambios de trayectoria y consecuencias de acciones. A diferencia de los LLM que solo procesan texto o imágenes, los modelos del mundo enfatizan la comprensión de las relaciones causales. Por ejemplo, ¿cómo caerá un objeto después de ser empujado? ¿Cómo decidirá un conductor al ver un obstáculo delante? Este tipo de modelos no solo se utiliza para generar contenido, sino que, más importante aún, permite a la IA realizar simulación mental y planificación.
Principales avances en la industria
Google DeepMind publicó el sistema Genie 3 en agosto de 2025, capaz de generar entornos 3D interactivos a partir de texto. Esto se considera un avance importante de los modelos del mundo en el ámbito de la generación. Además, modelos de video como Veo también implican una comprensión de la dinámica del mundo. Hassabis afirmó que la futura AGI será un sistema integrado que combine modelos base (como Gemini) con capacidades de modelo del mundo.
Tesla es otro practicante activo de los modelos del mundo. Su sistema FSD (conducción totalmente autónoma) ha utilizado en los últimos dos años redes neuronales de extremo a extremo para predecir fotograma a fotograma las imágenes de las ocho cámaras de conducción, con el fin de simular y tomar decisiones de conducción en tiempo real. Tesla también aplica principios similares a su robot humanoide Optimus, logrando manipulación, navegación y planificación de tareas mediante modelos visuales de extremo a extremo. Aunque Tesla no publica artículos académicos, su cartera de patentes involucra en gran medida redes neuronales, procesamiento de datos y simulación, estrechamente relacionada con los modelos del mundo.
Nvidia desempeña el papel de proveedor de infraestructura. Proporciona simuladores y herramientas de desarrollo a la mayoría de las empresas de robots humanoides, y su tecnología de simulador de mundo también ocupa una posición líder.
Además, Fei-Fei Li (李飞飞) y su World Labs han contribuido mucho a nivel teórico, proporcionando un sólido respaldo académico para la investigación de los modelos del mundo.
La opinión de Hassabis: el cuello de botella y el cronograma de la AGI
Hassabis ha enfatizado repetidamente en entrevistas recientes que las leyes de escala (Scaling Laws) siguen siendo válidas, pero los rendimientos se han desacelerado. Considera que solo ampliar la escala de los modelos no es suficiente para lograr la AGI, y se necesitan una o dos innovaciones importantes del nivel de AlphaGo.Los sistemas de IA actuales muestran una "inteligencia irregular": se desempeñan bien en algunas tareas, pero pueden fallar inesperadamente en tareas simples. Las capacidades que faltan incluyen: aprendizaje continuo, creatividad verdaderamente novedosa, desempeño consistente, planificación a largo plazo y un razonamiento más profundo.
Hassabis predice que la AGI aún necesitará de 5 a 10 años. La escasez de potencia computacional y de energía son los principales obstáculos, pero también señala que la propia IA puede ayudar a resolver estos problemas, por ejemplo mediante la optimización del diseño de materiales, la eficiencia de la energía solar y la fusión nuclear controlada. Modelos como Gemini Flash de DeepMind ya han logrado una mejora de eficiencia energética de aproximadamente 10 veces al año gracias a técnicas de destilación.
La postura de LeCun y su salida de Meta
Yann LeCun ha criticado durante mucho tiempo que los LLM son un "callejón sin salida" hacia la IA a nivel humano. Él cree que los modelos del mundo son la clave. A finales de 2025, LeCun dejó Meta y fundó Advanced Machine Intelligence Labs (AMI Labs) para continuar con su programa de investigación de modelos del mundo. El objetivo de la empresa es desarrollar sistemas que puedan comprender el mundo físico, tener memoria persistente y ser capaces de razonar y planificar secuencias de acciones complejas.
Perspectivas futuras
Los modelos del mundo tienen un enorme potencial en robótica, conducción autónoma y descubrimiento científico. Hay estudios que muestran que los agentes de IA entrenados en mundos simulados rinden entre un 20% y un 30% mejor en tareas de razonamiento que los agentes convencionales. Hassabis prevé que la IA vivirá una "edad de oro de la ciencia" en el futuro, donde avances como AlphaFold en el plegamiento de proteínas se repetirán en campos como los materiales, la física, las matemáticas o el clima.
Aunque la tecnología de modelos del mundo todavía se encuentra en sus primeras etapas, cada vez hay más consenso en que podría ser el camino necesario hacia una verdadera inteligencia artificial general.