世界模型(World Model)正在成为人工智能领域最受关注的方向之一。Google DeepMind CEO Demis Hassabis近日明确表示,当前以ChatGPT为代表的大语言模型路径需要世界模型的补充。尽管OpenAI、Google、xAI、Anthropic等公司都在押注LLM,但Hassabis认为,若要实现真正的通用人工智能(AGI),AI必须理解物理世界、因果关系,并具备长期规划和假设验证的能力。
什么是世界模型?
世界模型是指AI在内部构建对外部世界动态的模拟,能够预测物理场景、物体运动、轨迹变化以及行动后果。与仅处理文本或图像的LLM不同,世界模型强调对因果关系的理解。例如,一个物体被推倒后会如何倒下?一个驾驶员看到前方障碍物时会如何决策?这类模型不仅用于生成内容,更重要的是让AI能够进行心智模拟和规划。
行业内的主要进展
Google DeepMind 在2025年8月发布了Genie 3系统,能够从文本生成可交互的3D环境。这被视为世界模型在生成领域的重要突破。此外,Veo等视频模型也隐含了对世界动态的理解。Hassabis表示,未来的AGI将是把基础模型(如Gemini)与世界模型能力相结合的集成系统。
Tesla 是另一个世界模型的积极实践者。其FSD(全自动驾驶)系统在过去两年中利用端到端神经网络,逐帧预测八个驾驶摄像头的画面,用于模拟和实时驾驶决策。Tesla还将类似原理应用于Optimus人形机器人,通过视觉端到端模型实现操控、导航和任务规划。尽管Tesla不公开发表论文,但其专利组合中大量涉及神经网络、数据处理和仿真,与世界模型紧密相关。
Nvidia 则扮演了基础设施提供者的角色。它为大多数人形机器人公司提供模拟器和开发工具,其世界模拟器技术也处于领先地位。
此外,Fei-Fei Li(李飞飞) 和她的World Labs在理论层面贡献颇多,为世界模型的研究提供了坚实的学术支撑。
Hassabis的观点:AGI的瓶颈与时间表
Hassabis在近期访谈中反复强调,缩放定律(Scaling Laws)依然有效,但收益已经放缓。他认为,仅靠扩大模型规模不足以实现AGI,还需要一两个如AlphaGo级别的重大创新。
当前AI系统展现出“锯齿形智能”——在某些任务上表现出色,但在简单任务上却可能意外失败。缺失的能力包括:持续学习、真正的新颖创造力、一致性的表现、长期规划以及更深入的推理。
Hassabis预测,AGI仍需要5到10年时间。算力和能源短缺是主要瓶颈,但他同时指出,AI本身可以帮助解决这些问题,例如通过优化材料设计、太阳能效率以及可控核聚变。DeepMind的Gemini Flash等模型已通过蒸馏技术实现了每年约10倍的能效提升。
LeCun的立场与离开Meta
Yann LeCun长期以来一直批评LLM是通往人类级AI的“死胡同”。他认为,世界模型才是关键。2025年底,LeCun离开Meta,创办了Advanced Machine Intelligence Labs(AMI Labs),继续其世界模型研究计划。该公司的目标是开发能理解物理世界、拥有持久记忆、能够推理和规划复杂动作序列的系统。
未来展望
世界模型在机器人、自动驾驶和科学发现领域拥有巨大潜力。有研究表明,在模拟世界中训练的AI智能体,其在推理任务上的表现比常规智能体高出20%至30%。Hassabis设想,未来AI将迎来一个“科学的黄金时代”,类似AlphaFold在蛋白质折叠上的突破将会在材料、物理、数学、天气等领域反复出现。
尽管世界模型技术仍在早期阶段,但越来越多的共识认为,它可能是通向真正通用人工智能的必由之路。