AGI需要世界模型:现状与展望
近日,Google DeepMind首席执行官Demis Hassabis公开表示,ChatGPT等大语言模型的发展路径需要结合世界模型,才能迈向真正的通用人工智能(AGI)。这一表态引发了AI领域的广泛讨论。
世界模型为何关键
Hassabis认为,现有的大语言模型擅长处理文本、图像、视频等多模态数据,但其对物理世界、因果关系、长期规划以及假设检验的理解仍然缺乏。世界模型旨在让AI构建对世界运行规律的内部模拟,从而像人类一样通过心理模拟来预测结果、提出新假设。
他指出,缩放定律(Scaling Laws)依然有效,但仅靠增加算力和数据可能不足以实现AGI,还需要一两项类似AlphaGo级别的重大创新。世界模型正是他眼中最可能的突破口。
各公司研究进展
Google DeepMind在2025年8月发布了Genie 3,可根据文本生成可交互的3D环境,这是世界模型在生成式模拟方面的显著进展。Hassabis透露,未来AGI将把大模型与这类世界模拟能力融合,形成更强大的系统。
特斯拉的FSD系统已利用类似世界模型的技术,通过八路摄像头逐帧预测驾驶场景,实现自动驾驶规划和决策。该技术也被延伸至Optimus人形机器人,使其能够理解并操作物理世界。
英伟达则凭借其仿真平台为众多机器人公司提供世界模拟工具。Meta前首席AI科学家Yann LeCun离开Meta后创办了AMI Labs,专注于世界模型与持久记忆,以支撑更高级的智能系统。
面临的挑战与未来
Hassabis预计AGI仍需5至10年时间。计算芯片短缺和能源约束是主要瓶颈,但AI本身有望加速能源技术突破。他强调,世界模型加上持续学习、长期记忆和规划能力,才能真正实现类人的广泛认知能力。
当前AI在模拟环境中自我学习时,推理能力可提升20%至30%,这显示出世界模型的潜力。随着各研究团队不断推进,世界模型正从理论走向工程实践,有望成为AGI的重要基石。