当世界模型开始“运行世界”
2026-09-15 作者:数字仿真网

当世界模型不再只是看懂世界,而是能够运行一个世界,具身智能的训练范式正在被重写。日前,智元机器人(AGIBOT)正式发布 Genie Envisioner 2.0GE 2-Sim),标志着其世界模型体系从世界动作模型World Action ModelWAM)向完全可交互的世界模拟器World Simulator)跃迁,为具身智能提供了被官方称为物理进化引擎的规模化训练与评估基础设施(如图1所示)。

 1 智元机器人远征A2人形机器人 

一、从理解世界在模型中学习

2025年,智元机器人推出行业首个动作驱动世界模型开源平台 Genie Envisioner,让机器人通过视觉、语言与动作的统一建模理解世界。作为上海首家人形机器人量产企业,智元机器人正沿着表征世界模拟世界的路径持续加码。Genie Envisioner 2.0 的范式转变更进一步:从让机器人理解世界,到让机器人在模型生成的世界中学习。

这一转变的核心,是智元持续迭代的世界动作模型(WAM)框架。与传统世界模型只建模状态不同,WAM 将动作作为一等变量纳入循环,完整刻画状态动作状态演化的闭环(如图2所示),使世界模型不再只是理解环境的表征层,而是同时成为策略学习与动作生成的共同基座——模型既要看懂世界,也要回答下一步该做什么。

 2 WAM 框架运作机制:从世界模型表征到动作预测 

二、物理进化引擎:让模型世界可运行

围绕让模型世界可运行这一目标,GE 2-Sim 集成了一系列新能力(如图3所示)。EnerVerse-AC 实现动作条件世界建模与未来预测,让模型世界对机器人的动作作出符合物理与语义约束的高保真响应;GE-Sim 作为神经模拟器支持闭环策略评估,支撑分钟级稳定仿真,可连续生成完整任务序列而非碎片片段;EWMBench 则从仿真保真度、动作正确性与语义对齐三个维度衡量模拟器质量,为模拟器到底好不好提供可比较的标尺。

与此同时,GE 2-Sim 内建通用奖励模型,支持基于文本反馈的自我评估与优化,可在无需人工设计奖励的条件下开展模型内强化学习(RL in World Model)。系统还统一了多视角感知、跨视角三维一致性与机器人本体感觉,将感知从图像升级为可交互的具身世界;随着推理效率的提升,系统逼近实时交互,支撑世界模型内评估(Eval in World Model”“世界模型内强化学习”“世界模型内远程操作(Teleoperation in World Model三类应用场景(如图4所示)。

 3 GE 2-Sim 世界模拟器总体架构:表征与世界模拟器联动 

三、数据与训练范式的重构

在数据层面,GE 2-Sim 建立了新的数据与训练范式。Real2Edit2Real 范式让真实数据变得可编辑、可扩展,显著提升训练数据的规模与多样性;保真度感知的数据合成(Fidelity-Aware Data Composition)则将真实数据与生成数据按保真度组合,在真实感与泛化能力之间取得平衡。两相结合,为模型内学习提供了源源不断的多样化训练材料。

4 GE 2-Sim 系统分层:从核心仿真引擎到演化场景与应用(图片来源:智元机器人官网)

四、仿真范式的下一个拐点

智元机器人认为,这标志着具身智能迈向可扩展法则的关键拐点。世界模型正从离线工具走向交互式系统环境:机器人得以在合成环境中以更低成本、更高密度完成训练、评估与优化,再向真实世界迁移;训练瓶颈也从真实数据可得性转向仿真本身的保真度

值得注意的是,这一路线已初显成效。据公开报道,今年5月,智元自研世界模型 Genie Envisioner-Sim 2.0GE 2.0)凭借综合表现登顶具身智能评测基准 WorldArena Track 1(世界模型感知与动作响应赛道),被业界评价为从感知到自主决策的闭环

对数字仿真行业而言,世界模拟器与工业仿真在以虚验实、以虚促实的底层逻辑上深度同频—— AI 大模型学会运行物理世界,仿真将不仅是验证工具,更可能成为智能体能力生长的第一现场。

结语

当模型成为世界,现实不再是唯一的训练场;当学习与进化可以在模型内部发生,具身智能的边界也将被重新定义。从理解世界运行世界GE 2-Sim 的发布,或许正是这场范式迁移的起点。

郑重声明:文字内容整理源自网络,目的在于传递更多行业信息,不代表本网站立场和观点,如涉及转载文章、图片、观点、文字、版权和其他问题,请发至邮箱cdsn@cdsnet.com.cn,我们将及时更正或删除。本网站拥有对此声明的最终解释权。