当世界模型不再只是“看懂世界”,而是能够“运行一个世界”,具身智能的训练范式正在被重写。日前,智元机器人(AGIBOT)正式发布 Genie Envisioner 2.0(GE 2-Sim),标志着其世界模型体系从“世界动作模型”(World Action Model,WAM)向完全可交互的“世界模拟器”(World Simulator)跃迁,为具身智能提供了被官方称为“物理进化引擎”的规模化训练与评估基础设施(如图1所示)。

图1 智元机器人远征A2人形机器人
2025年,智元机器人推出行业首个动作驱动世界模型开源平台 Genie Envisioner,让机器人通过视觉、语言与动作的统一建模理解世界。作为上海首家人形机器人量产企业,智元机器人正沿着“表征世界—模拟世界”的路径持续加码。Genie Envisioner 2.0 的范式转变更进一步:从让机器人理解世界,到让机器人在模型生成的世界中学习。
这一转变的核心,是智元持续迭代的世界动作模型(WAM)框架。与传统世界模型只建模状态不同,WAM 将动作作为一等变量纳入循环,完整刻画“状态—动作—状态演化”的闭环(如图2所示),使世界模型不再只是理解环境的“表征层”,而是同时成为策略学习与动作生成的共同基座——模型既要“看懂”世界,也要“回答”下一步该做什么。

图2 WAM 框架运作机制:从世界模型表征到动作预测
围绕“让模型世界可运行”这一目标,GE 2-Sim 集成了一系列新能力(如图3所示)。EnerVerse-AC 实现动作条件世界建模与未来预测,让模型世界对机器人的动作作出符合物理与语义约束的高保真响应;GE-Sim 作为神经模拟器支持闭环策略评估,支撑分钟级稳定仿真,可连续生成完整任务序列而非碎片片段;EWMBench 则从仿真保真度、动作正确性与语义对齐三个维度衡量模拟器质量,为“模拟器到底好不好”提供可比较的标尺。
与此同时,GE 2-Sim 内建通用奖励模型,支持基于文本反馈的自我评估与优化,可在无需人工设计奖励的条件下开展模型内强化学习(RL in World Model)。系统还统一了多视角感知、跨视角三维一致性与机器人本体感觉,将感知从“图像”升级为可交互的具身世界;随着推理效率的提升,系统逼近实时交互,支撑“世界模型内评估(Eval in World Model)”“世界模型内强化学习”“世界模型内远程操作(Teleoperation in World Model)”三类应用场景(如图4所示)。

图3 GE 2-Sim 世界模拟器总体架构:表征与世界模拟器联动
在数据层面,GE 2-Sim 建立了新的数据与训练范式。Real2Edit2Real 范式让真实数据变得可编辑、可扩展,显著提升训练数据的规模与多样性;保真度感知的数据合成(Fidelity-Aware Data Composition)则将真实数据与生成数据按保真度组合,在真实感与泛化能力之间取得平衡。两相结合,为“模型内学习”提供了源源不断的多样化训练材料。

图4 GE 2-Sim 系统分层:从核心仿真引擎到演化场景与应用(图片来源:智元机器人官网)
智元机器人认为,这标志着具身智能迈向“可扩展法则”的关键拐点。世界模型正从离线工具走向交互式系统环境:机器人得以在合成环境中以更低成本、更高密度完成训练、评估与优化,再向真实世界迁移;训练瓶颈也从“真实数据可得性”转向“仿真本身的保真度”。
值得注意的是,这一路线已初显成效。据公开报道,今年5月,智元自研世界模型 Genie Envisioner-Sim 2.0(GE 2.0)凭借综合表现登顶具身智能评测基准 WorldArena Track 1(世界模型感知与动作响应赛道),被业界评价为“从感知到自主决策的闭环”。
对数字仿真行业而言,世界模拟器与工业仿真在“以虚验实、以虚促实”的底层逻辑上深度同频——当 AI 大模型学会运行物理世界,仿真将不仅是验证工具,更可能成为智能体能力生长的第一现场。
当模型成为世界,现实不再是唯一的训练场;当学习与进化可以在模型内部发生,具身智能的边界也将被重新定义。从“理解世界”到“运行世界”,GE 2-Sim 的发布,或许正是这场范式迁移的起点。