人类数据扩展
用约 13 万小时第一视角原始录制数据(过滤、切分与标注前)学习可迁移的物理与动作先验。
Motus2
Motus2 是一个面向机器人灵巧操作的通用世界模型(General World Model)。 同一套共享参数同时提供策略、模拟器和评估器三种接口,把动作提出、后果预测和结果评估连接成 决策与学习闭环。模型利用大规模人类第一视角数据进行预训练,并结合工作记忆、模型化强化学习 与触觉专家,实现双臂和灵巧手的真实机器人控制。
核心摘要
模型概览
传统机器人系统通常把动作策略、未来预测和价值判断拆成多个模型。Motus2 将三者统一在 一个视频—动作主干网络中:策略接口给出可执行动作块;动作条件世界模型模拟候选动作的 视觉后果;价值模型评估这些分支。共享表示让训练、规划和策略优化能够在同一模型内协同。
在测试时,系统既可以直接生成动作,也可以采样多个候选动作,预测各自未来并利用价值 估计选择更优分支。训练时,模拟结果和价值信号还能转换为策略更新,形成真正的闭环改进。
核心能力
用约 13 万小时第一视角原始录制数据(过滤、切分与标注前)学习可迁移的物理与动作先验。
将预测后果和价值估计转化为策略学习信号,并通过 Best-of-N 实现测试时扩展。
滑动窗口适合流式推理,全局自回归与 Hybrid Memory 用于更长时序任务。
轻量专家读取近期触觉测量,细化短动作块,为接触密集型灵巧操作提供反馈。
官方资源
完整技术细节、实验设置和作者名单请以 arXiv:2608.30237 为准;alphaXiv 提供可交互阅读页面;Motus2 机器人演示目录汇总 29 段可直接访问的真实机器人 rollout; 英文项目主页还包含模型图、数据扩展、记忆和触觉模块说明。
@misc{bi2026motus2,
title = {Motus2: A Self-Evolving General World Model for Dexterous Manipulation},
author = {Hongzhe Bi and Zihao Zhou and Yihang Tang and Jingrui Pang and
Shuhe Huang and Haitian Liu and Runqing Wang and Shuai Huang and others},
year = {2026},
eprint = {2608.30237},
archivePrefix = {arXiv},
primaryClass = {cs.RO},
url = {https://arxiv.org/abs/2608.30237}
}常见问题
这里的 Motus2 是面向灵巧操作的机器人与具身智能模型,与名称相似的微生物分类工具 mOTUs2 无关。
Motus2 不只生成动作;同一共享模型还能够在给定动作条件下预测未来,并对预测结果进行价值评估,从而支持规划和闭环策略改进。
项目团队已说明将开放代码与模型权重;正式发布前,请关注英文项目主页上的 Code 和 Model 入口,避免使用非官方镜像。