这项由复旦大学数据科学学院、上海创新研究院、上海交通大学和麦吉尔大学联合开展的研究,于2026年6月28日发布在预印本平台arXiv,论文编号为arXiv:2606.29501。研究团队提出了一套名为A2World的机器人世界模型框架,系统性地探索了如何让机器人不仅能"看懂"世界,还能真正理解动作与后果之间的物理联系。 当你伸手去抓一杯水,你的大脑在手还没接触杯子之前,就已经在脑海中预演了整个过程:手指会怎么弯曲、杯子会如何移动、水面会不会晃动。这种"预演未来"的能力,是人类处理物理世界时最基础也最关键的本能。对机器人而言,拥有类似的能力,意味着它不再只是按照固定程序执行动作,而是真正理解"我这样动,世界会发生什么变化"。这正是A2World框架想要赋予机器人的能力——一种可以跨越不同机器人形态、不同场景、不同任务迁移使用的"动作-物理世界"理解能力。 当前主流的机器人控制方法大致走向两条路。一条路是训练机器人直接从摄像头画面学会如何输出控制指令,这类方法叫做视觉-语言-动作策略,机器人就像一个熟练的厨师,看到食材就知道该怎么切、怎么炒。另一条路是让机器人先在"脑海中模拟"世界会发生什么,再根据模拟结果决定动作,就像一个棋手在落子之前先在脑中推演几步棋局。 两条路各有其优势和局限。直接输出动作的方法响应快,但缺乏对物理规律的深层理解,换个场景就容易失效。模拟世界的方法理论上更通用,但现有研究往往存在一个共同问题:它们要么从通用的视频生成模型出发,没有在真实机器人动作数据上认真"磨合";要么只在单一数据集上训练,见识的机器人形态太少、场景太窄,就像一个只见过厨房的厨师,去到医院手术室就不知所措了。 更关键的是,即便有研究做了大规模预训练,往往也只瞄准某一个下游任务去优化,比如专门为了做策略评估,或者专门为了生成控制指令,而不是设计一个能被反复"借用"的通用物理知识库。这就好像每家餐厅都从头培训厨师,却从来不建立一套可以在不同餐厅之间复用的烹饪基础课程。 复旦大学的研究团队看到了这个空白。他们提出了一个核心观点:动作,是理解物理世界最天然的监督信号。无论机器人长什么样、手臂有几条、在哪个房间工作,"向前推一个物体"背后的物理规律是一致的——物体会沿着推力方向移动,接触面会产生形变或位移。如果能让模型在大量真实动作与对应视觉变化的配对数据上反复学习,它就会逐渐内化这些物理规律,形成一种可迁移的"动作-世界"知识。 为了实现这个想法,研究团队首先做了一件扎实的基础工作:收集并整理了规模庞大的机器人操作数据集。最终汇总的数据覆盖了超过210万条机器人操作轨迹,涵盖20多种不同形态的机器人,数据来源横跨AgiBot、DROID、OPEN-X、InternData等多个公开高质量数据集,以及Galaxea和RoboCoin等新兴平台的数据。 这些数据的多样性极为惊人。参与训练的机器人包括单臂的Franka、双臂的Genie-1、轮式移动的WidowX,以及Unitree G1等双足机器人平台,涉及的任务从简单的抓取摆放,到精密插接、操作铰接物体,再到处理柔性形变物体,应有尽有。摄像头视角既有固定的第三人称视角,也有安装在机器人手腕上随动的第一人称视角。 面对如此多样的数据,研究团队做了一个聪明的统一化处理:将所有机器人的动作表示统一成"双臂格式",每条手臂用7个数字描述(末端执行器的位置、姿态和夹爪状态)。对于单臂机器人,缺失的那条手臂直接用零补位。这种处理方式避免了为每种机器人单独设计动作编码方案,让模型能够在统一的语言体系下理解所有机器人的行为。 在训练过程中,还有一个细节处理颇为讲究:由于不同数据集的摄像头摆放方式差异巨大,如果把所有数据混在一起随机抽取,模型可能会被混乱的视角信息搞糊涂。因此团队采用了"数据集一致性批次"策略,每次训练时一个批次内的数据只来自同一个数据集,保证视角信息的一致性,就像在学厨艺时,先把中餐的所有基本功练扎实,再去学法餐,而不是今天切菜用法式刀法、明天又换回中式菜刀。 有了数据之后,研究团队需要设计一个能充分利用这些数据的模型架构。A2World的基础架构选用了DiT(扩散变换器,一种在图像和视频生成领域表现出色的神经网络结构),并在此基础上做了三项关键设计。 第一项设计是动作条件化注入。通俗地说,就是让模型知道"接下来要发生什么动作",从而预测视觉场景会如何变化。具体做法是将动作序列(一个包含未来20步机器人动作的时间序列)通过一个小型神经网络编码成一个紧凑的特征向量,然后将这个向量叠加到模型内部用于控制生成过程的"时间步嵌入"上。这样,模型的每一层都能感知到当前动作,就像一位导演通过耳机实时给摄影师指示——"镜头向左转30度,推进聚焦",摄影师的每一帧画面都在响应这些指令。 第二项设计是多视角联合生成。现实中的机器人操作台往往配备了多个摄像头,既有从工作台正面拍摄的全局视角,也有安装在机器人手腕上的近距离视角。研究团队将多个视角的视频帧在时间维度上拼接成一个整体序列,统一放入模型处理,并为每个视角分配一个可学习的"身份标签",让模型知道哪些帧来自哪个摄像头。更重要的是,在模型的每个处理层中,都插入了"跨视角注意力模块"——来自视角A的信息可以直接影响视角B的生成,反之亦然。这确保了不同摄像头拍到的画面在物理上保持一致,不会出现正面视角显示机器人夹起了杯子、侧面视角却显示杯子还没动的矛盾情况。 第三项设计是模型不依赖"伪动作标签"。一些现有研究在没有真实动作标注的视频数据上工作,需要先训练一个辅助模型去推测"可能发生了什么动作",然后用这些猜测出来的伪标签来训练世界模型。这就像让一个厨师先猜测食谱,再按照猜测的食谱来学厨艺——误差会层层叠加。A2World直接使用真实的机器人动作标注数据进行训练,去掉了这个中间环节,使得学到的物理知识更加准确可靠。 A2World完成预训练之后,就像一位掌握了扎实物理基础的工科毕业生,可以在此基础上走向两条截然不同但同样重要的职业方向。研究团队将这个预训练权重作为出发点,分别衍生出了A2World-sim(面向仿真模拟)和A2World-policy(面向控制策略)两个下游版本。 A2World-sim的目标是成为一个可以取代真实机器人测试的"虚拟试验台"。现实中,要测试一个机器人控制策略的效果,通常需要让真实机器人反复执行任务,这不仅耗时耗力,还存在损坏设备的风险,就像新司机每次练车都必须上真实道路,既危险又占用公共资源。如果有一个高质量的虚拟仿真环境,机器人策略就可以在其中进行大量"虚拟练习",再把表现好的策略拿到现实中验证。 要让A2World成为一个可以长时间运行的模拟器,需要解决一个核心挑战:它本身只能预测从当前帧往后20帧的画面,而完整的一次机器人操作任务可能需要几百帧。为此,A2World-sim采用了"滚动预测"的方式——生成了前20帧之后,把这些帧加入历史记录,再基于历史记录和下一段动作预测下一个20帧,如此循环,就像一个短途接力跑,每个队员负责一小段,整个队伍完成全程。 但这种接力方式带来了一个新问题:如何聪明地利用历史记录?如果只保留最近的几帧,可能会遗漏重要的状态信息(比如几秒前机器人刚刚放下的一个物体);但如果保留所有历史帧,计算量会急剧膨胀。研究团队设计了一种"基于姿态引导的历史采样"方法——根据机器人末端执行器在历史时间段内走过的路径弧长,均匀地从历史中选取最具代表性的帧。这就像在回顾一次长途驾车的路线时,不是每公里都拍一张照片,而是在每个重要转折点、爬坡点、停靠点各拍一张,用最少的照片还原最完整的旅程轨迹。 具体来说,对于单臂机器人,会计算每个相邻时刻之间末端执行器的位移和旋转变化量,将其合并成一个"运动步长",然后把整个历史时间段按照累积步长均匀分割,选取最接近各分割点的帧。对于双臂机器人,则同时考虑左右两臂的运动量,将两者的贡献叠加后再进行相同的采样逻辑。经过这种筛选的历史帧通过两条并行的通道注入模型:一条是通过"交叉注意力"机制,让待生成的帧直接关注历史帧的内容;另一条是将历史帧的信息注入自注意力机制的记忆池,让模型在生成新帧时能随时"查阅"历史状态。 为了让A2World-sim在长时间滚动预测中保持稳定,不因早期的微小误差而逐渐漂移崩溃,训练时还引入了"自我强迫"技术:训练期间有时故意将上一轮模型自己生成的帧作为条件输入,而不是总是使用真实数据中的完美帧。这样,模型会学会在面对自身生成的、略有瑕疵的帧时如何继续保持合理的预测,而不是只能处理教科书般完美的输入——就像一个学生不仅要会做标准题,还要练习如何在前一步算错的情况下继续往下推导并尽量减小误差。 A2World-policy走向了另一条路,目标是直接用来控制机器人完成任务。与A2World-sim相比,它不再接收外部给定的动作序列,而是需要自己决定下一步该怎么动。 在架构设计上,A2World-policy保留了A2World的视觉生成骨架,同时在旁边接上了一个动作生成分支,形成一个"Y字形"的联合预测结构。视觉部分和动作部分共享同一套自注意力机制,彼此可以相互交流信息——视觉分支在生成未来画面的同时,也在向动作分支传递"世界将会发生什么变化"的信号,动作分支利用这些信号来精确计算应该输出什么动作。研究团队把这种结构类比为"混合专家"模型(MoE),因为两个分支共享注意力"专家"进行跨模态交流,同时各自保留独立的"层归一化"和"前馈网络"分支,分别处理各自的细节。 在训练时,视觉分支和动作分支的噪声扰动是分别独立施加的,但会按照一个固定的比例从同一个基础噪声水平缩放而来——视觉分支的噪声水平是基础值的√6倍,动作分支的噪声水平是基础值的0.5倍。这种设计让两个分支在学习时各有侧重,但又保持着内在的同步联系,就像钢琴的左手和右手练习同一首曲子,速度可以不同,但节拍是统一的。 在推理(实际使用)时,系统接收一张初始场景图像和一条语言指令(由预训练的T5文本编码器处理),同时生成未来的场景视频和对应的动作序列。用户可以分别调整视觉生成和动作生成的"引导强度",在视觉逼真度和动作准确性之间灵活权衡。 在基础世界模型的生成能力展示上,团队使用了未参与训练的真实机器人数据进行测试。在DROID数据集上,从同一张初始观测帧出发,给定不同的动作序列,A2World可以成功模拟机器人去抓取红色勺子、蓝色碗,或者模拟抓取失败时的场景——这说明模型确实在响应动作输入,而不是简单地生成"成功的样子"。在RoboCoin数据集上,研究人员给出了从未出现在训练数据中的纯粹脚本化控制指令(比如"左臂向右平移20厘米,同时右臂绕X轴旋转10度"),A2World依然能够在多个视角下生成物理上自洽的场景视频。在RoboMind和VIOLA两个完全未见过的数据集上(摄像头摆放方式和场景均与训练数据完全不同),生成的视频依然合理连贯,显示出良好的泛化能力。 在A2World-sim的滚动预测质量评测中,研究团队与三个基线方法进行了对比:在广泛视频数据上用文本条件预训练的Cosmos-Predict2、使用DROID数据多视角预训练的Ctrl-World,以及具备动作条件化但只处理单视角的Prophet。评测指标不只是图像质量,还额外引入了基于光流的动作保真度指标——衡量生成视频中物体的实际运动方向和幅度与输入动作的匹配程度。在LIBERO仿真数据集上,A2World-sim在所有五项指标(PSNR、SSIM、tSSIM、EPE、cos)上均优于所有基线。在真实机器人数据集(Flexiv Rizon双臂平台)上,这一优势得到延续。进一步在RoboNet数据集上与传统视频预测方法(MaskViT、iVideoGPT、SAMPO)对比,A2World-sim在FVD(视频质量综合指标)上达到146.1,远优于第二名的175.3。 在超出训练分布的场景迁移测试中,团队在LIBERO上完成微调后,直接去测试LIBERO-Plus Spatial(一个引入了背景变换、摄像头角度变化、光照变化等多种分布偏移的扩展版本)。与DreamDojo相比,A2World-sim在动作保真度指标EPE上从0.2738降低到0.1301,提升幅度明显。定性比较进一步显示,DreamDojo在蓝色背景的新场景中会逐渐向训练时见过的原始背景"漂移",而A2World-sim能更好地保持新场景的视觉特征。 最关键的验证来自真实机器人测试台的策略评估实验。研究团队让不同的控制策略在A2World-sim中进行虚拟闭环测试(机器人策略每一步输出动作,A2World-sim根据动作生成下一帧,策略再从新帧中读取观测值,如此循环),统计虚拟成功率,然后与同一策略在真实机器人上的实际成功率进行对比。横跨5个不同难度的任务、共8个数据点,虚拟成功率与真实成功率之间的斯皮尔曼秩相关系数达到0.916,皮尔逊相关系数达到0.965,决定系数R?达到0.930。用通俗的话说,如果一个策略在虚拟环境里表现好,那它在现实中八九不离十也会表现好,反之亦然。这意味着研究者可以在大量策略中用虚拟测试快速筛选,只把最有希望的策略送上真实机器人验证,大幅降低硬件损耗和时间成本。 在A2World-policy的策略性能评测上,研究团队首先在机器人学习领域常用的LIBERO基准测试(包含Spatial、Object、Goal、Long四个子任务集)上进行了全面评测。A2World-policy的平均成功率达到98.6%,在与Diffusion Policy(72.4%)、π0(94.2%)、Cosmos Policy(98.5%)等多个强基线方法的比较中取得了最高分。 在分布外迁移能力的评测(即在LIBERO上训练后去LIBERO-Plus Spatial上测试)中,研究团队设计了四个对照版本:直接从Cosmos-Predict2初始化(C-init,80.2%)、用文本条件替代动作条件进行相同规模预训练(T-pre,85.8%)、使用标准动作条件A2World预训练(A-pre,88.5%),以及同时预训练视频和动作的策略针对性版本(P-pre,88.6%)。A-pre与P-pre几乎持平,却明显优于T-pre和C-init。这说明动作条件预训练所带来的物理世界知识,在迁移到新的视觉分布时提供了比文本条件预训练更坚实的基础。而且,动作预训练得到的权重是两用的——同一套权重既可以转化为A2World-sim(用于策略评估),也可以转化为A2World-policy(用于策略执行),无需为两个用途分别设计预训练流程。 在真实机器人测试平台上,研究团队用两台Flexiv Rizon 4S双臂机器人完成了五项真实操作任务的评测,这五项任务分别是:插入RAM内存模块、翻转小箱子、拨动电源开关、高举大箱子,以及将柔性链条放入箱子中。这五项任务覆盖了精密接触操作、铰接物体操作和柔性形变物体操作等多种典型的操作难题。评测由数据采集团队的操作员作为第三方独立执行,采用统一标准化的协议。A2World-policy在平均成功率上全面超越了π0.5和LingBot-VA,尤其在"将链条放入箱子"这种需要多个阶段精确配合的长任务上差距最为显著,那两个基线系统往往在早期阶段就卡住了,而A2World-policy能够完成整个包括放入链条和关闭箱盖在内的完整操作序列。 在历史采样策略的对比实验中,不注入历史信息(即每次滚动预测只依赖当前帧)、使用滑动窗口只保留最近几帧,以及使用姿态引导弧长均匀采样这三种方案在LIBERO上进行了比较。姿态引导采样在PSNR(25.41→26.64)、SSIM(0.8806→0.8957)、动作保真度EPE(0.3969→0.3498)上均有明显提升,证明了选择运动信息丰富的历史帧而非简单堆砌最近帧的重要性。 在预训练方式对策略性能影响的对比实验中,四种初始化方式(C-init 97.0%、T-pre 97.4%、A-pre 98.6%、P-pre 98.8%)的LIBERO成功率差距虽然不是非常悬殊,但在分布外迁移任务上的差距(80.2%对比85.8%对比88.5%对比88.6%)更能说明问题:动作条件预训练给模型植入的是对物理规律的理解,这种理解在面对新场景时展现出更好的鲁棒性。 在视频生成与动作生成的耦合关系实验中,研究团队绘制了训练过程中视频一致性(用光流余弦相似度衡量)与动作质量(综合平移误差、旋转误差和夹爪状态误差)的关系散点图。完整联合训练的A2World-policy版本,随训练推进形成了一条从左下向右上延伸的轨迹——视频生成越来越好的同时,动作预测也越来越准。冻结视频分支只训练动作分支的变体,则在更低的水平上形成了一条几乎停滞的轨迹(最终策略成功率86.2%对比完整版98.6%)。这说明视觉理解能力和动作控制能力并不是互相竞争的,而是互相促进的——一个更好地理解"世界将如何变化"的模型,自然也更好地知道"应该怎么动才能让世界发生期望的变化"。 说到底,这项研究给机器人领域提出并验证了一个听起来直白但执行起来颇具挑战性的主张:用真实的动作来监督对世界的理解,比用文字描述或者间接猜测更有效。当模型在数百万次"这个动作——对应这个视觉变化"的配对中磨砺之后,它积累的不是某个特定机器人、某个特定场景的经验,而是更接近于物理世界运行规律本身的知识。这种知识像一把万用钥匙,既能开"虚拟仿真"这把锁,又能开"策略控制"这把锁,而不需要为每把锁单独打造一把钥匙。 归根结底,机器人要真正走入复杂的现实生活,不只需要更大的算力或更多的数据,还需要以正确的方式理解动作与物理后果之间的因果关系。A2World框架在这条路上迈出了系统性的一步。当然,目前的系统仍然有明显的局限——预训练数据几乎全部来自桌面操作任务,对于更复杂的全身运动、室外环境或人机协作场景,能否保持同样良好的迁移效果,还有待进一步验证。视频生成的计算开销也意味着实时闭环控制在某些场景下仍需要额外的工程优化。这些都是未来值得继续探索的方向。有兴趣深入了解完整技术细节的读者,可以通过arXiv编号2606.29501查阅原始论文,研究团队也在GitHub上(LogosRoboticsGroup/A2World)开放了项目主页。 A:A2World是一个动作条件化的世界模型,核心区别在于它不是直接从图像输出动作指令,而是先学会预测"执行某个动作后世界会变成什么样子"。普通控制方法像是熟练工人凭经验操作,A2World更像是让机器人在脑海中先演练一遍再动手,并且这种"演练能力"可以在不同机器人和不同场景之间迁移复用。 A:目前还不能完全替代,但在研究团队的实验中,虚拟仿真成功率与真实机器人成功率的相关性极高(R?=0.930),说明它是一个非常可靠的初步筛选工具。实际使用中,可以先用A2World-sim大量筛选策略,再把最有希望的候选方案送上真实机器人做最终验证,从而大幅节省硬件损耗和测试时间。 A:实验对比清楚地显示,在新场景的迁移测试(LIBERO-Plus Spatial)上,动作条件预训练(A-pre)的平均成功率达到88.5%,明显高于文本条件预训练(T-pre)的85.8%。原因在于,给定当前观测和一个动作序列,未来视觉状态基本是确定的;而给定一条文本指令,对应的合理动作序列可能有很多种,预训练目标更模糊,学到的物理规律不够精准,在面对新场景时鲁棒性更差。
伊朗伊斯兰革命卫队13日晚间发表声明称,针对以色列袭击展开的报复行动,成功对包括军事中心和空军基地在内的数十个目标实施了“毁灭性精准打击”。以军14日接连对多地发布伊朗导弹来袭警报。卡莱尔与东契奇之间的关系摩擦,从东契奇的新秀赛季就开始了,这也是这位队史最成功的教练最终在2020-21赛季后辞去小牛主教练职务的原因之一。相比之下,卡莱尔与哈利伯顿之间则建立了和谐的关系,这位老教练为此付出了很多努力。《我的健身男教练》中文版我们追溯历史,不论是资本主义国家还是社会主义国家都对育儿的公共化或社会化进行过尝试。后来随着新自由主义的转型,很多国家公共化的育儿逐渐消弭。西方的马克思主义女性主义者做过许多尝试去阻止这样一个过程。2023-2024赛季,阿不都沙拉木拿下常规赛MVP,成为继巴特尔之后第二个获此殊荣的少数民族球员。就连陷入深深自我怀疑、意欲退役的西尔扎提,也找回自信,重返轮换阵容。
20260718 🍆 奥克兰城首发:24-加罗、2-马里奥-伊里奇(61'20-马特-埃利斯)、3-亚当-米歇尔、5-尼科-博夏、21-亚当-贝尔、22-周通(46'8-加利加)、25-海耶尔(75'4-格雷)、7-迈尔-贝文(73'11-德弗里斯)、17-拉格斯、26-大卫-约(61'10-曼尼库姆)、27-哈里斯-泽布(61'6-杰克逊-曼努艾尔)爱液win7/win10/win11版本更新后怎么更新1987年泡泡玛特创始人王宁出生于河南新乡获嘉县,毕业院校也并非985高校,而是毕业于民办二本郑州大学西亚斯国际学院(如今改名为郑州西亚斯学院)。
📸 崔志刚记者 赵福平 摄
20260718 👄 但你要记住,学习不是打怪升级,更像打扑克牌。有些人起手就是A,有些人只能凑顺子。你不能决定发到什么牌,但你能决定怎么玩。《大雷擦大阻》譬如,阿里在AI领域早已动作频频。2025财年年报显示,阿里将AI视为业务增长的核心驱动力,全力投入AI基础设施和技术先进性建设。过去一个财年,阿里推动大模型基础研究和创新,还扩大开源。
📸 罗香艳记者 董定元 摄
😏 随后,吉利系高管入驻,将力帆科技的业务重心转向“换电市场”和B端市场,推出枫叶和睿蓝两个换电新能源汽车品牌。2022年6月,吉利通过增资扩股将持股比例提升至52%(满江红基金持股稀释至约20%),实现对力帆科技的绝对控股。但从市场表现来看,用户对睿蓝和枫叶两个品牌的反响平平。2023年,力帆科技营收同比下滑21.8%,扣非净利润再度亏损。《叔叔压在妈妈身上高情商回复》
spider
spider







spider
spider
spider