蚂蚁灵波开源LingBot-Video:全球首个MoE架构具身智能视频模型
蚂蚁灵波开源了 LingBot-Video,全球首个基于 MoE 架构的具身智能视频生成基础模型。该模型针对机器人需求优化,在推理效率、物理合理性、动作理解和任务完成度上提升显著,为具身智能提供开源底座。在北大与字节跳动的 RBench 基准测试中,LingBot-Video 总分0.620,超越其他模型,尤其在生成符合物理规律的机器人行为方面表现
全球首个具身智能视频模型开源
7月9日, 蚂蚁集团旗下的蚂蚁灵波, 正式地开源了Video模型, 它是全球首个基于混合专家架构, 且是面向具身智能的视频生成基础模型。这个模型围绕着机器人以及具身智能的核心需求, 对视频预训练范式进行了重新设计, 它在推理效率、物理合理性、动作理解以及任务完成度等方面, 取得了系统性的提升, 它为视频基础模型从数字内容创作迈向具身智能, 提供了新的开源底座。
按蚂蚁灵波官方所讲, Video模型开源会极大削减具身智能领域的研究门槛, 致使更多开发者能够凭借该模型于机器人动作预测、仿真数据生成等方面展开探索。这种做法有希望加快视频生成技术从娱乐作用向工业级机器人控制的转变。

基准测试总分领先主要对手
视频在北京大学联合字节跳动发布的机器人操作视频综合评测基准里, 总分是0.620 , 此基准关键考察模型能不能生成契合真实物理规律的机器人行为 , 结果表明视频在动作过程合理性以及任务执行完整性这两方面呈现出更优的表现 , 它超过了Wan2.6的0点607 , 还超过了CogVideoX1点5Pro的0点584 , 以及OpenSora的0点581。
被测试的人员明确指出, 当Video在进行生成关乎机器人的相关视频之际, 它是能够更为精准地模拟物体承受力、发生碰撞等物理方面的现象的, 进而避免出现传统视频模型里常见的那种“穿模”或者“动作不连贯”的问题。而这一具有优势的情况对于机器人在实际应用过程当中的任务规划来讲至关重要。

具身领域综合评测表现最优
为了能进一步去验证Video针对物理世界变化的建模能力, 蚂蚁灵波在其内部评测环节之中, 从通用质量以及具身领域这两个维度着手做了评估。最终所呈现的结果表明, 将OpenSora、Wan2.2A14B、CogVideoX、PyramidFlow、LTX-2.3这五个开源模型作为对比对象, Video在具身领域的表现远比主要基线模型要更出色。
基于综合评测所获取的数据表明, Video于具身关联的各类场景之内, 呈现出更为突出的对于物理的理解以及动作方面的一致性表现, 尤其是在诸如灵巧操作、机器人移动以及第一视角交互等一系列任务当中, 它所生成视频的物理合理性得分, 明显地高于其他的模型。这也就意味着, Video已然初步拥有了针对于物理世界的建模能力。
两大视频生成路线分化
在过去的几年当中, 视频生成模型于画质方面、流畅度方面以及创意表达方面都实现了快速的进步, 然而, 就具身智能这个范畴来讲, 存在着这样一种情况, 即一个看上去极为逼真甚至动作也显得流畅的视频, 却没办法去放映真切的物理规律, 进而根本难以用于支撑机器人持续不断地进行预测、规划以及执行任务。与此同时, 具身智能还提出了另外的要求, 那就是模型得具备更高的推理效率, 以此来适应实时交互以及控制闭环。
这同样致使视频生成起始呈现出两类各异的演进趋向, 其一朝着影院方向发展, 为内容创作提供服务, 其二迈向机器人领域, 为物理世界的解读、预估以及互动予以服务, Video恰恰是蚂蚁灵波针对具身智能开拓视频生成全新路径的关键探寻, 意味着视频生成技术由“好看”朝着“好用”产生转变。
架构创新提升推理效率三倍
在架构层面, Video运用DiT加MoE设计方式, 用MoE去替换传统Dense架构, 在扩充模型容量之际控制单次推理成本, 其30B总参数模型在生成时仅仅激活大概3B参数, 相较于同等参数规模的Dense架构有着约3倍的推理效率, 这样的设计让模型既能够获取大规模参数所赋予的视觉表达能力, 又更加契合具身智能对于高效推理的需求。
工程师宣称, 这般的稀疏激活机制, 致使Video于维持高性能之际, 大幅削减了计算资源的耗费, 为后续于边缘设备之上的部署创造了条件。这针对需实时响应的机器人应用场景而言, 极为关键。

数据与训练双轮驱动
针对数据方面, Video构建了数据画像引擎, 于海量互联网视频基础上, 进一步引入VLA、VLN、Ego等和机器人相关的数据, 覆盖灵巧操作、机器人移动以及第一视角交互等场景, 具身数据总规模达7万小时。这些数据助力模型学习动作与环境变化间的关系, 而非只学习视频的表面纹理和视觉风格。
Video在训练方面, 引入了多维强化学习奖励系统, 除了有美学、文本跟随以及运动一致性等常规指标之外, 该模型还进一步围绕着物理合理性和任务完成程度进行对齐, 从而让生成的结果能够更加符合真实世界的规律, 并且也更加贴近机器人在真实世界完成任务之时的需求, 据相关介绍, Video能够被运用于机器人动作预测、仿真数据生成、动作条件建模、世界模型研究等多个方向, 目前已经正式开源了。
你们觉得, Video的开源, 其究竟会怎样去改变机器人开发者那种从事该领域工作的方式呢, 欢迎来到评论区去分享你们自身的看法, 快去点赞并且转发这篇文章, 从而能够让更多的人可以了解到这一项具有突破性意义的技术!
登录后参与评论
评论仅开放给已登录并完成邮箱绑定的用户。
0
暂无评论。