你的位置:开云体育最新网站 开云最新官方网站 - 登录入口 > 新闻资讯 > 开yun体育网宇宙模子现在还不是一种单一分数就能轮廓的才略-开云体育最新网站 开云最新官方网站 - 登录入口
开yun体育网宇宙模子现在还不是一种单一分数就能轮廓的才略-开云体育最新网站 开云最新官方网站 - 登录入口
发布日期:2026-07-26 08:09 点击次数:86


7 月的上海开yun体育网,世博展览馆 H3 馆的过谈比往年拥堵许多。
进口处停着宇树的载东谈主变形机甲 GD01,不雅众列队坐进驾驶舱拍照。往里走,300 多台机器东谈主真机散在 200 多产品身智能企业的展台之间,具身智能无疑是这届 WAIC 最具象的展品。而视频生成公司的展台就设在机器东谈主公司隔邻,播放演示片的屏幕连成片:机械臂倒水,无东谈主机穿林,假造扮装回身。
不同公司的栽种员说着高度趋同的话:齐在讲具身智能,齐在讲宇宙模子。

图:WAIC 2026 现场,宇树科技展台(起原:新蓝网)
穿梭在展台之间的投资东谈主,靠近诸多公司相同问着高度趋同的一套问题,中枢聚焦在模子到底什么水平。但取得的谜底却分辨指向不同的东西。有东谈主翻开手机展示 VBench 排名,有东谈主调出 RoboTwin 2.0 的任务班师率弧线,有东谈主谈仿真到真机的移动数据。合并个词,在不同的展台上被不同的数字界说。
当具身智能与宇宙模子成为显学,榜单便不再仅仅时期社区的里面排名,而成了行业相识时期途径的进口,在某种程度上,更成了话语权本人。
一张拼图,三个榜单
2026 年以来,具身智能和宇宙模子简直成了 AI 圈最热的两个词。
时期圈在盘问,视频模子到底能弗成成为机器相识物理宇宙的旅途。成本圈在盘问,下一代 AI 公司,能弗成从“会语言的模子”走向“会相识、会预计、会行径的模子”。媒体圈的问题则更明晰、直白,当“宇宙模子公司”越来越多,到底该若何看谁更强?
关系词时于当天,宇宙模子依旧莫得一个斡旋的界说和推敲尺度。
落到具体的评测上,宇宙模子现在还不是一种单一分数就能轮廓的才略,它更像一张尚未完成的拼图:视频质料、指示相识、时序一致性、物理规则、机器东谈主引申、动作预计,每一项才略背后齐站着一张榜单和一群拥趸。
那么,具身智能和宇宙模子到底该看哪些榜单?把这张拼图隔断,有三块河山绕不开:一张修起“像不像“,一张修起“懂不懂“,一张修起“动不动得了“。看懂它们,比看懂任何一场发布会齐更接近行业的真实经由。还有一块修起“准不准“,它是整张拼图的底座,值得单唯独章。
VBench:修起“像不像“
VBench 是现在视频生成鸿沟最常用的评测体系之一,由南洋理工大学 S-Lab、上海东谈主工智能实践室 OpenGVLab 等机构推出。它从主体一致性、布景一致性、融会融会度、好意思学质料等 16 个维度评价生成视频。
它修起的问题很径直:模子生成的视频,像不像真实宇宙,是否合适用户输入。
在 VBench 1.0 认证榜中,头部模子集合在 84 分到 88 分之间,差距仍是很小。于是 VBench 在 2025 年推出 2.0 版块,将评测范围彭胀到东谈主类保真、物理、可控性、学问等维度,运转关爱那些决定真实感、却容易被忽略的问题。
左证其 HuggingFace 官方榜单的认证视图,主要排名如下:
图:VBench-2.0 榜单:Veo 3 以 66.72% 居首(起原:HuggingFace Vchitect/VBench_Leaderboard,2026 年 7 月截图)
但 VBench 仍主要评价视频服从。画面不错传神,模子却偶然相识画面背后的规则。
WorldModelBench:修起“懂不懂“
要是视频生成模子被称为“宇宙模子”,它就需要继承更严格的老到。
2025 年,来自 UC Berkeley、UC San Diego、NVIDIA 和 MIT 的辩论者推出 WorldModelBench,把模子放进物理和学问环境中测试。
该评测袒护机器东谈主、驾驶、工业、东谈主类活动等 7 大鸿沟,包含 350 条请示词和 6.7 万条东谈主工标注,从指示撤职、物理规则、学问三个维度打分。其中物理撤职占总分一半。原因很简便:宇宙模子最紧迫的才略之一,是预计物体在真实宇宙中会如何变化。
服从泄露,即使发达最佳的模子,也唯有 61% 的视频正确完成指示;12% 的视频违背质料守恒,11% 出现物体相互穿透。
模子能生成一个看起来合理的宇宙,但距离真实相识宇宙,还有彰着距离。
图:WorldModelBench 官网榜单(起原:worldmodelbench-team.github.io,2026 年 7 月截图)
RoboTwin 2.0:修起“动不动得了“
宇宙模子终究要就业于行径,再往拼图下贱走一格,机器东谈主能否干活便成了一个很紧迫的维度。
RoboTwin 2.0 由上海交大 ScaleLab 与港大 MMLab 主导、上海东谈主工智能实践室参与。它包含 50 个双臂协同操作任务,捏取打发、器用使用、可形变物体操作,跑在 SAPIEN 仿真器上,撑持 Aloha-AgileX、ARX-X5、Piper、Franka、UR5 共 5 种双臂内容,配套一个 731 个实例、147 个类别的物体库,通过 Easy 和 Hard 两种环境,测试机器东谈主能否从仿真走向更复杂的真实宇宙。
早期服从泄露,在 Hard 设定下,大量方法班师率仍低于 20%。机器东谈主简略完成特定任务,但距离沉稳、泛化地完成任务还有很长距离。
图:RoboTwin 2.0 官方榜单(起原:robotwin-platform.github.io,2026 年 7 月截图)
三张榜单,三种才略,各自有发布机构和评分体系。莫得一张榜单能独自界说宇宙模子,放在沿途,他们才勾画出一条从生成、相识到行径的才略链。但这个链条还衰败一个最关节的门径。
Physics-IQ:修起“准不准“
东谈主类作念好多动作时,会下坚强在脑中预演服从。推一下杯子,它会滑多远,会不会翻倒;歪斜水壶,水会从那处流出来;把两块磁铁聚合,它们会吸住如故弹开。
机器东谈主也需要这种才略。它必须左证目下的现象,预计几秒后会发生什么,再决定下一步动作。视频宇宙模子时时在这里犯错。这类预计要是不准,背面的揣测和引申齐无从谈起。
测量这一底座才略的基准叫 Physics-IQ,由 Google DeepMind 与 INSAIT 结伴推出,论文发表于 WACV 2026。
2026 年 6 月,原团队结伴 Anates Labs 发布修正版 Physics-IQ Verified,修正了 57.6% 的样本标注问题,改用逐样本加权计分。
它的想象与前述榜单齐不同:辩论者真实拍摄了 66 个物理实践,袒护固膂力学、流体、光学、热力学、磁学五大类,每个实践 3 个机位、实拍 2 次,共 396 段 8 秒视频。模子只看前 3 秒,预计后 5 秒会发生什么,再与真实拍到的后续画面比对。4 阵势的合成一个 0 到 100 的 Physics-IQ 分数,并用合并场景两次实拍之间的互异作念归一化:真实宇宙我方重拍一次齐不会统统疏浚,模子的预计就被拿来和这种当然波动相比。
Physics-IQ 覆按的是更底层的问题,即这个模子是否果然相识物理。这也恰是图灵奖得主 Yann LeCun 多年来反复办法的不雅点,“AI 需要成立对于宇宙的里面模子,而不是只会生成内容”。他担任 Meta 首席科学家期间, Meta FAIR 便把 Physics-IQ 作为中枢评测基准。
关系词翻开 Physics-IQ 的官方榜单,排在第一的却并非 Meta 的模子,也不是英伟达插足重金的Cosmos,而是一个中国的视频生成模子。
2025 年 4 月 21 日,Sand.ai 的 Magi-1 以 56.0% 的得分上榜登顶。那时的榜首、Google 的 VideoPoet 唯有 29.5%,Magi-1 简直把这个数字翻了一倍。从那天算起,Magi-1 系在第又名的位置上坐了约 13 个月,中间只离开过三周。
这张表有三种读法。
看裸模子:前三名里有两个成立在 Magi-1 之上,Magi-1 的 56.0% 是 v2v 设定下的裸模子最高分,远高于 Sora 2 裸模子的 42.3%,Cosmos3-Super 裸模子的 59.7% 出自不同设定,两者不径直可比。
看增强系统:2026 年 5 月,英伟达最新发布的旗舰宇宙模子 Cosmos3-Super 加持 WMReward 后冲到 63.4%,狭小登顶约三周;6 月 17 日,基于 Magi-1 的增强系统以 64.5% 重回第一。
图:Physics-IQ 官方榜单:Magi-1 系居首,Sora 2 裸模子 42.3%(起原:physics-iq.github.io,2026 年 7 月截图)
再看修正后的新榜:2026 年 6 月发布的 Verified 版块上,Magi-1 24B 增强版 58.2 分排第一、裸模子 48.4 分排第二,Cosmos3-Super i2v 39.5 分,Sora 2 唯有 26.5 分。
图:Physics-IQ Verified 修正榜(起原:physics-iq-verified.anates.ai,2026 年 7 月截图)
把两张榜单放在沿途看,会出现一个反学问的画面。OpenAI 的 Sora 在 VBench 这类修起“像不像“的榜单上排名并不出丑,到了 Physics-IQ 上,Sora 2 裸模子唯有 42.3%,不足榜首 64.5% 的三分之二;Verified 新榜上唯有 26.5 分,不足榜首 58.2 分的一半。
生成得传神,和预计得准确,被解说是两回事。
把视频生成作念成“预计下一个词“
Magi-1 赢在那处?论文给出的谜底是架构选择。
当下主流的视频生成模子,Sora、Kling 等,走的齐是扩散途径:一次性生成整段视频,悉数帧同期去噪,相互之间莫得严格的时候先后。
而Magi-1 的作念法更像语言模子预计下一个词:依期间方法逐块生成,每块 24 帧,块里面用扩散去噪保证画质,块与块之间自转头衔尾。通过 block-causal attention,自后的帧不会影响以前的帧,以前一朝被写下,就不再被影响。
图:Magi-1 逐块自转头生成与块因果防范力暗意(起原:SandAI-org/MAGI-1,arXiv:2505.13211)
这个架构自然更接晚宇宙模子该作念的事:左证宇宙的此刻,推演下一秒。它还带来几个工程上的特征:撑持流式生成,视频不错边生成边播放;表面上不错无尽长地续写下去。对宇宙模子而言,这意味着推演的时候跨度不受窗口按捺,仿真不错一直进行,还不错逐块更换请示词,按捺后续走向。
要是把关节词从“生成”换成“预计”,Magi-1 和 LeCun 办法的 JEPA 途径便有了一种理念上的深层呼应。LeCun 在 2022 年发表态度论文《A Path Towards Autonomous Machine Intelligence》,建议 JEPA 架构:不在像素空间预计宇宙,而在表征空间预计,主动忽略那些不可预计的细节。这条途径自后长成一个家眷:I-JEPA、V-JEPA,再到 2025 年的 V-JEPA 2,用百万小时视频西宾,其养殖版块不错作念零样本的机器东谈主揣测。
图:Yann LeCun 在 2026 年 6 月巴黎 VivaTech 演讲(起原:La Ecuación Digital)
一个在像素宇宙里逐块自转头,一个在表征空间里作念预计,虽时期有蓄意统统不同,但齐指向合并个判断,即简略预计物理宇宙变化是宇宙模子的必要条款。
尺子一朝出现,叙事便有了鸿沟
在WAIC 的论坛上,“宇宙模子“被反复拿起。7 月 19 日的一场东谈主形机器东谈主与具身智能论坛,主题之一恰是“尺度体系不斡旋“。开幕当天有不雅察著作写谈:通用宇宙模子正在成为东谈主形机器东谈主的新竞争壁垒。
竞争的坐标系如委果平移。以前几年,视频模子的发布会比的是“像不像“:分辨率、时长、好意思学分。Physics-IQ 这类榜单的出现,把问题换成了“物理宇宙变化预计的准不准“。它的价值不在于新添了一张榜单,而在于把宇宙模子从一个抽象观念,拉回到具象的物理宇宙:杯子会若何倒,水会若何流,光会若何折。这些东西没法靠话术修饰。坐标系的变化不会写在职何一场发布会的邀请函上,但它会决定下一年景本流向那处、东谈主才流向那处。
榜单会迭代,排名会更迭。但尺度一朝开辟,相识行业的神阵容必会被改写,恍惚的叙事也就有了相对明晰的鸿沟。
尺子一朝有了,量出什么,即是什么。
本文由东谈主东谈主齐是产品司理作家【Z Finance】,微信公众号:【Z Finance】,原创/授权 发布于东谈主东谈主齐是产品司理,未经许可开yun体育网,不容转载。
相关资讯
