世界模型新比赛!北大、清华、北航、上交、中科大联合发布首个三视角具身世界模型榜单,新评测标准来了
文章摘要
【关 键 词】 世界模型、具身智能、三视角、模型评测、机器人
北京大学等多所高校联合发起首个面向机器人三视角世界模型的评测榜单TriWorldBench Challenge,旨在解决多摄像头视角下世界一致性问题,并探索如何科学评价世界模型对真实世界的理解能力。传统视频生成模型评价主要关注画面清晰度、连贯性及内容匹配度,但这无法满足具身世界模型在动态、连续且遵循物理规律的真实环境中的应用需求。因此,建立新评价标准成为推动具身世界模型从视觉生成迈向深度世界理解的关键。
该评测体系聚焦机器人操作场景中的头部、左腕和右腕三个视角,核心考察模型的多视角一致性、任务执行能力及对物理世界的理解。在多视角一致性方面,系统要求生成的三个视角视频不仅各自合理,还必须在机械臂活动、动作阶段、抓取进度及目标物体状态上保持高度对应。在任务执行能力上,评测不仅要求画面清晰流畅,更强调模型能否准确执行指令、保证机械臂运动符合预期,并确保抓取和释放等局部交互的合理性。此外,物理世界理解能力则通过考察物体位置关系、动作变化及空间对应来评估模型对三维空间的认知。
TriWorldBench不仅提供排名,更致力于成为帮助研究团队优化模型的诊断工具。基准测试包含五百个三视角同步片段,覆盖五十个操作任务,通过六个维度和十九项评测信号计算总分。系统采用细粒度评测机制,将指标分配到证据最可靠的相机视角,结合动作阶段标注判断机械臂的运动与静止状态,同时让视觉质量评分受任务完成度约束,避免画质精美但内容错误的视频获得优势。目前该挑战已面向全球开放报名,期望为不同技术路线提供公平比较平台,推动行业形成统一科学的评价标准,探索具身世界模型发展的下一阶段。
原文和模型
【原文链接】 阅读原文 [ 2302字 | 10分钟 ]
【原文作者】 机器之心
【摘要模型】 qwen3.7-max-2026-06-08
【摘要评分】 ★★★★☆



