快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期一 · 09-07 14:03 约 2 分钟读完

智象发布具身世界模型HiDream-O1-Embodied,RoboColiseum扰动适应榜登顶

摘要

智象未来(HiDream.ai)发布具身世界模型HiDream-O1-Embodied,在具身智能评测平台RoboColiseum的扰动适应子榜单中以平均分0.692登顶。该模型强化物理感知与动态预判能力,标志其打通图像、视频、3D、动作等模态,贯通理解-推演-执行全流程,构建统一世界模型基座。

智象发布具身世界模型HiDream-O1-Embodied,RoboColiseum扰动适应榜登顶
图片来源:量子位

智象未来(HiDream.ai)今日正式推出具身世界模型HiDream-O1-Embodied。该模型基于原生全模态技术理念设计,旨在强化机器人在物理世界中的感知精度与动态预判能力,推动具身智能向更高阶的物理交互演进。此次发布标志着智象在图像、视频、3D及动作等多模态统一表征基础上,完成了从理解、推演到执行的全链路技术闭环。

在模型发布同期,HiDream-O1-Embodied首次参与具身智能模型评测平台RoboColiseum,即在核心的扰动适应(Robustness)子榜单中,以平均分0.692的成绩位居榜首。该平台基于高保真仿真环境构建,围绕指令跟随、空间理解、扰动适应与通用操作四个维度设置78个评测任务,其中扰动适应被公认为最具挑战性,通过改变背景、光照、材质、机器人初始状态及相机位置等变量,检验模型在非理想条件下的稳定性与泛化能力。

据智象未来CTO姚霆介绍,HiDream-O1-Embodied在理解、感知和抗干扰三方面进行了针对性创新。在指令理解层面,模型覆盖多元动词、句式与表达方式的等价指令空间,可穿透句式变化直达用户意图;在视觉感知层面,模型综合多视角信息,让不同视觉通道相互补充,避免单一视角失灵导致全局失效;在训练阶段,模型主动引入光照变化、画面污损、视野遮挡等非理想条件,提升在复杂环境中的容错能力。

支撑上述能力的是智象提出的“真实基座+生成增强”数据生产范式。以与诺亦腾的合作为例,高精度真人动作捕捉数据作为真实底座,智象借助原生全模态能力完成百倍级数据精细化扩增,在恪守物理约束的前提下生成背景、光照、物体形态等变量各异的训练样本,形成数据与模型互相驱动的增长飞轮。

不到一个月前,智象刚发布交互式世界模型HiDream-O1-World,并在WBench的Navi分榜中以平均分80.9登顶。交互式世界模型侧重数字空间中的理解与推演,具身世界模型则面向物理世界中的操作与执行,两者形成互补。智象未来创始人兼CEO梅涛此前表示,下一代大模型竞争的关键在于从单模态走向原生统一的全模态。从HiDream-O1-Image到HiDream-O1-World再到HiDream-O1-Embodied,智象正逐步构建覆盖视觉、交互及具身领域的模型家族矩阵。

具身智能世界模型智象未来RoboColiseum
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词