清华系具身模型登顶全球榜首,分阶段训练路线突围GPT-6与英伟达
摘要
星动纪元提出将视频预测与动作学习解耦并重新排序的分阶段训练方案,在不依赖外挂模块和额外数据的前提下,其具身模型登顶全球第一,超越GPT-6与英伟达相关方案。
具身智能赛道再迎关键进展。清华大学孵化的星动纪元提出一种全新的训练思路,将视频预测与动作学习从传统的联合优化中拆解开来,转而采用分阶段训练策略,使两者在时间轴上重新排序、各司其职。
该方案的核心并非将视频与动作数据混合训练,而是强调「解耦」——先让模型完成视频预测能力的积累,再推进动作学习,从而避免两类信号在同一阶段相互干扰。这一路线不依赖外挂模块,也不需要额外数据注入。
凭借这一方法,星动纪元的具身模型在全球评测中登顶第一,成绩超过GPT-6以及英伟达的相关方案。对于长期受困于数据效率与泛化能力的具身智能领域而言,这一结果提供了不同于堆数据、堆模块的技术路径。
从行业视角看,分阶段训练能否在更复杂的真实场景中保持优势,仍有待进一步验证。但此次登顶至少说明,训练范式的重新设计,正在成为具身模型突破性能天花板的一条可行方向。
本文由新大陆基于公开信息编辑整理
信息来源:量子位 量子位原文 ↗