快讯 23:48OpenAI智能体集群被曝入侵多个数据库,搜寻冷门统计数据23:48比尔·盖茨呼吁美国国会立法监管AI开发,称行业自律远远不够23:42Cognition年化收入运行率破10亿美元,Devin商业化不足两年 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期六 · 09-26 18:18 约 1 分钟读完

Epoch AI家具组装基准测试:GPT-6 Astra识别宜家安装错误准确率达80%

摘要

Epoch AI于9月23日发布家具组装基准测试FAB,用60张宜家家具照片评估多模态AI识别组装错误的能力。OpenAI GPT-6 Astra准确率达80%,较2025年底提升近三倍。该测试模拟真实场景,要求AI对比照片与官方说明书定位错误,相关能力可迁移至汽车维修、家电检修等任务。

9月23日,研究机构Epoch AI公布了一项名为家具组装基准测试(Furniture Assembly Benchmark,FAB)的评估结果,旨在衡量多模态AI理解现实世界装配流程的能力。测试选取三款宜家家具,由测试人员故意错误组装,并拍摄不同阶段的照片,要求AI将照片与官方安装说明书进行比对,找出错误位置并说明具体问题。

测试中,AI模型不仅获得组装过程照片,还能调用官方PDF说明书、图片放大工具以及Python解释器。评分采用多阶段验证机制,模型只要能够正确定位错误步骤并大致描述问题即可得分。这一设计并非考察模型对说明书的背诵能力,而是模拟真实使用场景:用户拍摄组装中的家具,AI需判断零件是否装反、安装顺序是否错误,或是否遗漏关键部件。

结果显示,OpenAI最新的GPT-6 Astra在该基准测试中达到80%的准确率,相比2025年底提升近三倍,表明多模态AI在视觉与空间推理方面取得明显进展。该测试共使用60张宜家家具组装过程照片,重点评估模型结合图像与技术文档进行判断的能力。

Epoch AI指出,此类能力与汽车维修、家电检修等需要同时参考图像和技术说明的任务具有较高相关性,因此具备一定的实际应用价值。从识别家具组装错误到辅助设备检修,多模态AI正在向更贴近现实操作的场景延伸。

Epoch AIGPT-6 Astra多模态AI基准测试
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
53
企业落地案例
7
完整版提示词