微软联合Hugging Face发布ThinkingBox智能体沙箱与基准
摘要
微软与Hugging Face推出ThinkingBox智能体沙箱及ThinkingBox-Bench基准,覆盖507个有状态业务工作流,每任务运行20次,以终局数据库状态和副作用作为可执行判定,现可通过OpenEnv在Hugging Face上运行。
微软与Hugging Face近日联合发布ThinkingBox智能体沙箱及配套基准ThinkingBox-Bench,旨在为有状态业务工作流中的智能体提供可执行评测环境。该工具现可通过OpenEnv在Hugging Face平台上运行。
ThinkingBox-Bench覆盖507个有状态业务工作流,每个任务均运行20次,以终局数据库状态和副作用作为可执行判定标准。这种设计将评估重点从传统的过程指标转向最终系统状态,更贴近真实业务场景中对数据一致性和操作影响的关注。
对于AI行业从业者而言,ThinkingBox的发布意味着智能体评测正从静态问答向动态、有状态的任务执行演进。通过OpenEnv在Hugging Face上开放运行,开发者可直接接入这一沙箱环境,测试智能体在复杂业务流中的表现。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗