快讯 23:50LMSYS 开源 Vicuna-13B:基于 ShareGPT 数据微调 LLaMA,训练成本仅约 300 美元22:47海马云发布GEAR端云混合掌机:骁龙865配7英寸144Hz屏,硬件首发3149元22:45华为星河通信独库公路实测:98.7%路段信号良好 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期日 · 10-04 06:56 约 1 分钟读完

微软联合Hugging Face发布ThinkingBox智能体沙箱与基准

摘要

微软与Hugging Face推出ThinkingBox智能体沙箱及ThinkingBox-Bench基准,覆盖507个有状态业务工作流,每任务运行20次,以终局数据库状态和副作用作为可执行判定,现可通过OpenEnv在Hugging Face上运行。

微软与Hugging Face近日联合发布ThinkingBox智能体沙箱及配套基准ThinkingBox-Bench,旨在为有状态业务工作流中的智能体提供可执行评测环境。该工具现可通过OpenEnv在Hugging Face平台上运行。

ThinkingBox-Bench覆盖507个有状态业务工作流,每个任务均运行20次,以终局数据库状态和副作用作为可执行判定标准。这种设计将评估重点从传统的过程指标转向最终系统状态,更贴近真实业务场景中对数据一致性和操作影响的关注。

对于AI行业从业者而言,ThinkingBox的发布意味着智能体评测正从静态问答向动态、有状态的任务执行演进。通过OpenEnv在Hugging Face上开放运行,开发者可直接接入这一沙箱环境,测试智能体在复杂业务流中的表现。

微软Hugging FaceThinkingBox智能体评测
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
57
企业落地案例
9
完整版提示词