斯坦福发布 Terminal-Bench-Science 0.1,70 项任务测评 AI 科研智能体
斯坦福大学团队推出 Terminal-Bench-Science 0.1 基准,含生命、物理、地球、数学和工程科学 70 个专家精选任务,用于评估 AI 智能体在真实科研工作流中的表现,为科研自动化提供标准化测试平台。
斯坦福大学研究团队正式发布 Terminal-Bench-Science 0.1,这是一个专为评估 AI 智能体在科研场景中能力而设计的全新基准。该基准覆盖生命科学、物理学、地球科学、数学和工程科学五大领域,包含 70 个由领域专家精心挑选的任务,旨在模拟真实科研工作流的复杂性与专业性。
与现有基准不同,Terminal-Bench-Science 0.1 聚焦于智能体在终端环境中的端到端操作能力,任务设计强调多步骤推理、工具调用和实验数据分析等科研核心环节。每个任务均附带明确的评估标准,确保测试结果的客观性和可复现性。
研究团队表示,该基准的推出填补了当前 AI 科研评估中缺乏领域深度和实操性的空白。现有测试多集中于通用问题求解,而科研工作流往往需要智能体具备特定领域的知识储备和严谨的逻辑链条,这正是 Terminal-Bench-Science 0.1 试图衡量的关键维度。
初步测试显示,当前主流 AI 智能体在该基准上的表现仍有较大提升空间,尤其在跨学科任务和长链条推理方面错误率较高。这一结果揭示了 AI 在真实科研应用中面临的挑战,也为后续模型优化和基准扩展提供了数据基础。
Terminal-Bench-Science 0.1 的发布有望推动 AI 科研助手从实验室走向实际应用,为科研机构评估和选择合适工具提供参考。研究团队计划后续增加任务数量和动态难度调整,以更全面追踪智能体科研能力的演进。