OpenAI推出心理健康基准测试,1215段对话评估AI应对能力
摘要
OpenAI发布MentalHealthBench开放基准,含1215段合成心理健康对话,由22个国家和地区80多名持证专家参与制定,覆盖19种语言及近20个专业领域,配套5262条专家评分标准,旨在填补AI心理健康评估空白。
OpenAI于9月24日正式对外发布MentalHealthBench,这是一个面向AI系统的开放式基准测试,旨在衡量模型在心理健康场景中的实际应对水平。该基准包含1215段合成心理健康对话,话题跨度从日常心理困扰延伸至紧急心理危机事件。
据公开信息,MentalHealthBench的构建过程汇集了来自22个国家和地区的80多名持证心理学家与精神科医生。这些专家使用19种语言,覆盖近20个心理健康专业领域,为每一段对话配套撰写了评分标准。根据相关研究论文,完整数据集共收录5262条由专家团队撰写的评分标准。
OpenAI指出,当前针对AI在心理健康领域表现的主流评估多聚焦于紧急情况,并依赖宽泛的预设标准来判断模型优劣,这导致业界对模型在完整心理健康对话范围内的表现仍缺乏清晰认知。此次公开MentalHealthBench,意在邀请其他研究人员审查其方法、开展独立评估,并在此基础上推进后续研究。
美国心理学会首席执行官阿瑟·埃文斯博士在OpenAI的公告中表示,心理健康是一个连续谱,因此需要与人进行不同程度心理健康交流的AI系统,同时建立在临床科学和真实生活经验的基础之上。OpenAI还透露,目前每周有超过10亿人使用ChatGPT。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗