OpenAI 开源心理健康对话基准 MentalHealthBench:80 余位专家共写评分标准

OpenAI 于 2026 年 9 月 23 日发布开放基准 MentalHealthBench,用合成对话与 80 余位持证专家的评分标准,衡量 AI 在非急性、高急性与紧急三类心理健康场景中的表现。

这次发布的是什么

OpenAI 于 2026 年 9 月 23 日发布 MentalHealthBench,一个面向真实心理健康对话场景的开放评测基准。它的定位不是新产品,而是一把用来量同类产品的尺子:此前多数心理健康相关评测集中在紧急场景、用宽泛的预设标准打分,覆盖不到占比更大的日常对话。

MentalHealthBench 把对话按急性程度分三层 —— 非急性(可能带情绪成分的日常对话)、高急性(显示较严重问题但非即时紧急)、紧急(涉及即时安全担忧)—— 并覆盖成年人、13–17 岁青少年、照护者与临床医生四类用户角色。影响的主要是三类人:做心理健康类 AI 产品的团队、评估模型安全性的研究者,以及需要向合规方解释「凭什么说这个模型是安全的」的工程负责人。

可用性与限制

  • 获取方式:开放发布,官方邀请研究方检查方法、自行运行评测并在其上继续构建;公告未指明具体的开源许可与代码托管地址,以官方页面为准。
  • 分发区域:无区域限制,但评测内容与论文为英文。
  • 使用门槛:面向研究者与评测方,不是给终端用户的功能。普通用户无法在 ChatGPT 里「打开」这个基准。
  • 语言与地区:专家来自 22 个国家、使用 19 种语言、覆盖近 20 个心理健康亚专科。
  • 覆盖边界:官方明确说明没有任何基准能捕捉个人对话中所有重要的东西,且合成对话不代表这些话题在 ChatGPT 中实际发生的频率。

主要功能

  • 按急性程度分三层评估模型响应
  • 区分成年人、青少年、照护者、临床医生四类角色
  • 输出十个行为维度的分解得分
  • 用专家撰写的加权评分标准打分
  • 公开方法供第三方复跑与扩展

技术原理

据官方说明,这个基准的核心不是模型,而是评分标准(rubric)本身。OpenAI 与一个全球专家团队共同构建:超过 80 位持证心理健康专家,来自 22 个国家、使用 19 种语言、覆盖近 20 个心理健康亚专科。

流程大致是这样:专家先阅读每一段合成对话(用隐私保护技术生成,用于模拟真实使用模式),然后只针对对话中最后一条用户消息撰写评分标准条目,每条只针对模型响应的某个单一侧面(比如有没有问到正确的问题、给出的建议是否合适)。每条标准的权重区间是 -10 到 +10 —— 正分奖励有益行为,负分惩罚有害行为,数值大小代表临床重要性。

质量控制靠多人交叉:每段对话由至少 3 位专家审阅,只有至少 2 位专家一致同意、且未被第三位否定的标准才会被保留。据官方说明,最终打分由自动评分器完成,使用的模型为 GPT-5.6 Sol。

公告还包含一项与基准分离的用户视角分析:招募 44 位曾用 AI 做情绪支持的成年人,来自 16 个国家、14 种语言,请他们对模型响应打分并撰写标准。结果发现两类视角的侧重不同 —— 用户更看重实际可执行的下一步和语气,专家更强调收集相关背景、谨慎解读模糊情境。官方说明该分析不改变基于专家共识的最终评分标准。

实际体验

这个基准的公开材料里,可复现的观察集中在「怎么读它的结果」这件事上,而不是跑分本身。

第一,它的分数是多层的,不是单一总分。官方提供按急性程度分层、按用户类型分类、以及十个行为维度的分解 —— 这意味着两个总分接近的模型,完全可能一个更擅长主动追问背景,另一个更擅长给出可执行建议。只看总分会把这类差异抹掉。

第二,青少年场景有独立处理。涉及青少年的对话由具备青少年心理健康专长的临床医生审阅,且对话中通过系统消息明确标注用户年龄。官方同时指出,这种标注方式的设计目标是适用于不同模型提供商,因此可能覆盖不到各个产品自己内置的全部保护措施。

第三,官方在评估设计上主动披露了对照的边界:用户视角分析只限非急性对话,目的是避免让参与者接触可能令人痛苦的高急性材料。所以「用户觉得有用」和「专家认为正确」之间的差距数据,只在非急性场景下成立。

需要说明的是,官方在公告中强调的结果方向是「AI 系统在帮助人们应对心理健康状况方面持续进步」,同时明确写下 ChatGPT 不能替代治疗或专业护理。评估本身在被评测的困难对话上做,其失败率不代表典型使用中的表现 —— 这是官方自己给出的读法提示。

项目地址与获取方式

基准的公告与论文入口在 OpenAI 官方站点:openai.com/index/introducing-mentalhealthbench。据官方说明,论文详细描述了评分流程与评估设置,基准本身开放发布,供研究者复跑与构建。

请通过官方渠道(OpenAI 官网公告页与其引用的论文链接)获取完整材料与后续更新,避免从第三方转载处下载声称是同一基准的打包文件。公告未明确给出独立的代码仓库地址,具体获取方式以官方页面当前说明为准。

适合谁用

  • 做心理健康相关 AI 产品的团队 —— 需要一个外部基准来解释自己在哪些行为维度上做得好、哪些还欠缺。
  • 模型评测研究者 —— 基准开放发布,可在其评分标准体系上扩展新的场景或语言。
  • 医疗与教育机构的合规评估方 —— 需要一套有具名专家来源、可追溯评分依据的评测框架。
  • 产品侧的青少年保护负责人 —— 基准单独拆出 13–17 岁场景与对应审阅流程,可作为对照参考。
  • 不必用的:想给自己的聊天机器人「一键测个分」的个人开发者。这个基准面向对话级的安全行为评估,不是通用能力榜单,接入成本与解读门槛都不低。

常见问题

这个基准能直接告诉我哪个 AI 更懂心理问题吗?

不能直接排序。它输出的是多维度分解结果——按急性程度、用户类型和十个行为维度分层,而不是一个可以直接比大小的总分。而且官方明确说明,没有任何基准能捕捉个人对话中所有重要的东西,合成对话也不代表实际话题分布。把它当诊断工具用会误读。

我能在 ChatGPT 里用它检查自己的对话吗?

不行。MentalHealthBench 是面向评测方的开放基准,不是 ChatGPT 里的功能。它的用法是由研究者拿模型输出去跑评分标准,得到的是统计层面的行为画像,而不是对你某段对话的逐句评价。需要个人支持应该走 ChatGPT 内的危机资源与 Trusted Contact 等入口。

基准的评分标准是谁定的,会不会有偏向?

由 OpenAI 与一个全球专家团队共同构建:超过 80 位持证心理健康专家、来自 22 个国家、19 种语言。每条标准权重落在 -10 到 +10 之间,并且要经过至少 3 位专家审阅、至少 2 位一致同意且无人否决才会保留。公告同时披露了用户视角的对照分析,但说明该分析不参与最终评分标准。偏向性只能由第三方复跑后来判断,这也是它开放发布的意义。

为什么它更适合看「青少年」场景?

因为这是少数把 13–17 岁单独拆出来的评测设计。涉及青少年的对话由具备青少年心理健康专长的临床医生审阅,且通过系统消息明确标注年龄。官方也坦承这种方式可能覆盖不到各产品自己内置的保护措施 —— 也就是说它有独立视角,但不等于完整覆盖。

相关工具与内容

想了解大模型评测与安全披露的一般读法,可以看站内的 AI 对话类工具 分类,其中收录了 ChatGPT、Claude、豆包 等主流对话产品的可核实信息。做科研或长文整理时常用的 Kimi 与 DeepSeek 也在同一批收录里。需要横向比较写作类工具的选择思路,可以看 AI写作工具怎么选。

Related
链接已复制