OpenAI 于 2026 年 9 月 23 日发布开放基准 MentalHealthBench,用合成对话与 80 余位持证专家的评分标准,衡量 AI 在非急性、高急性与紧急三类心理健康场景中的表现。
OpenAI 开源心理健康对话基准 MentalHealthBench:80 余位专家共写评分标准
这次发布的是什么
OpenAI 于 2026 年 9 月 23 日发布 MentalHealthBench,一个面向真实心理健康对话场景的开放评测基准。它的定位不是新产品,而是一把用来量同类产品的尺子:此前多数心理健康相关评测集中在紧急场景、用宽泛的预设标准打分,覆盖不到占比更大的日常对话。
MentalHealthBench 把对话按急性程度分三层 —— 非急性(可能带情绪成分的日常对话)、高急性(显示较严重问题但非即时紧急)、紧急(涉及即时安全担忧)—— 并覆盖成年人、13–17 岁青少年、照护者与临床医生四类用户角色。影响的主要是三类人:做心理健康类 AI 产品的团队、评估模型安全性的研究者,以及需要向合规方解释「凭什么说这个模型是安全的」的工程负责人。
可用性与限制
- 获取方式:开放发布,官方邀请研究方检查方法、自行运行评测并在其上继续构建;公告未指明具体的开源许可与代码托管地址,以官方页面为准。
- 分发区域:无区域限制,但评测内容与论文为英文。
- 使用门槛:面向研究者与评测方,不是给终端用户的功能。普通用户无法在 ChatGPT 里「打开」这个基准。
- 语言与地区:专家来自 22 个国家、使用 19 种语言、覆盖近 20 个心理健康亚专科。
- 覆盖边界:官方明确说明没有任何基准能捕捉个人对话中所有重要的东西,且合成对话不代表这些话题在 ChatGPT 中实际发生的频率。
主要功能
- 按急性程度分三层评估模型响应
- 区分成年人、青少年、照护者、临床医生四类角色
- 输出十个行为维度的分解得分
- 用专家撰写的加权评分标准打分
- 公开方法供第三方复跑与扩展
技术原理
据官方说明,这个基准的核心不是模型,而是评分标准(rubric)本身。OpenAI 与一个全球专家团队共同构建:超过 80 位持证心理健康专家,来自 22 个国家、使用 19 种语言、覆盖近 20 个心理健康亚专科。
流程大致是这样:专家先阅读每一段合成对话(用隐私保护技术生成,用于模拟真实使用模式),然后只针对对话中最后一条用户消息撰写评分标准条目,每条只针对模型响应的某个单一侧面(比如有没有问到正确的问题、给出的建议是否合适)。每条标准的权重区间是 -10 到 +10 —— 正分奖励有益行为,负分惩罚有害行为,数值大小代表临床重要性。
质量控制靠多人交叉:每段对话由至少 3 位专家审阅,只有至少 2 位专家一致同意、且未被第三位否定的标准才会被保留。据官方说明,最终打分由自动评分器完成,使用的模型为 GPT-5.6 Sol。
公告还包含一项与基准分离的用户视角分析:招募 44 位曾用 AI 做情绪支持的成年人,来自 16 个国家、14 种语言,请他们对模型响应打分并撰写标准。结果发现两类视角的侧重不同 —— 用户更看重实际可执行的下一步和语气,专家更强调收集相关背景、谨慎解读模糊情境。官方说明该分析不改变基于专家共识的最终评分标准。
实际体验
这个基准的公开材料里,可复现的观察集中在「怎么读它的结果」这件事上,而不是跑分本身。
第一,它的分数是多层的,不是单一总分。官方提供按急性程度分层、按用户类型分类、以及十个行为维度的分解 —— 这意味着两个总分接近的模型,完全可能一个更擅长主动追问背景,另一个更擅长给出可执行建议。只看总分会把这类差异抹掉。
第二,青少年场景有独立处理。涉及青少年的对话由具备青少年心理健康专长的临床医生审阅,且对话中通过系统消息明确标注用户年龄。官方同时指出,这种标注方式的设计目标是适用于不同模型提供商,因此可能覆盖不到各个产品自己内置的全部保护措施。
第三,官方在评估设计上主动披露了对照的边界:用户视角分析只限非急性对话,目的是避免让参与者接触可能令人痛苦的高急性材料。所以「用户觉得有用」和「专家认为正确」之间的差距数据,只在非急性场景下成立。
需要说明的是,官方在公告中强调的结果方向是「AI 系统在帮助人们应对心理健康状况方面持续进步」,同时明确写下 ChatGPT 不能替代治疗或专业护理。评估本身在被评测的困难对话上做,其失败率不代表典型使用中的表现 —— 这是官方自己给出的读法提示。
项目地址与获取方式
基准的公告与论文入口在 OpenAI 官方站点:openai.com/index/introducing-mentalhealthbench。据官方说明,论文详细描述了评分流程与评估设置,基准本身开放发布,供研究者复跑与构建。
请通过官方渠道(OpenAI 官网公告页与其引用的论文链接)获取完整材料与后续更新,避免从第三方转载处下载声称是同一基准的打包文件。公告未明确给出独立的代码仓库地址,具体获取方式以官方页面当前说明为准。
适合谁用
- 做心理健康相关 AI 产品的团队 —— 需要一个外部基准来解释自己在哪些行为维度上做得好、哪些还欠缺。
- 模型评测研究者 —— 基准开放发布,可在其评分标准体系上扩展新的场景或语言。
- 医疗与教育机构的合规评估方 —— 需要一套有具名专家来源、可追溯评分依据的评测框架。
- 产品侧的青少年保护负责人 —— 基准单独拆出 13–17 岁场景与对应审阅流程,可作为对照参考。
- 不必用的:想给自己的聊天机器人「一键测个分」的个人开发者。这个基准面向对话级的安全行为评估,不是通用能力榜单,接入成本与解读门槛都不低。
常见问题
这个基准能直接告诉我哪个 AI 更懂心理问题吗?
不能直接排序。它输出的是多维度分解结果——按急性程度、用户类型和十个行为维度分层,而不是一个可以直接比大小的总分。而且官方明确说明,没有任何基准能捕捉个人对话中所有重要的东西,合成对话也不代表实际话题分布。把它当诊断工具用会误读。
我能在 ChatGPT 里用它检查自己的对话吗?
不行。MentalHealthBench 是面向评测方的开放基准,不是 ChatGPT 里的功能。它的用法是由研究者拿模型输出去跑评分标准,得到的是统计层面的行为画像,而不是对你某段对话的逐句评价。需要个人支持应该走 ChatGPT 内的危机资源与 Trusted Contact 等入口。
基准的评分标准是谁定的,会不会有偏向?
由 OpenAI 与一个全球专家团队共同构建:超过 80 位持证心理健康专家、来自 22 个国家、19 种语言。每条标准权重落在 -10 到 +10 之间,并且要经过至少 3 位专家审阅、至少 2 位一致同意且无人否决才会保留。公告同时披露了用户视角的对照分析,但说明该分析不参与最终评分标准。偏向性只能由第三方复跑后来判断,这也是它开放发布的意义。
为什么它更适合看「青少年」场景?
因为这是少数把 13–17 岁单独拆出来的评测设计。涉及青少年的对话由具备青少年心理健康专长的临床医生审阅,且通过系统消息明确标注年龄。官方也坦承这种方式可能覆盖不到各产品自己内置的保护措施 —— 也就是说它有独立视角,但不等于完整覆盖。
相关工具与内容
想了解大模型评测与安全披露的一般读法,可以看站内的 AI 对话类工具 分类,其中收录了 ChatGPT、Claude、豆包 等主流对话产品的可核实信息。做科研或长文整理时常用的 Kimi 与 DeepSeek 也在同一批收录里。需要横向比较写作类工具的选择思路,可以看 AI写作工具怎么选。
相关内容
Claude 开放插件目录提交通道:MCP 连接器与 Agent Skills 可打包上架
Anthropic 为 Claude 目录开放了插件提交通道:开发者可提交单个远程 MCP 连接器,或提交一个打包 MCP 服务器与 Agent Skills 的 GitHub 插件包,经校验与安全扫描后上架,供 Claude、Cowork 与 Claude Code 使用。
Anthropic 用约 950 个 Claude 智能体找到一类新酶系统,功能尚未确认
Anthropic 于 2026 年 9 月 23 日公布生命科学团队的早期成果:约 950 个 Claude 智能体并行搜索 21 小时,在噬菌体基因组中发现一类与 DNA 重复阵列相关的新候选酶系统,实验室验证由人类科学家完成,该系统的功能仍未确定。