跳到正文
中文
FikirPilot 内容

OpenAI 发布了针对心理健康对话的新人工智能测试

更新于: 2026年9月24日 · 2 分钟阅读

发布于: · 消息抵达: · 处理时长: 45 分钟

OpenAI 发布了针对心理健康对话的新人工智能测试
放在木桌上的笔记本电脑

OpenAI发布了名为 MentalHealthBench 的评测工具,用于评估人工智能模型在心理健康对话中的回答。该研究依据80多名持证心理健康专业人士的标准,考察了对1,215段虚构对话中最终用户消息的回答。

  • 其中53.5%属于非紧急情景,18.2%属于高风险情景,28.3%属于紧急情景。
  • 其中21.2%代表青少年用户画像。

评估采用的标准包括询问必要背景、提供可执行的建议、临床准确性、维护个人的决策空间、不强化不切实际的信念,以及准确判断紧急程度等。数据集中仅有13段土耳其语对话,因此被认为不足以对土耳其的实际援助服务进行全面比较。

为何重要

这项研究为评估心理健康领域的人工智能回答提供了一个框架,不仅考察回答是否流畅或总体上有帮助,还分别评估其识别风险程度和进行安全沟通等能力。研究同时纳入紧急和高风险案例,以及青少年用户画像,为考察同一种回答方式可能无法满足不同脆弱程度用户的需求提供了基础。不过,研究结果建立在依据专家标准对虚构对话回答进行评估的基础上,并不能单独说明真实用户互动会呈现怎样的情况。土耳其语样本较少,也限制了从土耳其的援助服务和用户需求角度进行直接比较。因此,尚未得到回答的问题是,评测中的发现会如何随着语言和实际使用条件的不同而变化。

背景

OpenAI 在 FikirPilot 档案中并不是新出现的名称:在过去90天内,我们发布了54篇提及该名称的新闻;最新一篇的日期为2026年9月24日。

来源: Teknoblog