OpenAI 发布 MentalHealthBench:以 1215 段对话评估 AI 的心理健康应对能力
OpenAI 发布了开放基准测试 MentalHealthBench,包含 1215 段合成心理健康对话,用于评估 AI 系统应对日常议题和紧急情况的能力。来自 22 个国家和地区的 80 多名持证心理学家与精神科医生参与制定,内容覆盖 19 种语言和近 20 个专业领域,并设有 5262 条专家评分标准。OpenAI 称,在受测模型中 GPT-6 Astra 得分最高,同时强调该基准是可审查的诊断工具,而非最终排行榜。数据集现已开放供研究人员下载。
本文来源:IT之家,仅供学习参考,版权归原作者所有。