「评测 AI」这件事正在变天:衡量标准从「模型能做什么」(哪怕强到能终结 78 年未解的 S⁶ 悬案)转向「模型对使用它的人做了什么」。Anthropic 刚用 500 万美元投下了第一票。
消息不算高调:Anthropic 启动 500 万美元资助计划,支持独立团队开发开源福祉评测(wellbeing evaluation)基准,评估 AI 对用户福祉的影响。入选者获得直接资金、模型访问权限和技术支持,成果以开源形式发布,任何开发者都能直接用。申请截止 9 月 21 日。
表面是一页 grants 公告,深层却是行业被迫补上一块从未有过的「度量层」:把「一段对话结束,人过得怎么样」变成模型可测试、可比对的一等指标。
为什么福祉会击穿现有的评测套路
今天的评测几乎都是「单答案打分」:对不对、准不准、安全不安全。福祉评测不是这个形状。
- 评测单位是上下文,不是单轮。处于痛苦中的用户很少在第一句话就说出自伤念头,风险要到很长的对话里才逐渐显现,单轮评测根本看不见它。
- 同样的输出,对不同的人是两种结果。Claude 给减肥建议,对普通用户没问题;对有过进食障碍史的用户,可能是有害的。不存在抽象的「正确答案」,只有「针对这个人、这个状态」的正确答案。
- 两个方向的失败都算伤害。过度顺从(从不拒绝)和过度拒绝(对情感话题退避三舍)都是问题,好评测要同时测。
这正是该领域长期难以被度量的原因:评测对象不是 token 序列,而是一条「人的轨迹」。
Anthropic 给出的「严谨评测」五要素
Safeguards 团队发布了资助对应的标准,也是任何人做评测的现成模板:
- 明确写出 pass/fail 定义,以及为什么重要;
- 临床与领域专家参与设计和验证,而非事后背书;
- 对称测试「预防」与「伤害」,过度顺从与过度拒绝都测;
- 模拟真实使用:多轮对话,风险逐步升级、语境不断变化;
- 用真实专家判断校验自动打分器。
注意这五条的共性:把评测从「单答案打分」推向「临床式、长程式评估」——这更像医学里的照护审计,而不是 ML 基准跑分。
结构信号
- 福祉正在变成工业级规格。前沿实验室出钱让第三方建开源、可审计的福祉基准,意味着「benefit」从使命宣言里的词,变成像准确率、延迟一样可度量、可对比的数字。
- 独立评测成为新的信任层。资助独立团队、开源产出、人人可用——这是行业在监管介入之前,试图自己建立问责机制的模板。花钱养自己的「看门狗」,本身就是一种策略;对一家已盈利并逼近史上最大 AI IPO 的公司,可审计的福祉数据就是面向资本市场的信誉资产。
- 陪伴正式成为产品面。Anthropic 自己的研究显示,用户会用 Claude 寻求支持、建议和陪伴。一旦情感陪伴成为产品功能,它的失效模式就变成产品责任问题。所有做聊天、陪伴、健康类 AI 的团队都该留意。
可以做什么
- 做用户向 AI 的:用那五要素当 checklist,自查多轮对话的福祉风险。
- 做安全/对齐/评测的:这是一条有资金、开源、高可见度的赛道——项目明确邀请临床医生、心理学家、方法论学者,不只是 ML 工程师。
- 做研究的:9 月 21 日截止,是个日历级事件。这一轮选中的名字,会出现在即将定义下一代基准的领域里。
过去两年行业在争论「怎么测 AI 的能力」(我们此前拆解过:AI 科学家的评价标准正从考试转向发现),下一场争论——以及下一场基准竞赛——是关于「AI 对人做了什么」。Anthropic 先落子了。
常见问题
什么是「福祉评测」?
衡量「AI 对使用它的人做了什么」而非「模型能做什么」:一段对话结束后用户的状态好不好——以多轮对话为评测单位,同时测过度顺从与过度拒绝两类失败,并由临床与领域专家参与设计与验证。
Anthropic 的资助计划谁可以申请?
面向独立研究团队,入选者获得资金、模型访问与技术支持,成果开源发布;明确邀请临床医生、心理学家、方法论学者,不只限 ML 工程师。申请 9 月 21 日截止。
这项资助计划对行业意味着什么?
福祉正在变成工业级规格——「benefit」从使命宣言变成像准确率一样可度量、可对比的数字;独立评测成为监管介入前的行业自查信任层,也让情感陪伴正式成为需要承担产品责任的功能面。