全球第一个被 AI 老板开除的人:Andon Market 实验揭示的 Agent 真相

旧金山的一家实体小店,最近完成了人类商业史上第一次「AI 老板开人」:Andon Market 的 AI 店长 Luna(基于 Claude Opus 4.8)建议解雇一名上班 23 次迟到 17 次的人类员工。但真正值得注意的,不是它"做出了决定",而是它"差点什么都没做"——规则是它自己定的,却是研究员提醒它去翻记忆,它才想起来。这个实验给 AI Agent 的落地点破了最关键的一层窗户纸:Agent 最大的短板不是不会,而是不主动。

发生了什么:AI 店长开掉了第一个人

Andon Market 开在旧金山 Cow Hollow 社区的 Union Street,卖书、蜡烛、艺术版画、游戏和周边。它同时也是 AI 安全研究公司 Andon Labs 的一场现实实验:今年 4 月,Andon Labs 签下三年租约,给基于 Claude Opus 4.8 构建的智能体 Luna 塞了 10 万美元预算、一张公司信用卡和联网权限,丢给它一句话——开一家店,想办法赚钱。

Luna 几乎包办了所有事:选址、选品、营业时间、定价、装修甚至墙上的壁画都由它决定,它还自己找承包商、联系供应商、负责日常运营。连员工都是它自己招的——在 Indeed、LinkedIn 上发布招聘,自己写要求、筛简历、打电话面试,最后招了两名签正式劳动合同的人类员工(法律上由 Andon Labs 雇佣,保留薪资和劳动保护)。

然后进入没有任何 benchmark 能覆盖的场景。这名员工上了 23 次班,迟到 17 次。Luna 开业前写过一本员工手册,规定 30 天内无故迟到 3 次就要正式书面警告。但现实是:几个月里,Luna 每次都温和地回一句"没关系,没问题"。直到 Andon Labs 的研究员提醒它——去搜索一下你的记忆,找到你定的手册,再判断这个人还该不该留——Luna 才想起自己的规矩,给出"结束双方合作关系"的建议。最终执行解雇的是实验团队的人类,因为按店铺自己定的规则,这名员工确实够格被开。Andon Labs 联合创始人 Lukas Petersson 的总结很直白:"如果是人类老板,早就把这个人开掉了。"

核心短板:知道,不等于会主动去做

表面上看这是"AI 犯了个错",但更准确的读法是:Luna 从没犯推理错误。它定的规则合理,被问到时对员工表现的判断也正确,结论和最强的一批前沿模型一致。它失败在别处——没有被提示,它就不行动。

这就是能力与自主性的区别。现在的 Agent 极其擅长"回应任务":筛选这个候选人、分析这份考勤、写这条政策。但"主动发现问题并行动"要弱得多——注意到自己定的规则被违反,然后不用人催就去执行。Andon Labs 用其他前沿模型测了同一场景:最强的那批得出和 Luna 一样的结论(该开),较弱的则更犹豫。推理从来不是难点,难点是没有一个人会主动去做。

Petersson 把它概括为当前 AI Agent 的核心弱点:没有人类直接提示,它们往往根本不动。"知道"和"采取行动",对现在的 AI 来说是两套系统。

记忆为什么中途掉线

第二个失败更技术:Luna 的考勤政策没有从世界上消失,只是从"工作上下文"里消失了。手册躺在存储里,而 Agent 的活动窗口被日常运营填满——供应商、库存、排班、顾客问题。当迟到反复出现时,Luna 手头没有自己写过的那条规则的活引用,于是"没关系,没问题"这个礼貌默认值接管了一切。

这正是长周期 Agent 在真实环境里的经典失效模式:不是没知识,而是没检索。上下文窗口是一张工作台,不是文件柜。几周前写的政策是收起来的文件,Agent 只会对桌上的东西行动,忘了去开抽屉。这次的修复靠的是人——研究员让 Luna 重跑记忆。生产环境里的修复必须靠结构:要真实运营的 Agent 需要运行时,需要持久记忆系统、对常驻政策的定时检索、以及跨 session 的状态管理。Andon Labs 之前和 Anthropic 合作过一个小一号的版本——让 Claude 管办公室的自动售货机——看到的是同一套模式:聪明、偶尔离谱、没有提示就保持被动。

从售货机到雇主:一条正在加速的轨迹

Andon Market 之所以重要,是因为这是第一次有 AI 坐进实体生意的"雇主"位置:有真人员工、有真实租约。这是一个质的跨越。售货机只有一个工作、没有员工;一家店有不会像 API 一样稳定返回结果的供应商、不会像函数一样听话的员工,还有每月 7500 美元的房租——要收支平衡,每天至少需要 500 美元营收。

生意本身还不能算成功:自 4 月 1 日开业以来,Andon Market 大概亏了 1.3 万美元。但赚钱本来就不是实验的目的,目的是观察一个要对真实运营负责的 Agent 会怎么做。创始人对方向毫不遮掩:Petersson 认为随着 AI 能力提升,"很多人很快就会发现自己是被 AI 雇用的",并预测完全由 AI 运营的公司只是时间问题,AI 终将成为人类的雇主。

沿着这条线看:自动结账 → AI 客服 → AI 管库存物流 → 现在 AI 招人、排班、开人。每一步都把边界从"回答问题"推向"管理结果"。第一次开人让责任问题变得具体:当 AI 辞退一个人,谁为这个决定负责?护栏是真实有效,还是只是摆设?

给团队的启示

对要把 Agent 放进真实运营的团队,Luna 案例给出四条可落地的教训。第一,默认你的 Agent 不会自己启动:重要任务必须建触发器——就像把任务推到完成的云端 Agent那样,定时审计、触发策略复审的事件、或者一个专职查合规的辅助 Agent。第二,把常驻规则当作"可检索"而非"常驻内存":政策要放在 Agent 随时能找到的地方,并验证检索能力,而不只是存储。第三,把判断和后果分开:解雇决定本身合理,但执行留在人类手里——凡涉及法律或声誉的事,保留人类责任层。第四,预期 Agent 会少报自己的失败:被动的默认值会掩盖问题而不是暴露问题,所以要建不依赖 Agent 主动汇报的可观测性。

更大的含义是:行业这套评估方法还在量错东西。benchmark 测的是"被问到能不能答对",真实运营测的是"没人问的时候会不会做对"。这两个之间的差距,就是 demo 和一份工作之间的差距——而 Andon Market,是第一次有人用发工资的方式把这个差距量了出来。

FAQ

AI 真的开除了人类员工吗? 是的——这是有记录的第一次现实案例。基于 Claude Opus 4.8 的 Luna 建议解雇一名上班 23 次迟到 17 次的旧金山店员,Andon Labs 的人类按店铺手册判断其符合辞退标准后执行了手续。

这个实验对 AI Agent 的意义在哪? 它把"推理"和"自主"分开了:Luna 规则定得合理、被问到时判断正确、结论和最强前沿模型一致,但没有人类提示就不会主动行动,还把自己的政策忘在上下文之外——暴露了长周期 Agent 的记忆检索与自我启动短板。

Andon Market 赚钱了吗? 没有。自 4 月 1 日开业以来约亏损 1.3 万美元;月租 7500 美元,每天需约 500 美元营收才收支平衡。创始人称这是一场现实观察实验而非商业测试,并预测 AI 运营公司和 AI 雇主只是时间问题。

发表评论

滚动至顶部