Claude「棉花糖」「甜瓜」曝光:One-Shot 3D 空间推理,思考 Token 烧穿上限

两款未发布的 Claude 新模型——内部代号「棉花糖」(Marshmallow)与「甜瓜」(Melon)——本周转入开发者测试,早期实测已经出现了本不该出现在 LLM 身上的结果:一步到位(One-Shot)生成 3D 空间布局与建筑方案,且测试者普遍反馈对话体验优于 Opus 5。代价是算力:两者会在回答前烧掉海量「思考 Token」,多位测试者直接触顶生成上限。若传闻属实,Anthropic 正在把竞赛从「训练期堆算力」推向「推理期拼思考」,并把下一块高地押在空间智能上。

两款泄露的 Claude 模型,正在改写竞争赔率

Anthropic 尚未确认任何信息。泄露的是内部推进的硬证据:claude-marshmallow-eapclaude-melon-eap 于 2026 年 8 月 21 日 00:45–00:57 UTC 出现在 API 流量中,期间 marshmallow-ht-eap 被高频调用 57 次;随后它又以 Custom model 身份出现在 Claude Code 模型列表,带 100 万 Token 超长上下文——这是 Anthropic 公开测试渠道中出现过的最长窗口。

拿到访问权的开发者报告了三件关键事实:其一,两模型在空间推理上强得反常——3D 强化学习与建筑布局任务可以一步到位,重力、拓扑、几何与承重约束在第一次输出时就全部满足;其二,对话自然度优于 7 月 24 日发布、口碑遇冷的旗舰 Opus 5;其三,算力消耗惊人——测试者称它们疯狂吞噬思考 Token,屡次触发 <max-tokens> 上限

泄露细节:代号、流量与首批实测

「食物+EAP」的命名延续了 7 月短暂测试的 claude-horchata-eap 传统。棉花糖综合能力据报略强于甜瓜;两者都在顶级 Fable 之下。目前尚无第一方 API 端点,访问疑似仅限红队与内部测试者——这正是「准备放量」阶段的典型特征。

外界有两种解读:其一,这是 Opus 5.1 的救火版本——针对 Opus 5 的缺陷紧急回炉,用海量思考 Token 强行拔高逻辑天花板;其二,这是新一代 Sonnet / Haiku,一个吸收了新空间能力的更快更省的中端型号。Claude Code 里百万上下文的 Custom model 是一个强烈信号:Anthropic 想让这两款模型在真实编码工作流中被检验,而不只是跑基准。

为什么难:空间推理与思考 Token

空间想象力一直是 LLM 的死穴:3D 房间里桌椅的物理坐标、堆叠物体的重力法则、复杂动线与承重结构的建筑规划——这些长期是语言模型的翻车点。视觉之于早期语言模型,正如空间推理之于前沿模型:这是下一个必须征服的模态,把「文本智能」升级为「世界模型」级别的能力(相关成本机制可参考我们此前的测试时计算成本分析)。

思考 Token 是故事的另一半。这些模型不再是「快嘴」逐字生成,而是先消耗隐形 Token 做深度自我推演、思维链构建与逻辑试错,再给出答案——这与AI 从「找答案」走向「造答案」的数学进展同源:价值正从训练期学到的东西,转移到推理期真正发生的思考,而这份思考按 Token 计费。

产业推演:推理经济与空间前线

若实测属实,两个结构性变化清晰可见。第一,竞争从训练期算力堆叠转向推理期思考消耗。稀缺资源不再是「训练模型的算力」,而是「每次查询允许花掉的推理预算」;定价与延迟都将围绕思考 Token 重构,Agent 工作负载里会出现新的账单项。

第二,空间前线解锁了纯文本够不到的应用层:游戏开发者用自然语言描述「一座中世纪要塞,三个防御塔加一条隐藏地道」,一步拿到 3D 布局;建筑师按地形与光照一次生成几十种结构合规的概念方案;数字孪生、元宇宙、自动驾驶仿真与机器人空间规划全都坐在同一条能力底座上。Anthropic 的节奏同样关键:Opus 5 遇冷、IPO 在即,泄露时机指向一次快速的「复仇发布」——它赌不起一代失败。

行动建议

1. 盯官方端点与公告。两款模型均未确认,公布大概率就在数周内;Custom model 列表出现即内测铺开的信号。

2. 用 Claude Code 的查一下 Custom model 列表——百万上下文入口正是这些版本出现的位置。

3. 现在就把空间任务加进评估集——房间布局、户型、物体摆放类测试;3D 推理将是下一代模型的差异化指标。

4. 给 Agent 工作负载预留思考 Token 预算——推理成本正从训练摊销转向按查询计费,像盯 GPU 工时一样盯 Token 消耗。

5. 为新一轮产品形态做准备。Fable 仍是质量天花板,但一个更快、空间能力更强的中端型号,可能重置编码、数据与 Agent 产品的默认选择。

常见问题(FAQ)

棉花糖和甜瓜是什么?
Anthropic 两款未发布模型的内部代号(claude-marshmallow-eap 与 claude-melon-eap):8 月 21 日先被 API 流量截获,随后以 Custom model 身份出现在 Claude Code,带 100 万 Token 上下文;实测可一步生成 3D 空间布局,对话体验优于 Opus 5,尚未达到 Fable 级。

思考 Token 是什么?
模型在给出最终答案前、用于内部推理的「隐形」Token——思维链构建与逻辑试错都发生在这一步。测试者称两款模型消耗量极大、屡次触顶上限,说明竞争正从训练算力转向推理算力。

这两款模型什么时候正式发布?
官方尚未确认任何信息。外界猜测要么是 Opus 5.1 的救火发布,要么是 Sonnet/Haiku 级迭代;Claude Code 已出现百万上下文的 Custom model,内测显然已在铺开。

发表评论

滚动至顶部