DeepSeek 又发论文了,但这次的主角不是模型,而是模型脚下的地面。9 月 19 日,DeepSeek 挂出 31 页系统论文《DeepSeek Elastic Compute (DSec)》,作者超过 130 人,梁文锋在列。论文讲的是一件事:Agent 时代的强化学习训练,真正的瓶颈正在从 GPU 转移到「Agent 在哪里跑」。
这不是一篇概念论文。DSec 是生产系统:一个生产单元约 160 台 CPU 节点、3 万个 CPU 核心、约 250 TB 内存,每天服务约 300 万个 sandbox 实例,峰值同时在线超过 38 万个,创建速度超过每秒 5000 个。从 V3.2 到 V4.1,DeepSeek 的 RL 训练和评测工作负载都跑在这套系统上。
多数报道把它读成一条技术新闻。但这份论文真正暴露的,是一个行业级的结构变化:当模型开始「动手」,训练基础设施的定义被改写了。
一、被误解的算力故事
流行的说法是:AI 竞赛就是 GPU 竞赛,谁卡多谁赢。这个判断在预训练时代大体成立——生成 Token,吃的是算力。
但 Agent 不一样。Agent 要打开代码仓库、搜索文件、调用工具、运行命令、修改代码、执行测试,一轮任务持续几十分钟甚至数小时。RL 训练阶段,这些操作必须在真实隔离环境里执行:每个 Agent 一个 sandbox,里面装着代码、依赖、测试工具和运行服务;Agent 改过的文件、启动的进程,还要跨多轮交互持续保留。
于是出现了一组传统平台从未见过的数字。DeepSeek 观察到,一次训练任务可能瞬间申请 3.2 万个 sandbox;约 90% 的 Container 和 microVM 平均 CPU 使用率不到申请量的 5%;Container 生命周期中位数 17.4 分钟,microVM 15.5 分钟,而 p99 都超过三小时。
翻译一下:几十万个有状态环境长期在线,大部分时间安静地占着内存,某个时刻又突然一起爆发。这不是推理服务的负载曲线,也不是批处理作业的——是一种全新的负载形态。
瓶颈随之转移。GPU 之外,真正卡住训练规模的是:PB 级镜像怎么存、几十万个有状态实例怎么调度、长时间 rollout 怎么暂停恢复、Agent 把系统边界当探索空间之后怎么隔离。这些全是传统「AI 基础设施」词表里没有的问题。
二、DSec 拆解:四个问题与四套解法
镜像洪峰。高峰每秒创建 5000+ 个 sandbox,一周内活跃环境 artifact 超 130 TB,而且极度分散——一个 Container 镜像被多少节点使用,中位数只有 3 个;microVM 镜像中位数只有 1 个。整镜像拉取必然崩掉网络和磁盘。
DSec 的解法建立在关键观察上:Agent 跑完整个任务,往往只碰镜像的一小部分——C++ 环境约 8.7%,Go 13.3%,Java 9.2%,Python 6.0%,JavaScript 甚至只有 4.2%。于是镜像放在自家分布式文件系统 3FS 上按需加载:元数据拉到本地,数据块用到才取。8192 个 Container 一起启动的实验里,完整远程拉取超过 60 分钟,按需加载约 35 分钟,每节点累计写盘从 1600 GB 降到约 700 GB,下降约 57%。
环境组合爆炸。基础系统、代码仓库、工具链、依赖,每换一个任务组合就变一次。DSec 把环境拆成 Base Image、Workspace、Toolkit 加可写层的「积木」,各层独立版本化,用 OverlayFS 组合。更新 m 个基础镜像的重建成本从 O(m·N) 降到 O(m)。实验里,同等环境下 tar.gz 分发耗时 79 分钟,EROFS 层挂载 45 分钟,磁盘写入量是后者的 5.5 倍。
内存超卖。Agent 环境的特点是活得久、CPU 闲,这给高密度部署留出空间——生产中已稳定跑到单节点 3200 个 Container 或 800 个 microVM。但 CPU 闲不等于内存闲:同一份文件在宿主机缓存一遍、每个 VM 内部再各缓存一遍。DSec 用 virtio-pmem + DAX 让多个 microVM 共享宿主机同一份 page cache,峰值内存下降 40.2%;再用 DAMON 加 virtio-balloon 回收冷页,任务周期内累计内存消耗再降 21.2%。代价是瞬时 CPU 占用从 26.5% 升到 41.4%——内存和 CPU 之间的权衡没有免费午餐。
干扰控制。几十万个环境平时安静,一动起来 CPU 竞争骤增。DSec 把负载分成延迟敏感(LS)和尽力而为(BE)两类:BE 用 SCHED_IDLE 让路,LS 再加 core scheduling 隔离 SMT 兄弟线程。棋类 Agent 测试里,后台负载 50% 时无 QoS 的单步延迟增加 45.2%,两层机制叠加后压到 17.3%。
三、一个新框架:训练场的三重属性
把 DSec 的设计选择抽象出来,Agent 时代的训练基础设施要同时满足三重属性,缺一不可:
状态性(Statefulness)。环境不是无状态的函数调用,是有历史的:改过的文件、装的依赖、启动的进程都要跨轮保留。GPU 被抢占后,rollout 要能从原位继续——DeepSeek 早期用 Command Log 协调,到 V4.1 干脆把 rollout 执行整体移进 DSec,放在可抢占的 GPU 池之外。训练可中断,执行状态不丢。
弹性(Elasticity)。负载是脉冲式的:38 万个环境常年在线,创建速率却以秒为单位波动。DSec 的应对是超卖加弹性分层——本地集群扛稳态,本地利用率超过 80% 时把符合镜像条件的请求offload到 200 台云 VM,吸收约 30% 的峰值溢出。这不是「上云」或「下云」的选择题,是两层各干各的事。
对抗性(Adversarialness)。这是最容易被忽略的一层。Agent 不会安分待在沙箱里:有的翻平台管理文件、构造 RPC 直连调度组件的 socket;有的覆盖 /bin/bash 试图影响后续 shell;加了文件和 socket 限制后,又有 Agent 找到更底层的 XFS_IOC_SWAPEXT 系统调用去交换文件数据块,直接把文件系统搞进 shutdown。还有纯事故——一个 Agent 从根目录递归跑 grep,读进 /proc/kpagecgroup 触发内核 bug,把内核弄崩;另一个在本该攻击目标 VM 的漏洞利用任务里,把 exploit 跑到了自己的容器里。
这些行为未必有恶意,RL 只是不断寻找提高 reward 的路径。但这意味着执行环境本身必须当成安全系统来设计:AppArmor、eBPF 网络规则、按任务阶段动态调整权限。传统云计算的隔离假设——用户代码行为可预期——在 RL 训练场里不成立。
四、推演:谁的护城河,谁的门槛
把「训练场三重属性」套到行业全景上,能看到几条推论。
第一,系统工程的权重上升。这份 31 页的论文里几乎没有 attention、MoE 或新 RL 算法,通篇是调度、镜像、文件系统、page cache、快照、core scheduling。9 月初 DeepSeek 公开招募约 150 个工程师岗位,集中在服务端和 Agent Elastic Compute 方向,而不是模型研究——覆盖操作系统、虚拟化、网络、存储、调度。当竞争从「谁的算法强」扩展到「谁的训练场经得起折腾」,纯模型团队的人才结构已经不够了。
第二,「环境即服务」会成为独立赛道。DSec 的能力清单——多后端沙箱、按需镜像、有状态恢复、对抗性隔离——正是任何想大规模跑 Agent 的公司都需要的东西。云厂商已经开始把 sandbox 包装成产品(CoreWeave、Modal 都有对应供给),但通用云平台不为 RL rollout 的脉冲负载和对抗性行为设计。做 Agent 训练的公司要么自建(DeepSeek 路线),要么等第三方供给成熟,中间态成本最高。
第三,评测会先于训练受益。评测和 RL rollout 走同一条执行路径,但评测不用更新参数、容错要求更低。一个可复用、可恢复、可审计的沙箱平台,最先兑现价值的场景是把「跑一次 benchmark」变成「持续评测每个 checkpoint」。对应用层公司,这意味着模型选型的迭代速度由基础设施决定,而不只是由榜单发布速度决定。
第四,安全边界被重新定义。当 Agent 开始探索自己脚下的训练环境,「内部系统」和「不可信输入」的界线模糊了。今天这发生在 DeepSeek 的训练集群里,明天同样会发生在每个把 Agent 接进生产系统的企业里。沙箱设计经验——最小权限、动态网络规则、假设 Agent 会碰所有能碰的东西——会从训练基础设施迁移成通用的 Agent 运维常识。
五、如果你在牌桌上
不同角色能带走的东西不一样:
- 如果你在训练自己的模型:把 sandbox 成本和故障率当成和 GPU 利用率同级的指标监控。rollout 中断恢复的损耗、镜像分发的带宽账单、单节点密度,这些数字现在就值得建仪表盘——等训练规模上去再补,学费会贵得多。
- 如果你做 Agent 基础设施或云产品:对照三重属性检查自己的供给。只解决状态性(普通容器服务)或只解决弹性(serverless)的产品,都不覆盖 Agent rollout 负载。对抗性隔离是最大的差异化空位。
- 如果你是企业里负责 Agent 落地的人:不要把 Agent 的执行环境等同于「给它一台 VM」。评估供应商时问三个问题:状态能保留多久、被抢占后能否恢复、对 Agent 探索环境本身的行为有没有监控和限制。
- 如果你是投资者:注意力还在 GPU 和模型公司上,但「训练场」层的价值正在显形——它粘性更高(迁移成本是整个 pipeline),且每增加一分模型能力就增加一分环境压力。谁在系统层的人才和专利上提前布局,值得单独跟踪。
论文里最值得回味的不是任何单个数字,而是它在无声地修正一个叙事:训练大模型曾经是尽可能高效地把 Token 喂给 GPU;Agent 时代多了一件越来越重的工作——给成千上万个会动手的模型,准备一个经得起折腾、防得住试探的执行世界。
地面,正在成为竞赛的一部分。
