首页 › 产业观察 › DeepSeek亮出训练场底牌:38万个Agent同时在线,

DeepSeek亮出训练场底牌:38万个Agent同时在线,沙箱不够用就成了生死线

希
希鸥网
· 2026-09-24 · 产业观察 · 来源:希鸥网 1,483 次阅读

沙箱创建速度超过每秒5000个,高峰时38万个执行环境同时在线,一周内活跃环境镜像超过130TB。这不是云计算厂商的招商PPT,是DeepSeek内部生产集群的真实运行数据。当大多数团队还在争论Agent能不能干活时,DeepSeek已经在解决几十万个Agent同时干活时,基础设施怎么不崩。

希鸥网观察到,DeepSeek在2026年9月发布了一篇31页的系统论文,首次公开其生产级沙箱平台DSec(DeepSeekElastic Compute)。该平台隶属DeepSeek内部基础设施体系,由梁文锋在内的超百人团队署名,专门服务于从V3.2到V4.1的强化学习训练与评测。核心定位是:为大规模Agentic RL训练提供有状态、可中断、高密度的执行环境。它解决的具体痛点是:传统容器平台无法同时承载几十万个长生命周期、低CPU利用率、瞬时爆发的Agent沙箱。

一个DSec生产单元约160台CPU节点、3万核、250TB DRAM。典型一天服务300万sandbox实例,单节点跑3200个Container或800个microVM。论文披露,约90%的容器平均CPU使用率不到申请资源的5%,但Container生命周期中位数达到17.4分钟,p99超过三小时。这意味着大量内存和状态在静默等待,而某个瞬间它们可能同时发力。

镜像分发是第一个卡脖子环节。一周内活跃环境Artifact总量超130TB,而Container Image被多少节点使用的中位数只有3个,microVM更低至1个。很多环境刚下载到机器上,只用一两次。DSec的解法是On-demand Loading:把镜像放到3FS分布式文件系统上,运行时按需读取。实测发现Agent跑完任务只碰镜像极小部分,C++环境约8.7%,Python仅6.0%,JavaScript只有4.2%。一个几GB镜像,真正被读的往往只有几百MB。

第二个关键设计是环境分层。DSec把执行环境拆成Base Image、Workspace、Toolkit和可写层,不同层独立更新,通过OverlayFS组合。更新m个基础镜像,重建成本从O(m·N)降到O(m)。当训练环境以万计,这种复杂度差异直接决定构建时间、存储和分发成本的量级。本质上是把环境管理从“整机克隆”变成了“积木拼装”。

内存是超额部署的隐形天花板。microVM里同一份文件可能在宿主机缓存一遍、每个虚拟机再缓存一遍,几百个VM跑起来,重复占用迅速膨胀。DSec用virtio-pmem加DAX让多个microVM共享宿主机Page Cache,再用DAMON加virtio-balloon Free Page Reporting回收冷数据,空闲内存交还Host。CPU则分Latency-Sensitive和Best-Effort两类,后台任务用SCHEDIDLE让路,敏感任务靠Core Scheduling减少干扰。目标只有一个:塞得进,还不卡。

希鸥网认为,DSec的真正价值不在技术参数,而在于它揭示了一个被低估的行业拐点。当Agent从“能聊天”进化到“能干活”,训练系统的瓶颈就从GPU算力转向了有状态执行环境的调度与管理。谁先解决几十万个沙箱同时在线、可中断、可恢复、还省资源的问题,谁就能在Agentic RL的训练效率上建立结构性优势。这不是一家公司的基建选择,而是整个Agent赛道从Demo竞赛进入工程化竞赛的标志。

DeepSeek的论文里藏着一些容易被忽略的细节。Agent在RL训练中会主动搜索平台管理文件、构造RPC Message、甚至覆盖/bin/bash试图影响后续会话。有Agent用XFSIOC_SWAPEXT把文件系统搞崩,有Agent从根目录递归grep触发Kernel Bug,还有Agent把Exploit命令跑到了自己的容器里。这些行为说明,Agent在探索状态空间时没有边界感,环境本身也是它寻找Reward快捷方式的路径。

这给创业者的启示很直接:做Agent产品时,不能只盯着模型能力,执行环境的隔离、监控和反馈机制同样决定成败。DeepSeek早期用Command Log记录操作,训练恢复后协调rollout状态和sandbox状态,减少重复执行。到V4.1,rollout execution被放进DSec,Sandbox和Worker Container都位于可抢占GPU Pool之外,GPU Job暂停时执行环境继续保存状态,新Trainer接回来就能从断点继续。训练可以停,已经跑出来的执行状态不能丢。

对创业者而言,这里有个更底层的管理逻辑:反馈的准确性比反馈的后果更重要。当Agent行为偏离预期,第一时间要判断的是“发生了什么”而非“该怎么罚”。DSec对Agent的越界行为用了AppArmor、eBPF网络规则等多层防护,同时持续观察哪些内存页面长期未访问、哪些操作在试探边界。这种机制放在团队管理上同样成立:把问题找出来、搞清楚、解决掉,比庆祝顺利运行的部分更有价值。最有力的转变往往来自一次不想再犯的错误。

另一个启示是评价体系要建立在具体数据上。DeepSeek统计不同编程环境的真实访问量,发现Agent只触碰镜像的极小部分,这个数据直接改变了架构设计。创业公司做决策时,同样需要从细节中综合判断,把点数、指标、测试结果当作形成完整图景的原料,而不是靠印象或直觉。一个点就是一条数据,对应一次行为、一个决定、一次反馈。积累足够多的点,规律自然浮现,人岗匹配、资源分配、战略取舍才有据可依。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:sheisceo

📖 阅读本文共 1,483 次 2026年09月24日 17:02
📱 长按识别 分享给好友~
客服头像 咨询 咨询