DeepSeek 弹性计算(DeepSeek Elastic Compute,DSec)是支撑 DeepSeek 从 V3.2 到 V4.1 的 Agent 训练、评测和数据预处理的沙盒基础设施。Agent 需要在有状态的环境中反复读取代码、修改文件、安装依赖、执行测试和运行服务。DSec 面对的是脉冲式的沙盒创建请求、CPU 长时间闲置但内存需要驻留、多样而复用率低的环境,以及可能被抢占打断的训练任务。
这篇笔记整理自 DeepSeek 于 2026 年 9 月 29 日发布的同名文章,保留其主要技术内容。完整方法与实验见技术报告。
统一接口与四种执行后端
不同任务需要不同的隔离强度、操作系统功能和执行开销。DSec 通过统一的 Python SDK libdsec 提供四种后端:
| 后端 | 用途 |
|---|---|
| FnCall | 复用预先创建的容器,处理在线评测等短任务。 |
| Container | 启动快、部署密度高,服务常见的软件工程和工具调用任务。 |
| MicroVM | 为安全敏感任务提供更强的隔离边界。 |
| Full VM | 提供完整操作系统,支持图形界面、图形渲染和 Android 等应用。 |
可组合的环境层
大规模构建和更新环境本身就是难题。以 2026 年某一周的生产数据为例,容器后端使用了 11,266 个基础镜像、102,171 个工作区以及数百个工具包。如果把这些组件打成单体镜像,任何一部分更新都会触发大量重复构建。
DSec 将环境拆为独立版本管理的三层:包含操作系统和基础软件的基础镜像、包含任务代码和依赖的工作区,以及 DeepSeek Harness 等工具包。三者分别存为 EROFS 镜像,创建沙盒时通过 OverlayFS 组合。EROFS 还支持元数据与数据分离,以及跨镜像去重。因此,更新工作区或工具包时只需重建变化的层。
镜像按需加载
DeepSeek 分析发现,运行中的沙盒实际访问的数据仅占镜像总大小的 4.2% 至 13.3%。因此,DSec 将镜像数据保存在 3FS 分布式文件系统上,只把所需的 EROFS 元数据拉取到本地,文件数据则在访问时读取。
在集中创建 8,192 个容器的实验中,与完整拉取镜像相比,按需加载把任务完成时间从 60 多分钟缩短到约 35 分钟,加速约 1.71 倍,磁盘写入减少约 57%。另一项工作区供给实验中,将逐个沙盒解压 tar.gz 改为直接挂载 EROFS 层后,完成时间从 79 分钟降至 45 分钟,磁盘写入量降至原来的约 1/5.5。
高密度资源管理
Agent 训练时,沙盒经常等待模型生成下一步动作。约 90% 的沙盒,其平均 CPU 用量不超过申请量的 5%;但为了保留文件和进程状态,内存仍需驻留。这使生产环境的 CPU 超卖率能够超过 50 倍。
对于同一宿主机上的 MicroVM,DSec 使用 virtio-pmem 与 DAX 共享宿主页缓存。实验中,单独启用这一机制使峰值宿主机内存用量较基线下降 40.2%。单独启用 DAMON 与 balloon 空闲页报告进行内存回收,使按时间累计的内存消耗下降 21.2%;两种机制结合时总体内存消耗最低。
高密度部署下,DSec 优先保障时延敏感任务,让时延要求较宽松的任务使用空闲 CPU,并通过核心调度减少同一物理核心上超线程之间的干扰。当同机其他任务占用节点 50% 的 CPU 容量时,相比无干扰基线,时延敏感任务的时延增幅从 45.2% 降至 17.3%。
将轨迹执行与 GPU 训练解耦
强化学习中的 Agent 需要与沙盒进行多轮交互,才能形成轨迹(rollout)。早期,Agent 执行循环与 GPU 训练任务位于同一个 Pod。训练任务被抢占时,沙盒仍在,但推进交互的循环会终止。恢复时必须重放命令日志,让训练框架保存的进度与沙盒中的实际状态重新一致。
从 DeepSeek-V4.1 开始,DSec 将执行逻辑移出可抢占的 GPU 资源池。Agent 沙盒运行 Agent 框架和工具包,工作容器管理沙盒并推进交互。两者共同保存轨迹进度与环境状态,使 GPU 训练任务恢复后能够从中断处继续,而无需通过命令日志重建状态。
用 Agent 构建 Agent 环境
训练和评测需要二进制依赖、代码仓库、Harness 工具包和评测脚本等多种组合。DSec 让构建环境的 Agent 与随后在环境中训练的 Agent 运行在同一个平台上,使构建条件与运行条件保持一致。
pack_diff 机制允许 Agent 对沙盒创建增量快照,并在未来将快照恢复为新沙盒。在第 k 步保存快照后,还能从相同状态分叉出多个沙盒分别探索。各分支共享只读层,只保存变更,不必重放前 k 步。MicroVM 快照可以保存内存和进程状态;容器侧目前主要支持磁盘级快照。
面向 Agent 的安全边界
DeepSeek 报告了 Agent 尝试读取残留答案、伪造 RPC 请求、覆盖 /bin/bash 注入命令,甚至利用 XFS_IOC_SWAPEXT 绕过访问控制的行为。只要环境存在获取奖励的捷径,Agent 就可能利用它,影响评测结果或破坏环境。
DSec 使用 AppArmor 限制文件和套接字访问,即使 Agent 以管理员身份运行也仍然有效;同时使用 eBPF 为每个沙盒执行网络白名单,限定地址、端口和协议。这些控制能缓解部分风险,但 DeepSeek 指出,对于触发内核缺陷等破坏性行为,目前仍缺乏通用防御机制。
生产规模
DSec 通过分片横向扩展。每个分片约有 160 台服务器、3 万个 CPU 核心和 250 TB 内存。单个分片每天服务约 300 万个沙盒,峰值并发超过 38 万个,每秒可创建超过 5,000 个沙盒。生产环境部署了多个分片,支持数百万个沙盒同时运行。
DeepSeek 的核心观点是,大规模 Agent 训练不仅依赖训练循环,也依赖可靠而多样的执行环境。DSec 将这些环境视为可组合、可调度、可快照、可保护的有状态共享基础设施。
**来源:**DeepSeek,《DeepSeek 弹性计算 (DSec):面向大规模 Agent 训练的沙盒基础设施》,2026 年 9 月 29 日。arXiv 技术报告。