责编 | 梦依丹 出品丨奇点折射(ID:rgznai100) 9 月 19 日,arXiv 上出现一篇署名包含梁文锋(Wenfeng Liang)的论文。 这不是一篇模型论文。它的学科分类是 cs.DC(分布式、并行与集群计算) ,不是 cs.LG 或 cs.AI。31 页、13 张图、131 位作者。前身是投给 ACM SIGOPS ATC 2026 操作系统方向(OSC Track) 的两页 extended abstract,已通过首轮评审,本次是大幅扩写后的完整版。 论文基本信息 标题:DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale 作者:Jialiang Huang、Hongxuan Tang、Jingchang Chen 等,共 131 位 机构:DeepSeek-AI、清华大学 地址:https://arxiv.org/abs/2609.22978 论文讲的是 DeepSeek 内部支撑 Agent 训练的那层「地基」—— DSec(DeepSeek Elastic Compute) ,一个生产级沙箱平台。 论文明确写了:从 DeepSeek-V3.2 到 V4.1 的全部 Agentic RL 训练、评测与环境构建负载,都跑在它上面。 这篇论文把长期被当成「黑盒」的 Agent 执行环境,做成了一套与强化学习框架协同设计的生产级平台。 核心亮点,五句话: 规模:一个规模单元约 160 台 CPU 节点、3 万核、250 TB 内存,单日服务约 300 万沙箱,峰值并发 38 万+,创建速率 5000+/秒; 环境组合:把基础镜像、工作区、工具包拆成独立版本化的只读层,运行时拼装,维护成本从 O(m·N) 降到 O(m)——改 dockerd 只用了 30 行 Go; 极限超卖:90% 的沙箱平均 CPU 用不到 5%,却能靠内存共享回收(峰值内存 −40.2%)和 QoS 调度(延迟膨胀 45.2% → 17.3%)把单节点压到 3200 个容器; 镜像按需加载:运行时只读到镜像数据的 4.2%~13.3%,于是干脆不整包拉——8192 容器突发场景提速 1.71×,磁盘写少 57%; 直面现实:首次公开 Agent 在沙箱里"抄答案"和"搞破坏"的真实案例(伪造 RPC、翻日志、用 ioctl 换 extent 映射),以及 AppArmor + eBPF 的应对边界。 当行业都在卷模型能力和 Agent 框架时,DeepSeek 用 31 页讲了一件更朴素的事——Agent 的上限,很大程度上由它脚下那层沙箱决定。 DSec 是什么? 一句话概括就是把 Agent 需要的隔离执行环境,做成一种可弹性伸缩的「算力服务」。 没有一种沙箱,能适合所有 Agent 任务。 于是 DSec 首先拒绝了「一种运行时包打天下」的思路。它通过统一 SDK 暴露四类后端,但仍让调用方根据任务选择合适的执行环境。 论文把它拆成四种沙箱后端,用一个统一的 Python SDK(libdsec)暴露出去: 有意思的是, 容器和 microVM 并不直接跑在裸机上,而是跑在 QEMU/libvirt 虚机里 ,多一层隔离内核和网络栈,作为不可信容器与裸金属之间的额外安全边界。图形类负载则走宿主 hypervisor 的半虚拟化 GPU(virtio-gpu),并通过 DXVK 这类兼容层转译渲染栈。 论文也很诚实地说:libdsec 不是一个语义上的统一抽象。四类后端的启动成本、隔离边界、文件系统语义、OS 能力都不一样,选哪个仍然是调用方的责任。 从 Agent 模型到 Agent 基础设施,系统问题正在回到舞台中央 2026 奇点智能技术大会将于 11 月20—21日在北京万达文华酒店举行,并与 C++ 及系统软件技术大会同期举办。 大会围绕 Agent 训练与执行环境、推理引擎、KV Cache、AI 编译器、调度系统和工程治理等问题,邀请一线研究者与工程实践者分享真实经验。 扫码免费领取大会 PPT 与 Agent 实战资料 真正难的不是启动沙箱,而是同时“供给”几万个沙箱 Agentic RL的流量不是平滑到来的。 据论文统计显示,一个训练任务最多可以一次申请约 3.2 万个沙箱。这些沙箱还不是复制同一个环境:不同任务可能依赖不同的代码仓库、操作系统、编译器、工具链和软件版本。 在论文统计的一周生产数据中,活跃环境资产超过 130TB。更麻烦的是,很多镜像只会被少数任务使用,单个镜像的复用率并不高。 这与传统云计算的镜像分发逻辑正好相反。 云平台通常面对的是“少量热门镜像,被大

about image