国产大模型公司DeepSeek(深度求索)披露最新智能体(Agent)训练基础设施论文。 论文首页截图 近日,DeepSeek在预印本平台arXiv公布论文《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》,首次系统披露DeepSeek用于大规模Agent强化学习(RL)与评测的生产级沙盒基础设施DSec:随着AI从“生成Token”走向“执行任务”,大模型公司除GPU、数据之外,开始大规模建设可交互、可验证、可隔离的训练环境。 这篇论文提交日期是9月19日,作者名单超过130人,DeepSeek创始人梁文锋位列最后一位。 论文详细介绍了DeepSeek Elastic Compute(DSec)。这是一套为大规模Agent训练和评测设计的生产级沙盒平台,可以在集群中统一调度和管理大量沙盒,并根据不同任务快速组合所需的软件、数据和运行环境,同时通过镜像共享、内存回收和CPU调度等方式提高资源利用效率。DSec还与DeepSeek强化学习(RL)框架协同设计,将Agent有状态的任务执行与可抢占的GPU训练解耦。也就是说,即使GPU训练任务被暂停或重新调度,Agent已经执行到一半的任务状态仍然可以保留下来,待GPU资源恢复后继续执行。 通俗而言,可以把DSec理解为一个专门给AI智能体训练用的“超大共享教室调度系统”:它能同时开几十万个隔离的小房间给AI跑代码,用乐高积木的方式快速搭环境,用共享书架的方式省存储空间,还能在GPU被抢的时候把教室打包封存、等GPU回来了再接着用,同时防止AI在教室里搞破坏。 据了解,单个生产级DSec规模单元约由160个节点组成,拥有约3万个CPU核心和250TB内存,生产环境中每天服务约300万个沙盒,峰值支持同时运行超38万个沙盒,并维持每秒超过5000个沙盒的创建速率。论文并未披露具体DSec的数量。 论文介绍,传统大模型训练主要围绕数据、GPU计算和Token生成展开,而Agent(智能体)训练则需要模型持续与真实执行环境交互。 以Coding Agent(编程智能体)为例,它可能需要读取代码库、修改文件、安装依赖、执行Shell命令、运行测试、读取报错,再继续决策。 随着训练规模的不断扩大,单靠人工很难构建大量训练环境。根据论文介绍,DeepSeek正在建立内部流程,让Agent自动构建的环境,并进行检查,再投入RL和评测。由此形成“Agent构建环境--新Agent在环境中训练--更强Agent继续构建更多环境”的生产闭环。 值得一提的是,论文中还提到如今Agent会主动寻找漏洞和“作弊”。在训练中,DeepSeek发现Agent可能没有按照预期方式解决任务,而是寻找意外的信息通道获取答案;另一些行为则会直接破坏运行环境。随着Agent能力增强,“防作弊”和行为约束本身正在成为Agent训练基础设施的一部分。大规模Agent训练不仅需要隔离恶意或投机行为,还要处理模型普通操作错误可能造成的系统级故障。 在这篇最新技术论文中,DSec展示了一套面向大规模Agent训练的基础设施方案。从沙盒创建、环境复用,到rollout调度、状态保存和安全隔离,Agent训练正在形成一套独立的基础设施需求。随着Agent任务持续变长、交互过程不断增加,执行环境的规模也会进一步扩大。如何让数十万个甚至更多沙盒稳定运行,同时控制资源成本和安全风险,将成为Agent训练继续扩展需要解决的问题。 特别

about image