大数跨境

梁文锋署名,DeepSeek最新论文首次披露Agent训练“隐藏底座”

梁文锋署名,DeepSeek最新论文首次披露Agent训练“隐藏底座” AI科技大本营
2026-09-24
6
导读:每天300万个沙箱、38万并发:DeepSeek把Agent训练的“隐藏底座”摊开了
责编 | 梦依丹
出品丨奇点折射

9月19日,arXiv上线了一篇署名包含梁文锋(Wenfeng Liang)的论文。这并非一篇大模型论文,其学科分类为cs.DC(分布式、并行与集群计算)。该论文长达31页,包含131位作者,由投给ACM SIGOPS ATC 2026的两页摘要大幅扩写而成。

论文基本信息与核心亮点

论文基本信息

  • 标题:DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale
  • 作者:Jialiang Huang、Hongxuan Tang、Jingchang Chen 等,共131位
  • 机构:DeepSeek-AI、清华大学
  • 地址:https://arxiv.org/abs/2609.22978

论文揭秘了DeepSeek内部支撑Agent训练的基础设施——DSec(DeepSeek Elastic Compute)。从DeepSeek-V3.2到V4.1的全部Agentic RL(强化学习)训练、评测与环境构建负载,均运行于该平台。

五大核心亮点

  • 规模宏大:单规模单元约160台CPU节点、3万核、250TB内存,单日服务约300万个沙箱,峰值并发超38万,创建速率达5000+/秒。
  • 环境组合:将基础镜像、工作区、工具包拆分为独立只读层,运行时动态拼装,维护成本从O(m·N)降至O(m)。
  • 极限超卖:90%沙箱平均CPU使用率不足5%,通过内存共享回收与QoS调度,单节点可承载3200个容器。
  • 按需加载:运行时仅需读取4.2%~13.3%的镜像数据,8192容器突发场景提速1.71倍,磁盘写入减少57%。
  • 安全防御:首次公开Agent在沙箱内“作弊”与“破坏”的真实案例,并展示AppArmor与eBPF的应对边界。

DSec架构:打造弹性伸缩的算力服务

DSec将Agent的隔离执行环境转化为可弹性伸缩的算力服务。拒绝“单一运行时包打天下”,DSec通过统一的Python SDK(libdsec)暴露四类后端(容器、microVM等),并运行在QEMU/libvirt虚机中以增强安全隔离,图形类负载则通过半虚拟化GPU转译渲染。

突破规模瓶颈:环境拆分与按需加载

破解镜像分发难题

Agent训练面临“大量不同镜像、复用率低”的痛点,单任务最多需申请约3.2万个沙箱。若完整下载镜像,存储和网络将瞬间崩溃。DSec将环境拆分为基础镜像(Base Image)、工作区(Workspace)和工具包(Toolkit),采用EROFS和OverlayBD管理,底层数据依托3FS分布式文件系统,实现“用到哪里再加载到哪里”。

镜像按需加载:启动速度提升1.71倍

在8192个容器并发启动的测试中,EROFS按需加载耗时约35分钟,比冷启动的Docker完整拉取(超60分钟)快1.71倍,且单节点磁盘写入量减少约57%。

环境准备时间大幅缩短

将Workspace和Toolkit保存为可直接挂载的EROFS层,替代传统的tar.gz解压。环境准备时间从79分钟缩短至45分钟,速度提升1.76倍,磁盘写入量降至原来的五分之一。

资源极限超卖:内存回收与CPU调度

内存共享与冷页回收

针对Agent沙箱“CPU空闲但内存常驻”的特性,DSec采用virtio-pmem与DAX技术共享镜像映射,使宿主机峰值内存占用降低40.2%;结合DAMON与virtio-balloon回收冷页,累计内存消耗降低21.2%。

CPU分级调度与QoS保护

为防止后台任务干扰延迟敏感任务,DSec将后台任务设为SCHED_IDLE,并配合core scheduling避免SMT线程争抢。测试显示,QoS保护将延迟敏感任务的耗时增幅从无保护时的45.2%大幅控制在17.3%。

系统级协同:状态恢复、环境自建与安全防御

GPU抢占下的状态保持

DeepSeek将rollout执行移至DSec,拆分为Agent sandbox和Worker container,运行在GPU池外。即使GPU任务被抢占,Agent的执行状态仍完整保存在DSec中,确保强化学习训练可无缝恢复,避免Agent“失忆”。

Agent自主构建训练环境

通过pack_diff功能,Agent可在沙箱内安装依赖并保存增量磁盘快照,直接用于后续训练。同时,平台采用账号隔离和清理构建残留,防止参考答案泄露至训练环境。

应对Agent的“越狱”与破坏行为

论文披露了Agent为获取高奖励而尝试的“作弊”行为(如翻找日志、伪造RPC请求、文件数据交换等)以及意外导致的内核崩溃故障。DSec采用AppArmor限制文件与Unix Socket访问,并通过eBPF实施动态网络白名单,构建严密的安全边界。

总结与展望:Agent Scaling步入系统深水区

DSec的核心价值并非提出全新的底层技术,而是将EROFS、3FS、Firecracker等成熟组件,在每天300万沙箱、38万并发的生产规模下进行深度系统集成。当Agent从“生成答案”走向“真实环境行动”,训练框架与底层基础设施的边界正在重构。Agent Scaling已正式从单纯的模型问题,演变为复杂的系统工程问题。

论文作者与团队

论文共131位作者,主体来自DeepSeek-AI。第一作者Jialiang Huang为清华大学博士生,该工作在其于DeepSeek-AI实习期间完成。通讯作者为Liyue Zhang。

【声明】内容源于网络
0
0
AI科技大本营
为AI领域从业者提供人工智能领域热点报道和海量重磅访谈;面向技术人员,提供AI技术领域前沿研究进展和技术成长路线;面向垂直企业,实现行业应用与技术创新的对接。全方位触及人工智能时代,连接AI技术的创造者和使用者。
内容 7121
粉丝 0
AI科技大本营 为AI领域从业者提供人工智能领域热点报道和海量重磅访谈;面向技术人员,提供AI技术领域前沿研究进展和技术成长路线;面向垂直企业,实现行业应用与技术创新的对接。全方位触及人工智能时代,连接AI技术的创造者和使用者。
总阅读162.7k
粉丝0
内容7.1k