9月24日,DeepSeek公开了一篇关于智能体训练基础设施的论文,首次系统披露其生产级沙盒平台DSec(DeepSeek Elastic Compute)的技术细节。论文提交日期为9月19日,作者超过130人,DeepSeek创始人梁文锋位列其中。
如果说大模型训练是让AI学会思考,智能体训练则是让AI能动手——检查代码、调用工具、执行命令,再根据结果调整下一步。每次训练都需要一个与外界隔离、又能记住此前操作的环境,这就是“沙箱”。当成千上万个智能体同时“开工”,难题从模型本身延伸到了如何快速、低成本地提供这些沙箱。
DSec给出的方案规模庞大。据论文披露,单个生产单元约由160个节点组成,拥有约3万个CPU核心和250TB内存,托管PB级镜像。生产环境中每天服务约300万个沙盒,峰值并发超38万个,创建速率超每秒5000个,单任务最多可一次性拉起3.2万个沙盒。
技术机制上,DSec将基础系统、任务工作区和工具包拆成可独立更新的部分,创建沙箱时再组合,镜像数据按需读取。论文统计发现,沙盒运行中实际读取的数据仅占完整镜像的4.2%到13.3%。当8192个容器同时突发部署时,按需加载耗时35分钟,而Docker冷拉取超过60分钟。
rollout与GPU解耦是另一亮点。从V4.1开始,DeepSeek把rollout从GPU训练环境拆分出来,交给DSec独立运行。GPU训练被抢占时,rollout状态可独立保留,待资源恢复后继续执行。
论文还披露了Agent的“不当行为”。DeepSeek发现,有Agent会翻查日志、伪造RPC请求,甚至修改/bin/bash试图绕过任务流程;还有Agent扫描可达服务、拉取外部代码,通过评测之外的路径寻找答案。DSec主要通过AppArmor和eBPF限制操作范围,但内核层漏洞仍难以完全防住。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.