近日
DeepSeek团队
在预印本平台arXiv公布论文
《DeepSeek弹性计算(DSec):
面向大规模Agent训练的沙盒基础设施》
首次系统披露
DeepSeek用于大规模
Agent强化学习与评测的
生产级沙盒基础设施DSec
论文信息显示
这篇论文长达31页
作者名单超过130人
DeepSeek创始人梁文锋
位列其中
论文称
随着AI从
“生成Token”走向“执行任务”
大模型公司除GPU、数据之外
开始大规模建设
可交互、可验证、可隔离的
训练环境
也就是“沙盒”
当成千上万个智能体
同时“开工”
难题也从模型本身延伸到了
如何快速、低成本地
提供这些沙盒
DSec是DeepSeek给出的方案
可以将其理解为
一个支撑智能体训练与评测的
计算平台
研究人员可通过统一接口
按任务选择
短时函数调用、容器
微型虚拟机或完整虚拟机
论文介绍
单个训练或评测任务
最多可能一次申请3.2万个沙盒
不同任务所需的
代码、软件依赖和工具
各不相同
如果每开一个沙盒
都重新下载、解压完整镜像
会增加负载
DeepSeek将
基础系统、任务工作区和工具包
拆成可独立更新的部分
创建沙盒时再组合
镜像数据则按需读取
据论文统计
约九成容器和微型虚拟机沙盒的
平均CPU使用量
不超过其申请容量的5%
但它们修改过的文件
和安装的软件仍须保留
DSec通过共享和回收内存
让更多沙盒共用机器
同时保护对响应速度
要求较高的任务
针对智能体的不当行为
DeepSeek认为
没有单一机制能防止
所有智能体不当行为和系统故障
因此
团队采取的方法是
加强可观测性以识别新问题
并随模型演进
持续加固 Dsec
包括限制智能体
通过非预期渠道
获取答案的访问控制
减少对欺骗行为的奖励等
从而解决部分问题
撰文:张晨昊 编辑/排版:李飞 统筹:李政葳
参考:澎湃新闻、第一财经、新浪财经
来源: 世界互联网大会
