DeepSeek发表新论文

光明网 显示图片

近日

DeepSeek团队

在预印本平台arXiv公布论文

《DeepSeek弹性计算(DSec):

面向大规模Agent训练的沙盒基础设施》

首次系统披露

DeepSeek用于大规模

Agent强化学习与评测的

生产级沙盒基础设施DSec

论文信息显示

这篇论文长达31页

作者名单超过130人

DeepSeek创始人梁文锋

位列其中

DeepSeek发表新论文

论文称

随着AI从

“生成Token”走向“执行任务”

大模型公司除GPU、数据之外

开始大规模建设

可交互、可验证、可隔离的

训练环境

也就是“沙盒”

当成千上万个智能体

同时“开工”

难题也从模型本身延伸到了

如何快速、低成本地

提供这些沙盒


DSec是DeepSeek给出的方案

可以将其理解为

一个支撑智能体训练与评测的

计算平台

研究人员可通过统一接口

按任务选择

短时函数调用、容器

微型虚拟机或完整虚拟机


论文介绍

单个训练或评测任务

最多可能一次申请3.2万个沙盒

不同任务所需的

代码、软件依赖和工具

各不相同

如果每开一个沙盒

都重新下载、解压完整镜像

会增加负载

DeepSeek将

基础系统、任务工作区和工具包

拆成可独立更新的部分

创建沙盒时再组合

镜像数据则按需读取


据论文统计

约九成容器和微型虚拟机沙盒的

平均CPU使用量

不超过其申请容量的5%

但它们修改过的文件

和安装的软件仍须保留

DSec通过共享和回收内存

让更多沙盒共用机器

同时保护对响应速度

要求较高的任务


针对智能体的不当行为

DeepSeek认为

没有单一机制能防止

所有智能体不当行为和系统故障

因此

团队采取的方法是

加强可观测性以识别新问题

并随模型演进

持续加固 Dsec

包括限制智能体

通过非预期渠道

获取答案的访问控制

减少对欺骗行为的奖励等

从而解决部分问题


撰文:张晨昊 编辑/排版:李飞 统筹:李政葳

参考:澎湃新闻、第一财经、新浪财经

来源: 世界互联网大会