前阿里千问负责人林俊旸离职后首发长文:从训练模型转向训练智能体

2026-03-27 14:53来源: 澎湃新闻

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  3月26日,原阿里通义千问(Qwen)技术负责人林俊旸(Justin Lin)在社交平台上发布了一篇题为“From ‘Reasoning’ Thinking to‘Agentic’ Thinking(从推理式思考到智能体思考)的文章长文。这是他自本月初从阿里辞职之后发布的第一篇长文。

  在这篇文章中,林俊旸系统性地复盘了推理模型阶段的特征,并探讨了AI未来的发展方向:从训练模型转向训练智能体。

  从“想得更久”到“为了行动而想”

  林俊旸首先区分了两种截然不同的思考范式:推理式思考与智能体式思考。

  推理式思考核心是模型在给出最终答案之前的内部推演质量,即能不能解这道定理,能不能写对代码,能不能通过benchmark(基准测试)。

  OpenAI的o1和DeepSeek-R1代表的正是这一范式,它们证明了在拥有确定性、稳定且能规模化的反馈信号与强大的基础设施支持下,语言模型上的强化学习能带来“质变”级的认知提升。

  但林俊旸认为,现在该问的是下一步:如何实现智能体式思考。这一思考模式的追问的是模型在跟环境打交道的过程中,能不能持续往前走。核心问题从“模型能不能想得够久”变成了“模型能不能用一种撑得起有效行动的方式来想”。

  这意味着,智能体式思考要处理几件纯推理模型无需面对的难题:何时停止思考开始行动?如何选择工具并排序?如何处理残缺的、有噪声的环境反馈?行动失败了如何改计划?如何在长期交互中保持思路不断?

  林俊旸总结,“智能体式思考,就是通过行动来推理。”他预测,智能体式思考将逐渐取代旧式“内部独白式推理”——那种又长又封闭的内部轨迹,试图靠吐出越来越多的文字弥补自己没法跟外界交互的缺陷。哪怕是极难的数学或编程任务,一个真正先进的系统也应该能搜索、能模拟、能执行、能检查、能修订。

  “2025年初,我们千问团队有一个很大的野心:做一个统一的系统,把思考模式和指令模式合二为一。调推理力度可以低、中、高三档。更好的是模型能从提示词和上下文里自动判断该想多久,简单的直接答,难的多花算力。”林俊旸称。

  林俊旸也对探索智能体式思考这一尝试做了复盘。他写道,真正的麻烦不在模型架构,而在数据。

  优秀的指令模型核心优势是直接、简洁、格式合规、低延迟,服务于企业的高吞吐批量任务;而优秀的思考模型,则需要消耗更多的Token、保持连贯的中间推理结构、探索多种解题路径、保留足够内部算力得以显著提升最终正确率。

  但这两种行为特征“天然互斥”,如果融合数据未经精细筛选,最终结果往往两头平庸:“思考”行为变得杂乱、冗杂、决策力不足;“指令”行为不够干脆、可靠性下降、成本超出商用需求。

  因此,2025年下半年,Qwen的2507版本就发了独立的Instruct和Thinking版本。林俊旸认为,真正成功的合并需要一个平滑的推理力度光谱,而非简单的模式开关,这恰恰是GPT的“effort control”机制所指向的方向。

  三项挑战

  向智能体式思考的转型,将带来三个层面的全新挑战。

  首先是基础设施的重构。林俊旸指出,在智能体强化学习中,模型不再孤立,而是嵌入在一个庞大的“Harness”(集成框架)里,包含工具服务器、浏览器、终端、搜索引擎、模拟器、沙盒、API 层、记忆系统、编排框架等。训练和推理必须更彻底地“解耦”,否则采样吞吐量会急剧下降。他直言,这已经不是一个建模问题,而是一个系统工程问题。

  其次,环境本身成为一项研究对象。在SFT(监督微调)时代,行业执着于数据多样性;在智能体时代,应该执着于“环境质量”——稳定性、真实性、状态丰富度、抗模型“钻空子”的能力。林俊旸表示,环境构建已从副业开始,逐渐成为一个真实的创业方向,而非边角料项目。

  最棘手的挑战则是reward hacking(奖励破译)。林俊旸称,模型一旦获得调用工具的权限,作弊就变得容易得多:有搜索能力的模型可能在RL训练时直接去查答案,编程Agent可能利用代码仓库的漏洞走捷径。环境里藏着漏洞的话,策略看起来超强,其实是学会了作弊。他认为,未来真正卡脖子的研究瓶颈,将来自环境设计、评估器的鲁棒性、反作弊机制。

  智能体式思考也意味着harness(集成框架)工程。林俊旸认为,核心智能会越来越取决于多个智能体怎么组织:一个协调者来规划任务、分派工作,几个专业智能体充当领域专家,还有一些子智能体执行具体任务,同时帮忙管好上下文、防止信息污染、保持不同层级推理之间的隔离。

  对于竞争优势,林俊旸给出了自己的判断:智能体时代拼的是更好的环境、更紧的训推耦合、更强的harness工程,以及能不能把模型的决策和决策的后果真正串成一个闭环。

  未来是从训练模型走向训练智能体、训练智能体系统的时代,林俊旸写道。

  公开资料显示,林俊旸出生于1993年,是阿里巴巴最年轻的P10级技术负责人。林俊旸本科就读北京大学计算机科学专业,硕士阶段在北京大学外国语学院完成,学习语言学与应用语言学。2019年毕业后,林俊旸加入阿里巴巴达摩院,正式开启职业生涯,担任高级算法工程师。

  2022年底,阿里巴巴将达摩院的语言、视觉等AI团队整体并入阿里云,成立通义实验室。林俊旸被正式任命为通义千问系列大模型的技术负责人。作为Qwen的“代言人”,林俊旸曾负责所有模型发布、基准测试、社区互动,还在2025年亲自组建机器人与具身智能团队,并被视为坚定的开源倡导者。

  作者:澎湃新闻记者 喻琰

[责任编辑: ]
阅读剩余全文(
为你推荐
5月18日,在湖北省荆州市沙市区王板桥社区,救援人员转移受灾群众。目前,荆州已在中心城区采取停工、停产、停业、停运、停课“五停”措施,并迅速开展抢险救灾工作。目前,荆州已在中心城区采取停工、停产、停业、停运、停课“五停”措施,并迅速开展抢险救灾工作。
19
5月18日,在浙江省湖州市德清县的杭德市域铁路跨东苕溪斜拉桥段铺轨施工现场,中铁十一局工人对正线最后一节轨排进行扣件紧固作业。5月18日,随着由中铁十一局参建的杭州至德清市域铁路Ⅱ标段最后一节轨排连接成功,杭德市域铁路全线轨道贯通,为线路按期开通运营奠定坚实基础。
19
十二届自贡国际恐龙灯会——自贡彩灯交易大会日前在四川自贡举行。5月14日拍摄的四川自贡中华彩灯大世界一景。新华社发  贴合大众年轻化、潮流化的消费偏好,自贡彩灯企业跳出传统灯会的单一模式,持续跨界创新,让古老彩灯适配多元夜游新场景。
19
2026年国际博物馆日即将到来,各地迎来博物馆参观游览热潮。2026年国际博物馆日即将到来,各地迎来博物馆参观游览热潮。2026年国际博物馆日即将到来,各地迎来博物馆参观游览热潮。
18
5月17日22时42分,在海南商业航天发射场,长征八号运载火箭将千帆星座第9批组网卫星顺利送入预定轨道,所有卫星状态正常,发射任务获得圆满成功。
18
贵州省安顺市西秀区七眼桥镇章庄村吴家屯的村民排练地戏前在一起交流(5月13日摄)。安顺地戏是流行于贵州安顺市的一种民间戏剧,以表演古朴粗犷著称,被誉为“中国戏剧活化石”。
18
自5月10日起,北京地铁在6号线、17号线、昌平线、S1线等4条线路的11座车站开展“轨道+骑行”试点服务。自5月10日起,北京地铁在6号线、17号线、昌平线、S1线等4条线路的11座车站开展“轨道+骑行”试点服务。
17
5月12日,龙门石窟研究院石窟保护研究与遗产监测团队成员芮子航(左)与李培君在龙门石窟研究院文物科技保护中心修复文物。
17
位于中沙群岛东南部的黄岩岛拥有结构复杂的珊瑚礁生态系统。2025年9月,我国设立黄岩岛国家级自然保护区,中国海警在黄岩岛海域开展常态化巡航执法,进一步提升黄岩岛珊瑚礁生态系统的多样性、稳定性和持续性,守护这片珍贵的生态家园。
17
5月15日,在合湛高铁广西段南康东干渠特大桥箱梁架设现场,运梁车向工地运送箱梁(无人机照片)。5月15日,在合浦至湛江高速铁路广西段南康东干渠特大桥箱梁架设现场,全线首榀箱梁架设成功,标志着项目建设进入新阶段。
16
载入更多资讯
返回
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮