杨植麟再访:AI逃离“缸中之脑”,迈向智能体与自进化之路
Kimi创始人杨植麟在K2发布后的第二次深度访谈,系统阐述AI如何通过长思考推理与多轮智能体强化学习突破封闭认知,走向无限进化的雪峰。
概述
2025年7月,月之暗面(Moonshot AI)发布开源编码与智能体大模型Kimi K2后,创始人杨植麟接受了第二次深度专访。此次对话围绕三个核心范式变迁展开:从“缸中之脑”(brain in a vat)式的纯粹推理,到多轮智能体强化学习所代表的与外部世界交互;从预训练 + 监督微调(SFT)的研发范式,转向预训练 + 强化学习(RL)并以此驱动智能体能力的范式;以及模型公司从依赖第三方脚手架“逆向工程”模型能力,转向构建“第一方智能体产品”的研发逻辑。访谈同时系统拆解了OpenAI L1‑L5框架的内在依赖关系,指出推理(Reasoner)与智能体(Agent)是解锁创新(Innovator)与组织(Organizer)阶段的前提,而AGI并非单一阶梯,而是一个不断爬升的方向。杨植麟借用物理学家大卫·多伊奇《无穷的开始》的哲学隐喻——“问题是不可避免的,问题是可解决的”——将人工智能研发视为永无顶峰的无尽雪山,追求的是攀登本身。
背景与问题
本次访谈发生在一个特殊的时点。距首次访谈一年半,期间基础模型赛道经历了剧烈的舆论起伏与能力飞跃。DeepSeek在2025年初达到全球峰值声望,而杨植麟本人几乎停止公开露面,在内部仅将飞书签名加上“时间的朋友”。K2的发布让公司重回公众视野,该模型被《自然》杂志称为“另一个DeepSeek时刻”。K2基于混合专家(MoE)架构,其核心突破在于通过编码能力让模型离开“缸中之脑”,长出“手”,能够操作外部数字世界,完成长达数小时的复杂端到端任务。
外部环境的变化映射出两个关键研究问题:
- 大模型如何从封闭的推理环境过渡到多轮、多工具的交互式任务执行?
- 模型公司如何构建可持续的研发范式,使模型不仅能使用工具,更能参与自身迭代(自进化),并最终形成可泛化的多智能体系统?
杨植麟在访谈中就此给出了技术判断与路线图。
核心内容解析
1. 从“缸中之脑”到世界交互:两种推理范式
杨植麟区分了当前两种关键的推理扩展方式,二者共同指向测试时扩展(test‑time scaling),即在预测阶段通过增加计算量与生成token数来完成更复杂的任务。
-
长思维推理(long‑thinking reasoning):以o1为代表,模型在回答前进行内部反思,不断提出猜想并自我验证,将原本需要多次采样(Pass@k)才能得到的正确解浓缩为单次通过(Pass@1)。这一过程本质上是线性的串行采样,但可通过并行采样混合提升效率。杨植麟指出,虽然看起来是“自由探索”,但实际运作趋于线性——每次猜想建立在前序猜想(甚至是被否决的猜想)之上。该范式仍属于“缸中之脑”:模型不与外界互动,仅凭内部思维解决问题。
-
多轮智能体强化学习(agent RL):模型在行动的同时思考,调用搜索引擎、浏览器、代码执行器等外部工具,根据环境反馈更新状态,在多轮交互中完成任务。这是模型从“颅内思考”向“手脑并用”的跃迁。K2正是通过这种范式呈现了克隆代码仓库、跨语言翻译、调试、测试等端到端编码能力,整个过程无需人类干预,时间跨度可达数小时。
两种范式的共同本质是在推理时扩展token数量:前者通过增加单轮思考token,后者通过增加交互轮次与工具调用,最终支撑起复杂、开放式的任务。
2. 研发范式迁移:从SFT到RL,从对话到智能体
访谈透露了Kimi内部研发重心的明确转向:
- 技术主线:从以预训练 + 监督微调(SFT)为中心的范式,切换至预训练 + 强化学习(RL)。这要求团队能力结构与研发流程的全面重塑。
- 产品形态:从纯对话(Chat)向智能体(Agent)演进。K1.5验证了RL技术栈,特别是端到端奖励信号的有效性。团队发现,无需过程奖励(process reward)或价值函数,直接用结果奖励训练即可,这些复杂机制反而可能引入副作用。这为后续K2的智能体RL训练扫清了路线。
3. 第一方产品 vs. 第三方脚手架:模型公司的新逻辑
杨植麟对比了两种开发范式:
- 第三方脚手架模式:基于模型已有的溢出能力,通过逆向工程猜测其训练环境中的工具、系统提示与上下文工程,搭建产品(例如Manus)。本质是拟合模型训练分布。
- 第一方智能体产品模式:从正向设计工具与环境,再在相同环境中端到端训练模型,使模型在该环境中获得天然的性能优势。工具和模型可以协同优化:模型表现不佳时,可调整工具设计并重新训练,形成更高的集成上限。
他认为,第一方产品拥有更高的天花板,但Kimi目前的投入仍以模型为主线,只是将这一趋势视为重要变量。
4. L1‑L5框架的重新审视:非线性跃迁与自进化之门
针对OpenAI定义的Chatbot → Reasoner → Agent → Innovator → Organizer五级跃迁,杨植麟给出了非教条式的解读:
- 推理与智能体并非严格的串行依赖。Claude的路径便是先做Agent再做狭义推理,技术路线选择造成短期分化,但若要攀向更高峰,二者终需兼备。
- 智能体能力是解锁创新(L4)的关键。只有当模型能参与模型自身的研发——提出新想法、运行实验、分析结果、迭代优化——才能进入创新阶段。K2被期望参与K3的开发。
- 组织(L5)与创新可能并行发生。L5可理解为多智能体系统:从一个智能体分叉出多个并行或串行的子智能体,分别负责代码、测试、文档、架构等分工。但如何端到端训练出泛化性强的多智能体系统,仍是巨大挑战。
- AGI不是某个阶梯上的瞬间,而是一个方向。技术上许多子领域已超过99%人类,但技术对社会结构的重塑(如蒸汽机般需要数十年消化)同样是AGI的组成部分。杨植麟比喻:公司的名字“Moonshot”(登月)与AI的差异在于,登月有“站上月球即可宣告成功”的时刻,而AI则永远在不断攀爬的路上,甚至将来可能是“你使用AI去攀登”。
5. 无限山峰的攀登哲学
杨植麟反复阅读《无穷的开始》,将两句铭文“问题是不可避免的,问题是可解决的”转化为研发信仰。在他看来,人类文明从静态走向动态,科学知识的边界不断扩张,每解决一个问题就产生新问题。AI的技术发展正处于完全相同的状态:RL解决后遇到评估与验证难题,验证问题解决后又会有新挑战。“也许有一天我们会发现这座雪山根本没有顶峰——我不知道——我希望它永远没有。”
关键概念与机制
以下对访谈中涉及的核心机制进行结构化拆解。
| 概念 | 定义与机制 | 典型表现 |
|---|---|---|
| 长思考推理 (Long-Thinking Reasoning) | 模型在输出最终答案前,多次生成中间思考token,提出猜想并自我验证,实现Pass@k→Pass@1的转化。目前方法以串行采样为主,也可混合并行。 | o1风格模型;无需外部工具,完全内部推理。 |
| 智能体强化学习 (Agent RL) | 模型在多轮交互中执行操作(搜索、浏览、代码编写),每轮获得环境反馈,用于指导下一步决策,最终完成端到端任务。训练时模型与工具环境耦合。 | Kimi K2克隆、翻译、调试并测试代码仓库。 |
| 测试时扩展 (Test‑time Scaling) | 通过增加预测时生成的token总数(思考token + 交互轮次)来提升任务解决能力,本质是用更多算力换取更复杂的任务表现。 | 模型独立工作数小时,无需人类介入。 |
| 端到端奖励信号训练 | 不使用过程奖励或价值函数,只根据最终结果给予奖励,通过RL直接优化模型。Kim1.5实验表明该方法更稳定,避免中间奖励引入的偏差。 | K1.5在推理任务上对齐o1时,未使用过程监督。 |
| 第一方产品范式 | 先正向设计工具与上下文工程方案,再在同一环境中训练模型,使模型天然适配该环境,并可与工具协同迭代。 | Anthropic的Claude Code、OpenAI的ChatGPT Agent。 |
| 自进化回路 | 智能体能力使模型参与自身开发(提出实验、分析结果、优化超参或架构),从而进入OpenAI L4创新阶段。 | K2用于处理数据、分析模型、训练流程。 |
优势、局限与适用场景
优势
- 能力边界突破:从单轮对话到多轮交互、从文本生成到实际操作数字世界,打开了编程、科研、复杂工作流等应用场景。
- 长时自主作业:测试时扩展使得数小时的端到端任务成为可能,极大降低了人类监督成本。
- 第一方集成潜力:模型与工具协同训练可避免分布漂移,提高复杂场景下的可靠性。
- 开源与生态:K2以开源MoE架构推出,有望复现“DeepSeek时刻”的生态效应,促进社区二次开发。
局限与风险
- 评估与验证难题:对于开放式端到端任务,如何定义有效的自动评估指标仍无万全之策。模型的自我进化若缺乏可靠验证,可能走向不可控的行为漂移。
- 多智能体泛化挑战:训练多智能体系统时,极易过拟合于特定任务分工,难以泛化到未见的协作结构。
- 长期消化周期:技术影响力与人类社会的融合需要数十年,过早宣称某一阶段“已完成”可能掩盖大量未解决的边缘问题。
- 路径依赖风险:虽然推理与智能体可并行,但若某一方向投资过度而忽视另一方向,可能陷入局部最优。Kimi当前重心在模型,第一方产品投入尚小,可能限制产品化速度。
适用场景
- 复杂软件工程:代码仓库级别的翻译、重构、调试、测试自动化。
- 科研辅助:实验设计、结果分析与迭代优化,成为研究员的“放大器”。
- 多步骤业务流程:需串联搜索、数据查询、格式转换、报告生成的混合任务。
- 模型预研与自改进:利用智能体能力参与下一代模型的研发,形成闭环创新。
关键要点总结
- 范式双引擎:长思考推理(内部思维扩展)与多轮智能体强化学习(外部交互扩展)共同构成测试时扩展的基石,二者缺一不可,是通向更高级智能的必经之路。
- 研发重心转移:从SFT转向RL,从对话转向Agent,K1.5验证了端到端奖励信号的可行性,K2实现了从“缸中之脑”到“手脑并用”的工程落地。
- 产品逻辑演变:第一方产品模式通过正向设计工具与环境并联合训练,有望获得比逆向工程式脚手架更高的集成度和性能上限。
- L4/L5的前提是L3:智能体能力是让模型参与自身迭代(创新)和组织多智能体系统(组织)的关键锁钥,推理与智能体可交叉推进,但终需齐备。
- AGI非一步登顶:无绝对终点,更多维度上已超人类,但社会层面的消化与重塑是AGI的长期维度;追求的是持续攀登的过程本身。
- 哲学底色:“问题是不可避免的,问题是可解决的”贯穿创业与技术决策,将技术挑战转化为可解的问题,再从中衍生新的探索,构成无限进化的雪山攀登。
参考资料
- 访谈源推文(包含内容摘要与链接索引):https://x.com/zhang_benita/status/2079758352213762367
- 本次访谈的完整中文文字稿及YouTube视频播客(英文字幕)信息见于该推文,具体链接未在摘录中提供,建议通过上述源线程获取。
本报告基于张小珺对杨植麟的第二次专访内容撰写,提炼了技术范式、研发策略与哲学层面的核心判断,适合作为追踪Kimi技术演进及AI智能体趋势的长期参考资料。