生成式AI 的中局范式:从Harness 到Experience Loop

生成式AI 的中局范式:从Harness 到Experience Loop

过去几年,生成式AI行业一直在寻找下一个足以改写叙事的大词。有人说是更大的模型,有人说是推理,有人说是Agent,有人说是世界模型,也有人已经把目光投向“自我改进”“递归自我提升”。但如果把这些概念拆开,会发现:2026年的行业未必已经出现了“Transformer 2.0”式的新底座;真正逐渐收敛的,是一套......本文来自微信公众号: AIGC从0到1 ,作者:王零壹,原文标题:《生成式 AI 的中局范式:从 Harness 到 Experience Loop》过去几年,生成式AI行业一直在寻找下一个足以改写叙事的大词。有人说是更大的模型,有人说是推理,有人说是Agent,有人说是世界模型,也有人已经把目光投向“自我改进”“递归自我提升”。但如果把这些概念拆开,会发现:2026年的行业未必已经出现了“Transformer 2.0”式的新底座;真正逐渐收敛的,是一套比“模型能力”更完整的系统观。它大致包括三个层面的变化:在产品上,AI正从“帮你用软件”,走向“替你交付工作”;在系统上,模型不再独自构成产品,模型之外需要一个持续运行、可行动、可验证的Runtime;在学习上,行业开始从“依赖人类数据训练模型”,走向“让系统在环境中积累经验,并把经验转化为能力”。如果一定要写成一个公式,今天越来越多AI系统接近的是:AI System=Model+Persistent Runtime+Environment+State/Memory+Verification+Learning Loop或者更直白一点:Goal→Act→World→Feedback→Update→Act AgainChatGPT时代的基本链路是:提示词,生成答案。成熟Agent系统的链路则变成:目标,执行,进入环境,获得结果,接受评估,沉淀经验,再次行动。讨论的是:AI如何从一次性推理,变成一个持续存在于真实世界里的系统。一、先别把五层问题混成一场路线之争今天关于Agent、Harness、Agent OS、Continual Learning、World Model的争论,常常显得混乱。原因不复杂:大家讨论的根本不是同一层问题。层级讨论的问题代表性方向模型层智能从哪里来Scaling、推理、多模态、世界模型系统层模型如何真正行动Model+Harness/Runtime学习层系统如何变得更好经验、记忆、技能、持续学习产品层用户究竟买到什么Copilot、Agent、AI Worker产业层AI在经济中扮演什么角色软件工具、数字员工、软件即劳动力这五层会相互影响,但不能互相替代。例如,腾讯WorkBuddy、阿里QwenWork、Grok Bot等产品的意义,在于它们把AI产品的交付单位,从“回答”推进到了“任务成果”。微软对Copilot的表达也经历了类似变化:从“帮我找到”,到“帮我选择”,再到“替我完成”。这是一种很重要的产品迁移:软件开始从工具,走向劳动力。但“软件即劳动力”不是模型自动出现的结果。模型能思考、能生成,不等于它拥有身份、权限、记忆、工作现场、操作记录与责任边界。那些问题,属于运行时。二、Agent的关键,不只是模型,而是它运行在哪个世界里DeepSeek在DSH中给出了一个非常清晰的表达:Agent=Model+Harness其中,模型负责智能;Harness负责让智能能够完成任务。DeepSeek的做法尤其值得注意:模型、工具、技能、会话、沙箱、存储、循环、调度和UI,都可以被视为可替换的插件。核心保持很薄,外围不断替换和组合。这意味着,Harness不是一个写死的Agent工作流。它更像一个可以持续被检验、替换、重放、恢复、分叉和优化的运行环境。Agent不只是“调用几个工具”,而是在一个可观察的系统中工作:它有轨迹,有日志,有状态,也需要面对失败。Anthropic在其面向托管Agent的实践中,也提出了一个很现实的判断:许多Harness本质上编码了“模型做不到什么”的旧假设。模型变强后,这些经验性补丁可能反而成为约束。这正是当下系统设计最微妙的地方。模型能力增强,会吞掉一部分Harness。但它不会吞掉全部Harness。会被模型逐渐吞掉的,是认知层的脚手架:硬编码的规划逻辑;提示词技巧;固定决策树;简单的工具路由;机械式重试;为弱模型设计的大量上下文补丁。模型越强,越不需要人类替它规定“应该先想什么、再想什么”。但另一部分东西,不会因为模型更聪明而消失:身份与权限;沙箱与隔离;长期状态;外部记忆;工具契约;审计日志;成本控制;验证机制;安全与治理边界。这些不是认知问题,而是现实世界的问题。模型可以决定“下一步应该做什么”;但模型不能自己决定“它是否有资格做这一步”。所以,未来更可能发生的变化是:认知脚手架会逐渐消失,行动基础设施会越来越厚。也可以写成一句更短的话:Cognitive Harness变薄,Operational Runtime变厚。很多所谓Agent OS,最后未必会成为“AI的Windows”或“AI的Android”。它更可能变成非人类行动者的运行环境:管理状态、身份、权限、资源、工具、沟通、记录和评估。它不是智能本身,但它决定智能能否被安全、稳定、长期地使用。三、Harness是今天最成熟的答案,但它还不是终局如果只看2026年已经被证明有效的部分,Model+Harness几乎是最清晰的系统范式。因为模型再强,也需要被接入环境。一个能完成复杂工作的Agent,至少需要回答这些问题:它能看见什么?它可以调用哪些工具?它有没有权限修改数据、发邮件、下单或部署代码?中途失败后,能否恢复?多轮任务结束后,是否还记得此前发生过什么?它的动作能否被追溯?谁来判定它完成得对不对?这些问题的答案,构成了Runtime。所以,今天的Agent成熟度,不只看模型benchmark,也要看运行时是否具备“持续工作的条件”。一个较完整的Agent系统,可以写成:Agent=Model+Runtime+Environment+Memory+Verifier+Learning Loop其中:Model提供通用智能与推理能力;Runtime提供编排、身份、权限和持久状态;Environment提供任务、工具、资源与现实反馈;Memory保存可复用的信息;Verifier判断结果是否可靠;Learning Loop把一次次执行转化为系统能力。前四项,已经逐渐成为工业实践。真正仍未定型的,是最后一项:Learning Loop。也就是,AI获得经验之后,到底改变什么?四、真正的问题是“经验更新哪里”在传统模型叙事里,能力提升的路径相对清楚:更多数据,更多算力,更长训练,更强模型。但Agent进入环境后,系统开始产生另一类数据:不是人类提前写好的语料,而是行动产生的经验。它完成一次任务,失败一次操作,收到一次用户纠正,通过一次评估,都会留下轨迹。问题是,这些轨迹最终应该流向哪里?一个很有解释力的更新栈是:Experience→Memory→Skill→Context Strategy→Harness→Model Weights这条链路把许多看似不同的技术路线放回了同一张图里。一次经验,最轻量的处理方式,是进入记忆。再进一步,经验可以被提炼为技能:下次遇到类似任务,不必从零开始。继续往上,它可以改变上下文策略:什么信息应被优先召回,什么历史应被压缩,什么证据必须在行动前出现。再往上,它可能改变Harness:工具如何组合、任务如何分解、失败后如何恢复、哪些步骤必须经过验证。最重的一层,才是更新模型权重。因此,“Harness会不会自我进化”“技能会不会自动优化”“记忆是不是下一代壁垒”,其实都是同一个更根本问题的不同回答:AI获得经验以后,究竟应该修改系统的哪一层?这也解释了为什么不少所谓“自我进化Agent”,并不一定真的在训练模型。有些系统在更新技能文件,有些在优化提示词,有些在重写工作流,有些在调整工具策略,有些则从历史轨迹中抽取下一轮可执行的规则。它们的共同点不是“已经实现通用自我进化”,而是开始把经验视为可被处理的生产资料。不过,这条路的门槛很高。微软关于Agent演化的研究综述提出了一个很务实的结论:如果缺少确定、独立的验证器,系统依赖模糊的自我评价,反而可能越优化越差。这很符合工程直觉。让AI自动改进一段代码、一个工作流或一个技能,本质上是在让它修改生产系统。没有稳定的测试、评估和回滚机制,所谓“学习”很容易退化成随机漂移。因此,自我优化最先适合的领域,往往不是最开放的任务,而是结果可验证的任务。例如:能否通过测试;是否完成表单;价格、库存或字段是否正确;代码是否运行;任务是否在约束内完成;输出是否满足明确标准。先有验证,才可能有可靠的改进。五、经验和环境,可能成为下一条能力曲线关于下一代AI,最值得重视的变化:“经验”开始被当作独立变量讨论。DeepMind与强化学习路线的长期判断一直很明确:如果系统不能在长期环境中积累、保留和迁移经验,它很难拥有真正持续的能力增长。Demis Hassabis多次强调,持续学习、长期记忆和长周期推理仍是关键缺口。Agent的重要性,不在于它是一种产品皮肤,而在于它让模型真正进入环境。模型只有进入环境,才能获得后果。有后果,才有反馈。有反馈,才可能形成经验。字节Seed发布的EdgeBench,是这类讨论中很有代表性的信号。该基准包含134个真实任务、约3.8万小时Agent与环境交互;单个任务通常要求持续操作12小时以上,部分任务延续到72小时。报告中最值得注意的,是其提出的观察:在特定任务集合中,Agent的表现曲线呈现较稳定的增长趋势;团队还观察到,Agent在部分任务上的学习速度似乎正以大约每三个月翻倍的速度提升。但它提出了一个值得严肃对待的问题:过去,行业主要讨论参数、算力和token。未来,能力曲线会不会多出一个横轴:Environment Interaction Time也就是,系统究竟在真实环境中经历了多少次行动、失败、纠正、验证与再尝试。如果这个变量成立,环境就不再只是模型部署的终点,而会成为能力生产的一部分。世界不只是供AI使用的工具集合,它也可能是AI获取新数据、形成新策略、积累新技能的训练场。六、OpenAI的RSI,意味着什么?围绕“递归自我改进”的讨论,很容易滑向戏剧化叙事:AI开始自己造AI,然后能力爆炸。现实版本要克制得多。OpenAI组建RSI团队,重点并不是宣布“我们已经拥有AGI”,而是尝试自动化高质量研究工作:让系统参与研究流程、构建评估、处理反馈、发现缺失能力、生成数据,并帮助改进下一代模型。这更像一个AI研发飞轮:研究任务→Agent执行→产生轨迹与反馈→评估→数据与方法改进→更好的模型与系统→更复杂的研究任务字节Seed等团队也在让模型参与评估、数据、训练、研究和基础设施工作,并探索小时级、天级的长任务。这里真正值得观察的指标,是:AI对AI研发的有效贡献,占整个研发流程的比例是否越过某个临界点。当AI只能辅助写代码、总结论文时,它是工具。当AI能持续完成可验证的研究与工程任务,并把结果重新送回训练、评估和系统优化链路时,它才开始成为研发能力的一部分。这距离“递归自我提升”仍然很远,但方向已经很具体。前两天,山姆奥特曼宣称在年底之前可以内部实现。七、未来三到五年,分歧会落在哪儿?如果把今天看作生成式AI的“中局”,未来不会只剩一条路线。较大的共识是,2026—2027年,持久化Agent Runtime会继续普及。更多系统会拥有工具、权限、长任务状态、日志、记忆与可恢复能力。2027—2029年,外部学习机制可能成为标准配置:记忆更有效,技能会优化,工作流会重写,上下文策略会调整,Harness会逐渐适应环境,验证器会参与改进。更远一点的分歧,才是模型权重是否需要持续在线更新。一条路线是:底层模型相对稳定,但外部Runtime、记忆、技能和环境策略持续适应。另一条路线是:模型本身也进入更高频、更连续的学习过程。前者的工程可控性更强,后者的想象空间更大,但安全、遗忘、能力漂移和评估难度也更高。因此,未来几年最值得追踪的,是几个更朴素的问题:什么样的经验,真正能转化为能力?什么样的反馈,足以驱动可靠优化?经验应该写入记忆、技能、Harness,还是模型权重?新能力能否长期保留,并迁移到别的环境?谁有能力提供高质量、可验证、可持续的环境?当AI获得更多权限时,验证、审计和治理如何同步变厚?八、Harness是今天的答案,Experience Loop可能才是明天的范式今天,最成熟的系统答案已经相当清楚:Model+Harness模型负责理解与推理,Harness让它拥有工具、状态、权限、记忆、日志和工作能力。但如果把时间拉长,真正决定系统上限的,是Harness能否把行动转化为经验,又能否把经验转化为下一轮更好的行动。所以,生成式AI的中局,不是模型和Agent的二选一。更像是一场从“预训练模型”走向“持续运行系统”的迁移:Intelligence=Model×Environment×Experience Loop模型提供潜力,环境提供后果,经验闭环决定潜力能否持续变成能力。Harness是今天的答案。Experience Loop,可能才是明天的范式。

查看原文
分享到:

相关推荐

Is 256GB enough for an iPhone? Here's when you sho...

1小时前

富豪为什么要亲手写万字小作文:孙宇晨这次玩砸的,是他吃了十年的老本

1小时前

白露三不睡,到老不后悔!老话讲,9月7日起,这三种觉千万别睡

1小时前

What's the difference between volatile and non-vol...

3小时前