GPT 6 就是 AGI?工作轨迹才是新时代的富矿

大家都在聊 RSI(自动进化模型)是不是通向 AGI 的路,OpenAI 顺手发布了 GPT 6 Astra,并宣称 AGI 已经到来了。
但 GPT 6 凭什么?只需要看看这次到底升级了什么。
一、AGI 的重心,从写代码挪到了用软件
这次发布最值得注意的反而是编程。GPT 6 在 DeepSWE 上只提升了 1.4 个百分点;真正大幅跃升的是:屏幕元素定位 ScreenSpot-Pro 从 GPT-5.6 Sol 的 76.9% 提到 92.7%,业务流程 AutomationBench 从 18.1% 提到 41.4%,CAD 设计任务提高 12.6 个百分点。
发布会演示里,OpenAI 强调的也是具体软件和工作文件的使用能力——3D 建模、Power BI、电路板设计、法律文档排版,一个个场景摆出来。
这不是 OpenAI 一家的倾向。Fable 5.1 上能看到类似情况:编程的 CursorBench 提高 2.9 个百分点,AutomationBench 提高 14.3 个百分点,科研的 Terminal-Bench Science 0.1 提升近一倍。Gemini 3.8 Flash 更是专门强调专业领域的多步骤分析,甚至拿出 Finance Agent v2、Harvey benchmark 这类领域基准来做对比。
Computer use 这个功能的轮回史,正好能窥见节奏的变化。
2024 年 10 月 Anthropic 发布 computer use 时,通用操作电脑的想象空间已经打开。但当时它自己就承认:慢,而且容易出错。模型成功点几次按钮足够做吸引人的演示,但要连续完成工作,它比人慢、稳定性又差。
随后 2025 年 2 月 Claude Code 上线,直接带火 Coding Agent 市场。到 2026 年 2 月,Anthropic 披露 Claude Code 年化收入运行率已超过 25 亿美元,仅当年年初以来就翻了一倍以上。Coding Agent 里有现成的代码仓库、命令行和测试工具,直接执行命令通常比看屏幕找按钮有效得多。CLI 和 MCP 代表的结构化工具接入一度引发”消灭 GUI”的讨论。Computer use 也在去年年中到今年年中之间,从每场发布会的展示焦点变成了不再重要的注脚。
直到这次 GPT 6 Astra 发布会,它才再度回归。

回归的原因并不神秘:程序员池子快满了,而非程序员的办公场景还没工具可用。
Codex 产品负责人在 8 月 21 日宣布月活已达 2000 万以上,更领先的 Claude Code 即便没有公开数据,应该也不比这个少。SlashData 在 2026 年第一季度估计,云原生开发者有 1,990 万,占全球开发者约 39%,倒推总量约 5,100 万人——这个口径还包含非职业开发者,真正以编程为工作、能持续形成付费需求的人群更小。
而且这个市场已经被迅速教育过一遍。JetBrains 在今年 5—7 月对超过 1.5 万名专业开发者的调查显示,90% 的职业开发者每周都在使用 AI coding agent,68% 每天使用。尚未成为每周用户的人只剩约一成,继续寻找没试过 Coding Agent 的程序员,空间已经很有限。
数据也印证了减速。第三方机构 TickerTrends 估算,截至 8 月 10 日 Claude Code 的四周收入运行率增幅为 5.2%,低于此前几个月的扩张速度。对大厂而言,Coding Agent 已经进入争夺现有用户、提高使用频率、增加企业付费的深度竞争阶段,不再是高速增长的荒蛮期。
而 Coding 之外,另一批用户才刚刚开始进来。OpenAI 在 6 月披露,非开发者知识工作者已占 Codex 用户约 20%,增长速度超过开发者的三倍。到 8 月更新企业数据时,自 2 月以来工程职能的 Codex 周活增长 5 倍,法律职能增长了 108 倍,销售和招聘分别增长 41 倍。
CLI、API 和 MCP 可以承担其中大量操作,但覆盖还不完整。牛津大学 3 月 25 日发布的调查《How are AI agents used?》分析了约 17.7 万个 MCP 工具,软件开发占工具数量的 67%、占可观测下载量的 90%。Toolradar 8 月的分类报告里,开发者工具依然占主导。2 月到 8 月间,MCP、CLI 的增长主要发生在办公、支付与商家财务、设计领域,但各领域进度不一,距离覆盖所有工具、所有操作仍有明显距离。
刷屏的 Astra 用 Blender 3D 建模的视频就是实例。按 OpenAI 公布的流程,建模是通过 Blender 的 Python API 创建场景、后台脚本设置相机和渲染;但为保证精确,它必须同时用 computer use 打开和检查 Blender,结合渲染图继续修改——正是借助视觉理解,模型发现水槽表面着色异常后修正了相关几何属性。
所以 Computer Use 的回归,不是 GUI 战胜了 CLI,而是模型进入 Coding 之外后,任务验收本身重新包含了视觉与交互。
问题是:能用软件,不等于会干活。从看到软件说明书到完成工作之间,是需要学习的。GPT 6 Astra 在这些任务上惊艳,是因为都加训过了——发布页内 OpenAI 明确提到,Astra 接受了面向专业环境的定向训练。
这种训练怎么来的?
二、工作轨迹,成了新时代的富矿
要训练模型干活,首先得让它在活儿里学着干,这就是训练任务。
在 Coding 里,这些东西不难找。GitHub 上一个已解决的 Issue 就是一道现成的题,甚至自带答案和环境:用户描述问题就有了题,仓库保留修改前的代码就有了上下文,开发者提交的解决方案就是答案,还有测试和审查意见帮你筛选修改是否有效。找到已解决的问题,把代码恢复到修改前让模型重做一遍,就能训练。
所以 Coding 范畴下,训练团队不太需要工作轨迹,从 GitHub 扒就行。
但走出 Coding 之后,这些就不再唾手可得。没有 GitHub,要么让专家脑补想象工作,要么从已有的工作轨迹里总结。专家贵,手搓慢,后者要用好了既省钱又快。
工作轨迹因此成了新的富矿。围绕它的收集、整理和利用,市场和研究界都在加大投入。
比如 Handshake,本来是高校和求职者的网络,现在 AI 数据收集成了主要工作,搜集的正是当下的工作流程。官网上他们描述现在的做法:通过录屏和轨迹分析了解工作流程,用专家制定的评分标准评估 Agent,再在模拟环境中改进表现。
Sunset 原本是帮创业公司办理关停、封存业务数据的,到 2026 年也成了一家专注工作流程的 AI 数据公司。其 4 月 14 日的官方文章披露,公司直接购买符合条件的内部数据,整理并处理隐私合规问题,授权给 AI 实验室和研究机构,材料包括内部沟通、产品开发历史、客户反馈。Sunset 把这类产品叫 RL gyms——用于强化学习的训练场。
三、用传统 Agentic RL 的眼光看,这个富矿不好采
要好工作轨迹,至少过两道关:把记录变成可执行的题目和环境,让模型能重新尝试;构造有效奖励,能判断任务完成的好坏,最好还知道哪里好哪里坏。
Coding 之外的世界,光是出题和构建环境就难度重重。
一个 RL 可用的环境,至少要让模型能在里面根据反馈尝试不同做法:操作失败了可以修改方案再试,同一道题可以重复执行、比较不同策略。
但工作轨迹 ≠ 训练样本 ≠ RL 环境。人的工作记录只记下发生过什么;训练样本还需要任务边界;RL 环境需要更多。录屏能告诉你一个人打开了哪份表格、改了哪些内容,但模型如果打开另一份文件、换一种公式,录屏不会给出新结果。要让它重做这份工作,得先还原它当时面对的上下文(文件和表格)、还原可操作的空间(软件/系统)、明确当时的要求。三个条件,对不同工作完全不同。
版本之子 Coding 已经越过山丘。 可操作空间是编程软件,开发过程又留下各种结构化记录帮你恢复场景:代码仓库存着历史版本和依赖文件,拉出来就能恢复运行条件;失败后马上恢复初始状态再试另一种修法。题目也唾手可得:Issue 描述问题,修复前的 commit 提供起点,PR 给出参考补丁,测试帮助检查结果。程序员日常使用的协作系统,已经替训练团队保存了一部分题目、答案和环境。
过去这类 GitHub 数据清洗靠人扒,但到 2025 年开始自动化了。2025 年 6 月 12 日,中山大学团队提交 SWE-Factory 初版论文《SWE Data Construction, Automatically!》,把环境准备放手交给四类 Agent:一个读项目说明弄清怎么安装,一个搭运行环境,一个准备测试脚本,最后一个实际运行、查报错再让前面的助手修改。成功配置会被保存,同一项目其他题目可以接着用。2026 年 1 月 5 日的修订版中,团队用 GPT-4.1 mini 在 671 个候选问题里构建了 337 道有效任务。
2026 年 2 月 2 日,Qwen 团队提交《SWE-Universe: Scale Real-World Verifiable Environments to Millions》,把自动出题进一步做大:专门用成功搭建环境的操作记录训练了 Qwen-Next-80A3 构建模型,最终从 52,960 个仓库构造出 807,693 个可验证训练实例,用于后续轨迹生成、中训练和强化学习。至此,从工作轨迹里自动搭建训练环境这件事正式成立,程序员们的 PR 丝滑地进入了训练循环。
还在爬坡的中间层:OS 和开放软件。 走进更开放的工作场景,Coding 的有利条件就不存在了:现实任务往往涉及多个复杂工具,记录可能分散在整个电脑乃至电脑之外。还好,在完整领域任务和 Coding 之间还有大量软件和操作系统——Blender、Office,以及连接它们的 OS——它们成了迈出去的第一步,而且早就有专门的训练途径。
2024 年 4 月 11 日的《OSWorld》把真实电脑做成可重复操作的实验环境:369 个任务,每题配初始状态配置和结果检查脚本,可涉及多应用之间的操作。Agent 在虚拟机里操作真实软件,准备任务时配好文件和应用状态,尝试结束后重置环境。Blender 也很早就构建好了环境——2025 年 4 月 2 日斯坦福的《BlenderGym》设计了 245 个场景,覆盖灯光、材质、几何编辑,每题有基础场景文件、生成初始与目标场景的脚本、渲染图和文字说明。
但到这里,工作轨迹依然只能作为人工出题的参考。即使有工作流程,它们也缺少 PR、Issue 那样成套可追溯的任务记录,最好用的反而是论坛题库。软件有了,还需要人准备初始文件、写清修改要求、制作参考结果、设计验收方式,大量标注和清洗让每个训练集成本极高。OSWorld 搭 369 道题,用了 9 名学生、三个多月、约 1,800 人时。Epoch AI 在 2026 年 1 月的行业访谈里,从业者给出单道题(只是出题和评分器,不含环境构建)的价格大概是 200—2000 美元。
既然贵,大家也想自动化。港大与 Salesforce Research 2024 年 12 月 12 日提交的 AgentTrek 去教程里扒题,让模型整理目标与步骤,再用 Agent 在真实网络里重新执行,走得通的当训练轨迹去蒸馏/SFT——但当时它主要生成轨迹,没能力为任务恢复可重置、可探索的 RL 环境。
直到最近才有初步尝试。2026 年 5 月 21 日的《Spreadsheet-RL》直接针对 Excel 任务训练 Agent:从公开表格论坛自动构造环境,训练集包含 5,925 道经筛选的 ExcelForum 任务,模型每次在独立工作空间里改表格,指定答案区域与论坛正确答案比较给奖励。
也可以现采数据,保证记录环境符合要求。2026 年 5 月 28 日腾讯混元及合作高校发布的《PhoneWorld》描述了现采数据的可能用法:先收集人在真实 App 里的操作截图和动作记录,识别常用页面、跳转关系、哪些操作会改数据;再整理成开发要求,让 Coding Agent 编写、编译、修复模拟 App。收藏、发消息等操作会修改本地数据库,重置时恢复初始状态,于是任务可反复执行、检查结果。6 月 22 日的《PhoneBuddy》就直接把这些环境用于 RL。这可能是未来的一种大规模方法,但目前还不普遍。
数据公司做的还是比较古法的环境构造。Scale AI 在 2026 年 2 月 27 日披露,当下接近一半的新数据训练项目涉及 RL 环境,产品覆盖工具使用、电脑操作和领域工作流。GPT 6 里最大的进步,正集中在数据公司专攻挖掘的领域。

到了真实的领域工作,还是只能回到古法操作。 更完整的领域任务难度又加一层,因为需要恢复的东西往往比记录下来的多得多。一位分析师做报告,留下查数据库、改表格、生成文档的操作记录,我们知道他查过什么、改过什么,却未必知道任务开始时数据库里还有什么、哪些文件他有权访问、客户在会议里补充过什么要求。这些信息没出现在记录里,不代表不重要——分析师可能正因为提前知道某个条件,才没去查另一份资料、没采用另一种方法。条件没恢复,模型重做的就不是同一个问题。
从训练效率看,理想环境应让模型低成本反复尝试,且每次尝试条件可比;最好能重置。对长程任务,能从中间状态恢复是最佳状态:前面几十步是准备,模型只在最后几步遇到困难,保存中间状态就能从那里反复探索。标准软件往往能做到这些,但实际任务分散在软件之间甚至系统之外——要从不完整的记录中恢复任务要求、确定环境边界、补齐关键状态、承受原记录之外的操作,再用软件串联起来。想从 Coding 进入其他领域,基础条件往往要重新建设,还得回归人力手搓。
前 OpenAI 员工、LoRA 发明人 Edward Hu 在 9 月 1 日发布的《Training frontier knowledge work agents: A 397B RL training guide with SkyRL》,介绍了后训练领域专门模型的过程:使用 1,928 道专家构造的任务,覆盖企业法律、投行和管理咨询。按 Mercor 1 月的 APEX-Agents,这些任务先调查数百名专业人士,了解律师、投行分析师和咨询顾问的时间花在哪里;再请有五到十年经验的专家在 Google Workspace 里模拟同事共同推进项目,制作文件和沟通材料——比如围绕一家虚构公司的咨询项目准备业务背景、分析材料,还与 Box 合作设计文件的组织方式。专业人士花五到十天构建一个资料丰富的项目环境,再根据环境设计任务。APEX-Agents 最终包含 33 个这样的环境、480 道任务和对应评分标准。RL 的环境,是每题背后一个模拟公司的工作空间。
这条路线上,工作轨迹还不能自动变成训练环境,都得靠专家手搓。但 Mercor 至少说明用 RL 训练更长程、超越 Coding 的任务是可能的,就是贵和慢,得靠巨量人力 scaling。
潜在的救星:用 Agent 内的轨迹训练 Agent 自己。 轨迹收集又贵又分散,很多时候甚至不如专家颅内出题快。那干脆用 Agent 自身留下的工作轨迹。Agent 这个产品和以前的产品不一样,整个 Harness 就是按编程逻辑构建的:保存好的上下文条件库、issue(命令)、执行环境(Agent 自己)、解题流程。虽然现在 Agent 不是全能的,但大家用它几乎覆盖所有任务,从中能找到各种复杂、多样任务的轨迹——这就是一个可能达到 GitHub 级信息丰富度和环境可控性的通用工作轨迹库,不用岂不是浪费了。
模型公司也想到了。2026 年 9 月 3 日,阿里 Qwen 团队与清华提交《Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments》,利用 Codex、Claude Code 这类编程 Agent 运行时由 harness 记录的工具调用轨迹——读过哪些文件、执行过什么命令、修改过哪些内容、工具返回了什么。系统先梳理轨迹中的文件操作,尽可能找回 Agent 修改前的内容、排除解题中新增的文件,再由另一个 Agent 补齐缺失文件和依赖、检查工作空间是否足以支持任务,最终构造约 3.73 万个环境,在其中提出新任务、重新生成解题轨迹用于 SFT。它恢复的主要仍是软件开发类任务和环境,但确实给出了通用任务如何利用 Agent 记录的明路。
当然,要真把通用领域的工程轨迹用好,还需要三个前置条件:一是 Agent 数据跨任务拼接的可能(一项日常事务可能先在一个对话里搜资料、另一个任务里做表格、人打开软件修改、第三个 Agent 生成报告,各段记录分别存在,Agent 得学会标明它们如何关联);二是中间状态的保存和恢复(任务开始的文件版本、关键节点状态、需求变更、交付反馈);三是让过去不在 Agent 里用的软件尽量在 Agent 里用,这需要操作系统层面更通畅、各类软件能被 Agent 稳定调用。目前除了 GPT 6 在 OS、computer use 和开放软件上的增强,其他条件还不满足。过渡期内,数据清理、背景补全和专业验收仍需大量人工,最多半自动。
即使有了可反复运行的环境,也才过了第一关。第二关是奖励和奖励分配。
有了题,得让模型知道做得好坏。但开放领域里,奖励不存在。Benchmark 之所以重要,很多时候意味着一种角度的奖励模型,改造改造就能成评分规则 rubric——但 Benchmark 也是专家攒的,自动生成的通用奖励并不存在。
Coding 之外,Universal Verifier 不存在。模型修复代码靠测试就知道成没成功,但 Excel 做得对不对、3D 建模是不是够好,非常不直观。2026 年的 Spreadsheet-RL 在真实 Excel 里评分时结合数值对错与公式、结构检查;这只是基础奖励,即算没算对。实际用 Excel,还希望结构可审计、可持续更新、跨表可计算,所以 MBABench 把端到端金融表格评估拆成 Accuracy、Formula、Format 三类,同时检查计算行为、专业语义和交付质量。3D 领域同理,2026 年 6 月的 CodeBench 同时使用执行成功率、多视角视觉相似度、三维几何指标和人类成对偏好来评价建模。这都是在一个个领域、具体任务中重新搭出来的 rubric 类终局奖励。
放到更大的领域,任务更多样,建通用奖励规则更难。Mercor 的 APEX-Agents 面对金融、法律任务,专家不得不为每项任务编写能独立判断真假的标准与评分;公开基准中每种任务平均约四项评分标准,要细化到每种任务。
没有 RLVR 的好用奖励只是一部分,信用分配在 Coding 之外变得更麻烦。数学和 Coding 训练里可以给同一道题生成多条候选、用答案检查或测试评分、强化相对较好的结果,代表是 GRPO——不用太考虑过程中哪步对哪步错。但对 rubric 难写、环境构造慢的领域,GRPO 这种粗线条评价体系太狂放也太浪费:题目少、不能浪费,而且很多 Coding 任务的工具接口和动作语义相对稳定(读文件、搜索、编辑、执行、测试),这种稳定性让价值模型容易复用经验。扩展到多种职业工作后,每一步有没有帮上忙要用不同办法判断——搜到一篇文章要看有没有提供有用信息,改好公式要看计算对不对,发消息要看有没有推动对方解决问题。只用一个 ±1 的终局分数处理,变得非常困难。
因此最近算法上的很多改动都围绕这点,路径大概三条:改造 GRPO、回归更经济可靠的 PPO 与 critic、用 rubric 和工作轨迹构造更多学习信号。
第一条路,保留 GRPO 的简洁性,改造它怎样比较和利用轨迹。 只有 ±1 太糙,那就加 checkpoint。2026 年 2 月南洋理工与东南大学的 HGPO 发现:即使当前环境一样,模型此前知道的事情可能不同——同样打开一个商品页面,一个 agent 已查过预算和尺寸,另一个还没有,接下来是否购买不能只按开始页面一样就同组比较。HGPO 按历史上下文一致程度拆分比较 rollout,未到环境状态分叉的地方单独拆组,分别计算优势再加权结合。2026 年 7 月 MBZUAI 提出 BPO,在可保存恢复的沙箱里,从模型对选择不确定的地方分叉尝试不同动作、比较后续结果,思路和 2025 年 5 月南洋理工与 Skywork AI 的 GiGPO 相似——利用不同轨迹中重复出现的环境状态,从同一处出发比较不同动作,给局部优势与整条轨迹优势结合。BPO 更主动细致,在网页购物、家务模拟、代码修复任务中报告了相同计算预算下优于 GRPO、RLOO 的效果。
第二条路,重新引入 PPO 式 critic,但用更便宜或更有效的。 早先 PPO 训练价值模型判断「任务做到这里,继续执行预计能拿多少回报」,给每个步骤打分,是稠密的过程评分模型,不必取很多 rollout。智谱 2026 年 6 月的 GLM-5.2 技术说明就提到:长任务 Agentic RL 的部分场景(上下文压缩后形成数量和长度差异很大的执行片段、GRPO 难比较)用回了带 critic 的 PPO,从单次执行估计 token 级优势。问题是训练 critic 非常贵、不一定准、训练变慢。省钱的办法是不再单独训练 critic:厦大与南洋理工 2026 年 8 月提出 SAPO,让执行任务的模型兼任 critic——生成下一步操作时顺带预测这步最终能获得多少奖励,跑完后比较实际结果与当时的预测差额作为训练信号。比如搜索前预测 0.3,搜索后找到符合要求的商品,下一轮预测 0.6,这步就产生约 +0.3 的改善信号。每道任务一次采样只跑一条轨迹也能获得不同轮次的信号,省掉独立 critic 的显存。ALFWorld 和 WebShop 上相对 PPO、GRPO 都有改善。
另一个方向是从现有轨迹提取局部信号,让 critic 更快更准、关注关键步骤。卡内基梅隆与 IBM Research 2026 年 9 月的 DRACO 直接用 rubric 本身增加关键判断点:根据任务和实际执行过程生成 rubric 检查表,评审模型逐项检查并指出相关步骤在哪里——规则里要判断「是否核对了必要信息」,对应的就是前面的查询动作,据此调整各步骤受到的鼓励或惩罚。AppWorld 上比稀疏真实奖励的 GRPO 高 5.3 个百分点,但效果仍依赖评分标准和步骤对应是否可靠。
这些都暴露了进入开放工作后,终局 reward 不够、轨迹没被好好按任务依赖关系切分。在有效利用工作轨迹做奖励和分配这块,业界比去年整体进步并不多。
小结:当 Agent 想用传统 Agentic RL 跳出 coding 的鱼池,工作轨迹用起来并不丝滑。当前主流还是专家标数据、手搓为主。这也是为什么数据公司、造环境的公司都在创业风口上——广阔的现实有手搓不完的环境,商业逼迫模型公司必须买新的环境数据、再做 RL、再扩展 Agent 的边界。唯一的光亮在 Terminal-Universe 这类方法里:在 Agent 自己环境里取轨迹,用 Harness 快速造环境。但光还暗淡,也解决不了奖励和信用分配。
四、跳出传统 Agentic RL,有出路吗?
既然造环境的路子用不起工作轨迹,那就换条路:如果真实工作反馈可以直接训练模型,就不用造环境了。
有人找到了这条狭窄的捷径。6 月,李飞飞参投的 AI 实验室 Trajectory 的联合创始人 Arjun Karanam 在官网发表《Continual Learning: End of Frozen Software》。他的论点是:工作每天都在发生,但发生过的工作没法直接拿来训练。工作轨迹之所以好使,是因为用户在实际工作中可能已经把问题指出来了——模型做了一张表,用户说这里应该按客户去重、你算成订单数了。这句话不只表达不满意,还指出了哪里错、应该怎样改。如果最后只把它压成一个负分,再让模型靠反复尝试找问题,就浪费了反馈里已有的信息。而且一次用户请求通常只有一次执行,后续修改可能几小时后才出现,拿它造环境、题目和评判标准,光数据标注和清洗就受不了。
那怎么让模型快速学到反馈?用自蒸馏 SDPO。
SDPO 沿用 Thinking Machine 的 OPD 方法。OPD 里有一个较强的教师模型和一个待训练模型:学生拿到任务自己生成回答或执行操作,老师随后沿着学生实际走过的过程,判断每个位置接下来怎样做更合适,训练让学生的预测向老师靠近。与直接模仿标准答案的 DPO 相比,老师教的是学生实际遇到的问题——学生走了一条不同路线甚至中途犯错,老师仍可以在那个位置提供指导。但 OPD 需要一个懂这个领域的老师,不适合探索全新的、没有老师的领域。
2026 年 1 月 28 日,ETH Zurich、斯坦福与马普所在《Reinforcement Learning via Self-Distillation》中提出 SDPO,把老师删掉了。他们认为模型自己做不出来,不代表看到反馈后还不明白:让学生先尝试任务,同一个模型额外看到执行反馈后自己给自己当老师,回到学生原来的生成过程重新判断下一步,学生再向这位事后诸葛亮靠拢学习。论文在科学推理和工具使用任务上的汇总成绩 70.2%(GRPO 为 66.6%);化学问答实验中,同样四张 GH200,SDPO 约五十分钟达到 GRPO 五小时的准确率。
到了 3 月,ETH Zurich、MIT 与苏黎世大学发布《Aligning Language Models from User Interactions》,把这套思路直接用在用户数据轨迹上。前一篇仍需学生不断生成新尝试、从环境拿反馈;这一篇的离线实验直接利用已经发生的对话:一次交互整理为用户原来的要求、模型的回答、用户接下来的消息三部分。日志里的回答来自 GPT-3.5 和 GPT-4,要训练的学生是 Qwen、Olmo 等模型,于是把日志回答逐步喂给学生计算它每个位置的预测;”老师”用同一个模型但额外看到用户后续回复,两边的区别就是有没有看到用户的纠正。让学生向看过反馈之后的判断靠近,不需要新搭交互环境,也不需要先把反馈加工成奖励分数。
它更进一步做了”只围绕一道难题,模型能不能边做边学”的实验:反复尝试同一道编程题,每次拿到反馈通过自蒸馏更新参数,再用更新后的模型继续尝试——普通多轮对话把经验放进上下文,这里把经验逐步写进模型。在极难题上,达到相同解题发现概率,SDPO 比反复采样或多轮对话少用约三分之二的尝试。从约 1.4 万段真实对话提取约五万个样本训练后,Qwen3-4B 的 AlpacaEval 长度控制胜率从 37.9% 提到 46.1%,Qwen3-8B 从 49.3% 到 51.9%、IFEval 从 83.9% 到 85.0%(4B 在 ArenaHard 困难题上降 1.2 个百分点)。至此,用现成的单次工作轨迹直接训练模型的路线走通了。
Trajectory 6 月 2 日的《Scaling SDPO》继续完善:异步训练下,等用户反馈回来时做事的模型可能已经更新了好几轮——上午模型做错表,下午用户才指出问题,要学习的是现在的模型,留下错误的却是旧版本。他们根据新旧模型差别调整旧记录在训练中的分量,再给更新加上限制。这样每项任务只留一条轨迹也能训练,失败的过程也不必扔。APEX 上 GPT-OSS-120B 通过率从 5% 提到 25%,比没有稳定措施的 SDPO 高九个百分点;Tau-Retail 实验中异步训练相对同步约两倍时间加速、准确率不降。8 月 11 日发布法律领域的新结果:用一家律所的实际工作数据后训练,Nemotron 3.5 Lightning 在留出法律任务上的全部标准通过率从 0% 提到 8.3%。
说实话,效果并不显著。但这已是越过传统 Agentic RL、直接把工作轨迹用好的当下最优解。
想绕路,没那么简单。 这套用 SDPO 替代 RL 的路径正越来越受到挑战。UIUC、人大与北大 2026 年 5 月 11 日的《The Many Faces of On-Policy Distillation》发现,OPSD 容易把”模型看了答案以后会接着说”当成”模型已经学会不看答案也能做”,中间其实差了一步:老师的判断一部分来自解题能力,另一部分来自它已经知道答案;学生需要学前者,训练信号给的可能恰恰是后者。在他们的测试里,老师看最终答案的 OPSD 做完蒸馏准确率甚至低了一个百分点,而 GRPO 稳稳提升 12%。想用蒸馏逃开 credit assignment,还是折在了 credit assignment 上——这可能就是 Trajectory 效果不佳的原因。
普林斯顿 7 月发布的《Rethinking On-Policy Self-Distillation for Thinking Models》在五个 Qwen/OLMo 推理模型上发现,给老师完整参考解答后自蒸馏,长推理评测成绩全部下降,例如 Qwen3-8B 三个数学基准平均从 63.5% 降到 57.8%。研究人员认为,老师已经知道答案就倾向直接往下走,而学生原本需要的核查、回退、重新考虑反而得到负面信号——学到了更短的过程,没学到老师凭借额外信息才具备的判断力。
中科院相关团队与南京理工大学 7 月的《Denser ≠ Better》专门研究持续后训练,发现 SDPO 可以更快适应当前领域,但在连续训练设置中出现了更严重的遗忘甚至崩塌,GRPO 的适应更保守、旧能力保留反而更好。OPD 当年的一大优势就是没有 SFT 那样的灾难性遗忘、又比 RL 高效省钱;但在每天吸收用户反馈的场景下可能反而遗忘更甚。靠它学成 AGI 就不可能了。
五、一口一口吃掉世界,能走到 AGI 吗?
归根到底,目前 GPT 6 显示出的这套「AGI」路径,就是不断造环境,然后 RL 进入新领域。但这样真的能吃掉 AGI 这么广阔的世界吗?被 RL 了的模型,智能真的提升了吗?
2026 年 1 月,Meta 与西北大学等的《Paying Less Generalization Tax》观察到:RL 的目标环境成绩上升,未训练环境的表现却下降。Llama-3.1-8B-Instruct 在 WebShop 训练后购物成功率从 34.4% 升至 58.0%,但没参与训练的 ALFWorld 家务任务从 25.8% 降至 10.8%。提前用 SFT 巩固能减轻遗忘,但保护没有自动延伸到其他能力。
当然,十万 GPU 训练的万亿级 GPT 6 可能比 8B 模型有更多余裕保留技能。但从用户反馈看,那些不在主要 Benchmark 上的能力,GPT 6 可能还不如前一代。在 ARC 测试作者 Louis-François Bouchard 维护的 ToneBench(测模型能否模拟其他文章风格)上,GPT-6 Astra 比 GPT 5.6 低了 2.7 分。比如原文作者就说,这篇文章他用 GPT 6 辅助,但完全得一句一句重写,是最近几个月写得最费劲的一篇。
2026 年 3 月复旦、美团和上海人工智能实验室的《Can RL Improve Generalization of LLM Agents?》发现,RL 的泛化效果很大程度上取决于「换的是什么」。Qwen2.5-7B-Instruct 只在 WebShop 简单任务上训练,困难任务得分从 17.4 提到 77.5;但跨环境测试中,3B 和 7B 模型在未训练环境上的平均提升只有 3.32 和 3.44 分,个别组合明显出现泛化税型退步——7B 在 BabyAI 训练后,WebShop 得分从 28.59 掉到 10.25。作者观察到 BabyAI 每一步都提供可选动作,模型逐渐依赖这种提示,换到需要自己组织操作的环境就容易出错。
也有正面信号。2026 年 7 月 Surge AI 的《Cross-Benchmark Generalization in Long-Horizon Agents》在不包含软件工程的办公与多工具工作流上训练,仍观察到软件工程评测的提升,说明某些工作方法可能跨过训练领域。2025 年 10 月卡内基梅隆等机构公开的 Agent Data Protocol,把编程、浏览器、工具使用等不同来源轨迹统一后训练,观察到优于单领域训练的结果。
但原文作者最后的那个判断我很有共鸣:这条枯燥的造环境路径背后,商业逻辑的驱动力可能远大于对 AGI 的追求。
GPT 6 的「AGI」,是模型能打开 Blender、填好 Excel、排版法律文档了——它离”在未知领域自己学会干活”,中间还隔着环境、奖励和信用分配三座大山。这套路径能一口一口吃掉工作场景,但每一口都得有人先把环境手搓出来、把 rubric 写出来。
这不是 AGI 的样子。至少,不是你我想的那个。


























