区块链 区块链技术 比特币公众号手机端

AI自我进化观察:机器智能流水线从人工到模型的七次翻转

图像

按照 AI 行业的标准,今天是个相当安静的周五,所以是时候退后一步,思考一下究竟正在发生什么。如果你读过我们的 2025 阅读清单,关注过我们对 Z.ai GLM 的报道,理解了 Poolside 的转型,一直在跟进我们的 AI for Science 主题,并且收听了今天的 Simile 播客,那么你不仅是 Latent Space 最核心的读者之一,很可能也已经形成了这样的心智模型:

图像

自 2022 年以来,每一年,生产机器智能的流水线中都会有一个组件从人工制造翻转为模型制造。这不是渐进的,也不是均匀的——每次翻转都有一个“零号病人”,即某篇论文或某个产品,合成版本首次在前沿实验室中成为承重部件,而从那以后,未来其实已经到来,只是尚未被产品化。

如果你眯起眼睛看,我们过去所说的“合成数据”、“合成评分标准”、"AI 研究员”和“端到端 RL 环境”,不过是野心越来越大的对人类的模拟——差 10%,但便宜 100 倍、快 10,000 倍。

第一阶段:奖励信号(2022)

最先走向合成的,出人意料地是裁判。InstructGPT 确立了如今已成为经典的做法:一次性收集人类偏好,训练一个奖励模型,然后让策略针对模型而非人类进行优化。从策略的角度看,那个发放认可的东西已经是一个 LLM 了。Constitutional AI 更进一步,让 AI 依据一组原则进行自我批评(RLAIF),而 Lee et al. 后来证明 AI 反馈能以极低的成本达到与人类反馈相当的效果。等到 LLM-as-judge 成为默认的评估方法(MT-Bench、AlpacaEval)时,整套审批机制——奖励、批评、评估——都已经在用模型评判模型了。

第二阶段:训练数据(2023)

微软的 Phi 系列把论点直接写进了标题:Textbooks Are All You Need。一个在 LLM 合成的教科书级数据上训练的小模型,表现远超其参数量应有的水平,而 phi-1.5 证实这并非偶然。苹果的 WRAP 把这一做法推广开来:不只是生成数据,而是用 LLM 改写整个互联网,预训练的效率大约提升 3 倍。从此这条流水线开始工业化——NVIDIA 的 Nemotron-4 340B 发布时就把宽松许可的合成数据生成流水线作为主打特性,到 2025 年,推理轨迹语料库(由强推理模型生成的思维链)已经成为标准的预训练和中期训练原料。语料库——本应是不可再化约的人类输入——如今已大部分由模型撰写。

第三阶段:教师(2023)

ChatGPT API 开放几周后,斯坦福的 Alpaca 证明,只需 600 美元在 GPT 生成的指令上做微调,就能克隆出一个前沿模型的许多行为。Vicuna 用共享对话做到了这一点;Orca 则依靠丰富的教师解释而非光秃秃的答案。这项技术从模仿成熟为一门正经的训练学科——on-policy generalized knowledge distillation 修复了训练/推理的不匹配——并在 DeepSeek-R1 在旗舰模型之外同时发布一整族蒸馏模型时达到文化巅峰,自此,“教师是一个模型”成为此后每个小模型发布的默认假设。

第四阶段:课程(2024)

第 1–3 阶段让输入变成了合成的;第 4 阶段则是循环开始自我闭合的地方,因为模型开始决定接下来学什么。这些组件很早就存在了——Self-Instruct(模型编写自己的指令集)和 STaR(模型自举自己的推理轨迹)都是 2022 年的工作——但真正的翻转发生在 Meta 的 Self-Rewarding Language Models 和 SPIN 展示出模型可以生成自己的任务、评判自己的输出、并突破人类偏好数据的天花板继续改进之时。课程设计——ML 中历来最依赖手艺的部分,那种凭品味决定下一步训练什么的选择——变成了模型对自己做的事情。

第五阶段:研究员(2026)

辅助时代(Copilot,随后是 SWE-agents)仍由人来挑选实验。发现时代则不然。DeepMind 的 AlphaEvolve 在 2025 年进化出了真正的新算法,Sakana 的 AI Scientist(如今已登上 Nature!)勾勒出了完整的论文写作流水线。关键时刻是 Karpathy 于 2026 年 3 月推出的 autoresearch:一个刻意极简的棘轮循环——coding agent 修改真实的 LLM 训练配置,运行一个五分钟的实验,只有当验证损失改善时才保留改动,然后通宵重复。他自己的长时间运行将 700 个实验累积成 20 项保留的改进,把训练到 GPT-2 的时间从 2.02 小时缩短到 1.80 小时——这些都是他在睡觉时发现的真实、可迁移的代码改动。

第六阶段:环境(2026)

RL 的扩展瓶颈从模型转移到了环境:你需要成千上万个可执行、可验证、专业上逼真的任务世界,而人类无法足够快地手工构建它们。我们最近在 z.ai / GLM-5.3 一期中报道过这一点:Z.ai 构建了端到端合成环境的流水线——research agent 挖掘真实工作模式并将其转化为带有隐藏状态的长程环境,judge agent 尝试每个任务以确认其可解,verifier 在看不到参考答案的情况下被合成出来,然后用 oracle、no-op 和未解决状态检查对其进行压力测试,直到其二值奖励可靠到可以直接用于训练。正如 GLM-5.3 发布说明所言,整个环境、评判和验证栈从头到尾都是合成的。同一周,Ornith-1.5 发布并宣称实现了端到端自我改进——模型自己提出任务并生成自己的 RL rollout。训练场、裁判和记分牌现在全都是模型了。

第七阶段:人类受试者(2025)

如果模型可以充当裁判、教师和环境,那么人在回路中剩下的角色就是受试者——偏好、行为和需求的来源。这正是 Simile 正在取代的那一层。这一脉络从 Joon Sung Park 的 Generative Agents(Smallville,2023)延伸到 Generative Agent Simulations of 1,000 People,后者基于两小时的生平访谈构建数字孪生体,其复现源人类问卷与行为回答的准确度,达到人类两周后复现自己时准确度的 85%。

需要克服的最大障碍:前沿模型是朝着 agent 模型的方向训练的,这让它们很难逼真地模拟真实的人——因此 Simile 用访谈、交易数据以及来自 Open Science Framework 的注册 RCT 进行后训练,专门恢复人类的偏见、不一致性和因果纹理,并报告了模拟质量的早期 scaling law。随着 Shopify 的 SimGym 模拟购物者轨迹,以及腾讯的 十亿 persona 方法处于这个光谱上较为粗糙的一端,焦点小组、用户研究和 A/B 测试小组正在变成推理工作负载。

第八阶段:物理世界(2026,进行中)

表格的最后一行始终没有完全变红,而这正是关键所在。Poolside 的反向高管聘用信精确地划出了这条界线:世界上的问题分为智能受限型(可以通过扩展认知来解决,很快会被开放权重商品化)和实验受限型,对于后者,“再多智能也无法替代真实世界的实验反馈——没有湿实验室,10 万个聪明头脑也治不好癌症。”他们的赌注是:AI 的持久价值将归属于拥有实验回路的人:AI 是“世界上最有价值的科学发现引擎”。

生物领域正从另一个方向打出同样的牌。CZ Biohub 正在把 Human Cell Atlas 成像为虚拟细胞——因为 in silico 大约比 in vivo 便宜且快 1000 倍——并向虚拟免疫系统延伸,Chai、Xaira 以及 Lila 的数据中心形态实验室正在填补 AI-for-science 技术栈。物理世界是唯一无法被完全合成的组件——只能被一个细胞一个细胞地压缩进模型。

指数增长始于对角线

再读一遍这张表格,你会发现第一个模式之下还藏着第二个模式。每一次翻转之前都伴随着同样的反对意见——模型坍塌、幻觉叠加、垃圾进垃圾出——但每一次翻转照样发生了,而且恰好发生在某种验证机制让合成版本变得可信的那一刻:Phi 教科书数据的激进过滤、LLM 评估中的 judge-vs-judge 一致性研究、RLVR 的单元测试和证明检查器、z.ai verifier 的 oracle/no-op 检查、Simile 数字孪生体的注册 RCT、虚拟细胞的湿实验回路。合成的前沿并不是在生成变好时推进的。它是在验证变好时推进的。

这也暗示了它下一步的去向。表格左下角剩余的灰色三角形——物理实验、具身真值——恰恰是验证最慢、最昂贵的区域。模型学会了写作,然后学会了评判,接着学会了练习,再然后学会了实验。这个十年剩下的问题是:它们需要触碰多少现实——又能靠模拟蒙混过去多少。

差 10%,便宜 100 倍,快 10,000 倍……而且这三个维度都在快速改进。

  • 原文链接: x.com/latentspacepod/sta...
  • 鸿途知科网 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~
版权声明

本文仅代表作者观点,不代表区块链技术网立场。
本文系作者授权本站发表,未经许可,不得转载。

发表评论:

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。

热门