当智能成本下降100倍时会发生什么——CatalystNeuro

大语言模型的进展通常以“最好的模型现在能做到以前没有任何模型能做到的事”来报道。这是能产生头条新闻的方向,而且它确实令人难以置信。在能力范围顶端的每一步提升,都让模型能够处理以前无法企及的一类任务,无论是修复横跨整个代码库的 bug,还是最近在尚未被任何人解决的悬而未决的数学问题上取得进展。
还有第二个进展方向受到的关注较少,那就是以多低的价格能买到给定水平的能力。大量有用的工作并不需要最聪明的模型,而只需要一个足够好的模型,被应用成千上万次。阅读某个主题的每一篇科学论文、检查档案库中的每一份合同是否包含某个特定条款,或者总结大型讨论论坛中的每一个帖子,都属于这类任务。对于这些任务,问题不在于是否存在能完成工作的模型,而在于它能否在预算内完成一万次这样的工作。天花板解锁新类型的任务;地板解锁规模。
当你为一个应用挑选模型时,你是在权衡它的能力与每次调用的成本。对于 agentic coding,我几乎完全关注能力,总体感觉是工作质量的提升值得花钱,即使存在能力尚可但便宜得多的模型。最近我的注意力被地板的成本吸引了。我们正在测量 DANDI Archive 上共享的数据集在后续发表中被复用的频率,这意味着用模型阅读大约一万篇候选论文,并询问每一篇是否真的复用了数据。按今天的价格,用一款能力在春季处于前沿水平的模型对整个语料库进行一次完整扫描,成本略高于一百美元。按今年三月的价格,同样能力水平的同样扫描要花费数千美元,而一年前这种能力无论花多少钱都买不到。地板的这一变化,正是把这项分析从只能在样本上做的事情变成一个可行项目的原因。我对整个成本谱系上的进展感到惊讶,尤其是便宜的模型变得多么智能。
Artificial Analysis 已经对数百个模型的智能和价格进行了几年的基准测试,其中足够多的数据可以用来重构这种权衡。特别是,这张图展示了智能指数与每任务成本的关系,为不同水平的模型能力提供了现实的成本估算。最上面的一条线是他们定义的 "Pareto line",即给定价格点上能力最强的模型。这条线描述了 LLM 的真正前沿。我从 artificialanalysis.ai 拉取了数据,观察随着新模型的发布,Pareto 前沿是如何移动的。我认为值得花点时间回顾这一进展,并对未来几个月做一些预测。
简短版本:二月份每任务成本为 $1.22 的智能水平,今天只需 $0.022,不到六个月下降了 56 倍,而且下降速度还在加快。按测得的节奏,给定能力水平下降 100 倍大约需要一年,值得问的问题不是这是否会发生,而是它会改变什么。
Artificial Analysis 智能指数
本文通篇的能力轴都是 Artificial Analysis 智能指数,因此有必要弄清楚这个数字是什么。当前版本 v4.1.1 是九项评估的加权平均值,分为四个类别:agentic 任务占 34%,coding 占 24%,科学推理占 24%,通用能力占 18%。权重反映了该领域的关注点所在:三分之一的分数来自模型完成多步骤 agentic 工作的能力,而不是回答考试题目的能力。各组成部分的评估、权重和评分细节记录在 Artificial Analysis 的智能基准测试方法中。
你最终得到的是一个代表模型能力的单一数字,有点像 LLM 的 IQ。它并不完美,两个得分相同的模型可能有不同的强项,但我发现这个分数在指示模型能力方面做得相当不错。
作为一个参照点,Anthropic 的 "Claude 4.5 Sonnet (Reasoning)" 对我和许多其他人来说,是第一次让模型感觉足够强大,可以在 agentic harness 中用于编写代码。当时我在使用 Cline,这个模型相比自动补全和复制/粘贴工作流带来了显著的生产力提升。该模型的智能分数为 37.4(基于今天的智能评分系统)。目前最强的模型是 Claude Opus 5 max effort,分数为 63.1。
为了更直观地感受不同指数水平的含义,我借用了 Simon Willison 的 pelican benchmark:用 "Generate an SVG of a pelican riding a bicycle" 提示模型,然后看看返回什么。这不是指数所测量的内容,但它是任何人都可以用肉眼判断的任务。下面的面板使用 GPT-5.6 系列在指数上的四个点:Luna 的 low、high 和 xhigh effort,以及 Sol 的 max effort。我为每个模型生成了三个样本并展示第一个;所有样本都在网站仓库中。
每个模型针对提示词 "Generate an SVG of a pelican riding a bicycle" 的三个样本中的第一个,于 2026 年 8 月 20 日通过 OpenRouter 生成。智能指数分数来自 Artificial Analysis。
进步是显而易见的:更多细节、更好的比例,以及一只明显在骑自行车而不是悬停在自行车上方的鹈鹕。
测量每任务成本
每 Token 成本很容易获得,但不同模型可能使用数量差异很大的 Token,因此更好地指示模型成本的指标需要考虑这一点。每任务成本是 Artificial Analysis 自己测量的数字:运行其智能指数评估套件中一个任务的平均美元成本,包括运行期间实际计费的输入、推理和答案 Token。网站上有显示,但免费 API 层级不包含它,所以我是从网站上每个模型页面中嵌入的数据里抓取的,涵盖他们目前进行基准测试的模型以及页面仍保留该测量的已退役模型(较旧的 Claude Opus 和 Sonnet 版本、GPT-5.x 系列等)。这得到了 137 个模型的测量成本,最早追溯到 2024 年 12 月的 DeepSeek V3,每个模型都配有发布日期和当前量表上的智能指数分数。
前沿是如何移动的
本节中的图表是 2026 年 8 月 19 日(本文撰写日期)的快照。两张图表和分层表的实时版本每周从同一数据源刷新,位于 LLM Cost Frontier 仪表板上。
移动的 Pareto 前沿
下面的图表绘制了智能与测得的每任务成本的关系,并描绘了 Pareto 前沿——达到每个智能水平的最便宜方式——包括它今天的状况以及过去一年中每隔两个月的状况,使用每个模型的发布日期来重构当时可用的模型。图表一次构建一条前沿,在完整画面上暂停,然后重复;使用按钮可以停止它。悬停在任何点上可以查看其背后的模型。
智能指数与每个智能指数任务的测量成本(对数刻度)。小点是全部 137 个测量模型在其最后一次测量成本时的状态,按其发布的两个月窗口着色(2025 年 8 月之前的模型归入 2025 年 8 月窗口)。空心点(无论大小)是开放权重模型;实心点是专有模型。悬停在任何点上可查看其详细信息,包括 Artificial Analysis 是否已将其从实时基准测试中退役。每条线描绘了在快照日期之前发布的模型中达到给定智能指数的最便宜方式;标记就是前沿模型本身。在相继的前沿共享同一段的地方,较旧的线绘制在上面,因此只有在前沿实际移动的地方才能看到较新的线。页面不再带有测量成本的模型(其中包括 o3 和 GPT-5.3 Codex)不在图中(参见注意事项)。
每一条相继出现的前沿都位于前一条的上方和左侧:同样的成本获得更多智能,或者同样的智能花更少的钱。这种移动的速度正在加快。2025 年下半年,前沿缓慢推进:8 月到 10 月之间只有两个小的凸起,10 月到 12 月之间只有一个。2 月和 4 月的前沿各自移动了曲线的很大一部分,而最后两个快照几乎完全替换了前沿,6 月前沿的十一个模型中有十个是 4 月之后新出现的,今天十六个模型中有十五个是 6 月之后新出现的。
右边缘讲述了能力的故事。前沿的天花板从 2025 年 8 月的指数 35.3(GPT-5,每任务 $0.26)上升到当年 10 月的 37.4(Claude 4.5 Sonnet)、2 月的 48.4(Claude Sonnet 4.6)、4 月的 55.0(Claude Opus 4.7,$2.23)、6 月的 62.1(Claude Fable 5,$3.14),以及今天的 63.1(Claude Opus 5,$2.34):一年内上升了二十八个智能指数点。左半部分显示了便宜模型智能的提升。截至 2026 年 8 月 19 日,GPT-5.6 Luna 的 effort 阶梯现在几乎占据了指数 52 以下的所有位置,2025 年 8 月天花板所对应的水平现在每任务只需 $0.0088。2026 年 6 月的前沿异常地由开放权重模型主导:其十一个模型中有六个是开放的(其中包括 MiMo-V2.5、DeepSeek V4 Pro、MiniMax-M3 和 GLM-5.2),它们占据了指数 38 到 53 之间的整个中段。在更早的快照中,开放模型只出现在范围的底部,而今天,在 GPT-5.6 Luna 发布之后,十六个前沿模型中只有两个是开放的。
请注意,单个模型可以通过不同的推理级别覆盖这个范围的很大一部分:GPT-5.6 Luna 阶梯从 low effort 的 $0.0088 到 max 的 $0.047,覆盖了前沿的整个下半部分,而 Claude Opus 5 从 low effort 的 $0.43 到 max 的 $2.34,在此过程中可以买到大约十个智能指数点。Effort 现在是成本/智能权衡中的一个关键旋钮,因此,成本和智能密不可分地联系在一起。
各层级的成本记录
下面的记录图追踪了任何已发布模型在给定智能指数层级或以上所达到的最低测量每任务成本。该序列对于较低层级可追溯到 2025 年年中,更高的层级在可用时出现。
每一步都是一个为其层级创下新低的已发布模型;空心标记是开放权重模型,实心标记是专有模型。一个层级的线从第一个有测量成本的模型跨越该智能指数阈值时开始。GPT-5.6 Luna 从 7 月 9 日起按其发布价格绘制,从 7 月 30 日降价起按其当前价格绘制;所有其他成本反映当前价格(参见注意事项)。
| 层级 | 首次测量跨越 | 成本崩塌 | 减半时间 |
|---|---|---|---|
| 指数 ≥ 30 | 2025 年 8 月(GPT-5 high) | 29 倍 | ~73 天 |
| 指数 ≥ 40 | 2026 年 2 月(Claude Sonnet 4.6) | 56 倍 | ~28 天 |
| 指数 ≥ 50 | 2026 年 3 月(GPT-5.4 xhigh) | 35 倍 | ~29 天 |
| 指数 ≥ 60 | 2026 年 6 月(Claude Fable 5 max) | 3.8 倍 | ~34 天 |
一个能力水平首先由一个大型前沿模型以溢价价格达到。一段时间后,更便宜的模型达到同一水平,记录下降一个数量级或更多。≥ 40 层级由 2 月的 Claude Sonnet 4.6 开启,每任务 $1.22,两天内就被每任务 $0.33 的 Gemini 3.1 Pro Preview 超越;开放权重模型 MiMo-V2.5-Pro 在 4 月将记录削减到 $0.034,而 GPT-5.6 Luna 的 high effort 今天以 $0.022 保持这一记录。≥ 50 层级在一个月后遵循同样的轨迹:GPT-5.4 在 3 月以 $1.10 跨越它,GPT-5.5 然后是 GLM-5.2 和 Grok 4.5 在整个春季逐步压低记录,GPT-5.6 Luna 的 xhigh 设置在 7 月 9 日发布时以 $0.16 拿下记录,而 OpenAI 在 7 月 30 日的 80% 降价将其带到 $0.032,五个月内下降了 35 倍。
首次跨越通常是一个以发布溢价定价的 max effort 前沿模型,最常来自 Anthropic 或 OpenAI。随后,大实验室的小型蒸馏模型(GPT-5.6 Luna 系列保持着当前四个记录中的三个)和开放权重发布(MiMo、DeepSeek V4、GLM、Hy3)大幅压低价格。在历史足够长可以测量的层级中,记录大约每四到十周减半一次。
顶层是溢价得以幸存的地方。只有六个模型得分达到 60 或以上,其中最便宜的 Grok 4.6 每任务仍需 $0.84。但该记录自 6 月以来已下降了 3.8 倍,如果较低层级的模式成立,这个水平的蒸馏模型应该会在一两个季度内把价格打下来。
对我来说,最令人印象深刻的结果是 OpenAI 的 "GPT-5.6 Luna" 在其智能水平下的低价格。现在,10 个月前引发 coding harness 革命的 Anthropic "Claude 4.5 Sonnet (Reasoning)" 的智能,使用 "GPT-5.6 Luna (medium)" 只需 1/40 的成本就能获得!这个数字取决于 7 月 30 日的降价;在 Luna 三周前的发布价格下,它会是 1/8。
注意事项
最重要的局限是,成本是按发布日期索引的最新测量值,而不是发布时采集的历史测量值。价格在模型的生命周期内会被削减,因此早期的点反映了自发布以来的任何降价,这使分析偏向于低估崩塌幅度并偏向于把日期定得太早。我修正过的唯一一次降价是最近最大的一次:OpenAI 在 2026 年 7 月 30 日将 GPT-5.6 Luna 的价格削减了 80%,即其 7 月 9 日发布三周后(Terra 同日降价 20%,Sol 未变)。由于降价不会改变一个任务使用的 Token 数量,我通过用价格比率缩放测量值来重构了 Luna 发布时的每任务成本,并且在记录图表和表格中,Luna 的记录日期定为降价日,而不是发布日。这使三个较低层级的测量减半时间各延长了几天。其他模型可能有过我没有发现的降价,而已退役模型的最后一次测量价格可能不是它发布时的价格。覆盖范围是第二个问题。已退役的模型只有在其页面仍保留测量数据时才会被纳入,这在 228 个有价格和分数的退役模型中找回了 44 个;其余的,包括 o3、GPT-5.3 Codex 以及 GPT-4 时代的所有模型,都是不可见的,因此最古老的前沿所依赖的模型比实际存在的要少,而较低层级的真正起始价格很可能是由本分析看不到的模型设定的。
已退役模型的智能指数分数是按当前量表计算的,但指数本身是许多评估的一种聚合。而且评估套件上的每任务成本是一种带有长提示词的重推理工作负载;带有短提示词和短答案的聊天工作负载在不同模型之间的缩放方式会不同,尤其是在推理与非推理变体之间。
预测
外推测量速率是有风险的,因为每次崩塌都是一个竞争事件而不是一条定律,但这些轨迹已经足够规律,值得给出具体数字。按 ≥ 60 层级当前约 34 天的减半时间,Grok 4.6 的 $0.84 记录将在 12 月初左右跌破十美分。指数 55 目前由 Grok 4.5 以 $0.36 保持,到 10 月中旬应该会低于一毛钱。天花板更难预测:它在一年内攀升了二十八个点,但自 6 月以来只上升了一个点,这看起来是当前指数的饱和,而不是模型的放缓,所以我预计那里的下一个里程碑将是指数修订,而不是一个大数字。如果最后四个层级的模式成立,无论修订后的指数把什么称为前沿,它都会以每任务几美元的价格首次亮相,并在一个季度内被商品化。
进展的两个方向
进展的两个方向服务于不同类型的工作。更高的天花板改变了什么在根本上是可能的:去年没有任何模型能做而现在有一个模型能做的任务。更低的地板改变了什么在大规模上是可负担的:一个模型已经能做但不能做一万次的任务。促成这篇文章的文献扫描就是一个地板问题。模型只需要阅读一篇论文并回答一个定义明确的问题,远低于当前前沿的模型都能可靠地处理,但它需要对每一篇候选论文都这样做,而每篇论文 $1 和 $0.02 之间的差别就是试点研究和完整普查之间的差别。法律证据开示、系统综述、大规模数据整理、内容审核和客户支持分诊都具有同样的形态,它们全部都在大约每隔几个月便宜一个数量级,而工作本身没有任何变化。实际后果是,值得用模型尝试的问题集合正在从两端同时扩张,而便宜端的扩张是最容易被忽视的。
更便宜的智能意味着更多的支出
对这些图表的一种自然解读是,LLM 上的支出应该正在下降。实际情况恰恰相反。1865 年,William Stanley Jevons 观察到,更高效的蒸汽机(每单位工作需要的煤更少)反而增加了英国的总煤炭消耗量而不是减少它,因为更便宜的工作找到了多得多的用途。当单位智能的成本下降 30 倍时,同样的动态也适用。已经在做的工作变得更便宜,但大得多的效应是那些因为达不到门槛而根本没有在做的工作。这种现象后来被称为 Jevons 悖论。我们的文献扫描就是一个小的例子:按去年的价格,它最多只会在一个样本上运行一次,而按今年的价格,我们在整个语料库上运行它,当 pipeline 变化时重复运行,并计划对每个阳性结果运行三次以减少噪声。每篇论文的成本下降了一个多数量级,而我们在这个项目上的总支出上升了。给定价格下对智能的需求似乎具有高度弹性,只要这一点成立,下降的前沿就会转化为消耗更多的 Token,而不是花更少的钱。
前沿的移动比任何单个发布都更可预测。到目前为止,每个能力层级都遵循同样的轨迹:溢价首次亮相、快速商品化、由蒸馏模型或开放权重模型以首次亮相价格的百分之几保持的稳定记录。如果一种能力今天以任何价格存在,合理的规划假设是它将在几个月内以商品价格存在。对于系统设计而言,这支持这样的架构:模型是一个可替换的组件,能力层级之间的路由是显式的,因为层级边界本身尚未稳定,也没有很快稳定的迹象。
市场上出现的模型路由器是这一趋势正在被落地实施的标志。OpenRouter 现在提供一个路由器,它接受一个最低能力分数,并将每个请求发送到 Artificial Analysis 前沿上满足该分数的最便宜模型,这样系统就能自动从移动的前沿中受益,无需开发者去追踪。把模型名称硬编码到应用程序中已经成为多付钱的最快方式。
100 倍会改变什么
如果去年的节奏保持下去,2026 年初每任务成本为一美元的能力到年底将只需一美分,而今天每任务成本为几美元的指数 60 模型将在一两个季度内低于一毛钱。我想谨慎行事,不基于一年的数据过度推断,但有几个后果可以直接从这些数字中得出。
阅读一切成为默认。在每份文档一美分的价格下,模型可以例行公事地阅读一个领域的每一篇论文、档案库中的每一条记录、每一封电子邮件,或支持队列中的每一条消息,问题从查看哪些文档转变为向所有文档提出哪些问题。像我们的复用普查这样的项目不再是项目,而变成监控:扫描可以在每一篇新发表的论文出现时运行。多遍工作流成为常态,因为运行一个任务三次并取共识的成本比几个月抢跑一次还要低,而且由此带来的准确率提升很大。能力层级本身也不再是描述系统的有意义方式,因为 pipeline 会把每一步路由到它需要的任何智能水平,无论那个水平那一周的成本是多少。在那个世界里,稀缺的资源不是智能,而是关于把它指向什么的判断、用来校验它的 ground truth,以及大规模运行它的系统。这些是工作中不会变得更便宜的部分。
模型元数据于 2026 年 8 月 19 日从 Artificial Analysis 免费 API 拉取,每任务测量成本从 artificialanalysis.ai 上的模型页面抓取。数据在 LLM Cost Frontier 仪表板上保持最新。欢迎指正。
- 原文链接: catalystneuro.com/blog/c...
- 鸿途知科网 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~
版权声明
本文仅代表作者观点,不代表区块链技术网立场。
本文系作者授权本站发表,未经许可,不得转载。
鸿途知科网
发表评论:
◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。