区块链 区块链技术 比特币公众号手机端

AI起飞论为时尚早:真实世界与长期任务仍是硬伤

Image

不。智能过于参差不齐,验证器过于脆弱,视野也过于短浅。起飞的条件尚未具备。我们依然缺少 AGI 中的 "G",而且目前我们手中的工具质量,并不一定能带我们抵达那里——尽管它们或许可以成为帮助我们实现 RSI(递归自我改进)的构建模块。

前几天,@AndrewCurran_ 发帖阐述了他的观点:基于 OpenAI 最近在 serving(服务)方面的改进,再加上 AI 解决了 10 个长期悬而未决的数学难题(如今对 AI 来说这已是常见表现),我们现在正处于起飞阶段。我不同意。

Image

https://x.com/AndrewCurran_/status/2083479629982048610

为什么这些令人印象深刻的成果不能证明起飞

人们为什么会这样想其实不难理解:这些成果确实极其惊人,攻克了存在数十年的猜想,技术的进步也令人震撼。但数学和代码是现存最容易被验证的领域,因此基于我们现有的技术手段,突破集中出现在那里是可以预期的;而那些效果不佳的领域(几乎其他所有领域)则不会登上头条。你作为观察者会盯着数学看,因为那里有看得见的东西,于是便忽略了那些毫无成果的领域。

尤其是,Andrew 引用的 serving 改进,与我们今天从公开可用的模型中所了解到的一切都是吻合的;但与我将在本文中讨论的种种局限相比,这些在我看来并不像是起飞已经到来的隐秘迹象。不过,还是要给 @thsottiaux 双倍加分,他巧妙地营造了一个局面,让那些早期的表述完全有理由被这样解读。

我们知道这些模型擅长可验证的领域,但我们也知道(至少在公开层面)我们尚未在信用分配上取得所需的突破,也缺乏长期 RL 所需的稳定性,再加上灾难性遗忘以及其他一大堆问题,这些都使其难以泛化到数学、大部分科学和编码之外的领域。即便以目前的形式存在,在短时间视野的任务上,它依然确实强得不可思议,应当被极其认真地对待。我坚信这项技术极其强大且具有革命性——我每天都在从事相关工作。

Karpathy 的观点:AGI 仍然还有十年之遥

不过,不要只相信我的片面之词。以下就是 @karpathy 在去年年底与 @dwarkesh_sp 的对话中给出的观点,他认为 AGI 距我们仍然还有十年之遥:

Image

@karpathy 谈他与 @dwarkesh_sp 的对话:https://x.com/karpathy/status/1979644538185752935

值得注意的是,Karpathy 恰恰是因为我所担心的那些问题而对 RL 持保留态度;然而公开来看,所有主要实验室目前都主要在使用 RLVR 进行 post-training 流水线。除非我们在他所说的替代学习范式方面看到突破,否则我认为,就这些模型在特定领域之外还能做到什么而言,我们实际上正处在一个局部最大值上。

除此之外,在与世界和人类互动方面,我们普遍也没有好的验证器。这类有损问题本身就定义不清,要构建能够验证它们的机制也非常困难。为一项包含许多相互关联变量的复杂任务定义什么是奖励,再正确地分配这一奖励,以我们目前的方法来说还是过于复杂了。

长视野编码的失败

这些问题的一个绝佳例子——尤其是在编码领域——是我最近从 @dexhorthy 那里了解到的一篇论文。威斯康星大学麦迪逊分校的研究人员(https://arxiv.org/abs/2603.24755)构建了一个长视野编程任务基准测试,用以展示 Agent 在长时间尺度上维护和迭代软件项目的能力表现。

Image

https://www.scbench.ai/leaderboard

即便到了 GPT 5.5 时代,结果依然相当糟糕。没有任何一个问题接近被端到端地解决。他们测试过的最佳模型也只通过了大约 15% 的检查点,而且代码本身会随着 Agent 在自己先前工作的基础上继续构建而不断退化,其"面条化"的速度比人类编写的项目在其整个历史中的退化速度快上好几倍。

在最新一轮模型中,这些问题依然严重存在。Dex 自己在基准测试的一个切片上跑了这些模型,GPT 5.6、Fable 5 和 K3 的检查点通过率大约翻了一倍。

这是实实在在的进步,但没有一次运行能接近干净利落地解决任何单个问题。

Image

https://cloud.dev.codelayer.gg/shared/artifacts/019fb5bd-59b0-707d-806e-0449590a7fd0?key=b5cfbefc-bd79-4b9e-ae23-5b8b9d32d6e8

你可以关注 @dexhorthy,留意他何时发布最新测试的完整报告(我听说很快就要发布了)。

我知道这些都是带有自身局限性的个别例子,但在评估我们正处于时间线上的哪个位置时,你完全可以把它们作为证据的一部分计入考量。

短视野的工作确实令人印象深刻,但这些长视野的局限——我们最容易在编码领域衡量到——对智能体的方方面面都是巨大的问题;这个智能体本应以我们所有人最狂野的科幻梦想所期望的方式,去导航、存在于、支撑并发展我们的未来。

目前,这些模型无法在不严重退化的情况下,持续地将它们过去的决策与当下的决策联系起来。在解决这个问题之前,我们不会从自我改进中获得重大胜利——而正是这些突破,才能为 AI 解锁其余的世界。

什么会改变我的想法

要我同意"正在起飞",我需要看到这些能力变得广泛适用,并且能够在那些显而易见、连我们有限的验证能力都能发挥作用的领域之外,也展现出普遍的胜任力。我尤其希望看到它与世界交互、与人周旋,并在相当长的时间视野内进行因果推理。

我认为,对这些问题的清醒认识很有价值,因为这场战争尚未获胜。在这些事情上保持冷静很重要,因为还有太多工作要做;而指出这条道路上的细微之处,将有助于人们对我们在通往 AGI 之路上所处的位置,有一个更加脚踏实地的判断。

所以,结论是:在 AI 能够达到普通人都能认出它是 AGI 的水平之前,我们还有很多工作要做。到了那个水平,它将深刻影响人们的生活,能够取得突破并自我引导,最终实现我们亟需的重大进步。

  • 原文链接: x.com/kinglycrow/status/...
  • 鸿途知科网 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~
版权声明

本文仅代表作者观点,不代表区块链技术网立场。
本文系作者授权本站发表,未经许可,不得转载。

发表评论:

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。

热门