Grok 4.6:可靠的全能主力模型

Grok 4.6 发布啦!过去几周,我把它当作日常主力模型,用于常规的编程和知识工作,并专门用它构建了几个项目,去试探它在哪些地方能够扛得住。
它在所有这些方面都表现出色。最突出的并不是某项能力的单点跃升,而是它的沟通方式和速度。

信息密度极高的沟通
它很擅长协作,让人乐于与它共事。它给出的摘要信息密度很高,都是实实在在的内容,而不是把任务原样复述一遍;它在运行中给出的简短进度更新,也足以让我判断是否需要打断它。
处理小改动时它会保持安静,一旦涉及大量文件,它就会开始说明。要把这个切换分寸调得恰到好处,花的功夫比想象中更多。它有时仍会告诉我一些我不需要的信息,这也是我们正在改进的地方。
令人愉悦的速度
4.5 也很快。4.6 不仅快,而且明显更聪明,这两者的结合促使我转向更同步的工作方式。我不会预先塞入大量上下文然后干等,而是先提出一个小需求,查看结果,再继续推进。同一个会话中,只要提出请求,就能无缝转入更长期的任务。
我会根据当月最强模型恰好擅长什么,在同步与异步之间切换。异步工作方式能在我分身他处时完成更多事情,但我容易丢失思路,最后只能毫无头绪地审一大段 diff。4.6 把我拉回了同步模式,而在我看重结果时,这也是我更愿意待的地方。
那几周里,大部分时间做的都是普通工作。它替我浏览网站,包括在服务商控制台里点击创建 API 密钥。它对运行中的应用做了功能和视觉 QA。它把收件箱精简到只剩少数几个真正需要回复的邮件线程,这种感觉永远不会让人厌倦。它还帮我起草了 Cursor SDK Bridge 和 /rename-chat 的发布推文,并用 Remotion 为两者制作了一支发布视频!
简短提示词,严格验证
那几周里有一部分时间,我在对比测试不同的提示词风格:长提示词与短提示词的对比,以及诸如“非常努力地工作”这类特定措辞是否会改变结果。我发现措辞本身没有任何影响。
长度确实有影响,但影响方式和我预想的不同。长提示词换来的是具体性,因此如果你确切知道自己想要什么,就把它写下来。短提示词则是把更多决策交给模型的审美判断。过去在这种权衡之下,通常的结论是把所有内容都写清楚。到了 4.6,它的审美已经足够好,短提示词加上明确的偏好,通常就能得到不错的结果。
如果你手里确实有一份详细规范,长规范仍然很好用。我给了一份关于反馈小组件的详细规范,它带有会话捕获、服务端处理器和云 Agent 派发功能,它从头到尾完整实现了,结构也很合理。不过它确实会在组件里出现重复,除非你要求它拆分。
我构建的项目中有一个是电子表格应用,我把同一任务分别交给两个模型,每个模型各试了两次。其中一轮我提供了一份两页的规范说明,涵盖了我能想到的每一个工具栏按钮、键盘快捷键和公式;另一轮只给了三句话。
用 Next.js 构建一个精致的 Sheets/Excel 风格应用,并带上一个能分析表格的 AI 聊天功能。所有 AI 功能都使用 Cursor SDK。预加载一份逼真的示例工作簿,让它看起来立刻就很专业。
两个应用产出的结果几乎一模一样。真正改变结果的,是额外加上的一句话:
实现完成后验证功能和设计,并持续迭代、验证,直到达到生产就绪状态。
这句话是我那几周里发现的最具杠杆效应的做法!有了它,模型会打开应用,按真实用户路径点击操作,检查嵌套公式是否计算正确,并修复发现的问题。没有扎实的浏览器操作能力,这一切都不可能实现——正是这种能力让验证循环得以成立。
当输出结果更难检查时,同样的原则依然成立。让模型“改进 3D 场景的纹理”毫无进展;而“捕获当前帧,列出画面中的问题,然后只修复这些问题”则立刻见效。
由此之后的每次对比,我都让两个模型在互相隔离的工作区中运行同一套提示词,所以这些结论不是凭我上个月的记忆得出的。

你也不需要告诉它要努力工作或持续推进直到做完。它自己就会坚持相当长的时间。更关键的是说清楚“完成”意味着什么,否则它会替你来定义。
走得更远
我成长过程中玩了多得离谱的《帝国时代 2》,足有数千小时。因此重现它是我想尝试的第一个项目。我要求做一个浏览器策略游戏,包含经济系统、建造、战斗、战争迷雾、目标,以及一个新玩家无需说明就能看懂的 HUD。

4.5 构建了一个可玩的平面原型。4.6 第一次就拿出了等距视角的 3D 世界,HUD 和小地图也已经就位。更接近真正的游戏了!
怀旧之旅还在继续,我接着做了 MSN Messenger。

两个模型显然都了解这个经典参考,而且做得不错。4.6 只是整体上更精致,连独立的会话窗口和眨眼动画都还原到位了。
我经常使用 Excalidraw,而它是开源的,这使它顺理成章地成为检验模型处理真实代码库(而不是空文件夹)的场所。我让两个模型都实现一个演示模式:保存命名视图、对它们重新排序,并以引导式讲解的方式展示。提示词刻意没有说明具体实现方式。

两个模型产出的结果大致相同,对于那么模糊的提示词来说已经相当出众了!4.6 只是第一轮就更注重细节,实际体验就是我不需要反复指出问题。
这里也正好是跳过验证会出问题的地方。在较早的一次运行中,摘要读起来像是已经完成了,但添加视图的功能实际上并不能用。仅仅一轮“运行起来给我看看”,就暴露了那个损坏的导入。
日常工作
我并不是每天都会做演示文稿和报告,但很多人会,我想看看它处理这类工作时的表现。于是我把同一份虚构的季度数据同时交给两个模型,要求生成一份董事会演示文稿。

两者都能胜任,差距主要在呈现方式而非分析内容。4.5 基本只是把数据堆在幻灯片上,而 4.6 在结构和层级上花了真功夫,所以读起来像一份真人制作的 deck,而不是一次数据倾倒。
视频即代码
这一部分值得多写一些,因为最近我在上面花了很多时间。Remotion 是“视频即代码”:每一帧都是一个 React 组件,根据当前帧序号渲染,整个项目通过无头 Chromium 和 FFmpeg 编译成 MP4。你的视频就存在于 git 中。这是一种非常好玩的创作方式!不过把它交给模型去做也有些不寻常,因为你无法通过“它能运行”来判定是否成功。
我要求为 X TypeScript SDK 制作一支 60 到 90 秒的发布影片,并把官方文档交给它作参考。

我会从两条标准来评判:是否有故事线,以及节奏是否撑得住。大多数模型都在这里以同样的方式失败:全大写标题、带边框的文字、所有内容同时砸在屏幕上。两支影片都避开了大部分这些毛病,而 4.6 那支更引人入胜。
在不同模型上持续测试几天后,我发现视频是差距最大的领域。两个在 Web 应用上水平相当的模型,到了这里可能一个天上一个地下。
需要引导的地方
几乎所有需要我去引导的地方,都归结到同一件事:模型能否方便地验证自己的工作。
网站是最简单的情形。DOM 就是文本,它可以读取页面、截图,再和它原本的意图做对比。这正是验证循环在 UI 工作中效果这么好的原因。
3D 就更难了,因为多了一个无法靠阅读来检查的维度。视频还要更难,因为额外维度是时间,检查工作意味着捕获一帧帧画面,并分析帧与帧之间的差异。物理模拟也面临同样的问题。模型对世界应有的行为有很好的直觉,但要确认它确实按预期运转,不是一张截图就能回答的。
务实的答案是给它一种“观察”的手段,或者接受由你来检查。
为什么它是我的默认选择
特长突出的模型确实有真正的价值——那些在特定领域表现非凡的模型。但我绝大部分工作并不是某一件特定的事。我日常想要的是一个我非常了解的模型:我已经对它会有怎样的表现建立起了直觉,它可靠到可以放心地把事情交给它,而且我足够了解它的短板,能不加思考地绕过去。
这正是 4.6 在我这里变成的样子。在编程层面,它能处理我边看边反馈的交互式和视觉化工作,也能在真实仓库中长时间作战。在知识工作层面,它能担当收件箱整理、浏览器 QA,以及背后没有 API 的点击操作任务。它在任何一项上都不是能想象到的最强模型,但在所有方面都做得好,而且我清楚能期待什么。
在那些以外观为评判标准的地方,我仍然会参与其中。动效、3D 和最终打磨需要的是参考图和截图循环,而不是一段描述。我也会把验收标准写下来,而不是轻信一句“完成了”的摘要。
试试看
Grok 4.6 现已上线,可以在 Cursor、SpaceXAI API、OpenRouter 以及任何你获取 Token 的地方使用!
快来试一试,并让我知道你的想法。我们会持续改进它,所以无论反馈好坏都请告诉我们,这能让我们知道下一步该往哪里使劲。
期待听到你最终用 Grok 4.6 做出了什么!
- 原文链接: x.com/ericzakariasson/st...
- 鸿途知科网 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~
版权声明
本文仅代表作者观点,不代表区块链技术网立场。
本文系作者授权本站发表,未经许可,不得转载。
鸿途知科网
发表评论:
◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。