8 月 12 日,Grok 4.6 发布。它没有 GPT 发新模型那样的排面,也没复制 Claude 满屏跑分和实测刷屏的热闹。Grok 的讨论声量像一次平常的小更新,别的 AI 新闻很快就把它盖了过去。但硅星人发现,舆论声量不大,却有越来越多开发者把 Grok 4.6 当主力模型,用它替代 GPT 和 Claude。而就在几个月前,几乎没人这么做。当时的 Grok 是马斯克 AI 版图里最大的烂摊子,除了吐槽和擦边,远不如其他模型,一会偏左一会偏右把自己玩成监管事故。如今 Grok 又是怎么翻盘的?Grok 4.6 不是 SOTA 但够用Grok 4.6 不是横扫榜单的 SOTA 模型,但够用。在 Artificial Analysis 的智力指数中,Grok 4.6 得到 61 分,与 GPT-5.6 Sol Max 持平,只比 Fable 5 Max 少一分。在自家的 CursorBench 3.2 中,它得到 69.9%,同样没有排名第一。但比起上一代,Grok 4.6 真正补上的是日常使用中的那些短板。它处理复杂任务、调用工具、长时间连续工作的能力都明显变强了。以前 Grok 执行到一半容易卡住,需要用户不断纠正,现在已经能够主动检查结果、发现错误,推进任务。换句话说,Grok 4.6 不一定是每道题最聪明的选手,却已经成为一个相当能干的“全能选手”。挑选日常使用的主力模型,毕竟不是在给模型办运动会,单项夺冠固然亮眼,没有致命短板,反而更加重要。只要能够覆盖一天里的大多数任务,不需要用户频繁切换 GPT 或 Claude,就已经具备成为主力工具的资格。Grok 4.6 跨过的正是普通模型被使用的"斩杀线"。此外,当 AI 从偶尔问答变成每天跑几个小时的 Agent,用户算的就不只是智力,还有价格。跑分高出 5% 很诱人,但不可控的价格更吓人。价格,正是 Grok 4.6 这次翻盘的第二张牌。便宜,就是 Grok 的杀手锏当模型能力跨过"够用"这条线,价格就开始变得重要。Grok 4.6 不是市场上最便宜的模型,却是前沿模型中最便宜的一个,能力只差一点,输出价格却只有对手的四分之一左右。Grok 4.6 的 API 价格是每百万 token 输入 2 美元、输出 6 美元。作为对比,GPT-5.6 Sol 是输入 5 美元、输出 30 美元,Claude Opus 5 则是输入 5 美元、输出 25 美元。在 Agent 场景里,价格的差距会被放大。粗略算一笔账:一个项目消耗 1000 万输入 token 和 200 万输出 token,先不考虑缓存、长上下文计价和不同 Agent 的 token 效率,用 Grok 4.6 大约要 32 美元,换成 GPT-5.6 Sol 则要 110 美元。再说会员本身。先不提花 900 美元买一年 Grok Heavy 会员那种邪修方法。不少用户觉得Grok正价会员就足够耐用。此外,如果你真是重度用户,花 300 美元买 SuperGrok Heavy,会同时拿到价值 200 美元的 Cursor Ultra。而这个 Ultra 会员每月含 400 美元 API Agent 用量,外加 Cursor 给的额外奖励额度。日常使用中,其实没有那么多非 SOTA 模型不可的任务。模型聪明固然更好,但如果它价格更贵、速度更慢,还随时可能撞上额度,用起来反而束手束脚。Grok 的优势恰好出现在这里,能力已经跨过够用线,价格足够低,会员额度也相对耐烧。开发者们也更愿意使用 Grok。收购 Cursor 后,Harness 完善了模型足够聪明、足够便宜,Harness 也同样重要。开发者实际使用的是模型外面的 Harness。它负责读取仓库、管理上下文、调用终端、运行测试,以及在任务失败后继续修复。模型决定 Agent 有多聪明,Harness 决定它能不能把活干完。这恰好是过去 Grok 的短板。OpenAI 有 Codex,Anthropic 有 Claude Code,Grok 却长期停留在聊天框和 API 中。xAI 收购 Cursor 后一口气补齐了从模型训练、Agent 执行到代码托管的整套 Harness。Grok Build 可以在终端中读取和修改代码、执行命令、运行测试,还能调用多个子 Agent 并行工作。8 月 18 日,Cursor 又推出代码托管平台 Origin,支持代码仓库、Pull Request、代码浏览和 GitHub 同步,被 Cursor 称作"面向 Agent 时代的 Git 平台"。至此,Grok 提供模型,Build 负责执行,Cursor 提供工作台,Origin 管理代码资产。过去分散在不同产品中的开发链路,被装进了同一套系统。Grok 的翻盘也因此不再只是模型升级,它终于长出了真正干活的手和脚。难得的窗口期Grok 的翻盘,也恰好赶上了一个微妙的窗口期。Codex 依然强,但额度越来越难以预估。不少老用户觉得,同额度正在变得越来越不经用。而那种反复重置用量的玩法,刚开始还能制造惊喜,次数多了,用户也疲了。Claude Code 更是一身负面。有 Max 20x 用户报告,同样的任务,额度消耗突然快了 4 到 8 倍。还有子 Agent 异常递归,不到五分钟就烧光整个五小时窗口。服务稳定性也拖了后腿。8 月 12 日至 17 日,Anthropic 官方状态页就连续记录异常,其中多次直接影响 Claude Code。最近,Anthropic 又宣布给新模型生成的文本加入不可见水印,Claude Code 也在覆盖范围内。用户付费生成的代码和文档可能携带可检测的 AI 标记,这对于很多开发者来说是很难接受的。商业世界里的翻盘,往往需要两股力量同时出现:自己争气,对手给机会。前者决定你有没有资格站上牌桌,后者决定用户是否愿意离开原来的工具。技术进步只能缩短差距,真正打开市场缺口的,常常是领先者亲手透支了信任。很多逆袭者并不是突然变得无可替代,只是在那个微妙的窗口里,成了最少让人失望的选择。大模型没有最终赢家Grok 4.6 还不是公认最强的模型,它的价格优势也未必能够永远持续。今天 xAI 可以用低价和大额度抢用户,明天同样可能收紧套餐、调整规则。开发者把它换上,并不意味着从此不会再换下来。但这次变化仍然值得关注。它说明前沿模型的竞争,正在从"谁最聪明"转向"谁最适合一直开着"。跑分决定发布当天的热度,但价格、额度、Harness 和稳定性,决定几个月后的使用习惯。开发者对模型没有多少忠诚度。谁能把活干完,谁就留在工作流里,谁总在关键时刻掉链子,再高的跑分也只能成为备用选项。几个月前,人们还在讨论马斯克是不是毁了 Grok。如今,Grok 没有靠一场轰动的发布会洗掉过去,而是靠一次次完成任务,悄悄挤进了开发者的工作流。模型世界真正的投票从来不是榜单,而是编辑器里的每一次回车、额度条上的每一格,以及账单。如果大模型公司真想把模型当作工具运营,而不是靠一次次发布和跑分来抬高估值,就必须接受一个不那么性感的事实:用户购买的不是实验室里的智力上限,而是现实工作中的稳定产出。一款模型只有发布当天令人兴奋,还算不上生产力工具。
无人在意的角落,Grok 成了开发者们的新欢
来源:PingWest
2026年09月01日 06:01
0 阅读
分享到: