缓存读取价砍 75%:Fable 5.1 真正想卖的不是跑分

缓存读取价砍 75%:Fable 5.1 真正想卖的不是跑分

每百万 token 的缓存读取价格,从 1 美元降到 0.25 美元,降幅 75%。 这是 Claude Fable 5.1 发布里最不起眼、也最值钱的一个数字。它躺在定价表最偏僻的角落,不如那些基准测试榜单显眼,却决定了 agent 跑长任务时真正的成本。 标准输入、输出价格没动,还是每百万 token 10 美元和 50 美元。Anthropic 只动了缓存读取这一项。但 agent 的成本结构和一次性聊天完全不同:一个连续工作几小时的编程 agent,会反复读取同一套代码、系统提示、工具定义和任务历史。如果每次工具调用都按标准输入价算,任务跑得越久,重复上下文越贵。缓存让系统保存已经处理过的上下文,后续只付便宜的读取费。所以这一行价格砍掉 75%,Anthropic 才敢说「典型负载省约 25%,重度 agent 任务省到 45%」。 先澄清一件事:Fable 5.1 和 Mythos 5.1,是同一个模型的两种部署方式。区别不在智力,在安全保护级别。Fable 5.1 面向所有人开放,带网络安全和生物安全防护:一部分高风险请求被拦截,另一部分被路由到更弱的 Opus 系列。Mythos 5.1 保留更多原始能力,只通过受信访问计划提供给经过审核的网络安全和生命科学机构。 换句话说,Anthropic 这次在尝试把「模型能力」和「模型开放程度」拆开管理——不再为了降风险直接削弱整个模型,而是按用户身份、任务类型、使用环境,给不同层级的能力。这件事比任何一个跑分数字都更值得注意。 跑分当然也涨了。8 项公开基准全部第一,智能体科学研究最夸张:Terminal-Bench-Science 上 Fable 5.1 拿到 52.6%,是 Fable 5(24.7%)的两倍多,也甩开 GPT-5.6 Sol 的 22.4%。但这些数字,任何一个发了大模型的厂商都拿得出来。真正新的东西,在跑分之外。 反蒸馏机制,是这次最值得讲的部分。 从今天起,新注册的 API 账户没法再这么干:在多轮对话里手动篡改 Claude 的上下文,同时保留思维链记录。之前有一种公开记录的常见手法——篡改 Claude 之前的上下文,但刻意保留思维链,就能在一组新的、可能带对抗性的指令下,重放模型在另一组指令下产生的推理过程。这条路现在被堵死了。 堵法是一套签名机制。每个思维链区块被加上一个签名。当你把助手的回复在后续请求里发回 API,系统用这个签名做两件事:验证当前模型有没有权限读这个区块,以及验证这个区块之前的整段对话——系统提示、工具列表、所有历史消息——是不是和当初生成它时一模一样。任何一处被动过,校验就失败。 失败之后怎么处理,取决于开发者设的一个参数 prefix_mismatch_behavior:默认是 error,直接返回 400 拒绝请求;设成 drop_block,系统就静默丢掉这个区块以及它之后的所有思维链,请求照常执行。被丢的部分不计费,还会在响应的 input_transformations 里列出来。 哪些操作会触发失败?编辑、重排或删除任何历史消息,改顶层系统提示,对工具列表增删改名,从对话中间抽掉某个思维链区块却保留后面的,引用一个在两次请求间返回了不同内容的图片或文档 URL——都会让后续所有思维链区块失效。反过来,在对话末尾追加新消息、从历史开头移除思维链、改 max_tokens、增减 cache_control 标记、服务端的 compaction 和上下文编辑,这些是安全的。 还有一个链式设计:每个思维链区块会记录前一个区块的信息,形成一条跨轮次的链。从链条头部摘区块可以,但从中间抽掉一个,后面每一个都跟着失效,整条链从断裂处往后全部作废。 如果你用 Claude Code、claude.ai 或 Claude Agent SDK,这些官方产品已经自动保证对话前缀不被篡改,什么都不用改。直接调 Messages API 的开发者就得多留个心眼:把 messages 数组严格当 append-only 用,再在 drop_block 模式下跑一遍完整多轮会话,看日志里有没有 prefix_binding_mismatch 条目。 这个机制是冲着蒸馏去的。它不拦你调 API,拦的是「拿到别人的推理过程再重新灌进去」这条路。 跑分和价格之外,还有个被反复念叨的点:Anthropic 说 Fable 5.1 会减少「看起来快、实际降低质量」的走捷径行为,更愿意追根因。投资机构 Millennium 给了一个案例:一段内部代码有个约百万次运行才出现一次的崩溃,工程师花了四五年没查清原因,Fable 5 也不行。Fable 5.1 分析外部供应商的程序库,把反汇编结果和核心转储文件比对,最终定位到那个外部库的缺陷。 这种叙事听听就好,毕竟来自早期合作伙伴。代码评审平台 CodeRabbit 的独立测试泼了盆冷水:45 项评审任务、105 个已知问题点,Fable 5.1 找出 64 个,Fable 5 找出 65 个,召回率几乎没变。它没有发现更多问题,但生成的评论从 253 条减到 166 条,挑剔式意见从 265 条降到 79 条,精确率从 32.8% 升到 37.3%——输出更克制了。代价是速度:一次评审平均 18 分 38 秒,比 Fable 5 的 12 分 32 秒慢了近 49%。而且在这组测试里,拉高推理强度反而更慢、召回率更低,CodeRabbit 的建议是日常用 Low 档。 这等于给 Fable 5.1 划了条边界:它不是所有编程任务的默认选择。小 PR 用它太贵太慢,只有跨多文件、要理解整个代码库的复杂任务,更长的分析过程才有价值。 Anthropic 这次花了大篇幅展示的,是科学研究能力,而不是 Claude Code。Mythos 5.1 调用开源蛋白质设计和折叠工具生成结合剂,交给两家外部机构做实验:三个靶点上,它设计的结合剂亲和力比 Adaptyv Bio 竞赛最佳方案高 10 倍;12 个靶点命中率接近 50%,行业典型水平是 10% 到 15%。Fable 5.1 拿 NASA 麦哲伦号 30 多年前的雷达数据训练神经网络,重绘了金星三分之一表面的高分辨率地形图,分辨率从 10-20 公里提到 2-3 公里,已用 CC 协议开源。Mythos 5.1 还给七个开源蛋白质和基因组模型写了定制 GPU kernel,推理速度最高快 2.5 倍,GPU 成本预计省 30% 到 60%,这些优化近期会开源。 这些案例和普通问答的区别在于,模型的输出离开了文本环境,开始接受真实世界验证:蛋白质必须在实验室里真的结合,GPU kernel 必须产出完全一致的结果。角色变了——模型不再只负责搜论文、总结知识,而是进入「提方案、调工具、跑计算、出候选、接受验证」的闭环。当然,工具、数据、评价体系还是人类给的,结论还是科学家审。 最后是数据留不留的问题。Fable 5 默认要求保留 30 天使用数据,这对安全监测有帮助,却卡住了金融、医疗、法律这些受监管行业。Fable 5.1 配套推出 Enterprise Frontier Safeguards:日志存在客户自己的 AWS、Azure 或 Google Cloud 环境里,用客户管理的密钥和审计系统,风险标记直接交给客户,默认不需要 Anthropic 员工人工查看。这套系统和 100 多家企业共同设计,覆盖金融、医疗、制造等多个行业。 当 agent 开始接触代码仓库、财务资料、生产系统凭证,数据存哪、谁能看、怎么审计,就比任何一个基准分更能决定它能不能被部署。 把这三件事摆在一起——缓存降价适合长任务、安全系统减少误伤、敏感数据留在客户手里——Fable 5.1 真正的变化就清楚了。Anthropic 没在争「最强模型」的位置,它在补「可部署性」这三块基础设施。竞争的重心,正从「每百万 token 多少钱」挪到「完成一个合格任务多少钱」。 参考来源: Claude Fable 5.1 & Mythos 5.1 — Anthropic Fable 5.1 model review — CodeRabbit

查看原文
分享到:

相关推荐

The Dell 14S is yet another cheap laptop chasing t...

25分钟前

华为徐直军称鸿蒙生态今年底预计突破 1 亿用户,这一目标实现意味着什么?

25分钟前

车企高管称现在不买 L3 级像当年不买 5G 手机,这个类比成立吗?现阶段有必要选购 L3 级车型吗...

25分钟前

芒果超媒董事长:AI长剧《后西游记》成本仅为同类S级真人剧几分之一

25分钟前