Anthropic 发布 Claude Fable 5.1?缓存读取价格大降 75%

opoinstall
2026-09-02
5 min read

Anthropic 发布 Claude Fable 5.1?Anthropic 于 2026 年 9 月 1 日正式推出 Claude Fable 5.1 与 Claude Mythos 5.1,在大幅提升编程和知识工作性能的同时,将 Fable 5.1 的提示词缓存读取价格降低了百分之七十五。随着人工智能模型处理日益复杂的长轮次开发者会话,API 代币成本已成为工程团队面临的主要运营瓶颈。过去,维护庞大的对话上下文需要在随后的每一轮中支付全额输入费用。如今,由于头部提供商正积极对缓存上下文读取进行降价,开发者能够以大幅降低的运营成本来维持长生命周期的智能体循环和庞大的代码库。

业务里程碑与财务瓶颈:Claude Fable 5.1 发布及缓存价格下调

概览

  • Anthropic 于 2026 年 9 月 1 日发布 Claude Fable 5.1 和 Claude Mythos 5.1,在双轨安全防护层中共用底层模型。
  • Fable 5.1 的提示词缓存读取价格下降百分之七十五,从每百万代币一美元降至二十五美分,而基础费率保持不变。
  • 对于典型工作负载,整体 API 支出减少约百分之二十五;对于上下文密集型的智能体工作负载,降幅最高可达百分之四十五。

前沿人工智能开发的单位经济效益正在向针对静态上下文的大幅成本削减倾斜。对于构建自主编码智能体和深度分析工具的软件团队而言,上下文的累积可能会成为每月云账单的主要贡献者。随着智能体检查文件、运行单元测试并维护对话状态,输入代币体积在每一步都会膨胀。当模型按完整输入费率对每个对话轮次进行计费时,多轮智能体执行在生产环境中很快就会变得成本高昂。

随着 Anthropic 发布 Claude Fable 5.1 所引入的商业重组直接解决了这一成本障碍。Claude Fable 5.1 和 Claude Mythos 5.1 共享相同的底层模型,但在安全防护配置上有所分化:Fable 5.1 在各大商业云服务商中广泛可用,而 Mythos 5.1 则在受信任的访问计划下严格限制于经过审查的网络安全和生命科学组织。除了创下基准记录(包括在 Terminal-Bench-Science 0.1 评估套件中达到 52.6%)之外,Fable 5.1 还将缓存读取价格从每百万代币一美元大幅砍至二十五美分,正如Anthropic 官方发布公告中所详述的那样。

Claude Fable 5.1 提示词缓存定价明细,展示了缓存读取成本降低 75% 以及整体工作负载的节省情况

虽然基础输入和输出费率分别保持在每百万代币十美元和五十美元不变,但将缓存读取打折百分之七十五改变了智能体循环的经济学。对于频繁引用静态系统提示词、大型 API 架构和稳定代码库存储库的工作负载,整体推理开销下降了百分之二十五到四十五。正如 TechCrunch 行业报道所指出,这种转变使工程团队能够以更低的运营成本部署上下文密集的开发者工作流程。

Terminal-Bench-Science 基准测试结果,对比了 Claude Fable 5.1 与前沿模型的准确性与成本效益

多轮智能体中代币膨胀的系统性根本原因与技术机制

在 API 和应用层,多轮智能体工作流程不可避免地会生成重复的上下文处理。在交互式编程环境中,助手必须反复评估相同的存储库结构、项目指令和先前的工具执行输出。如果没有有效的提示词缓存,重复的对话上下文可能会在后续轮次中以标准输入费率再次被处理和计费,从而在长会话中成倍增加代币消耗。

提示词缓存通过允许 API 重复使用先前处理过的上下文来解决这种冗余问题,而不是按完整费率对重复的输入代币进行计费。然而,要利用 Fable 5.1 的这些成本降低优势,开发者需要应对几个破坏性的 API 更改,这些更改会影响对话上下文的结构化方式。

多轮智能体循环中的破坏性 API 更改

Fable 5.1 引入了多项影响工具选择、思考块兼容性和对话历史处理的 API 行为更改,正如 Claude 平台开发者文档中所记录的:

  1. 移除强制工具选择:将 tool_choice 设置为 anytool 现在会返回 HTTP 400 错误。开发者必须过渡到 auto 模式并结合结构化输出架构或严格的系统提示词指令。
  2. 模型绑定的思考块:Fable 5.1 可以解析早期模型生成的思考块,但较旧的模型无法解释来自 Fable 5.1 的推理块。退回到较小模型的多模型路由设置在切换时将丢失推理上下文。
  3. 编辑轮次时的上下文失效:对于 2026 年 8 月 31 日及之后创建的账户,修改或注入系统提醒到先前的对话轮次中现在会使后续的思考块失效。团队必须采用轮次作用域的系统消息或在服务器端处理上下文更新。

Claude Fable 5.1 和 Claude Mythos 5.1 在生产安全防护下的 Terminal-Bench 智能体编程基准测试分数

下图对比了标准线性代币计费与提示词缓存上下文优化:

[线性代币计费流程(高累积成本)]
  第 1 轮(系统提示词 + 代码库) ──> 完整输入代币费率 ($10/M)
  第 2 轮(累积历史 + 工具调用) ──> 完整上下文重新评估 ($10/M)

[提示词缓存上下文架构]
  第 1 轮(静态系统和工具定义) ──> 5 分钟缓存写入 ($12.50/M)
  第 2 轮(增量工具输出) ──> 折扣缓存读取 ($0.25/M) + 增量代币 ($10/M)

通过构建 API 负载以最大化静态前缀的缓存命中率,工程团队能够维持长运行的推理循环,同时在复杂的执行图中保持单位成本的可预测性。

架构评估:多轮智能体的上下文管理与 FinOps

随着后端架构纳入提示词缓存和上下文繁重的智能体,工程领导者必须在其软件管道中优化上下文管理。开发者必须评估上下文重用如何影响不同工作负载类别下的单任务成本和模型性能。

工作负载经济学:评估官方成本指导

下表根据官方模型基准和定价指导,概述了不同运营概况下的估计财务影响:

工作负载概况 官方成本指导 主要驱动因素
典型工作负载(API / 企业 / Claude Code) 估计成本降低约 25% 静态前缀上更便宜的 75% 重复缓存读取
高智能体工作负载(上下文繁重 / 多轮) 估计成本降低高达约 45% 在扩展的工具和推理循环中频繁重用上下文
自定义生产工作负载 需要基准测试 实际节省取决于未缓存的输入、输出量和写入频率

除了定价更新外,企业合规性要求也在推动数据治理方面的架构变革。为了支持在高度监管环境中运营的组织,Anthropic 宣布了企业前沿安全防护(EFS),该功能将从今年秋天开始分阶段向客户推出,详见 Anthropic 官方 EFS 公告

企业前沿安全防护架构图,展示了客户管理的云基础设施和零数据保留工作流程

EFS 允许企业客户在部署自动化安全监控的同时,保持零数据保留的隐私优势。在此架构下,用于监控的活动数据存储在亚马逊云科技、谷歌云或微软 Azure 上客户自己管理的云基础设施中,从而将监控数据保留在客户控制的基础设施内。

集成清单与治理日程:适应新定价与 API 约束

为了在保持企业合规性的同时最大化降低提示词缓存定价所带来的经济优势,工程和 FinOps 团队可以遵循结构化的实施准则。

GDPval-AA 基准测试对比,说明了 Claude Fable 5.1 在多学科知识工作流程中的性能

开发者实施清单

  • 建立提示词缓存断点:构建 API 负载,使大型、静态的系统提示词、代码库定义和工具架构位于动态对话轮次之前,以最大化缓存命中率。
  • 重构工具选择架构:移除已弃用的强制 tool_choice 参数,更新客户端库以使用 auto 模式及结构化输出验证。
  • 采用轮次作用域的系统消息:确保通过轮次作用域参数传递动态指令,而不是编辑先前的对话轮次,从而防止思考块失效。

产品与 FinOps 策略清单

  • 重新计算高上下文功能的单位经济学:根据每百万代币 $0.25 的缓存读取速率对功能利润率进行建模,评估扩大默认上下文窗口的可行性。
  • 跟踪生产环境缓存命中率:监控智能体工作流程中的缓存读取频率,以确保系统提示词在多轮会话中保持稳定。
  • 为水印验证做准备:评估 Anthropic 的私有预览水印检测 API,使输出验证与欧盟人工智能法案的透明度要求保持一致,详见 Anthropic 的水印概述

通过将 API 消耗模式与现代缓存基础设施对齐,开发团队可以扩展自主智能体功能,同时对运营支出保持严格控制。

常见问题 (FAQ)

缓存读取价格降低 75% 如何影响整体 API 支出?
缓存读取是指已被模型处理并缓存的输入代币。在 Fable 5.1 下,缓存读取的成本为每百万代币 $0.25,而基础输入费率为每百万代币 $10。Anthropic 估计,典型工作负载的成本可降低约 25%,高度智能化的工作负载最高可节省约 45%,具体节省金额取决于缓存读取、缓存写入、未缓存输入、输出量以及工作负载结构的组合。
Claude Fable 5.1 中有哪些破坏性 API 更改会影响多轮智能体循环?
Fable 5.1 删除了强制工具选择,如果将 `tool_choice` 设置为 `any` 或 `tool`,则会返回 HTTP 400 错误。此外,由 Fable 5.1 生成的思考块无法被降级路由设置中的早期模型解析,并且修改对话历史记录中的先前轮次会使新创建的 API 账户的思考块失效。
什么是企业前沿安全防护(EFS),它如何支持零数据保留?
企业前沿安全防护(EFS)是一种企业合规架构,允许组织将其用于监控的活动数据存储在 AWS、谷歌云或 Azure 上的自有云基础设施中。它在模型提供商服务器上提供了零数据保留的隐私优势,同时允许自动化安全监控以检测凭证盗窃或对抗性滥用。

工程团队的核心要点

Claude Fable 5.1 的发布表明计算通缩正在前沿人工智能平台加速。随着基础模型提供商优化缓存架构并引入企业治理的安全框架,部署自主、长运行智能体工作流程的门槛正在迅速下降。

对于软件架构师而言,可持续的 AI 部署需要在系统的每一层优化上下文管理。将高效的 API 提示词缓存与模块化应用级设计配对,可确保系统保持响应迅速、经济高效且符合新兴的全球标准。随着代币经济学持续改善,围绕高效状态保存来构建数据管道的组织将占据最有利的位置,引领下一代智能软件服务。

参考文献

Share this article