Anthropic 推出 Claude Fable 5.1?Anthropic 於 2026 年 9 月 1 日正式推出 Claude Fable 5.1 與 Claude Mythos 5.1,在大幅提升編碼與知識工作效能的同時,將 Fable 5.1 的提示詞快取讀取定價降低了 75%。隨著人工智慧模型處理越來越複雜的多輪開發者對話,API Token 成本已成為工程團隊的主要營運瓶頸。過去,維持龐大的對話上下文需要在後續的每個對話輪次中支付完整的輸入費率。如今,由於前沿模型提供商積極提供快取上下文讀取的折扣,開發者能夠以顯著較低的營運支出來維持長運行的代理迴圈與龐大的程式碼庫。
商業里程碑與財務瓶頸:Claude Fable 5.1 發布與快取價格調降
重點一覽
- Anthropic 於 2026 年 9 月 1 日發布 Claude Fable 5.1 與 Claude Mythos 5.1,在雙軌安全防護層級中共用相同的底層模型。
- Fable 5.1 的提示詞快取讀取定價下跌 75%,從每百萬個 Token 一美元降至二十五美分,而基礎費率維持不變。
- 一般工作負載的整體 API 支出減少約 25%,而上下文密集的代理式工作負載最高可減少 45%。
前沿人工智慧開發的單位經濟效益正朝著大幅降低靜態上下文成本的方向轉變。對於建構自主編碼代理與深度分析工具的軟體團隊而言,上下文的累積可能成為每月雲端帳單的主要負擔。當代理檢查檔案、執行單元測試並維持對話狀態時,輸入 Token 的數量會在每個步驟中不斷膨脹。當模型以完整輸入費率對每個對話輪次進行計費時,多輪代理的執行在生產環境中很快就會變得成本高昂。
隨著 Anthropic 推出 Claude Fable 5.1 所帶來的商業重組,直接解決了這項成本障礙。Claude Fable 5.1 與 Claude Mythos 5.1 共用相同的底層模型,但在安全防護配置上有所區隔:Fable 5.1 已在各大商業雲端提供商中全面推出,而 Mythos 5.1 則在受信任的存取計畫下,僅限經過審查的網路安全與生命科學組織使用。除了創下基準紀錄(包括在 Terminal-Bench-Science 0.1 評估套件中達到 52.6% 的成績)之外,Fable 5.1 將快取讀取定價從每百萬個 Token 一美元大幅砍至二十五美分,詳情請見Anthropic 官方發布公告。

雖然基礎輸入與輸出費率分別維持在每百萬個 Token 十美元和五十美元不變,但將快取讀取的價格折抵 75% 改變了代理迴圈的經濟效益。對於頻繁參考靜態系統提示詞、大型 API 架構和穩定程式碼庫儲存庫的工作負載,整體推論支出下降了 25% 至 45%。正如 TechCrunch 產業報導所指出,這種轉變讓工程團隊能夠以更低的營運成本部署上下文密集的開發者工作負載。

多輪代理中 Token 通膨的系統性根本原因與技術機制
在 API 與應用程式層中,多輪代理式工作負載本質上會產生重複的上下文處理。在互動式程式設計環境中,助理必須重複評估相同的儲存庫結構、專案指示以及先前的工具執行輸出。若沒有有效的提示詞快取,重複的對話上下文可能會在後續輪次中以標準輸入費率再次被處理並計費,從而在漫長的對話階段中使 Token 消耗量倍增。
提示詞快取透過允許 API 重複使用先前處理過的上下文,而不是以完整費率對重複的輸入 Token 進行計費,來解決這種冗餘問題。然而,要藉助 Fable 5.1 來享有這些成本降低的好處,開發者必須處理幾項會影響對話上下文結構的重大 API 變更。
多輪代理迴圈中的重大 API 變更
正如 Claude Platform 開發者文件中所記載,Fable 5.1 引入了數項影響工具選擇、思考區塊相容性以及對話歷史記錄處理的 API 行為變更:
- 移除強制工具選擇:將
tool_choice設定為any或tool現在會傳回 HTTP 400 錯誤。開發者必須改用auto模式結合結構化輸出結構描述或嚴格的系統提示詞指示。 - 模型綁定的思考區塊:Fable 5.1 可以解析早期模型產生的思考區塊,但較舊的模型無法解讀來自 Fable 5.1 的推理區塊。回退到較小模型的多模型路由器設定將在切換時遺失推理上下文。
- 已編輯輪次的上下文失效:對於在 2026 年 8 月 31 日當天或之後建立的帳戶,修改或注入系統提醒至先前的對話輪次現在會使後續的思考區塊失效。團隊必須採用輪次範圍的系統訊息或在伺服器端處理上下文更新。

下圖對比了標準線性 Token 計費與提示詞快取上下文最佳化:
[線性 Token 計費流程(高累積成本)] 第 1 輪(系統提示詞 + 程式碼庫) ──> 完整輸入 Token 費率($10/M) 第 2 輪(累積歷史記錄 + 工具呼叫) ──> 完整上下文重新評估($10/M) [提示詞快取上下文架構] 第 1 輪(靜態系統與工具定義) ──> 5 分鐘快取寫入($12.50/M) 第 2 輪(增量工具輸出) ──> 折扣快取讀取($0.25/M)+ 增量 Token($10/M)
透過建構 API 酬載以最大化靜態前綴的快取命中率,工程團隊能夠維持長運行的推理迴圈,同時在複雜的執行圖中保持可預測的單位成本。
架構評估:多輪代理的上下文管理與 FinOps
隨著後端架構納入提示詞快取與上下文密集的代理,工程領導者必須在其軟體管線中最佳化上下文管理。開發者必須評估上下文重複使用如何影響各個工作負載類別的每項任務成本與模型效能。
工作負載經濟學:評估官方成本指引
下表概述根據官方模型基準與定價指引,在不同營運配置下的估計財務影響:
| 工作負載配置 | 官方成本指引 | 主要驅動因素 |
|---|---|---|
| 一般工作負載(API / 企業 / Claude Code) | 預估成本降低約 25% | 靜態前綴的重複快取讀取便宜 75% |
| 高度代理式工作負載(上下文密集 / 多輪) | 預估成本降低最高約 45% | 在擴充的工具與推理迴圈中頻繁重複使用上下文 |
| 自訂生產工作負載 | 需進行基準測試 | 實際節省取決於未快取的輸入、輸出量與寫入頻率 |
除了定價更新之外,企業合規要求也正在推動資料治理方面的架構變更。正如 Anthropic 官方 EFS 公告中所詳述,為了支援在高度受監管環境中運作的組織,Anthropic 推出了企業前沿安全防護(Enterprise Frontier Safeguards, EFS),並將從今年秋季稍晚開始分階段向客戶推出。

EFS 允許企業客戶在部署自動化安全監控的同時,保有零資料保留的隱私優勢。在這種架構下,用於監控的活動資料會儲存在客戶位於 Amazon Web Services、Google Cloud 或 Microsoft Azure 上管理的雲端基礎設施中,將監控資料保留在客戶控制的基礎設施內。
整合檢查清單與治理時程:適應新定價與 API 約束
為了在維持企業合規性的同時最大化降低提示詞快取定價帶來的經濟優勢,工程與 FinOps 團隊可以遵循結構化的實施指南。

開發者實施檢查清單
- 建立提示詞快取中斷點:建構 API 酬載,使大型靜態系統提示詞、程式碼庫定義與工具結構描述放置在動態對話輪次之前,以最大化快取命中率。
- 重構工具選擇結構描述:移除已棄用的強制
tool_choice參數,並更新用戶端函式庫以使用auto模式搭配結構化輸出驗證。 - 採用輪次範圍的系統訊息:確保透過輪次範圍的參數傳遞動態指示,而不是編輯先前的對話輪次,以防止思考區塊失效。
產品與 FinOps 策略檢查清單
- 重新計算高上下文功能的單位經濟效益:以每百萬個 Token $0.25 的快取讀取費率來對功能毛利率進行建模,評估擴充預設上下文視窗的可行性。
- 追蹤生產環境的快取命中率:監控代理式工作負載中的快取讀取頻率,以確保系統提示詞在多輪對話中保持穩定。
- 為浮水印驗證做好準備:評估 Anthropic 的私人預覽浮水印偵測 API,使輸出驗證符合歐盟人工智慧法案(EU AI Act)的透明度要求,詳情請參閱 Anthropic 的浮水印概觀。
透過將 API 消耗模式與現代快取基礎設施保持一致,開發團隊可以擴充自主代理功能,同時嚴格控制營運支出。
常見問題 (FAQ)
快取讀取定價降低 75% 如何影響整體 API 支出?
Claude Fable 5.1 中的哪些重大 API 變更會影響多輪代理迴圈?
什麼是企業前沿安全防護(Enterprise Frontier Safeguards),它如何支援零資料保留?
工程團隊的關鍵要點
Claude Fable 5.1 的發布證明了運算通膨正在各個前沿人工智慧平台中加速。隨著基礎模型提供商最佳化快取架構並引入企業治理的安全框架,部署自主且長運行的代理工作負載的門檻正在迅速降低。
對於軟體架構師而言,永續的 AI 部署需要在系統的每個層級最佳化上下文管理。將高效的 API 提示詞快取與模組化的應用程式級設計相結合,可確保系統保持回應迅速、具成本效益,並符合新興的全球標準。隨著 Token 經濟學持續改善,圍繞高效狀態保存來建構資料管線的組織,將最有優勢引領下一代智慧軟體服務。
參考資料
- Anthropic. Claude Fable 5.1 and Claude Mythos 5.1 Announcement. https://www.anthropic.com/claude-fable-and-mythos-5-1
- Claude Platform. Claude Fable 5.1 Overview and Migration Guide. https://platform.claude.com/docs/en/models/fable-5-1/overview
- Anthropic. Developing Enterprise Frontier Safeguards with Our Customers. https://www.anthropic.com/news/enterprise-frontier-safeguards
- Anthropic. How Claude’s Text Watermarking Works. https://www.anthropic.com/news/claude-text-watermark
- TechCrunch. Anthropic’s New Fable Release Is Cheaper, Less Restrictive. https://techcrunch.com/2026/09/01/anthropics-new-fable-release-is-cheaper-less-restrictive/
- ITHome. Anthropic Releases Claude Fable 5.1 and Mythos 5.1. https://www.ithome.com/0/997/193.htm
Share this article


