Sonnet 5 的代理任務成本與導入邊界

Sonnet 5 的工程評估需要同時看標價、token 用量、工具迴圈、任務完成成本與平台整合限制。

Sonnet 5 的代理任務成本與導入邊界

Sonnet 5 已成為 Anthropic 中階預設模型,並進入 Claude、Claude Code、API、Managed Agents 與多個開發工具。規格上有 100 萬 token context window,標準價格維持每百萬 input token 3 美元、output token 15 美元,短期促銷價為 2 美元與 10 美元。這組標價適合做預算初估,但不能直接當成代理任務的實際成本。

代理工作負載的費用主要卡在輸出量與回合數。Artificial Analysis 的測試顯示,Sonnet 5 平均每個任務使用約 69k output tokens,比 Sonnet 4.6 多約 40%;在部分代理評測中,回合數約為 Sonnet 4.6 的 3 倍,高 effort 設定在 GDPval-AA 上約為 low effort 的 6 倍。以標準價格計算,單一 Intelligence Index 任務成本約 2.29 美元,約為 Sonnet 4.6 的 2 倍,且比 Opus 4.8 高約 15%。導入時應以每個完成任務的成本建模,不能只看每百萬 token 單價。

Tokenizer 也會改變帳單。新的 tokenizer 對英文約增加 1.4 倍有效成本,西文約 1.33 倍,簡體中文大致持平。多語系產品需要用自己的 prompt、工具輸入、回覆格式跑樣本帳單,尤其是 coding agent 會混合英文程式碼、錯誤訊息、終端輸出與規格文字,單一語言估算容易低估費用。

能力面向較適合放在 coding、tool use、long-running agent 與 Managed Agents 類工作流。CursorBench 從 Sonnet 4.6 的 49% 到 Sonnet 5 的 57%;Cognition 的 FrontierCode Extended 給出 53.8% 分數與 57.6% pass rate;其他平台也快速加入支援。這代表生態系把它視為可部署的預設模型,但不等於所有任務都應替換成 Sonnet 5。對固定批次、低互動、短輸出的任務,需先比較 Sonnet 4.6、Opus 4.8 或既有模型的任務級成本。

平台功能同步擴張,Managed Agents 增加 session delta streaming、per-session override、webhook events、reverse pagination、credential injection scoping,以及含 token 與 tool metrics 的 observability tab。這些功能會把模型選型牽到權限邊界與營運責任:credential 注入範圍要能審計,工具呼叫要能回放,長任務失敗要能追蹤到 session、token、tool call 與 webhook 狀態。導入驗證最小集合應包含真實任務樣本、固定 effort 設定、token 帳單、工具回合數、失敗原因分類與提示注入測試。