從 GPT-5.6 看 agent、工具呼叫和 ChatGPT Work

整理 GPT-5.6 這次發布裡比較值得看的幾個技術點:ultra、多 agent、Programmatic Tool Calling、ChatGPT Work,以及安全邊界。

從 GPT-5.6 看 agent、工具呼叫和 ChatGPT Work

今天凌晨 GPT-5.6 發布,量子位那篇整理看完,我第一個反應其實不是「分數又刷高了」。分數當然很誇張,但更值得盯的是 OpenAI 這次把幾件事一起往前推了:模型、agent、桌面端產品和工具呼叫方式。

這種發布比較麻煩,因為它看起來像一篇模型新聞,實際上牽到產品架構。原本 Codex 桌面應用程式直接升成新的 ChatGPT 桌面版,舊版 ChatGPT 變成 ChatGPT Classic。新的 ChatGPT 桌面端拆成 Chat/Work/Codex 三種模式,Chat 處理問答和搜尋,Work 接成果型任務,Codex 留給軟體開發。

這邊有個訊號:OpenAI 不想再把「聊天」當成唯一入口。它要把使用者的意圖分流成不同工作模式,尤其是 Work 這塊。

模型本身分成三檔,Sol、Terra、Luna,名字對應太陽、地球和月亮。Sol 是旗艦,Terra 走日常工作平衡,Luna 則是最快和最便宜。官方說 GPT-5.6 Sol 在編碼、知識工作、網路安全、科學任務上達到 SOTA,還能用較少 token 和較低估算成本完成任務。

我比較在意 ultra 模式。max 原本是讓模型在單一任務上花更多推理時間,ultra 則把任務丟給多個 agent 並行處理。照 OpenAI 的說法,預設會協調 4 個 agent,可擴到 16 個。

這聽起來很合理,也很燒錢。量子位也提到,有網友吐槽 ultra 模式 15 分鐘內就把 Pro 會員 5 小時額度燒完。多 agent 不是免費午餐,它比較像把「時間」換成「併發算力和 token」。

再來是 Programmatic Tool Calling。簡單來說,模型可以自己寫一段輕量程式,拿來協調多個工具呼叫、處理中間結果、看進度,然後決定下一步。以前工具密集型任務常見的麻煩是,每跑一步就要把結果塞回模型,模型再決定下一步,來回很多次。這次的方向是讓一部分協調工作留在小程式裡,少一點模型往返,也少一點 token 浪費。

如果這個能力穩,對 Codex 這類工作流會很有感。寫程式時最花時間的常常不是生成一段 code,而是查檔案、跑測試、讀錯誤、改 patch,再重跑。這些步驟本來就很適合被程式化地串起來。

OpenAI 也拿 Fable 5 來對比。Agents’ Last Exam 涵蓋 55 個專業領域的長週期工作流測試,官方說 Sol 拿到 53.6 分,比 Fable 5 高 13.1 分;就算降到中等推理強度,也能以大約四分之一成本領先 11.4 分。Terra 和 Luna 則用約十六分之一成本反超 Fable 5。

程式碼部分,官方稱 Sol 是 OpenAI 目前最強程式碼模型。在 Artificial Analysis Intelligence Index 上,最高推理強度的 Sol 和 Fable 5 分差不到 1 分,但時間少 61%,成本約一半。這種數字我會先當官方敘事看,真正有沒有差,還是要回到自己的 repo 和測試集上跑。

設計能力也被特別拿出來講。GPT-5.6 據說只要高層級指示,就能做出美觀、符合人體工學、功能完整的介面。比較有意思的是電腦操作能力,模型可以檢查渲染後的結果,再修視覺和功能問題。這比單純產生 HTML 或 React code 更接近真正的前端工作。

ChatGPT Work 則是把這套能力包成產品。它可以連 Google Drive、SharePoint、Slack、Microsoft Teams、Gmail,使用者可以指定資料源,也可以交給模型判斷。官方給的場景是直接產出 Excel、Word、投影片、報告或 Sites 網站,模型還會自己看最終渲染效果。

這邊我會看兩件事。第一,它能不能真的遵循範本,例如投影片的版面、字型、間距、配色,甚至母片規則。第二,長任務怎麼監督。量子位提到 Work 可以一次跑,也可以依排程重複執行,或在檔案更新時觸發;過程中使用者可以看進度、回答追問、調整方向和審核動作。

安全部分,OpenAI 說 GPT-5.6 是目前最強的網路安全模型。ExploitBench 得分 73.5%,GPT-5.5 是 47.9%;ExploitGym 兩小時最高通過率從 15.1% 到 24.9%,六小時到 33.7%;SEC-Bench Pro 則是 71.2%,GPT-5.5 是 45.8%。

但開放方式有切線。防禦性任務,像程式碼安全審查、補丁開發、威脅建模和藍隊工作會提供支援;更高階的漏洞分診驗證、惡意軟體分析、偵測工程和補丁驗證,只開給 OpenAI Daybreak 的網路安全可信存取計畫。官方也說這一代在網路安全和生物兩個維度都沒有跨過 Critical 風險門檻。

看到最後,那個 Claude 重置 Fable 5 額度的梗其實只是花絮。比較實際的變化是,OpenAI 正在把模型能力收進一個能交付成品的工作臺裡。能力變強是一件事,能不能穩定跑幾小時、少燒 token、遵守範本、在關鍵動作前停下來等人審核,這些細節會決定它到底是玩具,還是真的能進日常工作。