GPT-5.6 筆記:OpenAI 這次在賣一套工作系統

從 Sol、Terra、Luna 的價格和 benchmark,寫到 ultra effort、Codex 合併、ChatGPT Work、Sites beta 與 cyber safety 爭議。

GPT-5.6 筆記:OpenAI 這次在賣一套工作系統

這次 GPT-5.6 發表,最直覺的部分是模型線變好懂了。Sol、Terra、Luna 分別是旗艦、較低成本的 GPT-5.5 類能力、大量任務用的最快便宜選項。API 價格跟著切:Sol 每百萬 input/output tokens $5/$30,Terra $2.5/$15,Luna $1/$6。

但如果只看模型表格,會漏掉更大的動作。ChatGPT、Codex 和 API 同步 rollout,Responses API 加上 Programmatic Tool Calling 與 multi-agent beta,Codex 併進新的 ChatGPT desktop app;旁邊還有 ChatGPT Work 和 Sites beta。這比較像 OpenAI 把模型能力包成工作環境,三個新 model id 只是入口。

Benchmark 先看,但不要只看#

官方數字很漂亮。Sol 在 Agents’ Last Exam 拿到 53.6,比 Claude Fable 5 adaptive 高 13.1 分;medium reasoning 下以約四分之一預估成本,領先 Fable 11.4 分。Terminal-Bench 2.1 和 DeepSWE 則拿來說它能處理較長的 command-line workflow 和真實 codebase 任務。

第三方數字比較降溫。Artificial Analysis 給 Sol max 的 Intelligence Index 是 59,比 Fable 5 max 低 1 分,但每 task 成本約三分之一;Sol 在 Coding Agent Index 是 80,領先 Fable 5 和 Opus 4.8。coding agent 這段對開發者最有感。

也有卡住的地方。Sol 相比 GPT-5.5 hallucination rate 更高;ParseBench 說文字和表格還行,圖表、layout、複雜文字版面與 source-element bounding boxes 仍是弱點。所以它比較像 coding agent 和成本曲線前進一截。

Ultra 賣的是協調#

ultra effort level 讓這次味道變了。max 是給模型更多時間推理、檢查、修正;ultra 預設協調四個 agents 平行做事,用更多 tokens 換更好的結果和更短的 time-to-result。

adaptive reasoning、parallel agents、programmatic tool use、token efficiency 被綁成同一件事;tool APIs、subagents、evaluation harnesses 和 economics 也會影響結果。benchmark 會反映一部分,實際工作流才看得出差距。

Sol 訓練 Luna,先放慢一點#

「Sol autonomously post-trained Luna」是這次最容易被誤讀的一句。照字面看很像模型自己訓練下一個模型,難怪會被放大。技術討論保守很多,較常見的讀法是 Sol 在成熟的 OpenAI RL infrastructure 裡,改 config、調 scheduler、實作 graders 或 reward-shaping logic,接著啟動實驗。

OpenAI 也拿 internal usage data 支撐這個方向,像研究員 experiment throughput 自年初以來翻倍,內部 agentic token usage 約 22 倍。這些數字很強,但講成 Sol 端到端發明並訓練 Luna,步子跨太大。比較穩的讀法是,GPT-5.6 自動化了模型研發工作流中有份量的一段,前提是它站在成熟內部系統上。

產品層壓得很重#

ChatGPT Work 被描述成 Codex + GPT-5.6 驅動的 agent,可以跨 app 和檔案工作,也能吃企業工具上下文。Sites beta 讓 ChatGPT 產出的 app 或網站可以 hosting、storage,也能加 optional auth。

能力變成工作系統,安全問題也變具體。AI Safety Institute 的測試說,他們在 GPT-5.6 Sol 上找到 universal jailbreaks,可用於 vulnerability discovery 和 exploit development 這類長任務。OpenAI 也說部分 cyber/bio requests 可能被暫停或封鎖,送進額外安全審查。

這次發表比較適合讀成一個產品轉向。榜單要看,價格要算;可日常工作感受可能更受 Codex 合併、desktop app、multi-agent、Programmatic Tool Calling 和 Sites 影響。GPT-5.6 目前也還帶著 hallucination、layout 弱點、設定組合過多與 cyber safety 的坑。先拿它跑真實任務,再談它是不是你的主力模型。