
這篇 AINews 的標題在問 Codex 有沒有超過 Claude Code。我比較在意另一件事,數字太密集,密集到你很難把它當成一般產品更新看。GPT 5.6 Sol 在 2026 年 7 月 9 日推出,7 月 12 日 Tibo 說 Codex 和 ChatGPT Work 過去 48 小時到了 600 萬使用者;24.5 小時後,又變成 700 萬。再把 Fidji 3 月披露的 200 萬,以及年初約 55 萬到 70 萬放進來看,半年 10 倍這個說法就有了脈絡。
跟 Claude Code 比就麻煩多了。原文提到,2 月那次更新是約 200 萬使用者和 25 億美元 ARR,後面相對安靜。比較善意的解釋是,Anthropic 可能已經把很多 coding 使用轉到 Claude Tag,Slackbot 和 CLI tool 的可及性不同,統計口徑也會不同。所以我不會把「超車」當成唯一結論。比較穩的說法是,Codex 這半年跑出很陡的使用曲線,而且 OpenAI 願意把用量修正直接攤在檯面上講。
Tibo 那串更新也很工程味。暫時移除 Plus、Business 和 Pro 的 5 小時限制,加入 banked reset;GPT-5.6 Sol 這邊有推論最佳化,約多 10% 用量;context limit 從 372k 回到 272k,原因是 billing/usage 的副作用;reasoning effort 的實驗變更回退,high/xhigh 下太會叫 subagent 的行為也修掉。它讀起來沒有漂亮產品發表稿的味道,倒比較像事故後的 changelog。反而比較可信。
回到 coding agent 本身,原文把一堆討論拉到同一個方向,model quality 已經不是全部。threepointone 的話被整理成 harness is the app,LangChain 也說 task-specialized harness 比 generic wrapper 更可能勝出。這邊的意思很白話,模型再強,沒有把檔案、UI、執行環境、回放、錯誤復原包好,最後還是很容易在長任務裡燒用量。Factory 的 design mode 也是同一類思路,少叫使用者用文字重講一次畫面上的東西,直接指 UI element 或 file。
成本指標也開始換演算法。單看 token price 會漏掉 turns、verbosity、cache hit rate 這些東西。skirano 的 coding-agent index explorer 提到 Terra Max 分數略高於 Fable 5 Max,成本低不少;Cognition 說 Devin Fusion 用 Fable 5 之後,cost per task 可能低於 Opus 4.8。我比較想記的是 imjaredz 提到的數字,在 81% 的 Fable-led runs 裡,lead model 沒有做 code edit。貴模型如果能少做蠢事,帳單反而可能比較便宜。
Prime Intellect 的 verifiers v1 則補上更底層的拼圖。它把環境拆成 taskset、harness 和 runtime,還支援 bring your own harness。rollout trace 改用 message DAG 儲存,每則 message 只存一次,trace 成長從 O(n²) 降到 O(n)。這種改法聽起來很 infra,但對 long-horizon agent 很要命,因為回合一多,歷史複製就會變成成本和重播的負擔。原文也列了一個很硬的配置,100B reasoning model、40-turn SWE agent tasks、1000 RL steps、6 個 H200 nodes、不到 2 天。
安全邊界那段也不能跳過。Grok Build CLI 被指稱會把整個 repository 上傳到 Google Cloud bucket,包含 private code 和 secrets,超過 coding task 需要的範圍。xAI 回應提到 ZDR、privacy controls 和 /privacy command,但原文也保留了社群疑慮,尤其是 default behavior、prior uploads、retention/deletion guarantees。這件事很現實。coding agent 越像同事,就越會碰到 repo、log、API key、內部檔案;工具如果只在 UI 上說可以 opt out,wire-level behavior 卻不清楚,信任會很快被磨掉。
所以這篇的讀法,我會收在幾個檢查點。用量成長是真的快,但比較不同產品時要看入口和統計口徑;harness、orchestrator、eval/runtime 會決定 agent 能不能把長任務跑完;cost per task 比 token price 更接近實際帳單。剩下那個最麻煩,資料邊界要講清楚。你把一個工具放進 repo,它就不能只像聊天視窗那樣可愛。