
看到這期 AINews,我原本以為重點會是 GPT-5.6 又丟出什麼新能力。結果比較有意思的地方反而很務實:Codex 的使用量據稱在大約一天內又增加 100 萬,Tibo 前一天才說有 600 萬活躍使用者;同一段時間,@sama 也提到 Codex + ChatGPT Work 一週內成長 2.5 倍。
如果這些數字成立,那問題就不是「大家喜不喜歡用聊天介面寫程式」了。更像是另一件事:AI coding agent 正在從 demo 進入工作流。人在旁邊下指令,agent 進 repo、讀 AGENTS.md、跑 tool、改檔案、看測試結果,最後把一個任務收掉。這跟以前請模型吐一段 code,感覺差很多。
但這邊有個坑。模型越會寫 code,越容易讓人誤以為「模型品質」就是全部。AINews 裡有幾個訊號剛好指向相反方向。@swyx 提到過期的 agents.md 指令可能像自找的 prompt injection,讓長時間任務卡住好幾個小時。LangChain 把 Codex tracing 加進 LangSmith,後面又擴到 Cursor、Copilot、Pi 和 OpenCode,可以看到 tool calls、subagents 和 token usage。Hermes 也在處理 tool call 平行化與 resets 這類執行層問題。
簡單來說,agent 的品質不只在模型本身,也在 harness。你給它什麼環境、怎麼讓它呼叫工具、失敗時怎麼回復、過程能不能觀察,這些會直接決定它是幫你省時間,還是幫你製造一個更難 debug 的黑盒子。
這也是 eval 會突然變得很重要的原因。Perplexity 開源的 WANDR 很有代表性,它不是拿固定答案集評分,而是重新抓 cited pages,再檢查 claim 跟證據是否對得上。這比較接近真實 web research,因為網頁會變、資料會變,agent 不能只背一份靜態答案。
另一邊,SlopCodeBench 被拿來衡量 agent 在連續任務中如何侵蝕 codebase。這題我覺得特別貼近工程現場。很多 coding benchmark 看的是「能不能解掉單一 issue」,但公司裡真正怕的是另一種狀況:它每次都看起來解了,三週後 repo 多出一堆奇怪抽象、測試變慢、錯誤訊息變含糊,維護成本開始往上疊。
本機推論這條線也很值得看。PrismML 的 Bonsai 27B 基於 Qwen 3.6 27B,Ternary 版 5.9 GB,1-bit 版 3.9 GB,授權是 Apache 2.0,還宣稱保留 multimodal、tool-using、long-context agentic workflow。Tencent Hunyuan 也提到 1-bit 和 4-bit Hy3,描述 295B 規模模型可在啟用 MTP 時透過 llama.cpp 跑在單張 GPU 上。
我不會把這解讀成「雲端模型要被取代」。比較合理的看法是,本機 agent 的操作空間變大了。當模型可以用低位元格式放進消費級裝置,或至少放進比較可負擔的本機環境,很多原本卡在成本、隱私、延遲的任務,就有機會被重新設計。尤其 agent 不是隻問答,它會讀檔、跑命令、處理長上下文,本機化的價值會比單純聊天更明顯。
多模態那邊,MOSS-VL-Realtime 給了另一個方向。它是 11B vision-language family,256K context,面向連續影片串流。比較有趣的是它可以一邊生成一邊看,場景變了就修正或中斷答案,證據不足時保持沉默。這聽起來像小細節,但對即時系統很關鍵。會閉嘴,有時候比硬答更像一個可用元件。
OmniAgent 的 long-video understanding 也在講類似的事。它不是把所有 frame 都塞進去,而是用 Observation-Thought-Action loop 去請求需要的 frames 和 audio。在 LVBench 上,OmniAgent-7B 據稱拿到 50.5,勝過 Qwen2.5-VL-72B 的 47.3,而且只用了約 203 frames,對方是 768。這個差異背後的重點很工程:少看一點,但看對地方。
把這些線索放在一起,這期 AINews 其實講的是同一個問題:當生成成本下降,真正難的部分會往系統邊界移動。coding agent 要靠 harness 和 tracing 才能穩定;research agent 要靠動態 eval 才知道自己有沒有亂講;本機模型要靠量化與執行環境才跑得動;即時多模態要學會選證據和沉默。
回到 Codex 的成長數字,它當然很驚人。但我比較想看的不是下一個 100 萬使用者,而是這些使用者把 agent 放進什麼工作流。若只是把聊天框換成命令列,熱度很快會回到正常值。若 harness、eval、observability 和本機部署一起補上,AI agent 才真的會變成工程系統裡的一個穩定零件。這中間還有很多坑要踩,至少現在坑的位置開始清楚了。