Kimi K3 之後,open-weight 模型該看效率和系統

從 Latent Space AINews 重組 Kimi K3 這波討論,看 benchmark、KDA、agent sandbox 與 memory workflow 的工程含義。

Kimi K3 之後,open-weight 模型該看效率和系統

Latent Space 這期 AINews 的標題很故意:今天沒什麼大事發生。可是正文幾乎都在繞著昨天的 Kimi K3 打轉。這種反差很有意思,因為它剛好把這波 open-weight 模型競爭的樣子講出來了,發布訊息過了一天,討論還在往外擴散。

原文把 K3 放在幾個脈絡裡看。社群反應最直接,有人祝賀 Moonshot 創辦人 Zhilin Yang,也有人很乾脆地說 Kimi K3 真的很好。比較硬的說法來自 benchmark。Artificial Analysis 的 Intelligence Index 裡,六週內超過 51 分的 frontier labs 從兩家變六家,K3 拿 57,低於 Claude Fable 5 的 60,高於 Opus 4.8 的 56。Coding Agent Index 也是 57,追平 GPT-5.6 Terra 和 GPT-5.5,Terminal-Bench v2 是 84%,DeepSWE 是 64%。

數字當然不能當成全部。原文也把懷疑聲音保留下來:有人覺得 K3 已經接近 frontier,有人認為它在 generality、efficiency 或 hidden evals 上還落後幾個月。這邊我會比較相信那個窄一點的結論。K3 可能還沒把所有問題都解掉,但它已經大到沒辦法被當成「中國模型還差很多」的註腳。

比較值得拆的是它怎麼做到。原本大家很容易把 frontier 能力想成 compute moat,誰買得到更多 GPU,誰就能往前推。K3 讓討論改看 efficiency stack,像 MoE routing、quantization、data curation,還有 Moonshot 自己在稀缺條件下做出的 Mooncake stack。這個方向不浪漫,可是很工程。當 capex 沒辦法正面硬拚時,每一份 FLOP 能換到多少產品能力,就變成很殘酷的題目。

Kimi Delta Attention 也是這裡最像技術核心的部分。@sdrzn 的整理說,KDA 像 fast-weights 記憶機制,替每個 request 維持固定大小且可學習的狀態,避免長 context 每次都付完整 attention 成本。原文提到的宣稱是,在 1M context 下 throughput 最多快 6 倍,也便宜 6 倍,長 context pricing 比較平。這些數字還要看更廣的部署結果,但方向很清楚,長上下文的競爭已經不是把視窗開大而已,帳單和延遲會一起追上來。

同一篇裡還有一個容易被排行榜蓋過的點:agent sandbox。Abhishek Bhardwaj 的 Sandbox track keynote 是本週最受歡迎的演講,談的是 ChatGPT Work 背後的雲端基礎設施。原文吐槽得很直接,如果你以為 agent sandbox 只是把 container 跑在 Kubernetes 上,可能太盯著 compute,低估了 storage 和 filesystem。這句話其實很重。agent 真的開始做長任務時,它會讀檔、改檔、保留狀態、跨步驟恢復上下文。這些麻煩都不像 benchmark 分數那麼漂亮,但產品穩不穩常常卡在這裡。

所以後半篇一直提 memory、MCP、workflow scaffolding,我覺得是合理的。base model access 變便宜之後,差距會跑到 harness 和工具層。Paulius Ztin 提的 wiki memory 很具體:agent 不要每次都從原始檔案重新推導理解,而是在 unified memory 上面建 task-specific Markdown wiki,再用 FastMCP 同步。Qdrant 和 mem0 那段也接上同一件事,continual learning 可以先被看成 memory 問題,不必急著改 weights。

研究筆記則像幾個提醒。ARC Prize 驗證 Thinking Machines 的 Inkling 在 ARC-AGI-1 拿 79.5%,ARC-AGI-2 拿 36.5%,是兩個榜上最高的 open-weight 模型。cyber 這邊,open models 在 long-horizon cyber 仍然明顯落後最好的 closed models。RoboTTT 把 robot policy context length 拉長 3 個 orders of magnitude,manipulation performance 比 single-step baseline 高 87%,還完成五分鐘、十階段的 assembly task。這些都在說同一件不太舒服的事:模型能力在不同場景裡前進得很不平均。

回到 K3,這次比較像工程系統的勝利。模型本身很強,benchmark 也夠亮,但更值得盯的是它背後那套把算力、架構、推論、工具與工作流揉在一起的做法。接下來如果只看誰的 base model 分數高,會漏掉很多真正決定產品差距的東西。