
Moonshot AI 的 Kimi K3 會引起注意,是因為 Moonshot 把一個開放權重模型推到接近當前前沿封閉模型的位置,而不是隻領先上一代開放模型。官方發表的資訊也讓團隊有東西可以實測:總引數 2.8T、1M-token context、原生多模態輸入、計畫在 2026 年 7 月 27 日前釋出權重、Artificial Analysis 的 Intelligence Index 得分 57,以及在 Frontend Code Arena 拿下第 1 名,pairwise win rate 為 76%。
團隊接下來要確認的是,K3 能不能放進真實的 coding、agent 和大量依賴 retrieval 的系統裡。吞吐量、context 處理、harness 行為和評測品質,會決定它能不能真的進 production。
這個模型接近第一梯隊,但限制不少#
Artificial Analysis 認為 K3 可與 Opus 4.8 和 GPT-5.5 相比,整體仍落後 Fable 5 與 GPT-5.6 Sol。Arena 的結果更集中在前端場景。K3 在 Frontend Code Arena 得到 1679 分,從 K2.6 的第 18 名升到第 1 名,在七個 frontend domains 裡有六個排名第 1,Gaming 排第 2。
這個分佈很重要。一個模型可以很會產生 web UI,卻仍然需要另外驗證 long-horizon agents、production code maintenance、hidden evals 和 factual work。Artificial Analysis 也提到,AA-Omniscience accuracy 從 K2.6 的 33% 升到 K3 的 46%,hallucination 則從 39% 惡化到 51%。能力變強了,輸出也更難管。
Serving K3 本身就是產品的一部分#
K3 的架構不只是更大的 checkpoint。Moonshot 公開了 Kimi Delta Attention 和 Attention Residuals。社群文章也提到 LatentMoE 或 Stable LatentMoE、896 個 experts 中啟用 16 個、per-head Muon、quantile load balancing 和 SiTU。
KDA 已經影響 runtime 工作。vLLM 表示,Moonshot 直接向 vLLM 貢獻了 KDA prefix-caching support,因為 KDA 會打破傳統 prefix caching 背後的假設。實際 serving speed 約每秒 26 到 28 tokens 的回報,也解釋了為什麼好幾位觀察者關注的不只是 leaderboard rank,還包括 harness defaults、thinking history 和 long-session behavior。
開放權重的承諾,最後仍要靠這層 serving 撐起來。