Kimi K3 之後,open-weight 模型該看效率和系統
從 Latent Space AINews 重組 Kimi K3 這波討論,看 benchmark、KDA、agent sandbox 與 memory workflow 的工程含義。
LATEST WRITING
以發布時間排序,聚焦 AI agent、coding agent 與工程導入限制。
從 Latent Space AINews 重組 Kimi K3 這波討論,看 benchmark、KDA、agent sandbox 與 memory workflow 的工程含義。
Moonshot 的 Kimi K3 讓開放權重模型逼近前沿級封閉模型。團隊要真正用上它,還得把服務、評測和路由做好。
NVIDIA 的 Nemotron 3 Embed 把 RTEB 成績、1B 部署和 NVFP4 服務效率放在同一組模型裡,工程上要看品質、延遲和硬體條件怎麼取捨。
以 AINews 2026/7/14 的摘要為基礎,整理 Codex 使用量暴增、harness 與 eval 變成關鍵、低位元本機推論和即時多模態系統幾條線索。
Codex 和 ChatGPT Work 使用者快速衝到 700 萬,這件事比誰超車誰更有意思:coding agent 的競爭正在往 harness、cost per task 和資料邊界移動。
從 AVA-AI-Voice-Agent-for-Asterisk 看一個開源 AI 語音代理怎麼接上既有 PBX,包含架構、部署、版本更新與實務風險。
從 README 出發,看 Linux of AI 怎麼把 AI vendor lock-in 拆成 ontology、policy、orchestration、audit log 和成本結果測量等問題。
用 NVIDIA Nemotron 開放資料的例子,整理 Agentic AI 為什麼不能只看模型權重,以及合成資料在工具使用、persona、評估與信任裡扮演的角色。
整理 GPT-5.6 這次發布裡比較值得看的幾個技術點:ultra、多 agent、Programmatic Tool Calling、ChatGPT Work,以及安全邊界。
從 Sol、Terra、Luna 的價格和 benchmark,寫到 ultra effort、Codex 合併、ChatGPT Work、Sites beta 與 cyber safety 爭議。
Latent Space 訪談 Modal CTO Akshat Bubna,談 AI 工作負載為何需要沙盒、彈性推論、CLI 觀測和硬邊界。
harshaneel/humanize 把 AI 改寫和檢測包成零依賴 LLM 技能,benchmark 支持它壓低表面與 perplexity 訊號,但 learned classifier 仍是明確限制。
DeepMind 的 SIMA 2 顯示 Gemini 可讓遊戲代理在未見過的 3D 世界中解讀目標與自我改進,但長程任務、短記憶和低階操作仍未解。
Qu 等人的研究把 SSA 拆成現金流、複製與自我更新三個可檢查條件,並提醒現有來源只能證明元件存在,還不能證明完整系統已落地。
Obsidian AI Setup 的技術重點在長期上下文初始化、文件匯入品質與 generated Markdown 的維護邊界。
Vercel 建構 eve 暴露的工程問題,包含可恢復執行、工具權限、技能更新與 agent-readable web。
Mete Polat 整理二十個與 AI 共事的 mental model,重點落在 upfront alignment、rewind、工具授權、驗證迴圈和安全邊界。
Simon Willison 用 DSPy 評估 Datasette Agent 的唯讀 SQL 問答提示,問題出在 schema 資訊不足與工具呼叫建議太硬。
一個 Claude Code 風格 coding agent 的 alpha 版本,重點在檔案工具、命令執行與審批邊界。
Sonnet 5 的工程評估需要同時看標價、token 用量、工具迴圈、任務完成成本與平台整合限制。