DeepSeek V4.1 Flash 如何縮小長上下文的 KV 快取?
從長時間執行的編碼代理程式出發,理解 DeepSeek V4.1 Flash 如何透過跨層共用、FP4 量化與局部狀態重建,減少 KV 快取的儲存與搬移負擔。
LATEST WRITING
以發布時間排序,聚焦 AI agent、coding agent 與工程導入限制。
從長時間執行的編碼代理程式出發,理解 DeepSeek V4.1 Flash 如何透過跨層共用、FP4 量化與局部狀態重建,減少 KV 快取的儲存與搬移負擔。
DeepSeek V4.1 Flash 分開配置輸入與輸出的啟用參數量,並縮減 KV 快取。Artificial Analysis 的評測則呈現另一項取捨:Token 用量高於 V4 Pro 0813,估計任務費用仍更低。
從 Latent Space AINews 重組 Kimi K3 這波討論,看 benchmark、KDA、agent sandbox 與 memory workflow 的工程含義。
Moonshot 的 Kimi K3 讓開放權重模型逼近前沿級封閉模型。團隊要真正用上它,還得把服務、評測和路由做好。
NVIDIA 的 Nemotron 3 Embed 把 RTEB 成績、1B 部署和 NVFP4 服務效率放在同一組模型裡,工程上要看品質、延遲和硬體條件怎麼取捨。
以 AINews 2026/7/14 的摘要為基礎,整理 Codex 使用量暴增、harness 與 eval 變成關鍵、低位元本機推論和即時多模態系統幾條線索。
Codex 和 ChatGPT Work 使用者快速衝到 700 萬,這件事比誰超車誰更有意思:coding agent 的競爭正在往 harness、cost per task 和資料邊界移動。
從 AVA-AI-Voice-Agent-for-Asterisk 看一個開源 AI 語音代理怎麼接上既有 PBX,包含架構、部署、版本更新與實務風險。
從 README 出發,看 Linux of AI 怎麼把 AI vendor lock-in 拆成 ontology、policy、orchestration、audit log 和成本結果測量等問題。
用 NVIDIA Nemotron 開放資料的例子,整理 Agentic AI 為什麼不能只看模型權重,以及合成資料在工具使用、persona、評估與信任裡扮演的角色。
整理 GPT-5.6 這次發布裡比較值得看的幾個技術點:ultra、多 agent、Programmatic Tool Calling、ChatGPT Work,以及安全邊界。
從 Sol、Terra、Luna 的價格和 benchmark,寫到 ultra effort、Codex 合併、ChatGPT Work、Sites beta 與 cyber safety 爭議。
Latent Space 訪談 Modal CTO Akshat Bubna,談 AI 工作負載為何需要沙盒、彈性推論、CLI 觀測和硬邊界。
harshaneel/humanize 把 AI 改寫和檢測包成零依賴 LLM 技能,benchmark 支持它壓低表面與 perplexity 訊號,但 learned classifier 仍是明確限制。
DeepMind 的 SIMA 2 顯示 Gemini 可讓遊戲代理在未見過的 3D 世界中解讀目標與自我改進,但長程任務、短記憶和低階操作仍未解。
Qu 等人的研究把 SSA 拆成現金流、複製與自我更新三個可檢查條件,並提醒現有來源只能證明元件存在,還不能證明完整系統已落地。
Obsidian AI Setup 的技術重點在長期上下文初始化、文件匯入品質與 generated Markdown 的維護邊界。
Vercel 建構 eve 暴露的工程問題,包含可恢復執行、工具權限、技能更新與 agent-readable web。
Mete Polat 整理二十個與 AI 共事的 mental model,重點落在 upfront alignment、rewind、工具授權、驗證迴圈和安全邊界。
Simon Willison 用 DSPy 評估 Datasette Agent 的唯讀 SQL 問答提示,問題出在 schema 資訊不足與工具呼叫建議太硬。
一個 Claude Code 風格 coding agent 的 alpha 版本,重點在檔案工具、命令執行與審批邊界。
Sonnet 5 的工程評估需要同時看標價、token 用量、工具迴圈、任務完成成本與平台整合限制。