從 Codex 暴增看 AI agent 的下一個戰場
以 AINews 2026/7/14 的摘要為基礎,整理 Codex 使用量暴增、harness 與 eval 變成關鍵、低位元本機推論和即時多模態系統幾條線索。
TOPIC
8 篇文章
這裡收集本站中和「AI Agent」相關的工程判斷筆記,依發布時間排序。
回到主題索引以 AINews 2026/7/14 的摘要為基礎,整理 Codex 使用量暴增、harness 與 eval 變成關鍵、低位元本機推論和即時多模態系統幾條線索。
用 NVIDIA Nemotron 開放資料的例子,整理 Agentic AI 為什麼不能只看模型權重,以及合成資料在工具使用、persona、評估與信任裡扮演的角色。
整理 GPT-5.6 這次發布裡比較值得看的幾個技術點:ultra、多 agent、Programmatic Tool Calling、ChatGPT Work,以及安全邊界。
從 Sol、Terra、Luna 的價格和 benchmark,寫到 ultra effort、Codex 合併、ChatGPT Work、Sites beta 與 cyber safety 爭議。
DeepMind 的 SIMA 2 顯示 Gemini 可讓遊戲代理在未見過的 3D 世界中解讀目標與自我改進,但長程任務、短記憶和低階操作仍未解。
Qu 等人的研究把 SSA 拆成現金流、複製與自我更新三個可檢查條件,並提醒現有來源只能證明元件存在,還不能證明完整系統已落地。
Vercel 建構 eve 暴露的工程問題,包含可恢復執行、工具權限、技能更新與 agent-readable web。
Mete Polat 整理二十個與 AI 共事的 mental model,重點落在 upfront alignment、rewind、工具授權、驗證迴圈和安全邊界。