
Google DeepMind 在 2025 年 11 月 13 日公開 SIMA 2,一個以 Gemini 為核心的 3D 虛擬世界 agent。前一代 SIMA 主要把人類指令轉成鍵盤與滑鼠操作;SIMA 2 多了對目標的推理、對使用者的回覆,以及用自身經驗繼續訓練下一代 agent 的流程。工程上值得讀的是介面邊界:DeepMind 仍讓 agent 只看畫面、用虛擬鍵盤和滑鼠動作,不直接讀遊戲內部狀態。
Gemini 進入控制迴圈後,中間步驟變得可觀察#
第一代 SIMA 學會超過 600 種語言跟隨技能,例如「向左轉」、「爬上梯子」和「打開地圖」。agent 的輸入是螢幕畫面,輸出是虛擬鍵盤與滑鼠操作,訓練目標是跨多款商業遊戲執行人類指令。
Gemini 介入後,SIMA 2 可以把高階目標拆成遊戲內行動,並向使用者說明接下來打算做什麼、目前正在做哪一步。訓練資料包括帶語言標籤的人類示範影片,也包括 Gemini 產生的標籤。DeepMind 的示例涵蓋手繪螢幕提示、多語言指令與 emoji;可觀察結果仍是任務是否完成、行動是否對準環境。公開文章沒有提供低階 policy 結構、延遲數字或錯誤分類,判斷要停在來源能證明的範圍。
泛化證據來自未見遊戲與生成世界#
DeepMind 將 SIMA 2 放進 ASKA 和 MineDojo。ASKA 是維京生存遊戲,MineDojo 是 Minecraft 的研究實作,兩者都屬於訓練時未見的遊戲。文章說 SIMA 2 在 held-out games 的任務完成率高於 SIMA 1,也比前一代更接近人類玩家;公開文字沒有列出成功率圖表中的具體數字。
另一組測試把 SIMA 2 接到 Genie 3。Genie 3 可從文字或單張圖片產生即時 3D 模擬世界。SIMA 2 進入新生成世界後,DeepMind 觀察到 agent 能定向、理解使用者指令,並朝目標做出有意義的動作。Genie 3 測試把泛化壓到新場景的即時感知與行動;DeepMind 後文仍承認,很長的多步驟任務與目標驗證還沒解掉。
自我改進流程的重點在回饋來源#
SIMA 2 的 self-improvement 由 Gemini 產生初始任務和估計獎勵值開始。agent 的行為資料被放進自產經驗庫,後續世代再用經驗資料訓練。文章描述,在 ASKA 和 Genie 3 環境中,SIMA 2 可以在沒有額外人類回饋或遊戲資料的情況下,改善原本失敗的任務。
資料來源從人類示範擴到 agent 試錯軌跡和 Gemini 評分,這是研究價值所在。公開文章仍無法拆出貢獻比例,包括 Gemini 產生任務的品質、獎勵估計的穩定度,以及下一代模型到底從失敗軌跡學到什麼。對訓練 agent 的人來說,reward 來源和 experience bank 對後續模型的影響,比 self-improvement 這個標籤更可檢查。
限制集中在長程記憶與低階操作#
DeepMind 把幾個限制寫在文章後段。SIMA 2 面對很長的複雜任務時仍有困難,特別是需要多步驟推理和 goal verification 的場景。agent 的互動記憶也短,原因是為了維持低延遲,只能使用有限 context window。
輸入輸出介面也帶來取捨。看畫面、按鍵盤和滑鼠讓 SIMA 2 可跨遊戲運作,因為 agent 不依賴遊戲內部機制;精準低階操作和複雜 3D 場景的視覺理解也會卡在同一個介面邊界。SIMA 2 的研究結果支持把推理模型接進行動迴圈,但控制精度和狀態確認仍要靠系統設計補上。
機器人連結仍停在研究假設#
DeepMind 提到,SIMA 2 在遊戲裡學到的導航、工具使用和協作任務,是未來實體 AI 助理需要的基本能力。公開文章沒有提供實體機器人實驗結果,robotics 連結目前來自虛擬環境中的行為類比。
DeepMind 將 SIMA 2 定位為 limited research preview,早期存取只給少數學者和遊戲開發者。文章也提到團隊與 Responsible Development & Innovation Team 合作,特別把 self-improvement 放在責任開發範圍內。
外部團隊目前能取得研究敘述、影片和圖表;可直接重跑的模型、資料集或完整評測腳本沒有隨文章一起公開。SIMA 2 目前最可檢查的訊號是 agent 看螢幕、和使用者對話、把目標拆成行動,再把試錯經驗放回訓練流程。DeepMind 同時承認長程驗證、短記憶和低階控制仍未解;早期使用權仍限制在少數學者與遊戲開發者手上。