
最近看到 Hugging Face 上 NVIDIA 這篇〈Data for Agents〉,我第一個反應是:這題其實比「模型開不開源」麻煩很多。
因為 Agent 這種東西,最尷尬的地方不在會不會回答,而在它開始動手之後。API 壞掉怎麼辦?workflow 沒看過怎麼辦?工具回傳怪東西,模型是卡住、亂猜,還是能退一步修正?如果這些情境沒有進到訓練資料和評估裡,那它看起來再會講,也比較像一個接了工具的 autocomplete。
原文把這件事講得很直接。Agent 的能力,其實是資料問題。裡麵包含軟體工程 trace、工具使用失敗、多步推理、檢索、安全性、使用者模擬和 workflow 執行。開放權重當然重要,可是隻看權重,我們很難知道模型為什麼會那樣呼叫工具,為什麼某些任務會失敗,也很難重現別人的結果。
這邊 Nemotron 系列扮演的角色,就比較像把「模型背後的資料層」攤出來。NVIDIA 提到,Nemotron 模型與資料集在 ICML 相關研究裡被將近 145 篇論文引用。Nemotron-CC 用合成資料強化 Common Crawl,Nemotron-CC-MATH 用合成數學題提升推理,Nemotron Pretraining 則涵蓋一般、程式碼、數學和合成資料,規模到數兆 token。
但問題也來了:資料真的開出來,就能解決一切嗎?
不會。尤其是公司內部最有價值的東西,往往正是不能公開的那部分。可能是一套 workflow,一批語料,也可能是競爭對手沒有的客戶模式。Bryan Catanzaro 的說法是,每家公司都圍繞著某個秘密建立。這句話放在 AI 上其實很準,因為模型要有用,常常就是靠這些細節;可是公司也不可能把底牌全部丟到公開資料集。
合成資料在這裡的用途,不是把秘密洗白成可以隨便流通的東西,而是保留訊號,同時降低暴露底層來源的風險。這個取捨很現實。大家都希望共享資料層更豐富,沒有人想第一個交出讓自己有差異的東西。
原文中我覺得最具體的工具,是 Nemotron Post-Training v3 Prompt Atlas。NVIDIA 說他們已釋出超過 10 兆個預訓練 token,還有數百萬筆後訓練樣本。數字很大,但大型資料表通常不會讓人更懂資料,頂多讓人知道自己快迷路了。
Prompt Atlas 的做法比較工程一點:把每個 prompt 樣本變成地圖上的一個點,從 Nemotron v3 後訓練集合依資料量抽樣,讓混合比例比較接近原本資料分佈。你可以用顏色和篩選器看 dataset、pipeline stage、domain 或 tool use。語意接近的 prompt 會聚在一起,所以可以放大某塊區域,看 coding algorithm、安全、數學或 agentic behavior 的代表樣本。
這種東西的價值在於,它讓資料整理和 eval 建立變得比較可檢查。模型行為很抽象,可是 prompt cluster、樣本比例、工具使用情境都攤開之後,至少比較有地方下手。
再來是 persona。這部分很容易被寫成空泛的「多元性」,但原文給了一個好例子:用英文網路資料訓練的 toxicity classifier,可能抓不到韓文或日文裡的敵意,因為攻擊性有時藏在禮貌層級,而不是明顯髒話。訊號一樣,語境換了,模型就可能看不懂。
Nemotron-Personas 想處理的就是這種在地資料品質。它用 NeMo Data Designer 產生合成 persona,並對齊官方區域人口與地理統計。目標不是重建真人,而是讓開發者測系統有沒有反映自己聲稱服務的使用者、語言、地區和職業。Privasis-USA 則沿著 Nemotron-Personas-USA 往醫療、金融、法律和社會情境延伸,加入保護隱私的合成紀錄。NVIDIA 也提到,這個集合已發布第十個國家,代表超過 24 億人。
看到這邊,我覺得比較健康的態度,是把合成資料當成一種需要管理的資料來源。它可以降低風險,但仍然需要 grounding、lineage、curation、evaluation 和人工判斷。真實 workflow、人類回饋、模型生成 trace、模擬使用者和合成標籤會混在一起,那條「還算真實資料嗎」的界線常常不會很清楚。
所以真正麻煩的工作,是把哪些內容由模型生成、哪些有 grounding、哪些經過審查、資料原本想測什麼,都記錄下來。推理資料要看題目難度和 trace 乾淨程度;persona 資料要看分佈是否忠實、是否有人做在地審查;agentic workflow 則要看任務多樣性、失敗覆蓋和復原路徑。
這篇文章對我來說最有用的提醒,是不要把 Agent 進步想成單純換更大的模型。當模型開始跨系統做事,資料來源、整理方式和評估方法就會變成產品行為的一部分。開放資料和合成資料不是漂亮包裝,它們比較像一組可以被檢查的工具。檢查得夠細,才有機會知道 Agent 到底學到了什麼,也比較有資格討論它能不能被信任。