Agent 檢索的 embedding 選型:Nemotron 3 Embed 給出的三種取捨

NVIDIA 的 Nemotron 3 Embed 把 RTEB 成績、1B 部署和 NVFP4 服務效率放在同一組模型裡,工程上要看品質、延遲和硬體條件怎麼取捨。

Agent 檢索的 embedding 選型:Nemotron 3 Embed 給出的三種取捨

NVIDIA 在 Hugging Face Blog 發布 Nemotron 3 Embed 時,把主軸放在一個很工程的問題:retriever 品質不夠,Agent 會拿錯 context、重查、燒 token,還把雜訊帶進後面的推理。文章給出的主要證據是 RTEB、ViDoRe V3 Text、MMTEB Retrieval、LongEmbed,以及一組用 Nemotron 3 Ultra 搜尋 Agent 做的 downstream token cost 估算。

分數先看哪幾個#

Nemotron-3-Embed-8B-BF16 在 RTEB 排第 1,RTEB 分數 78.5%,MMTEB Retrieval 是 75.5%。這個數字本身只代表 benchmark 上的 retrieval 品質,不等於你的 production RAG 會直接變好,但它至少把 8B 版本的位置講清楚:NVIDIA 把它當成品質上限。

比較有部署味道的是 1B BF16。它在 RTEB 拿到 72.4%,相對前一代 1B 模型 llama-nemotron-embed-vl-1b-v2,錯誤率降低 27%;MMTEB Retrieval 是 71.0%,錯誤率降低 28%。如果你的問題是 latency 和成本,這組數字會比單看榜首更接近日常選型。

Agent 成本這段要看註解#

文章用 Nemotron 3 Ultra 當 search agent,替換 retrieval system 裡的 embedding model,然後比較 ViDoRe V3、BRIGHT 和 BrowseComp-Plus 的平均 retrieval accuracy 與每個 query 的 downstream agentic token cost。NVIDIA 的結論是,retriever 越準,相關 evidence 越早回來,Agent 重複搜尋和推理輪數會變少。

這段我會把它當成「在這個實驗設定下的方向性證據」。原因很簡單,token cost 是從 Nemotron 3 Ultra 的 input/output token counts,再用 GPT-5.5 pricing formula 估出來。公式可以幫你比較趨勢,但還沒有替你的 corpus 和 tool 呼叫模式買單。

部署差異不是隻看引數量#

三個模型的定位分得很明確。8B BF16 給 precision-critical retrieval 和高風險 enterprise RAG;1B BF16 給成本與延遲敏感的 production serving;1B NVFP4 則瞄準 Blackwell/GB200 上的大規模吞吐。

NVFP4 版本把 linear layer 的 weights 和 activations 量化到 NVFP4,搭配 Quantization-Aware Distillation 補長輸入序列的準確率。文章宣稱在 Blackwell 上,NVFP4 對高吞吐、低延遲 retrieval serving 可比 BF16 高到 2x throughput,同時保留 99%+ 的 BF16 retrieval accuracy。服務層也有對應安排:Rust-based Nemotron 3 Embed NIM 在 NVIDIA GB200 和 RTX PRO 6000 GPU、ISL 256 與 1024 下,與 vLLM checkpoint 持平或更好。

為什麼 1B 還值得看#

1B 版不是從零訓練的小 retriever。NVIDIA 先把 Ministral-3-3B-Instruct-2512 做 bidirectional adaptation,得到 3B retriever base,再用 ModelOpt 的 mcore_minitron NAS 壓到 2B,接著用 8B teacher checkpoint distill。這個流程跑兩輪,最後得到 1.14B embedding model。訓練後段還分成 1024-token multilingual alignment 和 4096-token long-context 資料兩階段。

企業端案例多半還在 evaluation 或 early internal benchmark 階段。Mem0 提到 1B 在 LongMemEval Retrieval@10 拿 80.38%,高於 Qwen-3-0.6B 的 78.71%;Zep 說 1B 在多個 memory retrieval tasks 排第一。這些是有名字的早期訊號,還不能直接替換成一般化結論。

簡單來說,這次 Nemotron 3 Embed 比較像一組 retrieval 選型表:要品質上限看 8B,要一般 CPU/GPU 低延遲看 1B BF16,有 Blackwell 且吞吐壓力很大再看 1B NVFP4。真正要驗證的地方,還是自己的 corpus、query 分佈和 Agent 會不會因為更早拿到正確 evidence 而少繞幾圈。