NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval
TL;DR · AI 摘要
NVIDIA Nemotron 3 Embed Ranks 1 Overall on RTEB, Advancing Agentic Retrieval Back to Articles 0 -1 Enterprise + Article...
核心要点
- 主题聚焦:NVIDIA Nemotron 3 Embed Ranks 1 Overall on RTEB,
- 来源:Hugging Face Blog,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
NVIDIA Nemotron 3 Embed 在 RTEB 排行榜位列第一,推动智能体检索技术发展
返回文章列表
[0
[-1
企业
+
]
文章
发布日期:2026年7月16日
点赞
18
[
- +12
Yauhen Babakhin
ybabakhin
关注
nvidia
Ronay Ak
ronay-nv
Jiarui Cai
jiaruic
Vinay Raman
viraman
Radek Osmulski
radekosmulski-nvidia
Jakub Zakrzewski
jzakrzewski
Anmol Gupta
anmolg-nvidia
Oliver Holworthy
oliverholworthy
Sahel Sharifymoghaddam
sahel-sh
Khang Pham
KhangPhamML
James Rong
hrong-nv
Steve Han
steve-nvidia
Sean Sodha
ssodha-nv
Isabel Hulseman
ihulseman0220
Bo Liu
BoLiu
在多步骤智能体工作流中,检索是关键环节。低质量的检索可能导致智能体获取不相关上下文、重复查询、浪费令牌预算,并将噪声带入后续推理步骤。
今天,我们发布 NVIDIA Nemotron 3 Embed,这是一组开源且可商用的嵌入模型,旨在提升检索质量,同时为生产级 RAG(检索增强生成)、智能体检索、代码检索和智能体记忆提供实用的部署方案。
该模型系列包含三个开源模型,在准确率-效率曲线上均达到最先进水平,其中 8B 参数模型在 RTEB 排行榜位列第一,1B 参数模型则针对生产级部署进行了高效优化:
| 模型 | 角色 | 最佳适用场景 | |------|------|--------------| | Nemotron-3-Embed-8B-BF16 | 标志性质量基准:在 RTEB 排行榜排名第一的旗舰嵌入模型 | 精度要求高的检索及高价值企业 RAG | | Nemotron-3-Embed-1B-BF16 | 高效标准版:针对生产检索中延迟和成本敏感场景的高效率模型 | 成本与延迟敏感的生产服务 | | Nemotron-3-Embed-1B-NVFP4 | 硬件加速版本:专为 Blackwell 优化的高效吞吐版本,内存占用更小 | 超高吞吐量及大规模基础设施 |
表1. Nemotron 3 Embed 模型适用性与部署矩阵。
图1. RTEB 多语言排行榜截图(2026年7月15日),显示 Nemotron-3-Embed-8B-BF16 排名第一。
核心特性
除了 RTEB 排行榜成绩,Nemotron 3 Embed 还为企业检索部署提供了生产就绪的功能集:
- 开放权重、数据集及训练配方:使团队能够自主检查、调优、微调并部署检索模型。
- 32k 上下文窗口:支持长文档、大代码上下文及多轮智能体历史的检索,减少截断。
- 多语言与代码检索:覆盖全球企业数据、技术文档及多文件代码仓库的检索需求。
- NVIDIA NVFP4 效率优化:提供 Blackwell 优化的 4 位部署路径,实现高吞吐量检索且内存占用更小。
- 微调与蒸馏配方:NVIDIA NeMo AutoModel 配方支持领域适配及模型压缩,助力团队将检索模型适配至自有数据。
- 即日生态集成:即刻在 Hugging Face 上提供,可部署为 NVIDIA NIM 微服务,兼容 vLLM,可通过主流 AI 云及推理合作伙伴访问。
评估:检索质量、智能体效率与部署权衡
我们从三个维度评估 Nemotron 3 Embed:检索质量、下游智能体效率以及部署权衡。8B 模型确立了模型系列的质量上限,而 1B BF16 和 NVFP4 版本则将相同的检索导向设计应用于更具成本效益和更高吞吐量的部署场景。
RTEB 领先表现与检索基准的显著提升
我们首先在 RTEB 上评估了这些模型,其中 Nemotron-3-Embed-8B-BF16 排名第一。我们还在 ViDoRe V3 Text、MMTEB Retrieval 和 LongEmbed 上通过平均 NDCG@10 指标对这些模型进行了测试。
图 2. 在 RTEB、ViDoRe V3 Text、MMTEB Retrieval 和 LongEmbed 上,使用平均 NDCG@10 指标比较 Nemotron 3 Embed 模型与前代 Nemotron 基线模型的检索准确率。
- Nemotron-3-Embed-8B-BF16 在 RTEB 上排名第一,RTEB 得分为 78.5%,MMTEB Retrieval 得分为 75.5%。
- Nemotron-3-Embed-1B-BF16 将 8B 模型的检索质量压缩到更小的部署规模。它在 RTEB 上得分为 72.4%,相比其 1B 前代模型(llama-nemotron-embed-vl-1b-v2)将错误率降低了 27%,在 MMTEB Retrieval 上得分为 71.0%,错误率降低 28%。
更佳检索对智能体的重要性
为在智能体场景中评估检索效果,我们使用由 Nemotron 3 Ultra 驱动的搜索代理,并调整检索系统使用的嵌入模型。更高效的检索可以更早返回相关证据,帮助智能体避免重复搜索、不必要的推理步骤和额外上下文检查。我们比较了 ViDoRe V3、BRIGHT 和 BrowseComp-Plus 上的平均检索准确率与预估的下游智能体每查询 token 成本。
图 3. 在 ViDoRe V3、BRIGHT 和 BrowseComp-Plus 上,平均检索准确率与下游智能体每查询 token 成本的对比。
评估说明:搜索代理使用 Nemotron 3 Ultra。下游 token 成本基于 Nemotron 3 Ultra 的输入/输出 token 数量,采用 GPT-5.5 定价公式估算。
图 3 显示,更强的检索能力可降低下游智能体 token 成本。更精确的检索系统能更早返回相关证据,帮助智能体以更少的重复搜索和推理步骤完成任务。在这些评估中,Nemotron 3 Embed 模型提升了智能体检索的前沿水平,其中 8B 模型在 ViDoRe V3、BRIGHT 和 BrowseComp-Plus 上同时实现了最高的平均检索准确率和最低的预估下游 token 成本。
在 Blackwell 上使用 NVFP4 扩展检索能力
对于高吞吐量部署,团队通常选择更小的嵌入模型以满足延迟和成本目标。Nemotron-3-Embed-1B-NVFP4 通过在 NVIDIA Blackwell 架构上使用原生 NVFP4 加速,旨在缩小服务效率与检索质量之间的差距。该模型将线性层的权重和激活量化为 NVFP4 以实现高效推理,并使用量化感知蒸馏(QAD)来帮助恢复长输入序列的精度。
图 4. ViDoRe V3 检索准确率与服务效率对比,将 Nemotron-3-Embed-1B-NVFP4 与部分更小的开源嵌入基线模型进行比较,包括 Qwen3-Embedding-0.6B 和 EmbeddingGemma-300M。
- 服务效率:Blackwell 上的 NVFP4 在高吞吐量、低延迟检索服务中,吞吐量可达 BF16 的 2 倍。
- 精度保持:NVFP4 版本在保持 BF16 检索精度 99% 以上的同时,减少了内存占用。
Day 0 高性能 NIM
对于生产级检索系统,服务堆栈还需要在不同输入序列长度和硬件目标下,保持在真实请求负载下的效率。为了使 Nemotron 3 Embed 在企业级规模上实现高性能,我们还发布了针对 1B 模型的优化版 NVIDIA NIM 微服务。如图 5 所示,基于 Rust 的 Nemotron 3 Embed NIM 在 NVIDIA GB200 和 RTX PRO 6000 GPU 上,针对 256 和 1024 的 ISL,性能表现与 vLLM 检查点相当或更优。
Figure 5. Nemotron 3 Embed NIM 与 vLLM 检查点在 NVIDIA GB200 和 RTX PRO 6000 GPU 上的服务性能对比。
Nemotron 3 Embed 模型构建方法
Nemotron-3-Embed-8B-BF16 通过将 Ministral-3-8B-Instruct-2512 的因果解码器转换为双向编码器,适配了其全序列检索的骨干网络。该模型在混合的网络来源和合成文本对上进行对比预训练,随后在法律、金融、医疗、商业和教育等领域的精选多语言检索数据集上进行微调。这 8B 模型作为旗舰嵌入模型,而同一系列早期的 8B 教师检查点则用于蒸馏出高效的 1B 变体。
缩小到 1B 模型
1B 模型并非从零开始训练的小型检索器。我们首先将双向适配方案应用于 Ministral-3-3B-Instruct-2512 骨干网络,建立 3B 检索器基线,随后通过两轮结构化剪枝和蒸馏进行压缩。
首先,使用 NVIDIA ModelOpt 的 mcore_minitron 神经架构搜索引擎,将 3B 父模型压缩至 2B 中间规模。NAS 管道在严格的参数预算下,搜索隐藏层宽度、FFN 大小、注意力头数和深度,以识别适用于检索任务的高效架构。
随后,通过 8B 教师检查点对 2B 中间模型进行蒸馏,以恢复排序准确性。我们使用多语言、领域内检索数据混合集上的余弦距离损失和均方误差损失组合,使学生模型的嵌入与教师模型对齐。
Figure 6. 剪枝和蒸馏流程将检索器从 3B 基线压缩至最终的 1B 生产模型。
同样的流程——ModelOpt 结构化剪枝后使用 8B 教师蒸馏——再次重复,将 2B 中间模型压缩至最终的 1.14B 嵌入模型。最终训练采用渐进式两阶段上下文扩展计划:
- 第一阶段:在 1024 个 token 上下文长度上聚焦于广泛的多语言对齐,重建父模型的核心检索行为。
- 第二阶段:将上下文长度扩展至 4096 个 token,并加入长上下文合成和推理数据集,帮助 1B 模型在更长输入中保持判别性召回能力。
以下表格总结了 Nemotron 3 Embed 模型的核心技术规格和部署目标:
模型大小 | 嵌入维度 | 上下文窗口 | 池化方式 | 输入前缀 | 目标硬件 ---|---|---|---|---|--- 8.0B | 4096 | 32k | Mean | query: / document: | 通用 GPU 推理 1.14B | 2048 | 低延迟 CPU/GPU | NVIDIA Blackwell/GB200
表 2. Nemotron 3 Embed 模型的架构规格和核心推理配置。
企业合作伙伴评估
企业 ISV、原生 AI 公司和内存提供商正在通过智能代理检索、代理记忆、代码检索和生产推理工作流,评估 Nemotron 3 Embed 的实际表现。
- "上下文是实现智能体精准性的关键。我们的上下文智能图谱利用嵌入向量和语义相似性技术,为像EnterpriseClaw这样的智能体提供最相关的企业级上下文信息。今年5月我们与NVIDIA联合推出的EnterpriseClaw早期测试结果令人振奋,尤其是NVIDIA新推出的Nemotron 3 Embed模型在问答场景中表现出比我们当前模型更优的性能。我们对这些模型进一步提升企业级智能体准确性和可靠性潜力感到非常兴奋。" - Automation Anywhere首席人工智能与开发官Adi Kuruganti
- "我们对NVIDIA Nemotron 3 Embed模型的初步评估显示,其在智能体检索使用场景中表现出色。1B和8B两个版本的可用性使团队能够根据不同环境的需求,在质量、延迟和部署要求之间灵活平衡。我们期待继续评估这些模型,并探索它们如何支持生产级AI应用的高性能检索。" - Boomi产品管理高级副总裁Mani Gill
- IBM在基于watsonx.data构建的概念验证中,对新推出的NVIDIA Nemotron Embed模型进行了评估,早期结果令人鼓舞。
- Mem0正在评估NVIDIA Nemotron 3 Embed模型用于其AI智能体记忆解决方案,其中嵌入向量技术帮助智能体检索相关记忆、关联上下文并追踪交互关系。
- Palantir正在与NVIDIA合作评估Nemotron 3 Embed模型的部署方案,为开展边缘检索任务的终端客户提供服务,这建立在之前将NVIDIA嵌入模型引入AIP模型目录的工作基础上。
- ServiceNow正在评估NVIDIA Nemotron Embed模型用于文档检索,并持续关注领域内微调技术以提升检索准确率。
- turbopuffer正在将其原生嵌入服务与Nemotron 3 Embed模型结合,使开发者能够在其语义搜索引擎中使用这些模型。
- "在我们的重排序堆栈中替换为NVIDIA Nemotron 3 Embed模型,使性能实现了显著提升,让我们能够以前所未有的精度从网页中选取与查询相关的片段。" - You.com高级AI工程师Rahul Mohan
- Zep评估了NVIDIA Nemotron 3 Embed 1B模型用于智能体记忆和上下文检索。在与Zep使用的多个模型(包括一些远大于Nemotron 3 Embed 1B的模型)的早期内部基准测试中,该模型在所有记忆检索任务中均排名第一。Zep认为FP4检查点的可用性也使该模型在存储和延迟方面具有很强的竞争力。
- Zoom正在评估NVIDIA Nemotron 3 Embed模型用于其企业智能体搜索的检索层,该检索层为Zoom的上下文层提供支持,帮助智能体从会议和工作场所知识源(包括文档、聊天记录、工单和其他内部系统)中检索相关信息。
入门指南
NVIDIA Nemotron 3 Embed模型开放权重和开源训练方案,使组织能够完全掌控如何为生产级AI应用定制和部署检索模型。
开发者可根据工作流程选择最适合的部署方案:
- Hugging Face - 获取模型权重、模型卡片以及SentenceTransformers、Transformers和vLLM的示例代码。
- NVIDIA NIM - 在build.nvidia.com访问优化后的微服务,实现生产级推理。
- AI云和推理合作伙伴 - 通过领先的生态系统合作伙伴部署Nemotron 3 Embed - Baseten、Bitdeer AI、DeepInfra、Friendli AI、OpenRouter。
对于需要领域适应或模型精简的工作负载,我们还开源了NVIDIA NeMo AutoModel训练方案:
- 微调方案 - 将Nemotron 3 Embed适配到您的企业语料库和检索任务中。
- 知识蒸馏方案 - 在保持排序质量的前提下压缩大型检索模型,实现生产部署。
例如,在NV Docs评估中,对Nemotron-3-Embed-1B-BF16进行微调后,NDCG@10指标从56.7%提升至63.3%(+11.6%),Recall@5指标从56.1%提升至62.8%(+11.9%)。
无论您是在构建企业搜索、生产级RAG、智能体记忆、代码检索还是智能体AI系统,NVIDIA Nemotron 3 Embed都提供灵活的部署方案——从Hugging Face上的开源模型,到完全托管的AI云平台,以及NVIDIA NIM微服务。
探索这些模型,在您偏好的平台上进行部署,并告诉我们您正在构建的项目。
本文提及的模型 5
本文提及的数据集 1
本文提及的空间 1
本文提及的集合 1
更多该作者的文章
智能体的数据
22
2026年7月8日
NVIDIA Isaac Teleop和GR00T 1.7 Open VLA模型现已在LeRobot发布
8
2026年7月7日
社区
编辑
预览
通过拖拽文本输入框、粘贴或
点击此处
上传图片、音频和视频。
轻点或粘贴此处上传图片
评论
· 注册或登录以发表评论
- +6