
日本国家NVIDIA于7月17日推出了面向AI代理和RAG(检索增强生成)应用的嵌入式AI模型“Nemotron 3 Embed”。该系列包含高性能模型、高效模型以及针对Blackwell架构优化的模型三种类型,均采用开放权重,支持商业用途,并通过Hugging Face和NVIDIA NIM平台免费提供。
Nemotron 3 Embed专为企业级RAG、代理搜索及代码搜索等场景设计,具备32K上下文窗口,能够实现高精度搜索。这一特性有效减少了AI代理的重复检索和不必要的推理,从而大幅降低了令牌消耗。
此外,Nemotron 3 Embed开放了权重及微调和蒸馏的配方,方便用户根据自身需求进行定制。根据不同的使用环境,提供了以下三种模型:
Nemotron-3-Embed-8B-BF16
这是一个拥有80亿参数的顶级模型,专注于提升搜索精度,适合对准确性要求极高且风险较大的企业级应用。该模型基于“Ministral-3-8B-Instruct-2512”构建。
Nemotron-3-Embed-1B-BF16
该模型拥有11.4亿参数,强调高效性,适用于对延迟和成本敏感的环境。它是通过对基于“Ministral-3-3B-Instruct-2512”的父模型进行蒸馏而成。
Nemotron-3-Embed-1B-NVFP4
这是针对Blackwell架构GPU优化的高效模型版本,基于Nemotron-3-Embed-1B-BF16。采用NVFP4技术,在保持高效模型搜索精度的同时,减少了内存使用并实现了最高两倍的吞吐量提升。



