Nemotron 3 Embed 8B, 1억9000만 문서·7만 질의 Q2D-Web 검색 평가 종합 1위
에이전트형 RAG의 첫 검색 단계가 1억9000만 개 웹 문서 규모에서 비교되기 시작했다. NVIDIA의 Nemotron 3 Embed 8B는 10개 언어, 약 7만 개 에이전트 재작성 질의의 통합 nDCG@10에서 1위를 기록했다. 다만 언어별 성능과 처리량은 원문 게시물만으로 확인되지 않아 별도 검증이 필요하다.
원문: Nemotron 3 Embed 8B tops Q2D-Web retrieval benchmark across 190 million documents 원문 보기 →
에이전트가 다시 쓴 질의를 대규모 웹에서 평가
검색 증강 생성 시스템의 품질은 답변 모델만으로 결정되지 않는다. 첫 단계 검색기가 관련 문서를 놓치면 뒤의 재순위화와 생성 모델이 복구할 정보 자체가 사라진다. Perplexity가 만든 Q2D-Web은 이 병목을 실제 웹 검색에 가까운 크기로 측정한다. 평가 대상은 1억9000만 개 웹 문서이며, 에이전트가 사용자의 요청을 검색에 맞게 바꾼 질의 약 7만 개를 10개 언어에서 사용한다.
“Nemotron 3 Embed 8B가 Q2D-Web 통합 nDCG@10에서 1위를 기록했다.”
이 수치는 NVIDIA AI의 원문 게시물에 담겼다. NVIDIA AI 계정은 Nemotron 모델과 GPU 기반 연구·개발 도구의 출시, 실제 평가 결과를 주로 전한다. 이번 글은 자체 모델의 순위를 알리는 동시에 Perplexity의 Q2D-Web 공개 게시물을 인용했다. Perplexity는 이를 에이전트형 RAG의 첫 단계 검색기를 위한 공개 벤치마크와 순위표로 설명하며, 세 종류의 관련성 판정을 포함한다고 밝혔다.
nDCG@10이 말하는 것과 말하지 않는 것
nDCG@10은 상위 10개 결과에 관련 문서가 얼마나 앞쪽에 배치됐는지를 관련성 등급에 따라 계산한다. 통합 점수 1위는 Nemotron 3 Embed 8B가 여러 언어와 질의를 합친 조건에서 가장 유리한 정렬을 만들었다는 뜻이다. 매개변수 8B급 임베딩 모델이 대규모 문서 집합에서 선두에 올랐다는 점은 검색 인프라를 구축하는 팀에 비용과 품질의 새 선택지를 제공한다. 특히 사용자의 원문 질의를 그대로 쓰지 않고 에이전트가 검색용으로 재작성하는 서비스라면 평가 조건이 실제 작업 흐름과 더 가깝다.
그러나 통합 순위만으로 모든 배포 환경의 승자를 정할 수는 없다. 원문 게시물에는 모델별 절대 nDCG@10 점수, 언어별 편차, 색인 지연, 질의 처리량, 메모리 사용량이 제시되지 않았다. 1억9000만 문서라는 규모도 특정 시점의 말뭉치와 관련성 판정 방식에 묶인다. 기업 내부 문서나 전문 용어가 많은 검색에서는 별도의 평가 세트가 필요하다. 공개 순위표는 출발점이지 운영 환경의 정확도 보증이 아니다.
다음 관전 지점
앞으로는 Nemotron의 언어별 성능과 지연 시간, 다른 임베딩 모델이 같은 색인 설정에서 재현하는 결과를 봐야 한다. Perplexity가 질의 생성 과정과 관련성 판정 자료를 어느 수준까지 공개하는지도 중요하다. 데이터와 평가 코드가 충분히 열리면 검색 사업자뿐 아니라 사내 RAG 팀도 자기 문서를 섞어 회귀 시험을 만들 수 있다. 순위표 갱신 뒤에도 Nemotron 3 Embed 8B가 선두를 유지하는지, 통합 점수의 이점이 실제 답변 정확도와 비용 절감으로 이어지는지가 다음 검증 과제다.
관련 기사
NVIDIA, Nemotron Nano 12B v2 VL을 온프레미스 영상 이해용 경량 오픈 모델로 전면 배치
NVIDIA는 2026년 3월 25일 Nemotron Nano 12B v2 VL이 온프레미스 video understanding을 지원하며, 자사 설명 기준으로 MediaPerf benchmark에서 30B급 대안에 가까운 성능을 더 작은 footprint로 낸다고 밝혔다. NVIDIA 모델 카드는 이를 multi-image reasoning, video understanding, visual Q&A, summarization을 위한 상용 가능 멀티모달 모델로 소개한다.
NVIDIA Nemotron 3 Embed 8B, RTEB 1위로 RAG 검색 경쟁 압박
RAG와 에이전트의 품질 병목이 검색 모델로 이동하고 있다. NVIDIA는 Nemotron 3 Embed 8B가 RTEB 전체 1위에 올랐고 32k context와 1B 변형을 함께 제공한다고 밝혔다.
NVIDIA TwoTower, 98.7% 품질 유지하며 생성 속도 2.42배 높인 확산 LLM
LLM 추론 속도를 높이는 다른 경로가 등장했다. NVIDIA의 Nemotron-Labs-TwoTower는 30B 백본을 두 타워 확산 모델로 바꿔 98.7% 품질과 2.42배 처리량을 동시에 제시했다.