NVIDIA Nemotron 3 Embed 8B, RTEB 1위로 RAG 검색 경쟁 압박
RAG와 에이전트의 품질 병목이 검색 모델로 이동하고 있다. NVIDIA는 Nemotron 3 Embed 8B가 RTEB 전체 1위에 올랐고 32k context와 1B 변형을 함께 제공한다고 밝혔다.
태그
#nvidia 태그가 달린 기사
RAG와 에이전트의 품질 병목이 검색 모델로 이동하고 있다. NVIDIA는 Nemotron 3 Embed 8B가 RTEB 전체 1위에 올랐고 32k context와 1B 변형을 함께 제공한다고 밝혔다.
영상 분석 파이프라인 구축이 코드 중심 작업에서 자연어 지시와 coding agent 조합으로 이동하고 있다. NVIDIA DeepStream 9.1은 13개 agentic skills와 JetPack 7.2 지원을 포함한다.
865 FP4 TFLOPS를 절반 크기·전력대에 넣은 Jetson T3000이 로봇 엣지 AI의 비용선을 낮춘다. Cosmos 3 Edge와 agent skills까지 묶이며 휴머노이드와 산업용 로봇의 온디바이스 추론 경쟁이 더 가까워졌다.
NVIDIA가 Cosmos 3 Nano를 교통 안전 영상 QA에 맞춰 후처리해 정확도를 54.41%에서 93.35%까지 끌어올린 결과를 공개했다. agent가 LoRA와 AutoML을 실행한 점이 핵심이다.
NVIDIA가 LLM 구조를 GPU tile 크기에 맞추는 설계 원칙을 제시했다. 128 배수 정렬, 256·512 선호, NVFP4와 expert parallelism이 처리량과 지연시간을 함께 좌우한다는 내용이다.
NVIDIA가 agentic AI용 CPU Vera의 성능 근거를 공개했다. Olympus 코어는 Grace보다 IPC가 50% 높고, agentic 실행 부하에서 x86 대비 지속 per-core 성능 1.8배를 제시했다.
NVIDIA와 Hugging Face가 Isaac GR00T 1.7, Isaac Teleop, 데이터셋, 로봇 워크플로를 LeRobot에 연결했다. 1,600만 Hugging Face AI 빌더와 300만 NVIDIA 로봇 개발자가 같은 오픈 파이프라인을 쓰게 되는 구조다.
NVIDIA Research의 MOTIVE는 video model fine-tuning에서 움직임에 실제로 기여하는 clip을 골라내는 방법이다. ICML 2026 Outstanding Paper Honorable Mention을 받았고, base model 대비 74.1% human preference를 기록했다.
NVIDIA는 Nemotron family가 100M downloads를 넘었다고 밝혔다. benchmark나 출시 문구가 아니라, open model 전략이 개발자 환경에 얼마나 퍼졌는지 보여주는 수치다.
LLM이 학습 데이터를 얼마나 암기하는지에 대해 NVIDIA가 ICML 논문을 공유했다. 핵심 수치는 parameter당 약 3.6 bits로, privacy와 scaling 논의를 사례가 아닌 용량 문제로 바꾼다.
LLM 추론 속도를 높이는 다른 경로가 등장했다. NVIDIA의 Nemotron-Labs-TwoTower는 30B 백본을 두 타워 확산 모델로 바꿔 98.7% 품질과 2.42배 처리량을 동시에 제시했다.
기업 AI 도입의 병목이 모델 부족에서 운영 복잡도로 이동하고 있다. NVIDIA는 내부 Enterprise Inference Hub가 100개 넘는 모델 엔드포인트와 매주 수조 토큰 규모의 사용을 처리한다고 밝혔다.