NVIDIA Nemotron-Personas-Korea, 7M 합성 사용자로 agent 현지화
NVIDIA가 Hugging Face에 Nemotron-Personas-Korea를 공개했다. 한국 공공통계에 기반한 7 million synthetic personas는 agent localization이 번역뿐 아니라 지역, 존댓말, 직업, 공공 서비스 맥락까지 다뤄야 한다는 점을 보여준다.
태그
#nvidia 태그가 달린 기사
NVIDIA가 Hugging Face에 Nemotron-Personas-Korea를 공개했다. 한국 공공통계에 기반한 7 million synthetic personas는 agent localization이 번역뿐 아니라 지역, 존댓말, 직업, 공공 서비스 맥락까지 다뤄야 한다는 점을 보여준다.
중요한 점은 post-training agent 경쟁이 inference speed뿐 아니라 reinforcement learning throughput에 달려 있다는 데 있다. NVIDIA는 NeMo RL의 FP8 path가 Qwen3-8B-Base에서 RL workload를 1.48x 빠르게 하면서 BF16 accuracy를 따라간다고 제시했다.
중요한 점은 NVIDIA가 생성 비디오 연구를 짧은 clip이 아니라 simulation-ready 3D environment 쪽으로 밀고 있다는 것이다. 트윗은 Lyra 2.0이 per-frame 3D geometry와 self-augmented training을 쓴다고 설명했고, 프로젝트 페이지는 Gaussian splats와 mesh를 Isaac Sim으로 내보낼 수 있음을 보여 준다.
coding agent가 단순 PR 보조를 넘어 GPU kernel 최적화까지 들어갔다. Cursor는 NVIDIA와의 실험에서 235개 CUDA 문제를 3주간 풀어 38% geomean speedup을 냈다고 밝혔다.
핵심은 양자 컴퓨팅을 연구실 데모가 아니라 공개 모델·벤치마크·코드 스택으로 옮기려는 시도라는 점이다. 4월 14일 트윗은 Ising을 open suite로 짚었고, NVIDIA 기술 글은 Ising Calibration 1이 QCalEval에서 GPT-5.4보다 14.5%, Gemini 3.1 Pro보다 3.27% 높다고 적었다.
NVIDIA가 양자 칩 보정과 오류 정정을 개방형 AI 스택으로 묶었다. QCalEval에서는 GPT 5.4보다 14.5% 높았고, 디코딩 쪽은 2.25x 속도 개선 수치까지 내놔서, 양자 컴퓨팅의 가장 고된 소프트웨어 병목 하나가 실제 배포 단계로 조금 더 가까워졌다.
우주 데이터센터는 아직 미래형 구호에 가깝지만, 우주 inference는 벌써 사업 냄새가 난다. Kepler의 cluster는 10개 위성에 Nvidia Orin 40개를 얹고 고객 18곳을 확보해, space compute를 pitch deck 바깥으로 끌어냈다.
r/Games에서 확산된 게시물은 Resident Evil Requiem DLSS 5 데모가 AI slop 비판을 받자 Nvidia CEO가 이를 해명한 내용을 다뤘다.
NVIDIA AI PC는 2026년 4월 2일 X에서 Gemma 4 모델군이 RTX GPU와 DGX Spark에 최적화됐고, 특히 26B와 31B가 local agentic AI에 적합하다고 밝혔다. NVIDIA 공식 blog는 이 협업이 RTX PC, workstation, DGX Spark, Jetson Orin Nano, data center 배포까지 아우르며, native tool use, multimodal input, Ollama와 llama.cpp 기반 local runtime 지원을 제공한다고 설명한다.
Tom's Hardware 테스트에 따르면 Nvidia RTX Neural Texture Compression은 sample scene에서 texture memory를 약 85% 줄일 수 있다. 다만 가장 공격적인 모드는 performance cost가 있고, 시각 품질을 안정적으로 유지하려면 DLSS 같은 anti-aliasing이 사실상 중요하다.
NVIDIA는 2026년 4월 2일 Google의 최신 Gemma 4 모델을 RTX PC, DGX Spark, Jetson edge module에 맞춰 최적화했다고 밝혔다. 핵심은 compact multimodal model을 cloud 바깥의 실제 local agent stack으로 밀어 넣는 데 있다.
r/MachineLearning의 글과 연결된 benchmark writeup은 RTX 5090의 batched FP32 SGEMM이 비효율적인 cuBLAS 경로를 타며 GPU 계산 자원을 크게 남기고 있다고 주장한다.