Nemotron 3 Ultra, RTL 코딩 9개 범주 평균 97.1% 통과율로 열린 모델 경쟁 압박
반도체 설계 자동화에서 열린 모델의 실전성이 더 구체적인 수치로 제시됐다. NVIDIA는 Nemotron 3 Ultra가 CVDP 9개 RTL 범주에서 평균 97.1% 통과율과 반복당 6,629 토큰을 기록했다고 전했다.
카테고리
Insights의 LLM 기사
반도체 설계 자동화에서 열린 모델의 실전성이 더 구체적인 수치로 제시됐다. NVIDIA는 Nemotron 3 Ultra가 CVDP 9개 RTL 범주에서 평균 97.1% 통과율과 반복당 6,629 토큰을 기록했다고 전했다.
에이전트 성능 경쟁이 모델 크기만의 문제가 아니라는 점이 숫자로 드러났다. NVIDIA는 NOOA가 SWE-bench Verified 82.2%, CyberGym L1 86.8%를 기록했다고 밝혔다.
작은 microcontroller에서 LLM을 돌린다는 말은 과장이 아니다. 핵심은 flash에 25M parameter lookup table을 두고 token마다 필요한 일부만 읽는 메모리 배치다.
Debian의 쟁점은 “AI를 쓰느냐 마느냐”보다 기여물의 책임, 저작권, 공개 의무를 어디까지 요구할지에 가깝다. 세 제안은 같은 불안을 전혀 다른 규칙으로 풀고 있다.
오픈 가중치 모델을 둘러싼 관심은 “중국 모델을 막을 수 있나”보다 더 넓다. 모델 자체보다 그 위에 쌓이는 agent runtime, serving, 평가, 운영 도구가 다음 경쟁장이 되고 있다.
Claude Opus 5가 GitHub Copilot 모델 선택지에 들어오면서 고난도 코딩 작업을 GitHub 작업면 안에서 바로 맡길 수 있게 됐다. Pro+, Max, Business, Enterprise 사용자는 VS Code, Copilot CLI, cloud agent, JetBrains 등 9개 표면에서 순차적으로 접근한다.
일상형 고성능 모델 경쟁의 초점이 최고점보다 비용당 성능으로 옮겨갔다. Claude Opus 5는 Fable 5에 가까운 코딩·지식 작업 성능을 절반 가격으로 내세우며, API 가격은 입력 $5/M·출력 $25/M 토큰으로 책정됐다.
소형 오픈 모델도 짧은 RL 루프로 특정 과제 성능을 크게 끌어올릴 수 있다는 신호다. NVIDIA는 Nemotron 3 Nano가 5달러 미만 실험에서 22%에서 91%로 올랐다고 전했다.
대형 모델 서빙의 병목이 가중치 이동으로 좁혀졌다. NVIDIA는 ModelExpress로 DeepSeek-V4 Pro 시작 시간을 8분에서 1분 44초 수준으로 줄였다고 밝혔다.
가벼운 보안 특화 모델이 V8에서 고유 취약점 55건을 찾으며 방어 자동화의 비용 구조를 흔들었다. Google DeepMind는 정부와 신뢰 파트너에게만 CodeMender 경유 파일럿을 연다.
Microsoft가 주도한 공개 서한은 open-weight 모델 제한을 늦추자는 주장보다, 누가 서명했고 누가 빠졌는지 때문에 더 뜨거웠다.
AI coding agent를 더 많이 돌리자는 흐름에 맞서, 문제는 loop 수가 아니라 검토와 모델 학습의 한계라는 반론이 힘을 얻었다.