AI X/Twitter Aug 20, 2026 2 min read
지원되는 Hugging Face 모델을 ONNX 중간 변환 없이 두 명령으로 TensorRT 추론 번들로 만들 수 있게 됐다. NVIDIA의 TensorRT Model Connect는 같은 번들을 네이티브 C++ API에서 실행하며, 전체 프로젝트는 Codex 에이전트와 사람의 검토로 구축됐다.
지원되는 Hugging Face 모델을 ONNX 중간 변환 없이 두 명령으로 TensorRT 추론 번들로 만들 수 있게 됐다. NVIDIA의 TensorRT Model Connect는 같은 번들을 네이티브 C++ API에서 실행하며, 전체 프로젝트는 Codex 에이전트와 사람의 검토로 구축됐다.
NVIDIA가 LLM 구조를 GPU tile 크기에 맞추는 설계 원칙을 제시했다. 128 배수 정렬, 256·512 선호, NVFP4와 expert parallelism이 처리량과 지연시간을 함께 좌우한다는 내용이다.