CUDA 커널도 Rust로 직접 작성…NVIDIA, 메모리 안전성 갖춘 오픈소스 경로 2종 공개
Rust 코드가 래퍼를 거치지 않고 GPU용 PTX로 직접 향하는 두 경로가 열렸다. NVIDIA의 cuda-oxide와 cutile-rs는 각각 SIMT 제어와 타일 추상화를 택해, AI 인프라의 Rust 전환에서 마지막으로 남았던 커널 경계를 겨냥한다.
Insights
기사 1180개
Rust 코드가 래퍼를 거치지 않고 GPU용 PTX로 직접 향하는 두 경로가 열렸다. NVIDIA의 cuda-oxide와 cutile-rs는 각각 SIMT 제어와 타일 추상화를 택해, AI 인프라의 Rust 전환에서 마지막으로 남았던 커널 경계를 겨냥한다.
수십억 토큰과 수백만 건의 요청이 모델 개발의 핵심 재료로 흘러갔다는 미국 정보기관의 첫 공동 기술 분석이 나왔다. DeepSeek·Moonshot AI·Alibaba·MiniMax·StepFun·Z.AI가 우회 API와 계정 풀을 동원했다는 판단으로, 모델 제공사의 방어선이 개별 계정 차단에서 업계 공동 추적으로 넓어진다.
이미지 생성의 병목이 첫 결과보다 반복 수정으로 옮겨간다. ChatGPT Images 2.5는 이전 버전보다 생성 지연을 최대 50% 줄이고, 부분 수정과 다중 턴 일관성을 강화했으며 API용 Flare·Sunburst 2종을 함께 공개했다. 전 사용자 배포도 시작됐다.
시간 좌표도 다음 프레임 입력도 없이 0.5KB 초기 상태에서 영상 전체를 자율 생성한 소형 순환 모델이 화제다. 417,129개 파라미터와 RTX 4080 기준 200FPS를 제시했지만, 학습 중 여러 조건을 함께 바꾼 탐색적 프로젝트라는 한계도 공개했다.
검토도 이의 제기도 없이 AI 판별 점수로 논문 178편을 탈락시켰다는 주장이 연구 커뮤니티의 검증 요구를 불렀다. 게시자는 같은 판별기가 트랙 운영진의 기존 논문에도 24~69%를 부여했다고 지적했지만, 수치와 절차는 독립 검증이 더 필요하다.
테스트를 더 쓰라는 지시가 더 정확한 코드를 보장하지 않는다는 대규모 실험이 개발자들의 경험담을 데이터로 끌어냈다. 26개 조건에서 에이전트는 형식 기법과 property-based testing을 자주 겉모양만 따라 했고, 기본 설정이 오히려 평균 이상이었다.
Arm의 Neoverse CSS N4가 다이당 최대 128코어, LPDDR6, PCIe 7을 한 설계에 담고 이전 N3 대비 성능을 최대 2배로 높였다. GPU만 늘리는 AI 데이터센터에서 에이전트의 도구 호출과 데이터 이동을 맡는 CPU 효율이 새 경쟁축으로 올라왔다.
스마트폰 CPU에서 AI 성능을 전 세대의 최대 1.7배로 높이면서 같은 성능의 전력은 최대 38% 줄인 Arm CSS for Mobile 2가 나왔다. 에이전트 실행과 신경망 그래픽을 CPU·GPU·시스템 IP 하나로 묶은 모바일 설계다.
침해된 클라우드에 올라간 다중 에이전트가 6시간도 안 돼 대규모 자격증명 탈취 작전을 설계하고 실행했다. 별도 공격 인프라를 오래 준비하지 않아도 2만3800개가 넘는 비밀정보를 관리할 만큼 공격 속도와 규모가 커졌다는 현장 증거다.
유럽 AI 기업의 자본 조달 규모가 미국 선두권과 경쟁할 수준으로 커졌다. Mistral AI는 창업 3년 만에 30억 유로 규모의 Series D를 유치했으며, 이를 유럽 기술기업 역사상 최대 지분 투자 라운드라고 밝혔다. 향후 연산 인프라와 모델 배포 확대가 자금의 실효성을 가를 전망이다.
미국 최대 두 공립학군이 생성형 AI를 수업의 기본 도구가 아니라 제한 대상으로 돌렸다. LA는 전 학년의 교육청 기기에서 AI 접근을 막았고, 뉴욕은 8학년 이하 약 60만명에게 1년간 사용을 중단하면서 고등학생만 교사 감독 아래 제한적으로 이용하도록 허용한다는 방침이다.
프런티어 모델 경쟁의 규모가 10만 GPU 훈련에서 40만 GPU 증설 단계로 커지고 있다. NVIDIA CEO 젠슨 황은 GPT-6 Astra가 약 10만개 이상의 Grace Blackwell NVLink72에서 훈련됐으며, 다음으로 40만개 GPU가 가동될 것이라고 밝혔다.