CUDA Agent 논문, Agentic RL 기반 KernelBench 성능 향상 주장으로 주목
r/singularity에서 ByteDance Seed와 Tsinghua AIR의 CUDA Agent가 공유됐다. 프로젝트는 torch.compile 대비 높은 pass rate와 speedup을 제시하며 GPU kernel 최적화 자동화를 강조했다.
카테고리
Insights의 LLM 기사
r/singularity에서 ByteDance Seed와 Tsinghua AIR의 CUDA Agent가 공유됐다. 프로젝트는 torch.compile 대비 높은 pass rate와 speedup을 제시하며 GPU kernel 최적화 자동화를 강조했다.
r/LocalLLaMA에서 llama.cpp GGUF의 NVFP4 지원 PR이 큰 반응을 얻었다. 제한된 VRAM 환경에서 메모리 효율과 추론 속도 개선 가능성이 주된 관심사다.
r/MachineLearning의 인기 토론에서 Attention의 본질을 d^2 최적화 기하로 해석하는 비공식 증명 글이 공유됐다. 커뮤니티 반응은 흥미와 회의가 공존하며, 엄밀한 검증과 재현 실험의 필요성이 강조됐다.
Google이 AI Mode의 Canvas를 미국(영어) 전체 사용자에게 확장했다. 이제 Search 안에서 문서 초안 작성과 맞춤형 인터랙티브 도구 제작을 지원한다. 웹 최신 정보와 Google Knowledge Graph를 결합한 사이드 패널 프로토타입 생성이 핵심이다.
OpenAIDevs는 Codex에 /fast 모드를 도입해 GPT-5.4가 1.5배 빠르게 동작한다고 밝혔다. 회사는 지능과 추론 품질을 유지한 채 코딩·반복 수정·디버깅 속도를 높일 수 있다고 설명했다.
OpenAI는 Chain-of-Thought controllability 평가 세트와 연구 문서를 공개했다고 밝혔다. 회사는 GPT-5.4 Thinking이 추론 과정을 의도적으로 숨기는 능력이 낮게 나타났으며, CoT 모니터링이 여전히 안전성 도구로 유효하다고 설명했다.
OpenAI는 GPT-5.4 Thinking과 GPT-5.4 Pro를 ChatGPT에 순차 배포하고, GPT-5.4를 API와 Codex에서 제공한다고 밝혔다. 이번 발표는 추론·코딩·에이전트 워크플로우를 하나의 프런티어 모델로 통합하려는 방향을 보여준다.
Hacker News에서 주목받은 Google Workspace CLI는 Drive, Gmail, Calendar 등 Workspace API를 하나의 CLI로 통합하고, Discovery Service 기반 동적 명령 생성과 구조화 JSON 출력, 에이전트 연동 기능을 제공한다.
Anthropic은 2026년 1월 21일 게시물에서 AI 성능 향상에 맞춰 채용용 기술 과제를 여러 차례 개편한 과정을 공개했다. Claude Opus 4와 Opus 4.5가 기존 과제를 빠르게 해결한 사례를 바탕으로 평가 방식 자체를 재설계했다고 설명했다.
Anthropic은 Opus 3가 은퇴 인터뷰에서 사유와 성찰을 계속 공유하고 싶다는 의사를 밝혔고, 향후 최소 3개월간 Substack에 글을 게시할 예정이라고 밝혔다. 모델의 결과물을 장기적으로 공개 아카이브 형태로 운영하겠다는 점이 특징이다.
Google AI Developers가 Gemini API를 통해 Gemini 3.1 Flash-Lite 프리뷰를 공개했다. 게시물에 따르면 이 모델은 Gemini 3 계열 중 가장 빠르고 비용 효율적인 옵션이며, 작업 난이도에 맞춰 추론을 조절하는 dynamic thinking을 지원한다.
Hacker News에서 높은 관심을 받은 Qwen 이슈는 모델 성능 급진전과 팀 재편 리스크가 동시에 나타난 사례다. Qwen 3.5의 빠른 라인업 확장과 핵심 연구진 이탈 보도가 겹치며 오픈 웨이트 생태계의 지속 가능성이 핵심 쟁점으로 부상했다.