GitHub Code Quality, AI가 coverage workflow PR까지 작성
GitHub Code Quality 설정에 AI가 코드 coverage workflow를 만들어 PR로 올리는 기능이 들어갔다. 저장소별 빌드·테스트·coverage 업로드 절차를 한 번에 구성하되, 병합 전 사람이 검토하는 구조다.
카테고리
Insights의 LLM 기사
GitHub Code Quality 설정에 AI가 코드 coverage workflow를 만들어 PR로 올리는 기능이 들어갔다. 저장소별 빌드·테스트·coverage 업로드 절차를 한 번에 구성하되, 병합 전 사람이 검토하는 구조다.
긴 컨텍스트 모델의 속도는 학습 전 attention 설계에서 사실상 결정된다. NVIDIA는 4K에서 128K로 갈수록 attention 비중이 18%에서 85%까지 커진다고 설명했다.
음성 AI의 체감 품질은 모델보다 지연 시간에서 갈린다. OpenAI는 GPT-Live가 말하는 동안 듣고, WebRTC 시작 절차를 6회 네트워크 왕복에서 1회로 줄였다고 설명했다.
LLM 평가가 짧은 프롬프트 그림 생성에서 장시간 실행 코드 생성으로 넓어지고 있다. Karpathy는 Opus 5가 약 $10의 1M 토큰 예산과 2시간 실행으로 5,500줄 Three.js 코드를 만들었다고 전했다.
대형 변경 리뷰 병목을 줄이는 기능이 GitHub 기본 워크플로로 들어왔다. GitHub 문서는 stacked PR을 같은 저장소 안의 의존 PR 체인으로 만들고 독립 리뷰·병합할 수 있다고 설명한다.
코딩 에이전트 평가는 이제 pass@1만으로 부족하다. Together AI는 DeepSWE 분석에서 Kimi K3가 Fable 5에 근접한 pass@1을 보이면서 rollout 비용은 약 3분의 1이었다고 밝혔다.
2.4T MoE 모델이 공개 가중치까지 예고하면서 폐쇄형 코딩 모델의 가격 기준이 압박받는다. Qwen은 Qwen3.8-Max 입력 $2, 출력 $6/M 토큰과 1M 컨텍스트를 함께 제시했다.
235개 댓글의 관심은 “모델이 맞힌 답”보다 “그 답에 붙은 reasoning trace가 실제 이유인지”에 모였다.
660점까지 오른 논점은 “agent를 Slack과 웹에서 여러 사람이 함께 쓰면 권한, 메모리, 샌드박스를 어떻게 나눌 것인가”에 모였다.
Copilot의 모델 선택지가 7월 31일 한 번에 바뀌었다. GitHub는 Copilot Chat, inline edits, ask, agent mode, code completions 전반에서 Gemini 2.5 Pro와 Gemini 3 Flash를 deprecated 처리하고 대체 모델을 제시했다.
Agent 품질 검증이 개발 실험과 실제 운영 트래픽을 같은 엔진에서 비교하는 단계로 넘어갔다. Google은 Gemini Enterprise Agent Platform의 평가 서비스를 GA로 전환하며 20개 이상의 사전 구축 지표, adaptive rubrics, drift 알림을 묶었다.
NVIDIA AI가 Thinking Machines의 Inkling-Small NVFP4 체크포인트를 공개적으로 가리키며 오픈 가중치 멀티모달 모델 경쟁에 새 선택지가 추가됐다. Hugging Face 메타데이터는 Apache-2.0, MoE, 이미지·오디오 입력 태그와 25,000회 이상 다운로드를 보여준다.