GitHub, Claude·Codex agent에 작업별 모델 선택권을 붙였다
GitHub가 github.com의 Claude·Codex coding agent를 더 이상 단일 모델 제품으로 두지 않기로 했다. 이제 사용자는 task 시작 시점에 Anthropic 4종과 OpenAI 3종 가운데 고를 수 있고, 이 선택이 latency와 비용, patch 품질을 크게 바꾼다.
카테고리
Insights의 LLM 기사
GitHub가 github.com의 Claude·Codex coding agent를 더 이상 단일 모델 제품으로 두지 않기로 했다. 이제 사용자는 task 시작 시점에 Anthropic 4종과 OpenAI 3종 가운데 고를 수 있고, 이 선택이 latency와 비용, patch 품질을 크게 바꾼다.
GitHub가 Copilot의 compliance 이슈를 실제 배포 가능한 정책으로 바꿨다. 미국·EU data residency가 Copilot의 모든 일반 제공 기능을 덮고, 미국 정부 고객은 FedRAMP Moderate 기준의 인프라를 쓰게 되지만 대가는 1.1배 model multiplier다.
OpenAI가 defensive cybersecurity용으로 조정한 GPT-5.4-Cyber를 검증된 개인 수비자와 인증된 팀에 열기 시작했다. 중요한 점은 TAC가 소수 pilot을 넘어 수천 명의 defender와 수백 개 팀으로 커진다는 데 있다.
이번 스레드는 Claude를 정렬 대상이 아니라 정렬 연구 도구로 밀어 넣었다는 점에서 의미가 크다. Anthropic이 연결한 글에 따르면 9개의 Claude Opus 4.6 에이전트가 인간 기준선 PGR 0.23을 0.97까지 끌어올렸고, 누적 연구 시간은 800시간 수준이었다.
r/MachineLearning에서는 1.088B pure SNN 언어모델을 from scratch로 수렴시켰다는 개인 실험을, 완성된 product보다 기존 합의에 도전하는 로그 공개로 받아들이는 분위기였다. 2026년 4월 13일 게시글은 27K steps에서 loss 4.4, 93% sparsity를 보고했고, 댓글에서는 흥미롭다는 반응과 함께 비교 가능한 metric과 더 긴 학습이 필요하다는 지적이 함께 나왔다.
LocalLLaMA에서는 Apple Silicon에서 Qwen3.5 추론을 4배 안팎까지 끌어올린 MLX용 DFlash 구현이, 과장된 demo가 아니라 baseline을 다시 잡고 open source로 공개한 engineering 작업이라는 점 때문에 주목받았다. 2026년 4월 13일 글 작성자는 stock MLX 기준으로 Qwen3.5-9B 2048 tokens에서 30.96 tok/s를 127.07 tok/s로 높였고 acceptance는 89.36%라고 공개했다.
Google은 AI 경쟁의 축을 단순한 답변 품질에서 개인 data 문맥으로 옮기고 있다. Gemini Personal Intelligence의 인도 진출은 Gmail, Photos, YouTube 기록을 읽는 memory형 assistant를 거대한 시장에서 시험하겠다는 뜻에 가깝다.
MCP는 이제 개발자 편의 기능이 아니라 enterprise 통제 문제로 넘어갔다. Cloudflare의 새 설계는 context를 잡아먹는 tool schema와 무질서한 local server 운영을 한 번에 다루려는 점에서 의미가 크다.
enterprise AI의 병목은 model 자체보다 그 바깥의 배선 작업에 있었다. OpenAI의 Cloudflare Agent Cloud 협업은 edge runtime, state, storage, tool execution을 한 번에 묶어 실서비스 경로를 짧게 만들려는 시도에 가깝다.
길게 도는 CLI agent 작업을 더 이상 한 화면에 묶어둘 필요가 없어졌다. GitHub의 새 <code>copilot --remote</code> 기능은 실행 중인 세션을 web과 GitHub Mobile로 미러링해 다른 기기에서 후속 명령, mode 전환, 승인 처리를 이어가게 한다.
PR이 멈추는 가장 지저분한 순간 하나가 버튼으로 줄어들었다. GitHub는 새 Fix with Copilot 흐름이 conflict를 정리하고 build와 test를 다시 확인한 뒤 cloud-based development environment에서 변경사항을 push한다고 설명했다.
Quantization 얘기는 accuracy가 버티지 못하면 곧바로 무너진다. Red Hat AI는 quantized Gemma 4 31B가 메모리를 절반으로 줄이면서 tokens/sec를 거의 2배로 높이고, baseline accuracy의 99%+를 유지한다고 적었다.