DeepMind 4개 지역 12B 분산 훈련, 동기식 병목을 20배 속도로 돌파
Google DeepMind의 새 훈련 구조가 중요한 이유는 데이터센터 경계 자체가 최전선 병목이 되고 있기 때문이다. Decoupled DiLoCo는 2-5Gbps 광역 링크 위에서 4개 미국 지역에 걸쳐 12B Gemma 모델을 학습했고, 기존 동기화 방식보다 20배 넘게 빠르면서 평균 정확도는 64.1%로 기준선 64.4%에 거의 붙었다.
태그
#infrastructure 태그가 달린 기사
Google DeepMind의 새 훈련 구조가 중요한 이유는 데이터센터 경계 자체가 최전선 병목이 되고 있기 때문이다. Decoupled DiLoCo는 2-5Gbps 광역 링크 위에서 4개 미국 지역에 걸쳐 12B Gemma 모델을 학습했고, 기존 동기화 방식보다 20배 넘게 빠르면서 평균 정확도는 64.1%로 기준선 64.4%에 거의 붙었다.
Google은 기업용 AI가 시범 운영을 지나 실제 운영 단계로 넘어갔다는 신호를 던졌다. 4월 22일 Cloud Next 글에서 고객 직접 API 호출이 분당 160억 토큰을 넘었고, 2026년 머신러닝 연산 투자 가운데 절반 이상이 클라우드 사업으로 향한다고 적었다.
Cerebras가 2024년 철회했던 IPO를 다시 추진한다. TechCrunch 보도에 따르면 회사는 2025 revenue $510M, 2025 adjusted basis net income $237.8M을 filing에 적었고, AWS 및 OpenAI 관련 대형 수요가 AI chip 시장의 Nvidia 의존을 흔드는 변수로 떠올랐다.
Anthropic는 April 6, 2026에 Google과 Broadcom으로부터 2027 시작 예정인 next-generation TPU capacity를 multi-gigawatt 단위로 확보했다고 밝혔다. run-rate revenue가 $30 billion을 넘고 million-dollar customers가 February 이후 두 배로 늘어난 상황에서, 이번 계약은 infrastructure scale과 demand surge를 함께 보여준다.
OpenAI는 2026년 4월 8일 enterprise가 자사 매출의 40% 이상을 차지하며 2026년 말에는 consumer와 비슷한 규모로 커질 수 있다고 밝혔다. 회사는 OpenAI Frontier와 통합 AI superapp을 앞세워 enterprise 전체로 확장되는 agent 전략을 설명했다.
Microsoft는 2026년 4월 3일 일본에 100억 달러를 투자해 AI infrastructure, cybersecurity, workforce를 강화하겠다고 발표했다. 계획에는 일본 내 GPU access, 공공·민간 보안 협력, 그리고 2030년까지 100만 명 이상의 engineers·developers 교육이 포함된다.
Microsoft는 2026년부터 2028년까지 태국 cloud·AI 인프라에 US$1 billion 이상을 투자하고, 정책 협력과 workforce development까지 묶은 장기 계획을 공개했다. Bangkok 방문에서 공공부문 규제 협력, aCommerce 기반 generative AI 실증, Digital Council of Thailand와의 인재·startup 논의를 함께 제시했다.
Anthropic는 2026년 4월 8일 X에서 Claude Platform용 장기 실행 agent 서비스인 Managed Agents의 설계를 설명하는 engineering post를 소개했다. Anthropic는 session, harness, sandbox를 분리해 failure 복구와 고객 인프라 연결, security boundary를 개선했다고 설명한다.
r/artificial의 한 토론 글은 email, phone number, browser, computer, memory, payments, SaaS access 같은 사람의 기본 업무 능력이 빠르게 agent용 API primitive로 재구성되고 있다고 정리한다.
Cloudflare는 2026년 4월 2일 AI bot traffic이 주당 100억 요청을 넘어서면서 CDN cache 설계 전제가 바뀌고 있다고 밝혔다. 회사는 human과 AI가 섞인 workload에서 SEIVE·S3FIFO 같은 AI-aware replacement policy와 장기적으로는 AI 전용 cache tier가 필요할 수 있다고 설명했다.
AWS는 2026년 3월 16일 NVIDIA와의 협력을 chip과 networking을 넘어 software, data movement, Amazon Bedrock model service까지 확대한다고 밝혔다. 양사는 2026년부터 AWS region 전반에 1 million개가 넘는 GPU를 제공하고 Blackwell, Nemotron, NIXL integration을 production AI workload에 맞춰 확장할 계획이다.
Meta는 NVIDIA와의 multi-year 계약이 training, inference, 핵심 업무 처리를 위한 AI 최적화 data center 구축을 뒷받침할 것이라고 밝혔다. 이번 발표는 privacy, networking, Vera Rubin cluster 계획까지 하나의 인프라 로드맵으로 묶는다.