본문으로 건너뛰기
부식 중

DeepMind 4개 지역 12B 분산 훈련, 동기식 병목을 20배 속도로 돌파

Google DeepMind의 새 훈련 구조가 중요한 이유는 데이터센터 경계 자체가 최전선 병목이 되고 있기 때문이다. Decoupled DiLoCo는 2-5Gbps 광역 링크 위에서 4개 미국 지역에 걸쳐 12B Gemma 모델을 학습했고, 기존 동기화 방식보다 20배 넘게 빠르면서 평균 정확도는 64.1%로 기준선 64.4%에 거의 붙었다.

원문: This is Decoupled DiLoCo: our new resilient and flexible way to train advanced AI models across multiple data centres. 원문 보기 →

AI X/Twitter 작성자 Insights AI 1분 소요 39 조회 출처

Google DeepMind는 4월 23일 원문 스레드에서 Decoupled DiLoCo를 여러 데이터센터에 걸쳐 고급 AI 모델을 학습시키는 탄력적이고 유연한 방식으로 소개했다. 이 문제의 핵심은 모델 성능이 아니라 클러스터 동기화의 취약성이다. 칩 장애와 지역 간 네트워크 한계가 커질수록, 거대한 훈련 작업은 한 덩어리 슈퍼클러스터에 묶이기 쉽다. DeepMind는 그 가정을 정면으로 흔들었다.

공식 글에 나온 숫자는 더 직접적이다. Decoupled DiLoCo는 2-5Gbps 광역 네트워크 환경에서 미국 4개 지역에 걸쳐 12B Gemma 모델을 학습했고, 기존 동기화 방식보다 20배 넘게 빨랐다. 기계학습 성능도 크게 무너지지 않았다. 평균 정확도는 64.1%로 기준선 64.4%에 거의 붙었다. 대역폭을 크게 줄이면서도 학습 품질을 유지했다는 뜻이다.

장애 내성 수치도 강하다. DeepMind는 대규모 장애 시뮬레이션에서 goodput이 표준 데이터 병렬 훈련의 27% 대비 88%를 유지했다고 적었다. TPU v6e와 TPU v5p를 한 훈련에 섞어도 성능 저하 없이 돌아간다는 점도 중요하다. 완전히 같은 세대의 칩이 다 모일 때까지 기다리지 않고도 남는 자원을 훈련에 붙일 수 있다는 뜻이기 때문이다. 같은 그림에선 필요한 대역폭이 8개 데이터센터 기준 198Gbps에서 0.84Gbps까지 내려간다고도 제시된다. 작은 최적화가 아니라 훈련 인프라 정의 자체를 바꾸는 수치다.

GoogleDeepMind 계정은 연구 논문, 모델 성과, 인프라 전환점을 X에 올리는 패턴이 뚜렷하다. 이번 건은 그중에서도 인프라에 속한다. 이제 볼 것은 이 구조가 Gemma 연구 사례에 머무는지, 아니면 더 큰 실서비스 훈련으로 넘어가는지다. 데모 수치를 넘어 확장된다면, 최전선 연구소가 유휴 연산 자원과 칩 세대 혼합, 장애 허용성을 보는 방식 자체가 달라질 수 있다.

공유: 긴글

관련 기사

AI

Anthropic, Google·Broadcom과 multi-gigawatt TPU 계약 체결

Anthropic는 April 6, 2026에 Google과 Broadcom으로부터 2027 시작 예정인 next-generation TPU capacity를 multi-gigawatt 단위로 확보했다고 밝혔다. run-rate revenue가 $30 billion을 넘고 million-dollar customers가 February 이후 두 배로 늘어난 상황에서, 이번 계약은 infrastructure scale과 demand surge를 함께 보여준다.

2분 소요 53 조회
AI X/Twitter

NVIDIA, Hugging Face 129억3030만달러 인수…오픈 모델 플랫폼 독립성 유지

NVIDIA가 Hugging Face를 129억3030만달러에 인수하기로 합의하며 1,800만 개발자와 300만개 모델이 모인 오픈 AI 생태계를 품는다. 양사는 NVIDIA 하드웨어를 강제하지 않고 멀티클라우드·멀티가속기 중립성을 유지하겠다고 약속했으며, 규제 심사가 다음 변수다.

2분 소요 4 조회