Together Research, divide-and-conquer long-context 파이프라인이 GPT-4o single-shot를 앞설 수 있다고 보고
Together Research는 2026년 3월 27일 divide-and-conquer를 적용한 더 작은 모델이 long-context task에서 GPT-4o single-shot를 맞추거나 앞설 수 있다고 밝혔다. Together 블로그와 arXiv 논문은 이 방법이 planner-worker-manager 구조와 task, model, aggregator noise 분석에 기반한다고 설명한다.
원문: New from Together Research: a smaller model using divide & conquer can match or beat GPT-4o single-shot on long context tasks. Paper accepted at ICLR 2026. Read more in the 🧵 원문 보기 →
Together Research가 X에서 밝힌 내용
2026년 3월 27일, Together Research는 더 작은 모델도 divide-and-conquer 전략을 적용하면 long-context task에서 GPT-4o의 single-shot 실행을 맞추거나 앞설 수 있다고 밝혔다. 또한 이 연구가 ICLR 2026에 채택됐다고 덧붙여, 단순한 소셜 미디어 주장보다 검토 가능한 연구 결과라는 점을 강조했다.
이 주장이 중요한 이유는 long context 경쟁이 종종 더 큰 context window와 더 강한 frontier model의 경쟁으로만 해석되기 때문이다. Together는 orchestration 설계가 raw model size만큼 중요할 수 있다고 말하고 있다.
블로그와 논문이 추가한 정보
Together의 블로그는 긴 문서를 여러 조각으로 나누고 병렬 처리한 뒤 다시 합치는 planner-worker-manager 파이프라인을 설명한다. 회사는 이 접근이 context가 충분히 커지면 Llama-3-70B, Qwen-72B 같은 모델이 GPT-4o의 단일 패스 처리보다 더 나은 결과를 낼 수 있게 한다고 주장한다.
함께 공개된 arXiv 논문은 이를 더 구조적으로 설명한다. 논문은 실패 원인을 세 가지로 나눈다. 조각 간 의존성에서 오는 task noise, 문맥 길이가 길어질수록 커지는 model noise, 부분 답안을 잘못 합칠 때 생기는 aggregator noise다. 초록은 retrieval, question answering, summarization 실험이 이 틀을 뒷받침하며, 언제 chunk 기반 multi-agent 처리가 유리한지 설명한다고 말한다.
왜 중요한가
이 발표가 고신호인 이유는 long-context 시스템의 최적화 목표를 바꾸기 때문이다. 병목이 모델 용량만이 아니라 작업 분해와 재조합 방식에도 있다면, frontier-model 비용을 항상 지불하지 않고도 강한 성능을 낼 여지가 생긴다.
제품 팀과 인프라 팀 입장에서는 직접적인 함의가 있다. divide-and-conquer 파이프라인은 병렬 처리로 지연을 줄이고, 비용을 낮추며, 특정 workload에 맞게 조정하기 쉬운 구조가 될 수 있다. 즉 long-context engineering은 이제 model 선택 문제를 넘어 시스템 설계 문제로 이동하고 있다.
물론 chunking이 언제나 낫다는 뜻은 아니다. 같은 논문도 cross-chunk dependence가 있는 경우 단순 분할이 쉽게 실패한다고 지적한다. 그럼에도 이번 결과는 언제 더 작은 협업형 모델 구성이 더 효과적인지 판단하는 기준을 한층 명확하게 제시한다.
관련 기사
LLM이 직접 고르는 attention 범위, KV cache 읽기 절반으로
긴 문맥 전체를 매 토큰마다 훑지 말고 모델이 필요한 구간을 직접 선언하게 하자는 단순한 발상이 연구자들의 눈길을 끌었다. Declarative Attention은 기존 모델을 재학습하지 않고도 총 attention 대상 토큰을 최대 52.0% 줄였지만 정확도 손실과 실제 지연 시간 검증이 과제로 남는다.
Mobius, 지식·추론 분리로 7B 학습량 62.6% 줄이고 속도는 약 4배까지 끌어올려
지식 저장과 추론 연산을 분리한 Mobius가 7B Transformer와 비슷한 성능을 학습 데이터 62.6%로 달성했다. Qwen3.5-35B에서 이어 학습한 버전은 종단 간 추론 속도를 약 4배 높였다.
4개월 만에 네 번째 Flash — Gemini 3.8의 추론·코딩 도약
Google이 9월 2일 추론·코딩 최강 Flash 모델 Gemini 3.8을 공개했다. 3.7 Flash 출시 3주 만에 나온 후속작으로, Gemini 3.8 Flash와 사이버보안 특화 3.8 Flash Cyber 두 가지 변형이 제공된다.