Recursive Language Models — 2026년 AI 패러다임으로 부상한 컨텍스트 관리 혁신
MIT와 Prime Intellect가 주도하는 RLM은 LLM이 Python REPL과 서브-LLM을 활용해 자체 컨텍스트를 능동적으로 관리하게 하며, 모델 컨텍스트 윈도우 대비 100배 긴 입력을 처리한다.
컨텍스트 윈도우의 근본적 재설계
Recursive Language Models(RLM)은 2025년 10월 Alex Zhang이 제안하고 arXiv에 논문이 게재된 새로운 프레임워크로, Prime Intellect는 이를 2026년의 패러다임으로 명명했다.
작동 원리
기존 LLM은 대용량 입력을 직접 토큰으로 변환해 신경망에 주입한다. RLM은 이와 달리 긴 프롬프트를 환경의 일부로 취급하며, LLM이 Python REPL을 통해 심볼릭하게 상호작용하도록 설계됐다. 루트 LM은 샌드박스 Python 환경에서 도구를 호출하고, 서브-LLM을 실행하며, 최종 결과를 answer 변수에 작성한다.
핵심 혁신
- 능동적 컨텍스트 관리: 모델이 필요에 따라 컨텍스트를 Python 스크립트와 서브-LLM에 위임
- 정보 손실 없음: 요약 없이 원본 데이터를 보존
- 확장성: 모델 컨텍스트 윈도우 대비 최대 100배 긴 입력 처리
- 품질 향상: 짧은 프롬프트에서도 기존 LLM 대비 획기적으로 우수한 품질
The Bitter Lesson과의 일치
RLM은 Richard Sutton의 The Bitter Lesson 철학과 일치한다. 강화학습을 통해 모델이 end-to-end로 자신의 컨텍스트 관리를 학습하게 함으로써, 수동적 엔지니어링이 아닌 학습을 통한 개선을 가능케 한다.
Prime Intellect의 비전
Prime Intellect는 RLMEnv를 구현하며, RLM 패러다임을 통해 에이전트가 수주~수개월에 걸친 장기 과제를 해결할 수 있을 것으로 전망한다. 이는 단순히 컨텍스트 윈도우를 늘리는 것을 넘어, 모델이 스스로 정보를 구조화하고 관리하는 근본적인 패러다임 전환을 의미한다.
오픈소스 구현
Alex Zhang의 RLM GitHub는 다양한 샌드박스를 지원하는 범용 추론 라이브러리를 제공한다.
Source: Prime Intellect, arXiv, MarkTechPost
관련 기사
Google Deep Research, Gemini 3.1 Pro·MCP 연결로 기업 조사 에이전트화
Google이 4월 21일 Deep Research를 Gemini 3.1 Pro 기반으로 끌어올리고 MCP 연결과 Max 모드를 붙였다. 웹 검색, 업로드 파일, 라이선스 데이터 소스를 한 흐름에서 묶어야 하는 금융·생명과학 팀을 겨냥한 변화다.
리서치 에이전트가 검색어로 비밀을 흘리는 MosaicLeaks 실험
ServiceNow 연구진은 로컬 문서와 웹 검색을 오가는 deep research 에이전트가 사내 정보를 검색어 조각으로 흘릴 수 있음을 보였다. PA-DR 훈련은 전체 정보 유출률을 34.0%에서 9.9%로 낮췄지만, 성능만 올리는 훈련은 유출을 키웠다.
코드 리뷰 품질 2.17배, OpenCodeReview 통제형 에이전트로 토큰 5~15배 절감
에이전트에게 더 많은 자유를 주는 대신 탐색과 검증을 의도적으로 제한하자 코드 리뷰 품질은 최대 2.17배로 높아지고 토큰 사용량은 5~15분의 1로 줄었다. 200개 실제 PR과 1,505개 검증 의견을 사용한 Alibaba 연구팀의 결과는 모델 크기보다 워크플로 설계가 중요할 수 있음을 보여준다.