AI 탐색 전략을 스스로 개선하는 Dream-RSI 프레임워크 공개
누적된 탐색 이력을 재생 시뮬레이터로 활용해 AI 에이전트가 비용 없이 스스로 탐색 전략을 개선하는 Dream-RSI 프레임워크가 제안됐다. 재귀적 자기 개선의 핵심 병목이었던 탐색 전략 최적화 문제를 효율적으로 해결한다.
원문: Dream-RSI: Recursive Self-Improvement through Evolving Worlds 원문 보기 →
재귀적 자기 개선의 핵심 병목
자율 AI 에이전트의 능력이 고도화되면서 재귀적 자기 개선(Recursive Self-Improvement, RSI)이 핵심 연구 과제로 부상했다. RSI의 성과는 복잡한 문제 공간에서 얼마나 효과적으로 탐색하느냐에 달려 있다.
그런데 탐색 전략 자체를 개선하는 일에는 딜레마가 있다. 고정된 전략은 탐색 공간이 확장될수록 적응하지 못하고, 온라인 정책 최적화는 방대한 메타 탐색 공간을 탐색하면서 장기 롤아웃에 걸쳐 지연되고 비싼 피드백을 처리해야 한다.
꿈 속에서 배우는 AI
arXiv에 공개된 논문은 이 딜레마를 독창적인 방식으로 풀어낸다. 핵심 아이디어는 누적된 탐색 이력을 재생 시뮬레이터로 활용하는 것이다.
시스템은 과거 탐색에서 만들어진 발견 트리(discovery tree)를 기반으로 '꿈'을 꾼다. 이 재생 시뮬레이터 안에서 오프-폴리시(off-policy) 피드백을 즉시, 저비용으로 얻어 탐색 정책을 평가하고 개선한다. 값비싼 온라인 평가를 반복할 필요가 없다.
개선된 정책은 이후 온라인에 재배포되어 새로운 발견을 이끌고, 그 이력이 다시 시뮬레이터를 풍부하게 한다. 이 사이클이 반복되면서 탐색 능력이 점진적으로 향상된다.
구조적 특징
- 경량 오케스트레이션 레이어: 탐색을 명시적이고 프로그래밍 가능하게 만들면서 기저 코딩 에이전트는 변경하지 않는다.
- 즉각적 피드백: 재생 시뮬레이터가 제공하는 오프-폴리시 피드백으로 반복적·고비용 온라인 평가 없이 정책을 개선한다.
- 확장성: 탐색 공간이 커질수록 이력도 쌓여 시뮬레이터가 더 정교해지는 구조다.
코딩, 수학, 과학적 발견 등 복잡한 도메인에서 AI 에이전트의 자율적 역량 향상에 기여할 수 있는 접근법으로 주목받고 있다.
관련 기사
Claude 내부 지표, AI가 AI 개발을 앞당기는 속도를 52배 실험으로 제시
AI 연구 자동화가 추상적 위험에서 실험 지표로 이동했다. Anthropic은 Mythos Preview가 최적화 과제에서 약 52배 속도 향상을 냈고, 연구 다음 단계 판단에서도 64% 우위를 보였다고 밝혔다.
목적지 URL 감춘 google.com/goto, 검색 스크래핑 비용이 커진 이유
검색 결과의 링크가 곧 목적지라는 오래된 전제가 흔들렸다. Google이 로그아웃·비공개 검색에서 불투명한 <code>google.com/goto</code> 주소를 넓게 노출하면서, 검색 결과를 수집하는 도구는 링크마다 추가 요청을 보내야 하는 상황에 놓였다.
RLHF 개척자 폴 크리스티아노, OpenAI 재단 이사회·안전보안위원회 핵심 감독직 동시 합류
OpenAI의 초기 정렬 연구를 이끈 폴 크리스티아노가 재단 이사회와 안전보안위원회에 돌아온다. 그는 영리법인 이사회에도 의결권 없는 참관인으로 참여한다. OpenAI 연구 4년, ARC 설립, NIST 정부 평가 경력을 회사의 핵심 감독 구조에 동시에 투입하는 인선이다.