과잉 설계 없는 RAG — 6가지 검색 아키텍처와 선택 기준
AI 엔지니어 Rafael Pierre가 데이터 신선도, 코퍼스 특성, 쿼리 패턴, 규모, 팀 역량이라는 5가지 요인을 기준으로 최적 RAG 아키텍처를 고르는 가이드를 정리했다. 하루 1000건 미만 쿼리라면 풀텍스트 검색만으로 충분할 수 있다.
태그
#rag 태그가 달린 기사
AI 엔지니어 Rafael Pierre가 데이터 신선도, 코퍼스 특성, 쿼리 패턴, 규모, 팀 역량이라는 5가지 요인을 기준으로 최적 RAG 아키텍처를 고르는 가이드를 정리했다. 하루 1000건 미만 쿼리라면 풀텍스트 검색만으로 충분할 수 있다.
GatorOnco가 5명의 종양내과 전문의가 진행한 맹검 무작위 평가에서 치료계획 정확도 4.09점을 받아 전문의의 4.11점과 통계적으로 동등했다. 2820억 토큰의 생의학 학습과 최신 임상지침을 불러오는 agentic RAG를 결합했지만, 단일 의료기관 평가이며 환자 예후를 검증한 임상시험은 아니다.
RAG와 에이전트의 품질 병목이 검색 모델로 이동하고 있다. NVIDIA는 Nemotron 3 Embed 8B가 RTEB 전체 1위에 올랐고 32k context와 1B 변형을 함께 제공한다고 밝혔다.
r/MachineLearning의 관심은 새 OCR 모델 이름보다 비교 가능한 기준에 모였다. Baidu Unlimited-OCR와 Mistral OCR 4가 같은 주에 나오면서 문서 ingestion 성능을 한곳에서 보려는 수요가 커졌다.
문서 AI 경쟁의 초점이 단순 텍스트 추출에서 위치·유형·신뢰도까지 포함한 구조화로 옮겨간다. Mistral은 OCR 4가 170개 언어를 지원하고 OlmOCRBench 85.20점을 기록했다고 밝혔다.
토론의 초점은 멋진 agent 구조가 아니라 데이터 품질, 평가, 관찰 가능성이 실제 신뢰를 만든다는 점이었다.
기업 RAG의 약점은 답을 모르는 것이 아니라, 필요한 근거가 다른 저장소에 흩어졌을 때 너무 일찍 멈추는 데 있다. Google Research는 충분한 문맥을 검사하고 다시 검색하는 Agentic RAG로 factuality 데이터셋 정확도를 최대 34% 높였다고 밝혔다.
Google이 Gemini API 파일 검색 도구를 멀티모달로 확장했다. 이미지, 오디오, 동영상을 포함한 다양한 파일 유형에 대한 효율적인 RAG 시스템을 구축할 수 있게 됐다.
Hacker News는 model-agnostic memory라는 약속에 끌렸지만, 스레드의 진짜 열기는 “이게 context pollution을 어떻게 막나”라는 질문에서 나왔다. memory가 늘수록 더 지저분해지는 것 아니냐는 회의가 빠르게 붙었다.
Cloudflare가 AutoRAG를 AI Search로 바꾸며 agent용 retrieval을 별도 infra 작업에서 Workers binding으로 끌어왔다. Open beta 기간에는 built-in storage, vector index, BM25 hybrid search, cross-instance search를 무료 한도 안에서 쓸 수 있다.
MongoDB는 2026년 3월 20일 Heidi의 AI scribe가 18개월 동안 190개국 이상에서 81 million clinical consultations까지 확장됐다고 밝혔다. 연결된 공식 사례는 Atlas와 Atlas Vector Search가 이질적인 의료 데이터를 통합하고, RAG를 수행하며, healthcare 환경에서 무중단 확장을 가능하게 했다고 설명한다.
Mintlify는 docs assistant가 여러 page에 걸친 답변과 exact syntax를 찾는 상황에서 chunked RAG의 한계를 느껴 Chroma 기반 virtual filesystem `ChromaFs`를 만들었다고 설명했다. 세션 생성 시간을 약 46초에서 100ms로 줄였고, HN에서는 filesystem-first retrieval이 agent에 더 잘 맞는다는 반응이 이어졌다.