Baidu Unlimited-OCR, 500M 활성 파라미터로 40쪽 문서를 한 번에 읽는 구조
Original: Baidu Unlimited-OCR reads 40-page documents with 500M active parameters View original →
긴 문서를 페이지 단위로 잘라 OCR에 넣던 방식에 다른 선택지가 생겼다. Baidu의 Unlimited-OCR은 3B 전체 파라미터 중 추론 시 500M만 활성화하고, 32K 컨텍스트 안에서 40쪽 이상 문서를 한 번에 처리하는 모델로 소개됐다.
Vaibhav Sisinty는 트윗에서 “3 billion parameters but only 500 million active during inference”라며 40쪽 문서, 93% 정확도, 기준 대비 +6포인트를 핵심 수치로 제시했다.
이 트윗은 AI 도구와 모델 흐름을 넓게 소개하는 개인 계정에서 올라왔고, Yann LeCun이 리포스트하면서 더 크게 확산됐다. 원 논문은 arXiv에 공개된 “Unlimited OCR Works”이며, 코드와 모델 가중치는 Baidu의 GitHub 저장소에 공개되어 있다. 논문은 DeepSeek OCR 계열의 인코더 압축률과 Reference Sliding Window Attention을 결합해, 출력 토큰이 길어져도 KV cache가 계속 커지는 문제를 줄이는 접근을 설명한다.
기술적으로 중요한 지점은 OCR이 단순 이미지 인식이 아니라 문서 구조 복원 문제라는 점이다. 표가 페이지를 넘기거나 수식과 본문이 섞일 때, 페이지별 처리 방식은 읽기 순서와 맥락을 잃기 쉽다. Unlimited-OCR은 텍스트, 수식, 표, 읽기 순서를 구조화된 Markdown으로 뽑는 것을 목표로 한다.
다음 관전점은 실제 배포 비용과 재현성이다. Hugging Face와 GitHub에서 실행 경로가 열려 있지만, 긴 문서 OCR은 입력 품질과 레이아웃 다양성에 따라 성능 차이가 크게 난다. 93% 수치가 기업 문서, 스캔 PDF, 다국어 계약서에서 얼마나 유지되는지가 채택 속도를 가를 것이다. 원문 트윗은 여기에서 확인할 수 있다.
Related Articles
불과 0.9B 파라미터로 복잡한 문서 레이아웃, 표, 코드, 수식을 처리하는 오픈소스 OCR 시스템 GLM-OCR이 공개되었습니다. OmniDocBench V1.5에서 94.62점으로 1위를 차지하며 실용성과 효율성을 입증했습니다.
r/LocalLLaMA에서 소개된 Kreuzberg v4.5는 문서 구조 인식과 테이블 추출을 강화한 Rust 기반 document intelligence 프레임워크다. 작성자는 Docling 품질에 맞먹거나 일부 구간에서 앞서는 결과를 더 낮은 메모리 사용량과 함께 제시했다.
문서 AI 경쟁의 초점이 단순 텍스트 추출에서 위치·유형·신뢰도까지 포함한 구조화로 옮겨간다. Mistral은 OCR 4가 170개 언어를 지원하고 OlmOCRBench 85.20점을 기록했다고 밝혔다.