Baidu Unlimited-OCR, 500M 활성 파라미터로 40쪽 문서를 한 번에 읽는 구조
문서 AI의 비용 병목은 페이지 단위 분할과 길어지는 KV cache다. Unlimited-OCR은 3B 전체 파라미터 중 500M만 활성화하면서 40쪽 문서와 32K 컨텍스트를 한 번에 처리한다고 소개됐다.
태그
#document-ai 태그가 달린 기사
문서 AI의 비용 병목은 페이지 단위 분할과 길어지는 KV cache다. Unlimited-OCR은 3B 전체 파라미터 중 500M만 활성화하면서 40쪽 문서와 32K 컨텍스트를 한 번에 처리한다고 소개됐다.
r/MachineLearning의 관심은 새 OCR 모델 이름보다 비교 가능한 기준에 모였다. Baidu Unlimited-OCR와 Mistral OCR 4가 같은 주에 나오면서 문서 ingestion 성능을 한곳에서 보려는 수요가 커졌다.
문서 AI 경쟁의 초점이 단순 텍스트 추출에서 위치·유형·신뢰도까지 포함한 구조화로 옮겨간다. Mistral은 OCR 4가 170개 언어를 지원하고 OlmOCRBench 85.20점을 기록했다고 밝혔다.
r/MachineLearning이 이 글에 주목한 이유는 “누가 1등인가”보다 “문서 추출에서 너무 비싼 모델을 습관처럼 쓰고 있지 않나”를 숫자로 건드렸기 때문이다. 반복 실행, cost-per-success, critical-field 정확도까지 붙으면서 비용 논쟁이 한층 구체화됐다.
r/LocalLLaMA가 IBM의 Granite-4.0-3B-Vision에 주목했다. 이 소형 VLM은 범용 chat보다 chart, table, document key-value extraction에 맞춰 설계됐다.
r/LocalLLaMA에서 소개된 Kreuzberg v4.5는 문서 구조 인식과 테이블 추출을 강화한 Rust 기반 document intelligence 프레임워크다. 작성자는 Docling 품질에 맞먹거나 일부 구간에서 앞서는 결과를 더 낮은 메모리 사용량과 함께 제시했다.