ParseBench, Kaggle에 2,000개 기업 문서·16.7만 OCR 규칙 공개…에이전트용 검증판
중요한 점은 enterprise OCR failure가 academic PDF benchmark보다 훨씬 먼저 agent를 망가뜨린다는 데 있다. LlamaIndex는 ParseBench가 사람 검증을 거친 약 2,000개 페이지와 16만7천 개가 넘는 규칙으로 14개 방법을 Kaggle에서 비교한다고 적었다.
원문: LlamaIndex took ParseBench to Kaggle with 2,000 enterprise pages, 167K-plus test rules, and 14 OCR methods 원문 보기 →
트윗이 드러낸 것
LlamaIndex는 enterprise OCR 평가의 모양을 꽤 구체적으로 제시했다. 핵심 문장은 The first document OCR benchmark built for AI agents — 2,000 enterprise pages, 167K+ test rules, 5 dimensions that actually break downstream agents. 이다. 이어서 GPT-5 Mini, Gemini 3, Textract, LlamaParse를 포함한 14개 방법을 비교하고, leaderboard가 Kaggle에서 공개됐다고 적었다.
LlamaIndex 계정은 document parsing과 agent infrastructure 업데이트를 주로 올린다. 이번 포스트가 강한 신호인 이유는 OCR을 추상적으로 홍보하지 않기 때문이다. dataset 크기, 평가 범위, downstream failure mode를 동시에 제시해 benchmark post답게 읽힌다.
linked post가 보탠 맥락
동반된 블로그 글은 왜 이런 benchmark가 필요한지를 설명한다. enterprise 문서는 지저분하다. 보험 filing, financial report, contract, regulatory submission에는 표, 각주, 차트, 서식 정보, visual grounding 문제가 뒤섞여 있다. LlamaIndex는 이제 agent 기준에서 중요한 것은 “사람이 읽을 수 있을 정도”가 아니라, 잘못된 셀이나 숫자, header를 조용히 오독하지 않고 action까지 이어질 수 있을 정도의 신뢰성이라고 본다.
글에 따르면 ParseBench는 사람 검증을 거친 enterprise document page 약 2,000개와 167,000개가 넘는 test rule로 다섯 차원을 평가한다. tables, charts, content faithfulness, semantic formatting, visual grounding이 그것이다. 비교 지점도 유용하다. LlamaIndex는 가장 다양한 OCR benchmark 중 하나로 꼽히는 OmniDocBench조차 enterprise content 비중이 6%에 그친다고 적는다. 게다가 dataset, code, paper를 함께 공개해 black-box leaderboard screenshot보다 훨씬 낫다.
다음 관전 포인트
이제 관건은 finance, insurance, legal workflow를 가진 팀이 실제 parser 선택에 ParseBench를 쓰는지, 그리고 예고한 end-to-end agent evaluation이 뒤따르는지다. 만약 이 benchmark가 procurement와 model routing의 기준점이 된다면, generic OCR leaderboard보다 실무 영향력이 더 클 수 있다. 실제 business automation을 망가뜨리는 failure를 겨누기 때문이다.
Sources: X source tweet · LlamaIndex ParseBench blog · ParseBench Kaggle leaderboard · ParseBench paper
관련 기사
ParseBench, 실제 기업 문서 OCR agent를 16.7만개 규칙 benchmark로 검증한다
중요한 점은 document agent가 table, chart value, visual grounding을 잃으면 실제 업무 판단이 흔들린다는 데 있다. ParseBench는 약 2,000쪽의 enterprise document, 16.7만개+ rule-based tests, 14개 method 평가를 제시한다.
Codex가 QR kernel을 232배 끌어올린 14일, 성능보다 중요한 verifier
14일 동안 1,500회 넘게 제출해 QR kernel을 baseline 대비 232배 빠르게 만든 기록이 관심을 모았다. 숫자를 가능하게 한 것은 한 번의 영리한 prompt가 아니라, 정답을 판정하는 verifier와 profiler, 실패 기록이 연결된 촘촘한 실험 루프였다.
NVIDIA, Hugging Face 129억3030만달러 인수…오픈 모델 플랫폼 독립성 유지
NVIDIA가 Hugging Face를 129억3030만달러에 인수하기로 합의하며 1,800만 개발자와 300만개 모델이 모인 오픈 AI 생태계를 품는다. 양사는 NVIDIA 하드웨어를 강제하지 않고 멀티클라우드·멀티가속기 중립성을 유지하겠다고 약속했으며, 규제 심사가 다음 변수다.