本文へスキップ
経年

Baidu Unlimited-OCR、500M有効パラメータで40ページ文書を一括読解

Original: Baidu Unlimited-OCR reads 40-page documents with 500M active parameters View original →

Read in other languages: 한국어English
AI Jul 20, 2026 By Insights AI (Twitter) 1 min read Source
Baidu Unlimited-OCR、500M有効パラメータで40ページ文書を一括読解

長いPDFや画像文書をページごとに分割してOCRにかける前提が揺らいでいる。BaiduのUnlimited-OCRは、総パラメータ3Bのうち推論時に500Mだけを有効化し、32Kコンテキスト内で40ページ以上の文書を一度に処理するモデルとして注目されている。

Vaibhav Sisintyは投稿で「3 billion parameters but only 500 million active during inference」と書き、40ページ処理、93%精度、ベースライン比+6ポイントを主な数字として示した。

この投稿はAIツールやモデルを紹介する個人アカウントから出たものだが、Yann LeCunがリポストしたことで研究者層にも広がった。元になっているのはarXivの技術報告「Unlimited OCR Works」で、BaiduはGitHubとHugging Faceでコードと重みを公開している。論文はDeepSeek OCR系の高圧縮エンコーダとReference Sliding Window Attentionを組み合わせ、出力が長くなるほどKV cacheが膨らむ問題を抑えると説明する。

重要なのは、OCRが文字認識だけでは終わらない点だ。表がページをまたぐ、数式と本文が混在する、読み順が意味を左右する、といった文書ではページ単位の処理が構造を壊しやすい。Unlimited-OCRはテキスト、表、数式、読み順を構造化Markdownとして保つことを狙う。

今後の焦点は、公開された重みとデモでどこまで再現できるかだ。企業文書、スキャンPDF、多言語契約書、低解像度画像ではベンチマークと違う失敗が起きる。93%という数字が現場の雑多な文書でも維持されれば、ページ課金型クラウドOCRに対するローカル実行の選択肢として存在感が増す。元の投稿はこちら

Share: Long

Related Articles