百度 Unlimited OCR:能一次讀完整本書的 AI 技術

前言:OCR 技術迎來重大突破
你有沒有試過掃描一份50頁的報告,結果軟件中途就當機了?這種情況相信很多人都經歷過。幾十年來,光學字符識別(OCR)——將圖像中的文字轉換成可讀文字的技術——一直有一個不為人知的弱點:面對長篇文件,它往往力不從心。
但這一切剛剛改變了。中國科技巨頭百度剛剛發布了一個突破性的 AI 模型,名為 Unlimited OCR(無限 OCR),它完全名副其實——能夠在幾乎沒有長度限制的情況下,一次性讀取整份文件。不需要逐頁處理,不會記憶體崩潰,從頭到尾流暢地一氣呵成。
問題所在:為什麼長文件會讓 OCR 崩潰?
要理解 Unlimited OCR 為何如此重要,我們先來談談為什麼普通 OCR 在處理長文件時會遇到困難。
大多數現代 OCR 系統都建立在一種叫做 Transformer 的 AI 架構上。這些模型的工作方式是:每生成一個新詞,就要「回頭看」它之前生成的所有內容。對於短文件來說,這沒問題。但對於長文件呢?情況就會迅速惡化。
隨著文件越來越長,會發生以下問題:
- 記憶體使用量不斷增加 — 模型需要記住越來越多的內容
- 速度越來越慢 — 每生成一個新詞都需要更多計算
- GPU 需求急劇上升 — 需要越來越強大(也越來越昂貴)的硬件
- 逐頁處理的變通方法 — 大多數系統乾脆放棄,每次只處理一頁,處理完就清空記憶
正如百度官方研究論文所說:「現有模型甚至無法在單次前向傳播中解析十頁文件。」 它們全都採用「for 循環」的方式——處理第1頁,忘掉它,處理第2頁,忘掉它……如此循環。這雖然能用,但只是一種工程上的權宜之計,並非真正的解決方案。
靈感來源:人類並不是這樣工作的
百度的研究人員在這裡提出了一個聰明的問題:人類是如何閱讀和抄寫長篇文件的?
想想看。當你手動抄寫一本書時,你不會在寫下每個新詞之前,重新閱讀你已經寫下的每一個字。相反,你會:
- 把原始文件放在面前
- 瞥一眼你剛剛寫下的最後幾個字
- 寫下下一個字
就這樣。較早的內容自然會從你的工作記憶中淡出。當你翻到第47頁時,你不需要記住第1頁的內容。
這種類人行為正是 Unlimited OCR 核心創新的靈感來源。
解決方案:參考滑動窗口注意力機制(R-SWA)
Unlimited OCR 背後的魔法是一種全新的注意力機制,稱為參考滑動窗口注意力,簡稱 R-SWA。
「注意力」可以理解為模型聚焦於相關信息的能力。傳統 OCR 模型具有完全注意力——它們會關注所有曾經生成過的內容。R-SWA 則更加智能:

圖:參考滑動窗口注意力(R-SWA)——解碼器保持對壓縮文件參考詞元的完整訪問,同時僅關注固定大小的最近輸出滑動窗口(約128個詞元),使長文件解碼過程中 KV 緩存大小保持恆定。
| 模型關注的內容 | 傳統 OCR | Unlimited OCR(R-SWA) |
|---|---|---|
| 原始文件圖像 | 是 — 始終保留 | 是 — 始終保留 |
| 最近生成的文字 | 是 — 是 | 是 — 是(最近約128個詞元) |
| 所有之前生成的文字 | 是 — 不斷增長 | 否 — 保持固定 |
R-SWA 不是讓記憶無限增長,而是保持一個小型固定窗口的最近輸出(默認128個詞元),同時始終保留對原始文件圖像的完整訪問。關鍵在於,視覺/參考詞元(文件圖像)永遠不會受到循環狀態更新的影響——這防止了圖像隨時間「模糊」或降質,這是舊式滑動窗口方法的一個常見問題。
解決 KV 緩存問題
如果你聽說過 AI 中的「KV 緩存」問題,這正是 Unlimited OCR 真正大放異彩的地方。KV 緩存本質上是模型的短期記憶存儲。在傳統 Transformer 中,它會隨著每個生成的詞元而增長。
傳統 OCR:
輸出越多 → KV 緩存越大 → GPU 記憶體越多 → 推理越慢
Unlimited OCR:
輸出越多 → KV 緩存大小不變 → 記憶體穩定 → 速度一致
通過在整個解碼過程中將 KV 緩存保持在恆定大小,Unlimited OCR 處理40頁文件的效率與處理2頁文件一樣高。
基於 DeepSeek OCR:站在巨人的肩膀上
Unlimited OCR 並非從零開始構建。百度以 DeepSeek OCR 為基礎,進行了兩項關鍵架構改進:
DeepEncoder(保留自 DeepSeek OCR)
此組件將文件圖像壓縮成極少量的視覺詞元。例如,一張 1024×1024 的圖像被壓縮成僅 256個視覺詞元。這種激進的壓縮使模型能夠處理大型文件而不會膨脹。
MoE 解碼器(升級為 R-SWA)
解碼器使用混合專家(MoE)架構,具有:
- 30億個總參數
- 推理時僅有 5億個活躍參數(保持精簡高效)
- 每個注意力層都替換為 R-SWA
結果?一個比前身更高效、更準確的模型。
測試結果:又快又準
AI 研究中通常不會出現這種情況:效率提升的同時,準確率也提高了。
- OmniDocBench v1.5 基準測試得分 93% — 一個廣受認可的文件解析基準
- 比 DeepSeek OCR 基準提升 +6%
- 長文件吞吐量提升約 35%
- 成功在單次前向傳播中解析 2頁、5頁、10頁、20頁及40頁以上的文件
改進涵蓋所有文件類型:
- 純文字識別
- 數學公式提取
- 表格理解
- 閱讀順序預測
為何這項技術的意義遠超 OCR 本身
這項研究最令人興奮的部分也許是:R-SWA 不僅僅適用於 OCR。百度團隊明確表示,它是一種通用注意力機制,適用於:
- 自動語音識別(ASR) — 轉錄長篇音頻錄音
- 端到端翻譯長篇文件
- 任何涉及基於參考輸入的長程解析任務
這可能成為下一代處理長篇內容 AI 模型的基礎構建模塊。
如何試用 Unlimited OCR
該模型完全開源,現在即可使用:
- GitHub: github.com/baidu/Unlimited-OCR
- Hugging Face: huggingface.co/baidu/Unlimited-OCR
- 在線演示: 可在 Hugging Face Spaces 上體驗
- 研究論文: arxiv.org/abs/2606.23050
只需幾行 Python 代碼,通過 Hugging Face transformers 庫即可運行。
結語:文件 AI 的新紀元
百度的 Unlimited OCR 不僅僅是一個更好的 OCR 工具。它是對 AI 模型應如何處理長程任務的重新思考——通過模仿人類工作記憶的實際運作方式,而非蠻力地擴展無限上下文窗口。
對於處理大型文件檔案的企業、處理合同的律師事務所、將書籍數字化的研究人員,或任何曾因 OCR 工具的頁數限制而感到沮喪的人來說——這是一個真正的遊戲規則改變者。
一次性解析完整文件的時代已經到來。
參考資料
- Baidu Inc. (2026). Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing. arXiv:2606.23050. https://arxiv.org/html/2606.23050v1
- Baidu. Unlimited-OCR Model Card. Hugging Face. https://huggingface.co/baidu/Unlimited-OCR
- Mehul Gupta (2026). Baidu's Unlimited OCR: Beats DeepSeek OCR, Parses entire book in one go. Data Science in Your Pocket, Medium. https://medium.com/data-science-in-your-pocket/baidus-unlimited-ocr-beats-deepseek-ocr-parses-entire-book-in-one-go-6e3e1a8c9b34
- Facebook post summary: Baidu has just broken one of the biggest limitations of current OCR. https://www.facebook.com/thanhhm/posts/10165163919113126/
準備好擴展長篇文件的文件 AI 了嗎?
需要協助部署 OCR、文件解析流程,或大型檔案庫的生產級 RAG?我們的團隊可引導您從概念驗證到企業級文件 AI。

