百度 Unlimited OCR:能一次讀完整本書的 AI 技術

June 25, 202614 min read

前言:OCR 技術迎來重大突破

你有沒有試過掃描一份50頁的報告,結果軟件中途就當機了?這種情況相信很多人都經歷過。幾十年來,光學字符識別(OCR)——將圖像中的文字轉換成可讀文字的技術——一直有一個不為人知的弱點:面對長篇文件,它往往力不從心。

但這一切剛剛改變了。中國科技巨頭百度剛剛發布了一個突破性的 AI 模型,名為 Unlimited OCR(無限 OCR),它完全名副其實——能夠在幾乎沒有長度限制的情況下,一次性讀取整份文件。不需要逐頁處理,不會記憶體崩潰,從頭到尾流暢地一氣呵成。


問題所在:為什麼長文件會讓 OCR 崩潰?

要理解 Unlimited OCR 為何如此重要,我們先來談談為什麼普通 OCR 在處理長文件時會遇到困難。

大多數現代 OCR 系統都建立在一種叫做 Transformer 的 AI 架構上。這些模型的工作方式是:每生成一個新詞,就要「回頭看」它之前生成的所有內容。對於短文件來說,這沒問題。但對於長文件呢?情況就會迅速惡化。

隨著文件越來越長,會發生以下問題:

  • 記憶體使用量不斷增加 — 模型需要記住越來越多的內容
  • 速度越來越慢 — 每生成一個新詞都需要更多計算
  • GPU 需求急劇上升 — 需要越來越強大(也越來越昂貴)的硬件
  • 逐頁處理的變通方法 — 大多數系統乾脆放棄,每次只處理一頁,處理完就清空記憶

正如百度官方研究論文所說:「現有模型甚至無法在單次前向傳播中解析十頁文件。」 它們全都採用「for 循環」的方式——處理第1頁,忘掉它,處理第2頁,忘掉它……如此循環。這雖然能用,但只是一種工程上的權宜之計,並非真正的解決方案。


靈感來源:人類並不是這樣工作的

百度的研究人員在這裡提出了一個聰明的問題:人類是如何閱讀和抄寫長篇文件的?

想想看。當你手動抄寫一本書時,你不會在寫下每個新詞之前,重新閱讀你已經寫下的每一個字。相反,你會:

  • 把原始文件放在面前
  • 瞥一眼你剛剛寫下的最後幾個字
  • 寫下下一個字

就這樣。較早的內容自然會從你的工作記憶中淡出。當你翻到第47頁時,你不需要記住第1頁的內容。

這種類人行為正是 Unlimited OCR 核心創新的靈感來源。


解決方案:參考滑動窗口注意力機制(R-SWA)

Unlimited OCR 背後的魔法是一種全新的注意力機制,稱為參考滑動窗口注意力,簡稱 R-SWA。

「注意力」可以理解為模型聚焦於相關信息的能力。傳統 OCR 模型具有完全注意力——它們會關注所有曾經生成過的內容。R-SWA 則更加智能:

R-SWA 神經網絡架構 — 佔位示意圖

圖:參考滑動窗口注意力(R-SWA)——解碼器保持對壓縮文件參考詞元的完整訪問,同時僅關注固定大小的最近輸出滑動窗口(約128個詞元),使長文件解碼過程中 KV 緩存大小保持恆定。

模型關注的內容傳統 OCRUnlimited OCR(R-SWA)
原始文件圖像是 — 始終保留是 — 始終保留
最近生成的文字是 — 是是 — 是(最近約128個詞元)
所有之前生成的文字是 — 不斷增長否 — 保持固定

R-SWA 不是讓記憶無限增長,而是保持一個小型固定窗口的最近輸出(默認128個詞元),同時始終保留對原始文件圖像的完整訪問。關鍵在於,視覺/參考詞元(文件圖像)永遠不會受到循環狀態更新的影響——這防止了圖像隨時間「模糊」或降質,這是舊式滑動窗口方法的一個常見問題。


解決 KV 緩存問題

如果你聽說過 AI 中的「KV 緩存」問題,這正是 Unlimited OCR 真正大放異彩的地方。KV 緩存本質上是模型的短期記憶存儲。在傳統 Transformer 中,它會隨著每個生成的詞元而增長。

傳統 OCR:

輸出越多 → KV 緩存越大 → GPU 記憶體越多 → 推理越慢

Unlimited OCR:

輸出越多 → KV 緩存大小不變 → 記憶體穩定 → 速度一致

通過在整個解碼過程中將 KV 緩存保持在恆定大小,Unlimited OCR 處理40頁文件的效率與處理2頁文件一樣高。


基於 DeepSeek OCR:站在巨人的肩膀上

Unlimited OCR 並非從零開始構建。百度以 DeepSeek OCR 為基礎,進行了兩項關鍵架構改進:

DeepEncoder(保留自 DeepSeek OCR)

此組件將文件圖像壓縮成極少量的視覺詞元。例如,一張 1024×1024 的圖像被壓縮成僅 256個視覺詞元。這種激進的壓縮使模型能夠處理大型文件而不會膨脹。

MoE 解碼器(升級為 R-SWA)

解碼器使用混合專家(MoE)架構,具有:

  • 30億個總參數
  • 推理時僅有 5億個活躍參數(保持精簡高效)
  • 每個注意力層都替換為 R-SWA

結果?一個比前身更高效、更準確的模型。


測試結果:又快又準

AI 研究中通常不會出現這種情況:效率提升的同時,準確率也提高了。

  • OmniDocBench v1.5 基準測試得分 93% — 一個廣受認可的文件解析基準
  • 比 DeepSeek OCR 基準提升 +6%
  • 長文件吞吐量提升約 35%
  • 成功在單次前向傳播中解析 2頁、5頁、10頁、20頁及40頁以上的文件

改進涵蓋所有文件類型:

  • 純文字識別
  • 數學公式提取
  • 表格理解
  • 閱讀順序預測

為何這項技術的意義遠超 OCR 本身

這項研究最令人興奮的部分也許是:R-SWA 不僅僅適用於 OCR。百度團隊明確表示,它是一種通用注意力機制,適用於:

  • 自動語音識別(ASR) — 轉錄長篇音頻錄音
  • 端到端翻譯長篇文件
  • 任何涉及基於參考輸入的長程解析任務

這可能成為下一代處理長篇內容 AI 模型的基礎構建模塊。


如何試用 Unlimited OCR

該模型完全開源,現在即可使用:

只需幾行 Python 代碼,通過 Hugging Face transformers 庫即可運行。


結語:文件 AI 的新紀元

百度的 Unlimited OCR 不僅僅是一個更好的 OCR 工具。它是對 AI 模型應如何處理長程任務的重新思考——通過模仿人類工作記憶的實際運作方式,而非蠻力地擴展無限上下文窗口。

對於處理大型文件檔案的企業、處理合同的律師事務所、將書籍數字化的研究人員,或任何曾因 OCR 工具的頁數限制而感到沮喪的人來說——這是一個真正的遊戲規則改變者。

一次性解析完整文件的時代已經到來。


參考資料

準備好擴展長篇文件的文件 AI 了嗎?

需要協助部署 OCR、文件解析流程,或大型檔案庫的生產級 RAG?我們的團隊可引導您從概念驗證到企業級文件 AI。