Baidu Unlimited OCR: 책 전체를 한 번에 읽는 AI

서론: OCR이 큰 업그레이드를 받았습니다
50페이지짜리 보고서를 스캔하다가 중간에 소프트웨어가 멈춘 적 있으신가요? 혼자가 아닙니다. 수십 년간 OCR(광학 문자 인식)——이미지 속 글자를 읽을 수 있는 텍스트로 바꾸는 기술——에는 잘 알려지지 않은 약점이 있었습니다. 긴 문서에서 무너진다는 것입니다.
그런데 이제 바뀌었습니다. 중국 최대 테크 기업 중 하나인 Baidu(百度)가 Unlimited OCR이라는 획기적인 AI 모델을 공개했습니다. 이름 그대로 사실상 길이 제한 없이 문서를 한 번에 읽습니다. 페이지별 chunking 없음. 메모리 크래시 없음. 표지부터 끝까지 매끄럽게 이어지는 한 번의 읽기입니다.
문제: 긴 문서가 OCR을 망가뜨리는 이유
Unlimited OCR이 왜 큰일인지 이해하려면, 일반 OCR이 긴 문서에서 왜 어려워하는지부터 봐야 합니다.
대부분의 현대 OCR 시스템은 Transformer라는 AI 아키텍처 위에 구축됩니다. 새 단어를 생성할 때마다 이미 생성한 모든 내용을 "되돌아보며" 작동합니다. 짧은 문서면 괜찮습니다. 길어지면? 빠르게 상황이 나빠집니다.
문서가 길어질수록 일어나는 일:
- 메모리 사용량이 계속 증가——모델이 점점 더 많이 기억해야 함
- 속도 저하——새 단어마다 더 많은 연산 필요
- GPU 요구 급증——더 강력하고(비싼) 하드웨어 필요
- 페이지별 우회——대부분 시스템은 포기하고 한 페이지씩 처리한 뒤 매번 메모리 리셋
Baidu 공식 논문은 이렇게 말합니다: "기존 모델 중 단일 forward pass로 10페이지조차 파싱할 수 있는 것은 없다." 대신 모두 "for-loop" 방식에 의존합니다——1페이지 처리, 잊기, 2페이지 처리, 잊기…… 작동은 하지만 진짜 해결책이 아니라 엔지니어링 땜질입니다.
통찰: 인간은 그렇게 읽지 않는다
Baidu 연구진은 여기서 영리한 질문을 던졌습니다. 인간은 긴 문서를 어떻게 읽고 베껴 쓸까?
생각해 보세요. 책을 손으로 베껴 쓸 때, 다음 단어를 쓰기 전에 이미 쓴 모든 단어를 다시 읽지 않습니다. 대신:
- 원본 문서를 앞에 둠
- 방금 쓴 마지막 몇 단어만 훑어봄
- 다음 단어를 씀
그게 전부입니다. 오래된 내용은 자연스럽게 작업 기억에서 사라집니다. 47페이지에 있을 때 1페이지를 기억할 필요가 없습니다.
이 인간적 행동이 Unlimited OCR 핵심 혁신의 영감이 되었습니다.
해결책: Reference Sliding Window Attention (R-SWA)
Unlimited OCR의 핵심은 Reference Sliding Window Attention, 줄여서 R-SWA라는 새로운 attention 메커니즘입니다.
"Attention"을 모델이 관련 정보에 집중하는 능력으로 생각하면 됩니다. 기존 OCR 모델은 full attention——지금까지 생성한 모든 것을 봅니다. R-SWA는 더 똑똑합니다.

그림: Reference Sliding Window Attention (R-SWA)——디코더는 압축된 문서 reference token에 대한 전체 접근을 유지하면서, 최근 생성 텍스트의 고정 sliding window(약 128 token)에만 attention하여, 긴 문서 디코딩 중 KV cache 크기를 일정하게 유지합니다.
| 모델이 보는 것 | 기존 OCR | Unlimited OCR (R-SWA) |
|---|---|---|
| 원본 문서 이미지 | 예 — 항상 | 예 — 항상 |
| 최근 생성 텍스트 | 예 — 예 | 예 — 예 (최근 ~128 token) |
| 이전에 생성한 모든 텍스트 | 예 — 계속 증가 | 아니오 — 고정 유지 |
R-SWA는 끝없이 커지는 메모리 대신, 작고 고정된 최근 출력 window(기본 128 token)를 유지하면서 원본 문서 이미지에는 항상 전체 접근을 유지합니다. 핵심은 visual/reference token(문서 이미지)이 recurrent state update를 받지 않는다는 점입니다——시간이 지나 이미지가 "흐려지거나" 품질이 떨어지는, 구형 sliding window 방식의 문제를 막습니다.
KV Cache 문제 해결
AI의 "KV Cache" 문제를 들어본 적 있다면, Unlimited OCR이 빛나는 지점입니다. KV Cache는 본질적으로 모델의 단기 기억 저장소입니다. 기존 Transformer에서는 생성 token마다 커집니다.
기존 OCR:
출력 증가 → KV Cache 커짐 → GPU 메모리 증가 → 추론 느려짐
Unlimited OCR:
출력 증가 → KV Cache 크기 동일 → 메모리 안정 → 속도 일정
디코딩 전 과정에서 KV cache를 일정 크기로 유지하므로, Unlimited OCR은 40페이지 문서를 2페이지 문서만큼 효율적으로 처리할 수 있습니다.
DeepSeek OCR 위에 구축: 거인의 어깨 위에서
Unlimited OCR은 처음부터 만든 것이 아닙니다. Baidu는 DeepSeek OCR을 기반으로 두 가지 핵심 아키텍처 개선을 적용했습니다.
DeepEncoder (DeepSeek OCR에서 유지)
이 구성요소는 문서 이미지를 아주 적은 수의 visual token으로 압축합니다. 예를 들어 1024×1024 이미지는 256개 visual token으로 압축됩니다. 이 공격적 압축 덕분에 모델이 크기 폭발 없이 큰 문서를 다룰 수 있습니다.
MoE Decoder (R-SWA로 업그레이드)
디코더는 Mixture-of-Experts (MoE) 아키텍처를 사용합니다.
- 총 30억 파라미터
- 추론 시 활성 파라미터 5억만 (가볍고 빠르게 유지)
- 모든 attention layer를 R-SWA로 교체
결과? 전작보다 더 효율적이고 정확한 모델입니다.
결과: 더 좋고 더 빠르다
AI 연구에서 흔치 않은 일이 일어났습니다. 효율 개선과 함께 정확도도 올랐습니다.
- OmniDocBench v1.5에서 93% 점수 — 인기 문서 파싱 벤치마크
- DeepSeek OCR baseline 대비 +6% 개선
- DeepSeek OCR 대비 긴 문서 처리량 약 35% 향상
- 2, 5, 10, 20, 40+ 페이지 문서를 단일 forward pass로 성공적으로 파싱
개선은 모든 문서 유형에 걸칩니다.
- 일반 텍스트 인식
- 수학식 추출
- 표 이해
- 읽기 순서 예측
OCR을 넘어서는 의미
이 연구에서 가장 흥미로운 점은 R-SWA가 OCR 전용이 아니라는 것입니다. Baidu 팀은 다음에 적용 가능한 범용 attention 메커니즘이라고 분명히 밝혔습니다.
- ASR(자동 음성 인식) — 긴 오디오 녹음 전사
- 긴 문서 end-to-end 번역
- reference 기반 입력의 long-horizon 파싱이 필요한 모든 태스크
장문 콘텐츠를 다루는 차세대 AI 모델의 기초 building block이 될 수 있습니다.
Unlimited OCR 사용 방법
모델은 완전 오픈소스이며 지금 바로 사용할 수 있습니다.
- GitHub: github.com/baidu/Unlimited-OCR
- Hugging Face: huggingface.co/baidu/Unlimited-OCR
- 라이브 데모: Hugging Face Spaces에서 제공
- 연구 논문: arxiv.org/abs/2606.23050
Hugging Face transformers 라이브러리로 몇 줄의 Python만으로 실행할 수 있습니다.
결론: 문서 AI의 새 시대
Baidu의 Unlimited OCR은 더 나은 OCR 도구 이상입니다. AI 모델이 long-horizon 태스크를 어떻게 다뤄야 하는지에 대한 재고입니다——무제한 context window를 무작정 키우는 대신, 인간 작업 기억이 실제로 작동하는 방식을 모방하는 것입니다.
대규모 문서 아카이브를 다루는 기업, 계약서를 처리하는 로펌, 책을 디지털화하는 연구자, OCR 도구의 페이지 제한에 좌절했던 모든 사람에게——진짜 game-changer입니다.
한 번에 전체 문서를 파싱하는 시대가 왔습니다.
참고 문헌
- Baidu Inc. (2026). Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing. arXiv:2606.23050. https://arxiv.org/html/2606.23050v1
- Baidu. Unlimited-OCR Model Card. Hugging Face. https://huggingface.co/baidu/Unlimited-OCR
- Mehul Gupta (2026). Baidu's Unlimited OCR: Beats DeepSeek OCR, Parses entire book in one go. Data Science in Your Pocket, Medium. https://medium.com/data-science-in-your-pocket/baidus-unlimited-ocr-beats-deepseek-ocr-parses-entire-book-in-one-go-6e3e1a8c9b34
- Facebook post summary: Baidu has just broken one of the biggest limitations of current OCR. https://www.facebook.com/thanhhm/posts/10165163919113126/
Ready to Scale Document AI for Long-Form Content?
Need help deploying OCR, document parsing pipelines, or production RAG over large archives? Our team can guide you from proof-of-concept to enterprise-grade document AI.

