Baidu опубликовала в открытом доступе Unlimited-OCR — модель на 3 млрд параметров с лицензией MIT, предназначенную для распознавания и структурирования многостраничных документов.
Классические OCR-системы обычно работают как конвейер: отдельные компоненты находят области текста, строки и символы, распознают их, а затем восстанавливают структуру документа.
Unlimited-OCR использует end-to-end подход: изображение страницы преобразуется в компактное визуальное представление, которое модель сразу превращает в структурированный текст.
В основе модели — DeepEncoder, который сжимает страницу размером 1024×1024 пикселя до 256 визуальных токенов. Благодаря этому в контекст модели можно поместить сразу десятки страниц.
Декодер построен на архитектуре Mixture-of-Experts: модель содержит 3 млрд параметров, но при инференсе задействует около 500 млн.
Для работы с длинными документами разработчики Baidu предложили механизм Reference Sliding Window Attention (R-SWA). Он позволяет ограничивать объём KV cache по мере генерации текста и таким образом эффективнее работать с большими многостраничными документами.
На OmniDocBench v1.5 авторы получили общий результат 93,23 против 87,01 у DeepSeek-OCR и 89,17 у DeepSeek-OCR-2. Особенно заметна разница на сложных элементах документов: для формул результат Unlimited-OCR составил 92,61 против 83,37 у DeepSeek-OCR, для таблиц — 90,93 против 84,97.
Но значение этой разработки выходит далеко за пределы очередного OCR-бенчмарка.
Корпоративное распознавание документов традиционно строится на облачных сервисах — AWS Textract, Google Document AI, Azure Document Intelligence. Их стоимость зависит в том числе от количества обработанных страниц.
Unlimited-OCR можно развернуть на собственной инфраструктуре. Это позволяет обрабатывать договоры, счета, техническую документацию, нормативные акты, отчётность и корпоративные архивы внутри контура компании — без передачи документов внешнему облачному сервису и оплаты API за каждую следующую тысячу страниц.
Локальный AI, конечно, не означает бесплатную обработку: остаются GPU, инфраструктура, электричество и эксплуатация. А качество любой модели необходимо проверять на конкретных типах документов.
Но тенденция значительно шире одной разработки Baidu.
Document AI начинает проходить тот же путь, что и языковые модели: возможности, ещё недавно доступные преимущественно через коммерческие облачные API, постепенно становятся доступными для локального развёртывания.
В корпоративных архивах банков, промышленных и строительных компаний, юридических фирм и государственных организаций хранятся миллионы страниц PDF, сканов, договоров, отчётов и технической документации.
Для AI большая часть этого массива пока недоступна.
Современные OCR-модели превращают такие архивы в машиночитаемые данные. Поверх них уже можно строить корпоративный поиск, RAG, AI-агентов, анализ договоров, извлечение данных и автоматизацию процессов.
Unlimited-OCR показывает, как ещё один слой корпоративной AI-инфраструктуры постепенно переходит из облачных API внутрь самой компании.
Модель Unlimited-OCR на Hugging Face:
https://huggingface.co/baidu/Unlimited-OCR
Подготовлено RD media
Похожие материалы
Экономика AI: почему токены дешевеют, а счета растут
сент. 04, 2026
Утечки данных в Центральной Азии: что показывают цифры F6, а что — нет
сент. 04, 2026
AI и деньги · Часть 2
сент. 04, 2026