, сентябрь 04, 2026

Baidu открыла компактную AI-модель для распознавания длинных документов


Baidu выпустила в открытом доступе Unlimited-OCR — модель на 3 млрд параметров для распознавания многостраничных документов. End-to-end архитектура, лицензия MIT, локальное развертывание.

  •   2 мин чтения
Baidu открыла компактную AI-модель для распознавания длинных документов

Содержание

Baidu опубликовала в открытом доступе Unlimited-OCR — модель на 3 млрд параметров с лицензией MIT, предназначенную для распознавания и структурирования многостраничных документов.

Классические OCR-системы обычно работают как конвейер: отдельные компоненты находят области текста, строки и символы, распознают их, а затем восстанавливают структуру документа.

Unlimited-OCR использует end-to-end подход: изображение страницы преобразуется в компактное визуальное представление, которое модель сразу превращает в структурированный текст.

В основе модели — DeepEncoder, который сжимает страницу размером 1024×1024 пикселя до 256 визуальных токенов. Благодаря этому в контекст модели можно поместить сразу десятки страниц.

Декодер построен на архитектуре Mixture-of-Experts: модель содержит 3 млрд параметров, но при инференсе задействует около 500 млн.

Для работы с длинными документами разработчики Baidu предложили механизм Reference Sliding Window Attention (R-SWA). Он позволяет ограничивать объём KV cache по мере генерации текста и таким образом эффективнее работать с большими многостраничными документами.

На OmniDocBench v1.5 авторы получили общий результат 93,23 против 87,01 у DeepSeek-OCR и 89,17 у DeepSeek-OCR-2. Особенно заметна разница на сложных элементах документов: для формул результат Unlimited-OCR составил 92,61 против 83,37 у DeepSeek-OCR, для таблиц — 90,93 против 84,97.

Но значение этой разработки выходит далеко за пределы очередного OCR-бенчмарка.

Корпоративное распознавание документов традиционно строится на облачных сервисах — AWS Textract, Google Document AI, Azure Document Intelligence. Их стоимость зависит в том числе от количества обработанных страниц.

Unlimited-OCR можно развернуть на собственной инфраструктуре. Это позволяет обрабатывать договоры, счета, техническую документацию, нормативные акты, отчётность и корпоративные архивы внутри контура компании — без передачи документов внешнему облачному сервису и оплаты API за каждую следующую тысячу страниц.

Локальный AI, конечно, не означает бесплатную обработку: остаются GPU, инфраструктура, электричество и эксплуатация. А качество любой модели необходимо проверять на конкретных типах документов.

Но тенденция значительно шире одной разработки Baidu.

Document AI начинает проходить тот же путь, что и языковые модели: возможности, ещё недавно доступные преимущественно через коммерческие облачные API, постепенно становятся доступными для локального развёртывания.

В корпоративных архивах банков, промышленных и строительных компаний, юридических фирм и государственных организаций хранятся миллионы страниц PDF, сканов, договоров, отчётов и технической документации.

Для AI большая часть этого массива пока недоступна.

Современные OCR-модели превращают такие архивы в машиночитаемые данные. Поверх них уже можно строить корпоративный поиск, RAG, AI-агентов, анализ договоров, извлечение данных и автоматизацию процессов.

Unlimited-OCR показывает, как ещё один слой корпоративной AI-инфраструктуры постепенно переходит из облачных API внутрь самой компании.

Модель Unlimited-OCR на Hugging Face:

https://huggingface.co/baidu/Unlimited-OCR

Подготовлено RD media

Похожие материалы