, сентябрь 04, 2026

Baidu ұзын құжаттарды тануға арналған ықшам ЖИ моделін ашық жариялады


Baidu Unlimited-OCR моделін ашық қолжетімділікке жариялады — 3 млрд параметрлі көп беттік құжаттарды тану үшін. End-to-end архитектура, MIT лицензиясы, жергілікті орналастыру.

  •   2 мин чтения
Baidu ұзын құжаттарды тануға арналған ықшам ЖИ моделін ашық жариялады

Содержание

Baidu Unlimited-OCR моделін ашық қолжетімділікке жариялады — бұл MIT лицензиясы бар, 3 млрд параметрлі, көп беттік құжаттарды тану және құрылымдауға арналған жасанды интеллект (ЖИ) моделі.

Классикалық OCR жүйелері әдетте конвейер түрінде жұмыс істейді: жеке компоненттер мәтін аймақтарын, жолдар мен таңбаларды анықтайды, оларды таниды, содан кейін құжат құрылымын қалпына келтіреді.

Unlimited-OCR end-to-end тәсілін қолданады: бет кескіні ықшам визуалды көрініске түрлендіріледі, оны модель бірден құрылымдалған мәтінге айналдырады.

Модельдің негізінде DeepEncoder тұрады, ол 1024×1024 пиксельдік бетті 256 визуалды токенге дейін сығады. Осының арқасында модель контекстіне бірден ондаған бет орналастыруға болады.

Декодер Mixture-of-Experts архитектурасына негізделген: модель 3 млрд параметрден тұрады, бірақ inference кезінде шамамен 500 млн параметрді ғана пайдаланады.

Ұзын құжаттармен жұмыс істеу үшін Baidu әзірлеушілері Reference Sliding Window Attention (R-SWA) механизмін ұсынды. Ол мәтін генерациясы барысында KV cache көлемін шектеуге мүмкіндік береді, осылайша үлкен көп беттік құжаттармен тиімдірек жұмыс істеуге болады.

OmniDocBench v1.5 бенчмаркінде авторлар жалпы нәтижесінде 93,23 балл алды, ал DeepSeek-OCR — 87,01, DeepSeek-OCR-2 — 89,17 балл көрсетті. Айырмашылық күрделі құжат элементтерінде айқын байқалады: формулалар бойынша Unlimited-OCR нәтижесі 92,61 болды, DeepSeek-OCR — 83,37; кестелер бойынша — тиісінше 90,93 және 84,97.

Алайда бұл әзірлемені жай ғана кезекті OCR бенчмаркі деп қана бағалау дұрыс емес.

Корпоративтік құжат тануы дәстүрлі түрде AWS Textract, Google Document AI, Azure Document Intelligence сияқты бұлтты қызметтерге негізделеді. Олардың құны, басқа факторлармен қатар, өңделген беттер санына байланысты.

Unlimited-OCR компанияның өз инфрақұрылымында орналастырылуы мүмкін. Бұл шарттарды, шот-фактураларды, техникалық құжаттаманы, нормативтік актілерді, есептілік пен корпоративтік мұрағаттарды компания шеңберінде өңдеуге мүмкіндік береді — құжаттарды сыртқы бұлтты қызметке бермей және әр келесі мың бет үшін API ақысын төлемей.

Әрине, жергілікті ЖИ өңдеудің тегін екенін білдірмейді: GPU, инфрақұрылым, электр қуаты және пайдалану шығындары сақталады. Ал кез келген модельдің сапасын нақты құжат түрлерінде тексеру қажет.

Бірақ бұл үрдіс Baidu-дың бір ғана әзірлемесінен әлдеқайда кең.

Document AI тілдік модельдер өткен жолды қайталай бастады: жақында ғана негізінен коммерциялық бұлтты API арқылы қолжетімді болған мүмкіндіктер біртіндеп жергілікті орналастыруға қолжетімді бола бастады.

Банктердің, өнеркәсіп пен құрылыс компанияларының, заң фирмалары мен мемлекеттік ұйымдардың корпоративтік мұрағаттарында миллиондаған PDF беттері, сканерленген құжаттар, шарттар, есептер мен техникалық құжаттама сақталған.

ЖИ үшін бұл массивтің көп бөлігі әзірге қолжетімсіз.

Қазіргі OCR модельдері осындай мұрағаттарды машина оқитын деректерге айналдырады. Соның негізінде корпоративтік іздеу, RAG, ЖИ агенттерін, шарттарды талдау, деректерді алу және процестерді автоматтандыруды құруға болады.

Unlimited-OCR корпоративтік ЖИ инфрақұрылымының тағы бір қабаты бұлтты API-ден компанияның ішіне қалай біртіндеп ауысып жатқанын көрсетеді.

Unlimited-OCR моделі Hugging Face платформасында:

https://huggingface.co/baidu/Unlimited-OCR

RD media дайындады

Похожие материалы