Сегодня 17 апреля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Mistral AI представила инструмент, который превратит любой PDF-документ в текстовый файл для ИИ

Французский разработчик больших языковых моделей (LLM) Mistral AI объявил о выпуске нового API, который предназначен для обработки сложных PDF-документов. Mistral OCR — это API оптического распознавания символов (OCR), с помощью которого любой PDF-документ можно превратить в текстовый файл, чтобы облегчить его обработку алгоритмами на основе искусственного интеллекта.

 Источник изображения: Scott Graham / Unsplash

Источник изображения: Scott Graham / Unsplash

Языковые модели, лежащие в основе популярных генеративных алгоритмов, таких как ChatGPT от OpenAI, особенно хорошо работают с необработанным текстом. Поэтому компании, которые намерены вводить собственные рабочие ИИ-процессы, знают о важности хранения и индексации данных в чистом формате, чтобы эту информацию можно было повторно использовать в процессе обработки ИИ-алгоритмами.

В отличие от многих API OCR, разработка Mistral представляет собой мультимодальный API, который способен распознавать не только текст, но также иллюстрации и фотографии, размещённые между текстовыми блоками. API OCR формирует ограничительные рамки вокруг обнаруженных графических элементов и включает их в вывод. В результате обработки PDF-документа с помощью Mistral OCR формируется отформатированный в Markdown текст, который ИИ-алгоритмы обрабатывают более эффективно.

 Источник изображения: Mistral

Источник изображения: Mistral

«С годами в организациях накапливается множество документов, часто в формате PDF или в виде слайдов, которые недоступны для обработки LLM, особенно для систем RAG [Retrieval-Augmented Generation — техника получения и использования данных в качестве контекста для генеративных ИИ-алгоритмов]. Благодаря Mistral OCR наши клиенты могут преобразовывать сложные документы в читаемый контент на всех языках. Это важнейший шаг на пути к широкому внедрению ассистентов с искусственным интеллектом в компаниях, которым необходимо упростить доступ к обширной внутренней документации», — считает соучредитель и научный руководитель Mistral Гийом Лэмпл (Guillaume Lample).

Mistral OCR доступен на собственной платформе компании, а также в инфраструктуре облачных партнёров Mistral, таких как AWS, Azure и др. Для компаний, которые работают с конфиденциальными или секретными данными, Mistral предлагает версию API для локального развёртывания. В компании заявили, что Mistral OCR работает лучше, чем аналогичные API от Google, Microsoft или OpenAI. Компания протестировала свой API на сложных PDF-документах, в том числе содержащих математические выражения, сложные макеты и таблицы.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Выглядит намного лучше, чем раньше»: три минуты «чистого геймплея» Heroes of Might & Magic: Olden Era воодушевили фанатов перед ранним доступом 2 ч.
Тизер нового компаньона в дополнении «Неисчислимый музеон» разочаровал фанатов Warhammer 40,000: Rogue Trader 3 ч.
Anthropic выпустила Claude Design — дизайнерский ИИ для тех, кто в дизайне ничего не понимает 4 ч.
Инсайдер: в Game Pass может появиться тариф с доступом только к эксклюзивам Xbox, а будущее Call of Duty в сервисе под вопросом 4 ч.
Глава Nvidia: у Китая уже есть всё, что нужно для обучения ИИ уровня Claude Mythos 5 ч.
Google рассказала, как правильно разрабатывать приложения для Android с помощью ИИ 6 ч.
Хардкорный шутер Road to Vostok от финского разработчика-одиночки стал хитом раннего доступа Steam — 200 тысяч копий менее чем за две недели 6 ч.
Microsoft переделывает «Пуск» с нуля: изменение размеров, отключение разделов и другие настройки 6 ч.
Steam запустили на Nintendo Switch 6 ч.
Apple исправит ошибку с блокировкой iPhone из-за чешского спецсимвола 6 ч.
ИИ-стартап Cerebras поставит OpenAI ускорители ещё на $20 млрд 32 мин.
До 4 Тбайт китайской флеш-памяти со скоростью до 12 000 Мбайт/с — YMTC выпустила SSD Zhitai TiPlus 9100 4 ч.
Европейские стартапы обещают обогнать ИИ-чипы Nvidia по эффективности в 100 раз — но им не хватает денег и фабрик 4 ч.
Asus уточнила, какие блоки питания получат кабель ROG Equalizer 12V-2x6 с защитой от выгорания — это будет не бесплатно 6 ч.
«Теплозащитный экран выглядел великолепно»: астронавты Artemis II осмотрели капсулу после возвращения на Землю 6 ч.
OpenAI получит долю в конкуренте Nvidia в сфере ИИ-чипов 6 ч.
Строительство новых ЦОД забуксовало и это может затормозить всю отрасль ИИ 7 ч.
Apple распродала все запасы MacBook Neo — свежие заказы придут не раньше мая 8 ч.
Dreame представила в России передовые роботы-пылесосы и другие новинки 8 ч.
Tesla Cybertruck продаётся хуже ожиданий: 19 % машин за квартал Маск купил сам у себя 9 ч.