Сегодня 08 мая 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ показал прогресс в изучении редких и малоизвестных языков

Большие языковые модели искусственного интеллекта стали активно сокращать языковой разрыв по всему миру — самые передовые добились существенных успехов в работе с редкими языками, которые представляли сложности для предшествующих систем. Об этом сообщил TechRadar со ссылкой на исследование компании RWS.

 Источник изображения: bennett tobias / unsplash.com

Источник изображения: bennett tobias / unsplash.com

Модель Google Gemini Pro получила высокие оценки качества (выше 4,5 из 5 баллов) в знании языка киньяруанда, на котором говорят 12 млн человек в Руанде, Уганде и Демократической Республике Конго. Прогресс авторы исследования объяснили тем, что ИИ часто обращается к общим статистическим закономерностям разных языков. Передовым моделям уже не требуются огромные наборы информации для каждого языка — ограниченные объёмы обучающих данных компенсируются за счёт механизмов межъязыкового переноса. Ещё один положительный фактор — улучшения в работе токенизатора, то есть средства, которое разбивает слова из запросов на фрагменты, называемые токенами. Всё это помогает моделям ИИ качественнее работать с редкими и малоизвестными языками.

В ходе исследования эксперты обнаружили эффект «дрейфа бенчмарка», при котором возможности моделей неожиданно меняются при переходе от одной версии к другой. Так, последняя версия OpenAI GPT отстаёт от более мелких в нескольких задачах на генерацию контента, хотя её предшественница оказывалась более эффективной в тех же задачах. Эффективность токенизатора также может сильно отличаться между поколениями моделей — при работе с определёнными языками одна оказывается в 3,5 раза экономичнее другой. То есть при выборе модели для развёртывания в многоязычных приложениях полагаться на результаты тестов предыдущих систем не следует.

До недавнего времени многие лаборатории ИИ отдавали приоритет показателям производительности на английском и нескольких других основных языках мира; современные модели в значительной мере преуспели в этих областях, разработчики начинают отдавать приоритет охвату широкой аудитории, и, как ожидают эксперты, этому примеру будут следовать многие. При этом оценка в 4,5 балла из 5 не гарантирует реального уровня владения языком, и многоязычная поддержка до сих пор не стала предметом первой необходимости. Разработчики обращаются к материалам на редких языках отчасти и потому, что англоязычные источники уже исчерпаны. Но всё-таки ИИ продолжает разрушать языковые барьеры.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Разработчикам Eve Online пришлось сменить название студии, чтобы её перестали ассоциировать с Коммунистической партией Китая 44 мин.
Роскомнадзор заявил, что не ограничивал доступ к GitHub 2 ч.
Шпионский боевик 007 First Light от создателей Hitman получил системные требования для игры в 4K, а трассировку пути придётся подождать 2 ч.
Киберпанковый боевик No Law от создателей The Ascent не копирует Cyberpunk 2077 — разработчики ответили на вопросы игроков 4 ч.
ИИ теперь пишет 60 % нового кода Airbnb — и сам решает 40 % запросов в техподдержку 4 ч.
Google начала тестировать ИИ-агента Remy — конкурента OpenClaw 4 ч.
Россияне массово жалуются на блокировки аккаунтов в Anthropic Claude — потеряны проекты и переписки с ИИ 4 ч.
Амбициозный хоррор Paranormal Activity: Threshold от создателя The Mortuary Assistant отменён из-за конфликта с Paramount Pictures 5 ч.
Архивировать интернет становится всё сложнее: Wayback Machine и Wikimedia страдают от дефицита HDD 5 ч.
«Золотой глобус» не будет дисквалифицировать номинантов из-за ИИ, но излишеств не допустит 7 ч.
Пентагон рассекретил первую партию файлов об НЛО — впечатлить скептиков не удалось 2 ч.
NASA испытало обычные фотокамеры Canon и Nikon в условиях космоса — выжили не все 3 ч.
Gigabyte запустила продажи Aorus GeForce RTX 5090 Infinity с необычным дизайном и скрытым вентилятором 3 ч.
Самые тяжёлые чёрные дыры рождаются не из звёзд — они «собираются» из больших дыр, выяснили учёные 3 ч.
У заднеприводных Cybertruck могут отвалиться колёса — Tesla отзывает все 173 проданных электромобиля 4 ч.
iFixit объявила «короля ремонтопригодности» среди наушников — у AirPods Max 2 всего 4 балла из 10 4 ч.
Asus выпустила 12,3" портативный сенсорный монитор ROG Strix XG129C и 34" геймерский ROG Strix OLED XG34WCDMS 4 ч.
Спрос на чипы AMD обогнал поставки — компания ищет спасение у Samsung Electronics 4 ч.
Nintendo готовится к падению продаж консолей Switch 2 уже через год после дебюта 4 ч.
TCL CSOT показала дисплей для ноутбуков, работающий с частотой от 0,01 до 120 Гц одновременно 4 ч.