Сегодня 18 июня 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ показал прогресс в изучении редких и малоизвестных языков

Большие языковые модели искусственного интеллекта стали активно сокращать языковой разрыв по всему миру — самые передовые добились существенных успехов в работе с редкими языками, которые представляли сложности для предшествующих систем. Об этом сообщил TechRadar со ссылкой на исследование компании RWS.

 Источник изображения: bennett tobias / unsplash.com

Источник изображения: bennett tobias / unsplash.com

Модель Google Gemini Pro получила высокие оценки качества (выше 4,5 из 5 баллов) в знании языка киньяруанда, на котором говорят 12 млн человек в Руанде, Уганде и Демократической Республике Конго. Прогресс авторы исследования объяснили тем, что ИИ часто обращается к общим статистическим закономерностям разных языков. Передовым моделям уже не требуются огромные наборы информации для каждого языка — ограниченные объёмы обучающих данных компенсируются за счёт механизмов межъязыкового переноса. Ещё один положительный фактор — улучшения в работе токенизатора, то есть средства, которое разбивает слова из запросов на фрагменты, называемые токенами. Всё это помогает моделям ИИ качественнее работать с редкими и малоизвестными языками.

В ходе исследования эксперты обнаружили эффект «дрейфа бенчмарка», при котором возможности моделей неожиданно меняются при переходе от одной версии к другой. Так, последняя версия OpenAI GPT отстаёт от более мелких в нескольких задачах на генерацию контента, хотя её предшественница оказывалась более эффективной в тех же задачах. Эффективность токенизатора также может сильно отличаться между поколениями моделей — при работе с определёнными языками одна оказывается в 3,5 раза экономичнее другой. То есть при выборе модели для развёртывания в многоязычных приложениях полагаться на результаты тестов предыдущих систем не следует.

До недавнего времени многие лаборатории ИИ отдавали приоритет показателям производительности на английском и нескольких других основных языках мира; современные модели в значительной мере преуспели в этих областях, разработчики начинают отдавать приоритет охвату широкой аудитории, и, как ожидают эксперты, этому примеру будут следовать многие. При этом оценка в 4,5 балла из 5 не гарантирует реального уровня владения языком, и многоязычная поддержка до сих пор не стала предметом первой необходимости. Разработчики обращаются к материалам на редких языках отчасти и потому, что англоязычные источники уже исчерпаны. Но всё-таки ИИ продолжает разрушать языковые барьеры.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
NVIDIA стала лидером во всех тестах MLPerf Training 6.0 3 ч.
Новая статья: Умные помощники: обзор ИИ-сервисов для обработки изображений. Часть 2, актуализированная 5 ч.
Моддер показал геймплей Dark Souls 2 с бесшовным кооперативом — игроки в восторге 7 ч.
Assassin’s Creed Black Flag Resynced ушла на золото за три недели до релиза — ремейк «Чёрного флага» выйдет в срок 9 ч.
Возраст не помеха: спустя семь лет с релиза Devil May Cry 5 установила рекорд по продажам за год 10 ч.
Дженсен Хуанг: обществу необходимы «новые социальные нормы» в эпоху ИИ 11 ч.
Смартфоны Samsung научатся оценивать здоровье питомцев по фотографии 11 ч.
Спустя четыре года апгрейд GTA V до версий для PS5, Xbox Series X и S всё-таки станет бесплатным 11 ч.
Создатели хоррор-шутера Luna Abyss остались без работы через месяц после релиза — всех уволили 11 ч.
Внезапная блокировка Anthropic Fable 5 подстегнула интерес к открытым ИИ-моделям 12 ч.
В США заработал суперкомпьютер Lynx с интерконнектом Cornelis Omni-Path CN5000 3 ч.
Dell заняла первое место среди производителей серверов благодаря рекордному количеству заказов на ИИ-системы 3 ч.
Sandisk оценила SSD Optimus GX PRO 850P ёмкостью 8 Тбайт для PS5 почти в пять раз дороже самой консоли 8 ч.
Полный комплект комплектующих и аксессуаров Asus ROG 20th Anniversary Collection Edition оценён в $16 580 в Китае 8 ч.
В Гонконге открывается круглосуточный магазин с продавцом-андроидом 8 ч.
MSI наделила свои платы для Intel поддержкой половинчатых модулей DDR5 HUDIMM 10 ч.
Учёные разработали память, которая умеет забывать лишнюю информацию — совсем как человеческий мозг 10 ч.
Китай проследит, как ИИ отнимает и создаёт рабочие места 12 ч.
Silicon Motion будет внедрять PCIe 6.0 в SSD с оглядкой на процессоры Nvidia, а не Intel или AMD 12 ч.
Тяжёлая ракета Ariane 6 впервые стартовала в самой мощной конфигурации — она вывела на орбиту спутники Amazon Leo 12 ч.