Сегодня 06 июня 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ показал прогресс в изучении редких и малоизвестных языков

Большие языковые модели искусственного интеллекта стали активно сокращать языковой разрыв по всему миру — самые передовые добились существенных успехов в работе с редкими языками, которые представляли сложности для предшествующих систем. Об этом сообщил TechRadar со ссылкой на исследование компании RWS.

 Источник изображения: bennett tobias / unsplash.com

Источник изображения: bennett tobias / unsplash.com

Модель Google Gemini Pro получила высокие оценки качества (выше 4,5 из 5 баллов) в знании языка киньяруанда, на котором говорят 12 млн человек в Руанде, Уганде и Демократической Республике Конго. Прогресс авторы исследования объяснили тем, что ИИ часто обращается к общим статистическим закономерностям разных языков. Передовым моделям уже не требуются огромные наборы информации для каждого языка — ограниченные объёмы обучающих данных компенсируются за счёт механизмов межъязыкового переноса. Ещё один положительный фактор — улучшения в работе токенизатора, то есть средства, которое разбивает слова из запросов на фрагменты, называемые токенами. Всё это помогает моделям ИИ качественнее работать с редкими и малоизвестными языками.

В ходе исследования эксперты обнаружили эффект «дрейфа бенчмарка», при котором возможности моделей неожиданно меняются при переходе от одной версии к другой. Так, последняя версия OpenAI GPT отстаёт от более мелких в нескольких задачах на генерацию контента, хотя её предшественница оказывалась более эффективной в тех же задачах. Эффективность токенизатора также может сильно отличаться между поколениями моделей — при работе с определёнными языками одна оказывается в 3,5 раза экономичнее другой. То есть при выборе модели для развёртывания в многоязычных приложениях полагаться на результаты тестов предыдущих систем не следует.

До недавнего времени многие лаборатории ИИ отдавали приоритет показателям производительности на английском и нескольких других основных языках мира; современные модели в значительной мере преуспели в этих областях, разработчики начинают отдавать приоритет охвату широкой аудитории, и, как ожидают эксперты, этому примеру будут следовать многие. При этом оценка в 4,5 балла из 5 не гарантирует реального уровня владения языком, и многоязычная поддержка до сих пор не стала предметом первой необходимости. Разработчики обращаются к материалам на редких языках отчасти и потому, что англоязычные источники уже исчерпаны. Но всё-таки ИИ продолжает разрушать языковые барьеры.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Первый трейлер хоррора Alien: Isolation 2 — с детализированными интерьерами, прогрессивным освещением и неизменным Чужим 14 мин.
Capcom наконец анонсировала ремейк Resident Evil Code: Veronica — первый трейлер Resident Evil Veronica 28 мин.
Новая статья: 007 First Light — успех после долгих лет подготовки. Рецензия 55 мин.
Назад в будущее и обратно: анонсирована метроидвания Tempus Vitae с путешествиями во времени 2 ч.
Google исправила рекордные 429 уязвимостей в Chrome за раз — включая 22 критические 6 ч.
Аша Шарма подтвердила, что Xbox нужны эксклюзивы, но есть нюанс 7 ч.
Google начала экспериментировать с показом результатов поиска в Chrome сразу в режиме ИИ 7 ч.
Вредоносный мод для Minecraft заразил 116 000 компьютеров и продавал доступ к веб-камерам жертв 7 ч.
OpenAI согласилась предоставлять властям США свои новые ИИ-модели на проверку 8 ч.
ИИ-агент OpenAI Codex помог раскрыть атаку HTTP/2 Bomb: всего один компьютер может вывести из строя целый сервер 10 ч.
Silicon Motion представила SSD-контроллеры с PCIe 6.0 и скоростью до 28 Гбайт/с 3 ч.
Ангстремные мобильные процессоры Intel Panther Lake и Wildcat Lake начали появляться на настольных платах 3 ч.
В российской части МКС обнаружены две утечки воздуха — одну уже заделали 6 ч.
Thermal Grizzly показала водоблок для скальпированных процессоров — с алмазными пластинами за €1500 7 ч.
Роботакси Waymo показало себя как неожиданно удобный транспорт для бегства с места преступления 7 ч.
Репортаж со стенда Apacer на Computex 2026: память DDR5-9200, скоростные SSD с вентиляторами и не только 8 ч.
Илон Маск заговорил о 100 000 аппаратов Starlink на орбите — чтобы ускорить спутниковый интернет в 100 раз 8 ч.
Phison представила SSD-контроллер с поддержкой PCIe 6.0 10 ч.
Правительство США планирует выделить $700 млн на поддержку угольной энергетики для ИИ-инфраструктуры 10 ч.
Молния проникла в квартиру через интернет-кабель и уничтожила ПК и роутер 10 ч.