Сегодня 21 мая 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ показал прогресс в изучении редких и малоизвестных языков

Большие языковые модели искусственного интеллекта стали активно сокращать языковой разрыв по всему миру — самые передовые добились существенных успехов в работе с редкими языками, которые представляли сложности для предшествующих систем. Об этом сообщил TechRadar со ссылкой на исследование компании RWS.

 Источник изображения: bennett tobias / unsplash.com

Источник изображения: bennett tobias / unsplash.com

Модель Google Gemini Pro получила высокие оценки качества (выше 4,5 из 5 баллов) в знании языка киньяруанда, на котором говорят 12 млн человек в Руанде, Уганде и Демократической Республике Конго. Прогресс авторы исследования объяснили тем, что ИИ часто обращается к общим статистическим закономерностям разных языков. Передовым моделям уже не требуются огромные наборы информации для каждого языка — ограниченные объёмы обучающих данных компенсируются за счёт механизмов межъязыкового переноса. Ещё один положительный фактор — улучшения в работе токенизатора, то есть средства, которое разбивает слова из запросов на фрагменты, называемые токенами. Всё это помогает моделям ИИ качественнее работать с редкими и малоизвестными языками.

В ходе исследования эксперты обнаружили эффект «дрейфа бенчмарка», при котором возможности моделей неожиданно меняются при переходе от одной версии к другой. Так, последняя версия OpenAI GPT отстаёт от более мелких в нескольких задачах на генерацию контента, хотя её предшественница оказывалась более эффективной в тех же задачах. Эффективность токенизатора также может сильно отличаться между поколениями моделей — при работе с определёнными языками одна оказывается в 3,5 раза экономичнее другой. То есть при выборе модели для развёртывания в многоязычных приложениях полагаться на результаты тестов предыдущих систем не следует.

До недавнего времени многие лаборатории ИИ отдавали приоритет показателям производительности на английском и нескольких других основных языках мира; современные модели в значительной мере преуспели в этих областях, разработчики начинают отдавать приоритет охвату широкой аудитории, и, как ожидают эксперты, этому примеру будут следовать многие. При этом оценка в 4,5 балла из 5 не гарантирует реального уровня владения языком, и многоязычная поддержка до сих пор не стала предметом первой необходимости. Разработчики обращаются к материалам на редких языках отчасти и потому, что англоязычные источники уже исчерпаны. Но всё-таки ИИ продолжает разрушать языковые барьеры.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Postgres Professional представила СУБД Postgres Pro AXE для гибридных нагрузок 42 мин.
Цукерберг успокоил сотрудников Meta: новых массовых увольнений в этом году не ожидается 55 мин.
Microsoft позвала звёздного аналитика Мэттью Болла спасать стратегию Xbox 2 ч.
«Очередной шедевр Amanita»: авангардная головоломка Phonopolis от авторов Machinarium и Samorost стартовала в Steam с рейтингом 96 % 3 ч.
Embracer подтвердила сроки релиза следующей игры Warhorse Studios — новая Kingdom Come может выйти уже в 2027 году 5 ч.
Хакеры слили данные клиентов Trump Mobile и раскрыли реальные продажи смартфона T1 6 ч.
Сетевой боевик Spellcasters Chronicles от авторов Detroit: Become Human закроется спустя четыре месяца раннего доступа, зато у Star Wars Eclipse всё хорошо 6 ч.
Apple похвалилась, что пресекла мошеннические транзакции на $11,2 млрд за шесть лет и на этом не остановится 7 ч.
Owlcat раскрыла статистику участников «беты» The Expanse: Osiris Reborn и рассказала, как будет улучшать игру после критики фанатов 7 ч.
«Ваше мнение имеет значение»: разработчики Subnautica 2 помогут игрокам защититься от рыб, но оружие добавлять не будут 8 ч.
Первые тесты Lisuan LX 7G100 показали: Китай научился делать GPU для современных игр, но пока небыстрые 2 ч.
Samsung увернулась от забастовки, способной взвинтить цены на память — рабочие добились повышения премий 3 ч.
AM4 жив! Юбилейный Ryzen 7 5800X3D AM4 10th Anniversary Edition появился в продаже в Индии за $310 4 ч.
Китайские учёные впервые в истории запитали несколько движущихся по воздуху целей микроволновым лучом 4 ч.
Founders Edition, но не от Nvidia: китайская Lisuan Tech показала игровую видеокарту LX 7G100 в эталонном исполнении 4 ч.
Alibaba представила ИИ-ускоритель Zhenwu M890, который втрое быстрее предшественника 6 ч.
Суперкомпьютер по подписке: Bull предоставила Airbus инфраструктуру HPC-as-a-service 6 ч.
«Билайн бизнес» сообщил о массовом внедрении аудиобейджей с ИИ — они проанализировали 600 тысяч часов разговоров 7 ч.
Представлен iQOO 15T — игровой смартфон с разогнанным Dimensity 9500, 200-Мп камерой и батареей на 8000 мА⋅ч 7 ч.
AMD готовит мини-ПК Ryzen AI Halo для вайб-кодинга без облака за $3999 8 ч.