Сегодня 30 марта 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Meta✴ выпустила ИИ, который налету переводит текст с русского и ещё ста языков

Meta выпустила модель искусственного интеллекта SeamlessM4T, способную осуществлять перевод со 101 языка. Проект является шагом к созданию универсального переводчика в реальном времени, который сможет обрабатывать устную речь, как только она произносится.

 Источник изображения: Sophia Richards / unsplash.com

Источник изображения: Sophia Richards / unsplash.com

Традиционные модели ИИ для перевода работают по многоэтапной схеме: сначала устная речь превращается в текст, затем осуществляется перевод этого текста на другой язык, после чего текст на новом языке снова превращается в устную речь. Этот метод не всегда достаточно эффективен, поскольку на каждом этапе существует вероятность возникновения ошибок, которые грозят неправильным результатом перевода. Новая модель Meta SeamlessM4T осуществляет перевод напрямую и срабатывает, по словам разработчиков, на 23 % точнее, чем лучшие современные модели. В арсенале Google значится модель AudioPaLM, которая поддерживает 113 языков, но осуществляет перевод только на английский; SeamlessM4T переводит со 101 языка на 36.

Залогом успеха проекта стал процесс параллельного сбора данных: ИИ фиксирует случаи в просканированных данных источников в вебе совпадения звука или видео с субтитрами на другом языке. В результате модель научилась связывать эти звуки на одном языке с соответствующими фрагментами текста на другом. Авторы проекта, однако, признают, что участие человека в переводе остаётся важным: человек способен учитывать культурный контекст и обеспечить передачу смысла высказывания с одного языка на другой. В медицине или юриспруденции машинный перевод должен тщательно проверяться человеком — в противном случае могут возникать недоразумения.

Следует также учесть, что у моделей ИИ могут быть разные объёмы обучающих данных для разных языков: может быть много примеров перевода с греческого на английский, но отсутствовать данные для перевода с суахили на греческий. Чтобы решить эту проблему, разработчики SeamlessM4T предварительно обучали модель на миллионах часов аудиозаписей разговоров на разных языках. Эта подготовка помогла ИИ распознавать общие закономерности языков — в результате упростилась обработка менее распространённых языков, поскольку модель уже располагала основными данными о том, как должна звучать разговорная речь на них.

Система доступна с открытым исходным кодом, что, как надеются разработчики, побудит других развивать её текущие возможности. Некоторые эксперты пока сомневаются в том, насколько SeamlessM4T может быть полезна на практике и указывают, что закрытая модель Google работает значительно быстрее. В Meta же утверждают, что специалисты компании уже создали более свежую версию Seamless, которая по скорости работы не уступает переводчикам-людям.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая студия создателя The Stanley Parable не нашла денег на следующую игру и скоро закроется, а Wanderstop ждёт «последний сюрприз» 15 мин.
PUBG: Blindspot проживёт в раннем доступе Steam меньше двух месяцев — Krafton свернула разработку неудачного ответвления PUBG 18 мин.
«Базис» реализовал в Basis Workplace поддержку геораспределённой инфраструктуры 36 мин.
«Базис» реализовал в Basis Workplace поддержку геораспределённой инфраструктуры 36 мин.
Рано расслабляться: Anthropic предстоит пройти ещё один суд, чтобы отвергнуть претензии Пентагона окончательно 3 ч.
Квартальные затраты на облачную инфраструктуру превысили $110 млрд 13 ч.
На экране блокировки iPhone со старыми iOS появилось сообщение об опасных атаках 15 ч.
Google ускорит переход на постквантовое шифрование — процесс должен завершиться к 2029 году 21 ч.
Telegram утверждает, что опасной уязвимости в мессенджере не существует 24 ч.
Новая статья: Gamesblender № 769: новые Serious Sam и Hunter: The Reckoning, спад Switch 2 и перезарядка 2.0 в CS2 24 ч.
Новая статья: От Ryzen 7 1800X до Ryzen 7 9850X3D: девять лет эволюции AMD в одном тесте 10 ч.
Samsung и SK Hynix резко увеличили инвестиции в китайские заводы памяти на фоне дефицита DRAM и NAND 15 ч.
«Кремниевая прерия»: Crusoe пристроит к ИИ ЦОД OpenAI Stargate ещё 900 МВт, но уже для Microsoft 15 ч.
ESA запустило на орбиту два спутника Celeste для тестирования новых технологий навигации 22 ч.
Котировки акций производителей DRAM стабилизировались после первичного влияния TurboQuant 29-03 08:24
Microsoft потратит $146 млрд на ИИ, но это напугало инвесторов и вызвало падение котировок акций на 25 % 29-03 05:33
Anthropic привлекла рекордное количество подписчиков после скандала с Минобороны США 29-03 05:27
Первым в мире наручным часам на солнечных батареях исполнилось 50 лет 28-03 20:22
NASA возмутило частников отказом от коммерческих орбитальных станций — миллиарды инвестиций под угрозой 28-03 18:27
Худшая неделя за год: техногиганты потеряли миллиарды капитализации из-за войны и проблем Meta 28-03 18:16