Сегодня 13 февраля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Microsoft представила ИИ-агента Magma для управления приложениями и реальными роботами

Разработчики из Microsoft Research представили мультимодальную языковую ИИ-модель Magma, которая способна обрабатывать визуальные и текстовые данные для управления программными интерфейсами и роботизированными системами. Если алгоритм после тестирования выйдет за пределы Microsoft, то это может стать важным шагом на пути к созданию универсального мультимодального ИИ, способного работать как в цифровом, так и в реальном пространстве.

 Деомнтсрация того, как Magma управляет роботизированной рукой / Источник изображения: Microsoft Research

Демонстрация того, как Magma управляет роботизированной рукой / Источник изображения: Microsoft Research

Microsoft утверждает, что Magma является первой ИИ-моделью, которая способна не только обрабатывать мультимодальные данные (например, текст, изображения, видео), но и умеет выполнять действия на их основе, будь то навигация по пользовательскому интерфейсу или манипулирование физическими объектами. Разработка алгоритма Magma велась совместными усилиями разработчиков из Microsoft, KAIST, Университета Мэриленда, Висконсинского университета в Мэдисоне и Университета Вашингтона.

Ранее уже были реализованы проекты в сфере робототехники, основой которых становились большие языковые модели (LLM). К таким работам можно отнести проекты PALM-E и RT-2 от Google или ChatGPT for Robotics от Microsoft, где ИИ-системы были задействованы для управления программными интерфейсами.

 Комбинированный график, демонстрирующий возможности Magma / Источник изображения: Microsoft Research

Комбинированная схема, демонстрирующая возможности Magma / Источник изображения: Microsoft Research

В отличие от многих уже созданных мультимодальных алгоритмов, требующих использования отдельных моделей для восприятия и управления, в Magma эти способности объединены внутри единой базовой ИИ-модели. Microsoft позиционирует Magma, как существенный шаг на пути создания единого ИИ-агента, т.е. системы, способной автономно разрабатывать планы действий и выполнять многоэтапные задачи от имени человека, а не просто отвечать вопросы о том, что она видит.

«Учитывая описанную цель, Magma способна формулировать планы и выполнять действия для их достижения. Эффективно передавая знания, извлекаемые из свободно доступных визуальных и языковых данных, Magma объединяет вербальный, пространственный и временной алгоритмы для навигации по сложным задачам и обстановке», — говорится в сообщении исследователей из Microsoft.

 Источник изображения:  Microsoft Research

Источник изображения: Microsoft Research

ИИ-модель Magma включает в себя два технических компонента: Set-of-Mark (идентифицирует объекты, которыми можно манипулировать в среде, присваивая цифровые метки интерактивным элементам, таким как нажимаемые кнопки в пользовательском интерфейсе или захватываемые объекты в рабочем пространстве роботов) и Trace-of-Mark (позволяет алгоритму выполнять такие задачи, как навигация по пользовательским интерфейсам или управление роботизированными руками для захвата и перемещения объектов).

Один из участников проекта рассказал, что название алгоритма Magma расшифровывается как M(ultimodal) Ag(entic) M(odel) at Microsoft (Rese)A(rch). В описании алгоритма Microsoft утверждает, что Magma-8B демонстрирует конкурентоспособные результаты в бенчмарках, показывая высокие результаты в задачах навигации по пользовательскому интерфейсу и манипулировании роботами.

Так в бенчмарке VQAv2 алгоритм Magma получил 80,0 баллов за визуальные ответы на вопросы, что выше результата GPT-4V (77,2 балла), но ниже показателя LLaVA-Next (81,8 балла). Показатель алгоритма POPE в 87,4 балла в настоящее время является абсолютно лучшим среди ИИ-моделей, участвовавших в сравнении. Отмечается, что в сфере манипулирования роботами Magma превосходит OpenVLA.

 Источник изображения: Microsoft Research

Источник изображения: Microsoft Research

По заявлениям разработчиков, Magma отличается от аналогов вроде GPT-4V тем, что выходит за рамки так называемого «вербального интеллекта» и включает в себя «пространственный интеллект», т.е. возможность планирования и выполнения действий. Обучаясь на смеси изображений, видео, робототехнических данных и взаимодействий с пользовательским интерфейсом, Magma, по сути, является полноценным мультимодальным ИИ-агентом, а не просто перцептивной моделью.

Как и все ИИ-модели, Magma не совершенна. Документация Microsoft указывает на то, что алгоритм по-прежнему сталкивается с техническими ограничениями при принятии сложных пошаговых решений, требующих многократного выполнения действий в течение определённого времени. Microsoft продолжает работать над улучшением алгоритма. Софтверный гигант намерен выложить исходный код Magma и другую документацию на GitHub, чтобы сторонние исследователи могли использовать эти наработки для реализации собственных проектов.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Хакеры-пираты Anna’s Archive начали публиковать музыку, украденную у Spotify — несмотря на иск на $13 трлн 17 мин.
Вирусы научились напрямую обращаться к ИИ в реальном времени во время кибератак 20 мин.
ИИ-агент впервые попытался публично очернить программиста за отказ принять его код 26 мин.
Valve скоро добавит в Steam возможность прикреплять к обзорам данные о своём ПК — игроки в восторге 36 мин.
Microsoft взяла курс на «самодостаточность» в ИИ — собственные модели вместо зависимости от OpenAI 2 ч.
Возвращение в Раккун-Сити, старый знакомый и судьба Леона: новый геймплейный трейлер Resident Evil Requiem заинтриговал и встревожил фанатов 3 ч.
Загадочный хоррор Silent Hill: Townfall оказался игрой от первого лица в Шотландии конца 90-х 3 ч.
Apple начала блокировать аккаунты россиян с санкционными ФИО 4 ч.
«Думал, не доживу до этого дня»: Konami анонсировала первую за 12 лет новую Castlevania, и её делают разработчики Dead Cells 4 ч.
OpenAI обвинила китайскую DeepSeek в краже данных для обучения ИИ-модели R1 4 ч.
NASA запустило миссию Crew-12 с россиянином на борту — капсула SpaceX Dragon успешно достигла орбиты 35 мин.
Cisco нашла оправдание повышению цен, несмотря на рекордную выручку 37 мин.
Учёные обнаружили редкий случай рождения чёрной дыры без взрыва сверхновой 2 ч.
От «можем заменить» к «инженерной трезвости»: российские разработчики пересматривают подходы к импортозамещению 2 ч.
G42 из ОАЭ подписала соглашение о строительстве трёх дата-центров во Вьетнаме за $1 млрд 3 ч.
ECL представила всеядную энергетическую архитектуру для периферийных ИИ ЦОД 3 ч.
Backblaze назвала самые надёжные и проблемные HDD — общий уровень отказов за 2025 год упал до 1,36 % 3 ч.
Ракета Vulcan Centaur снова вспыхнула на старте и завертелась, но миссию выполнила — это вторая авария за три пуска 3 ч.
64 Гбайт памяти DDR5 теперь стоят дороже целого MacBook Air — за полгода цены взлетели в пять раз 4 ч.
В мирных целях и не только: Google Cloud анонсировала участие в космических проектах ReOrbit и Starfish Space 4 ч.