Сегодня 03 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Microsoft представила ИИ-модели для работы с изображениями и речью — они значительно экономнее аналогов OpenAI

Microsoft выпустила в публичный предварительный просмотр две новые модели искусственного интеллекта собственной разработки. MAI-Image-2.5-Pro является флагманским генератором изображений в ассортименте компании; MAI-Voice-2-Flash предназначается для распознавания речи в условиях больших объёмов корпоративных рабочих нагрузок.

 Источник изображений: microsoft.ai

Источник изображений: microsoft.ai

Софтверный гигант привёл данные о производительности обеих моделей как самый убедительный аргумент в пользу того, что он может использовать собственные продукты, не полагаясь на разработки OpenAI. Сейчас ИИ-модели Microsoft работают в большом числе продуктов компании: Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot и Azure — это уже не исследовательские проекты, а рабочая инфраструктура, обслуживающая миллионы клиентов. «Каждое из этих улучшений — шаг к одной и той же цели: продукты Microsoft, работающие на основе моделей Microsoft», — подчеркнули в компании.

В кривой «качество-скорость-стоимость» две новые модели занимают противоположные позиции, и это намеренно. MAI-Image-2.5-Pro выступает разработкой премиум-класса: она генерирует изображения высокого качества, обеспечивает детальное их редактирование и точную отрисовку текста. При доступе через API работа с моделью обойдётся $5 за 1 млн текстовых токенов на вводе, $8 за 1 млн токенов изображений на вводе и $106 за млн токенов изображений на выводе. Базовая MAI-Image-2.5 недавно заняла второе место в рейтинге моделей для редактирования изображений на платформе Arena.

MAI-Voice-2-Flash имеет прямо противоположное позиционирование. Она работает вдвое быстрее, чем базовая MAI-Voice-2-Flash, и стоит на 32 % дешевле — $15 за 1 млн знаков. Модель разработана для рынка высокопроизводительной голосовой связи: кол-центров, голосовых агентов и приложений для обработки речи в реальном времени, где важна низкая задержка. У творческой студии, которая стремится к максимальной точности, совершенно иные потребности, чем у службы поддержки клиентов, обрабатывающей миллионы звонков в день.

Microsoft также рассказала об успехах во внедрении собственных моделей. Сервис Bing Image Creator полностью переведён на MAI-Image-2.5; в PowerPoint эта модель помогла снизить затраты на ресурсы графического процессора на 84 % по сравнению с OpenAI GPT-Image-2; она помогла оптимизировать обработку задач в облачном хранилище OneDrive. Новую MAI-Voice-2-Flash развернули на платформе Dynamics 365 Contact Center, снизив затраты на ресурсы графических процессоров на величину до 89 %; её также интегрировали в сервис Azure Voice Live для разработчиков. Сервис Microsoft Dragon Copilot, которым пользуются 170 000 медицинских учреждений, и который за I квартал обработал 28 млн обращений пациентов, переведён на модель MAI-Transcribe-1.5 с поддержкой 58 языков.

Облегчённая модель MAI-Code-1-Flash для написания кода в июне начала работать на платформе GitHub Copilot — по сравнению с OpenAI GPT-5.4 Mini и Anthropic Claude Haiku 4.5 она обеспечивает на 10 % более высокое принятие кода при сниженном на 10 % медианном потреблении токенов. Пользователи на 6 % чаще снова выбирают её, чем GPT-5.4 Mini, и на 11 % чаще, чем Claude Haiku 4.5. Microsoft дополнительно обучила её работе в Excel, и в большинстве наиболее распространённых задач она стала выступать на уровне GPT-5.6, хотя она достаточно мала, чтобы работать на устаревших ускорителях Nvidia H100 и даже A100.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про аудиоредакторы

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Глава Epic Games объявил о крупнейшем кризисе игровой индустрии с 1983 года — ИИ лишил игровой рынок «железа» 37 мин.
Император одобряет: Saber подтвердила, что в Warhammer 40,000: Space Marine 3 не будет «никакого генеративного ИИ» 57 мин.
10 минут геймплея, дата выхода и дополнения на подходе: Square Enix устроила новую демонстрацию Final Fantasy VII Revelation 3 ч.
ИИ готов обнаруживать более 2000 уязвимостей в каждом выпуске ядра Linux 3 ч.
Масштабный сбой вывел из строя популярные платформы ИИ, включая ChatGPT, Claude и Grok 3 ч.
Китайские ИИ-компании массово «доят» Claude для обучения своих моделей — в ход идут тысячи аккаунтов и даркнет 3 ч.
Proxmox открыла офис в США и запустила круглосуточную поддержку — VMware тут же пообещала вернуть недорогую версию vSphere Standard 3 ч.
Состоялся релиз Basis Workplace 3.4 с поддержкой виртуализации отдельных приложений 3 ч.
Первое дополнение к Crimson Desert позволит почувствовать себя капитаном корабля — трейлер и подробности Charting the Unknown 4 ч.
Новый геймплейный ролик Metro 2039 подтвердил дату выхода и поддержку 60 кадров/с на консолях 4 ч.
Intel покончила с полувековой традицией — ведущих экспертов заставят доказывать пользу для бизнеса 3 ч.
Philips выпустила 34-дюймовый изогнутый бизнес-монитор 34B2U5900C с двумя режимами: 5K2K при 120 Гц и 1440p при 240 Гц 3 ч.
Один номер на два iPhone — Apple позволит переключаться между смартфонами без перестановки SIM 3 ч.
TCL выпустила P80 Ultra — первый смартфон с технологией Nxtpaper и OLED-экраном 3 ч.
Тонущую GoPro поглотили за $285 млн, и теперь она займётся оптикой для ЦОД 4 ч.
«Змей-Молния» на 420 Тбит/с: подводный интернет-кабель AWS Sta’O’Nuk свяжет Японию и США 5 ч.
DLSS 5 может стать новым стресс-тестом — энергопотребление RTX 5090 при активации технологии достигает 800 Вт 5 ч.
Intel рискует упустить контракт с Apple из-за болтливости — компания показала, что ей нельзя доверять 6 ч.
restore: открыл корнер Vertu в Москве — цены на смартфоны начинаются от 560 тыс. рублей 6 ч.
Cerebras получит 165-МВт дата-центр в Финляндии 7 ч.