Сегодня 18 июня 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Apple научила небольшие ИИ-модели описывать изображения лучше, чем аналоги крупных конкурентов

Учёные Apple разработали технологию RubiCap — способ обучения моделей искусственного интеллекта описывать изображения более подробно и эффективно, чем это делают модели более крупного размера.

 Источник изображения: Steve Johnson / unsplash.com

Источник изображения: Steve Johnson / unsplash.com

При подготовке подробного описания изображения ИИ-модели требуется идентифицировать множество объектов и областей в кадре, чтобы далее собственно описать их с высокой степенью детализации. Это помогает глубже понять композицию, чем при общем её описании. На практике такой навык может пригодиться для обучения производных ИИ-моделей, для создания генераторов картинок по текстовому описанию и для разработки специальных возможностей. Создание систем подробного описания картинок оказывается чрезмерно дорогим и ресурсоёмким как на этапе первичного обучения, так и в дальнейшем при обучении с подкреплением.

Для решения этих проблем инженеры Apple случайным образом выбрали 50 000 изображений из обучающих наборов PixMoCap и DenseFusion-4V-100K. Для каждой из этих картинок описания генерировали существующие модели с функциями компьютерного зрения, в том числе Google Gemini 2.5 Pro, OpenAI GPT-5, Alibaba Qwen2.5-VL-72B-Instruct, Google Gemma-3-27B-IT и Alibaba Qwen3-VL-30B-A3B-Instruct; собственные описания изображений создавали и текущие обучаемые модели Apple. Далее выступающая экспертом Gemini 2.5 Pro повторно анализировала изображения с вариантами подписей и результатами работы обучаемой модели; определяла, в чём участвующие в эксперименте системы совпадали, а какие детали упускали или искажали; и составляла чёткие критерии для оценки описаний. Выступающая в роли судьи Qwen2.5-7B-Instruct оценивала описания по каждому из предложенных критериев и формировала сигнал вознаграждения для обучаемой модели.

В результате обучаемая модель получала точную и качественную обратную связь о том, что надлежит исправить — и начинали генерироваться более точные описания без опоры на единственный «правильный» ответ. В итоге инженеры Apple обучили три собственные модели ИИ: RubiCap-2B, RubiCap-3B и RubiCap-7B с 2, 3 и 7 млрд параметров соответственно. В задачах на описание изображений они показали более качественные ответы, чем созданные другими разработчиками аналоги с 32 млрд и даже 72 млрд параметров. Примечательно, что RubiCap-3B в некоторых случаях демонстрировала более качественные результаты, чем RubiCap-7B — это подтверждает, что размер модели не всегда определяет её работу.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
ИИ уже превосходит обычных медиков в точности определения диагноза 22 мин.
Mozilla представила дорожную карту Firefox на фоне падения аудитории, исчисляемого миллионами человек в месяц 55 мин.
Великобритания потребовала от Google повысить прозрачность поисковой выдачи 58 мин.
NVIDIA стала лидером во всех тестах MLPerf Training 6.0 7 ч.
Новая статья: Умные помощники: обзор ИИ-сервисов для обработки изображений. Часть 2, актуализированная 8 ч.
Моддер показал геймплей Dark Souls 2 с бесшовным кооперативом — игроки в восторге 10 ч.
Assassin’s Creed Black Flag Resynced ушла на золото за три недели до релиза — ремейк «Чёрного флага» выйдет в срок 12 ч.
Возраст не помеха: спустя семь лет с релиза Devil May Cry 5 установила рекорд по продажам за год 13 ч.
Дженсен Хуанг: обществу необходимы «новые социальные нормы» в эпоху ИИ 14 ч.
Смартфоны Samsung научатся оценивать здоровье питомцев по фотографии 14 ч.
Второе поколение Apple iPhone Air весной 2027 года предложит вторую камеру и увеличит время работы от батареи 3 ч.
Тим Кук признался, что дефицит памяти вынудит Apple поднять цены на свои устройства 3 ч.
В США заработал суперкомпьютер Lynx с интерконнектом Cornelis Omni-Path CN5000 6 ч.
Dell заняла первое место среди производителей серверов благодаря рекордному количеству заказов на ИИ-системы 6 ч.
Sandisk оценила SSD Optimus GX PRO 850P ёмкостью 8 Тбайт для PS5 почти в пять раз дороже самой консоли 12 ч.
Полный комплект комплектующих и аксессуаров Asus ROG 20th Anniversary Collection Edition оценён в $16 580 в Китае 12 ч.
В Гонконге открывается круглосуточный магазин с продавцом-андроидом 12 ч.
MSI наделила свои платы для Intel поддержкой половинчатых модулей DDR5 HUDIMM 13 ч.
Учёные разработали память, которая умеет забывать лишнюю информацию — совсем как человеческий мозг 14 ч.
Китай проследит, как ИИ отнимает и создаёт рабочие места 16 ч.