Сегодня 02 июня 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Apple научила небольшие ИИ-модели описывать изображения лучше, чем аналоги крупных конкурентов

Учёные Apple разработали технологию RubiCap — способ обучения моделей искусственного интеллекта описывать изображения более подробно и эффективно, чем это делают модели более крупного размера.

 Источник изображения: Steve Johnson / unsplash.com

Источник изображения: Steve Johnson / unsplash.com

При подготовке подробного описания изображения ИИ-модели требуется идентифицировать множество объектов и областей в кадре, чтобы далее собственно описать их с высокой степенью детализации. Это помогает глубже понять композицию, чем при общем её описании. На практике такой навык может пригодиться для обучения производных ИИ-моделей, для создания генераторов картинок по текстовому описанию и для разработки специальных возможностей. Создание систем подробного описания картинок оказывается чрезмерно дорогим и ресурсоёмким как на этапе первичного обучения, так и в дальнейшем при обучении с подкреплением.

Для решения этих проблем инженеры Apple случайным образом выбрали 50 000 изображений из обучающих наборов PixMoCap и DenseFusion-4V-100K. Для каждой из этих картинок описания генерировали существующие модели с функциями компьютерного зрения, в том числе Google Gemini 2.5 Pro, OpenAI GPT-5, Alibaba Qwen2.5-VL-72B-Instruct, Google Gemma-3-27B-IT и Alibaba Qwen3-VL-30B-A3B-Instruct; собственные описания изображений создавали и текущие обучаемые модели Apple. Далее выступающая экспертом Gemini 2.5 Pro повторно анализировала изображения с вариантами подписей и результатами работы обучаемой модели; определяла, в чём участвующие в эксперименте системы совпадали, а какие детали упускали или искажали; и составляла чёткие критерии для оценки описаний. Выступающая в роли судьи Qwen2.5-7B-Instruct оценивала описания по каждому из предложенных критериев и формировала сигнал вознаграждения для обучаемой модели.

В результате обучаемая модель получала точную и качественную обратную связь о том, что надлежит исправить — и начинали генерироваться более точные описания без опоры на единственный «правильный» ответ. В итоге инженеры Apple обучили три собственные модели ИИ: RubiCap-2B, RubiCap-3B и RubiCap-7B с 2, 3 и 7 млрд параметров соответственно. В задачах на описание изображений они показали более качественные ответы, чем созданные другими разработчиками аналоги с 32 млрд и даже 72 млрд параметров. Примечательно, что RubiCap-3B в некоторых случаях демонстрировала более качественные результаты, чем RubiCap-7B — это подтверждает, что размер модели не всегда определяет её работу.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
AMD выпустила драйвер с поддержкой F1 25: 2026 Season Pack и World of Tanks: Heat 27 мин.
«Люди не готовы»: работник CD Projekt Red предупредил фанатов в ожидании The Witcher 4 3 ч.
Разработчики Path of Exile 2 пообещали поддерживать первую Path of Exile вечно, но только при одном условии 3 ч.
В Instagram и Facebook появится функция «Серии» для создания сериалов из Reels 4 ч.
Meta собирает переписку, историю браузера и содержимое буфера обмена сотрудников ради обучения ИИ 4 ч.
Google одним махом исправила 124 уязвимости в Android — одну из них вовсю использовали хакеры 5 ч.
ИИ Meta помог хакерам угонять аккаунты Instagram 5 ч.
Бывшие разработчики Forza Horizon анонсировали амбициозный гоночный боевик Clutch — первый трейлер и подробности 6 ч.
Хоррор Farsight погрузит игроков в неуютный мир бесконечных пространств в духе фильма ужасов «Закулисье» 6 ч.
Ведущие ИИ-лаборатории озаботились вопросом «сознания» у машин 7 ч.
ИИ пожирает всю память: аналитики прогнозируют подорожание DRAM ещё на 60 % 20 мин.
Blue Origin пообещала вернуть New Glenn к полётам через полгода после катастрофы, но мало кто в это верит 22 мин.
Их делали инженеры, а не маркетологи: Thermal Grizzly представила свои первые вентиляторы для ПК 3 ч.
Создатель Borderlands показал ещё не анонсированные Google Pixel Watch 5, якобы найденные на дне моря 4 ч.
Подорожание ноутбуков и компьютеров из-за ИИ перевалило за 10 % 5 ч.
Intel с партнёрами разработает эталонный дизайн стоек с чипами Xeon для ODM и OEM-производителей 5 ч.
MaxSun привезла на Computex 2026 десятилетнюю Radeon RX 580 с шестью HDMI 6 ч.
Marvell представила чип-коммутатор Teralynx T100 на 102,4 Тбит/с для ИИ ЦОД 7 ч.
MSI показала кулер с алмазами и металлическими вентиляторами для видеокарт нового поколения 7 ч.
iPhone рискуют остаться без поддержки 5G в России — всё из-за нестандартных частот 7 ч.