Сегодня 26 марта 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Apple научила небольшие ИИ-модели описывать изображения лучше, чем аналоги крупных конкурентов

Учёные Apple разработали технологию RubiCap — способ обучения моделей искусственного интеллекта описывать изображения более подробно и эффективно, чем это делают модели более крупного размера.

 Источник изображения: Steve Johnson / unsplash.com

Источник изображения: Steve Johnson / unsplash.com

При подготовке подробного описания изображения ИИ-модели требуется идентифицировать множество объектов и областей в кадре, чтобы далее собственно описать их с высокой степенью детализации. Это помогает глубже понять композицию, чем при общем её описании. На практике такой навык может пригодиться для обучения производных ИИ-моделей, для создания генераторов картинок по текстовому описанию и для разработки специальных возможностей. Создание систем подробного описания картинок оказывается чрезмерно дорогим и ресурсоёмким как на этапе первичного обучения, так и в дальнейшем при обучении с подкреплением.

Для решения этих проблем инженеры Apple случайным образом выбрали 50 000 изображений из обучающих наборов PixMoCap и DenseFusion-4V-100K. Для каждой из этих картинок описания генерировали существующие модели с функциями компьютерного зрения, в том числе Google Gemini 2.5 Pro, OpenAI GPT-5, Alibaba Qwen2.5-VL-72B-Instruct, Google Gemma-3-27B-IT и Alibaba Qwen3-VL-30B-A3B-Instruct; собственные описания изображений создавали и текущие обучаемые модели Apple. Далее выступающая экспертом Gemini 2.5 Pro повторно анализировала изображения с вариантами подписей и результатами работы обучаемой модели; определяла, в чём участвующие в эксперименте системы совпадали, а какие детали упускали или искажали; и составляла чёткие критерии для оценки описаний. Выступающая в роли судьи Qwen2.5-7B-Instruct оценивала описания по каждому из предложенных критериев и формировала сигнал вознаграждения для обучаемой модели.

В результате обучаемая модель получала точную и качественную обратную связь о том, что надлежит исправить — и начинали генерироваться более точные описания без опоры на единственный «правильный» ответ. В итоге инженеры Apple обучили три собственные модели ИИ: RubiCap-2B, RubiCap-3B и RubiCap-7B с 2, 3 и 7 млрд параметров соответственно. В задачах на описание изображений они показали более качественные ответы, чем созданные другими разработчиками аналоги с 32 млрд и даже 72 млрд параметров. Примечательно, что RubiCap-3B в некоторых случаях демонстрировала более качественные результаты, чем RubiCap-7B — это подтверждает, что размер модели не всегда определяет её работу.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
ИИ от Microsoft и NVIDIA ускорит создание новых атомных реакторов 28 мин.
Gartner: к 2030 году себестоимость инференса снизится на 90 %, но качественный ИИ дешевле не станет 36 мин.
Apple научила небольшие ИИ-модели описывать изображения лучше, чем аналоги крупных конкурентов 2 ч.
Мультиплеерный социальный детектив 4 Penny Coffins отправит игроков в викторианский Лондон искать Джека-потрошителя 3 ч.
ИИ поможет обнаруживать ошибки в коде проектов на GitHub 3 ч.
МТС Exolve представила сервис для централизованной работы с клиентскими чатами 3 ч.
Цифровые версии эксклюзивов Nintendo Switch 2 в США скоро станут дешевле розничных 4 ч.
Samsung Browser вышел за пределы смартфонов и теперь доступен на ПК с Windows 4 ч.
Google сократила потребление памяти ИИ-моделями в шесть раз без потери точности — с алгоритмом TurboQuant 4 ч.
Закрытие OpenAI ИИ-генератора видео Sora обрушило миллиардную сделку с Walt Disney 6 ч.
Не время для электромобилей: бум ИИ помог Panasonic распродать аккумуляторы на годы вперёд 16 мин.
Акционеры подали в суд на Supermicro из-за скандала с контрабандой ИИ-чипов в Китай 2 ч.
SanDisk стратегически вложила $1 млрд в тайваньского производителя памяти Nanya 2 ч.
Бум ИИ помог китайской CXMT более чем удвоить продажи памяти до $8 млрд 2 ч.
Игровой ноутбук Razer Blade 16 2026 получил чип Intel Core Ultra 9 386H, быструю память и порт Thunderbolt 5 3 ч.
Бизнес-компьютер Dell Pro 5 Micro в литровом корпусе получил чип Intel Panther Lake с ИИ-быстродействием 50 TOPS 4 ч.
HP представила рабочую станцию Z8 Fury G6i с поддержкой четырёх ускорителей NVIDIA RTX Pro 6000 Blackwell Max-Q Workstation Edition 4 ч.
ИИ помог открыть неизвестные ранее экзопланеты в архивах телескопа-охотника TESS 4 ч.
Samsung Galaxy Z Fold8 Wide показался на изображениях — он станет ответом на первый складной iPhone 5 ч.
Китай может занять до 42 % рынка массовых чипов к 2028 году благодаря ИИ 5 ч.