Сегодня 04 марта 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Слежка без камер: Apple создала ИИ, который вычисляет действия пользователя по звуку и движениям

Компания Apple опубликовала отчёт по результатам исследования, цель которого заключалась в изучении того, как большие языковые модели (LLM) могут анализировать аудиоданные и данные о движении, чтобы получить представление о том, что делает пользователь.

 Источник изображений: 9to5 Mac

Источник изображений: 9to5 Mac

Опубликованная недавно научная работа «Использование LLM для последующего объединения мультимодальных данных датчиков для распознавания активности» позволяет понять, как Apple рассматривает возможность объединения данных анализа с помощью ИИ-моделей с традиционными данными от датчиков для более точного понимания активности пользователя. По мнению исследователей, это имеет большой потенциал для повышения точности анализа активности, даже в случаях, когда одних данных от датчиков для этого недостаточно.

«Потоки данных с датчиков предоставляют ценную информацию о деятельности и контексте для разных приложений, хотя интеграция дополнительной информации может быть сложной задачей. Мы показываем, что большие языковые модели можно задействовать для последующего объединения данных при классификации активности на основе временных рядов, аудио и данных о движении», — говорится в работе Apple.

Исследователи отобрали подмножество данных для разнообразного распознавания активности в разных контекстах, например, выполнения домашних дел или занятий спортом, из набора данных Ego4D. Было установлено, что большие языковые модели достаточно хорошо справляются с задачами, связанными с определением того, что пользователь делает, анализируя звуковые и двигательные сигналы. Примечательно, что они справляются с такими задачами достаточно хорошо, даже если их специально не обучали этому. Если же им предоставить всего один пример для обучения, то точность сразу значительно повышается. Отмечается, что LLM в исследовании обрабатывала не саму аудиозапись, а текстовое описание, сгенерированное аудиомоделями и моделью движения, которая получает данные от акселерометра и гироскопа.

В сообщении сказано, что в рамках исследования использовался набор данных Ego4D, снятых от первого лица. Эти данные содержат тысячи часов записей из реального мира, на которых запечатлены разные ситуации — от домашних дел, до занятий спортом и активного отдыха. «Мы создали набор данных о повседневных активностях из набора Ego4D, выполнив поиск действий из повседневной жизни в предоставленных текстовых описаниях. Отобранный набор данных включает в себя 20-секундные выборки из 12 видов активностей: уборка пылесосом, готовка, стирка, прием пищи, игра в баскетбол, игра в футбол, игра с домашними питомцами, чтение книги, работа за компьютером, мытьё посуды, просмотр ТВ, силовые тренировки. Эти активности были выбраны таким образом, чтобы охватить спектр домашних и связанных со спортом задач на основе их широкого распространения в исходном наборе данных», — говорится в исследовании.

Исследователи обработали звуковые данные и данные о движении с помощью небольших ИИ-моделей, которые генерировали текстовые описания и прогнозы касательно категории активности, после чего данные передавались в разные LLM (Gemini-2.5-pro и Qwen-32B), чтобы оценить, насколько хорошо они могут идентифицировать активность. Затем Apple сравнила производительность этих двух ИИ-моделей в разных ситуациях: в одной из них предоставлялся список из 12 возможных активностей (закрытый набор), а в другой не было никаких вариантов (открытый набор). Для каждого теста предоставлялись разные комбинации текстовых расшифровок аудио, аудиометок, прогнозов по активностям, а также дополнительный контекст.

Большие языковые модели показали значительно более точные результаты, чем базовые модели, работающие только с одним типом данных, особенно в сложных сценариях. Наивысшей точности удалось добиться при работе с закрытым набором данных, когда модель должна была выбирать одну из 12 активностей. При работе с открытым набором ИИ-модели также показали хорошие результаты, но иногда ответы были слишком обобщёнными или неточными. Gemini-2.5-pro и Qwen-32B показали сопоставимые результаты с небольшими преимуществами друг над другом в разных категориях, что говорит об универсальности такого подхода.

Исследование Apple показывает, что ИИ-модели могут выступать в роли мощного и гибкого инструмента для объединения и анализа мультимодальных данных с минимальным дообучением. Это может способствовать созданию более умных и контекстно-осознанных систем на мобильных устройствах и носимых гаджетах.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Это просто нереально!»: Mundfish взбудоражила фанатов Atomic Heart трейлером с датой выхода сюжетного дополнения «Кровь на Хрустале» 2 ч.
Московский суд оштрафовал разработчика Escape from Tarkov на два миллиона рублей 3 ч.
Ghost of Yotei и Saros не выйдут на ПК — Sony больше не будет портировать эксклюзивы PS5, но есть исключения 4 ч.
«Яндекс» научил «Алису» управлять смартфоном по командам пользователя — ИИ-агент уже тестируется 4 ч.
OpenAI разрабатывает прямого конкурента платформы GitHub от Microsoft 5 ч.
Власти США задумались, не угрожают ли инвестиции Tencent в Epic и Riot безопасности США 5 ч.
В Meta появится отдел прикладного ИИ — он ускорит появление «суперинтеллекта» 6 ч.
Продажи Resident Evil Requiem перевалили за 5 млн копий меньше чем за неделю после релиза 7 ч.
Activision заставила замолчать надёжного инсайдера по Call of Duty и обвинила его в распространении лживых утечек 8 ч.
Esoteric Ebb стартовала в Steam с рейтингом 97 % и заслужила одобрение соавтора Disco Elysium 8 ч.
Xiaomi будет делать новый процессор каждый год — и уже в этом выпустит смартфон с собственным чипом, ОС и ИИ 2 ч.
Apple представила ноутбук MacBook Neo за $599 — со старым чипом от iPhone и другими компромиссами 4 ч.
Meta обучает ИИ на видео с очков Ray-Ban, в том числе на интимных — но сначала их смотрят люди в Кении 4 ч.
Caviar представила эксклюзивные Galaxy S26 Ultra Totem с барельефами животных из 24-каратного золота по цене от $10 490 4 ч.
Huawei начала глобальные продажи своих ИИ-решений для ЦОД 5 ч.
Tecno и Tonino Lamborghini представили серию дизайнерской электроники — от смартфонов до геймерского мини-ПК 5 ч.
CoreWeave удвоит капзатраты на ИИ ЦОД в 2026 году, но инвесторы сомневаются в оправданности такого шага 5 ч.
Европа и Китай почти одновременно испытали гигабитную лазерную связь на высоте 36 000 км 6 ч.
Xiaomi показала на MWC 2026 полноразмерный прототип гиперкара Vision Gran Turismo 6 ч.
Amazon увеличит инвестиции в ИИ ЦОД в Испании до €33,7 млрд и откроет завод по выпуску ИИ-серверов 6 ч.