Сегодня 21 февраля 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ChatGPT обрёл зрение — бот научился на лету понимать видеопоток с камеры смартфона и экрана

OpenAI объявила о появлении у чат-бота ChatGPT на базе генеративного интеллекта способности обрабатывать видеопоток и говорить с пользователями о том, что он «наблюдает» с помощью камеры смартфона или компьютера, либо что видит на экране устройства. Новая функция доступна в расширенном голосовом режиме (Advanced Voice Mode).

 Источник изображения: OpenAI

Источник изображения: OpenAI

О том, что ChatGPT получит функцию компьютерного зрения, позволяющую ему «видеть» при помощи камеры смартфона пользователя или через трансляцию экрана, компания объявила в мае этого года. Теперь доступ к функции расширенного голосового режима ChatGPT с распознаванием видео получили владельцы платных подписок ChatGPT Plus, Team и Pro. По словам компании, подписчики ChatGPT Enterprise и Edu не получат эту функцию до января, и что пока нет графика по её запуску в ЕС, Швейцарии, Исландии, Норвегии и Лихтенштейне.

В недавней демонстрации в программе CNN «60 минут» президент OpenAI Грег Брокман (Greg Brockman) провел тестирование расширенного голосового режима с визуальным распознаванием с участием телеведущего Андерсона Купера (Anderson Cooper) на предмет анатомических навыков чат-бота. Когда Купер рисовал части тела на доске, ChatGPT «понимал», что тот рисует. Вместе с тем ChatGPT в этом режиме допустил ошибку в задаче по геометрии, что говорит о его склонности к галлюцинациям.

После анонса в мае компания несколько раз откладывала запуск расширенного голосового режима с визуальным распознаванием. В апреле OpenAI пообещала, что этот режим будет доступен для пользователей «в течение нескольких недель», но спустя несколько месяцев признала, что на это потребуется больше времени, чем планировалось. И когда расширенный голосовой режим запустили для некоторых пользователей в сентябре, у него не было функции компьютерного зрения.

Компании Google и Meta тоже работают над аналогичными возможностями для своих чат-ботов. На этой неделе Google сделала функцию ИИ для анализа видео в реальном времени Project Astra доступной для группы «доверенных тестировщиков» на платформе Android.

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Activision спрятала на новой карте Call of Duty: Black Ops 6 тизер анонса Tony Hawk’s Pro Skater 3 + 4 33 мин.
Илону Маску удалось сделать X прибыльной, но выручка пока отстаёт от времён независимости Twitter 60 мин.
Угрозы, вымогательство и доносы в Следственный комитет: разработчики российского хоррора «Зайчик» подверглись травле со стороны бывших партнёров 3 ч.
Московский суд оштрафовал Telegram и YouTube на 80 000 рублей за неудаление персональных данных 3 ч.
Облачная ИИ-платформа Together AI получила на развитие более $300 млн при оценке в $3,3 млрд 4 ч.
Объём рынка средств для защиты данных в России в 2024 году достиг 23 млрд руб. 4 ч.
Приложения для слежки допустили слив личных данных миллионов людей по всему миру 6 ч.
На Sony опять подали в суд из-за слишком высоких цен в PS Store — теперь в Нидерландах 13 ч.
Роскомнадзор разблокировал агрегатор криптообменников BestChange 14 ч.
Инсайдер из Microsoft намекнул на релиз GPT-4.5 на следующей неделе и GPT-5 в мае 14 ч.
Общая мощность майнинговых ферм в России выросла до 11 ГВт, но только 3 ГВт легальны 36 мин.
Новая утечка показала Nothing Phone (3a) и Phone (3a) Pro со всех сторон и раскрыла полные характеристики 44 мин.
Производство российских смартфонов и планшетов загружено только на 20 % из-за невысокого спроса 2 ч.
Китайцы полезли под землю в поисках места для хранения энергии в сжатом воздухе 2 ч.
Выяснилось, что первый фирменный 5G-модем Apple C1 выпускает TSMC сразу по двум техпроцессам 3 ч.
iPhone 17 будут дороже предшественников — Apple начала готовить пользователей к повышению цен 3 ч.
Нужно больше дата-центров: AWS намерена построить по ЦОД в «каждом округе» между Северной Вирджинией и Ричмондом 3 ч.
Ноутбуки Apple и Lenovo оказались худшими по ремонтопригодности 4 ч.
QNAP представила 10GbE-коммутатор начального уровня QSW-3205-5T 4 ч.
Стартап Figure продемонстрировал, как его человекоподобные роботы справляются с бытовыми делами 5 ч.