Сегодня 03 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → google gemini
Быстрый переход

Gemini 4 хороша в тестах, но буксует в работе — пожаловались сотрудники Google

Google начала развёртывать долгожданную флагманскую модель искусственного интеллекта Gemini 4 Argon, но внутри компании нарастают сомнения относительно качества её работы в ключевых областях, в том числе в написании программного кода. В руководстве Google, однако, настроены оптимистично.

 Источник изображений: blog.google

Источник изображений: blog.google

Google представила модель Gemini 4 Argon узкому кругу партнёров в области кибербезопасности, пообещала после дополнительного тестирования расширить к ней доступ и начать с подписчиков платных тарифов. По официальной версии, Gemini 4 в ряде бенчмарков показала лучшие результаты, а в области безопасности обошла OpenAI Astra. Но эти показатели не отражают всей картины, утверждают источники Bloomberg — на практике она показывает более скромные результаты и испытывает трудности с некоторыми задачами из области программирования.

Поисковый гигант активно разрабатывает ИИ-модели, способные конкурировать с продуктами OpenAI и Anthropic; в июне компания намеревалась выпустить Gemini 3.5 Pro, но впоследствии отказалась от этого. Официальные представители Google заявили, что утверждения о низкой эффективности Gemini 4 в области программирования не соответствуют действительности, и сослались на слова руководителя DeepMind Корая Кавукчуоглу (Koray Kavukcuoglu): «Команде я доверяю всецело. Уверен, что мы всегда будем на переднем крае технологий».

Мнения сотрудников Google разделились. Одни говорят, что Anthropic Fable и OpenAI Astra развиваются быстрее, чем Gemini; и Gemini 4 даже при максимальных усилиях всё равно будет уступать в ряде аспектов. Другие полагают, что готовящаяся к выпуску версия по своим возможностям сравнялась с продуктами ведущих ИИ-лабораторий. Один из знакомых с процессом разработки модели сотрудников Google заверил, что внутри компании установился «широкий консенсус», что компания тщательно протестировала модели, и отверг утверждения, что они слабо справляются со сложными практическими задачами в области программирования.

Google необходимо, чтобы Gemini 4 стала успешной. Различные варианты Gemini используются практически во всех продуктах компании, включая ИИ-ответы в поиске, «Карты», Gmail и браузер Chrome. Этими сервисами пользуются миллиарды человек — таким охватом аудитории некоторые конкуренты Google похвастаться не могут. OpenAI и Anthropic уже недостаточно просто продавать доступ к моделям — они выпускают полноценные продукты, в том числе ИИ-агентов для написания кода. И если Google не ответит передовой моделью, у конкурентов будет время убедить клиентов, что будущее поиска и ПО — за их платформами.

В Google признали, что последняя модель уровня Pro вышла ещё в феврале, но с тех пор компания зафиксировала рост показателей своих продуктов с ИИ: корпоративной версии Gemini, чат-бота для массового пользователя и функции ИИ-обзоров в поиске — аудитория последних двух сервисов превысила 1 млрд пользователей. В ноябре минувшего года модель Gemini 3 выступила сильнее всех конкурентов; в мае этого года дебютировало семейство Gemini 3.5, компания пообещала в июне выпустить флагманскую Gemini 3.5 Pro, но, по неофициальной информации, отменила проект.

Решение нанесло урон позициям компании на рынке ИИ и, вероятно, обошлось компании недёшево с точки зрения времени и затрат. Только обучение подобной системы эксперты оценивают в $400 млн, и это без учёта оплаты труда инженеров, получающих очень высокую зарплату. Некоторые проблемы у Gemini 4 всё-таки есть, настаивают отдельные сотрудники. Её навыки в области написания кода неоднородны: модели, например, с трудом даётся фронтенд — направление, отвечающее за внешний вид и удобство использования приложений и сайтов. Кроме того, эта модель очень крупная, и её эксплуатация будет обходиться дорого, что может плохо сказаться на рентабельности Google.

Google, предполагают эксперты, могла чрезмерно увлечься «бенчмаксингом» — так называют популярное в отрасли явление, при котором инженеры оптимизируют ИИ-модели для получения высоких баллов в тестах, уделяя меньше внимания созданию продукта, который качественно выполняет свою задачу. Gemini 4 действительно не избежала этой тенденции, подтвердили знакомые с разработкой модели источники.

Среди сильных сторон модели отмечается способность обрабатывать отличную от текстовой информацию, например, извлекать метаданные из видео. Gemini 4 отличается высокими уровнями безопасности и киберзащищённости, а также умеет вести общение в ясной и естественной форме, говорит информированный источник.

Внутри Google ощущается явное недовольство ситуацией: исследователи указывают на раздутую бюрократию, которая стремится внедрить ИИ во все продукты компании; последовательной стратегии вредит постоянная смена задач и приоритетов. Компания потеряла ряд ведущих исследователей в области ИИ: легендарного инженера Джеффа Дина (Jeff Dean), нобелевского лауреата Джона Джампера (John Jumper), одного из руководителей направления Gemini Ноама Шазира (Noam Shazeer), а глава DeepMind Демис Хассабис (Demis Hassabis) уступил своё место более практичному Кораю Кавукчуоглу (Koray Kavukcuoglu).

Gemini 4, по официальной версии, разработана для выполнения длительных и сложных задач в сфере разработки ПО, в области финансов, юриспруденции и кибербезопасности. За один раз она способна генерировать до 1 млн токенов — это примерно 750 тыс. слов. Конкуренты Google тем временем стремительно движутся вперёд, хотя и призывают замедлить темпы разработки; среди потребителей наиболее популярен сейчас сервис ИИ-агента Meta✴✴ Muse — он умеет выполнять повседневные задачи, в том числе совершать покупки онлайн и записывать пользователей на приём.

Google начала платить сайтам за контент для ИИ-ответов — но большинству достаются копейки

Google начала эксперимент с выплатами издателям за материалы, которые используются при формировании ИИ-ответов в поиске. Однако первые результаты программы вызвали скептицизм: небольшие и средние сайты получают настолько мало денег, что это не компенсирует падение их поискового трафика из-за ИИ.

 Источник изображения: AI

Источник изображения: AI

По данным Ars Technica со ссылкой на The Information, к программе под названием AI contribution pilot компания Google подключила около 100 издателей. Участникам платят, если их материалы существенно влияют на ответы Gemini в ИИ-обзорах (AI Overview). При этом ранее Google не рассматривала возможность прямых выплат за использование контента, утверждая, что сайты получают взамен трафик из поисковой системы.

Несколько небольших и средних издателей рассказали The Information, что выплаты составляют примерно 0,1 % от их рекламной выручки, а некоторые крупные издатели вообще отказались от участия, рассчитывая таким образом добиться от Google более выгодных условий. При этом суммы заметно различаются. Например, один из участников программы по прогнозам может получать более $1 млн в год, тогда как недавно подключившийся сайт заработал около $60 000, что составляет лишь малую долю его доходов. Небольшие сайты получили менее $1000 за несколько месяцев.

Участники эксперимента отмечают, что материалы по нишевой тематике (аниме и игры) с меньшим количестве публикаций зарабатывают больше в виду высокого интереса у узкой аудитории. Одновременно статистика в консоли Google Search остаётся непрозрачной и издатели не всегда могут определить, почему получили ту или иную сумму. Компания также не объясняет достаточно подробно, что именно считается существенным вкладом в ИИ-ответ, поэтому сайтам сложно прогнозировать будущие выплаты.

Для Google проблема выходит за рамки отдельного эксперимента, так как ИИ-модели получают знания из большого массива интернет-данных, а поисковым системам по-прежнему необходим новый и актуальный веб-контент. Если сайты перестанут публиковать материалы или начнут блокировать доступ поисковым ботам Google, это может повлиять и на качество ИИ-поиска. При этом некоторые издатели уже активно начали противостоять переходу Google к поиску на базе ИИ. В частности, The New York Times подала иск из-за незаконного использования своих материалов для обучения моделей, а компания Penske Media, владеющая изданиями Variety и Rolling Stone, обвинила Google в несправедливом объединении обычной поисковой индексации со сбором данных для ИИ.

На ситуацию обращают внимание и регуляторы. В Великобритании Google ранее обязали предоставить издателям возможность отказаться от использования материалов в ИИ-поиске без потери присутствия в обычной выдаче, а Европейская комиссия проводит антимонопольное расследование, связанное с компенсацией издателям за использование их контента в ИИ-ответах.

Google вернулась в гонку ИИ с Gemini 4 Argon, которая слишком опасна для публики

Google представила Gemini 4 Argon — флагманскую модель искусственного интеллекта, ориентированную на сложные многошаговые задачи в программировании, анализе данных, юридической и финансовой работе, а также кибербезопасности. Но что важнее, новая модель — это попытка Google вернуться в гонку ИИ, где она в последнее время заметно отстала от OpenAI и Anthropic.

Gemini 4 вышла спустя почти целый год после Gemini 3 Pro, которая за это время была лишь обновлена до Gemini 3.1 Pro в феврале. Так что Google серьёзно отстала от конкурентов: OpenAI представила GPT-6 Astra, а Anthropic вывела на рынок Claude Fable 5 и Mythos 5, а потом и 5.1. Теперь в арсенале Google есть ответ в лице Gemini 4 Argon, которую сама компания позиционирует на уровне передовых моделей конкурентов.

Gemini 4 Argon получила лимит вывода до 1 млн токенов — в Google называют его отраслевым рекордом. Для сравнения, у предшествующих моделей компании максимальный объём генерируемого ответа составлял 64 тыс. токенов. Такой запас позволяет модели выполнять значительно более длинные цепочки рассуждений и генерировать сотни тысяч токенов в рамках одного рабочего процесса.

В Google описывают Gemini 4 Argon как систему, которая не просто отвечает на вопрос или генерирует фрагмент кода, а изучает исходные файлы, составляет план, запускает нужные инструменты, проверяет промежуточный результат и исправляет собственные ошибки.

Основными областями применения Gemini 4 Argon названы разработка ПО, финансовая и юридическая работа, а также кибербезопасность. Google уже использует Argon внутри компании. В частности, агенты на базе модели помогали оптимизировать алгоритмы для квантовых вычислений, анализировали телеметрию дата-центров и автоматически находили способы сократить потребление памяти. После внедрения предложенных оптимизаций компания рассчитывает освободить более 300 тебибайт памяти, а потенциальный суммарный эффект оценивает в 500 ТиБ — 1 ПиБ.

Ещё одно направление — масштабная миграция программного кода с C и C++ на Rust. Argon используется для работы с кодовыми базами объёмом от десятков тысяч строк до более чем 800 тыс. строк в ядре Fuchsia OS. В одном из экспериментов агенты модели переработали 32 тыс. строк SIMD-кода в библиотеке декодирования видео libgav1. Получившаяся реализация на Rust работает в 2,7 раза быстрее предыдущего Rust-порта при идентичных результатах декодирования.

В собственных тестах Google Gemini 4 Argon показала результат 77,9 % в бенчмарке DeepSWE v1.1, оценивающем способность ИИ решать реальные длительные задачи разработки ПО. Это выше показателей GPT-6 Astra (74,1 %) и Claude Fable 5.1 (67,4 %). В AutomationBench, который проверяет, правильно ли агенты выполняют многоэтапные бизнес-процессы, новинка получила 51,3 % против 41,4 и 31,4 % у Astra и Fable соответственно. Также Argon опередила флагманские GPT-6 Astra и Claude Fable 5.1 в Vals Index. В тесте понимания длинных видеозаписей LVBench результат составил 91,7 %.

Отдельное внимание Google уделила возможностям Argon в области кибербезопасности. Модель способна самостоятельно искать, проверять и исправлять уязвимости в программном обеспечении. В тесте CWE-bench v1 она получила 68 %, разделив первое место с флагманскими GPT-6 Astra и Grok 4.7. Google также заявляет о значительном превосходстве Argon над Gemini 3.8 Flash Cyber в ряде внутренних тестов по поиску уязвимостей и анализу веб-систем.

Google не собирается сразу делать Gemini 4 Argon общедоступной. Сначала её протестируют в рамках программы Fairwind вместе с доверенными экспертами по кибербезопасности. Google дополнительно проверяет Gemini 4 Argon на устойчивость к вредоносным инструкциям, попыткам обмануть ИИ и выходу агента за поставленные рамки.

После завершения тестирования Google планирует предоставить Argon разработчикам, корпоративным клиентам и обычным пользователям — первоначально платным клиентам API и подписчикам Google AI Ultra. На старте использование модели будет стоить $2 за 1 млн входных токенов и $10 за 1 млн выходных; после вводного периода тарифы вырастут до $4 и $20 соответственно. Кэшированные входные токены будут стоить на 95 % дешевле стандартной цены.

Google заменит ИИ-ботов Gem в приложении Gemini на «навыки», но вряд ли это поможет конкуренции с Muse

На фоне роста популярности универсальных ИИ-агентов, таких как Muse от Meta✴✴ и Instinct, компания Google объявила о закрытии функции Gem в сервисе Gemini, которая позволяла пользователям создавать собственных ИИ-помощников для выполнения конкретных задач. Созданные пользователями ИИ-боты Gem не пропадут: эти инструменты будут автоматически преобразованы в «навыки» (skills), применимые для решения самых разных задач с использованием ИИ.

 Источник изображений: Google

Источник изображений: Google

Подробности изменений сообщаются непосредственно в приложении Gemini: пользователей предупреждают, что с 17 ноября 2026 года Gem трансформируются в «навыки». Компания берёт на себя процесс переноса данных в новый формат, поэтому пользователям не придётся предпринимать никаких действий для перехода. До указанной даты функциональность Gem сохранится в прежнем виде.

Функция ИИ-ботов Gem, запущенная в 2024 году, была призвана помочь пользователям обучать ИИ выполнению определенных задач, избавляя от необходимости каждый раз повторять инструкции. Среди готовых вариантов от Google были, например, наставник по обучению, помощник для мозгового штурма, консультант по карьере, помощник по написанию кода и редактор текстов. Пользователи также могли создавать собственные версии ИИ-ботов Gem. Например, можно было создать ИИ-тренера по бегу, диетолога или планировщика для отпуска. Такими помощниками можно было делиться с другими людьми. В Google рассчитывали, что это повысит популярность приложения Gemini.

Как отмечает портал TechCrunch, несмотря на смену формата «навыки» остаются менее удобными для рядового пользователя, чем простой ввод текстового запроса в чат-бот, как это реализовано у Meta✴✴ для Muse.

Для выбора нужного «навыка» в ветке обсуждения задачи придётся вводить косую черту («/») — такой интерфейс обычно предпочитают инженеры, а не рядовые пользователи.

ИИ-модель Google Gemini перепутала тест с реальностью и случайно взломала три компании

Модель искусственного интеллекта Google Gemini в ходе тестирования возможностей в области кибербезопасности получила несанкционированный доступ к системам трёх сторонних компаний. По утверждению Google, во всех трёх случаях модель остановилась, определив, что вышла за пределы тестовой среды. Об инцидентах сообщила Wall Street Journal (WSJ).

 Источник изображения: Rubaitul Azad / unsplash.com

Источник изображения: Rubaitul Azad / unsplash.com

Инциденты произошли в мае во время испытаний на платформе компании Irregular, где ранее фиксировались аналогичные случаи с моделями OpenAI, Anthropic и Meta✴✴. Irregular уведомила Google о произошедшем в конце июля. Компания не стала публично раскрывать информацию и подтвердила инциденты лишь после запроса WSJ.

В отрасли пока только складывается практика раскрытия информации об инцидентах и непредусмотренном поведении ИИ-моделей. Одни разработчики сообщают о таких случаях самостоятельно, о других становится известно благодаря сторонним исследователям. В Google заявили, что не сочли публичное раскрытие необходимым, поскольку модель не причинила ущерба и во всех трёх случаях остановилась после того, как определила, что получила доступ к реальным системам.

В компании сравнили произошедшее с программами bug bounty, в рамках которых специалисты по безопасности получают вознаграждение за обнаружение уязвимостей. «Случившееся указывает на важность обучения мощных ИИ-моделей ответственному поведению. В данном случае модель повела себя надлежащим образом», — заявила вице-президент Google по разработке систем безопасности Хизер Эдкинс (Heather Adkins).

Инциденты произошли во время учений формата «захват флага» в инфраструктуре Irregular. Gemini должна была извлечь информацию из программного обеспечения вымышленной компании внутри тестовой среды, однако её название совпало с названием реальной организации. Кроме того, из-за ошибки конфигурации модель получила доступ в интернет, которого у неё не должно было быть.

В первом случае Gemini перебирала пароли, пока не получила доступ к защищённому сервису реальной компании. Определив, что система не относится к тестовой среде, модель прекратила действия и вышла из неё. В двух других случаях Gemini выполнила поиск по названию компании и обнаружила в общедоступных репозиториях учётные данные двух других организаций. Модель успешно воспользовалась ими, но затем также остановилась. Эти обстоятельства Google приводит в собственном изложении; независимого анализа действий модели пока не опубликовано.

В Google не сочли произошедшее примером рассогласования целей модели, поскольку она самостоятельно прекратила действия. Компания уведомила все три пострадавшие организации, а также федеральные власти США. В Google подчеркнули, что в инцидентах не участвовала новейшая версия Gemini, но не уточнили, какая именно модель проходила тестирование.

Google CC стал семейным ИИ-секретарём — он собирает письма, чеки и документы и превращает их в планы

В конце минувшего года Google выпустила экспериментальный проект CC, призванный сделать модель Gemini полезной в повседневной жизни. Это был ИИ-агент, который готовил ежедневные сводки и помогал отслеживать выполнение задач, анализируя информацию из Gmail, «Google Календаря» и «Google Диска». Экспериментальный сервис воплотился в функции ежедневных сводок Gemini Daily Brief, но в компании расширили и возможности первоначальной концепции Google CC.

 Источник изображения: blog.google

Источник изображения: blog.google

Теперь сервис Google CC позиционируется как ИИ-помощник для семей и домохозяйств. Он работает не только с одним человеком, а ориентируется на нужды всей семьи, работая в собственной учётной записи Google. Сервис работает через собственный профиль, и пользователи сами решают, какой информацией с ним поделиться — так же, как они делятся данными с друзьями. Управлять новым ИИ-агентом и взаимодействовать с ним могут до шести членов семьи. Можно отправлять ему файлы PDF, изображения, чеки и обычный текст. Получив доступ к данным, система анализирует их и формирует общую ежедневную сводку для всей семьи.

Родители могут настроить автоматическую пересылку писем из школы ребёнка на адрес Google CC, а также автоматически перенаправлять приглашения из календаря. Основная идея в том, чтобы собирать разрозненную информацию воедино и представлять её людям в удобном для них виде. Сервис может отслеживать важные даты и задачи, заносить эти события в семейный календарь или список дел. Google CC может выполнять повторяющиеся задачи: заполнять бланки разрешений и формы регистрации на различные мероприятия, составлять списки покупок и планировать меню на неделю. При недостатке информации, подчеркнули в Google, сервис не галлюцинирует, то есть не выдумывает несуществующие факты, а просто запрашивает недостающие данные.

Со временем объём памяти сервиса увеличивается, система узнаёт о пользователях больше и пополняет свою базу данных: запоминает продукты, которые семья покупает постоянно, или любимые рестораны. Чрезмерной инициативы Google CC не проявляет — он не заполняет формы самостоятельно и не совершает платежей. Сервис продолжает носить статус экспериментального, поэтому он может не всегда работать так, как заявлено. Опробовать его сейчас могут только обладатели личных аккаунтов Google, живущие в США. Действующие пользователи Google CC получат электронное письмо с предложением о переходе на новую версию сервиса; новым придётся записаться в лист ожидания.

Google представила ИИ-модели Gemini 3.8 Live и Live Extended Thinking

Вслед за основной моделью искусственного интеллекта Gemini 3.8 Flash компания Google выпустила её дополнительные версии Gemini 3.8 Live и Live Extended Thinking. Они разработаны как готовые к использованию голосовые помощники, способные сделать общение с Gemini более комфортным для совместной работы.

 Источник изображения: blog.google

Источник изображения: blog.google

Модель Gemini 3.8 Live, пояснили в Google, разработана для работы в сценариях масштабирования и высокой эффективности, а Gemini 3.8 Live Extended Thinking предназначена для решения задач высокой сложности. Младшая модель способна обрабатывать визуальные данные практически в реальном времени, она справляется с переходами между 97 поддерживаемыми языками прямо во время разговора. Она работает с внешними инструментами и обрабатывает вызовы API в фоновом режиме, подтверждая запросы и не прерывая разговора с пользователем.

Одна из примечательных функций Gemini 3.8 Live Extended Thinking — способность рассуждать и говорить одновременно. Она, подчёркивают в Google, оказалась достаточно мощной, чтобы занять первое место в рейтинге моделей Speech to Speech Quality Index компании Artificial Analysis; а также стала лидером в бенчмарке τ-Voice-banking, предусматривающем тестирование голосовых ИИ-агентов при выполнении в реальном времени сложных задач в области банковской техподдержки и поддержки клиентов финтех-компаний.

Генерируемый моделями звук получит цифровые «водяные знаки» SynthID. Обычные пользователи смогут поработать с моделью Gemini 3.8 Live в сервисе Search Live; в с Gemini 3.8 Live Extended Thinking — в Gemini Live. Обладатели платных подписок AI Pro и Ultra смогут обращаться к Gemini 3.8 Live Extended Thinking в приложениях «Google Документы», Gmail и Keep. Для разработчиков обе модели доступны через Gemini API и на платформе Google AI Studio. Корпоративным пользователям доступ к обеим моделям открыт через Gemini Enterprise; в перспективе новые модели появятся в сервисе Gemini Enterprise for Customer Experience и в Google Workspace для бизнес-клиентов.

Google выпустила приложение Gemini для Windows

Google объявила о выпуске приложения помощника с искусственным интеллектом Gemini для Windows. Оно выступает дополнением к привычным для пользователей рабочим инструментам и повседневным программам, предлагая быструю помощь по разным вопросам без отрыва от работы.

Предусмотрен быстрый запуск приложения Gemini поверх активного окна по нажатию сочетания клавиш Alt + Space. Если, например, требуется быстро проверить факты в документе или придумать заголовки к слайдам в презентации, пользователь может получить необходимую помощь в оперативном режиме и быстро вернуться к работе.

Доступны функции работы над задачами в выделенном рабочем пространстве. В приложении есть все привычные для опытных пользователей функции Gemini: задачи можно поручить доступному круглосуточно ИИ-агенту Gemini Spark, который доступен, правда, только платным подписчикам. ИИ-помощник может составить черновую сводку материалов проекта, проанализировав информацию в сервисах Google, в том числе Gmail и «Google Диск».

Через приложение можно генерировать изображения для презентаций с помощью модели Nano Banana, а также создавать видеоролики при помощи подключённой к платформе Gemini Omni. Приложение Gemini для Windows, заверили в Google, работает незаметно и не замедляет работу компьютера. Со временем разработчик будет добавлять в него новые функции, свойственные полноценным десктопным приложениям. Оно совместимо с Windows 10 и 11.

С Gmail, Google Docs и Keep теперь можно разговаривать — Gemini научился понимать голосовые команды

Google запустила функции голосового управления для помощника с искусственным интеллектом Gemini в приложениях семейства Workspace, в том числе Gmail, Keep и «Документы» — набирать текст вручную больше не требуется.

 Источник изображения: blog.google

Источник изображения: blog.google

Модели Gemini Audio не просто расшифровывают текст — их задача в том, чтобы интерпретировать намерения пользователя и извлекать из его голосовых команд необходимую информацию. Функция Gmail Live позволяет, например, задать ИИ вопрос о том, куда пройти на посадку в самолёт, или что случилось в школе у ребёнка за последнюю неделю. Модель самостоятельно находит необходимую информацию, не требуя, чтобы пользователь сам указывал необходимое письмо.

Функция Docs Live предполагает создание новых документов на основе запросов, которые пользователь отправляет естественным языком. К примеру, он отсылает Gemini материалы «мозгового штурма», а ИИ-помощник систематизирует идеи и формирует из них структурированный черновик. Дополнительными источниками данных могут выступать другие приложения Workspace, в том числе «Google Диск», Gmail и результаты поиска в интернете. Схожим образом работает Keep Live — речь пользователя преобразуется в оформленные заметки, а не переписывается слово в слово.

Приоритетный доступ к Gmail Live и Keep Live уже открыт для подписчиков платных тарифов Google AI Plus, Pro и Ultra; воспользоваться Docs Live могут только обладатели подписки Pro и Ultra. «Независимо от того, ищете ли вы что-то в своей почте, организуете свои мысли или проводите мозговой штурм, новые возможности Gmail, Docs и Keep позволяют делать всё это в режиме диалога», — пояснили в Google.

Google представила Guided Vision — функцию визуального поиска вещей в режиме Gemini Live

Google существенно расширила возможности помощника с искусственным интеллектом Gemini, когда представила режим Gemini Live — анализ изображения с камеры в реальном времени. Теперь этот режим дополнился функцией Guided Vision, предлагающей поиск объектов в кадре.

 Источник изображения: blog.google

Источник изображения: blog.google

Функция Guided Vision для режима Gemini Live дебютировала с сентябрьским пакетом обновлений Android Drop наряду с возможностью Gemini запоминать местоположение вещей в Find Hub, а также интеграцией чек-листов Google Keep в «Сообщениях». Guided Vision помогает Gemini Live подробно описывать, что находится в кадре. В предложенном Google примере пользователь направляет камеру на полку со специями и просит указать, где находится орегано — ИИ-помощник в точности сообщает, где стоит приправа и даже руководит рукой пользователя.

Новая функция может оказаться полезной в ряде сценариев — не только в поиске предметов домашнего обихода. Оказавшись в тускло освещённом ресторане, пользователь с помощью Guided Vision легко сделает заказ по меню. Можно также использовать её для чтения мелкого шрифта на этикетке продукта. Google также предусмотрела средства для корректной работы функции — Gemini подскажет, если потребуется изменить кадр, переместить камеру или расположить нужный объект в центре.

Guided Vision в ближайшее время появится на смартфонах под управлением Google Android 9 и более свежих версий — функцию можно будет добавить в ярлыки специальных возможностей.

Google Gemini сможет «думать» в фоне, пока пользователь занимается другими делами на смартфоне

Помощник с искусственным интеллектом Google Gemini может оказаться достаточно полезным, особенно при наложении на остальной интерфейс Android-смартфона — эта функция может срабатывать при длительном нажатии на кнопку питания. Но в этом режиме, пока Gemini работает, владелец устройства не может делать на нём что-либо ещё. Но Google уже тестирует возможность работы ассистента в фоне.

 Источник изображения: Rubaitul Azad / unsplash.com

Источник изображения: Rubaitul Azad / unsplash.com

В коде последней версии приложения Google v17.54.10 журналисты ресурса Android Authority обнаружили упоминание новой функции. При наложении приложение Gemini сможет автоматически сворачиваться, пока обрабатывает команды пользователя. То есть можно будет вызвать ИИ-помощника, задать ему вопрос, он автоматически свернётся в плавающую кнопку и даст владельцу смартфона возможность работать с ним дальше.

Сейчас это невозможно: формат наложения остаётся активным на протяжении всего разговора, то есть пока ИИ-помощник активен, делать на устройстве что-либо ещё не получится. Если Google реализует функцию многозадачности, работать с Gemini станет значительно комфортнее. Ранее в том же приложении обнаружилась ссылка на кнопку сворачивания Gemini, которая делала бы это в принудительном порядке, но в основной версии приложения Google она пока не появилась. О конкретных планах компания пока не сообщала, и нет ясности, какой из вариантов появится в общедоступном варианте приложения.

Google Gemini научился менять настройки смартфонов на Android 17 — начал с Pixel

На смартфонах Google Pixel 11 дебютировала новая функция Gemini, получившая название Device Help. Пользователь может задать помощнику с искусственным интеллектом вопросы о настройках своего телефона, задать конкретную цель — в ответ на это ассистент укажет на эти настройки и даже предложит внести несколько изменений в одно касание. Как выяснилось, эта функция работает не только на Pixel 11.

 Источник изображения: x.com/minhazav

Источник изображения: x.com/minhazav

Один из разработчиков в Google недавно опубликовал видео с работой функции Device Help — на демонстрации Gemini показывает функции, с которыми смартфон становится удобнее использовать ночью, в том числе переход на тёмную тему и регулировка яркости экрана. Он подчеркнул, что Device Help работает на любом устройстве Pixel под управлением Android 17, и в перспективе она появится на большем количестве устройств.

Разработчик не уточнил, о каких конкретно моделях идёт речь, но, видимо, для этого требуется Android 17, а встречается он пока нечасто. У журналистов ресурса Android Authority остались неоднозначные впечатления о работе Device Help: на двух разных экземплярах смартфонов Pixel 11 ИИ-помощник Gemini дал два разных ответа. Новая Google Android 17 устанавливается на модели Pixel 6 и более поздние. Уже начали выходить устройства и других производителей с предустановленной свежей версией платформы.

Внутри Google стартовало тестирование новой версии модели Gemini Flash

Некоторые сотрудники Google уже начали пользоваться предварительной версией модели искусственного интеллекта Gemini 3.8 Flash — темп гонки нарастает, и компания выпускает обновлённые версии с интервалом в несколько недель, чтобы не отставать от OpenAI и Anthropic.

 Источник изображения: Rubaitul Azad / unsplash.com

Источник изображения: Rubaitul Azad / unsplash.com

Свежая модель под названием Gemini 3.8 Flash Preview стала доступна сотрудникам Google на внутренней платформе для написания кода Jetski, передаёт Business Insider. Один из сотрудников компании, которому довелось протестировать новую модель, сказал, что она заметно лучше актуальной 3.7 Flash, но оговорился, что делать выводы ещё рано. Флагманская Gemini 3.5 Pro так и не вышла, Anthropic и OpenAI опережают Google в гонке ИИ, так что передовой модели у поискового гиганта нет. Он был вынужден сделать ставку на модели семейства Flash, более быстрые и дешёвые для пользователей — клиенты стали внимательно следить за расходами на ИИ.

Google позиционирует их как «рабочие лошадки» для написания кода и запуска ИИ-агентов, которые расходуют токены быстрее чат-ботов, но становятся всё более популярными в различных задачах. Ранее Google запустила ИИ-агента Gemini Spark, а Meta✴✴ тестирует своего под названием Hatch. Google действительно выпускает быстрые модели с большой скоростью: Gemini 3.6 Flash появилась в июле, а 3.7 Flash вышла всего через три недели. Гендиректор компании Сундар Пичаи (Sundar Pichai) заявил, что промежуток между версиями будет составлять менее месяца. Это значит, что Gemini 3.8 Flash может появиться в ближайшее время. Некоторые специалисты по ИИ убеждены, что замечали Gemini 3.8 Flash на платформе тестирования ИИ-моделей Arena AI, где Google ранее испытывала будущие релизы.

Google представила ИИ-генератор видео Gemini Omni 1.1 Flash

Google анонсировала модель искусственного интеллекта Gemini Omni 1.1 Flash, предназначенную для генерации видео. Проект представляет собой попытку решить задачу о том, как по заданному образцу из нескольких кадров сгенерировать органичный ролик — разработчикам предоставляется больший контроль над тем, что происходит между первым и последним кадром.

 Источник изображения: blog.google

Источник изображения: blog.google

Важнейшее нововведение Google Gemini Omni 1.1 Flash — способность модели запоминать существующее видео, когда она получает инструкцию продолжить сцену; модель полагается не только на последние кадры, а на 10 секунд предшествующего видеоматериала. Это помогает ей сохранять персонажей, окружение и общее направление сцены более согласованными, и не приходится угадывать, что должно произойти дальше. Расширился набор возможностей для продолжения исходных сцен. Видео можно удлинять фрагментами по 10 секунд, пока общая длина ролика не достигнет 40 секунд. Этот промежуток может показаться не таким уж продолжительным по сравнению с традиционным видео, но открывается более широкий набор возможностей для генерации последовательностей с помощью ИИ — с заданными началом, серединой и концом.

Это значит, что пользователь может предоставить первый и последний кадры, а Google Gemini Omni 1.1 Flash сгенерирует всё необходимое для их соединения. Это может быть движение камеры вокруг объекта, плавное масштабирование композиции или зацикленный ролик. Можно отправить модели до трёх секунд реального видео для дополнительного визуального контекста, а она сама, например, изобразит появление персонажа в сгенерированной сцене. На этапе предварительных материалов максимальное качество видео не требуется — они могут генерироваться в разрешении 360p, что позволяет ИИ работать на 60 % быстрее, чем в случае с 720p, и втрое дешевле. Можно протестировать задумку, скорректировать подсказки, проработать несколько версий, и когда результат окажется оптимальным, Omni 1.1 Flash создаст видео в 1080p или масштабирует его до 4K.

Доступ к Google Gemini Omni 1.1 Flash уже открылся через API Gemini в Google AI Studio, корпоративные клиенты могут поработать с моделью через Google Agent Platform. Частные пользователи при наличии подписки Google AI Plus, Pro и Ultra могут открыть новую модель в Google Flow; для них функция расширения сцены появится и в основном приложении Gemini.

Gemini Live перестал быть просто собеседником — теперь ИИ в Android умеет выполнять поручения

В 2024 году Google представила режим Gemini Live, который получил выгодные отличия от базового варианта помощника с искусственным интеллектом Gemini. Он предназначается не для обработки сложных текстовых вопросов, а для работы в формате свободного общения. Теперь Google решила обучить Gemini Live действовать.

 Источник изображения: blog.google

Источник изображения: blog.google

63 % пользователей Gemini разговаривают с ИИ-помощником вслух, подсчитали в Google, поэтому Gemini Live сделали не просто собеседником, а инструментом для решения задач. С очередным обновлением Gemini Live получил поддержку служб Personal Intelligence, Daily Brief, Gemini Spark, управления входящими сообщениями по голосовым командам и многое другое. Интеграция Spark позволяет запускать многоэтапные задачи по инструкциям простым языком, причём идеально формулировать мысли не требуется. В качестве примера приводится запрос: «Распланируй ужины на следующую неделю. Вегетарианские и с высоким содержанием белка. Обязательно используй рецепт, который я недавно сохранил, и составь список всех необходимых ингредиентов», — в ответ на него ИИ добавит в «Google Документы» полноценный план питания и список покупок.

В Gemini Live можно получить «Ежедневный обзор» (Daily Brief) — организованный и персонализированный список приоритетов на каждый день. Можно попросить Gemini зачитать план на день в разговорной форме, и он извлечёт нужную информацию из Gmail, «Google Календаря» и других источников, а затем предоставит информацию в устной форме, избавив пользователя от необходимости читать это самостоятельно. Поддерживается широкий спектр функций при работе с Gmail: можно поинтересоваться, есть ли новые письма, срочные сообщения от конкретного отправителя или по определённой теме; можно попросить составить сводку, отправить письма в архив или пометить их — и всё с помощью голосовых команд.

Наконец, Gemini Live получил поддержку службы Personal Intelligence. ИИ-помощник будет запоминать всё, о чём говорил пользователь; он свяжет разрозненные данные и использует контекст из других сервисов Google, включая веб-поиск, Gmail, YouTube и «Фото». Функции Daily Brief доступны для обладателей подписки Google AI Plus и выше, а для работы со Spark потребуется подписка не ниже Google AI Pro.


window-new
Soft
Hard
Тренды 🔥
Microsoft готовит Windows и Surface к чипам Nvidia — подробности раскроют 7 октября 3 мин.
ИИ научился притворяться человеком в видеозвонках — модель Griffin прошла «видеотест Тьюринга» 3 ч.
OpenAI покинул глава команды безопасности — он сомневался, что компания успевает за собственным ИИ 3 ч.
Gemini 4 хороша в тестах, но буксует в работе — пожаловались сотрудники Google 7 ч.
Apple ужесточит контроль над «полным доступом к диску» в macOS из-за рисков, связанных с ИИ-агентами 10 ч.
Уязвимость в приложении ChatGPT для macOS позволяла хакерам получить доступ к конфиденциальным данным 12 ч.
Новая статья: Silent Hill: Townfall — бутафорский туман. Рецензия 17 ч.
Новая студия сооснователя Rockstar делает комедийную игру в открытом мире и не будет оглядываться на GTA VI 18 ч.
Сооснователь студии-разработчика Kingdom Come: Deliverance выразил надежду, что GTA VI «проложит путь» к играм за $80 20 ч.
Баскетбольный клуб «Майами Хит» на одну игру станет «Вайс-Сити» в рамках «исторического партнёрства» с разработчиками GTA VI 22 ч.
Чиповый мегапроект Маска стоимостью $119 млрд может получить поддержку TSMC 4 ч.
Samsung запустила серийное производство чипов Exynos 2700, но решение по Galaxy S27 Ultra ещё не принято 4 ч.
Американские iPhone 18 Pro Max теряют связь — обновление не поможет, Apple будет менять смартфоны 6 ч.
Meta предложила всем желающим создавать собственные гаджеты с ИИ-агентом Muse 9 ч.
Роботы лишь через 40 лет смогут конкурировать с людьми всего за 10 % рабочих мест в США 9 ч.
Lian Li выпустила L-образные блоки питания Edge Platinum V2 и Edge Gold V2 мощностью до 1350 Вт, а также концентраторы Edge Hub 10 ч.
QNAP представила управляемые 10GbE-коммутаторы QSW-M5218 с портами 25GbE SFP28 15 ч.
Легендарный Kingpin вернётся к экстремальному разгону — оверклокер намекнул на совместный проект с Asus 18 ч.
Дурной пример заразителен: Google начала поднимать цены на смартфоны вслед за Samsung 18 ч.
Tencent арендовала 100 тыс. чипов у Oracle чтобы ускорить развитие своих ИИ-систем 20 ч.