Сегодня 05 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google научила Gemini 2.5 понимать и передавать эмоции в диалогах

На конференции Google I/O 2025 компания анонсировала новую версию своей мультимодальной модели Gemini 2.5, которая теперь поддерживает генерацию аудио и диалогов в реальном времени. Эти возможности доступны в предварительной версии для разработчиков через платформы Google AI Studio и Vertex AI.

 Источник изображения: Google

Источник изображения: Google

Gemini 2.5 Flash Preview обеспечивает реалистичное голосовое взаимодействие с ИИ, включая распознавание эмоциональной окраски речи, адаптацию интонации и акцента, а также возможность переключения между более чем 24 языками. Модель может игнорировать фоновые шумы и использовать внешние инструменты, такие как «Поиск», для получения актуальной информации во время диалога.

Дополнительно, Gemini 2.5 предлагает расширенные функции синтеза речи (TTS), позволяя управлять стилем, темпом и эмоциональной выразительностью озвучивания. Поддерживается генерация диалогов с несколькими голосами, что делает модель подходящей для создания подкастов, аудиокниг и других мультимедийных продуктов.

Для обеспечения прозрачности, все сгенерированные моделью аудио маркируются с помощью технологии SynthID, что позволяет идентифицировать контент, как сгенерированный ИИ. Разработчики могут опробовать новые функции через вкладки Stream и Generate Media в Google AI Studio.

Gemini 2.5 демонстрирует значительный шаг вперёд в области мультимодальных ИИ-систем, объединяя модальности текстов, изображений, аудио и видео в единую платформу. Новые функции открывают широкие перспективы для создания интерактивных приложений, виртуальных ассистентов и инноваций в сфере образования.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Вместо кешбэка и бесплатного Wi-Fi: в Китае начали повсюду раздавать ИИ-токены 2 ч.
Windows 11 будет сообщать приложениям возраст пользователя 6 ч.
В поглощении Hugging Face компанией Nvidia оказалось много символизма — возможно, неслучайного 6 ч.
Спамеры стали использовать ASCII-подмену символов — раньше так взламывали ИИ 7 ч.
Новая статья: Resonance: A Plague Tale Legacy — корабль, с которого сбежали крысы. Рецензия 19 ч.
Основателя Oracle вызвали в Конгресс — компания за восемь лет выполнила лишь десятую часть контракта для военных, а денег хочет почти втрое больше оговоренного 20 ч.
Crusoe заключила крупнейшую за свою историю облачную сделку с Jane Street — $13 млрд за 5 лет 20 ч.
Комедийный симулятор водителя автобуса Thank You Bus Driver от Double Fine отправит игроков раздавать пощёчины и принимать благодарности 21 ч.
С Gmail, Google Docs и Keep теперь можно разговаривать — Gemini научился понимать голосовые команды 22 ч.
ИИ-агент Meta во время тестов начал самовольничать — менял пароли и отправлял письма от имени пользователей 24 ч.
AMD анонсировала рабочую станцию Threadripper Halo Station с Instinct MI350P для ИИ-задач 3 ч.
ASUS анонсировала ИИ-серверы на чипах Intel Xeon 6 и AMD EPYC 9006 3 ч.
В 2027 году Apple выпустит умную камеру, которая записывает только нужные события 7 ч.
Бюджетные Galaxy A помогут Samsung нарастить поставки, пока конкуренты сокращают производство на фоне роста цен на память 7 ч.
Google, Oppo и Vivo вслед за Apple добавят два слоя стекла в складные дисплеи смартфонов 8 ч.
Apple усилила наём сотрудников в Китае — потребовались специалисты в области ИИ и не только 9 ч.
Samsung и Arm собираются разработать для OpenAI чип, который будет выпускаться по 2-нм технологии 10 ч.
GoPro пообещала сохранить преданность «вашему общему энтузиазму» 10 ч.
Разочарование инвесторов организацией дебюта Tesla Cybercab привело к снижению курса акций компании на 6 % 12 ч.
IPO компании Anthropic состоится не ранее середины октября 13 ч.