Сегодня 27 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google представила Gemini 3.5 Transcribe — ИИ превратит живую речь в готовый текст без слов-паразитов

Google представила модель Gemini 3.5 Transcribe с новыми возможностями расшифровки устной речи, поддержкой специальных терминов и более 85 языков. Новая модель появилась на фоне задержки выпуска флагманской Gemini 3.5 Pro.

 Источник изображения: blog.google

Источник изображения: blog.google

По словам Google, Gemini 3.5 Transcribe «представляет собой значительный шаг вперёд по сравнению с нашей предыдущей моделью расшифровки речи Chirp 3», особенно в отношении поддержки нескольких языков и снижения количества ошибок в распознанном тексте. Она позволяет пользователям «редактировать текст естественным образом, используя только свой голос», автоматически форматирует расшифровку и удаляет слова-паразиты.

Пользователи могут подключить к модели собственный словарь, благодаря которому Gemini 3.5 Transcribe будет учитывать специальную терминологию, имена собственные и нестандартное написание слов, избавляя человека от необходимости исправлять их вручную. При обработке записанного аудио модель умеет разделять реплики до трёх говорящих и расставлять временные метки для каждого слова.

Google также готовит модели Gemini 3.5 Live и 3.5 Live Experimental, которые должны расширить возможности технологий распознавания и обработки речи, лежащих в основе голосового чата Gemini. Первоначально компания сообщила журналистам, что обе модели выходят одновременно с Gemini 3.5 Transcribe. Однако после публикации материалов Google уточнила, что сейчас выпускается только Transcribe, а сроки появления Gemini 3.5 Live и 3.5 Live Experimental пока не определены. Ранее компания рассказывала, что Gemini 3.5 Live сможет лучше справляться с прерываниями в середине фразы, распознаванием языка и обработкой визуальных данных в реальном времени, а Live Experimental — комментировать ход выполнения сложных задач.

Gemini 3.5 Transcribe с поддержкой английского языка уже доступна пользователям приложения Gemini для macOS. Кроме того, новая функция голосового ввода Rambler появилась в Gboard для Android в некоторых странах и поддерживает несколько языков. Модель также доступна разработчикам в формате публичной предварительной версии через Gemini API в Google AI Studio и Antigravity. В ближайшее время поддержка Gemini 3.5 Transcribe должна появиться и в Chrome.

В число более чем 85 поддерживаемых языков входит и русский; модель также умеет автоматически определять язык и переключаться между несколькими языками в пределах одной записи.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Нет даже плана для плана»: Билл Гейтс предупредил о неготовности мира к эпохе ИИ 2 ч.
Devolver Digital анонсировала игру, которая выйдет в один день с GTA VI 2 ч.
Высший демон Хаоса, безостановочный экшен и музыка Мика Гордона: взрывной трейлер раскрыл дату выхода олдскульного шутера Warhammer 40,000: Boltgun 2 3 ч.
Ремастер культового приключения The Wolf Among Us не заставит себя долго ждать — дата выхода и трейлер режима «Нуар» 16 ч.
Ubisoft показала восемь минут геймплея ремейка «Героев Меча и Магии III» — фанаты заподозрили подвох 17 ч.
Владельцы Xbox получили возможность «оцифровки» физических копий игр со своих дисков 17 ч.
Nvidia выпустила драйвер с поддержкой Star Wars Zero Company, Resonance: A Plague Tale Legacy и Hell Let Loose: Vietnam 17 ч.
Meta ограничит подросткам соцсети двумя часами в день и отключит лайки — компания пошла на сделку с властями США 17 ч.
Alibaba выпустила экономичную ИИ-модель Qwen3.8-Flash на новой архитектуре 18 ч.
Первой игрой с поддержкой RTX Mega Geometry для ускорения трассировки сложной геометрии станет Gears of War: E-Day 18 ч.