Сегодня 16 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google представила Gemini 3.5 Transcribe — ИИ превратит живую речь в готовый текст без слов-паразитов

Google представила модель Gemini 3.5 Transcribe с новыми возможностями расшифровки устной речи, поддержкой специальных терминов и более 85 языков. Новая модель появилась на фоне задержки выпуска флагманской Gemini 3.5 Pro.

 Источник изображения: blog.google

Источник изображения: blog.google

По словам Google, Gemini 3.5 Transcribe «представляет собой значительный шаг вперёд по сравнению с нашей предыдущей моделью расшифровки речи Chirp 3», особенно в отношении поддержки нескольких языков и снижения количества ошибок в распознанном тексте. Она позволяет пользователям «редактировать текст естественным образом, используя только свой голос», автоматически форматирует расшифровку и удаляет слова-паразиты.

Пользователи могут подключить к модели собственный словарь, благодаря которому Gemini 3.5 Transcribe будет учитывать специальную терминологию, имена собственные и нестандартное написание слов, избавляя человека от необходимости исправлять их вручную. При обработке записанного аудио модель умеет разделять реплики до трёх говорящих и расставлять временные метки для каждого слова.

Google также готовит модели Gemini 3.5 Live и 3.5 Live Experimental, которые должны расширить возможности технологий распознавания и обработки речи, лежащих в основе голосового чата Gemini. Первоначально компания сообщила журналистам, что обе модели выходят одновременно с Gemini 3.5 Transcribe. Однако после публикации материалов Google уточнила, что сейчас выпускается только Transcribe, а сроки появления Gemini 3.5 Live и 3.5 Live Experimental пока не определены. Ранее компания рассказывала, что Gemini 3.5 Live сможет лучше справляться с прерываниями в середине фразы, распознаванием языка и обработкой визуальных данных в реальном времени, а Live Experimental — комментировать ход выполнения сложных задач.

Gemini 3.5 Transcribe с поддержкой английского языка уже доступна пользователям приложения Gemini для macOS. Кроме того, новая функция голосового ввода Rambler появилась в Gboard для Android в некоторых странах и поддерживает несколько языков. Модель также доступна разработчикам в формате публичной предварительной версии через Gemini API в Google AI Studio и Antigravity. В ближайшее время поддержка Gemini 3.5 Transcribe должна появиться и в Chrome.

В число более чем 85 поддерживаемых языков входит и русский; модель также умеет автоматически определять язык и переключаться между несколькими языками в пределах одной записи.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Apple устранила рекордное число уязвимостей в iOS и других программных продуктах 8 мин.
The Rolling Stones, Трэвис Скотт, Future и многие другие: музыканты начали дразнить фанатов тизерами коллаборации с GTA VI 53 мин.
Cloudflare захлопнула дверь перед частью ИИ-ботов на миллионах сайтов 55 мин.
Google представила ИИ-модели Gemini 3.8 Live и Live Extended Thinking 56 мин.
Remedy не сомневается в успехе Control Resonant — раскрыта дата выхода первых обзоров 2 ч.
Фэнтезийный ролевой боевик Wo Long 2: Wings of Ember от создателей Nioh получил новый трейлер, дату выхода и временную демоверсию 3 ч.
Марк Цукерберг также высказался против централизованного замедления развития ИИ 4 ч.
OpenAI не боится замедления ИИ — финансовый директор заявила, что даже остановка разработок не навредит бизнесу 4 ч.
В октябре Microsoft проведёт мероприятие, посвящённое Windows и устройствам Surface 8 ч.
Вот это поворот: на покупку издателя «Мира танков» и «Мира кораблей» нацелился бывший российский гонщик «Формулы-1» 14 ч.
Intel не смогла запустить завод в Огайо, а теперь им заинтересовалась SK hynix — там хотят делать память 8 мин.
Создание «китайского Starlink» ускорилось — к запускам спутников подключилась частная компания 35 мин.
Meta вскоре может представить умные очки Luna, в которых нет камер 40 мин.
Открытие китайских учёных кратно ускорит производство водорода солнечным светом 2 ч.
Micron создала планку DDR5 объёмом полтерабайта 2 ч.
Тан бьёт тревогу: Intel не может удовлетворить даже половину спроса на CPU, а дефицит памяти сохранится до 2028 года 2 ч.
Дженсен Хуанг заявил, что проблему безопасности ИИ надо решать инженерными методами, а не политическими 5 ч.
Razer представила игровую гарнитуру Kraken V4 X Sensa HD Haptics Edition с тактильной обратной связью 6 ч.
Новый раунд финансирования оценит OpenAI в $1,2 трлн ещё до IPO 8 ч.
144-ядерные Arm-процессоры Fujitsu MONAKA станут доступны в ноябре 11 ч.