Сегодня 09 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

SpaceXAI удвоила точность распознавания речи в новой модели Grok Voice Transcribe 2.0

SpaceXAI выпустила новую модель Grok Voice Transcribe 2.0 для преобразования речи в текст. По заявлению разработчиков, она допускает вдвое меньше ошибок, чем предыдущая версия, при той же стоимости. Модель ориентирована на сложные записи, включая телефонные разговоры с помехами, одновременную речь нескольких людей, а также региональные акценты и диалекты.

 Источник изображения: Grok

Источник изображения: Grok

Grok Voice Transcribe 2.0, как сообщает MarkTechPost, построена на базе аудиомодели, которая используется в Grok Voice. Технология уже ежедневно обрабатывает десятки тысяч звонков в службы поддержки, расшифровывает миллионы часов видеоматериалов и применяется в голосовом ассистенте автомобилей Tesla. Для обучения использовались многоязычные записи с шумами и помехами, после чего модель дополнительно дорабатывалась методами постобучения.

В публичном рейтинге Artificial Analysis модель Grok Voice Transcribe 2.0 заняла первое место среди 32 потоковых моделей по показателю AA-WER Streaming. Компания также протестировала её на четырёх внутренних наборах данных: телефонных разговорах; диалогах с Grok; произнесённых номерах телефонов, обычных и электронных адресах; коротких фразах для голосовых ассистентов на 19 языках. Во всех четырёх случаях версия 2.0 показала лучшие результаты, чем версия 1.0, однако внутренние данные предоставлены самой SpaceXAI и независимо не подтверждались.

Одним из главных улучшений разработчики называют многоязычное распознавание. Модель автоматически определяет язык, поддерживает десятки языков и способна продолжать расшифровку при смене языка непосредственно во время разговора. На наборе коротких фраз показатель WER, отражающий долю ошибок при распознавании слов, снизился с 20,6 до 6,8 %, то есть примерно на 67 %. Документация также указывает на поддержку автоматического форматирования чисел, денежных сумм и единиц измерения для 25 языков.

Модель доступна через Speech to Text API в пакетном и потоковом режимах. В потоковом режиме поддерживается аудиокодек Opus с потоком данных около 4 Кбайт/с. Для сравнения: несжатый звук в формате PCM с частотой дискретизации 24 кГц требует около 48 Кбайт/с. API поддерживает временные метки и оценки уверенности распознавания каждого слова, разделение речи разных собеседников без дополнительной платы, до восьми аудиоканалов и возможность задать до 100 ключевых терминов. Также предусмотрены автоматическое форматирование чисел и дат, удаление слов-паразитов и определение момента окончания реплики для голосовых ассистентов.

В пакетном режиме можно загружать файлы размером до 500 Мбайт в 12 аудиоформатах, а потоковое распознавание осуществляется через WebSocket. В API модель имеет идентификатор grok-voice-transcribe-2.0. Пакетная расшифровка стоит $0,10 за час аудио, потоковая — $0,20 за час.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Продюсер Konami рассказал о планах на продолжение Silent Hill 2 ч.
ИИ-агенты ошибаются опаснее чат-ботов — они сливают личные данные и совершают покупки без разрешения 2 ч.
Представлена операционная система KvadraOS Desktop для корпоративных рабочих мест 3 ч.
Ubisoft закроет серверы Rainbow Six Mobile — мобильный шутер не продержится и года 4 ч.
Anthropic прокачала Claude — теперь он визуализирует данные и создаёт анимацию прямо в чате 5 ч.
Суровая средневековая стратегия Stronghold 4 получила дату выхода в раннем доступе Steam и новую демоверсию 6 ч.
Продажи EA Sports FC 27 превысили $714 млн — футбольный симулятор возглавил топ игровых бестселлеров 2026 года 6 ч.
Беспилотник повредил второй дата-центр «Яндекса» подряд — на этот раз в Калуге 6 ч.
«От меня не скроешься»: в Steam вышла демоверсия кафкианского immersive sim о побеге от милиционера-великана Militsioner 7 ч.
Хакеры придумали «вредоносную поэзию» — стихи на GitHub помогают управлять вирусом и заражать новые компьютеры 7 ч.