
Сегодня Google представила Gemini 3.5 Transcribe — свою «самую точную на сегодняшний день модель преобразования речи в текст», которая уже задействована в ряде фирменных продуктов компании.
В отличие от традиционных моделей распознавания речи, которые с трудом справляются с фоновым шумом, сложным жаргоном и очисткой речи от слов-паразитов, Gemini 3.5 Transcribe преобразует «сырое» аудио напрямую в точный, отредактированный и отформатированный текст.
Эта модель «создана для того, чтобы улавливать ваш естественный стиль речи, лучше понимать ваши намерения и распознавать пользовательский словарный запас». Как видно на примере Rambler, Gemini 3.5 Transcribe способна справляться с самоисправлениями («давай встретимся во вторник — нет, в среду»), удалять из финального результата междометия вроде «эм», «эх» и другие слова-паразиты, а также автоматически форматировать текст и обеспечивать естественное голосовое редактирование. Кроме того, Google выделяет следующие преимущества:
- Более точная транскрипция: По данным Artificial Analysis, модель демонстрирует среднюю частоту ошибок в словах (WER) на уровне 4,0% для потокового режима и 2,6% для сценариев без потоковой передачи. Она показывает отличные результаты в шумных реальных условиях, точно распознавая буквенно-цифровые объекты, такие как почтовые индексы и идентификаторы заказов.
- Пользовательский словарный запас: Распознает специализированный жаргон и уникальное написание слов, плавно адаптируя транскрипцию под предоставленный вами персональный словарь.
- Поддержка языков по всему миру: Автоматически определяет и расшифровывает более 85 языков, легко справляясь с региональными акцентами и разнообразными диалектами.
- Идентификация нескольких спикеров: Точно распределяет речь в предварительно записанном аудио с указанием временных меток для трех спикеров (поддержка трех и более спикеров находится в экспериментальном режиме).
С точки зрения производительности Gemini 3.5 Transcribe предлагает то, что в Google называют «серьезным прорывом» в возможностях, улучшенными показателями частоты ошибок в словах и значительно меньшей задержкой по сравнению с моделью транскрипции Chirp 3 образца 2025 года.
По данным Artificial Analysis, время получения итоговой расшифровки, например, сократилось на 70%. В бенчмарке FLEURS для набора основных языков и локаций модель обеспечивает высокую точность многоязычной обработки, превосходя Chirp 3 и достигая WER 5,50% в потоковом режиме и 5,04% WER в сценариях без потоковой передачи.
Еще одна задача — позволить вам «выполнять задачи с помощью голоса». Вызов функций (function calling) позволяет Gemini 3.5 Transcribe «делегировать сложные задачи (такие как генерация изображений и анализ файлов) другим моделям Gemini». Это можно увидеть на примере функции Speak to Window в приложении Gemini для macOS.
Помимо приложения Gemini для macOS и Gboard Rambler на Android, Gemini 3.5 Transcribe доступна в Google Antigravity, где она «объединяет контекст экрана и историю чата (с вашего разрешения), чтобы обеспечить высочайшую точность транскрипции в именах файлов, мыслях агента и активных документах».
Вскоре модель появится в браузере Chrome, что позволит вам «надиктовывать текст в любом поле на веб-страницах, упрощая отправку ответов, создание черновиков или отправку запросов Gemini в Chrome более естественным и простым голосовым способом».
Gemini 3.5 Transcribe доступна:
- Для разработчиков в рамках публичного превью в Gemini API через Google AI Studio и Google Antigravity.
- Для корпоративных клиентов в рамках публичного превью через Gemini Enterprise Agent Platform, а вскоре появится и в Gemini Enterprise for Customer Experience
