Google представляет Gemini 3.5 Transcribe: модель, которая уже используется в Gboard Rambler и скоро появится в Chrome

Сегодня Google представила Gemini 3.5 Transcribe — свою «самую точную на сегодняшний день модель преобразования речи в текст», которая уже задействована в ряде фирменных продуктов компании.

В отличие от традиционных моделей распознавания речи, которые с трудом справляются с фоновым шумом, сложным жаргоном и очисткой речи от слов-паразитов, Gemini 3.5 Transcribe преобразует «сырое» аудио напрямую в точный, отредактированный и отформатированный текст.

Эта модель «создана для того, чтобы улавливать ваш естественный стиль речи, лучше понимать ваши намерения и распознавать пользовательский словарный запас». Как видно на примере Rambler, Gemini 3.5 Transcribe способна справляться с самоисправлениями («давай встретимся во вторник — нет, в среду»), удалять из финального результата междометия вроде «эм», «эх» и другие слова-паразиты, а также автоматически форматировать текст и обеспечивать естественное голосовое редактирование. Кроме того, Google выделяет следующие преимущества:


  • Более точная транскрипция: По данным Artificial Analysis, модель демонстрирует среднюю частоту ошибок в словах (WER) на уровне 4,0% для потокового режима и 2,6% для сценариев без потоковой передачи. Она показывает отличные результаты в шумных реальных условиях, точно распознавая буквенно-цифровые объекты, такие как почтовые индексы и идентификаторы заказов.
  • Пользовательский словарный запас: Распознает специализированный жаргон и уникальное написание слов, плавно адаптируя транскрипцию под предоставленный вами персональный словарь.
  • Поддержка языков по всему миру: Автоматически определяет и расшифровывает более 85 языков, легко справляясь с региональными акцентами и разнообразными диалектами.
  • Идентификация нескольких спикеров: Точно распределяет речь в предварительно записанном аудио с указанием временных меток для трех спикеров (поддержка трех и более спикеров находится в экспериментальном режиме).

С точки зрения производительности Gemini 3.5 Transcribe предлагает то, что в Google называют «серьезным прорывом» в возможностях, улучшенными показателями частоты ошибок в словах и значительно меньшей задержкой по сравнению с моделью транскрипции Chirp 3 образца 2025 года.

По данным Artificial Analysis, время получения итоговой расшифровки, например, сократилось на 70%. В бенчмарке FLEURS для набора основных языков и локаций модель обеспечивает высокую точность многоязычной обработки, превосходя Chirp 3 и достигая WER 5,50% в потоковом режиме и 5,04% WER в сценариях без потоковой передачи.

Еще одна задача — позволить вам «выполнять задачи с помощью голоса». Вызов функций (function calling) позволяет Gemini 3.5 Transcribe «делегировать сложные задачи (такие как генерация изображений и анализ файлов) другим моделям Gemini». Это можно увидеть на примере функции Speak to Window в приложении Gemini для macOS.

Помимо приложения Gemini для macOS и Gboard Rambler на Android, Gemini 3.5 Transcribe доступна в Google Antigravity, где она «объединяет контекст экрана и историю чата (с вашего разрешения), чтобы обеспечить высочайшую точность транскрипции в именах файлов, мыслях агента и активных документах».

Вскоре модель появится в браузере Chrome, что позволит вам «надиктовывать текст в любом поле на веб-страницах, упрощая отправку ответов, создание черновиков или отправку запросов Gemini в Chrome более естественным и простым голосовым способом».

Gemini 3.5 Transcribe доступна: