Google представила обновлённую ИИ-модель Gemini 3.5 Transcribe, предназначенную для преобразования живой речи в текст. Технологию можно использовать как для диктовки сообщений в мессенджерах, так и для голосового взаимодействия с ИИ-ассистентом Gemini.
Одной из главных особенностей Gemini 3.5 Transcribe стала автоматическая обработка речи. Модель умеет быстро удалять слова-паразиты, лишние междометия и ошибочно произнесённые фразы. При этом система анализирует контекст и старается сохранить в итоговом тексте только актуальную информацию.

Например, если пользователь сначала предлагает встретиться в одном кафе, а через несколько секунд меняет решение и называет другое место, Gemini 3.5 Transcribe учитывает исправление и формирует сообщение уже с новым вариантом.
Кроме того, модель поддерживает перевод речи между разными языками в реальном времени и лучше распознаёт смысл сказанного благодаря более глубокому пониманию контекста.
По данным Google, в представленных компанией тестах Gemini 3.5 Transcribe смогла обойти ряд конкурирующих решений, включая ElevenLabs Scribe v2.
API Gemini 3.5 Transcribe уже доступен разработчикам для интеграции в сторонние сервисы и приложения. Протестировать модель также можно через Google AI Studio, клавиатуру Gboard на Android и приложение Gemini для macOS. Позднее Google планирует добавить поддержку технологии и в браузер Chrome.


