Google ha presentado un modelo actualizado para convertir voz en texto, Gemini 3.5 Transcribe. Con él se pueden dictar mensajes en aplicaciones de mensajería y también interactuar con el asistente de IA Gemini.
Google destaca tres características del nuevo modelo: la capacidad de eliminar rápidamente las muletillas, la posibilidad de traducir el habla en tiempo real a diferentes idiomas y una comprensión profunda del contexto de lo dicho.
Transcripción completa del mensaje frente a la versión resumida por el modelo de IA
En los ejemplos mostrados por la compañía se ve que Gemini 3.5 Transcribe «limpia» rápidamente el discurso de palabras innecesarias, como interjecciones superfluas, y también de réplicas completas dichas por error. Si el usuario propone a un amigo quedar en un café y luego cambia de opinión y sugiere otro lugar, el modelo se adapta al instante y deja solo la opción vigente en el mensaje final.
En todos los benchmarks mostrados por la compañía, Gemini 3.5 Transcribe ha obtenido mejores resultados que sus competidores, como ElevenLabs Scribe v2.
1
La API del nuevo modelo de IA ya está disponible para que los desarrolladores la integren en sus productos. También se puede probar Gemini 3.5 Transcribe en Google AI Studio, en el teclado Gboard para Android y en la aplicación Gemini para MacOS. En el futuro, el modelo se integrará en el navegador Chrome.