Las 30 voces de Gemini en español: escúchalas todas (y qué cambia de verdad en 3.8)
Google tiene 30 voces prediseñadas para sus modelos de voz. Aquí las tienes todas sonando en castellano, una a una, y una guía honesta de qué sabemos —y qué no— del nuevo Gemini 3.8 Live frente al 3.1, sobre todo para atención telefónica.
Si montas agentes de voz, la elección de la voz no es un detalle estético: es lo primero que oye quien llama. Google ofrece las mismas 30 voces para su familia de modelos (tanto el TTS como el Live en tiempo real), pero su documentación solo da una palabra de carácter por voz y ni una muestra en castellano. Así que las he generado yo. Dale al play y elige con el oído, no con una etiqueta.
Escucha las 30 voces en castellano
Todas dicen la misma frase, generada con el modelo Gemini 3.8 Flash TTS en español de España, para que puedas compararlas en igualdad de condiciones. El nombre es el que usas en la API; la palabra es el carácter que les da Google.
Google no etiqueta las voces por género ni por idioma, solo da una palabra de carácter en inglés. La separación en femeninas y masculinas y la agrupación por carácter son orientaciones mías: el género lo he estimado midiendo el tono medio (frecuencia fundamental) de cada muestra, no es una etiqueta oficial, así que tómalo como guía. Frase de muestra: «¡Hola! Soy una voz de inteligencia artificial, pero prometo no sonar como un contestador de los aburridos…»
Lo más importante antes de seguir
El dato que no vas a encontrar en los artículos en inglés: para castellano de España (es-ES) no existe ningún benchmark ni valoración de calidad, ni de Google ni de terceros, que compare el 3.8 con el 3.1. Todo lo «oficial» sobre español se refiere a español de México. Por eso aquí verás las voces para que juzgues tú, y los datos los separo por nivel de evidencia.
Para que sepas de dónde sale cada afirmación, uso estas etiquetas a lo largo del artículo:
- Verificado confirmado en documentación o anuncios oficiales de Google.
- Foro reportado por usuarios en el foro oficial de desarrolladores de Google (no es postura de Google).
- Terceros medios o blogs externos; tómalo como orientativo.
- Sin datos no he encontrado fuente fiable; lo digo en vez de inventarlo.
Qué es Gemini 3.8 Live (y por qué te suena de repente)
Verificado Gemini 3.8 Live (ID de modelo gemini-3.8-live) es el modelo de voz en tiempo real —speech-to-speech, conversación hablada— que Google anunció el 15 de septiembre de 2026 y puso disponible de forma general (GA) para desarrolladores en la Gemini API y en AI Studio. Google lo describe como la opción por defecto para experiencias de voz de baja latencia. Tiene un hermano, 3.8 Live Extended Thinking, que «razona mientras habla» para flujos más complejos.
Verificado Sustituye al anterior gemini-3.1-flash-live-preview y cuesta lo mismo: 0,005 $/min de audio de entrada y 0,018 $/min de salida. Si tu agente empezó a sonar distinto sin que tú tocaras nada, probablemente es porque el 3.8 pasó a ser el modelo por defecto.
Ojo: TTS y Live no son lo mismo
Hay dos familias que comparten las 30 voces pero son productos distintos. El TTS (texto → audio, p. ej. gemini-3.8-flash-tts) convierte un texto en una locución; es con el que he generado las muestras de arriba. El Live (gemini-3.8-live) es conversación hablada en tiempo real: es el que usarías en un agente telefónico. Muchos titulares de «la voz más expresiva» son del TTS, no del Live. No los mezcles.
Qué cambia de verdad del 3.1 al 3.8
Verificado en la documentación del modelo, los cambios de comportamiento más relevantes —y que afectan directamente a un agente de atención— son:
- Function calling asíncrono por defecto. Antes, una consulta a una herramienta (tu CRM, tu agenda) bloqueaba la conversación; ahora no. Es, probablemente, la mejora más útil para telefonía: menos silencios incómodos mientras el agente «consulta».
- Se elimina el «affective dialogue» de la API. Esa capa que modulaba el tono según la emoción detectada ya no está. Para un agente de atención, esto importa más que cualquier titular de «suena mejor».
proactive_audiosiempre activado (ponerlo enfalseda error) ythinking_levelno soportado en el 3.8 Live base.
Fíjate en una cosa: la documentación oficial no promete mejoras concretas de expresividad, pausas o entonación frente al 3.1. Eso viene de otras fuentes, y ahí hay que tener cuidado.
¿Suena mejor el 3.8? Depende de a quién le preguntes
Verificado Google presume de que el 3.8 Live Extended Thinking lidera el índice de calidad speech-to-speech de Artificial Analysis. Pero hay dos matices que casi nadie cuenta: ese número es del Extended Thinking (no del 3.8 base), y Google no publica ninguna comparación numérica directa contra el 3.1.
Verificado Y un detalle revelador del propio Google: aunque el 3.8 Live gana en calidad medida, queda segundo en preferencia de usuarios (el Speech Agent Arena). Traducido: «mejor en los test» no es lo mismo que «la gente lo prefiere». Encaja con la sensación de que, en la práctica —y más en castellano—, puede no notarse mejor.
Terceros Hay comparativas con cifras llamativas (latencia que baja de 450–800 ms a 180–250 ms, errores de transcripción en telefonía del 6,2 % al 3,5 %, más llamadas simultáneas…), pero vienen de blogs que no explican su metodología, a veces mezclan el TTS con el Live, y ni siquiera coinciden entre ellos en el valor del 3.1. Úsalas como orientación, no como dato firme. Sin datos ninguna de esas pruebas está hecha en castellano.
El tema del acento y el idioma (lo que sí vas a notar)
Foro En el foro oficial de desarrolladores de Google, varios usuarios reportan dos problemas del 3.8 Live que tienen que ver justo con cómo habla:
- 23 de septiembre de 2026: el 3.1 seguía la instrucción de hablar con acento británico casi siempre; el 3.8 la ignora y mantiene acento americano por mucho que cambies el prompt. Alguien del equipo de Google respondió el 1 de octubre pidiendo más datos por privado, pero a día de hoy no hay solución publicada.
- 27 de septiembre de 2026: al fijar el
language_codeen el 3.8, el audio «deriva» y el modelo acaba hablando en el idioma objetivo aunque el texto sea correcto; y las instrucciones de acento del system prompt se ignoran (vuelve a una fonética americana estándar). Varios desarrolladores dicen haber vuelto al 3.1 o al 2.5.
Qué significa esto para tu agente en castellano
Que el control fino de acento e idioma en el 3.8 Live está, hoy, inestable. Si tu agente tiene que sonar en castellano de España, pruébalo en tu línea real antes de dar el salto, y no des por hecho que las instrucciones de acento del prompt se van a respetar. No es una posición oficial de Google: son reportes de la comunidad, pero son varios y coinciden.
Castellano: dónde está disponible y dónde no
Aquí hay una confusión habitual, porque «español» no se comporta igual según por dónde entres:
- Verificado En TTS pregrabado (Cloud Text-to-Speech / Gemini-TTS): el castellano de España es-ES está disponible en GA. También es-419 (Latinoamérica) y es-MX (México), en preview. Es la vía que he usado para las muestras de arriba.
- Verificado En el Live API con audio nativo (tiempo real): los modelos eligen el idioma automáticamente y no dejan fijar el
language_code; el idioma se acota por instrucciones del sistema. - Foro Y un detalle importante: es-ES no está disponible para audio nativo del Live (da un error de «código de idioma no soportado»); el apaño habitual es usar es-US o dejar que el modelo lo detecte.
Resumiendo: para una locución grabada tienes castellano de España oficialmente; para un agente de voz en tiempo real, hoy vas por es-US o por prompt. De ahí ese «deje raro» que a veces se cuela cuando no acotas bien el idioma.
¿Y lo de que «suena robótica»?
Terceros Las quejas de voz «comprimida» o «robótica» que yo he encontrado son, en su mayoría, anteriores al 3.8: de marzo de 2026, referidas a la app de consumo de Gemini (no a la API) y a una actualización del 3.1 —una incluso la retiró su autor al ver mejoras a los pocos días. No he dado con quejas sólidas sobre el 3.8 Live de la API, pero eso no significa que no las haya: puede que tú, trabajando en castellano, hayas notado cosas que a mí se me escapan. Si es tu caso, cuéntamelo y lo añado.
Por qué suenan peor en tu agente que en estas muestras
Esta es, de hecho, la pregunta que me llevó a escribir el artículo: las muestras de arriba suenan de maravilla, pero luego las pones en un agente de voz y no suenan igual de bien. La buena noticia es que casi nunca es culpa de la voz. Es que estás comparando dos cosas distintas. Para que lo oigas tú, aquí tienes las mismas voces en tres situaciones:
● Muestra TTS = texto a voz, alta fidelidad (lo de arriba). ● Live 3.8 = agente de voz en tiempo real, misma voz, leyendo la misma frase. ● Por teléfono = ese mismo Live pasado por una línea de 8 kHz, como en una llamada real.
Nota: al Live 3.8 le he pedido el castellano por instrucciones del sistema, porque en tiempo real no se puede fijar es-ES por código; aquí funcionó (distingue la c/z), pero no siempre es estable en el 3.8.
Si las comparas, el salto se oye solo. Y estas son las razones, por orden de peso:
- No es el mismo modelo. Las muestras de arriba son
gemini-3.8-flash-tts(texto → voz): coge la frase entera, se toma su tiempo y pule la entonación. Tu agente usagemini-3.8-live(voz → voz en tiempo real): genera el audio sobre la marcha, reaccionando a quien habla, sin una segunda pasada para pulir. Misma voz, entrega distinta. - El teléfono recorta el audio. Una llamada va a 8 kHz (códec telefónico), frente a los 24 kHz de las muestras de la web. Se pierden los agudos y la voz suena más fina y metálica. Compara el reproductor morado con el naranja: es la misma grabación, solo cambia el «teléfono».
- El castellano no está en el audio nativo del Live. Las muestras son es-ES; el Live en tiempo real no admite es-ES (va por es-US o automático) y, con el 3.8, el acento puede derivar. De ahí ese «deje» que a veces se cuela.
- El prompt y los ajustes. En tiempo real, el ritmo, los silencios mientras consulta tus herramientas y el turn-taking moldean cómo suena. Dos agentes con la misma voz pueden sonar muy distintos; aquí sí tienes margen para mejorar.
¿Qué es el «affective dialog» y puedo activarlo?
Es una función del audio nativo del Live que hace que Gemini detecte el tono y la emoción de quien habla y adapte su manera de responder. La documentación oficial lo resume así: «lets Gemini adapt its response style to the input expression and tone». Ayuda a que el agente no suene plano.
Y sí, puedes activarlo —con un detalle curioso: no está disponible en el 3.1 Flash Live, pero sí en el 3.8 Live. Si tu agente va sobre 3.8, se enciende poniendo la API en v1beta y enable_affective_dialog: true (en JavaScript, enableAffectiveDialog) dentro del mensaje de setup. Es, probablemente, lo primero que probaría yo si el 3.8 te suena apagado.
Resumiendo: si el 3.8 te suena peor en castellano, prueba a activar el affective dialog, a volver al 3.1 Flash Live (varios desarrolladores lo han hecho por el tema del acento) y a elegir voces graves o cálidas, que aguantan mejor el recorte del teléfono. Y mide siempre con una llamada real, no con una demo de navegador.
La tabla completa de las 30 voces
Verificado en dos fuentes oficiales de Google (Gemini API y Firebase). La palabra de carácter es la que da Google, en inglés; la traducción es orientativa. Recuerda que la misma voz es multilingüe: sirve para cualquier idioma soportado.
| Voz (API) | Carácter (Google) | Orientación ES |
|---|---|---|
| Zephyr | Bright | brillante |
| Puck | Upbeat | animada |
| Charon | Informative | informativa |
| Kore | Firm | firme |
| Fenrir | Excitable | excitable |
| Leda | Youthful | juvenil |
| Orus | Firm | firme |
| Aoede | Breezy | desenfadada |
| Callirrhoe | Easy-going | relajada |
| Autonoe | Bright | brillante |
| Enceladus | Breathy | susurrante |
| Iapetus | Clear | clara |
| Umbriel | Easy-going | relajada |
| Algieba | Smooth | suave |
| Despina | Smooth | suave |
| Erinome | Clear | clara |
| Algenib | Gravelly | grave |
| Rasalgethi | Informative | informativa |
| Laomedeia | Upbeat | animada |
| Achernar | Soft | suave |
| Alnilam | Firm | firme |
| Schedar | Even | equilibrada |
| Gacrux | Mature | madura |
| Pulcherrima | Forward | directa |
| Achird | Friendly | cercana |
| Zubenelgenubi | Casual | informal |
| Vindemiatrix | Gentle | gentil |
| Sadachbia | Lively | vivaz |
| Sadaltager | Knowledgeable | experta |
| Sulafat | Warm | cálida |
Cómo elegir voz para atención telefónica
- Empieza por las cálidas y suaves. Para recepción y atención suelen funcionar mejor voces como Sulafat (cálida), Achernar (suave), Vindemiatrix (gentil), Aoede (desenfadada) o Algieba (suave). Pero escúchalas arriba: la que te encaje a ti manda.
- Prueba en tu línea real, no solo en el navegador. El teléfono comprime el audio (8 kHz) y lo que suena redondo en tu portátil puede cambiar bastante en una llamada.
- Acota el idioma con cuidado en tiempo real, sobre todo con el 3.8: fija el castellano por prompt y ve con ojo al acento, que ahora mismo es menos predecible.
- La misma voz, dos personalidades. El carácter lo pones tú con el prompt; la voz solo aporta el timbre. Dos agentes con la misma voz pueden sonar muy distintos.
Fuentes
Oficiales de Google
- Generación de voz (lista de voces): ai.google.dev/gemini-api/docs/speech-generation
- Voces en Firebase AI Logic: firebase.google.com/docs/ai-logic/generate-speech
- Modelo Gemini 3.8 Live: ai.google.dev/gemini-api/docs/models/gemini-3.8-live
- Anuncio 3.8 Live: blog.google — Gemini 3.8 Live
- Capacidades del Live API (idioma/voz): ai.google.dev/gemini-api/docs/live-api/capabilities
- Gemini-TTS en Cloud (idiomas es-ES): cloud.google.com/text-to-speech/docs/gemini-tts
Foro oficial de desarrolladores (reportes de usuarios)
- Acento británico 3.8 vs 3.1: discuss.ai.google.dev — 184558
- Bug de
language_code/ acento en 3.8: discuss.ai.google.dev — 185304 - es-ES no soportado en audio nativo: discuss.ai.google.dev — 114284
Terceros (orientativo)
- DataCamp — Gemini 3.8 Live: datacamp.com/blog/gemini-3-8-live
- 9to5Google — quejas de voz (marzo 2026, app): 9to5google.com
¿Montas agentes de voz y quieres acertar con la voz?
Enseño a construir agentes de voz con IA de principio a fin: de la primera llamada a un agente en producción. Si te atascas con el idioma, el acento o la elección de voz, hablemos.
Muestras de audio generadas el 2 de octubre de 2026 con gemini-3.8-flash-tts (es-ES), misma frase para las 30 voces. El timbre de cada voz es común a los modelos TTS y Live de Gemini; lo que cambia entre versiones es la entrega (prosodia, acento), no la identidad de la voz. Datos verificados a 2 de octubre de 2026; las versiones de modelo y los precios de Google pueden cambiar.



