Retell ha incorporado GPT Realtime 2.1 a su agent builder y Google mantiene Gemini 3.1 Flash Live en preview con un precio muy bajo. Esta es una comparativa con números de latencia, control y coste, y con lo que he aprendido pasando parte de mis clientes de Retell a Atendy.
Resumen en cinco puntos
- La noticia. En su changelog del 24 de agosto de 2026, Retell anuncia que GPT-5.6 y GPT Realtime 2.1 están disponibles en el agent builder. GPT Realtime 2.1 es un modelo speech-to-speech de OpenAI lanzado el 9 de julio de 2026.
- Latencia. El speech-to-speech gana en tiempo hasta el primer audio y en interrupciones. Pero una cascada bien orquestada (streaming en STT, LLM y TTS) queda más cerca de lo que suele decirse, y Retell ya la tiene muy afinada.
- Control. La cascada sigue ganando cuando hay guion regulado, verificación de datos, muchas funciones con esquemas estrictos y necesidad de auditar texto. El texto intermedio es la herramienta de control, no un peaje.
- Coste. En la página pública de Retell, GPT Realtime cuesta 0,345 $/min y GPT Realtime mini 0,07 $/min; una cascada con GPT-4.1 y voces de plataforma se queda en unos 0,115 $/min. Gemini 3.1 Flash Live en preview cuesta 0,005 $/min de audio de entrada y 0,018 $/min de audio de salida.
- Veredicto. Realtime para recepción, dudas y conversaciones cortas con pocas herramientas. Cascada para recobro, verificación, sanidad y cualquier flujo con guion. Y para quien pueda construir su propia integración, Gemini Live cambia la ecuación del coste.
Qué ha cambiado en Retell
El changelog de Retell del 24 de agosto de 2026 viene cargado: Retell Workflows (biblioteca de integraciones, tool store y funciones preconfiguradas), arreglos en transferencias y detección de call screening en iOS y Android, y tres líneas que interesan directamente a quien construye agentes en español:
- GPT-5.6 y GPT Realtime 2.1 disponibles en el agent builder, con el segundo descrito como la opción de baja latencia.
- Transcripción en español con Soniox en todas las llamadas.
- Corrección de un fallo por el que un agente podía disparar la misma función dos veces en una respuesta (por ejemplo, confirmar dos veces una reserva).
El primer punto es el que abre este artículo. Retell lleva ofreciendo modelos realtime de OpenAI desde octubre de 2024, cuando integró la Realtime API a 1,50 $/min y con una latencia media que ellos mismos cifraban en 600–1.000 ms. Desde entonces el precio bajó a 0,50 $/min en diciembre de 2024, apareció la versión mini, y en febrero de 2026 los agentes con gpt-4o-realtime se migraron automáticamente a gpt-realtime. Lo nuevo es que ahora el modelo disponible es de la generación 2.x, que incorpora razonamiento configurable.
Qué es GPT Realtime 2.1
OpenAI publicó GPT Realtime 2.1 el 9 de julio de 2026 como actualización de GPT Realtime 2 (mayo de 2026). Según la ficha oficial del modelo, mejora tres cosas que importan mucho en telefonía: el reconocimiento de cadenas alfanuméricas (números de pedido, teléfonos, códigos), el manejo de silencios y ruido, y el comportamiento ante interrupciones. Mantiene el diseño speech-to-speech, admite llamadas a funciones en mitad de la conversación, y permite fijar el esfuerzo de razonamiento: más razonamiento eleva la calidad en turnos complejos a cambio de latencia y tokens de salida.
Con la misma versión, OpenAI redujo la latencia p95 de sus modelos realtime al menos un 25 %, atribuyéndolo a mejoras de caché y no a cambios en el tamaño del modelo. La ventana de contexto es de 128K tokens y admite entrada de texto, audio e imagen.
Precios de OpenAI por millón de tokens (API directa): 32 $ de audio de entrada y 64 $ de audio de salida para GPT Realtime 2.1; 10 $ y 20 $ para la versión mini; 4 $ y 24 $ para texto. Las tarifas de audio se mantienen respecto a la generación anterior; el texto de salida subió de 16 $ a 24 $ porque ahora incluye tokens de razonamiento.
Precio en Retell. A fecha de este artículo, la página pública de precios de Retell lista GPT Realtime 1.5 y GPT Realtime a 0,345 $/min y GPT Realtime mini a 0,07 $/min como motores speech-to-speech, pero todavía no muestra una línea para GPT Realtime 2.1. Compruébalo en el dashboard antes de hacer cuentas; en la sección de coste asumo la tarifa de Realtime como referencia y lo marco como estimación.
Las dos arquitecturas
Conviene aclarar el vocabulario, porque «speech-to-speech» se usa para describir dos cosas distintas.
Cascada (STT → LLM → TTS). Tres modelos encadenados: un reconocedor convierte la voz en texto, un LLM genera la respuesta en texto, y un sintetizador la convierte en voz. Es lo que hace Retell cuando eliges GPT-4.1, GPT-5.4, Claude o Gemini Flash como modelo. El texto existe en cada etapa: se puede registrar, redactar, validar y auditar.
Speech-to-speech (S2S). Un solo modelo recibe audio y produce audio. Dentro de esta familia hay dos variantes. La «semicascada» (half-cascade) procesa el audio de entrada de forma nativa, razona internamente en tokens de texto y sintetiza la salida dentro del propio modelo; es la aproximación que siguen OpenAI y Google en sus APIs comerciales. El audio nativo puro, que razona directamente en el espacio acústico sin ningún texto intermedio, sigue siendo sobre todo terreno de investigación y proyectos abiertos como Moshi.
Esta distinción explica casi todo lo que viene después. Las ventajas del S2S (menos latencia, más matiz acústico, interrupciones más naturales) y sus costes (menos observabilidad, menos opciones de proveedor, precio por token de audio) salen del mismo hecho: el texto ya no está en medio.
Latencia con cifras
La latencia que importa en una llamada es el tiempo entre el final del habla del usuario y el inicio del audio del agente. Una cascada la acumula por etapas: según el desglose que publica FutureAGI, el primer parcial del STT llega en 100–300 ms, el primer token del LLM en 200–600 ms, el primer audio del TTS en 75–300 ms, y a eso se suma red y orquestación. Gradium cifra la latencia práctica de una cascada en producción entre 1,5 y 3 segundos si no se optimiza cada tramo.
Retell, que ha construido su negocio sobre esa optimización, anuncia unos 600 ms de latencia de plataforma y en su benchmark público muestra ejemplos con P50 de 0,58 s y P90 de 1,34 s. En ese mismo benchmark, la latencia atribuida a GPT-4.1 es de 1.055 ms, frente a 1.338 ms de GPT-5.4 y 1.989 ms de GPT-5.5 Medium. Es decir: en cascada, el modelo que eliges mueve más la latencia que la propia arquitectura.
Del lado del S2S, Speko mide una reducción del 85 % frente a cascadas sin streaming, y OpenAI habla de p95 un 25 % más bajo en la generación 2.1. Pero Inworld matiza algo que coincide con lo que veo en mis llamadas: una cascada bien diseñada, con TTS que emite el primer audio en 100–250 ms, puede batir a algunos modelos end-to-end en latencia voz-a-voz. Ninguna de las dos arquitecturas es categóricamente más rápida.
Dos consecuencias prácticas. Primera: si tu problema es que el agente tarda 1,5 segundos en responder, antes de cambiar de arquitectura revisa el modelo (GPT-5.6 Luna sale a 1.286 ms en el benchmark de Retell y GPT-4.1 a 1.055 ms), la longitud del prompt y el TTS. Segunda: donde el S2S marca de verdad la diferencia no es en la media, sino en la cola y en las interrupciones. Un usuario que corta al agente a mitad de frase y espera que retome de forma natural nota la diferencia entre 400 y 900 ms mucho más que en un turno normal.
Control del guion y verificación de datos
Aquí es donde la cascada mantiene la ventaja, y no por inercia. Cuando un agente de recobro tiene que leer una deuda exacta, pedir un DNI y validar la letra de control, o cuando una clínica necesita que cierta advertencia se diga siempre con las mismas palabras, el texto intermedio es la herramienta que lo hace posible.
En Retell esto se traduce en piezas concretas del Conversation Flow: nodos con prompts acotados, transiciones por ecuación sobre variables extraídas en tiempo real, Code Nodes que validan formato antes de avanzar, captura de dígitos por DTMF cuando el reconocimiento de números falla, guardrails de seguridad, redacción de PII en transcripciones y grabaciones, y post-call analysis con campos tipados. Todo eso opera sobre texto. En un modelo S2S puedes definir funciones y dar instrucciones, pero no interceptar lo que el modelo va a decir antes de que lo diga.
La literatura técnica de 2026 coincide con bastante claridad. Deepgram sitúa la cascada como opción por defecto en producción porque ofrece fronteras de texto para depurar, trazas de auditoría y sustitución de componentes. AssemblyAI es más tajante y considera que, en 2026, la cascada es la respuesta para todo lo que se pone delante de clientes. FutureAGI propone una regla útil: con cinco o más herramientas y esquemas estrictos (reservas, pagos, admisión sanitaria, formularios), cascada; con una a tres herramientas y validación laxa (búsqueda, consulta de estado), el S2S funciona bien.
| Capacidad | Cascada en Retell | GPT Realtime 2.1 en Retell | Gemini 3.1 Flash Live (integración propia) |
|---|---|---|---|
| Texto exacto de cada respuesta antes de emitirse | Sí | No (transcripción a posteriori) | No (transcripción opcional en la sesión) |
| Flujo por estados con prompts acotados | Conversation Flow | Prompt de sesión; nodos limitados | Lo construyes tú en el orquestador |
| Validación de datos antes de avanzar (DNI, IBAN, fechas) | Code Nodes, ecuaciones, DTMF | Función + reintento; mejor alfanumérico en 2.1 | Función + reintento; «precisión numérica» declarada |
| Muchas herramientas con esquemas estrictos | Punto fuerte | Aceptable; menos previsible con 5+ tools | Aceptable; sin salidas estructuradas en preview |
| Redacción de PII y guardrails | Add-ons nativos | Solo sobre transcripción y grabación | A implementar |
| Cambiar de proveedor por etapa | STT, LLM y TTS independientes | Todo OpenAI | Todo Google |
| Razonamiento configurable | Depende del modelo (GPT-5.x, Claude) | Sí, con coste de latencia | thinkingLevel minimal–high (default minimal) |
GPT Realtime 2.1 estrecha una parte de esta brecha: la mejora en alfanuméricos ataca justo el punto más doloroso del S2S en telefonía, que es leer y confirmar códigos. Y la propia guía de prompting de OpenAI para modelos realtime recomienda algo que en cascada llevamos años aplicando: empezar con un prompt mínimo, evaluar y añadir instrucciones solo para los fallos que aparezcan. Pero mejorar el reconocimiento de un código no es lo mismo que poder validarlo antes de seguir. Esa diferencia sigue existiendo.
Coste por minuto
La factura de un agente en Retell se compone de tres partidas: infraestructura de voz (0,055 $/min), voz sintetizada (0,015 $/min con voces de plataforma, Cartesia, MiniMax, Fish u OpenAI; 0,040 $/min con ElevenLabs) y modelo. A eso se suma telefonía si usas números de Retell (0,015 $/min) y los add-ons que actives. Con telefonía propia por SIP (Zadarma, Netelip) la partida de telefonía de Retell es cero.
Estos son los precios públicos que uso para las cuentas, tal y como aparecen en la página de precios de Retell y en las de OpenAI y Google a fecha de publicación.
| Componente | Precio publicado | Fuente |
|---|---|---|
| Retell Voice Infra | 0,055 $/min | retellai.com/pricing |
| TTS voces de plataforma / OpenAI / Cartesia / MiniMax / Fish | 0,015 $/min | retellai.com/pricing |
| TTS ElevenLabs | 0,040 $/min | retellai.com/pricing |
| GPT-4.1 (cascada) | 0,045 $/min | retellai.com/pricing |
| GPT-5.4 (cascada) | 0,080 $/min | retellai.com/pricing |
| GPT-5.6 Luna (cascada) | 0,0064 $/min | bench.retellai.com |
| GPT Realtime / Realtime 1.5 (S2S) | 0,345 $/min | retellai.com/pricing |
| GPT Realtime mini (S2S) | 0,070 $/min | retellai.com/pricing |
| GPT Realtime 2.1 (S2S) | sin publicar* | changelog 24/08/2026 |
| OpenAI API directa, gpt-realtime-2.1 audio | 32 $ / 64 $ por 1M tokens | developers.openai.com |
| OpenAI API directa, gpt-realtime-2.1-mini audio | 10 $ / 20 $ por 1M tokens | developers.openai.com |
| Gemini 3.1 Flash Live Preview, audio | 0,005 $/min entrada · 0,018 $/min salida | ai.google.dev/pricing |
* Estimación en las tablas siguientes: tarifa de GPT Realtime (0,345 $/min) como referencia hasta que Retell publique la línea de 2.1.
Cómo se convierte un precio por token en coste por minuto
Para las APIs directas hay que traducir tokens a minutos. En la Realtime API de OpenAI, un minuto de audio de entrada son aproximadamente 600 tokens y un minuto de voz generada unos 1.200; con las tarifas de 2.1 eso da unos 0,019 $ por minuto escuchado y 0,077 $ por minuto hablado. En una llamada donde el agente habla el 40 % del tiempo, el modelo sale a unos 0,05 $/min antes de caché; los análisis de Forasoft y Layer3 Labs sitúan el coste típico entre 0,06 y 0,11 $/min con el contexto creciendo a lo largo de la llamada, y entre 0,02 y 0,05 $/min con la versión mini.
Google factura el audio a 25 tokens por segundo y ya publica el equivalente por minuto: 0,005 $ de entrada y 0,018 $ de salida. Con el mismo 40 % de habla del agente, Gemini 3.1 Flash Live cuesta alrededor de 0,012 $/min de modelo. A eso hay que añadir telefonía SIP y la infraestructura que orquesta la sesión, que corre de tu cuenta.
| Configuración | Arquitectura | $/min modelo | $/min total estimado | Supuestos |
|---|---|---|---|---|
| Retell · GPT-5.6 Luna + voz de plataforma + SIP propio | cascada | 0,0064 | 0,076 | Infra 0,055 + TTS 0,015 |
| Retell · GPT-4.1 + voz de plataforma + SIP propio | cascada | 0,045 | 0,115 | Infra 0,055 + TTS 0,015 |
| Retell · GPT-4.1 + ElevenLabs + SIP propio | cascada | 0,045 | 0,140 | Infra 0,055 + TTS 0,040 |
| Retell · GPT Realtime mini + SIP propio | S2S | 0,070 | 0,125 | Infra 0,055; sin TTS |
| Retell · GPT Realtime 2.1 + SIP propio | S2S | 0,345* | 0,400* | Infra 0,055; tarifa Realtime como referencia |
| Integración propia · gpt-realtime-2.1 API | S2S | 0,06–0,11 | 0,09–0,15 | + SIP ~0,015 + orquestación ~0,02 |
| Integración propia · Gemini 3.1 Flash Live (Atendy) | S2S | ≈0,012 | 0,04–0,05 | + SIP ~0,015 + orquestación ~0,02; agente habla 40 % |
Tres lecturas. Primera: dentro de Retell, el salto a S2S con el modelo grande multiplica por tres o cuatro el coste por minuto frente a una cascada con GPT-4.1; con la versión mini la diferencia desaparece, pero también parte de la calidad. Segunda: el S2S no cobra TTS, y eso importa si usabas ElevenLabs. Tercera: la partida que más mueve la aguja no es la arquitectura, es el proveedor del modelo. Gemini 3.1 Flash Live en preview está en otro orden de magnitud, y es la razón por la que Atendy puede ofrecer minutos a precios que en Retell no me salen.
Preview significa preview. Google no ha anunciado fecha de disponibilidad general para Gemini 3.1 Flash Live; el identificador del modelo y el precio pueden cambiar en GA, y en el foro de desarrolladores hay equipos preguntando por la fecha de producción en Vertex AI. Quien construya sobre ese precio debe tener un plan B calculado, y en mi caso ese plan B es la cascada.
Calidad conversacional
Si el argumento de la cascada es el control, el del S2S es la conversación. Neil Zeghidour, uno de los autores de Moshi en Kyutai, lo resume diciendo que al pasar por el cuello de botella del texto se pierde la información paralingüística: tono, duda, frustración, ironía. Un modelo que escucha el audio directamente puede responder a un usuario enfadado antes de que diga que está enfadado.
Google apoya Gemini 3.1 Flash Live justo en eso: detección de matices acústicos como tono y ritmo, mejor filtrado de ruido de fondo (tráfico, televisión), y ajuste dinámico ante expresiones de frustración o confusión. En su anuncio citan feedback positivo de Verizon, LiveKit y The Home Depot. OpenAI, por su parte, ha centrado la 2.1 en interrupciones y silencios, que es donde más se notaban los fallos de las versiones anteriores.
Retell no se ha quedado quieta en cascada. En su semana de lanzamientos de junio de 2026 añadió el Colloquial Model, que reescribe la redacción del LLM en unos 50 ms para eliminar frases de manual, y el Expressive Mode, con etiquetas de emoción automáticas o manuales y escucha sensible al ritmo y pausas del llamante. Además de la velocidad de voz dinámica de marzo, que acompasa el ritmo del agente al del usuario. Son parches sobre una arquitectura que no oye el audio, pero parches bien hechos.
Mi lectura: en una recepción de llamadas, en una encuesta o en una primera cualificación, la fluidez del S2S se percibe y mejora la experiencia. En un recobro o en una verificación de identidad, el usuario no está valorando la prosodia; está valorando que el agente no se equivoque con su nombre, su importe o su fecha.
El caso del español
Casi toda la literatura comparativa está escrita pensando en inglés. En español la pregunta cambia un poco.
En cascada, el punto débil siempre ha sido el STT: números de teléfono leídos como fechas, DNI con letras confundidas, nombres compuestos. Que Retell haya pasado toda la transcripción en español a Soniox es una noticia grande para quien trabaja con este idioma, y la mejora se nota antes que cualquier cambio de modelo. Soniox ya figuraba como subprocesador desde junio; ahora es el motor por defecto para cada llamada en español.
En S2S el reconocimiento va dentro del modelo. GPT Realtime 2.1 declara mejoras en alfanuméricos y Gemini 3.1 Flash Live soporta más de 90 idiomas con detección automática. Ninguno de los dos te deja elegir un STT distinto si el español peninsular o el acento de un cliente en Latinoamérica no salen bien; te quedas con lo que hay. Y ninguno tiene voces en catalán comparables a lo que consigues en cascada con un TTS específico.
Si tu agente se despliega en España y hace llamadas comerciales salientes, hay además un factor externo que llega en octubre de 2026: la obligación de usar numeración con prefijo 400 para ese tipo de llamadas. Es independiente de la arquitectura, pero afecta al plan de despliegue de cualquier campaña outbound, sea con Retell o con integración propia.
Lo que dicen los expertos
He seleccionado posiciones publicadas en 2026 por empresas que viven de una arquitectura u otra, para que se vea dónde coinciden pese a tener intereses opuestos.
«For 2026, cascaded is the answer for anything you’re putting in production.» AssemblyAI, proveedor de STT, en su guía sobre agentes speech-to-speech (agosto de 2026)
La cascada es la opción segura porque da fronteras de texto para depurar, trazas de auditoría y piezas intercambiables. Deepgram, proveedor de STT y TTS, comparando arquitecturas (mayo de 2026)
Una cascada bien diseñada, con TTS que emite audio en 100–250 ms, puede batir a algunos modelos end-to-end en latencia voz-a-voz. Inworld AI, que vende una cascada configurable como Realtime API (julio de 2026)
Al pasar por el cuello de botella del texto se pierde la información paralingüística. Neil Zeghidour, Kyutai (Moshi), citado por Gradium (mayo de 2026)
Con 5+ herramientas y esquemas estrictos, cascada. Con 1–3 herramientas y validación laxa, el S2S funciona. FutureAGI, plataforma de evaluación de agentes de voz (mayo de 2026)
El patrón híbrido (S2S para saludo y conversación, cascada cuando hay que llamar a una herramienta) es al que convergen la mayoría de agentes en producción en 2026. Fora Soft, en su guía de despliegue con LiveKit (julio de 2026)
«OpenAI’s models strike the best balance of speed, reliability, and intelligence.» Retell AI, en el caso de estudio publicado por OpenAI sobre su plataforma
Lo que me parece más significativo es que quienes venden S2S (Google, OpenAI) hablan de naturalidad y latencia, y quienes venden cascada (AssemblyAI, Deepgram, Inworld) hablan de control y auditoría, y ninguno de los dos bandos niega la ventaja del otro. La conclusión de Coval, que evalúa agentes en producción, lo cierra: la adopción empresarial del S2S sigue limitada por control, depuración y cumplimiento normativo, no porque el S2S sea peor conversando.
Mi experiencia con Retell y Atendy
Llevo construyendo agentes telefónicos en Retell desde 2023. En ese tiempo he desplegado recobro, inmobiliaria, viajes, sanidad y despachos legales, casi siempre en cascada con GPT-4.1 y, más tarde, con los GPT-5.x cuando la latencia lo permitía. Retell ha sido, y sigue siendo, una plataforma muy buena para lo que hace: orquestar STT, LLM y TTS con fallbacks, simular llamadas antes de publicar, versionar agentes y darme observabilidad sobre cada turno.
Probé los modelos realtime de OpenAI desde que Retell los integró en 2024. Entonces eran caros (1,50 $/min) y poco fiables con funciones. Con cada versión han mejorado, y la 2.1 es la primera que pondría delante de un cliente en un caso de uso conversacional. Pero mi problema con el S2S en Retell nunca ha sido la calidad; ha sido el precio por minuto y la pérdida de las herramientas de control que uso a diario en el Conversation Flow.
Atendy nació de ahí. Es mi producto de agentes de voz, con clientes ya en producción, y funciona sobre Gemini 3.1 Flash Live a través de la Live API de Google, en preview desde marzo. Elegí ese modelo por dos razones: la conversación en español fluye de forma muy natural, y el coste de modelo por minuto está en otro orden de magnitud respecto a lo que pago en Retell por cualquier configuración. Eso me permite ofrecer un precio que en Retell no podría sostener con margen. La contrapartida es que la orquestación (telefonía SIP, sesiones, transcripción, funciones, reintentos, monitorización) la mantengo yo, y que estoy construyendo sobre un modelo en preview, con la incertidumbre de GA que ya he mencionado.
Estoy pasando a Atendy los clientes en los que el S2S aporta más y arriesga menos: recepción de llamadas, agenda de citas, información y primer filtro. Y mantengo en Retell, en cascada, lo que necesita guion, validación y auditoría: recobro, verificación de identidad y flujos regulados. No es una migración total ni creo que deba serlo. Es asignar cada caso a la arquitectura que lo resuelve mejor al precio que el cliente puede pagar.
Sobre GPT Realtime 2.1 en Retell, mi plan es el que describo más abajo: duplicar un agente de recepción, ponerle el nuevo modelo, mandarle un porcentaje del tráfico con A/B testing y comparar latencia, precisión de funciones y coste con la cascada equivalente. Si el precio que aparezca en el dashboard está cerca de la tarifa de Realtime actual, el resultado lo intuyo: gana en conversación, pierde en factura, y para ese caso de uso ya tengo una alternativa más barata en Atendy. Si Retell lo pone a un precio cercano al de la versión mini, la cosa cambia y habrá que volver a hacer las cuentas.
Matriz de decisión por caso de uso
Con todo lo anterior, esta es la recomendación que hago a mis propios clientes. No es una tabla de «mejor» y «peor»: es qué arquitectura resuelve cada problema con menos riesgo.
| Caso de uso | Recomendación | Por qué |
|---|---|---|
| Recepción de llamadas y desvío | S2S (Realtime 2.1 o Gemini Live) | Conversación corta, pocas herramientas, la naturalidad es el producto |
| Agenda de citas | S2S con función de calendario, o cascada si hay reglas de negocio complejas | 1–3 herramientas; validar fecha y hora con reintento |
| FAQ con base de conocimiento | cascada | Grounding medible (Retell puntúa GPT-4.1 en 91,4 %), KB por nodo, coste bajo |
| Recobro de deuda | cascada | Importes exactos, guion legal, DTMF, PII, auditoría |
| Verificación de identidad (DNI, fecha de nacimiento) | cascada | Validación en Code Node antes de avanzar; el S2S solo reconoce mejor, no valida |
| Cualificación de leads outbound | S2S para el diálogo, cascada para el registro en CRM | Patrón híbrido; en España, atención al prefijo 400 en octubre |
| Sanidad: triaje básico y recordatorios | cascada | Cumplimiento, redacción de PII, respuestas con texto fijado |
| Encuestas de satisfacción | S2S | Conversación breve, sin datos sensibles, latencia percibida |
| Multilingüe con cambio de idioma en llamada | S2S (Gemini Live, 90+ idiomas) o cascada multilingüe granular de Retell | Ambos lo resuelven; el S2S sin configurar STT por idioma |
| Volumen alto con margen ajustado | cascada con GPT-5.6 Luna, o Gemini Live en integración propia | 0,076 $/min en Retell frente a ~0,04 $/min con integración propia |
Cómo probarlo sin romper producción
Retell ya tiene todas las piezas para evaluar GPT Realtime 2.1 con datos propios y sin tocar el agente que atiende a tus clientes.
- Duplica el agente con Agent Versioning 2.0 y etiquétalo como staging. Cambia el modelo a GPT Realtime 2.1 en el response engine.
- Reescribe el prompt. OpenAI advierte de que los modelos realtime siguen instrucciones específicas con más fuerza que sus antecesores; un prompt heredado de la cascada suele sobrar. Empieza mínimo y añade reglas solo para lo que falle.
- Revisa la voz. Los modelos realtime solo admiten el conjunto de voces de OpenAI compatibles con speech-to-speech (Vapi documenta que ash, ballad, coral, fable, onyx y nova no lo son). Si tu marca usa una voz de ElevenLabs, ese cambio ya es una decisión de producto.
- Simula antes de llamar. Usa la simulación por lotes y, si tienes acceso a Conductor, los escenarios que fallaron en la cascada (reprogramar cita, hablar sobre el agente, número mal entendido).
- Reparte tráfico. Con A/B testing envía un 10–20 % de las llamadas al agente realtime y deja el resto en cascada.
- Mide cuatro cosas en el dashboard: latencia P50 y P90, tasa de acierto de funciones, tasa de transferencia a humano y coste por minuto real. Añade la puntuación de AI QA si el volumen lo justifica.
- Decide por caso de uso, no por agente. Si el realtime gana en recepción y pierde en verificación, sepáralos con Agent Transfer y que cada tramo use la arquitectura que le corresponde.
Lo que queda por resolver
- El precio de GPT Realtime 2.1 en Retell. Hasta que aparezca en la página de precios, cualquier comparación de coste es provisional.
- La disponibilidad general de Gemini 3.1 Flash Live. Sin GA no hay garantía de precio ni de identificador de modelo. Es el riesgo principal de Atendy y lo gestiono con una cascada de respaldo.
- El patrón híbrido en plataformas. Retell permite cambiar el LLM por nodo en Conversation Flow; queda por ver si eso se extiende a alternar S2S y cascada dentro de una misma llamada sin transferir de agente.
- La regulación. El prefijo 400 para llamadas comerciales en España y las obligaciones del Reglamento europeo de IA para sistemas que interactúan con personas afectan igual a las dos arquitecturas, pero la cascada facilita demostrar qué se dijo.
Veredicto
¿Merece la pena cambiar a GPT Realtime 2.1 en Retell? Para conversaciones cortas, con pocas herramientas y donde la fluidez es el valor, sí, siempre que el precio por minuto encaje en tu margen. Para flujos con guion, verificación o auditoría, no: la cascada con GPT-4.1 o GPT-5.6 sigue siendo más barata, más controlable y suficientemente rápida.
Y si puedes permitirte una integración propia, el modelo que hoy cambia las cuentas no es el de OpenAI sino Gemini 3.1 Flash Live, con la salvedad de que sigue en preview. Es la apuesta que he hecho con Atendy para los casos de uso conversacionales, manteniendo Retell para el resto.
Preguntas frecuentes
¿Qué es GPT Realtime 2.1 y qué cambia respecto a GPT-4.1 en Retell?
GPT Realtime 2.1 es un modelo speech-to-speech de OpenAI: recibe audio y genera audio sin pasar por texto. GPT-4.1 es un modelo de texto que en Retell trabaja en cascada con un STT y un TTS. El primero reduce latencia y mejora las interrupciones; el segundo da control total sobre el texto, los datos que se verifican y el coste.
¿Cuánto cuesta el speech-to-speech en Retell frente a la cascada?
Según la página pública de precios, GPT Realtime cuesta 0,345 $/min y GPT Realtime mini 0,07 $/min, más la infraestructura de voz (0,055 $/min). Una cascada con GPT-4.1 y voces de plataforma suma unos 0,115 $/min con telefonía propia. El precio de GPT Realtime 2.1 hay que comprobarlo en el dashboard.
¿Cuándo conviene usar un modelo realtime en un agente de voz?
Cuando la naturalidad de la conversación es el producto: recepción, dudas, cualificación ligera, conversaciones con muchas interrupciones y pocas herramientas. Con guion regulado, verificación de identidad, muchas funciones con esquemas estrictos o presupuesto ajustado, la cascada sigue siendo la opción más segura.
¿Es Gemini 3.1 Flash Live una alternativa a GPT Realtime 2.1?
Sí, en arquitectura. Es el modelo audio-a-audio de Google, en preview desde el 26 de marzo de 2026, con precio de 0,005 $/min de audio de entrada y 0,018 $/min de salida. No está en Retell; se usa a través de la Live API en una integración propia, como hacemos en Atendy.
¿Puedo probar GPT Realtime 2.1 sin tocar mi agente en producción?
Sí. Retell permite duplicar el agente, cambiar el modelo, ajustar la voz y repartir tráfico por porcentaje con A/B testing, midiendo latencia P50/P90, precisión de herramientas y coste por minuto antes de decidir.
¿El speech-to-speech genera transcripción?
Sí, pero con un modelo aparte y a posteriori. En OpenAI se activa la transcripción de entrada con un modelo adicional (gpt-realtime-whisper o gpt-4o-transcribe, con coste propio); en la Live API de Google se puede pedir transcripción de entrada y salida dentro de la sesión. En ningún caso tienes el texto antes de que el modelo hable.
Fuentes
- Retell AI, changelog «Retell Workflows, Brex top 25, and more» (24 de agosto de 2026): retellai.com/changelog
- Retell AI, página de precios (consultada el 2 de septiembre de 2026): retellai.com/pricing
- Retell AI, Model Benchmark: bench.retellai.com
- OpenAI, ficha del modelo GPT-Realtime-2.1: developers.openai.com
- OpenAI, guía de prompting para modelos realtime: developers.openai.com
- DataNorth, «OpenAI releases gpt-realtime-2.1 voice models» (julio de 2026): datanorth.ai
- Forasoft, «OpenAI Realtime API Pricing: The Real Cost Per Minute» (julio de 2026): forasoft.com
- Layer3 Labs, «OpenAI Realtime API Pricing 2026» (julio de 2026): layer3labs.io
- Google, «Gemini 3.1 Flash Live: Google’s latest AI audio model» (26 de marzo de 2026): blog.google
- Google, «Build real-time conversational agents with Gemini 3.1 Flash Live» (27 de marzo de 2026): blog.google
- Google AI for Developers, precios de la Gemini API: ai.google.dev
- Google AI for Developers, ficha de gemini-3.1-flash-live-preview: ai.google.dev
- AssemblyAI, «Speech-to-Speech Voice Agents: Cascaded vs End-to-End» (agosto de 2026): assemblyai.com
- Deepgram, «Speech-to-Speech vs Cascade: Voice Agent Architecture» (mayo de 2026): deepgram.com
- Inworld AI, «Cascaded vs Speech-to-Speech Voice Architecture» (julio de 2026): inworld.ai
- Gradium, «Cascaded Voice Agents vs Speech-to-Speech» (mayo de 2026): gradium.ai
- FutureAGI, «Cascaded Voice AI vs Speech-to-Speech: The 2026 Architecture Decision» (mayo de 2026): futureagi.com
- Speko, «Speech-to-Speech vs Cascaded Pipelines» (marzo de 2026): speko.ai
- Coval, «Speech-to-Speech vs Cascaded Voice AI» (enero de 2026): coval.ai
- Fora Soft, «Build and Deploy LiveKit AI Voice Agents: The 2026 Playbook» (julio de 2026): forasoft.com
- Softcery, «Real-Time vs Turn-Based Voice Agents 2026» (abril de 2026): softcery.com
- OpenAI, caso de estudio sobre Retell AI: openai.com
- Vapi, documentación de OpenAI Realtime (voces compatibles): docs.vapi.ai
