Voz, vídeo y eventos9 min de lectura

Gemini Live Avatar: cuando el agente de voz también ocupa la pantalla

Google lleva a producción un agente que conversa con voz nativa, interpreta cámara y pantalla, ejecuta herramientas y genera un avatar sincronizado en vídeo. Para eventos y atención presencial, la interfaz deja de ser un chat y empieza a parecerse a un punto de servicio.

Google anunció el 24 de septiembre la disponibilidad general de Gemini 3.8 Live con Live Avatar en Gemini Enterprise. El sistema combina conversación voz a voz, comprensión visual, llamadas a herramientas y vídeo generado en tiempo real dentro de una única sesión bidireccional.

La novedad no consiste simplemente en animar una cara. El avatar puede seguir conversando mientras el agente consulta datos o ejecuta una operación en segundo plano. Esa continuidad permite diseñar experiencias más cercanas a una recepción, una demostración guiada o un puesto de información que a un chatbot tradicional.

01

La capa que faltaba era la presencia visual

Gemini 3.8 Live recibe audio a 16 kHz, imágenes o vídeo y texto. Puede responder con audio a 24 kHz y, al activar Live Avatar, con un flujo MP4 sincronizado a 24 fotogramas por segundo. El modelo adapta movimiento facial, labios y expresión a la voz generada sin depender de un motor externo de renderizado.

El sistema cambia automáticamente de idioma durante la conversación y Google declara compatibilidad con 97 lenguas. También puede analizar una cámara en directo o una pantalla compartida, de modo que una interacción puede combinar lo que la persona dice con lo que está mostrando.

Más que videollamada

La llamada a herramientas es asíncrona: el agente puede consultar una reserva, buscar una acreditación o recuperar información mientras mantiene la conversación activa.

02

Qué puede aportar en eventos y espacios físicos

En un congreso, feria o recinto, un avatar puede atender consultas de orientación, explicar una agenda, localizar una sala, recuperar datos de una inscripción o guiar una demostración. La entrada visual añade aplicaciones como leer una acreditación, interpretar una pantalla o acompañar paso a paso una incidencia técnica.

La conversación multilingüe abre además una vía para puntos de información que cambian de idioma sin trasladar a la persona entre menús o canales. En instalaciones audiovisuales, museos y showrooms, el mismo sistema puede adaptar el relato a las preguntas y ejecutar elementos de una experiencia conectada.

El valor no debería medirse por lo convincente que resulta el personaje, sino por la tarea completada: consultas resueltas, tiempo de espera, transferencias a personal, accesibilidad y recuperación ante interrupciones o ruido ambiental.

03

El avatar amplifica el problema de la confianza

Una interfaz con voz, mirada y expresiones puede producir una sensación de competencia superior a la capacidad real del sistema. La ficha de Google reconoce limitaciones propias de los modelos fundacionales, incluidas las alucinaciones, además de posibles ralentizaciones y tiempos de espera.

Por eso, la identidad artificial debe resultar evidente y la información importante necesita una fuente verificable. El avatar puede presentar opciones o explicar un proceso, pero las decisiones sensibles deberían conservar confirmaciones explícitas y una transferencia sencilla a una persona.

Google ofrece una biblioteca de personajes prediseñados. La creación de avatares personalizados requiere autorización empresarial y verificación, y las salidas de audio y vídeo incorporan la marca imperceptible SynthID. Son controles de procedencia útiles, aunque no sustituyen una comunicación clara al público.

04

Disponible para producción, pero no para conversaciones interminables

Live Avatar está disponible en Gemini Enterprise con endpoints en Estados Unidos y la Unión Europea. Google también ofrece capacidad reservada y controles empresariales. La variante Extended Thinking, destinada a razonamientos más complejos durante el diálogo, continúa en vista previa privada.

El límite más importante aparece en la propia ficha del modelo: el avatar admite unos pocos minutos de interacción continua, no sesiones de varias horas. Esto encaja con consultas, recepción o asistencia puntual, pero obliga a diseñar continuidad de sesión y alternativas para soporte prolongado.

El corte de conocimiento declarado es enero de 2025. Los datos actuales —agenda, inventario, acreditaciones, mapas o estado de una incidencia— deben proceder de herramientas y fuentes conectadas, no de la memoria del modelo.

05

El precio de la voz no es todavía el coste completo de la experiencia

La tarifa pública de Gemini 3.8 Live sitúa el audio de entrada en unos 0,005 dólares por minuto y el audio de salida en 0,018 dólares. La entrada de imagen o vídeo se estima en 0,002 dólares por minuto, además del texto y de las posibles búsquedas conectadas.

Sin embargo, la página no ofrece una cifra única por minuto que reúna avatar, infraestructura de vídeo, capacidad reservada, integraciones y operación. Los despliegues empresariales y los avatares personalizados requieren contacto comercial, por lo que comparar solo el precio del audio produciría una estimación incompleta.

Antes de escalar, los equipos deberían medir el coste por interacción resuelta y probar el agente sin avatar. Si la lógica conversacional, las herramientas y la recuperación de errores no funcionan en audio, añadir una cara solo encarece y hace más visible el fallo.

Conclusión

La interfaz se vuelve humana antes de que el sistema sea infalible.

Live Avatar acerca los agentes a los lugares donde una pantalla, una voz y una conversación forman parte del servicio. Su mejor uso no será fingir que hay una persona al otro lado, sino reducir fricción en tareas concretas, en varios idiomas y con acceso a datos reales. La presencia visual puede mejorar la experiencia; la fiabilidad seguirá dependiendo de las integraciones, los límites y la posibilidad de pedir ayuda humana.

Cinco pruebas antes de llevar un avatar al público

  • Conversación sin vídeo. La tarea debe funcionar primero con voz y herramientas.
  • Ruido e interrupciones. El entorno real rara vez se parece a una demostración silenciosa.
  • Datos actuales. Agenda, inventario y registros deben llegar desde sistemas conectados.
  • Identidad y consentimiento. La persona necesita saber que interactúa con IA y qué ocurre con cámara y audio.
  • Salida humana. Un fallo, una duda o una solicitud sensible deben tener una alternativa inmediata.

Fuentes

Las capacidades, disponibilidad, tarifas y limitaciones proceden de documentación oficial de Google publicada o actualizada el 24 de septiembre de 2026. Los precios son componentes de API y no equivalen por sí solos al coste total de un despliegue empresarial con vídeo.