Problema
La mayoría de interfaces de voz imita un walkie-talkie: una parte habla y la otra espera. El full-duplex elimina esa frontera, pero también abre errores nuevos: interrupciones torpes, confirmaciones ausentes y herramientas ejecutadas mientras el usuario corrige la intención.
Pedir “reserva una mesa para mañana… mejor el viernes” parece una frase trivial. Para un agente que escucha y actúa a la vez contiene dos intenciones incompatibles y un instante crítico: cuándo considera suficientemente estable la segunda para usar una herramienta.
Tesis
El turn-taking ya no puede reducirse a un umbral de silencio. Es una política de producto que combina intención, riesgo, latencia y derecho a corregir.
Criterio de calidad: la voz excelente no responde antes. Sabe qué acciones todavía deben esperar.
Framework
OpenAI describe GPT-Live como un modelo full-duplex capaz de escuchar y hablar simultáneamente, decidir si habla, escucha, pausa, interrumpe o usa herramientas. El diseño necesita cuatro estados perceptibles: escuchar, responder, confirmar y actuar.
La confirmación debe escalar con el efecto. Consultar el tiempo tolera ambigüedad; cancelar una reserva no. La interfaz puede mantener fluidez narrando el paso: “Voy a buscar opciones para el viernes” no es lo mismo que “He confirmado la reserva”.
También necesita política de barge-in: qué ocurre si el usuario habla encima. En una explicación se pausa. Durante lectura legal quizá se marca el punto. Antes de una acción se cancela la intención pendiente y se vuelve a confirmar.
Señal medible: porcentaje de interrupciones recuperadas sin repetir la conversación ni ejecutar una acción incorrecta.
Por que importa ahora
La baja latencia acerca la voz a una conversación natural, pero natural no significa segura. Cuanto más fluido parece el sistema, menos evidente es el instante en que una sugerencia se convierte en una acción.
Diseñar ese instante es trabajo de producto, no ajuste acústico. Debe quedar claro para usuario, log y sistema cuándo el agente pasó de comprender a comprometer.
Anti-ejemplo
“Si detecta 500 ms de silencio, responde.” Una pausa puede ser reflexión, ruido o final de turno; el riesgo de la próxima acción importa más que el cronómetro.
Otro fallo es permitir que el agente complete en voz una hipótesis sensible: nombre, dirección o cantidad. La reparación correcta es preguntar, no sonar seguro.
Protocolo (3 pasos)
- Define estados. Haz distinguibles escucha, propuesta y ejecución.
- Escala confirmación. Confirma más cuanto mayor sea el efecto.
- Prueba solapamientos. Evalúa interrupción, ruido, corrección y cambio de intención.
Graba la traza como eventos de conversación —inicio de turno, corrección, confirmación, tool call— y comprueba que un auditor pueda reconstruir por qué se actuó.
| Acción | Política | Confirmación |
|---|---|---|
| responder | fluida | no |
| consultar | anunciada | según sensibilidad |
| ejecutar | explícita | sí |
Relacionado
- Safe Outputs: agentes útiles sin permiso de escritura
- Agent Handoffs: transferencias sin fricción entre humanos y agentes
Fuentes consultadas
Proximo paso
Escribe una tabla de turnos para tu caso de voz: cuándo el agente puede interrumpir, qué debe confirmar y cómo cancela una acción tras una corrección.