Problema
“Human in the loop” suena responsable, pero muchas veces significa una cola ambigua donde nadie sabe cuando intervenir, que revisar o con que criterio aprobar.
El resultado es malo en ambos sentidos: agentes demasiado frenados para tareas simples y demasiado libres en decisiones sensibles.
La supervision humana no puede ser un boton rojo permanente. Debe ser una capacidad disenada.
Tesis
Human as Tool es una forma mas operativa de pensar la supervision.
El humano no aparece como ultima linea romantica de defensa. Aparece como una herramienta especializada que el agente puede invocar cuando detecta incertidumbre, riesgo, ambiguedad, excepcion o impacto alto.
Eso exige interfaz, SLA, contexto y criterio.
Framework
Una herramienta humana debe tener cinco parametros:
- Trigger: cuando se invoca.
- Payload: que contexto recibe el humano.
- Decision set: que opciones puede tomar.
- SLA: cuanto tiempo puede esperar el agente.
- Learning loop: como la decision mejora futuras reglas o evals.
Mini-caso: un agente legal prepara respuestas contractuales. No deberia pedir aprobacion para todo. Debe escalar solo cuando detecta cambio de responsabilidad, penalizaciones, terminos no estandar o cliente estrategico. El humano recibe diff, riesgo, recomendacion y opciones.
Senal medible: porcentaje de escalados humanos con trigger, decision y resultado reutilizable.
Postura: supervision sin diseno es friccion. Supervision invocable es arquitectura.
Por que importa ahora
OpenAI recomienda supervision humana para acciones sensibles, irreversibles o de alto impacto. MCP incluye elicitation como patron para pedir informacion adicional al usuario durante una interaccion. En sistemas agenticos, la pregunta deja de ser “humano si o no” y pasa a ser “que humano, cuando, con que contexto y para decidir que”.
El humano se convierte en un nodo del workflow, no en un parche.
Anti-ejemplo
“Todo lo aprueba alguien antes de enviar.”
Parece seguro, pero mata velocidad y no ensena al sistema. Si cada aprobacion llega sin taxonomia, el agente no aprende que situaciones son realmente peligrosas.
Protocolo (3 pasos)
- Define triggers de escalado. Riesgo legal, dinero, datos sensibles, irreversibilidad, baja confianza.
- Disena payload minimo. Contexto, recomendacion del agente, razon del escalado y opciones.
- Cierra aprendizaje. Cada decision humana debe alimentar regla, eval o documentacion.
| Trigger | Humano adecuado | Output esperado |
|---|---|---|
| riesgo legal | legal | aprobar/rechazar |
| dato sensible | security | permiso |
| cliente clave | account owner | criterio |
| baja confianza | experto dominio | respuesta |
| accion irreversible | manager | autorizacion |
Relacionado
- Human Escalation Design: cuando un agente debe pedir ayuda y cuando debe seguir solo
- Agent Handoffs: transferencias sin friccion entre humanos y agentes
- Output Verification Layer: el seguro invisible de los agentes en produccion
Fuentes consultadas
- OpenAI: A practical guide to building agents
- MCP Elicitation specification
- OpenAI: Evals for AI agents
Proximo paso
Elige un workflow con aprobaciones humanas. No preguntes “podemos automatizarlo”. Pregunta que triggers justifican humano, que payload necesita y que decision debe devolver.