Problema
Cuando una plataforma ofrece decenas o cientos de agentes en paralelo, la reacción natural es repartir más trabajo. Pero el volumen de hallazgos crece más rápido que la capacidad de distinguir duplicados, falsos positivos y contradicciones.
Un enjambre sin presupuesto de revisión no elimina el cuello de botella: lo traslada al informe final. La síntesis recibe una montaña de afirmaciones con aspecto independiente aunque muchas compartan el mismo contexto, modelo y sesgo.
Tesis
El presupuesto del enjambre debe asignarse por función antes de ejecutar: contexto, producción, verificación adversarial y síntesis. La capacidad reservada para dudar es parte del output.
Regla práctica: aumentar productores sin aumentar verificadores reduce el coste de generar y eleva el coste de creer.
Framework
Los Workflows de Grok Build hacen visible una arquitectura útil: contexto, revisión, verificación y síntesis. La plataforma permite desplegar cientos de agentes, pero la señal relevante no es el máximo; es que el flujo puede reservar escépticos independientes antes de consolidar resultados.
Para una revisión de código, por ejemplo, asigna un grupo a mapear superficies, otro a buscar fallos por dominio y otro a intentar refutar cada hallazgo. La síntesis solo recibe elementos con evidencia reproducible o desacuerdo explícito.
El presupuesto debe incluir diversidad, no solo cantidad. Dos agentes con el mismo prompt y los mismos archivos no son dos revisiones independientes. Cambia hipótesis, contexto disponible o criterio de falsación.
Señal medible: porcentaje del presupuesto dedicado a verificar y tasa de hallazgos descartados, fusionados o degradados antes del informe.
Por que importa ahora
El coste marginal de lanzar otra sesión cae, mientras el coste de revisar una recomendación crítica sigue siendo humano. Eso favorece métricas vanidosas: agentes lanzados, archivos leídos o issues encontrados.
Un presupuesto funcional permite comparar workflows. Si una ejecución usa el doble de agentes pero no mejora cobertura verificada ni reduce falsos positivos, no ha escalado calidad; solo ha escalado actividad.
Anti-ejemplo
“Lanza 100 agentes y que voten.” La mayoría no crea verdad cuando todos leen la misma evidencia y heredan la misma formulación. El consenso puede ser correlación disfrazada.
Tampoco basta un agente final que resuma. Resumir comprime; verificar intenta demostrar que algo es falso. Son trabajos distintos y necesitan instrucciones, herramientas y criterios diferentes.
Protocolo (3 pasos)
- Presupuesta por rol. Separa capacidad para explorar, producir, refutar y sintetizar.
- Exige evidencia. Cada hallazgo debe incluir ubicación, reproducción y condición de invalidez.
- Mide la poda. Registra qué descartó la verificación y por qué.
Empieza con una proporción explícita y ajústala con datos. En tareas de alto impacto, ningún aumento de producción debería aprobarse sin revisar la capacidad de falsación.
| Fase | Pregunta | Entregable |
|---|---|---|
| contexto | qué superficie existe | mapa |
| producción | qué podría fallar | candidatos |
| verificación | qué no resiste prueba | evidencia |
| síntesis | qué merece acción | decisión priorizada |
Relacionado
- Más agentes, menos WIP: la capacidad de revisión es el nuevo límite
- Output Verification Layer: el seguro invisible de los agentes
Fuentes consultadas
Proximo paso
Abre tu workflow multiagente más caro y etiqueta el gasto por función. Si casi todo produce y casi nada intenta refutar, reasigna presupuesto antes de añadir otra sesión.