Problema
La pregunta “que agent framework usamos?” parece técnica. En realidad suele esconder una decisión mas incomoda: que parte de la operación quieres gobernar con agentes.
En 2026 ya no hablamos solo de LangGraph o CrewAI. Aparecen propuestas como Eve, Flue, Microsoft Agent Framework, OpenAI Agents SDK, Vercel AI SDK y Factory. Algunas son frameworks. Otras son harnesses. Otras son plataformas. Otras son fabricas de software disfrazadas de producto.
Si las comparas como si fueran equivalentes, eliges mal. No porque sean malas herramientas, sino porque resuelven capas distintas.
Tesis
Un agent framework no se elige por hype. Se elige por la capa de control que falta en tu sistema.
La decisión correcta empieza con una pregunta operativa:
- necesitas un runtime durable?
- necesitas un harness programable?
- necesitas orquestación de estado?
- necesitas multiagente rápido?
- necesitas integración enterprise?
- necesitas una fabrica de software?
- necesitas simplemente montar un primer caso con guardrails?
La herramienta viene después.
Framework
Piensa el mercado de agentes en cinco capas:
| Capa | Que resuelve | Pregunta correcta |
|---|---|---|
| SDK ligero | herramientas, handoffs, guardrails, tracing | quien controla la app y el estado |
| Runtime/orquestador | estado, memoria, bifurcaciones, tareas largas | como se ejecuta un flujo complejo |
| Harness | canales, workflows, policies, ciclos durables | como empaquetas al agente como sistema |
| Plataforma | hosting, sandbox, permisos, despliegue, observabilidad | donde vive y opera el agente |
| Fabrica | SDLC, QA, review, aprendizaje de flujo | como escala el trabajo de software completo |
El error habitual es comprar la capa superior para resolver una carencia de la capa inferior. O al reves: montar un framework low-level cuando el problema real es deployment, permisos y responsabilidad.
Mapa rápido
| Opción | Capa principal | Mejor para | Riesgo principal | No la uses si |
|---|---|---|---|---|
| Eve | framework/plataforma durable en Vercel | agentes backend con filesystem, sandbox, approvals y subagentes | beta y acoplamiento al stack Vercel | necesitas neutralidad total de infraestructura |
| Flue | harness TypeScript durable | agentes programables con workflows, channels y policies | ecosistema joven | no tienes capacidad técnica para mantener runtime |
| LangGraph | runtime/orquestador stateful | flujos complejos, memoria, human-in-the-loop y control granular | sobreingenieria | solo necesitas un caso simple de negocio |
| CrewAI | framework multiagente alto nivel | crews, flows y prototipos operativos con roles claros | teatro de roles si no hay evaluación | aun no sabes que decisión debe tomar cada agente |
| OpenAI Agents SDK | SDK ligero | apps que ya controlan su stack y quieren tools, handoffs y guardrails | tu equipo mantiene la operación | necesitas una plataforma completa out-of-the-box |
| Microsoft Agent Framework | framework enterprise | equipos Microsoft/.NET/Python/Azure que necesitan MCP, A2A y continuidad AutoGen/Semantic Kernel | dependencia de ecosistema enterprise | tu stack no vive cerca de Microsoft |
| Vercel AI SDK | SDK de producto AI | interfaces, tool calling y apps web con agentes simples | no reemplaza un sistema operativo de agentes | necesitas workflow durable complejo |
| Factory | plataforma/fabrica de software | escalar desarrollo, QA y software delivery agent-native | no es framework generalista | buscas construir cualquier agente de negocio |
La tabla no decide por ti. Evita que compares cosas que no pertenecen a la misma categoría.
Por que importa ahora
Eve marca una señal clara: Vercel no lo presenta como otro chatbot. Lo orienta a agentes backend durables, filesystem-first, con sandbox, workflows, approvals, subagents y evals. Es decir, quiere que el agente tenga un lugar de trabajo, no solo una conversación.
Flue empuja otra lectura: el agente como harness programable. Su propuesta gira alrededor de TypeScript, tasks, workflows, channels, policies y runtime. Cloudflare lo posiciona como una capa que puede apoyarse en primitives de su Agents SDK. La palabra importante no es “agent”; es “harness”.
LangGraph sigue siendo fuerte cuando necesitas control de estado, memoria, persistencia y loops complejos. No compite con una landing bonita ni con un wrapper simple. Compite contra el caos de workflows que necesitan ser trazables y retomables.
CrewAI tiene otro lugar: acelerar la construcción de crews y flows multiagente con una capa mas opinada. Es útil cuando el equipo entiende roles, responsabilidades y outputs. Es peligroso cuando solo se usa para poner nombres humanos a procesos que nadie ha diseñado.
OpenAI Agents SDK y Vercel AI SDK son mas ligeros. Sirven cuando tu app ya tiene arquitectura y quieres incorporar herramientas, handoffs, guardrails, streaming o llamadas a modelos sin comprar una plataforma entera.
Microsoft Agent Framework pesa por otra razón: continuidad enterprise. Si tu organización esta en .NET, Python, Azure, Microsoft 365, AutoGen o Semantic Kernel, la decisión no es solo técnica. Es de integración, compliance y soporte interno.
Factory juega otra liga. No debería entrar como “framework de agentes” al mismo nivel. Es una apuesta por software factories: agentes y sistemas que observan, prueban y mejoran la cadena de delivery. Sirve para entender hacia donde va el mercado, pero no sustituye un SDK general para montar agentes de negocio.
Anti-ejemplo
“Probemos Eve, Flue, LangGraph, CrewAI y Factory y vemos cual gana.”
Ese benchmark no mide nada. Eve y Flue compiten mas por la forma de ejecutar agentes durables. LangGraph compite por control de estado. CrewAI compite por velocidad de modelar crews. OpenAI Agents SDK compite por ligereza dentro de una app. Microsoft Agent Framework compite por encaje enterprise. Factory compite por transformar software delivery.
Si todos entran en la misma tabla sin distinguir capa, la decisión queda contaminada desde el principio.
Protocolo (3 pasos)
- Define el trabajo que debe sobrevivir al prompt. Que estado, permisos, memoria, artefactos y evidencias deben persistir cuando termina la conversación.
- Elige la capa que falta. SDK, runtime, harness, plataforma o fabrica. No compres una plataforma si solo falta un tool loop. No montes un runtime si el problema es ownership.
- Haz una prueba con un caso real. El caso debe incluir entrada, tool use, fallo, retry, supervisión, evidencia y criterio de cierre.
| Decisión | Pregunta | Si la respuesta es si |
|---|---|---|
| estado durable | el agente debe retomar trabajo días después | mira Eve, Flue o LangGraph |
| web/product UI | el usuario interactua en una app propia | mira Vercel AI SDK u OpenAI Agents SDK |
| empresa Microsoft | datos, permisos y equipos viven en Microsoft | mira Microsoft Agent Framework |
| multiagente rápido | necesitas roles y flujos visibles pronto | mira CrewAI, pero con evals |
| software delivery | el problema es desarrollo, QA y review | mira Factory como plataforma |
| control low-level | necesitas gobernar cada transición | mira LangGraph |
| producción segura | necesitas sandbox, approvals y evidencia | exige guardrails antes de elegir vendor |
Guia larga de decisión
Eve: cuando el agente necesita lugar de trabajo
Eve es interesante porque parte del filesystem. Eso cambia el modelo mental. El agente no solo responde; crea, modifica, ejecuta y deja rastros en un entorno de trabajo. Para equipos ya cerca de Vercel, la combinación con Workflows, Sandbox, AI Gateway y Connect puede reducir mucho la distancia entre demo y producción.
La cautela: esta en beta. No lo venderia como estándar maduro para cualquier organización. Lo probaria cuando el stack Vercel ya existe y el caso necesita agentes backend durables.
Flue: cuando quieres un harness programable
Flue encaja si el equipo quiere escribir el comportamiento del agente como software, no como configuración de producto. Tasks, workflows, channels, policies y runtime dan una estructura clara para sistemas que deben operar mas alla de un request.
La cautela: exige criterio de ingeniería. Si el equipo busca “algo que lo haga todo”, Flue no elimina la necesidad de diseñar operaciones. La ordena.
LangGraph: cuando el estado importa
LangGraph sigue siendo una de las opciones mas serias cuando el problema es estado: memoria, checkpoints, branches, human-in-the-loop, retries y flujos que no caben en una secuencia lineal.
La cautela: puedes acabar construyendo una central nuclear para encender una bombilla. Si el caso no necesita estado complejo, LangGraph puede ser demasiado.
CrewAI: cuando necesitas modelar crews y flows
CrewAI es atractivo porque baja la fricción de construir sistemas multiagente. Roles, crews, flows, memoria, knowledge y guardrails ayudan a convertir una intuición en prototipo rápido.
La cautela: el multiagente seduce. Poner un “researcher”, un “planner” y un “reviewer” no crea gobernanza. Solo crea teatro si no hay evaluaciones, owners y criterios de salida.
OpenAI Agents SDK: cuando la app manda
OpenAI Agents SDK tiene sentido cuando ya sabes que tu aplicación sera el contenedor principal. El framework ayuda con agentes, handoffs, guardrails, tracing y tool use, pero no pretende reemplazar tu arquitectura operativa.
La cautela: si necesitas persistencia compleja, políticas multi-equipo, runtime durable y operaciones largas, tendras que disenarlo o apoyarte en otra capa.
Microsoft Agent Framework: cuando la empresa ya vive en Microsoft
Microsoft Agent Framework importa menos por novedad y mas por continuidad. Reune el camino de AutoGen y Semantic Kernel, con soporte .NET/Python y una narrativa enterprise alrededor de MCP, A2A y proveedores múltiples.
La cautela: es una gran opción cuando el entorno empresarial lo justifica. Para un equipo pequeño fuera del ecosistema Microsoft puede ser mas infraestructura de la necesaria.
Factory: cuando el producto no es el agente, es la fabrica
Factory no debería estar en la misma línea que LangGraph o CrewAI. Su promesa es transformar software delivery: agentes, droids, QA, evidencia y aprendizaje de flujo. Es una decisión de operating model de ingeniería.
La cautela: si quieres montar un agente de soporte, ventas o operaciones internas, Factory no es el primer sitio donde miraria. Si quieres redisenar como se produce software, si.
Matriz BRTHLS para elegir
Antes de elegir herramienta, completa esta matriz:
| Criterio | Bajo | Medio | Alto |
|---|---|---|---|
| criticidad | output reversible | afecta workflow interno | afecta cliente, dinero o compliance |
| duración | segundos | minutos/horas | días o procesos asincronos |
| estado | stateless | historial corto | memoria persistente y artefactos |
| permisos | una tool | varias tools internas | datos sensibles y acciones reales |
| supervisión | revisión final | approvals por etapa | control humano invocable |
| evidencia | logs básicos | trazas por paso | auditoria reproducible |
Regla simple:
- Bajo: SDK ligero.
- Medio: harness o runtime.
- Alto: plataforma, sandbox, observabilidad, evaluación y ownership antes de autonomía.
Relacionado
- Agent Orchestration 2026: LangGraph, CrewAI y la falsa sensación de escala
- Factory 2.0: el ingeniero ya no escala solo código, escala fabricas de software
- Tool Registry: el nuevo mapa de riesgos de los agentes enterprise
- A2A + MCP: los protocolos de agentes no son producto, son sistema nervioso
- AI Observability deja de ser debugging: ahora decide margen
Fuentes consultadas
- Vercel: Introducing Eve
- Vercel Eve documentation
- Flue documentation
- Cloudflare: the Agents SDK and Flue
- LangGraph overview
- CrewAI documentation
- OpenAI Agents SDK guide
- Vercel AI SDK Agents
- Microsoft Agent Framework 1.0
- Microsoft AutoGen repository
- Factory 2.0: From coding agents to software factories
Próximo paso
Si estas eligiendo agent framework, no necesitas otra demo. Necesitas decidir que operación quieres que el agente pueda ejecutar, que permisos tendra, como se audita, donde se detiene y que evidencia deja.
En BRTHLS lo podemos montar contigo: mapa de decisión, arquitectura mínima, primer caso productivo, guardrails, evaluación y tabla comparativa adaptada a tu stack real. Empieza por contactar con nosotros y trae una lista corta de procesos donde ya hay trabajo repetitivo, riesgo de decisión o handoffs que queman margen.