# Context Budgeting: ahorrar tokens sin dejar ciego al agente

> El presupuesto de contexto no va de recortar prompts, sino de decidir que informacion merece entrar, persistir, caducar o cachearse.

- Author: Viktor Berthelius (BRTHLS)
- Published: 2026-06-21
- Category: ai operating models
- Tags: context-engineering, token-economics, prompt-caching, ai-operating-models
- Language: es
- Canonical: https://www.brthls.com/magazine/context-budgeting-arquitectura-contexto-ahorra-tokens-sin-cegar-agente-es
- Source: BRTHLS Magazine — https://www.brthls.com

---

## Problema

Cuando sube el coste de IA, muchas empresas reaccionan recortando tokens. Prompts mas cortos, menos contexto, menos ejemplos, menos memoria. A veces funciona. A veces deja al agente ciego.

El contexto no es grasa que se pueda cortar sin pensar. Es el entorno informativo donde el agente decide. Si quitas contexto critico, el agente consume menos pero falla mas. Si metes todo, consume mas y puede confundirse.

El reto no es "menos contexto". Es mejor presupuesto de contexto.

## Tesis

`Context Budgeting` deberia ser una disciplina propia dentro del operating model de IA.

Consiste en decidir que informacion entra, donde se coloca, cuanto dura, cuando se cachea, cuando caduca, que se recupera bajo demanda y que nunca debe entrar.

Un buen presupuesto de contexto reduce coste sin destruir calidad. Uno malo ahorra tokens comprando retrabajo.

## Framework

Divide contexto en cinco presupuestos:

- **Estable:** instrucciones, politicas, criterios, schemas y ejemplos duraderos.
- **Situacional:** datos del caso, usuario, cliente, canal o tarea.
- **Recuperado:** documentos, tickets, memoria, conocimiento o fuentes.
- **Transitorio:** tool outputs, logs temporales y pasos intermedios.
- **Prohibido:** secretos, datos innecesarios, ruido y contexto no autorizado.

Mini-caso: un agente legal recibe un contrato, politicas internas, historial del cliente, ejemplos de redlines y outputs de herramientas. Si todo entra como un bloque plano, sube coste y baja precision. Si las politicas estables se cachean, el contrato entra como caso, las fuentes se recuperan con permisos y los tool outputs caducan, el sistema decide mejor y cuesta menos.

**Senal medible:** coste por outcome aceptado despues de separar contexto estable, situacional, recuperado y transitorio.

**Postura:** el contexto es inventario. Si no lo presupuestas, se convierte en basura cara.

## Por que importa ahora

Anthropic documenta prompt caching para reutilizar contenido estable como tool definitions, instrucciones de sistema, contexto y ejemplos. AWS anuncio en enero de 2026 una opcion de TTL de una hora para prompt caching en Amazon Bedrock con modelos Claude seleccionados, orientada a workflows agenticos largos, tool use, retrieval y orquestacion. OpenAI documenta agentes y SDKs donde herramientas, memoria y estructura de ejecucion pasan a ser piezas explicitas del sistema.

Todas esas piezas apuntan al mismo problema: los agentes largos necesitan gestionar contexto como recurso operacional, no como texto pegado.

El coste de contexto no solo aparece en factura. Aparece en latencia, errores, exposicion de datos y dificultad de debugging.

## Anti-ejemplo

"Metamos todo el knowledge base en el contexto para que no falle."

Eso suele fallar de forma cara. Aumenta tokens, mete documentos obsoletos, mezcla permisos y dificulta saber que fuente influyo en la respuesta. Un agente no necesita todo; necesita contexto suficiente, relevante, autorizado y fresco.

## Protocolo (3 pasos)

1. **Marca contexto por vida util.** Minutos, horas, dias, release, contrato o permanente.
2. **Cachea lo estable, recupera lo dinamico.** No trates politicas y datos de caso como la misma cosa.
3. **Mide ceguera y ruido.** Si baja coste pero sube retrabajo, el recorte fue falso ahorro.

| Tipo | Estrategia | Riesgo |
| --- | --- | --- |
| estable | cachear | version vieja |
| situacional | inyectar por caso | falta de contexto |
| recuperado | RAG con permisos | fuente erronea |
| transitorio | caducar | memoria contaminada |
| prohibido | bloquear | fuga de datos |

## Relacionado

- [Token-to-Outcome: el KPI que separa IA usada de IA rentable](/magazine/token-to-outcome-kpi-ia-rentable-es)
- [Context Architecture: por que prompt engineering no escala negocio](/magazine/context-architecture-prompt-engineering-no-escala-negocio-es)
- [Enterprise AI Search: por que la busqueda interna se esta convirtiendo en sistema operativo](/magazine/enterprise-ai-search-busqueda-interna-sistema-operativo-es)

## Fuentes consultadas

- [Anthropic: Prompt caching](https://platform.claude.com/docs/en/build-with-claude/prompt-caching)
- [AWS: Amazon Bedrock now supports 1-hour duration for prompt caching](https://aws.amazon.com/about-aws/whats-new/2026/01/amazon-bedrock-one-hour-duration-prompt-caching/)
- [OpenAI Agents SDK: Memory](https://openai.github.io/openai-agents-python/ref/memory/)

## Proximo paso

Toma un workflow caro y pinta su contexto en cinco colores: estable, situacional, recuperado, transitorio y prohibido. Ahi veras que parte se cachea, que parte se recupera y que parte sobra.

---

_Cite as: Berthelius, V. (2026). "Context Budgeting: ahorrar tokens sin dejar ciego al agente". BRTHLS Magazine. https://www.brthls.com/magazine/context-budgeting-arquitectura-contexto-ahorra-tokens-sin-cegar-agente-es_
