# Modelos fundacionales tabulares: los datos que un LLM no sabe leer

> Los modelos tabulares llevan el aprendizaje en contexto a filas y columnas, pero no sustituyen SQL, reglas ni ML tradicional en cualquier problema.

- Author: Viktor Berthelius (BRTHLS)
- Published: 2026-08-01
- Category: ai operating models
- Tags: tabular-foundation-models, enterprise-data, machine-learning, ai-architecture
- Language: es
- Canonical: https://www.brthls.com/magazine/modelos-fundacionales-tabulares-datos-empresa-llm-no-sabe-leer-es
- Source: BRTHLS Magazine — https://www.brthls.com

---

## Problema

La empresa habla en documentos, pero opera en tablas. Pedidos, fraude, churn, inventario, riesgo, pricing y mantenimiento viven en filas, columnas y relaciones entre sistemas.

La respuesta rápida de la ola generativa ha sido convertir esos datos en texto y entregárselos a un LLM. El resultado parece cómodo, pero cambia la naturaleza del problema. Una tabla no es una frase larga: intercambiar dos filas no altera su significado, una clave foránea importa más que su posición y una variable numérica no debería perder su escala al convertirse en tokens.

Forzar datos estructurados dentro de una arquitectura lingüística consume contexto y puede ocultar relaciones que un modelo predictivo necesita conservar.

## Tesis

Los modelos fundacionales tabulares abren una cuarta ruta para la IA empresarial: aprender una tarea nueva directamente desde ejemplos en filas y columnas, sin entrenar un modelo específico desde cero cada vez.

No reemplazan SQL, reglas, XGBoost ni LLM. Cambian la decisión de arquitectura. Si la tarea es recuperar un dato exacto, consulta. Si debe ejecutar una política conocida, usa reglas. Si debe explicar lenguaje, usa un LLM. Si debe predecir sobre datos estructurados y hay pocos ejemplos o mucho coste de preparación, prueba un modelo tabular.

El valor no está en declarar un ganador universal. Está en dejar de tratar todas las formas de inteligencia empresarial como problemas de texto.

## Framework

Usa una matriz de **modalidad, tarea, evidencia y operación**:

- **Modalidad:** texto, tabla única, esquema relacional, serie temporal o combinación.
- **Tarea:** recuperar, calcular, clasificar, estimar, generar o decidir.
- **Evidencia:** regla explícita, ejemplos históricos, documentos o relaciones entre entidades.
- **Operación:** volumen, latencia, coste, privacidad, explicabilidad y frecuencia de cambio.

Google Research presentó TabFM como un modelo zero-shot para clasificación y regresión tabular. Recibe ejemplos históricos y filas objetivo como contexto, aplica atención sobre filas y columnas y produce predicciones sin ajustar sus pesos para cada dataset. TabPFN sigue una dirección parecida y sus versiones recientes amplían el tamaño de tabla y los tipos de datos que pueden abordar.

Eso reduce una parte del ciclo tradicional: feature engineering, búsqueda de hiperparámetros y entrenamiento por dataset. No elimina la responsabilidad sobre leakage, calidad, drift, calibración o causalidad.

## Por que importa ahora

TabFM hace visible el cambio, pero también sus límites. El repositorio oficial indica que los pesos publicados son para uso no comercial y no productivo, que el proyecto no es un producto soportado de Google y que la configuración inicial trabaja con límites concretos de filas y features. El anuncio de Google anticipa integración con BigQuery mediante `AI.PREDICT`, pero una previsión de producto no equivale a disponibilidad general.

Esta tensión es editorialmente más útil que el benchmark: la interfaz se simplifica antes de que la operación esté resuelta. Un analista podría invocar predicción desde SQL, pero la empresa todavía debe definir qué dataset es autorizado, quién valida el target, cómo se compara con el baseline y cuándo una predicción deja de ser fiable.

El salto real ocurre cuando la organización incorpora una política de selección de modalidad. Ya no pregunta únicamente qué LLM comprar. Pregunta qué clase de modelo merece cada decisión.

## Anti-ejemplo

Un equipo exporta el CRM a CSV, serializa miles de filas dentro de un prompt y pide a un chatbot que prediga churn. La demo devuelve porcentajes convincentes. Nadie compara contra una regresión logística, revisa leakage temporal ni documenta qué filas llegaron al contexto.

Después sustituye el chatbot por un modelo tabular y declara resuelto el problema. Ha cambiado de tecnología, no de disciplina.

Un modelo fundacional no convierte una tabla mala en evidencia buena.

## Protocolo (3 pasos)

1. **Clasifica la decisión.** Separa recuperación, reglas, predicción y generación antes de elegir modelo.
2. **Construye un baseline aburrido.** Compara contra SQL, heurística y un modelo de árboles con la misma partición temporal y métrica.
3. **Valida operación, no sólo accuracy.** Mide calibración, latencia, coste, privacidad, límites de licencia y comportamiento ante drift.

| Necesidad | Primera opción | Prueba obligatoria |
| --- | --- | --- |
| dato exacto | SQL | reconciliación con fuente |
| política conocida | reglas | casos límite |
| explicación documental | LLM + retrieval | citas y permisos |
| predicción tabular | árboles o modelo tabular | baseline y calibración |
| esquema relacional | modelo relacional o features | leakage y relaciones |

## Relacionado

- [Prompt-to-Endpoint: la analítica conversacional necesita una capa semántica](/magazine/prompt-to-endpoint-analitica-conversacional-capa-semantica-es)
- [Context Supply Chain: la cadena de suministro que decide si tu IA sabe trabajar](/magazine/context-supply-chain-cadena-suministro-ia-corporativa-es)
- [Model Routing as Governance: política de modelos, no intuición](/magazine/model-routing-as-governance-politica-modelos-no-intuicion-es)

## Fuentes consultadas

- [Google Research: Introducing TabFM](https://research.google/blog/introducing-tabfm-a-zero-shot-foundation-model-for-tabular-data/)
- [Google Research: repositorio de TabFM](https://github.com/google-research/tabfm)
- [TabPFN-3: Technical Report](https://arxiv.org/abs/2605.13986)
- [Prior Labs: repositorio de TabPFN](https://github.com/PriorLabs/TabPFN)

## Proximo paso

Elige una predicción que hoy dependa de un pipeline caro. Conserva su split temporal y su métrica, prueba un baseline simple y un modelo tabular, y documenta dónde gana cada uno. Si no puedes comparar contra algo aburrido, todavía no estás evaluando una arquitectura.

---

_Cite as: Berthelius, V. (2026). "Modelos fundacionales tabulares: los datos que un LLM no sabe leer". BRTHLS Magazine. https://www.brthls.com/magazine/modelos-fundacionales-tabulares-datos-empresa-llm-no-sabe-leer-es_
