IA sobre tus datos, sin que tus datos salgan
Hay organizaciones que no pueden usar una API pública de IA. No por preferencia: por ley. Clínicas, bufetes, notarías, entidades financieras y organismos públicos manejan información que no puede abandonar sus instalaciones.
La respuesta habitual ha sido renunciar a la IA o firmar un acuerdo de confidencialidad y cruzar los dedos. Hay una tercera vía: ejecutar y entrenar los modelos en tu propia infraestructura.
Tres capacidades que se combinan
1. Entrenamiento de modelos sobre tus datos
Ajuste fino (fine-tuning) con QLoRA sobre modelos abiertos, entrenados con tu documentación interna. El modelo resultante es tuyo y se ejecuta donde tú decidas.
Hemos caracterizado empíricamente los límites de esta técnica en una estación NVIDIA DGX Spark de 121,7 GB de memoria unificada, entrenando seis configuraciones desde 3.000 hasta 72.000 millones de parámetros. El trabajo está publicado como informe técnico.
2. Motores RAG sobre tu documentación
Generación aumentada por recuperación: el sistema indexa tus manuales, contratos, folios o históricos y responde preguntas concretas citando el documento de origen. Cuando no encuentra respaldo en tus documentos, lo dice en lugar de inventar.
Toda la cadena —generación de embeddings, base vectorial y modelo de respuesta— puede correr dentro de tu red, sin llamadas a servicios externos.
3. Conexión de agentes vía MCP
El Model Context Protocol es el estándar abierto que permite a un modelo usar tus sistemas como herramientas: consultar el ERP, abrir un ticket, leer un repositorio o lanzar un proceso. Construimos los servidores MCP que exponen tus sistemas de forma controlada, con permisos explícitos por herramienta y trazabilidad de cada llamada.
Es lo que separa un chatbot que solo conversa de un agente que efectivamente hace el trabajo.
Datos medidos, no estimados
Consumo pico real de memoria en fine-tuning QLoRA sobre GB10 (Grace-Blackwell, 121,7 GB unificados):
| Modelo | Tipo | VRAM pico | RAM pico | Tiempo |
|---|---|---|---|---|
| Qwen2.5-3B | Denso 4-bit | 2,66 GB | 13 GB | 15,4 s |
| Qwen2.5-7B | Denso 4-bit | 8,53 GB | 29 GB | 19,7 s |
| Qwen2.5-14B | Denso 4-bit | 18,53 GB | 51 GB | 35,1 s |
| Qwen3-30B-A3B | MoE bf16 | 72,02 GB | 95 GB | 518 s |
| Qwen2.5-72B | Denso 4-bit | 43,96 GB | 64 GB | 24 s |
Longitud de secuencia 256–4096 según configuración. Las cifras corresponden a nuestro banco de pruebas de I+D sobre un conjunto de datos reducido, no a una carga de producción: sirven para dimensionar la envolvente de hardware, no como promesa de rendimiento.
Qué aprendimos y por qué importa
- La variable dominante no es el tamaño del modelo. Un modelo denso de 72B cargado pre-cuantizado a 4 bits consumió 43,96 GB, menos que un MoE de 30B en bf16. Lo que manda es el formato de carga y la longitud de secuencia.
- La longitud de secuencia decide. El mismo 72B con secuencia 1024 alcanzó ~119 GB y congeló la máquina; con secuencia 256 se quedó en 43,96 GB. Dimensionar sin tener esto en cuenta es la vía rápida al fracaso.
- La memoria unificada falla distinto. Sin frontera física entre GPU y sistema, un exceso que en una GPU discreta sería un error recuperable aquí congela el equipo y obliga a reiniciar. Limitar la fracción de memoria del proceso restablece esa frontera y convierte el fallo catastrófico en una excepción diagnosticable.
- Techos prácticos. Modelos densos pre-cuantizados a 4 bits: viables al menos hasta 72B. MoE por la ruta bf16: techo en torno a 30–35B. MoE de ~120B en bf16: no caben.
Qué entregamos
- Suite MLOps desplegada en tu infraestructura — contenedor Docker con API REST (FastAPI) y panel de telemetría en tiempo real del consumo de memoria.
- Ingesta de datos heterogéneos — Excel, Word, PDF, Markdown, CSV y TXT convertidos automáticamente a formato entrenable JSONL.
- Selector de modelo base — enumera los modelos instalados localmente y los resuelve a su repositorio entrenable.
- Motor de entrenamiento QLoRA/SFT con guardas de memoria y vigilante de host, para que un experimento no tumbe la máquina.
- Servidores MCP a medida con permisos por herramienta y registro de cada invocación.
- Dimensionamiento de hardware — qué equipo necesitas realmente para el tamaño de modelo y la longitud de contexto que tu caso exige.
Stack
QLoRA, LoRA, PEFT, TRL, bitsandbytes, FlashAttention-2, PyTorch, CUDA, Hugging Face, Ollama, LangChain, LangGraph, RAG y GraphRAG, bases vectoriales (ChromaDB, Pinecone), Docker y FastAPI. Hardware NVIDIA DGX Spark y equivalentes.
Cuándo tiene sentido
Cuando la normativa te impide subir datos a una API pública. Cuando el coste por token de un proveedor externo ya no compensa frente a ejecutar en local. Cuando necesitas un modelo que hable el vocabulario de tu sector. O cuando quieres que un agente opere sobre tus sistemas internos con permisos auditables.
