LLM Locales, RAG y MCP

Entrenamos modelos sobre tus datos en tu propia infraestructura, montamos motores RAG que responden solo con tu documentación y conectamos agentes a tus sistemas vía MCP. Nada sale a la nube.

Fine-tuning hasta 72B 0 datos a la nube RAG + MCP On-premise

IA sobre tus datos, sin que tus datos salgan

Hay organizaciones que no pueden usar una API pública de IA. No por preferencia: por ley. Clínicas, bufetes, notarías, entidades financieras y organismos públicos manejan información que no puede abandonar sus instalaciones.

La respuesta habitual ha sido renunciar a la IA o firmar un acuerdo de confidencialidad y cruzar los dedos. Hay una tercera vía: ejecutar y entrenar los modelos en tu propia infraestructura.

Tres capacidades que se combinan

1. Entrenamiento de modelos sobre tus datos

Ajuste fino (fine-tuning) con QLoRA sobre modelos abiertos, entrenados con tu documentación interna. El modelo resultante es tuyo y se ejecuta donde tú decidas.

Hemos caracterizado empíricamente los límites de esta técnica en una estación NVIDIA DGX Spark de 121,7 GB de memoria unificada, entrenando seis configuraciones desde 3.000 hasta 72.000 millones de parámetros. El trabajo está publicado como informe técnico.

2. Motores RAG sobre tu documentación

Generación aumentada por recuperación: el sistema indexa tus manuales, contratos, folios o históricos y responde preguntas concretas citando el documento de origen. Cuando no encuentra respaldo en tus documentos, lo dice en lugar de inventar.

Toda la cadena —generación de embeddings, base vectorial y modelo de respuesta— puede correr dentro de tu red, sin llamadas a servicios externos.

3. Conexión de agentes vía MCP

El Model Context Protocol es el estándar abierto que permite a un modelo usar tus sistemas como herramientas: consultar el ERP, abrir un ticket, leer un repositorio o lanzar un proceso. Construimos los servidores MCP que exponen tus sistemas de forma controlada, con permisos explícitos por herramienta y trazabilidad de cada llamada.

Es lo que separa un chatbot que solo conversa de un agente que efectivamente hace el trabajo.

Datos medidos, no estimados

Consumo pico real de memoria en fine-tuning QLoRA sobre GB10 (Grace-Blackwell, 121,7 GB unificados):

Modelo Tipo VRAM pico RAM pico Tiempo
Qwen2.5-3B Denso 4-bit 2,66 GB 13 GB 15,4 s
Qwen2.5-7B Denso 4-bit 8,53 GB 29 GB 19,7 s
Qwen2.5-14B Denso 4-bit 18,53 GB 51 GB 35,1 s
Qwen3-30B-A3B MoE bf16 72,02 GB 95 GB 518 s
Qwen2.5-72B Denso 4-bit 43,96 GB 64 GB 24 s

Longitud de secuencia 256–4096 según configuración. Las cifras corresponden a nuestro banco de pruebas de I+D sobre un conjunto de datos reducido, no a una carga de producción: sirven para dimensionar la envolvente de hardware, no como promesa de rendimiento.

Qué aprendimos y por qué importa

  • La variable dominante no es el tamaño del modelo. Un modelo denso de 72B cargado pre-cuantizado a 4 bits consumió 43,96 GB, menos que un MoE de 30B en bf16. Lo que manda es el formato de carga y la longitud de secuencia.
  • La longitud de secuencia decide. El mismo 72B con secuencia 1024 alcanzó ~119 GB y congeló la máquina; con secuencia 256 se quedó en 43,96 GB. Dimensionar sin tener esto en cuenta es la vía rápida al fracaso.
  • La memoria unificada falla distinto. Sin frontera física entre GPU y sistema, un exceso que en una GPU discreta sería un error recuperable aquí congela el equipo y obliga a reiniciar. Limitar la fracción de memoria del proceso restablece esa frontera y convierte el fallo catastrófico en una excepción diagnosticable.
  • Techos prácticos. Modelos densos pre-cuantizados a 4 bits: viables al menos hasta 72B. MoE por la ruta bf16: techo en torno a 30–35B. MoE de ~120B en bf16: no caben.

Qué entregamos

  • Suite MLOps desplegada en tu infraestructura — contenedor Docker con API REST (FastAPI) y panel de telemetría en tiempo real del consumo de memoria.
  • Ingesta de datos heterogéneos — Excel, Word, PDF, Markdown, CSV y TXT convertidos automáticamente a formato entrenable JSONL.
  • Selector de modelo base — enumera los modelos instalados localmente y los resuelve a su repositorio entrenable.
  • Motor de entrenamiento QLoRA/SFT con guardas de memoria y vigilante de host, para que un experimento no tumbe la máquina.
  • Servidores MCP a medida con permisos por herramienta y registro de cada invocación.
  • Dimensionamiento de hardware — qué equipo necesitas realmente para el tamaño de modelo y la longitud de contexto que tu caso exige.

Stack

QLoRA, LoRA, PEFT, TRL, bitsandbytes, FlashAttention-2, PyTorch, CUDA, Hugging Face, Ollama, LangChain, LangGraph, RAG y GraphRAG, bases vectoriales (ChromaDB, Pinecone), Docker y FastAPI. Hardware NVIDIA DGX Spark y equivalentes.

Cuándo tiene sentido

Cuando la normativa te impide subir datos a una API pública. Cuando el coste por token de un proveedor externo ya no compensa frente a ejecutar en local. Cuando necesitas un modelo que hable el vocabulario de tu sector. O cuando quieres que un agente opere sobre tus sistemas internos con permisos auditables.

Otros servicios

Arquitectura Empresarial de Soluciones

Diseñamos la arquitectura de sistemas de misión crítica: migración de monolitos a microservicios, plataformas cloud-native e integración con tus sistemas heredados.

Modelado Predictivo

Pronósticos de demanda, rotación, mantenimiento y riesgo a partir de tu histórico. Decisiones con datos, no con corazonadas.

¿Empezamos por un Discovery Call?

30 minutos, sin coste ni compromiso. Salimos de la llamada con el proceso candidato identificado y un ROI estimado.

+57 314 627 9741 contacto@autoonomia.com Respuesta en menos de 24 h hábiles