Cómo Correr Modelos de Lenguaje en tu Propia Infraestructura sin Depender de OpenAI

Cada vez que llamas a la API de OpenAI, estás pagando por token. Cada vez que envías un documento a Claude, estás transmitiendo datos a un servidor que no controlas. Cada vez que usas Gemini, Google procesa tu información en su infraestructura.

Para muchas empresas, esto es un problema doble: de costo (las APIs son caras a volumen) y de privacidad (los datos se procesan en servidores de terceros). La buena noticia es que ya no necesitas depender de estos proveedores. Los modelos de lenguaje de código abierto han alcanzado un nivel de calidad que los hace viables para la mayoría de las tareas empresariales.

El estado actual de los modelos abiertos

Hace dos años, la diferencia entre GPT-4 y los mejores modelos abiertos era abismal. Hoy esa brecha se ha cerrado significativamente, especialmente para tareas empresariales estructuradas.

Qwen (Alibaba) ofrece modelos desde 0.5B hasta 72B parámetros. El Qwen de 9B parámetros es particularmente relevante porque cabe en una GPU de 16GB de VRAM y maneja contextos de hasta 128K tokens — suficiente para procesar documentos largos completos.

Llama (Meta) ofrece modelos desde 1B hasta 405B parámetros. Sus versiones intermedias son excelentes para tareas de razonamiento y seguimiento de instrucciones.

Mistral ofrece modelos eficientes que priorizan rendimiento por parámetro. Buenos para entornos con hardware limitado.

Estos modelos son gratuitos para descargar y ejecutar. No pagas licencia, no pagas por token, no pagas suscripción mensual.

Qué hardware necesitas

El requisito principal es una GPU con suficiente VRAM (memoria de video) para cargar el modelo. Los modelos de lenguaje se cuantizan (se reducen en precisión) para caber en GPUs más pequeñas sin pérdida significativa de calidad.

Para empezar (16GB VRAM): Una NVIDIA RTX 4070 Ti, RTX A4000, o RTX 4090 puede correr modelos de 7-9B parámetros cuantizados (Q4_K_M) con contextos de hasta 128K tokens. Velocidad típica: 40-60 tokens por segundo. Inversión: $15,000-40,000 MXN por la GPU.

Para producción (24-48GB VRAM): Dos GPUs con 24GB cada una permiten correr modelos más grandes o atender múltiples solicitudes simultáneas con tensor parallelism. Velocidad típica: 100-300+ tokens por segundo.

El servidor: No necesita ser enterprise. Una workstation con procesador moderno, 64GB de RAM y una GPU dedicada es suficiente. Puedes usar un equipo existente o comprar uno dedicado. El sistema operativo es Linux (Ubuntu es la opción más común).

El costo total de un servidor de IA privada es comparable a 3-6 meses de uso de APIs comerciales a volumen empresarial. Después de eso, el costo operativo es esencialmente electricidad.

Cómo se ejecutan los modelos

El software para ejecutar modelos de lenguaje localmente es gratuito y de código abierto:

llama.cpp — La opción más versátil. Corre en CPU, GPU o ambas. Soporta cuantización para reducir el uso de memoria. Tiene un servidor HTTP integrado que expone una API compatible con OpenAI, lo que significa que aplicaciones diseñadas para usar la API de OpenAI pueden apuntar a tu servidor local sin cambios de código.

vLLM — Optimizado para throughput alto. Mejor para entornos de producción donde múltiples usuarios hacen solicitudes simultáneas. Requiere más VRAM pero es significativamente más rápido para atender múltiples peticiones concurrentes.

Ollama — La opción más simple para empezar. Descarga y ejecuta modelos con un solo comando. Menos configurable pero ideal para prototipos y pruebas.

La instalación típica toma horas, no semanas. Un equipo con experiencia en Linux puede tener un servidor de inferencia funcionando en un día.

Qué tareas pueden hacer estos modelos

Los modelos de 7-9B parámetros son más que suficientes para la mayoría de las tareas empresariales:

Extracción de datos de documentos. Leer un contrato y extraer partes, fechas, montos, cláusulas clave. Leer una identificación y extraer nombre, RFC, dirección.

Generación de notas y resúmenes. Generar notas SOAP desde transcripciones médicas, resumir minutas de reunión, crear reportes desde datos estructurados.

Clasificación de texto. Clasificar documentos por tipo, correos por prioridad, tickets de soporte por categoría.

Respuesta a preguntas sobre datos. Consultar una base de datos y presentar resultados en lenguaje natural. Es lo que hacen los agentes de IA.

Traducción. Los modelos multilingües pueden traducir entre español, inglés y otros idiomas con calidad comparable a servicios comerciales.

Para tareas más demandantes (razonamiento matemático complejo, generación creativa de alta calidad, análisis de código extenso), los modelos más grandes o los servicios comerciales siguen teniendo ventaja. Pero para el 80% de las tareas empresariales de procesamiento de información, un modelo local es suficiente.

Cuándo SÍ conviene usar APIs

La IA privada no es la respuesta para todo. Hay escenarios donde las APIs comerciales tienen más sentido:

Volumen muy bajo. Si procesas 10 documentos al mes, no justifica un servidor dedicado. La API es más práctica.

Tareas que requieren modelos frontier. Razonamiento complejo multi-paso, generación creativa de nivel publicación, análisis que requiere conocimiento actualizado del mundo.

Prototipado rápido. Cuando estás experimentando con una idea y no sabes si la IA puede resolverla. Prueba con una API, valida, y después migra a local si funciona.

Sin equipo técnico. Si no tienes a nadie que pueda mantener un servidor Linux con GPU, la API comercial es más viable. Aunque externalizar la administración del servidor es una opción.

La estrategia óptima para muchas empresas es un modelo híbrido: procesamiento privado para datos sensibles y volúmenes altos, APIs comerciales para tareas genéricas y prototipado. Con fallback automático entre ambos para garantizar disponibilidad.

Productos Leeuwwolk: todos corren localmente

En Leeuwwolk, todos nuestros productos están diseñados para operar con modelos de lenguaje con la garantía de privacidad de Leeuwwolk. Fullkro, Scriba, Medicus y The Manager usan Qwen y Llama como modelos primarios, con llama.cpp como runtime de inferencia.

La inversión en hardware se amortiza rápidamente contra el costo equivalente de APIs comerciales, y Leeuwwolk garantiza la privacidad: datos encriptados y nunca compartidos con terceros.

→ Conoce nuestras soluciones de IA privada

Leeuwwolk es una empresa mexicana que implementa soluciones de inteligencia artificial con modelos de código abierto con garantía de privacidad.