IA local con Ollama en tu empresa: privacidad y cero APIs
Implementa IA local en tu empresa con Ollama. Protege datos sensibles, cumple el RGPD y elimina los costes recurrentes de API en 2026.
Cada vez que tu equipo pega un contrato en ChatGPT para que lo analice, o le pregunta a un asistente de IA cómo redactar un correo con datos de un cliente, esa información sale de tu empresa y viaja a los servidores de un tercero. En la mayoría de los casos, el proveedor indica que no entrena sus modelos con esos datos, pero el hecho es que los datos han salido de tu control durante ese proceso.
Para muchas empresas españolas, esto ya es un problema regulatorio. El RGPD obliga a la minimización de datos y a la privacidad por diseño. El AI Act europeo añade capas de responsabilidad sobre los sistemas de IA que procesen datos de riesgo. Y, más allá de la legalidad, el coste acumulado de llamadas a APIs de OpenAI, Anthropic o Google puede convertirse en una partida presupuestaria significativa a medida que la adopción crece.
Ollama es la respuesta técnica a ambos problemas: permite ejecutar modelos de lenguaje de alta calidad directamente en la infraestructura de tu empresa, sin enviar datos al exterior y sin coste por petición. Este artículo explica qué es, cómo funciona, qué modelos usar y cuándo tiene sentido implantarlo.
Qué es la IA local y por qué importa a tu empresa
La IA local, también llamada IA on-premise, consiste en ejecutar el modelo de lenguaje en servidores propios, en la red corporativa o en una máquina dentro de tus instalaciones, en lugar de hacer llamadas a una API externa.
La diferencia práctica es fundamental: cuando usas una API como la de OpenAI, el texto que envías sale de tu red, es procesado en los servidores del proveedor y la respuesta vuelve. Aunque el proveedor aplique medidas de seguridad, el dato ha viajado. Con IA local, el modelo y los datos viven en el mismo entorno, nunca salen.
Esto tiene consecuencias directas para las empresas:
- Cumplimiento del RGPD simplificado. No hay transferencia de datos personales a terceros. No necesitas revisar si el proveedor tiene un DPA (Data Processing Agreement) adecuado ni preocuparte por las transferencias internacionales de datos.
- Confidencialidad real. Documentos legales, datos financieros, información de clientes, estrategia interna: todo puede procesarse sin salir de tu red.
- Coste predecible. En lugar de pagar por cada token procesado, pagas el hardware una sola vez. En escenarios de alto volumen, el ahorro es considerable.
- Sin dependencia de terceros. Un proveedor puede cambiar su política de uso, aumentar precios o interrumpir el servicio. Tu modelo local siempre estará disponible.
La IA local no es la solución para todo, pero para un subconjunto muy relevante de casos de uso empresariales, es la opción más sensata.
Ollama: el software que hace posible la IA local
Ollama es un proyecto de código abierto que simplifica radicalmente la descarga, configuración y ejecución de modelos de lenguaje en local. Antes de Ollama, poner en marcha un modelo como Llama o Mistral en un servidor requería conocimientos avanzados de Python, CUDA y gestión de dependencias. Hoy, con Ollama, el proceso se reduce a unos pocos comandos de terminal.
Lo que hace Ollama, en concreto:
- Descarga y gestiona modelos desde su repositorio oficial (que incluye decenas de modelos verificados).
- Expone una API REST local en el puerto 11434, compatible con el formato de la API de OpenAI. Esto significa que cualquier herramienta o código que ya use la API de OpenAI puede apuntar a Ollama con un cambio mínimo.
- Gestiona la carga del modelo en memoria (RAM o VRAM) y su descarga cuando no se usa.
- Permite ejecutar múltiples modelos y cambiar entre ellos sin complicaciones.
El hecho de que la API de Ollama sea compatible con el formato de OpenAI es especialmente relevante para las empresas: si ya tienes integraciones con GPT-4 en tus sistemas, puedes redirigirlas a un modelo local cambiando únicamente la URL del endpoint y la API key (que en local puede ser cualquier cadena).
Ollama es compatible con macOS, Linux y Windows. Funciona tanto con GPU NVIDIA (con aceleración CUDA) como con CPU, aunque el rendimiento con GPU es considerablemente superior.
Qué modelos puedes usar en 2026
El catálogo de modelos disponibles en Ollama ha madurado significativamente. En 2026 tienes opciones de calidad comparable a los modelos de API para muchas tareas empresariales habituales.
| Modelo | Parámetros | VRAM recomendada | Calidad en español | Mejor uso |
|---|---|---|---|---|
| Llama 3.3 (Meta) | 8B / 70B | 6 GB / 40 GB | Excelente | Uso general, análisis |
| Mistral 7B | 7B | 6 GB | Buena | Resumir, clasificar |
| Phi-4 (Microsoft) | 14B | 10 GB | Muy buena | Razonamiento, código |
| Gemma 3 (Google) | 9B / 27B | 8 GB / 20 GB | Muy buena | Redacción, análisis |
| Qwen 2.5 (Alibaba) | 7B / 72B | 6 GB / 48 GB | Excelente | Multilingual, código |
| DeepSeek-R2 | 7B / 70B | 6 GB / 40 GB | Buena | Código, razonamiento |
Para una empresa que empieza, Llama 3.3 8B o Qwen 2.5 7B son los puntos de partida más recomendables: ofrecen buena calidad en español, caben en una GPU de gama media (como una NVIDIA RTX 3080 o 4070) y son suficientes para la mayoría de tareas de ofimática inteligente.
Si el caso de uso exige mayor precisión, como análisis legal de contratos o generación de informes complejos, los modelos de 70B son la opción adecuada, pero requieren hardware más potente o ejecución distribuida en varios nodos.
Requisitos de hardware para empresas
Un error común es pensar que la IA local requiere infraestructura de supercomputación. Para la mayoría de los casos de uso de una PYME española, esto no es así.
Configuración mínima viable (modelos de 7-8B parámetros):
- Servidor o PC de sobremesa con 16 GB de RAM
- GPU con 6-8 GB de VRAM (NVIDIA GTX 1080, RTX 3070 o similar)
- SSD de al menos 50 GB para almacenar modelos
- Ubuntu Server 22.04 o Windows Server (con WSL2)
Configuración recomendada para uso intensivo:
- Servidor con 64 GB de RAM
- GPU NVIDIA RTX 4090 (24 GB VRAM) o dos GPU de gama media
- SSD NVMe de 200 GB
- Conexión a la red corporativa con acceso controlado
Configuración para modelos grandes (70B):
- 2-4 GPU de al menos 16 GB de VRAM, o
- Ejecución en CPU con 64-128 GB de RAM (más lento, pero viable para uso no masivo)
El coste de hardware para una configuración media oscila entre 2.000 y 6.000 euros, que en muchos casos se amortiza en menos de un año frente a los costes de API equivalentes.
Instalación y configuración básica
La instalación de Ollama es sencilla. En Linux:
curl -fsSL https://ollama.com/install.sh | sh
En Windows, hay un instalador ejecutable disponible en la web oficial. Una vez instalado, el servicio arranca automáticamente.
Para descargar y ejecutar un modelo:
ollama pull llama3.3
ollama run llama3.3
El segundo comando abre una interfaz de chat en terminal. Para uso empresarial, lo habitual es acceder a través de la API:
curl http://localhost:11434/api/chat -d '{
"model": "llama3.3",
"messages": [{"role": "user", "content": "Resume este contrato: ..."}]
}'
Para acceder al servidor desde otros equipos de la red (imprescindible en un entorno corporativo), hay que configurar la variable de entorno OLLAMA_HOST=0.0.0.0 antes de arrancar el servicio, y asegurarse de que el firewall corporativo permita el tráfico interno al puerto 11434.
Si ya tienes herramientas que usan la API de OpenAI, el cambio es mínimo:
from openai import OpenAI
client = OpenAI(
base_url="http://tu-servidor-local:11434/v1",
api_key="ollama" # cualquier string, se ignora en local
)
response = client.chat.completions.create(
model="llama3.3",
messages=[{"role": "user", "content": "Analiza esta factura..."}]
)
Casos de uso empresariales donde la IA local destaca
La IA local no es útil en todos los escenarios, pero hay un conjunto de casos de uso donde su ventaja es clara e inmediata.
Análisis y extracción de documentos confidenciales
Contratos, escrituras notariales, informes de auditoría, expedientes de clientes: son documentos que una empresa nunca debería enviar a una API externa. Con Ollama, puedes montar un sistema de análisis documental que procese estos archivos internamente, extraiga información estructurada y responda preguntas sobre su contenido. Si quieres profundizar en cómo combinar esto con bases de datos vectoriales para que la IA acceda a toda la documentación de tu empresa, el artículo sobre RAG empresarial: IA que aprende tus documentos internos explica el enfoque técnico completo.
Automatización de procesos internos de alta frecuencia
Cuando tienes un flujo de trabajo que procesa miles de documentos al mes, como facturas, albaranes o fichas de producto, el coste de API se acumula rápidamente. Con un modelo local integrado en tu herramienta de automatización de procesos, cada ejecución no genera ningún coste adicional. Las plataformas como n8n permiten conectar Ollama como nodo de procesamiento de lenguaje natural dentro de flujos de trabajo complejos.
Asistentes internos para el equipo
Un chatbot corporativo que responda preguntas sobre procedimientos, políticas de empresa, precios o fichas técnicas, conectado a los documentos internos, es uno de los casos de uso con mejor ROI. Con IA local, ese asistente puede acceder a información sensible, como márgenes comerciales o datos de clientes, sin ningún riesgo de fuga.
Generación de borradores de comunicaciones
Redacción de correos, respuestas a clientes, informes periódicos: para este tipo de tareas, un modelo de 7-8B parámetros en local ofrece una calidad perfectamente aceptable sin ningún coste por uso.
Industria y fabricación
En entornos industriales con redes aisladas (air-gapped) por razones de seguridad operacional, la IA local es la única opción. Inspección de calidad asistida por IA, análisis de datos de sensores, mantenimiento predictivo: todas estas aplicaciones pueden beneficiarse de modelos locales sin necesitar conectividad exterior.
IA local vs IA en la nube: cuándo usar cada una
La decisión no es binaria. La mayoría de empresas acaban con una arquitectura híbrida donde parte del procesamiento se hace en local y parte en APIs externas, según la naturaleza de los datos y los requisitos de calidad.
| Criterio | IA local (Ollama) | IA en la nube (API) |
|---|---|---|
| Privacidad de datos | Máxima (datos nunca salen) | Depende del proveedor |
| Cumplimiento RGPD | Simplificado | Requiere DPA y análisis |
| Coste inicial | Medio-alto (hardware) | Nulo |
| Coste recurrente | Nulo (electricidad) | Alto en volumen |
| Calidad en tareas complejas | Buena (modelos grandes) | Excelente (GPT-4o, Claude) |
| Tiempo de respuesta | Rápido (red local) | Variable (latencia de red) |
| Mantenimiento | Requiere equipo técnico | Ninguno |
| Disponibilidad | Sin dependencia externa | Depende del proveedor |
| Escalabilidad | Limitada por hardware | Casi ilimitada |
La regla práctica es sencilla: datos sensibles o alto volumen en local; tareas complejas sin restricción de datos en la nube. Si tienes dudas sobre qué modelo o arquitectura encaja mejor en tu caso concreto, desde AI Valencia ofrecemos consultoría técnica para diseñar la arquitectura óptima.
Limitaciones que debes conocer antes de implantar Ollama
La IA local tiene ventajas claras, pero también limitaciones reales que conviene evaluar honestamente.
Brecha de calidad en tareas complejas. Para análisis jurídicos matizados, generación de código complejo o razonamiento multistep muy elaborado, los modelos en la nube como GPT-4o o Claude Opus todavía ofrecen una calidad superior a los modelos locales de tamaño medio. Esta brecha se reduce constantemente, pero existe.
Requiere mantenimiento técnico. Actualizar modelos, gestionar el hardware, monitorizar el uso de VRAM y resolver incidencias de rendimiento requiere alguien con conocimientos técnicos. No es un servicio gestionado.
Escalabilidad limitada. Si de repente necesitas procesar diez veces más peticiones, con una API en la nube simplemente pagas más. Con IA local, necesitas aprovisionar más hardware con la antelación correspondiente.
Multimodalidad limitada. Para trabajar con imágenes, audio o vídeo de forma avanzada, las APIs externas siguen siendo superiores. Los modelos multimodales locales existen pero son más exigentes en hardware.
Si tu empresa procesa datos que no son especialmente sensibles y el volumen es bajo, las APIs externas siguen siendo la opción más ágil y fácil de mantener. Si por el contrario manejas documentación confidencial, tienes requisitos de cumplimiento estrictos o el volumen de procesamiento es alto, la IA local empieza a ser la alternativa racional.
Integración con las herramientas que ya usas
Uno de los aspectos más prácticos de Ollama es su compatibilidad con el ecosistema existente de herramientas de IA.
Open WebUI es una interfaz web de código abierto que se conecta a Ollama y ofrece una experiencia similar a ChatGPT para el equipo, con soporte para múltiples modelos, historial de conversaciones y gestión de usuarios. Es la forma más rápida de dar acceso al equipo sin que nadie tenga que usar la terminal.
n8n soporta Ollama de forma nativa como nodo de procesamiento. Esto permite construir flujos de automatización que, en determinados pasos, llamen al modelo local para clasificar, extraer o generar texto. Para profundizar en las posibilidades de n8n para la automatización empresarial, el artículo sobre n8n vs Make vs Zapier ofrece una comparativa detallada.
LangChain y LlamaIndex son los frameworks más usados para construir aplicaciones de IA avanzadas. Ambos soportan Ollama como backend, lo que significa que puedes construir sistemas RAG, agentes autónomos o pipelines de procesamiento de documentos con modelos locales.
Si tu empresa ya usa estas herramientas con APIs externas y quiere migrar parte del tráfico a local, la integración de IA con sistemas existentes es el punto de partida adecuado.
Aspectos de seguridad a considerar en el despliegue corporativo
Ejecutar IA en local no significa que la seguridad esté garantizada automáticamente. Hay que configurar el despliegue con cuidado.
Por defecto, Ollama escucha en todos los interfaces de red cuando se configura para acceso remoto. En una red corporativa, es imprescindible limitar el acceso mediante firewall a las IPs o subredes autorizadas. No expongas el puerto de Ollama a internet sin un proxy inverso con autenticación.
Si múltiples usuarios del equipo van a interactuar con el modelo, lo más recomendable es poner Open WebUI o una API gateway delante de Ollama, con autenticación y registro de uso. Esto también permite auditar qué consultas se hacen, algo que puede ser relevante para el cumplimiento normativo.
Para entornos con requisitos de seguridad elevados, la arquitectura de software con IA debe incluir desde el diseño los controles de acceso, el cifrado en tránsito (TLS en la API interna) y la separación de redes.
Primeros pasos para tu empresa
Si quieres evaluar si la IA local es adecuada para tu empresa, este es el camino más directo:
- Identifica un caso de uso concreto con datos sensibles o alto volumen. No empieces con una visión genérica de “IA en la empresa”, sino con un problema específico.
- Prueba en una máquina de desarrollo. Instala Ollama en un portátil o PC de la oficina, descarga Llama 3.3 8B y prueba el caso de uso identificado. Si la calidad es suficiente, el siguiente paso es claro.
- Evalúa el hardware necesario. Según el volumen esperado y el modelo elegido, calcula si necesitas GPU dedicada o si la CPU es suficiente para tu carga.
- Diseña la integración. ¿Cómo accederá el equipo? ¿Interfaz web (Open WebUI), integración en una aplicación interna, o automatización mediante API?
- Planifica el mantenimiento. Alguien tiene que gestionar las actualizaciones de modelos y el hardware. Define esa responsabilidad desde el principio.
Si el proyecto supera la fase de prueba y necesitas pasar a producción de forma profesional, desde AI Valencia podemos acompañarte en todo el proceso: desde la selección del hardware hasta el despliegue, la integración con tus sistemas y la formación del equipo. Contacta con nosotros a través de la página de consultoría para una primera evaluación sin compromiso.
¿Necesito una GPU potente para ejecutar IA con Ollama en mi empresa?
Depende del modelo y el volumen de uso. Para modelos de 7-8B parámetros como Llama 3.3 8B, una GPU con 6-8 GB de VRAM (como una NVIDIA RTX 3070 o 3080) es suficiente para uso empresarial moderado. También es posible ejecutar en CPU si el volumen de peticiones es bajo y puedes tolerar tiempos de respuesta más lentos. Para modelos de 70B parámetros, sí se necesita hardware más potente: al menos 40 GB de VRAM combinados, lo que implica una GPU de gama alta o varios nodos.
¿Es Ollama compatible con el RGPD sin ninguna configuración adicional?
Ollama en sí no transfiere datos a terceros, lo que elimina la principal preocupación de RGPD respecto al procesamiento externo. Sin embargo, el cumplimiento del RGPD no se reduce a dónde se procesan los datos: también implica controles de acceso adecuados, registros de tratamiento y seguridad del sistema donde corre el modelo. Es decir, Ollama simplifica el cumplimiento al evitar transferencias externas, pero la empresa sigue necesitando configurar correctamente el acceso y la seguridad del servidor. Para una guía más detallada sobre IA y protección de datos, consulta el artículo sobre IA y RGPD para empresas.
¿Qué diferencia hay entre Ollama y LM Studio?
LM Studio es una aplicación de escritorio orientada a usuarios individuales, con interfaz gráfica para explorar y chatear con modelos locales. Es ideal para experimentar y evaluar modelos antes de implantarlos. Ollama, en cambio, está diseñado para uso en servidor y producción: expone una API REST, se gestiona por línea de comandos y se integra fácilmente con otras herramientas y automatizaciones. Para uso empresarial donde múltiples usuarios o sistemas necesitan acceder al modelo, Ollama es la elección correcta. LM Studio puede ser útil en la fase inicial de evaluación.
¿Puedo usar modelos locales y APIs externas a la vez en el mismo sistema?
Sí, y de hecho es la arquitectura más común en empresas que adoptan IA de forma madura. Puedes enrutar las peticiones que contengan datos sensibles al modelo local (Ollama) y las que requieran mayor capacidad de razonamiento o no tengan restricciones de privacidad a una API externa. Herramientas como LiteLLM actúan como proxy unificado que decide el destino de cada petición según reglas configurables, lo que simplifica enormemente la gestión de esta arquitectura híbrida.
¿Cuánto tiempo lleva implantar Ollama en una empresa?
Un piloto técnico básico (servidor con Ollama y Open WebUI accesible desde la red interna) puede estar en marcha en uno o dos días si el hardware está disponible. El tiempo real de implantación depende de la complejidad de la integración con los sistemas existentes: si solo necesitas un asistente web para el equipo, son días; si necesitas integrar el modelo en flujos de trabajo automatizados o conectarlo a la base documental de la empresa, el proyecto puede extenderse entre dos y seis semanas. En AI Valencia diseñamos e implantamos estas soluciones desde la fase de diseño hasta la puesta en producción.