Herramientas IA

Ollama: cómo correr IA local en tu empresa sin que los datos salgan

11 min de lectura
Ollama para correr IA local dentro de una empresa

Respuesta rápida: Ollama es un programa que corre modelos de lenguaje en tu propia máquina o en tu propio servidor, sin enviar nada a internet. Se instala con un comando, descarga el modelo que le pidas y levanta una API local en el puerto 11434, que es a donde apuntan las herramientas que lo usan.

RESUMEN

  • Qué es Ollama y por qué te lo están mencionando
  • Cómo instalar Ollama
  • Los comandos que se usan todos los días
  • En qué puerto corre Ollama y cómo se conecta otra herramienta
Tabla de contenidos

En este artículo

  • Qué es Ollama y por qué te lo están mencionando
  • Cómo instalar Ollama
  • Los comandos que se usan todos los días
  • En qué puerto corre Ollama y cómo se conecta otra herramienta

Respuesta rápida: Ollama es un programa que corre modelos de lenguaje en tu propia máquina o en tu propio servidor, sin enviar nada a internet. Se instala con un comando, descarga el modelo que le pidas y levanta una API local en el puerto 11434, que es a donde apuntan las herramientas que lo usan. Conviene cuando la información no puede salir de la empresa: historias clínicas, expedientes, sueldos, contratos. La contra es honesta: un modelo local rinde menos que los grandes de pago y necesita una máquina con memoria suficiente, así que lo normal es mezclar, local para lo sensible y nube para el resto.

Qué es Ollama y por qué te lo están mencionando

Ollama es un programa que descarga modelos de lenguaje y los corre en la computadora donde lo instalaste. No hay cuenta, no hay suscripción y, sobre todo, no hay nada saliendo a internet cuando le haces una pregunta.

Casi siempre llega a una empresa por la misma conversación. Alguien del equipo quiere usar IA para trabajar con documentos internos, legal o seguridad pregunta a dónde van esos documentos, y la respuesta "a un servidor de un proveedor en otro país" corta el proyecto. Ahí aparece la pregunta de si se puede correr adentro, y la respuesta técnica se llama Ollama.

Lo que hace por dentro no es magia: descarga los pesos del modelo, los carga en memoria y levanta un servidor local que responde a preguntas. La parte que le da su fama es que todo eso se resuelve con un comando en vez de con una tarde de configuración.

Cómo instalar Ollama

En Mac y en Windows se instala como cualquier aplicación, desde su página oficial. En Mac con Homebrew también sale de una línea:

brew install ollama

En Linux, el instalador oficial:

curl -fsSL https://ollama.com/install.sh | sh

Y ya. Después se descarga un modelo y se prueba, que es donde se ve si tu máquina aguanta:

ollama run llama3.2

La primera vez descarga el modelo, que pesa varios gigas, y después arranca en segundos. Si te quedas mirando la pantalla más de un minuto sin respuesta, casi siempre es que el modelo no cabe en la memoria de tu máquina y el sistema está usando disco.

Los comandos que se usan todos los días

Son cuatro y con eso alcanza para el 90% del uso:

ComandoPara qué
ollama listver qué modelos tienes descargados y cuánto ocupan
ollama pull nombredescargar un modelo sin ejecutarlo todavía
ollama run nombreconversar con el modelo en la terminal
ollama rm nombreborrar un modelo y recuperar el espacio en disco

El de borrar es el que más se olvida y el que más problemas evita. Los modelos pesan entre 2 y 40 gigas cada uno, y probar cinco un sábado te deja el disco lleno sin que te des cuenta.

En qué puerto corre Ollama y cómo se conecta otra herramienta

Ollama escucha por defecto en el puerto 11434, que en la documentación vas a ver como Ollama port. Su dirección base es http://localhost:11434. Ese es el dato que piden casi todas las herramientas que se conectan a él, y el que más se busca cuando algo no conecta.

Los dos endpoints que se usan son /api/generate para una respuesta suelta y /api/chat para conversación con historial. Además expone una API compatible con la de OpenAI en /v1, que es lo que permite que muchas herramientas funcionen apuntando ahí sin cambiar nada más.

Si necesitas que otra máquina de la red lo alcance, hay que decirle que escuche fuera de sí mismo, con la variable de entorno OLLAMA_HOST. Las otras dos variables que se tocan en la práctica son OLLAMA_MODELS, para guardar los modelos en otro disco, y OLLAMA_KEEP_ALIVE, para que no descargue el modelo de memoria entre pregunta y pregunta.

Una advertencia que va en serio: si abres Ollama a la red, queda sin contraseña. Adentro de una empresa eso significa que cualquiera que llegue a esa IP puede usarlo. Se resuelve poniéndole algo delante que pida autenticación, y es el tipo de detalle que separa una prueba de un despliegue.

Ollama vs LM Studio vs vLLM vs llama.cpp: cuál te toca

Los cuatro corren modelos localmente y se eligen por para qué los quieres, no por cuál es mejor. Cuando alguien pregunta Ollama vs LM Studio casi siempre está preguntando otra cosa: si quiere probar o si quiere dejarlo funcionando. Y vLLM vs Ollama, o llama.cpp vs Ollama, es la misma pregunta un escalón más arriba, cuando ya hay que atender a varias personas a la vez.

HerramientaPara qué es buenaDónde se queda corta
LM Studioprobar. Tiene ventana, se instala en cinco minutos y ves la lista de modelos con un clicno está pensado para dejarlo corriendo como servicio
Ollamadejarlo funcionando. Línea de comandos, API estable, y casi todo lo que se integra con IA local habla con élsi nadie del equipo se lleva bien con la terminal, arranca lento
vLLMservir a muchas personas a la vez con GPU. Es lo que se usa cuando esto pasa a producción de verdadnecesita GPU y alguien que sepa administrarla
llama.cppel motor sobre el que se apoyan varios de los otros. Máximo control y máximo trabajo manualno es para quien quiere resolver, es para quien quiere afinar

Mi recomendación cuando me preguntan: LM Studio para ver de qué se trata un sábado, Ollama para el piloto de la empresa, y vLLM recién cuando el piloto funcionó y hay que atender a un área entera.

Ollama con Claude Code, LangChain y otras herramientas

La razón por la que Ollama aparece tanto junto a otros nombres es que su API es compatible con la de OpenAI. Eso hace que muchas herramientas funcionen apuntándolas a tu máquina en vez de a un proveedor.

  • Con LangChain: hay integración directa, y es el camino más común cuando se está construyendo algo propio encima.
  • Con interfaz web: lo que se busca como Ollama web UI o Ollama webui es esto: Open WebUI, que le da a un equipo no técnico una pantalla parecida a la de un chat conocido, corriendo contra tu Ollama.
  • Con herramientas de código: las que permiten configurar una dirección base compatible con OpenAI pueden apuntar a Ollama. Vale la advertencia honesta: un modelo local pequeño rinde bastante menos que los modelos grandes de pago para escribir código, y la diferencia se nota rápido.
  • Con MCP: el estándar que permite que un modelo use tus herramientas también funciona aquí, y es lo que convierte la prueba en algo que consulta tus sistemas.

Qué máquina hace falta, sin adornos

Lo que manda es la memoria. Un modelo tiene que caber, y si no cabe el sistema empieza a usar disco y la respuesta pasa de segundos a minutos.

  • Modelos chicos, de los que sirven para clasificar y resumir: funcionan en una laptop normal con memoria holgada.
  • Modelos medianos, que ya conversan decentemente: piden bastante más memoria, y sin tarjeta gráfica van lentos pero van.
  • Modelos grandes: necesitan GPU. Aquí es donde deja de ser un experimento en la laptop de alguien y pasa a ser un servidor.

El error que veo seguido es probar el modelo más grande en la primera tarde, ver que va lentísimo y concluir que la IA local no sirve. Sirve; lo que no sirve es la máquina para ese modelo.

Ollama frente a ChatGPT: qué se gana y qué se pierde

Se gana lo obvio y lo que suele decidir: la información no sale, no hay costo por consulta y funciona sin internet. En sectores donde hay una norma de por medio, eso no es una ventaja, es el requisito que hace posible el proyecto.

Se pierde calidad. Un modelo que cabe en tu máquina razona peor, sigue instrucciones complejas con menos fidelidad y se equivoca más en tareas largas que un modelo grande de pago. Quien te diga lo contrario no ha comparado los dos sobre el mismo trabajo.

Por eso lo que termino armando casi siempre es mixto: lo sensible se queda adentro con un modelo local, y lo demás va a la nube con un contrato que diga qué se puede hacer con tus datos. Qué cae de cada lado no es una decisión técnica, es una decisión de riesgo, y se toma con legal en la sala. Esa parte la trabajo en cumplimiento de la Ley 31814.

Si el problema es que la información no puede salir

Montar IA dentro de tu propia infraestructura es un proyecto con partes que no se ven en un tutorial: qué se queda adentro, qué puede ir a la nube y quién mantiene la máquina. Eso es lo que armo en automatización y agentes de IA.

Preguntas frecuentes

¿Cuánto cuesta licenciar herramientas de IA para un equipo de 50 personas?

Benchmark 2026: ChatGPT Team USD 25/usuario/mes, Claude Pro USD 20, Copilot Microsoft USD 30, Gemini Business USD 20. Para 50 personas ronda USD 12K-18K anuales por herramienta. No todos necesitan licencia: capacitamos a identificar quiénes obtienen más valor y optimizar el costo evitando licencias ociosas.

¿Copilot de Microsoft realmente vale el costo extra?

Vale la pena si tu empresa ya vive en Microsoft 365 (Outlook, Teams, Word, Excel). Copilot saca provecho de tus datos internos sin que tengas que hacer ingeniería. Si solo usas Word ocasionalmente, no se justifica. En nuestra experiencia, el ROI llega cuando el equipo usa Copilot 30+ minutos al día y elimina tareas reales.

¿Cuáles son las mejores herramientas de IA para empresas en 2025-2026?

Depende del caso de uso. Para productividad general: ChatGPT, Claude, Copilot. Para análisis de datos: Power BI con IA, Python. Para automatización: Make, Zapier, Power Automate. Para marketing: herramientas de segmentación con IA. Lo importante es elegir según el problema, no la tendencia.

¿Puedo usar ChatGPT con datos confidenciales de mi empresa?

Depende del plan. Con ChatGPT Team o Enterprise los datos no se usan para entrenar el modelo y están cubiertos por NDA comercial. Con el plan gratuito o Plus sí se pueden usar. Para datos muy sensibles recomendamos Claude for Work, Azure OpenAI Service (garantías empresariales) o modelos open source desplegados en tu infraestructura.

¿ChatGPT es suficiente para mi empresa o necesito algo más?

ChatGPT es un excelente punto de partida, pero no es suficiente para todo. Para análisis de datos necesitas herramientas de BI. Para automatización necesitas plataformas de workflow. Para predicciones necesitas modelos especializados. Te ayudamos a armar el stack completo según tu caso.

¿Quieres implementar esto en tu empresa?

Nuestra consultoría en IA para empresas diseña programas de capacitación y soluciones de datos personalizadas para empresas en Perú y LATAM. Desde workshops de 2-4 horas hasta programas completos de transformación digital de 6 meses.

¿Aún no sabes por dónde empezar? Haz gratis el diagnóstico de madurez en IA en 2 minutos y descubre en qué nivel está tu empresa y cuál es tu siguiente paso.

Formate con Gera

¿Quieres dominar la IA en un día?

Full Day IA con Gera: 8 horas en vivo con prompts probados, herramientas reales y un workflow listo para aplicar en tu trabajo.

Ver el Full Day IA
ollama

Comparte este artículo:

Sigue a Miss Yera:
WhatsApp directo
¿Tienes alguna duda o consulta?