Introducción a los modelos locales de Inteligencia Artificial en Linux
He hablado muchas veces de Ollama en Ubunlog sin profundizar demasiado. Ahora haré una introducción a los modelos de Inteligencia Artificial en Linux para saber cuáles podemos correr en forma local. Por supuesto, por limitaciones de hardware no se puede hacer lo mismo que conectándose a las plataformas operadas por las grandes empresas del sector, pero dependiendo del hardware que tengamos igual podemos lograr cosas bastante interesantes.
Con Ollama corremos los modelos de Inteligencia Artificial en nuestro ordenador y podemos hacer cosas como automatizar tareas, pedirle que revise nuestro código o que resuma documentos.
Introducción a los modelos de Inteligencia Artificial en Linux
¿Por qué correr un modelo en forma local?
Como en todas las cosas, la decisión de usar una herramienta implica ventajas y sacrificios. Veámoslas en detalle.
- Costo; El uso de Modelos de lenguaje a gran escala (LLM por sus siglas en inglés) es muy exigente en materia de hardware; más adelante entraremos en detalle sobre qué se puede hacer y qué no con los equipos domésticos. El punto es que cuanto más quieres lograr, más tienes que invertir. Aunque gran parte del uso de las plataformas oficiales es gratuito (con limitaciones), se aplica la máxima de que «si no eres el cliente, eres el producto»: tus chats serán monetizados de alguna forma por las empresas. Y si decides pagar por el uso de la API o las suscripciones mensuales, los costos pueden resultar prohibitivos.
- Velocidad y rendimiento: Es cierto que las plataformas de Inteligencia Artificial van a ser mucho más rápidas que nuestros ordenadores domésticos. Sin embargo, tenemos que analizar qué tan importante es la rapidez en comparación con el resto de los factores que estamos analizando. En la mayoría de los casos, lo suficientemente rápido puede ser bastante bueno.
- Personalización: Los modelos instalados localmente se pueden modificar y adaptar a nuestras necesidades. Los modelos de las plataformas oficiales siguen lineamientos bastante estrictos sobre lo que responden y, en algunos casos, demuestran sesgos ideológicos o pacatería. Antes de escribir esto leí en X la queja de una usuaria de Claude a la que el modelo de Anthropic se negó a decirle cuántas calorías consumía porque pensó que era anoréxica. Yo tuve que decirle a Microsoft Designer que me creara la imagen de un perro hembra, porque poner «perra» en el prompt violaba su política antidiscriminación.
- Capacidad del modelo y calidad de los resultados: De nuevo, el punto aquí es el propósito. Los modelos que podemos correr en nuestros equipos tendrán limitaciones provocadas por el hardware en el caso de que se necesite razonamiento profundo, actualización de datos o interacción con agentes. Continuamente las plataformas actualizan sus modelos con más cantidad de datos y mejores capacidades de razonamiento.
- Facilidad de uso: Aunque no es demasiado difícil instalar y desinstalar modelos con Ollama, saber qué modelo instalar o cómo interactuar con ellos requiere un poco más de conocimientos. Las plataformas incluyen herramientas para usos específicos como codificar, crear imágenes o trabajar con documentos.
Utilizando modelos locales podemos realizar muchas de las mismas tareas que hacemos con las plataformas de IA, dependiendo de las limitaciones de los modelos que puedan correr en nuestro hardware.- Conectividad: El uso de modelos locales nos evita la necesidad de estar conectados a un servidor externo. Aunque el uso de la API de las plataformas nos permite encargarles una tarea, desconectarnos y volver a conectarnos cuando esté terminada, igual seguimos necesitando una conexión.
Podemos facilitar la decisión con los siguientes criterios:
- El uso de modelos locales es adecuado cuando: Nuestra máxima prioridad es la privacidad y seguridad de los datos. Nuestro hardware es adecuado para correr los modelos que necesitamos. No disponemos de una conexión permanente a Internet. Necesitamos personalizar el modelo o eliminar restricciones. No se justifica gastar por el uso de plataformas.
- El uso de plataformas de Inteligencia Artificial se recomienda cuando: Necesitamos las mejores capacidades de razonamiento, los modelos más actualizados o una alta capacidad de procesamiento. No disponemos del hardware adecuado o los conocimientos técnicos necesarios para usar los modelos locales. Nuestro uso es demasiado ocasional para tomarnos la molestia de instalar un modelo local.
Para la mayoría de los usuarios domésticos bastará con el uso de los modos gratuitos de ChatGPT o Claude. Para los profesionales independientes, un enfoque de modelo híbrido puede resultar lo ideal.
Cómo saber qué modelos utilizar
La manera más fácil de saber qué modelo podemos correr en nuestro hardware es preguntarle a ChatGPT. Dicho esto, el primer parámetro a tener en cuenta es si tenemos o no GPU en nuestro ordenador.
Contar en nuestro ordenador con una unidad de procesamiento gráfico (tarjeta gráfica) es clave para determinar qué modelos podemos usar, ya que afectará directamente estos factores:
- Velocidad de inferencia: es la medida de qué tan rápido el modelo responde a la consulta que realizamos. Si contamos con una GPU de gama media, es posible que el modelo realice cálculos en paralelo de forma masiva. Sin el uso de GPU, la velocidad es apenas del 10 % respecto al caso anterior.
- Capacidad del modelo: es su habilidad intrínseca para entender, razonar, mantener información y realizar tareas complicadas. En este caso, la memoria RAM es el factor limitante, ya que cuanto más capaz sea el modelo, más memoria necesitará para ejecutarse. Las GPU dedicadas tienen su propia memoria, que suele ser más rápida que la memoria RAM tradicional.
- Temperatura y eficiencia energética: las unidades de procesamiento gráfico están pensadas para soportar grandes cargas de trabajo de forma eficiente y rápida, y al terminar vuelven en poco tiempo a su estado de reposo. Sin GPU, nuestro equipo deberá trabajar por más tiempo y al 100 % de su capacidad, generando más temperatura y consumo energético.
- Variedad de modelos: usando GPU tendremos acceso a modelos más precisos y capaces de realizar tareas como la creación de imágenes o el procesamiento de vídeos, mientras que sin GPU básicamente deberemos conformarnos con tareas basadas en textos.
En el próximo artículo seguiremos hablando sobre cómo elegir un modelo que funcione en nuestro hardware.

