AIUnlimited
🌳

Fundamentos de IA

🌱
AI Seeds

Empieza desde cero

🌿
AI Sprouts

Construye bases

🌳
AI Branches

Aplica en la práctica

🏕️
AI Canopy

Profundiza

🌲
AI Forest

Domina la IA

🔨

Maestría en IA

✏️
AI Sketch

Empieza desde cero

🪨
AI Chisel

Construye bases

⚒️
AI Craft

Aplica en la práctica

💎
AI Polish

Profundiza

🏆
AI Masterpiece

Domina la IA

📘

Práctica de IA

📖
Entendiendo modelos open-source

Fundamentos y recursos para modelos open-source

🎯
Del problema a la tarea del modelo

Convertir problemas de negocio en tareas de modelos

⚡
Ejecutando tu primer modelo

Mira tus primeros resultados en 30 minutos

🔧
Fine-tuning y evaluación

Ajusta modelos y evalúa el rendimiento

🚀
Sistemas de aplicación

Construye aplicaciones IA del mundo real

🎨
IA generativa

Explora modelos AIGC open-source

🤖
Agentes

Aprende frameworks Agent y herramientas MCP

📐
Fundamentos complementarios

Fundamentos LLM y evaluación

🎓

Claude Academia

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Laboratorio

7 experimentos cargados
🧬Sandbox de Red Neuronal🤖¿IA o Humano?🥋Dojo de Prompt Engineering🏁Carrera de Algoritmos🧠Trivia de IA🏗️Lienzo de diseño de sistemas
🎯Entrevista simuladaEntrar al Laboratorio→
🚀

Desarrollo profesional

🚀
Plataforma de Entrevistas

Comienza tu camino

🌟
Dominio Conductual

Domina las habilidades blandas

💻
Entrevistas Técnicas

Supera la ronda de código

🤖
Entrevistas de IA y ML

Dominio en entrevistas de ML

🏆
Oferta y Más Allá

Consigue la mejor oferta

Empezar
AIUnlimited

Licencia MIT

沪ICP备18025655号-11

Aprender

  • Fundamentos de IA
  • Práctica de IA
  • Claude Academia
  • Laboratorio
  • Desarrollo profesional

Comunidad

  • Acerca de
  • Preguntas Frecuentes

Soporte

  • Términos de Servicio
  • Política de Privacidad
  • Contacto
Académicos de IA e Ingeniería›⚡ Ejecutando tu primer modelo›Lecciones›Running Models Locally with Ollama
💻
Ejecutando tu primer modelo • Principiante⏱️ 20 min de lectura

Running Models Locally with Ollama

Ejecuta modelos de código abierto en tu portátil, comienza con Ollama

Los modelos pueden desplegarse localmente o en la nube. Los dispositivos locales incluyen portátiles, computadoras de escritorio y otros dispositivos de borde, etc.

También hay diferentes opciones de herramientas para ejecución local: Ollama, así como marcos como vLLM y SGLang.

En este capítulo, primero explicaremos claramente el uso básico de Ollama. La adaptación para otros dispositivos de borde y el uso de marcos como vLLM y SGLang se cubrirán más adelante.

¿Por qué querrías ejecutar modelos en tu propia computadora?

Llamar a grandes modelos a través de una API es el enfoque más sin complicaciones: envía la solicitud, el modelo calcula y devuelve el resultado. Los usuarios no necesitan comprar GPUs ni mantener el entorno subyacente.

Pero el enfoque de API también tiene limitaciones inevitables, principalmente en los siguientes aspectos:

  • Seguridad de datos: documentos centrales, privacidad de clientes y datos de negocio internos no se pueden enviar directamente a nubes públicas de terceros.
  • Disponibilidad fuera de línea: entornos de producción como líneas dedicadas intranet simplemente no pueden conectarse a la red externa.
  • Control de costos: cuando el volumen de llamadas es grande y estable, construir tu propio servidor es generalmente más rentable que pagar por token.

Así que, si tu negocio involucra sensibilidad de datos, requiere funcionamiento puramente fuera de línea o tiene grandes volúmenes de llamadas, el despliegue local es la elección más apropiada.

Primero revisa el sistema y hardware de tu portátil

Ollama es una de las herramientas actualmente más fáciles de usar, empaquetando descarga de modelos, gestión local y servicios API todos juntos. Los usuarios no necesitan escribir código para cargar modelos; solo unos pocos comandos pueden iniciar el modelo directamente.

Si un modelo puede ejecutarse suavemente localmente depende en gran medida de los recursos de hardware de la computadora. Ollama proporciona buen soporte para plataformas de hardware comunes, soportando Windows, Linux y macOS. Ya sea una CPU regular, GPU o un Mac con Apple Silicon, todos pueden usarse para ejecutar modelos.

Ejecución en CPU, incluso sin tarjeta gráfica dedicada, puedes ejecutar modelos a través de la CPU. Dado que la inferencia de grandes modelos requiere cálculo extenso, la velocidad de generación suele ser más lenta con CPU, haciéndola más adecuada para modelos con menos parámetros o escenarios donde los requisitos de velocidad de respuesta no son altos.

Ejecución en GPU, esta es actualmente la forma más común de ejecutar grandes modelos. GPU tiene fuertes capacidades de cálculo paralelo que pueden mejorar significativamente la velocidad de generación del modelo. Cuanto más grande sea el modelo, más memoria de video se necesita generalmente, así que al elegir un modelo, necesitas considerar si la tarjeta gráfica tiene suficiente memoria de video.

Lección 3 de 50% completado
←Server Configuration for Models

Discusión

Iniciar sesión unirse a la discusión

Ejecución en Apple Silicon, las chips M de Apple usan diseño de memoria unificada, donde CPU y GPU pueden usar la misma memoria. Para usuarios de Mac, si el dispositivo tiene 32GB, 64GB o más de memoria unificada, puedes intentar ejecutar algunos modelos cuantificados con más parámetros.

Elige tu sistema operativo, instala Ollama

Instalar Ollama en Windows

  1. Primero, en el sitio oficial de Ollama, Descargar Ollama y descargar la versión de Windows correspondiente
ilustración
  1. Después de la descarga, haz clic directamente en instalar, haz clic en continuar
ilustración
  1. Después de la instalación, muestra que el servicio Ollama ha iniciado
ilustración
  1. En cmd, inicia el modelo que quieres cargar, por ejemplo: qwen3.5:2b, escribe directamente el comando en la terminal
ollama run qwen3.5:2b

La salida de la página muestra que el modelo ha iniciado exitosamente. En este punto puedes tener conversaciones directamente en el cliente o llamar a la API para probar el modelo.

ilustración

Código de prueba de API:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:11434/v1",
    api_key="ollama",  
)

response = client.chat.completions.create(
    model="qwen3.5:2b", 
    messages=[
        {
            "role": "system",
            "content": "Eres un asistente útil.",
        },
        {
            "role": "user",
            "content": "¿Quién eres?",
        },
    ],
    temperature=0,
    max_tokens=512,
)

print(response.choices[0].message.content)

Resultado:

ilustración

Instalar Ollama en ModelScope Notebook

  1. Instalar Ollama en el Notebook, primero descargar el paquete de instalación, ejecuta el siguiente comando
!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux  
ilustración
  1. Después de descargar el paquete de instalación, entra en la carpeta ollama-linux y ejecuta el siguiente comando para instalar
%cd ollama-linux
ilustración
sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh

Después de la instalación, mostrará información del punto final API, por defecto 127.0.0.1:11434. Si se muestra la siguiente información, la instalación está completa.

ilustración

Instalar Ollama en Linux

Los pasos de instalación en Linux son iguales a instalar Ollama en ModelScope Notebook arriba.

Instalar Ollama en Mac

  1. Primero, en el sitio oficial de Ollama, Descargar Ollama y descargar la versión de macOS correspondiente
ilustración
  1. Después de la descarga, haz doble clic en el archivo descargado y arrastra ollama a Aplicaciones
ilustración
  1. Después de la instalación, muestra que el servicio Ollama ha iniciado
ilustración
  1. En cmd, inicia el modelo que quieres cargar, por ejemplo: qwen3.5:2b, escribe directamente el comando en la terminal
ollama run qwen3.5:2b

La salida de la página muestra que el modelo ha iniciado exitosamente. En este punto puedes tener conversaciones directamente en el cliente o llamar a la API para probar el modelo.

ilustración

También puedes chatear en el cliente.

ilustración

También puedes descargar modelos desde ModelScope e iniciarlos con Ollama

Ollama proporciona muchos repositorios de modelos. Podemos encontrar los modelos que necesitamos en ModelScope e iniciarlos con Ollama.

  1. Iniciar el servicio Ollama

Para servicios residenciales, el kernel único de Jupyter solo puede ejecutar una celda a la vez, lo que dificulta ejecutar las celdas siguientes. Por lo tanto, esta parte debe ejecutarse en la terminal. Después de abrir el Notebook, ve directamente al área de trabajo, donde verás "Terminal" en la parte inferior. Haz clic.

ilustración

Escribe en la terminal:

ollama serve
ilustración
  1. Luego, ejecuta el modelo que queremos iniciar, por ejemplo: Qwen3-4B-GGUF. La primera vez que el modelo se ejecuta, necesita descargar los archivos correspondientes del repositorio de modelos. Este comando también debe ejecutarse en la terminal. Puedes abrir una nueva terminal y ejecutar el siguiente comando:
ilustración
 ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF
ilustración

En este punto, el modelo ha iniciado. Puedes llamar a la API para probar si el punto final del modelo está conectado. El código es el siguiente:

import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
    "model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
    "messages": [
        {
            "role": "user",
            "content": "Hola, por favor preséntate"
        }
    ],
    "max_tokens": 100
}

response = requests.post(url, json=data)

print("Código de estado:", response.status_code)
print(response.text)

Si la llamada al modelo es exitosa, mostrará el resultado correspondiente del modelo.

ilustración

El proceso experimental completo involucrado en este capítulo se encuentra en: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c