Los modelos pueden desplegarse localmente o en la nube. Los dispositivos locales incluyen portátiles, computadoras de escritorio y otros dispositivos de borde, etc.
También hay diferentes opciones de herramientas para ejecución local: Ollama, así como marcos como vLLM y SGLang.
En este capítulo, primero explicaremos claramente el uso básico de Ollama. La adaptación para otros dispositivos de borde y el uso de marcos como vLLM y SGLang se cubrirán más adelante.
Llamar a grandes modelos a través de una API es el enfoque más sin complicaciones: envía la solicitud, el modelo calcula y devuelve el resultado. Los usuarios no necesitan comprar GPUs ni mantener el entorno subyacente.
Pero el enfoque de API también tiene limitaciones inevitables, principalmente en los siguientes aspectos:
Así que, si tu negocio involucra sensibilidad de datos, requiere funcionamiento puramente fuera de línea o tiene grandes volúmenes de llamadas, el despliegue local es la elección más apropiada.
Ollama es una de las herramientas actualmente más fáciles de usar, empaquetando descarga de modelos, gestión local y servicios API todos juntos. Los usuarios no necesitan escribir código para cargar modelos; solo unos pocos comandos pueden iniciar el modelo directamente.
Si un modelo puede ejecutarse suavemente localmente depende en gran medida de los recursos de hardware de la computadora. Ollama proporciona buen soporte para plataformas de hardware comunes, soportando Windows, Linux y macOS. Ya sea una CPU regular, GPU o un Mac con Apple Silicon, todos pueden usarse para ejecutar modelos.
Ejecución en CPU, incluso sin tarjeta gráfica dedicada, puedes ejecutar modelos a través de la CPU. Dado que la inferencia de grandes modelos requiere cálculo extenso, la velocidad de generación suele ser más lenta con CPU, haciéndola más adecuada para modelos con menos parámetros o escenarios donde los requisitos de velocidad de respuesta no son altos.
Ejecución en GPU, esta es actualmente la forma más común de ejecutar grandes modelos. GPU tiene fuertes capacidades de cálculo paralelo que pueden mejorar significativamente la velocidad de generación del modelo. Cuanto más grande sea el modelo, más memoria de video se necesita generalmente, así que al elegir un modelo, necesitas considerar si la tarjeta gráfica tiene suficiente memoria de video.
Iniciar sesión unirse a la discusión
Ejecución en Apple Silicon, las chips M de Apple usan diseño de memoria unificada, donde CPU y GPU pueden usar la misma memoria. Para usuarios de Mac, si el dispositivo tiene 32GB, 64GB o más de memoria unificada, puedes intentar ejecutar algunos modelos cuantificados con más parámetros.



ollama run qwen3.5:2b
La salida de la página muestra que el modelo ha iniciado exitosamente. En este punto puedes tener conversaciones directamente en el cliente o llamar a la API para probar el modelo.

Código de prueba de API:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:11434/v1",
api_key="ollama",
)
response = client.chat.completions.create(
model="qwen3.5:2b",
messages=[
{
"role": "system",
"content": "Eres un asistente útil.",
},
{
"role": "user",
"content": "¿Quién eres?",
},
],
temperature=0,
max_tokens=512,
)
print(response.choices[0].message.content)
Resultado:

!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux

ollama-linux y ejecuta el siguiente comando para instalar%cd ollama-linux

sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh
Después de la instalación, mostrará información del punto final API, por defecto 127.0.0.1:11434. Si se muestra la siguiente información, la instalación está completa.

Los pasos de instalación en Linux son iguales a instalar Ollama en ModelScope Notebook arriba.



ollama run qwen3.5:2b
La salida de la página muestra que el modelo ha iniciado exitosamente. En este punto puedes tener conversaciones directamente en el cliente o llamar a la API para probar el modelo.

También puedes chatear en el cliente.

Ollama proporciona muchos repositorios de modelos. Podemos encontrar los modelos que necesitamos en ModelScope e iniciarlos con Ollama.
Para servicios residenciales, el kernel único de Jupyter solo puede ejecutar una celda a la vez, lo que dificulta ejecutar las celdas siguientes. Por lo tanto, esta parte debe ejecutarse en la terminal. Después de abrir el Notebook, ve directamente al área de trabajo, donde verás "Terminal" en la parte inferior. Haz clic.

Escribe en la terminal:
ollama serve

Qwen3-4B-GGUF. La primera vez que el modelo se ejecuta, necesita descargar los archivos correspondientes del repositorio de modelos. Este comando también debe ejecutarse en la terminal. Puedes abrir una nueva terminal y ejecutar el siguiente comando:
ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF

En este punto, el modelo ha iniciado. Puedes llamar a la API para probar si el punto final del modelo está conectado. El código es el siguiente:
import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
"model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
"messages": [
{
"role": "user",
"content": "Hola, por favor preséntate"
}
],
"max_tokens": 100
}
response = requests.post(url, json=data)
print("Código de estado:", response.status_code)
print(response.text)
Si la llamada al modelo es exitosa, mostrará el resultado correspondiente del modelo.

El proceso experimental completo involucrado en este capítulo se encuentra en: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c