Les modèles peuvent être déployés localement ou dans le cloud. Les appareils locaux incluent les ordinateurs portables, les ordinateurs de bureau et d'autres appareils de bord, etc.
Il existe également différents choix d'outils pour l'exécution locale : Ollama, ainsi que des frameworks comme vLLM et SGLang.
Dans ce chapitre, nous allons d'abord expliquer clairement l'utilisation de base d'Ollama. L'adaptation pour d'autres appareils de bord et l'utilisation de frameworks comme vLLM et SGLang seront abordées ultérieurement.
Appeler de grands modèles via une API est l'approche la plus simple : envoyez la requête, le modèle calcule et renvoie le résultat. Les utilisateurs n'ont pas besoin d'acheter des GPU ni de maintenir l'environnement sous-jacent.
Mais l'approche API a aussi des limitations inévitables, principalement dans les aspects suivants :
Donc, si votre activité implique des données sensibles, nécessite un fonctionnement purement hors ligne ou a de forts volumes d'appels, le déploiement local est le choix le plus approprié.
Ollama est l'un des outils actuellement les plus simples à utiliser, regroupant le téléchargement de modèles, la gestion locale et les services API. Les utilisateurs n'ont pas besoin d'écrire du code pour charger les modèles ; quelques commandes suffisent pour démarrer directement le modèle.
La capacité d'un modèle à s'exécuter localement dépend largement des ressources matérielles de l'ordinateur. Ollama offre un bon support pour les plateformes matérielles courantes, en supportant Windows, Linux et macOS. Qu'il s'agisse d'un CPU ordinaire, d'un GPU ou d'un Mac avec Apple Silicon, ils peuvent tous être utilisés pour exécuter des modèles.
Exécution CPU, même sans carte graphique dédiée, vous pouvez exécuter des modèles via le CPU. Étant donné que l'inférence de grands modèles nécessite un calcul intensif, la vitesse de génération est généralement plus lente avec le CPU, ce qui le rend plus adapté aux modèles à plus petit nombre de paramètres ou aux scénarios où les exigences de vitesse de réponse ne sont pas élevées.
Exécution GPU, c'est actuellement le moyen le plus courant d'exécuter de grands modèles. Le GPU possède de fortes capacités de calcul parallèle qui peuvent améliorer significativement la vitesse de génération du modèle. Plus le modèle est grand, plus la mémoire vidéo est généralement nécessaire, donc lors du choix d'un modèle, vous devez considérer si la carte graphique dispose de suffisamment de mémoire vidéo.
Se connecter pour rejoindre la discussion
Exécution Apple Silicon, les puces M d'Apple utilisent une conception de mémoire unifiée, où le CPU et le GPU peuvent utiliser la même mémoire. Pour les utilisateurs de Mac, si l'appareil a 32 Go, 64 Go ou plus de mémoire unifiée, vous pouvez essayer d'exécuter certains modèles quantifiés à plus grand nombre de paramètres.



ollama run qwen3.5:2b
La sortie de la page indique que le modèle a démarré avec succès. À ce moment, vous pouvez avoir des conversations directement dans le client ou appeler l'API pour tester le modèle.

Code de test de l'API :
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:11434/v1",
api_key="ollama",
)
response = client.chat.completions.create(
model="qwen3.5:2b",
messages=[
{
"role": "system",
"content": "Vous êtes un assistant utile.",
},
{
"role": "user",
"content": "Qui êtes-vous ?",
},
],
temperature=0,
max_tokens=512,
)
print(response.choices[0].message.content)
Résultat :

!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux

ollama-linux et exécutez la commande suivante pour installer%cd ollama-linux

sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh
Après l'installation, les informations de point de terminaison API seront affichées, par défaut 127.0.0.1:11434. Si les informations suivantes s'affichent, l'installation est terminée.

Les étapes d'installation sur Linux sont les mêmes que pour installer Ollama dans ModelScope Notebook ci-dessus.



ollama run qwen3.5:2b
La sortie de la page indique que le modèle a démarré avec succès. À ce moment, vous pouvez avoir des conversations directement dans le client ou appeler l'API pour tester le modèle.

Vous pouvez également discuter dans le client.

Ollama fournit de nombreux dépôts de modèles. Nous pouvons trouver les modèles dont nous avons besoin dans ModelScope et les démarrer avec Ollama.
Pour les services résidents, le noyau unique de Jupyter ne peut exécuter qu'une seule cellule à la fois, ce qui rend difficile l'exécution des cellules suivantes. Cette partie doit donc être exécutée dans le terminal. Après avoir ouvert le Notebook, allez directement dans l'espace de travail, où vous verrez "Terminal" en bas. Cliquez dessus.

Entrez dans le terminal :
ollama serve

Qwen3-4B-GGUF. La première fois que le modèle s'exécute, il doit télécharger les fichiers correspondants depuis le dépôt de modèles. Cette commande doit également être exécutée dans le terminal. Vous pouvez ouvrir un nouveau terminal et exécuter la commande suivante :
ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF

À ce moment, le modèle a démarré. Vous pouvez appeler l'API pour tester si le point de terminaison du modèle est connecté. Le code est le suivant :
import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
"model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
"messages": [
{
"role": "user",
"content": "Bonjour, veuillez vous présenter"
}
],
"max_tokens": 100
}
response = requests.post(url, json=data)
print("Code de statut:", response.status_code)
print(response.text)
Si l'appel du modèle est réussi, il affichera le résultat correspondant du modèle.

Le processus expérimental complet impliqué dans ce chapitre est disponible à : https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c