AIUnlimited
🌳

Fondations IA

🌱
AI Seeds

Partez de zéro

🌿
AI Sprouts

Construisez les fondations

🌳
AI Branches

Mettez en pratique

🏕️
AI Canopy

Approfondissez

🌲
AI Forest

Maîtrisez l'IA

🔨

Maîtrise IA

✏️
AI Sketch

Partez de zéro

🪨
AI Chisel

Construisez les fondations

⚒️
AI Craft

Mettez en pratique

💎
AI Polish

Approfondissez

🏆
AI Masterpiece

Maîtrisez l'IA

📘

Pratique IA

📖
Comprendre les modèles open-source

Fondamentaux et ressources pour les modèles open-source

🎯
Du problème à la tâche modèles

Transformer les problèmes métier en tâches modèles

⚡
Exécuter votre premier modèle

Voyez vos premiers résultats en 30 minutes

🔧
Fine-tuning et évaluation

Affinez les modèles et évaluez les performances

🚀
Systèmes d'application

Construisez des applications IA réelles

🎨
IA générative

Explorez les modèles AIGC open-source

🤖
Agents

Apprenez les frameworks Agent et outils MCP

📐
Fondamentaux supplémentaires

Bases LLM et évaluation

🎓

Claude Académie

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Labo

7 expériences chargées
🧬Bac à sable neuronal🤖IA ou Humain ?🥋Dojo d'ingénierie de prompts🏁Course d'algorithmes🧠Quiz IA🏗️Canevas de conception système
🎯Entretien simuléEntrer dans le labo→
🚀

Développement de carrière

🚀
Rampe de lancement entretien

Commencez votre parcours

🌟
Maîtrise comportementale

Maîtrisez les compétences relationnelles

💻
Entretiens techniques

Réussissez l'épreuve de code

🤖
Entretiens IA et ML

Maîtrisez l'entretien ML

🏆
Offre et au-delà

Décrochez la meilleure offre

Commencer
AIUnlimited

Licence MIT

沪ICP备18025655号-11

Apprendre

  • Bases de l'IA
  • Pratique IA
  • Claude Académie
  • Labo
  • Développement de carrière

Communauté

  • À propos
  • FAQ

Soutien

  • Conditions d'utilisation
  • Politique de confidentialité
  • Contact
Programmes d'IA et d'ingénierie›⚡ Exécuter votre premier modèle›Leçons›Running Models Locally with Ollama
💻
Exécuter votre premier modèle • Débutant⏱️ 20 min de lecture

Running Models Locally with Ollama

Exécutez des modèles open source sur votre laptop, commencez avec Ollama

Les modèles peuvent être déployés localement ou dans le cloud. Les appareils locaux incluent les ordinateurs portables, les ordinateurs de bureau et d'autres appareils de bord, etc.

Il existe également différents choix d'outils pour l'exécution locale : Ollama, ainsi que des frameworks comme vLLM et SGLang.

Dans ce chapitre, nous allons d'abord expliquer clairement l'utilisation de base d'Ollama. L'adaptation pour d'autres appareils de bord et l'utilisation de frameworks comme vLLM et SGLang seront abordées ultérieurement.

Pourquoi voudriez-vous exécuter des modèles sur votre propre ordinateur ?

Appeler de grands modèles via une API est l'approche la plus simple : envoyez la requête, le modèle calcule et renvoie le résultat. Les utilisateurs n'ont pas besoin d'acheter des GPU ni de maintenir l'environnement sous-jacent.

Mais l'approche API a aussi des limitations inévitables, principalement dans les aspects suivants :

  • Sécurité des données : les documents principaux, la confidentialité des clients et les données métier internes ne peuvent pas être envoyés directement à des clouds publics tiers.
  • Disponibilité hors ligne : les environnements de production comme les lignes dédiées intranet ne peuvent tout simplement pas se connecter au réseau externe.
  • Contrôle des coûts : lorsque le volume d'appels est élevé et stable, construire votre propre serveur est généralement plus rentable que de payer au token.

Donc, si votre activité implique des données sensibles, nécessite un fonctionnement purement hors ligne ou a de forts volumes d'appels, le déploiement local est le choix le plus approprié.

D'abord vérifiez le système et le matériel de votre laptop

Ollama est l'un des outils actuellement les plus simples à utiliser, regroupant le téléchargement de modèles, la gestion locale et les services API. Les utilisateurs n'ont pas besoin d'écrire du code pour charger les modèles ; quelques commandes suffisent pour démarrer directement le modèle.

La capacité d'un modèle à s'exécuter localement dépend largement des ressources matérielles de l'ordinateur. Ollama offre un bon support pour les plateformes matérielles courantes, en supportant Windows, Linux et macOS. Qu'il s'agisse d'un CPU ordinaire, d'un GPU ou d'un Mac avec Apple Silicon, ils peuvent tous être utilisés pour exécuter des modèles.

Exécution CPU, même sans carte graphique dédiée, vous pouvez exécuter des modèles via le CPU. Étant donné que l'inférence de grands modèles nécessite un calcul intensif, la vitesse de génération est généralement plus lente avec le CPU, ce qui le rend plus adapté aux modèles à plus petit nombre de paramètres ou aux scénarios où les exigences de vitesse de réponse ne sont pas élevées.

Exécution GPU, c'est actuellement le moyen le plus courant d'exécuter de grands modèles. Le GPU possède de fortes capacités de calcul parallèle qui peuvent améliorer significativement la vitesse de génération du modèle. Plus le modèle est grand, plus la mémoire vidéo est généralement nécessaire, donc lors du choix d'un modèle, vous devez considérer si la carte graphique dispose de suffisamment de mémoire vidéo.

Leçon 3 sur 50% terminé
←Server Configuration for Models

Discussion

Se connecter pour rejoindre la discussion

Exécution Apple Silicon, les puces M d'Apple utilisent une conception de mémoire unifiée, où le CPU et le GPU peuvent utiliser la même mémoire. Pour les utilisateurs de Mac, si l'appareil a 32 Go, 64 Go ou plus de mémoire unifiée, vous pouvez essayer d'exécuter certains modèles quantifiés à plus grand nombre de paramètres.

Choisissez votre système d'exploitation, installez Ollama

Installer Ollama sur Windows

  1. D'abord, sur le site officiel d'Ollama, Télécharger Ollama et télécharger la version Windows correspondante
illustration
  1. Après le téléchargement, cliquez directement sur installer, cliquez sur continuer
illustration
  1. Après l'installation, il indique que le service Ollama a démarré
illustration
  1. Dans cmd, démarrez le modèle que vous voulez charger, par exemple : qwen3.5:2b, tapez directement la commande dans le terminal
ollama run qwen3.5:2b

La sortie de la page indique que le modèle a démarré avec succès. À ce moment, vous pouvez avoir des conversations directement dans le client ou appeler l'API pour tester le modèle.

illustration

Code de test de l'API :

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:11434/v1",
    api_key="ollama",  
)

response = client.chat.completions.create(
    model="qwen3.5:2b", 
    messages=[
        {
            "role": "system",
            "content": "Vous êtes un assistant utile.",
        },
        {
            "role": "user",
            "content": "Qui êtes-vous ?",
        },
    ],
    temperature=0,
    max_tokens=512,
)

print(response.choices[0].message.content)

Résultat :

illustration

Installer Ollama sur ModelScope Notebook

  1. Installer Ollama dans le Notebook, d'abord télécharger le paquet d'installation, exécutez la commande suivante
!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux  
illustration
  1. Après le téléchargement du paquet d'installation, entrez dans le dossier ollama-linux et exécutez la commande suivante pour installer
%cd ollama-linux
illustration
sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh

Après l'installation, les informations de point de terminaison API seront affichées, par défaut 127.0.0.1:11434. Si les informations suivantes s'affichent, l'installation est terminée.

illustration

Installer Ollama sur Linux

Les étapes d'installation sur Linux sont les mêmes que pour installer Ollama dans ModelScope Notebook ci-dessus.

Installer Ollama sur Mac

  1. D'abord, sur le site officiel d'Ollama, Télécharger Ollama et télécharger la version macOS correspondante
illustration
  1. Après le téléchargement, double-cliquez sur le fichier téléchargé et glissez ollama dans Applications
illustration
  1. Après l'installation, il indique que le service Ollama a démarré
illustration
  1. Dans cmd, démarrez le modèle que vous voulez charger, par exemple : qwen3.5:2b, tapez directement la commande dans le terminal
ollama run qwen3.5:2b

La sortie de la page indique que le modèle a démarré avec succès. À ce moment, vous pouvez avoir des conversations directement dans le client ou appeler l'API pour tester le modèle.

illustration

Vous pouvez également discuter dans le client.

illustration

Vous pouvez également télécharger des modèles depuis ModelScope et les démarrer avec Ollama

Ollama fournit de nombreux dépôts de modèles. Nous pouvons trouver les modèles dont nous avons besoin dans ModelScope et les démarrer avec Ollama.

  1. Démarrer le service Ollama

Pour les services résidents, le noyau unique de Jupyter ne peut exécuter qu'une seule cellule à la fois, ce qui rend difficile l'exécution des cellules suivantes. Cette partie doit donc être exécutée dans le terminal. Après avoir ouvert le Notebook, allez directement dans l'espace de travail, où vous verrez "Terminal" en bas. Cliquez dessus.

illustration

Entrez dans le terminal :

ollama serve
illustration
  1. Ensuite, exécutez le modèle que nous voulons démarrer, par exemple : Qwen3-4B-GGUF. La première fois que le modèle s'exécute, il doit télécharger les fichiers correspondants depuis le dépôt de modèles. Cette commande doit également être exécutée dans le terminal. Vous pouvez ouvrir un nouveau terminal et exécuter la commande suivante :
illustration
 ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF
illustration

À ce moment, le modèle a démarré. Vous pouvez appeler l'API pour tester si le point de terminaison du modèle est connecté. Le code est le suivant :

import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
    "model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
    "messages": [
        {
            "role": "user",
            "content": "Bonjour, veuillez vous présenter"
        }
    ],
    "max_tokens": 100
}

response = requests.post(url, json=data)

print("Code de statut:", response.status_code)
print(response.text)

Si l'appel du modèle est réussi, il affichera le résultat correspondant du modèle.

illustration

Le processus expérimental complet impliqué dans ce chapitre est disponible à : https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c