AIUnlimited
🌳

AI-Fundamenten

🌱
AI Seeds

Begin bij nul

🌿
AI Sprouts

Bouw een fundament

🌳
AI Branches

Pas toe in de praktijk

🏕️
AI Canopy

Ga de diepte in

🌲
AI Forest

Beheers AI

🔨

AI-Meesterschap

✏️
AI Sketch

Begin bij nul

🪨
AI Chisel

Bouw een fundament

⚒️
AI Craft

Pas toe in de praktijk

💎
AI Polish

Ga de diepte in

🏆
AI Masterpiece

Beheers AI

📘

AI Praktijk

📖
Open-source modellen begrijpen

Fundamenten en bronnen voor open-source modellen

🎯
Van probleem naar modeltaak

Bedrijfsproblemen omzetten in modeltaken

⚡
Uw eerste model uitvoeren

Zie uw eerste resultaten in 30 minuten

🔧
Fijntuning en evaluatie

Modellen fijntunen en prestaties evalueren

🚀
Applicatiesystemen

Bouw echte AI-toepassingen

🎨
Generatieve AI

Verken open-source AIGC-modellen

🤖
Agents

Leer Agent-frameworks en MCP-tools

📐
Aanvullende fundamenten

LLM-basis en evaluatie

🎓

Claude Academie

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Lab

7 experimenten geladen
🧬Neuraal Netwerk Sandbox🤖AI of Mens?🥋Prompt Engineering Dojo🏁Algoritme-race🧠AI-triviant🏗️Systeemontwerp Canvas
🎯Proef-sollicitatieGa naar het lab→
🚀

Carrièreontwikkeling

🚀
Interview Startplatform

Start je reis

🌟
Gedragsinterview Meesterschap

Beheers soft skills

💻
Technische Interviews

Slaag voor de codeerronde

🤖
AI- & ML-interviews

ML-interview meesterschap

🏆
Aanbod & verder

Bemachtig het beste aanbod

Begin met leren
AIUnlimited

MIT-licentie.

沪ICP备18025655号-11

Leren

  • AI-basis
  • AI Praktijk
  • Claude Academie
  • Lab
  • Carrièreontwikkeling

Community

  • Over ons
  • FAQ

Ondersteuning

  • footer.terms
  • footer.privacy
  • footer.contact
AI & Engineering Opleidingen›⚡ Uw eerste model uitvoeren›Lessen›Running Models Locally with Ollama
💻
Uw eerste model uitvoeren • Beginner⏱️ 20 min leestijd

Running Models Locally with Ollama

Voer open source modellen uit op uw laptop, begin met Ollama

Modellen kunnen lokaal of in de cloud worden gedeployed. Lokale apparaten omvatten laptops, desktops en andere edge-apparaten.

Er zijn ook verschillende keuzes van tools voor lokale uitvoering: Ollama, evenals frameworks zoals vLLM en SGLang.

In dit hoofdstuk leggen we eerst het basisgebruik van Ollama uit. Het aanpassen voor andere edge-apparaten en het gebruik van frameworks zoals vLLM en SGLang zal later worden behandeld.

Waarom zou u modellen op uw eigen computer willen uitvoeren?

Grote modellen aanroepen via een API is de meest zorgeloze aanpak: verzend het verzoek, het model berekent en retourneert het resultaat. Gebruikers hoeven geen GPUs aan te schaffen of de onderliggende omgeving te onderhouden.

Maar de API-aanpak heeft ook onvermijdelijke beperkingen, voornamelijk in de volgende aspecten:

  • Gegevensbeveiliging: kerndocumenten, klantgegevens en interne bedrijfsgegevens kunnen niet direct naar openbare clouds van derden worden gestuurd.
  • Offline beschikbaarheid: productieomgevingen zoals intranet-lijnen kunnen eenvoudig geen verbinding maken met het externe netwerk.
  • Kostenbeheer: wanneer het belvolume groot en stabiel is, is het bouwen van uw eigen server meestal kosteneffectiever dan betalen per token.

Dus, als uw bedrijf gevoeligheid van gegevens omvat, puur offline werking vereist of grote belvolumes heeft, is lokale implementatie de meest geschikte keuze.

Controleer eerst het systeem en de hardware van uw laptop

Ollama is een van de momenteel meest gebruiksvriendelijke tools, die modellen downloaden, lokaal beheer en API-services allemaal samenbundelt. Gebruikers hoeven geen code te schrijven om modellen te laden; slechts enkele opdrachten kunnen het model direct starten.

Of een model lokaal soepel kan draaien, hangt grotendeels af van de hardwarebronnen van de computer. Ollama biedt goede ondersteuning voor gangbare hardwareplatforms, met ondersteuning voor Windows, Linux en macOS. Of het nu een gewone CPU, GPU of een Mac met Apple Silicon is, ze kunnen allemaal worden gebruikt om modellen uit te voeren.

CPU-uitvoering, zelfs zonder een dedicated grafische kaart, kunt u modellen via CPU uitvoeren. Aangezien de inferentie van grote modellen uitgebreide berekening vereist, is de gegenereerde snelheid meestal langzamer met CPU, waardoor het meer geschikt is voor modellen met minder parameters of scenario's waarin de reactiesnelheid niet hoog is.

GPU-uitvoering, dit is momenteel de meer gebruikelijke manier om grote modellen uit te voeren. GPU heeft sterke parallelle rekenmogelijkheden die de gegenereerde snelheid van het model aanzienlijk kunnen verbeteren. Hoe groter het model, hoe meer videogeheugen meestal nodig is, dus bij het kiezen van een model moet u overwegen of de grafische kaart voldoende videogeheugen heeft.

Les 3 van 50% voltooid
←Server Configuration for Models

Discussie

Inloggen deelnemen aan de discussie

Apple Silicon-uitvoering, Apples M-serie chips gebruiken unified memory ontwerp, waar CPU en GPU hetzelfde geheugen kunnen gebruiken. Voor Mac-gebruikers, als het apparaat 32GB, 64GB of meer unified memory heeft, kunt u proberen enkele grotere parameter gequantificeerde modellen uit te voeren.

Kies uw besturingssysteem, installeer Ollama

Ollama installeren op Windows

  1. Ga eerst naar de officiële Ollama website, Download Ollama en download de bijbehorende Windows-versie
illustratie
  1. Na het downloaden, klik direct op installeren, klik op doorgaan
illustratie
  1. Na de installatie wordt weergegeven dat de Ollama-service is gestart
illustratie
  1. Start in cmd het model dat u wilt laden, bijvoorbeeld: qwen3.5:2b, typ de opdracht direct in de terminal
ollama run qwen3.5:2b

De paginaweergave toont dat het model succesvol is gestart. Op dit punt kunt u direct chatten in de client of de API aanroepen om het model te testen.

illustratie

API-testcode:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:11434/v1",
    api_key="ollama",  
)

response = client.chat.completions.create(
    model="qwen3.5:2b", 
    messages=[
        {
            "role": "system",
            "content": "U bent een behulpzame assistent.",
        },
        {
            "role": "user",
            "content": "Wie bent u?",
        },
    ],
    temperature=0,
    max_tokens=512,
)

print(response.choices[0].message.content)

Resultaat:

illustratie

Ollama installeren op ModelScope Notebook

  1. Installeer Ollama in het Notebook, download eerst het installatiepakket, voer de volgende opdracht uit
!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux  
illustratie
  1. Na het downloaden van het installatiepakket, ga naar de ollama-linux map en voer de volgende opdracht uit om te installeren
%cd ollama-linux
illustratie
sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh

Na de installatie worden API-eindpuntinformatie weergegeven, standaard 127.0.0.1:11434. Als de volgende informatie wordt weergegeven, is de installatie voltooid.

illustratie

Ollama installeren op Linux

De installatiestappen op Linux zijn hetzelfde als het installeren van Ollama in ModelScope Notebook hierboven.

Ollama installeren op Mac

  1. Ga eerst naar de officiële Ollama website, Download Ollama en download de bijbehorende macOS-versie
illustratie
  1. Na het downloaden, dubbelklik op het gedownloade bestand en sleep Ollama naar Toepassingen
illustratie
  1. Na de installatie wordt weergegeven dat de Ollama-service is gestart
illustratie
  1. Start in cmd het model dat u wilt laden, bijvoorbeeld: qwen3.5:2b, typ de opdracht direct in de terminal
ollama run qwen3.5:2b

De paginaweergave toont dat het model succesvol is gestart. Op dit punt kunt u direct chatten in de client of de API aanroepen om het model te testen.

illustratie

U kunt ook chatten in de client.

illustratie

U kunt ook modellen downloaden van ModelScope en ze starten met Ollama

Ollama biedt veel modelrepositories. We kunnen de modellen vinden die we nodig hebben in ModelScope en ze starten met Ollama.

  1. Start de Ollama-service

Voor residentiële diensten kan de enkele kernel van Jupyter slechts één cel tegelijk uitvoeren, waardoor het uitvoeren van volgende cellen moeilijk wordt. Dit deel moet daarom in de terminal worden uitgevoerd. Na het openen van het Notebook, ga direct naar de werkruimte, onderaan staat "Terminal". Klik erop.

illustratie

Typ in de terminal:

ollama serve
illustratie
  1. Voer vervolgens het model uit dat we willen starten, bijvoorbeeld: Qwen3-4B-GGUF. De eerste keer dat het model draait, moet het de bijbehorende bestanden downloaden van het modelrepository. Deze opdracht moet ook in de terminal worden uitgevoerd. U kunt een nieuwe terminal openen en de volgende opdracht uitvoeren:
illustratie
 ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF
illustratie

Op dit punt is het model gestart. U kunt de API aanroepen om te testen of het modeleindpunt is verbonden. De code is als volgt:

import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
    "model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
    "messages": [
        {
            "role": "user",
            "content": "Hallo, stel jezelf alstublieft voor"
        }
    ],
    "max_tokens": 100
}

response = requests.post(url, json=data)

print("Statuscode:", response.status_code)
print(response.text)

Als het modelaanroep succesvol is, wordt het bijbehorende modelresultaat weergegeven.

illustratie

Het volledige experimentele proces dat in dit hoofdstuk aan de orde is, is beschikbaar op: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c