Modellen kunnen lokaal of in de cloud worden gedeployed. Lokale apparaten omvatten laptops, desktops en andere edge-apparaten.
Er zijn ook verschillende keuzes van tools voor lokale uitvoering: Ollama, evenals frameworks zoals vLLM en SGLang.
In dit hoofdstuk leggen we eerst het basisgebruik van Ollama uit. Het aanpassen voor andere edge-apparaten en het gebruik van frameworks zoals vLLM en SGLang zal later worden behandeld.
Grote modellen aanroepen via een API is de meest zorgeloze aanpak: verzend het verzoek, het model berekent en retourneert het resultaat. Gebruikers hoeven geen GPUs aan te schaffen of de onderliggende omgeving te onderhouden.
Maar de API-aanpak heeft ook onvermijdelijke beperkingen, voornamelijk in de volgende aspecten:
Dus, als uw bedrijf gevoeligheid van gegevens omvat, puur offline werking vereist of grote belvolumes heeft, is lokale implementatie de meest geschikte keuze.
Ollama is een van de momenteel meest gebruiksvriendelijke tools, die modellen downloaden, lokaal beheer en API-services allemaal samenbundelt. Gebruikers hoeven geen code te schrijven om modellen te laden; slechts enkele opdrachten kunnen het model direct starten.
Of een model lokaal soepel kan draaien, hangt grotendeels af van de hardwarebronnen van de computer. Ollama biedt goede ondersteuning voor gangbare hardwareplatforms, met ondersteuning voor Windows, Linux en macOS. Of het nu een gewone CPU, GPU of een Mac met Apple Silicon is, ze kunnen allemaal worden gebruikt om modellen uit te voeren.
CPU-uitvoering, zelfs zonder een dedicated grafische kaart, kunt u modellen via CPU uitvoeren. Aangezien de inferentie van grote modellen uitgebreide berekening vereist, is de gegenereerde snelheid meestal langzamer met CPU, waardoor het meer geschikt is voor modellen met minder parameters of scenario's waarin de reactiesnelheid niet hoog is.
GPU-uitvoering, dit is momenteel de meer gebruikelijke manier om grote modellen uit te voeren. GPU heeft sterke parallelle rekenmogelijkheden die de gegenereerde snelheid van het model aanzienlijk kunnen verbeteren. Hoe groter het model, hoe meer videogeheugen meestal nodig is, dus bij het kiezen van een model moet u overwegen of de grafische kaart voldoende videogeheugen heeft.
Inloggen deelnemen aan de discussie
Apple Silicon-uitvoering, Apples M-serie chips gebruiken unified memory ontwerp, waar CPU en GPU hetzelfde geheugen kunnen gebruiken. Voor Mac-gebruikers, als het apparaat 32GB, 64GB of meer unified memory heeft, kunt u proberen enkele grotere parameter gequantificeerde modellen uit te voeren.



ollama run qwen3.5:2b
De paginaweergave toont dat het model succesvol is gestart. Op dit punt kunt u direct chatten in de client of de API aanroepen om het model te testen.

API-testcode:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:11434/v1",
api_key="ollama",
)
response = client.chat.completions.create(
model="qwen3.5:2b",
messages=[
{
"role": "system",
"content": "U bent een behulpzame assistent.",
},
{
"role": "user",
"content": "Wie bent u?",
},
],
temperature=0,
max_tokens=512,
)
print(response.choices[0].message.content)
Resultaat:

!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux

ollama-linux map en voer de volgende opdracht uit om te installeren%cd ollama-linux

sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh
Na de installatie worden API-eindpuntinformatie weergegeven, standaard 127.0.0.1:11434. Als de volgende informatie wordt weergegeven, is de installatie voltooid.

De installatiestappen op Linux zijn hetzelfde als het installeren van Ollama in ModelScope Notebook hierboven.



ollama run qwen3.5:2b
De paginaweergave toont dat het model succesvol is gestart. Op dit punt kunt u direct chatten in de client of de API aanroepen om het model te testen.

U kunt ook chatten in de client.

Ollama biedt veel modelrepositories. We kunnen de modellen vinden die we nodig hebben in ModelScope en ze starten met Ollama.
Voor residentiële diensten kan de enkele kernel van Jupyter slechts één cel tegelijk uitvoeren, waardoor het uitvoeren van volgende cellen moeilijk wordt. Dit deel moet daarom in de terminal worden uitgevoerd. Na het openen van het Notebook, ga direct naar de werkruimte, onderaan staat "Terminal". Klik erop.

Typ in de terminal:
ollama serve

Qwen3-4B-GGUF. De eerste keer dat het model draait, moet het de bijbehorende bestanden downloaden van het modelrepository. Deze opdracht moet ook in de terminal worden uitgevoerd. U kunt een nieuwe terminal openen en de volgende opdracht uitvoeren:
ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF

Op dit punt is het model gestart. U kunt de API aanroepen om te testen of het modeleindpunt is verbonden. De code is als volgt:
import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
"model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
"messages": [
{
"role": "user",
"content": "Hallo, stel jezelf alstublieft voor"
}
],
"max_tokens": 100
}
response = requests.post(url, json=data)
print("Statuscode:", response.status_code)
print(response.text)
Als het modelaanroep succesvol is, wordt het bijbehorende modelresultaat weergegeven.

Het volledige experimentele proces dat in dit hoofdstuk aan de orde is, is beschikbaar op: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c