మోడల్లను స్థానికంగా లేదా క్లౌడ్లో డిప్లాయ్ చేయవచ్చు. స్థానిక పరికరాలలో ల్యాప్టాప్లు, డెస్క్టాప్లు మరియు ఇతర ఎడ్జ్ పరికరాలు ఉన్నాయి.
స్థానిక రన్నింగ్ కోసం విభిన్న టూల్ ఎంపికలు కూడా ఉన్నాయి: Ollama, అలాగే vLLM మరియు SGLang వంటి ఫ్రేమ్వర్క్లు.
ఈ అధ్యాయంలో, మేము మొదట Ollama యొక్క ప్రాథమిక ఉపయోగాన్ని స్పష్టంగా వివరిస్తాము. ఇతర ఎడ్జ్ పరికరాలకు అనుకూలం మరియు vLLM మరియు SGLang వంటి ఫ్రేమ్వర్క్ల ఉపయోగం తర్వాత కవర్ చేయబడుతుంది.
API ద్వారా పెద్ద మోడల్లను కాల్ చేయడం అత్యంత సులభమైన విధానం: అభ్యర్థనను పంపండి, మోడల్ గణన చేసి ఫలితాన్ని తిరిగి ఇస్తుంది. వినియోగదారులు GPU లను కొనడం లేదా అంతర్లీన వాతావరణాన్ని నిర్వహించడం అవసరం లేదు.
కానీ API విధానం తప్పించలేని పరిమితులను కూడా కలిగి ఉంటుంది, ప్రధానంగా ఈ క్రింది అంశాలలో:
కాబట్టి, మీ వ్యాపారం డేటా సున్నితత్వం కలిగి ఉంటే, పూర్తిగా ఆఫ్లైన్ ఆపరేషన్ అవసరమైతే లేదా పెద్ద కాల్ వాల్యూమ్లు ఉంటే, స్థానిక డిప్లాయ్మెంట్ సరైన ఎంపిక.
Ollama ప్రస్తుతం అత్యంత సులభంగా ఉపయోగించగల సాధనాలలో ఒకటి, మోడల్ డౌన్లోడింగ్, స్థానిక నిర్వహణ మరియు API సేవలను అన్నీ కలిపి ఉంటుంది. వినియోగదారులు మోడల్లను లోడ్ చేయడానికి కోడ్ రాయాల్సిన అవసరం లేదు; కొన్ని కమాండ్లు మాత్రమే మోడల్ను నేరుగా ప్రారంభించగలవు.
మోడల్ స్థానికంగా సజావుగా రన్ అవగలదా లేదా అనేది చాలావరకు కంప్యూటర్ హార్డ్వేర్ వనరులపై ఆధారపడి ఉంటుంది. Ollama సాధారణ హార్డ్వేర్ ప్లాట్ఫామ్ల కోసం మంచి మద్దతు అందిస్తుంది, Windows, Linux మరియు macOS మద్దతు ఇస్తుంది. సాధారణ CPU, GPU లేదా Apple Silicon తో Mac అయినా, అవన్నీ మోడల్లను రన్ చేయడానికి ఉపయోగించవచ్చు.
CPU రన్నింగ్, సమర్పిత గ్రాఫిక్స్ కార్డ్ లేకుండా కూడా, మీరు CPU ద్వారా మోడల్లను రన్ చేయవచ్చు. పెద్ద మోడల్ ఇన్ఫరెన్స్కు విస్తృత గణన అవసరం కాబట్టి, CPU తో జనరేషన్ వేగం సాధారణంగా నెమ్మదిగా ఉంటుంది, ఇది చిన్న పారామీటర్ మోడల్లు లేదా ప్రతిస్పందన వేగం అవసరాలు ఎక్కువగా లేని స్థితులకు మరింత అనుకూలం.
GPU రన్నింగ్, ఇది ప్రస్తుతం పెద్ద మోడల్లను రన్ చేయడానికి ఎక్కువగా ఉపయోగించే మార్గం. GPU బలమైన సమాంతర కంప్యూటింగ్ సామర్థ్యాలను కలిగి ఉంటుంది, అవి మోడల్ జనరేషన్ వేగాన్ని గణనీయంగా మెరుగుపరచగలవు. మోడల్ పెద్దది అయ్యేకొద్దీ, సాధారణంగా వీడియో మెమరీ అవసరం ఎక్కువవుతుంది, కాబట్టి మోడల్ ఎంచుకునేటప్పుడు, గ్రాఫిక్స్ కార్డ్కు తగినంత వీడియో మెమరీ ఉందా అనే విషయాన్ని మీరు పరిగణనలోకి తీసుకోవాలి.
Apple Silicon రన్నింగ్, Apple యొక్క M-సిరీస్ చిప్లు యూనిఫైడ్ మెమరీ డిజైన్ను ఉపయోగిస్తాయి, ఇక్కడ CPU మరియు GPU అదే మెమరీని ఉపయోగించగలవు. Mac వినియోగదారుల కోసం, పరికరం 32GB, 64GB లేదా అంతకంటే ఎక్కువ యూనిఫైడ్ మెమరీ కలిగి ఉంటే, మీరు కొన్ని పెద్ద పారామీటర్ క్వాంటైజ్డ్ మోడల్లను రన్ చేయడానికి ప్రయత్నించవచ్చు.
సైన్ ఇన్ చర్చలో చేరండి



ollama run qwen3.5:2b
పేజీ అవుట్పుట్ మోడల్ విజయవంతంగా ప్రారంభమైందని చూపిస్తుంది. ఈ సమయంలో, మీరు క్లయింట్లో నేరుగా చాట్ చేయవచ్చు లేదా మోడల్ను పరీక్షించడానికి API కాల్ చేయవచ్చు.

API పరీక్ష కోడ్:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:11434/v1",
api_key="ollama",
)
response = client.chat.completions.create(
model="qwen3.5:2b",
messages=[
{
"role": "system",
"content": "మీరు సహాయక సహాయకుడు.",
},
{
"role": "user",
"content": "మీరు ఎవరు?",
},
],
temperature=0,
max_tokens=512,
)
print(response.choices[0].message.content)
ఫలితం:

!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux

ollama-linux ఫోల్డర్లోకి వెళ్ళి ఇన్స్టాల్ చేయడానికి ఈ క్రింది కమాండ్ అమలు చేయండి%cd ollama-linux

sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh
ఇన్స్టాలేషన్ పూర్తయిన తర్వాత, API ఎండ్పాయింట్ సమాచారం చూపిస్తుంది, డిఫాల్ట్ 127.0.0.1:11434. ఈ క్రింది సమాచారం చూపిస్తే, ఇన్స్టాలేషన్ పూర్తయింది.

Linux పై ఇన్స్టాలేషన్ దశలు పైన ModelScope Notebook లో Ollama ఇన్స్టాల్ చేయడం అదే విధంగా ఉంటాయి.



ollama run qwen3.5:2b
పేజీ అవుట్పుట్ మోడల్ విజయవంతంగా ప్రారంభమైందని చూపిస్తుంది. ఈ సమయంలో, మీరు క్లయింట్లో నేరుగా చాట్ చేయవచ్చు లేదా మోడల్ను పరీక్షించడానికి API కాల్ చేయవచ్చు.

మీరు క్లయింట్లో చాట్ కూడా చేయవచ్చు.

Ollama అనేక మోడల్ రిపోజిటరీలను అందిస్తుంది. మేము ModelScope లో మాకు అవసరమైన మోడల్లను కనుగొని Ollama తో ప్రారంభించవచ్చు.
నివాస సేవల కోసం, Jupyter యొక్క ఏకైక కెర్నెల్ ఒకేసారి ఒకే సెల్ను మాత్రమే అమలు చేయగలదు, దీని వలన తదుపరి సెల్ల అమలు కష్టమవుతుంది. కాబట్టి ఈ భాగాన్ని టెర్మినల్లో అమలు చేయాలి. Notebook తెరిచిన తర్వాత, నేరుగా వర్క్స్పేస్కు వెళ్ళండి, దిగువన "టెర్మినల్" కనిపిస్తుంది. దానిపై క్లిక్ చేయండి.

టెర్మినల్లో టైప్ చేయండి:
ollama serve

Qwen3-4B-GGUF. మోడల్ మొదటిసారి రన్ అయినప్పుడు, అది మోడల్ రిపోజిటరీ నుండి సంబంధిత ఫైల్లను డౌన్లోడ్ చేసుకోవాలి. ఈ కమాండ్ కూడా టెర్మినల్లో అమలు చేయాలి. మీరు కొత్త టెర్మినల్ తెరిచి ఈ క్రింది కమాండ్ అమలు చేయవచ్చు:
ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF

ఈ సమయంలో, మోడల్ ప్రారంభమైంది. మోడల్ ఎండ్పాయింట్ కనెక్ట్ అయిందా లేదా అని పరీక్షించడానికి మీరు API కాల్ చేయవచ్చు. కోడ్ ఈ క్రింది విధంగా ఉంటుంది:
import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
"model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
"messages": [
{
"role": "user",
"content": "హలో, దయచేసి మిమ్మల్ని పరిచయం చేసుకోండి"
}
],
"max_tokens": 100
}
response = requests.post(url, json=data)
print("స్థితి కోడ్:", response.status_code)
print(response.text)
మోడల్ కాల్ విజయవంతమైతే, అది సంబంధిత మోడల్ ఫలితాన్ని అవుట్పుట్ చేస్తుంది.

ఈ అధ్యాయంలో పాల్గొన్న సంపూర్ణ ప్రయోగాత్మక ప్రక్రియ ఇక్కడ అందుబాటులో ఉంది: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c