मॉडल को स्थानीय रूप से या क्लाउड में तैनात किया जा सकता है। स्थानीय उपकरणों में लैपटॉप, डेस्कटॉप और अन्य एज डिवाइस शामिल हैं।
स्थानीय चलाने के लिए विभिन्न टूल विकल्प भी हैं: Ollama, साथ ही vLLM और SGLang जैसे फ्रेमवर्क।
इस अध्याय में, हम पहले Ollama के बुनियादी उपयोग को स्पष्ट रूप से समझाएंगे। अन्य एज डिवाइसों के लिए अनुकूलन और vLLM और SGLang जैसे फ्रेमवर्क का उपयोग बाद में कवर किया जाएगा।
API के माध्यम से बड़े मॉडल को कॉल करना सबसे परेशानी मुक्त दृष्टिकोण है: अनुरोध भेजें, मॉडल गणना करता है और परिणाम लौटाता है। उपयोगकर्ताओं को GPU खरीदने या अंतर्निहित वातावरण को बनाए रखने की आवश्यकता नहीं है।
लेकिन API दृष्टिकोण में अपरिहार्य सीमाएं भी हैं, मुख्य रूप से निम्नलिखित पहलुओं में:
इसलिए, यदि आपका व्यवसाय डेटा संवेदनशीलता, शुद्ध ऑफलाइन संचालन या बड़े कॉल वॉल्यूम शामिल करता है, तो स्थानीय तैनाती अधिक उपयुक्त विकल्प है।
Ollama वर्तमान में सबसे उपयोगी में से एक है, मॉडल डाउनलोडिंग, स्थानीय प्रबंधन और API सेवाओं को एक साथ पैकेजिंग करता है। उपयोगकर्ताओं को मॉडल लोड करने के लिए कोड लिखने की आवश्यकता नहीं है; केवल कुछ कमांड सीधे मॉडल शुरू कर सकते हैं।
क्या कोई मॉडल स्थानीय रूप से सुचारू रूप से चल सकता है, यह काफी हद तक कंप्यूटर के हार्डवेयर संसाधनों पर निर्भर करता है। Ollama सामान्य हार्डवेयर प्लेटफार्मों के लिए अच्छा समर्थन प्रदान करता है, Windows, Linux और macOS का समर्थन करता है। चाहे नियमित CPU, GPU हो या Apple Silicon वाला Mac, सभी मॉडल चलाने के लिए उपयोग किए जा सकते हैं।
CPU चलाना, समर्पित ग्राफिक्स कार्ड के बिना भी, आप CPU के माध्यम से मॉडल चला सकते हैं। चूंकि बड़े मॉडल इन्फरेंस के लिए व्यापक गणना की आवश्यकता होती है, CPU के साथ जनरेशन गति आमतौर पर धीमी होती है, जिससे यह छोटे पैरामीटर वाले मॉडल या प्रतिक्रिया गति की आवश्यकताएं अधिक न होने वाले परिदृश्यों के लिए अधिक उपयुक्त है।
GPU चलाना, यह वर्तमान में बड़े मॉडल चलाने का अधिक सामान्य तरीका है। GPU में मजबूत समानांतर कंप्यूटिंग क्षमताएं हैं जो मॉडल की जनरेशन गति में काफी सुधार कर सकती हैं। मॉडल जितना बड़ा होगा, आमतौर पर उतनी ही अधिक वीडियो मेमोरी की आवश्यकता होगी, इसलिए मॉडल चुनते समय, आपको यह विचार करना होगा कि ग्राफिक्स कार्ड में पर्याप्त वीडियो मेमोरी है या नहीं।
Apple Silicon चलाना, Apple की M-सीरीज चिप्स यूनिफाइड मेमोरी डिज़ाइन का उपयोग करती हैं, जहां CPU और GPU समान मेमोरी का उपयोग कर सकते हैं। Mac उपयोगकर्ताओं के लिए, यदि डिवाइस में 32GB, 64GB या अधिक यूनिफाइड मेमोरी है, तो आप कुछ बड़े पैरामीटर वाले क्वांटाइज्ड मॉडल चलाने का प्रयास कर सकते हैं।
साइन इन करें चर्चा में शामिल हों



ollama run qwen3.5:2b
पेज आउटपुट दिखाता है कि मॉडल सफलतापूर्वक शुरू हो गया है। इस बिंदु पर, आप सीधे क्लाइंट में बातचीत कर सकते हैं या मॉडल का परीक्षण करने के लिए API कॉल कर सकते हैं।

API परीक्षण कोड:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:11434/v1",
api_key="ollama",
)
response = client.chat.completions.create(
model="qwen3.5:2b",
messages=[
{
"role": "system",
"content": "आप एक सहायक सहायक हैं।",
},
{
"role": "user",
"content": "आप कौन हैं?",
},
],
temperature=0,
max_tokens=512,
)
print(response.choices[0].message.content)
परिणाम:

!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux

ollama-linux फ़ोल्डर में जाएं और इंस्टॉल करने के लिए निम्नलिखित कमांड चलाएं%cd ollama-linux

sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh
इंस्टॉलेशन पूरा होने के बाद, API एंडपॉइंट जानकारी दिखाई देगी, डिफ़ॉल्ट 127.0.0.1:11434। यदि निम्नलिखित जानकारी दिखाई देती है, तो इंस्टॉलेशन पूरा हो गया है।

Linux पर इंस्टॉलेशन चरण ऊपर ModelScope Notebook में Ollama इंस्टॉल करने के समान हैं।



ollama run qwen3.5:2b
पेज आउटपुट दिखाता है कि मॉडल सफलतापूर्वक शुरू हो गया है। इस बिंदु पर, आप सीधे क्लाइंट में बातचीत कर सकते हैं या मॉडल का परीक्षण करने के लिए API कॉल कर सकते हैं।

आप क्लाइंट में चैट भी कर सकते हैं।

Ollama कई मॉडल रिपॉज़िटरी प्रदान करता है। हम ModelScope में आवश्यक मॉडल ढूंढ सकते हैं और उन्हें Ollama से शुरू कर सकते हैं।
निवास सेवाओं के लिए, Jupyter का एकल कर्नेल एक समय में केवल एक सेल निष्पादित कर सकता है, जिससे बाद की सेल का निष्पादन कठिन हो जाता है। इसलिए इस भाग को टर्मिनल में निष्पादित किया जाना चाहिए। Notebook खोलने के बाद, सीधे वर्कस्पेस में जाएं, नीचे "टर्मिनल" दिखाई देगा। उस पर क्लिक करें।

टर्मिनल में टाइप करें:
ollama serve

Qwen3-4B-GGUF। मॉडल के पहली बार चलने पर, उसे मॉडल रिपॉज़िटरी से संबंधित फ़ाइलें डाउनलोड करनी होंगी। इस कमांड को भी टर्मिनल में निष्पादित किया जाना चाहिए। आप एक नया टर्मिनल खोल सकते हैं और निम्नलिखित कमांड चला सकते हैं:
ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF

इस बिंदु पर, मॉडल शुरू हो गया है। आप API कॉल करके परीक्षण कर सकते हैं कि मॉडल एंडपॉइंट कनेक्टेड है या नहीं। कोड इस प्रकार है:
import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
"model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
"messages": [
{
"role": "user",
"content": "नमस्ते, कृपया अपना परिचय दें"
}
],
"max_tokens": 100
}
response = requests.post(url, json=data)
print("स्थिति कोड:", response.status_code)
print(response.text)
यदि मॉडल कॉल सफल है, तो यह संबंधित मॉडल परिणाम आउटपुट करेगा।

इस अध्याय में शामिल संपूर्ण प्रयोगात्मक प्रक्रिया यहां उपलब्ध है: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c