AIUnlimited
🌳

AI की नींव

🌱
AI Seeds

शून्य से शुरू करें

🌿
AI Sprouts

नींव बनाएं

🌳
AI Branches

व्यवहार में लागू करें

🏕️
AI Canopy

गहराई में जाएं

🌲
AI Forest

AI में महारत हासिल करें

🔨

AI में महारत

✏️
AI Sketch

शून्य से शुरू करें

🪨
AI Chisel

नींव बनाएं

⚒️
AI Craft

व्यवहार में लागू करें

💎
AI Polish

गहराई में जाएं

🏆
AI Masterpiece

AI में महारत हासिल करें

📘

AI व्यावहारिक

📖
ओपन-सोर्स मॉडल को समझना

ओपन-सोर्स मॉडल की बुनियादी बातें और संसाधन

🎯
समस्या से मॉडल कार्य तक

व्यावसायिक समस्याओं को मॉडल कार्यों में बदलना

⚡
अपना पहला मॉडल चलाना

30 मिनट में अपने पहले परिणाम देखें

🔧
फाइन-ट्यूनिंग और मूल्यांकन

मॉडल फाइन-ट्यून करें और प्रदर्शन का मूल्यांकन करें

🚀
अनुप्रयोग प्रणालियाँ

वास्तविक AI अनुप्रयोग बनाएं

🎨
जनरेटिव AI

ओपन-सोर्स AIGC मॉडल का अन्वेषण करें

🤖
एजेंट

एजेंट फ्रेमवर्क और MCP टूल सीखें

📐
पूरक बुनियादी बातें

LLM की बुनियादी बातें और मूल्यांकन

🎓

क्लाउड अकादमी

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

लैब

7 प्रयोग लोड हुए
🧬Neural Network Playground🤖AI या इंसान?🥋Prompt Engineering Dojo🏁Algorithm Race🧠AI ट्रिविया चैलेंज🏗️सिस्टम डिज़ाइन कैनवस
🎯मॉक इंटरव्यूलैब में जाएँ→
🚀

करियर विकास

🚀
इंटरव्यू लॉन्चपैड

अपनी यात्रा शुरू करें

🌟
व्यवहारिक इंटरव्यू में महारत

सॉफ्ट स्किल्स में महारत

💻
तकनीकी इंटरव्यू

कोडिंग राउंड में सफल हों

🤖
AI और ML इंटरव्यू

ML इंटरव्यू में महारत

🏆
ऑफर और उससे आगे

सबसे अच्छा ऑफर पाएं

सीखना शुरू करें - यह बुनियादी है
AIUnlimited

MIT लाइसेंस

沪ICP备18025655号-11

सीखें

  • AI बुनियादी बातें
  • AI व्यावहारिक
  • क्लाउड अकादमी
  • लैब
  • करियर विकास

समुदाय

  • हमारे बारे में
  • सामान्य प्रश्न

सहायता

  • footer.terms
  • footer.privacy
  • footer.contact
AI और इंजीनियरिंग प्रोग्राम›⚡ अपना पहला मॉडल चलाना›पाठ›Running Models Locally with Ollama
💻
अपना पहला मॉडल चलाना • शुरुआती⏱️ 20 मिनट पढ़ने का समय

Running Models Locally with Ollama

अपने लैपटॉप पर ओपन सोर्स मॉडल चलाएं, Ollama से शुरू करें

मॉडल को स्थानीय रूप से या क्लाउड में तैनात किया जा सकता है। स्थानीय उपकरणों में लैपटॉप, डेस्कटॉप और अन्य एज डिवाइस शामिल हैं।

स्थानीय चलाने के लिए विभिन्न टूल विकल्प भी हैं: Ollama, साथ ही vLLM और SGLang जैसे फ्रेमवर्क।

इस अध्याय में, हम पहले Ollama के बुनियादी उपयोग को स्पष्ट रूप से समझाएंगे। अन्य एज डिवाइसों के लिए अनुकूलन और vLLM और SGLang जैसे फ्रेमवर्क का उपयोग बाद में कवर किया जाएगा।

आप अपने कंप्यूटर पर मॉडल क्यों चलाना चाहेंगे?

API के माध्यम से बड़े मॉडल को कॉल करना सबसे परेशानी मुक्त दृष्टिकोण है: अनुरोध भेजें, मॉडल गणना करता है और परिणाम लौटाता है। उपयोगकर्ताओं को GPU खरीदने या अंतर्निहित वातावरण को बनाए रखने की आवश्यकता नहीं है।

लेकिन API दृष्टिकोण में अपरिहार्य सीमाएं भी हैं, मुख्य रूप से निम्नलिखित पहलुओं में:

  • डेटा सुरक्षा: कोर दस्तावेज, ग्राहक गोपनीयता और आंतरिक व्यापार डेटा सीधे तीसरे पक्ष के सार्वजनिक क्लाउड को नहीं भेजा जा सकता।
  • ऑफलाइन उपलब्धता: इंट्रानेट समर्पित लाइन जैसे उत्पादन वातावरण बाहरी नेटवर्क से कनेक्ट नहीं हो सकते।
  • लागत नियंत्रण: जब कॉल वॉल्यूम बड़ा और स्थिर हो, तो अपना सर्वर बनाना आमतौर पर टोकन के अनुसार भुगतान करने से अधिक लागत प्रभावी होता है।

इसलिए, यदि आपका व्यवसाय डेटा संवेदनशीलता, शुद्ध ऑफलाइन संचालन या बड़े कॉल वॉल्यूम शामिल करता है, तो स्थानीय तैनाती अधिक उपयुक्त विकल्प है।

पहले अपने लैपटॉप के सिस्टम और हार्डवेयर की जांच करें

Ollama वर्तमान में सबसे उपयोगी में से एक है, मॉडल डाउनलोडिंग, स्थानीय प्रबंधन और API सेवाओं को एक साथ पैकेजिंग करता है। उपयोगकर्ताओं को मॉडल लोड करने के लिए कोड लिखने की आवश्यकता नहीं है; केवल कुछ कमांड सीधे मॉडल शुरू कर सकते हैं।

क्या कोई मॉडल स्थानीय रूप से सुचारू रूप से चल सकता है, यह काफी हद तक कंप्यूटर के हार्डवेयर संसाधनों पर निर्भर करता है। Ollama सामान्य हार्डवेयर प्लेटफार्मों के लिए अच्छा समर्थन प्रदान करता है, Windows, Linux और macOS का समर्थन करता है। चाहे नियमित CPU, GPU हो या Apple Silicon वाला Mac, सभी मॉडल चलाने के लिए उपयोग किए जा सकते हैं।

CPU चलाना, समर्पित ग्राफिक्स कार्ड के बिना भी, आप CPU के माध्यम से मॉडल चला सकते हैं। चूंकि बड़े मॉडल इन्फरेंस के लिए व्यापक गणना की आवश्यकता होती है, CPU के साथ जनरेशन गति आमतौर पर धीमी होती है, जिससे यह छोटे पैरामीटर वाले मॉडल या प्रतिक्रिया गति की आवश्यकताएं अधिक न होने वाले परिदृश्यों के लिए अधिक उपयुक्त है।

GPU चलाना, यह वर्तमान में बड़े मॉडल चलाने का अधिक सामान्य तरीका है। GPU में मजबूत समानांतर कंप्यूटिंग क्षमताएं हैं जो मॉडल की जनरेशन गति में काफी सुधार कर सकती हैं। मॉडल जितना बड़ा होगा, आमतौर पर उतनी ही अधिक वीडियो मेमोरी की आवश्यकता होगी, इसलिए मॉडल चुनते समय, आपको यह विचार करना होगा कि ग्राफिक्स कार्ड में पर्याप्त वीडियो मेमोरी है या नहीं।

Apple Silicon चलाना, Apple की M-सीरीज चिप्स यूनिफाइड मेमोरी डिज़ाइन का उपयोग करती हैं, जहां CPU और GPU समान मेमोरी का उपयोग कर सकते हैं। Mac उपयोगकर्ताओं के लिए, यदि डिवाइस में 32GB, 64GB या अधिक यूनिफाइड मेमोरी है, तो आप कुछ बड़े पैरामीटर वाले क्वांटाइज्ड मॉडल चलाने का प्रयास कर सकते हैं।

पाठ 3 / 50% पूर्ण
←Server Configuration for Models

चर्चा

साइन इन करें चर्चा में शामिल हों

अपना ऑपरेटिंग सिस्टम चुनें, Ollama इंस्टॉल करें

Windows पर Ollama इंस्टॉल करें

  1. पहले, Ollama की आधिकारिक वेबसाइट पर, Ollama डाउनलोड करें और संबंधित Windows संस्करण डाउनलोड करें
चित्र
  1. डाउनलोड पूरा होने के बाद, सीधे इंस्टॉल पर क्लिक करें, जारी रखें पर क्लिक करें
चित्र
  1. इंस्टॉलेशन पूरा होने के बाद, यह दिखाता है कि Ollama सेवा शुरू हो गई है
चित्र
  1. cmd में, वह मॉडल शुरू करें जिसे आप लोड करना चाहते हैं, उदाहरण के लिए: qwen3.5:2b, टर्मिनल में सीधे कमांड टाइप करें
ollama run qwen3.5:2b

पेज आउटपुट दिखाता है कि मॉडल सफलतापूर्वक शुरू हो गया है। इस बिंदु पर, आप सीधे क्लाइंट में बातचीत कर सकते हैं या मॉडल का परीक्षण करने के लिए API कॉल कर सकते हैं।

चित्र

API परीक्षण कोड:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:11434/v1",
    api_key="ollama",  
)

response = client.chat.completions.create(
    model="qwen3.5:2b", 
    messages=[
        {
            "role": "system",
            "content": "आप एक सहायक सहायक हैं।",
        },
        {
            "role": "user",
            "content": "आप कौन हैं?",
        },
    ],
    temperature=0,
    max_tokens=512,
)

print(response.choices[0].message.content)

परिणाम:

चित्र

ModelScope Notebook पर Ollama इंस्टॉल करें

  1. Notebook में Ollama इंस्टॉल करें, पहले इंस्टॉलेशन पैकेज डाउनलोड करें, निम्नलिखित कमांड चलाएं
!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux  
चित्र
  1. इंस्टॉलेशन पैकेज डाउनलोड होने के बाद, ollama-linux फ़ोल्डर में जाएं और इंस्टॉल करने के लिए निम्नलिखित कमांड चलाएं
%cd ollama-linux
चित्र
sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh

इंस्टॉलेशन पूरा होने के बाद, API एंडपॉइंट जानकारी दिखाई देगी, डिफ़ॉल्ट 127.0.0.1:11434। यदि निम्नलिखित जानकारी दिखाई देती है, तो इंस्टॉलेशन पूरा हो गया है।

चित्र

Linux पर Ollama इंस्टॉल करें

Linux पर इंस्टॉलेशन चरण ऊपर ModelScope Notebook में Ollama इंस्टॉल करने के समान हैं।

Mac पर Ollama इंस्टॉल करें

  1. पहले, Ollama की आधिकारिक वेबसाइट पर, Ollama डाउनलोड करें और संबंधित macOS संस्करण डाउनलोड करें
चित्र
  1. डाउनलोड पूरा होने के बाद, डाउनलोड की गई फ़ाइल पर डबल-क्लिक करें और Ollama को एप्लिकेशन में खींचें
चित्र
  1. इंस्टॉलेशन पूरा होने के बाद, यह दिखाता है कि Ollama सेवा शुरू हो गई है
चित्र
  1. cmd में, वह मॉडल शुरू करें जिसे आप लोड करना चाहते हैं, उदाहरण के लिए: qwen3.5:2b, टर्मिनल में सीधे कमांड टाइप करें
ollama run qwen3.5:2b

पेज आउटपुट दिखाता है कि मॉडल सफलतापूर्वक शुरू हो गया है। इस बिंदु पर, आप सीधे क्लाइंट में बातचीत कर सकते हैं या मॉडल का परीक्षण करने के लिए API कॉल कर सकते हैं।

चित्र

आप क्लाइंट में चैट भी कर सकते हैं।

चित्र

आप ModelScope से मॉडल डाउनलोड करके Ollama से भी शुरू कर सकते हैं

Ollama कई मॉडल रिपॉज़िटरी प्रदान करता है। हम ModelScope में आवश्यक मॉडल ढूंढ सकते हैं और उन्हें Ollama से शुरू कर सकते हैं।

  1. Ollama सेवा शुरू करें

निवास सेवाओं के लिए, Jupyter का एकल कर्नेल एक समय में केवल एक सेल निष्पादित कर सकता है, जिससे बाद की सेल का निष्पादन कठिन हो जाता है। इसलिए इस भाग को टर्मिनल में निष्पादित किया जाना चाहिए। Notebook खोलने के बाद, सीधे वर्कस्पेस में जाएं, नीचे "टर्मिनल" दिखाई देगा। उस पर क्लिक करें।

चित्र

टर्मिनल में टाइप करें:

ollama serve
चित्र
  1. इसके बाद, वह मॉडल चलाएं जिसे हम शुरू करना चाहते हैं, उदाहरण के लिए: Qwen3-4B-GGUF। मॉडल के पहली बार चलने पर, उसे मॉडल रिपॉज़िटरी से संबंधित फ़ाइलें डाउनलोड करनी होंगी। इस कमांड को भी टर्मिनल में निष्पादित किया जाना चाहिए। आप एक नया टर्मिनल खोल सकते हैं और निम्नलिखित कमांड चला सकते हैं:
चित्र
 ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF
चित्र

इस बिंदु पर, मॉडल शुरू हो गया है। आप API कॉल करके परीक्षण कर सकते हैं कि मॉडल एंडपॉइंट कनेक्टेड है या नहीं। कोड इस प्रकार है:

import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
    "model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
    "messages": [
        {
            "role": "user",
            "content": "नमस्ते, कृपया अपना परिचय दें"
        }
    ],
    "max_tokens": 100
}

response = requests.post(url, json=data)

print("स्थिति कोड:", response.status_code)
print(response.text)

यदि मॉडल कॉल सफल है, तो यह संबंधित मॉडल परिणाम आउटपुट करेगा।

चित्र

इस अध्याय में शामिल संपूर्ण प्रयोगात्मक प्रक्रिया यहां उपलब्ध है: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c