AIUnlimited
🌳

AI基礎

🌱
AI Seeds(種)

ゼロから始める

🌿
AI Sprouts(芽)

基礎を築く

🌳
AI Branches(枝)

実践に活かす

🏕️
AI Canopy(樹冠)

深く学ぶ

🌲
AI Forest(森)

AIをマスターする

🔨

AIマスタリー

✏️
AI Sketch(スケッチ)

ゼロから始める

🪨
AI Chisel(鑿)

基礎を築く

⚒️
AI Craft(制作)

実践に活かす

💎
AI Polish(磨き上げ)

深く学ぶ

🏆
AI Masterpiece(傑作)

AIをマスターする

📘

AI実践

📖
オープンソースモデルを理解する

オープンソースモデルの基礎とリソース

🎯
問題からモデルタスクへ

ビジネス問題をモデルタスクに変換

⚡
最初のモデルを実行する

30分で最初の結果を見る

🔧
ファインチューニングと評価

モデルをファインチューニングし、パフォーマンスを評価

🚀
アプリケーションシステム

実際のAIアプリケーションを構築

🎨
生成AI

オープンソースAIGCモデルを探索

🤖
エージェント

エージェントフレームワークとMCPツールを学ぶ

📐
補足基礎

LLMの基礎と評価

🎓

Claude アカデミー

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

ラボ

7つの実験がロード済み
🧬ニューラルネットワークサンドボックス🤖AI か人間か?🥋プロンプトエンジニアリング道場🏁アルゴリズムレース🧠AIトリビアチャレンジ🏗️システム設計キャンバス
🎯模擬面接ラボへ入る→
🚀

キャリア発展

🚀
面接ローンチパッド

旅を始めよう

🌟
行動面接マスター

ソフトスキルをマスター

💻
技術面接

コーディング面接を突破

🤖
AI・ML面接

ML面接をマスター

🏆
オファーとその先

最高のオファーを獲得

始める
AIUnlimited

MITライセンス

沪ICP备18025655号-11

学ぶ

  • AI基礎
  • AI実践
  • Claude アカデミー
  • ラボ
  • キャリア発展

コミュニティ

  • 概要
  • よくある質問

サポート

  • footer.terms
  • footer.privacy
  • footer.contact
AI & エンジニアリング アカデミックス›⚡ 最初のモデルを実行する›レッスン›Running Models Locally with Ollama
💻
最初のモデルを実行する • 初級⏱️ 20 分で読める

Running Models Locally with Ollama

ノートパソコンでもオープンソースモデルを実行できる、まずOllamaから

モデルはローカルまたはクラウドにデプロイされます。例えば、ローカルデバイスにはノートパソコン、デスクトップ、その他のエッジデバイスなどがあります。

また、ローカル実行には異なるツールの選択肢もあり、Ollama、vLLM、SGLangなどのフレームワークがあります。

本章ではまずOllamaの基本的な使い方法を説明します。その他のエッジデバイスのアダプテーションや、vLLM、SGLangなどのフレームワークの使用については、後で追加予定です。

なぜモデルを自分のパソコンに置きたい?

APIを使って大規模モデルを呼び出すのは最も手軽な方法です:リクエストを送信し、モデルが計算して結果を返します。ユーザーはGPUを購入する必要もなく、基盤環境を維持する必要もありません。

ただし、APIモードには避けられない制限もあり、主に以下の側面に表れます:

  • データセキュリティ:重要な文書、顧客プライバシー、社内業務データは、第三者のパブリッククラウドに直接送信できません。
  • オフライン利用:イントラネット専用線などの本番環境では、外部ネットワークに接続できません。
  • コスト管理:呼び出し量が大きく安定している場合、自分でサーバーを構を構築する総合コストは、通常トークン単位の支払いを続けるよりも割安です。

したがって、業務がデータ機密性を伴う、純粋なオフライン実行が必要、呼び出し量が大きいなどの場合、ローカルデプロイがより適した選択肢となります。

まずノートパソコンのシステムとハードウェアを確認する

Ollamaは現在使いやすいツールの1つで、モデルのダウンロード、ローカル管理、インターフェースサービスをすべてパッケージ化しています。ユーザーはコードを自分で書いてモデルをロードする必要がなく、数行のコマンドで直接モデルを起動できます。

モデルがローカルで正常に実行できるかどうかは、很大程度上コンピュータのハードウェアリソースに依存します。Ollamaは一般的なハードウェアプラットフォームに良好的なサポートを提供し、Windows、Linux、macOSなどの一般的なオペレーティングシステムをサポートしています。通常のCPU、GPU、Apple Siliconを搭載したMacコンピュータでもモデルを実行できます。

CPU実行:コンピュータに専用グラフィックボードがなくても、CPUでモデルを実行できます。大規模モデルの推論には大量の計算が必要なため、CPUを使用すると生成速度は通常遅くなるため、パラメータ規模が小さなモデルや、応答速度がそれほど重要でないシナリオに適しています。

GPU実行:これは現在一般的な大規模モデルの実行方法です。GPUは並列計算能力が高く、モデルの生成速度を大幅に向上できます。モデルが大きくなるほど、必要なビデオメモリも増えるため、モデルを選択する際にはグラフィックボードに十分なビデオメモリがあるか考慮する必要があります。

Apple Silicon実行:Apple Mシリーズチップは統一メモリ設計を採用しており、CPUとGPUが同じメモリを使用できます。Macユーザーにとって、デバイスに32GB、64GB、それ以上の統一メモリがある場合、より大きなパラメータ規模のQuantizationモデルの実行を試みることができます。

使用しているオペレーティングシステムを選んでOllamaをインストールする

WindowsでOllamaをインストール

1)まずOllamaの公式サイト、Download Ollamaから対応するWindowsバージョンをダウンロードします

本文挿入図

2)ダウンロード完了後、直接クリックしてインストールし、continueをクリックします

本文挿入図

3) インストール完了後、以下が表示され、Ollamaサービスが起動したことがわかります

本文挿入図

4)cmdで、ロードしたいモデルを起動します。例えば:qwen3.5:2b、ターミナルに直接コマンドを入力します

ollama run qwen3.5:2b

ページに以下の出力があれば、モデルの起動が成功したことを示し、このままクライアントで会話することも、インターフェースを呼び出してモデルをテストすることもできます

本文挿入図

テスト用のコードは以下の通りです:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:11434/v1",
    api_key="ollama",  
)

response = client.chat.completions.create(
    model="qwen3.5:2b", 
    messages=[
        {
            "role": "system",
            "content": "あなたは親切なアシスタントです。",
        },
        {
            "role": "user",
            "content": "あなたは誰ですか?",
        },
    ],
    temperature=0,
    max_tokens=512,
)

print(response.choices[0].message.content)
レッスン 3 / 50%完了
←Server Configuration for Models

ディスカッション

ログイン ディスカッションに参加

結果は以下の通り表示されます:

本文挿入図

ModelScope NotebookでOllamaをインストール

1)NotebookでOllamaをインストールするには、まずインストールパッケージをダウンロードし、以下のコマンドを実行します

!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux  
本文挿入図

2)インストールパッケージのダウンロード後、ollama-linuxフォルダに入り、以下のコマンドを実行してインストールします

%cd ollama-linux
本文挿入図
sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh

インストール完了後、APIインターフェース情報が表示され、デフォルトは127.0.0.1:11434です。以下の情報が表示されれば、インストール完了です。

本文挿入図

LinuxでOllamaをインストール

linuxでのインストール手順は、上記のModelScope NotebookでのOllamaインストール方法と同じです。

MACでOllamaをインストール

1)まずOllamaの公式サイト、Download Ollamaから対応するmacOSバージョンをダウンロードします

本文挿入図

2)ダウンロード完了後、ダウンロードしたファイルをダブルクリックし、ollamaをアプリケーションにドラッグします

本文挿入図

3) インストール完了後、以下が表示され、Ollamaサービスが起動したことがわかります

本文挿入図

4)cmdで、ロードしたいモデルを起動します。例えば:qwen3.5:2b、ターミナルに直接コマンドを入力します

ollama run qwen3.5:2b

ページに以下の出力があれば、モデルの起動が成功したことを示し、このままクライアントで会話することも、インターフェースを呼び出してモデルをテストすることもできます

本文挿入図

クライアントでもチャットが可能です

本文挿入図

魔搭からモデルをダウンロードし、Ollamaで起動することも可能

Ollamaは多くのモデルライブラリを提供しており、ModelScopeで必要なモデルを検索し、Ollamaで起動できます。

1)Ollamaサービスの起動

この種の常駐サービスでは、Jupyterの単一カーネルは一度に1つのセルしか実行できないため、後のセルが実行しにくくなります。この部分はターミナルで実行し、Notebookを開いたら直接ワークスペースに入り、下に「ターミナル」という文字があればクリックします。

本文挿入図

ターミナルで以下を入力します:

ollama serve
本文挿入図

2)次に起動したいモデルを実行します。例えば:Qwen3-4B-GGUF、モデルの初回実行時は、まずモデルリポジトリから対応するファイルをダウンロードする必要があります。このコマンドもターミナルで実行し、新しいターミナルを開いて以下のコマンドを実行します:

本文挿入図
 ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF
本文挿入図

この時点でモデルは起動済みであり、インターフェースを呼び出してモデルインターフェースが接続されているかテストできます。コードは以下の通りです:

import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
    "model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
    "messages": [
        {
            "role": "user",
            "content": "こんにちは、自己紹介してください"
        }
    ],
    "max_tokens": 100
}

response = requests.post(url, json=data)

print("ステータスコード:", response.status_code)
print(response.text)

モデルの呼び出しが成功すると、対応するモデル結果が出力されます。

本文挿入図

この章で扱ったすべての実験過程は、こちらを参照してください:https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c