モデルはローカルまたはクラウドにデプロイされます。例えば、ローカルデバイスにはノートパソコン、デスクトップ、その他のエッジデバイスなどがあります。
また、ローカル実行には異なるツールの選択肢もあり、Ollama、vLLM、SGLangなどのフレームワークがあります。
本章ではまずOllamaの基本的な使い方法を説明します。その他のエッジデバイスのアダプテーションや、vLLM、SGLangなどのフレームワークの使用については、後で追加予定です。
APIを使って大規模モデルを呼び出すのは最も手軽な方法です:リクエストを送信し、モデルが計算して結果を返します。ユーザーはGPUを購入する必要もなく、基盤環境を維持する必要もありません。
ただし、APIモードには避けられない制限もあり、主に以下の側面に表れます:
したがって、業務がデータ機密性を伴う、純粋なオフライン実行が必要、呼び出し量が大きいなどの場合、ローカルデプロイがより適した選択肢となります。
Ollamaは現在使いやすいツールの1つで、モデルのダウンロード、ローカル管理、インターフェースサービスをすべてパッケージ化しています。ユーザーはコードを自分で書いてモデルをロードする必要がなく、数行のコマンドで直接モデルを起動できます。
モデルがローカルで正常に実行できるかどうかは、很大程度上コンピュータのハードウェアリソースに依存します。Ollamaは一般的なハードウェアプラットフォームに良好的なサポートを提供し、Windows、Linux、macOSなどの一般的なオペレーティングシステムをサポートしています。通常のCPU、GPU、Apple Siliconを搭載したMacコンピュータでもモデルを実行できます。
CPU実行:コンピュータに専用グラフィックボードがなくても、CPUでモデルを実行できます。大規模モデルの推論には大量の計算が必要なため、CPUを使用すると生成速度は通常遅くなるため、パラメータ規模が小さなモデルや、応答速度がそれほど重要でないシナリオに適しています。
GPU実行:これは現在一般的な大規模モデルの実行方法です。GPUは並列計算能力が高く、モデルの生成速度を大幅に向上できます。モデルが大きくなるほど、必要なビデオメモリも増えるため、モデルを選択する際にはグラフィックボードに十分なビデオメモリがあるか考慮する必要があります。
Apple Silicon実行:Apple Mシリーズチップは統一メモリ設計を採用しており、CPUとGPUが同じメモリを使用できます。Macユーザーにとって、デバイスに32GB、64GB、それ以上の統一メモリがある場合、より大きなパラメータ規模のQuantizationモデルの実行を試みることができます。
1)まずOllamaの公式サイト、Download Ollamaから対応するWindowsバージョンをダウンロードします
2)ダウンロード完了後、直接クリックしてインストールし、continueをクリックします
3) インストール完了後、以下が表示され、Ollamaサービスが起動したことがわかります
4)cmdで、ロードしたいモデルを起動します。例えば:qwen3.5:2b、ターミナルに直接コマンドを入力します
ollama run qwen3.5:2b
ページに以下の出力があれば、モデルの起動が成功したことを示し、このままクライアントで会話することも、インターフェースを呼び出してモデルをテストすることもできます
テスト用のコードは以下の通りです:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:11434/v1",
api_key="ollama",
)
response = client.chat.completions.create(
model="qwen3.5:2b",
messages=[
{
"role": "system",
"content": "あなたは親切なアシスタントです。",
},
{
"role": "user",
"content": "あなたは誰ですか?",
},
],
temperature=0,
max_tokens=512,
)
print(response.choices[0].message.content)
ログイン ディスカッションに参加
結果は以下の通り表示されます:

1)NotebookでOllamaをインストールするには、まずインストールパッケージをダウンロードし、以下のコマンドを実行します
!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux

2)インストールパッケージのダウンロード後、ollama-linuxフォルダに入り、以下のコマンドを実行してインストールします
%cd ollama-linux

sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh
インストール完了後、APIインターフェース情報が表示され、デフォルトは127.0.0.1:11434です。以下の情報が表示されれば、インストール完了です。

linuxでのインストール手順は、上記のModelScope NotebookでのOllamaインストール方法と同じです。
1)まずOllamaの公式サイト、Download Ollamaから対応するmacOSバージョンをダウンロードします

2)ダウンロード完了後、ダウンロードしたファイルをダブルクリックし、ollamaをアプリケーションにドラッグします

3) インストール完了後、以下が表示され、Ollamaサービスが起動したことがわかります

4)cmdで、ロードしたいモデルを起動します。例えば:qwen3.5:2b、ターミナルに直接コマンドを入力します
ollama run qwen3.5:2b
ページに以下の出力があれば、モデルの起動が成功したことを示し、このままクライアントで会話することも、インターフェースを呼び出してモデルをテストすることもできます

クライアントでもチャットが可能です

Ollamaは多くのモデルライブラリを提供しており、ModelScopeで必要なモデルを検索し、Ollamaで起動できます。
1)Ollamaサービスの起動
この種の常駐サービスでは、Jupyterの単一カーネルは一度に1つのセルしか実行できないため、後のセルが実行しにくくなります。この部分はターミナルで実行し、Notebookを開いたら直接ワークスペースに入り、下に「ターミナル」という文字があればクリックします。

ターミナルで以下を入力します:
ollama serve

2)次に起動したいモデルを実行します。例えば:Qwen3-4B-GGUF、モデルの初回実行時は、まずモデルリポジトリから対応するファイルをダウンロードする必要があります。このコマンドもターミナルで実行し、新しいターミナルを開いて以下のコマンドを実行します:

ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF

この時点でモデルは起動済みであり、インターフェースを呼び出してモデルインターフェースが接続されているかテストできます。コードは以下の通りです:
import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
"model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
"messages": [
{
"role": "user",
"content": "こんにちは、自己紹介してください"
}
],
"max_tokens": 100
}
response = requests.post(url, json=data)
print("ステータスコード:", response.status_code)
print(response.text)
モデルの呼び出しが成功すると、対応するモデル結果が出力されます。

この章で扱ったすべての実験過程は、こちらを参照してください:https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c