Ollamaが遅い時の確認順|WindowsでCPU・GPU・context・tokens/sを切り分ける
- 公開日
- 2026-08-01
- 更新日
- 2026-08-01
- 情報確認日
- 2026-08-01
- 編集・運営
- Local AI Compass
Ollamaの「遅い」は、モデルをメモリへロードする時間、入力を処理する時間、生成中の時間が混ざりやすい症状です。Windowsではollama psのPROCESSORとcontext、APIのusage fields、ログを同じテスト条件で記録し、実測していない速度値を作らずに切り分けます。
導入前に確認すること
- Windowsのバージョン、メモリ容量、GPU/VRAM、空き容量を確認する
- 最初は軽量モデル、短い質問、少ない同時作業から始める
- 公式サイトの対応OS、利用規約、モデルのライセンスを確認する
30秒で結論:load・prompt eval・generationを分ける
Ollamaが遅い時は、返答開始前の待ち時間と、文字が出始めた後の生成速度を別に測ります。Ollama APIのusage fieldsには、total_duration、load_duration、prompt_eval_count、prompt_eval_duration、eval_count、eval_durationがあり、時間値はナノ秒で返されます。
| 遅い段階 | 見る値・状態 | 次の確認 |
|---|---|---|
| モデルを呼んでから反応するまで | load_duration、ollama ps、モデルがすでにloadedか | モデルサイズ、保存先、RAM/VRAM、同時モデル |
| 入力を送って最初の文字まで | prompt_eval_count、prompt_eval_duration、入力長、context | 履歴、長文、context、system prompt |
| 文字が出た後の生成 | eval_count、eval_duration、PROCESSOR、GPU/CPU | GPU対応、driver、quantization、CPU fallback |
- [公式] Ollama API Usage - total_duration、load_duration、prompt_eval_duration、eval_durationなどを確認します。
- [公式] Ollama Generate API - done、done_reason、使用量フィールド、ストリーミング最終チャンクを確認します。
- [公式] Ollama Chat API - チャットAPIの応答フィールドとストリーミング時の記録項目を確認します。
ollama psでPROCESSORとcontextを見る
公式FAQでは、ollama psのPROCESSORで100% GPU、100% CPU、CPU/GPUの一部処理を確認する方法が案内されています。GPU使用率の一瞬のグラフだけでなく、モデルがどこへロードされたか、contextが何になっているかを合わせて記録します。
ollama ps
| 表示例 | 読み方 | 注意 |
|---|---|---|
| 100% GPU | モデルがGPUへロードされた状態 | 生成速度を保証する表示ではない |
| 100% CPU | モデルがシステムメモリへロードされた状態 | GPU非対応・driver・VRAM・条件を確認 |
| CPU/GPUの分割 | 一部をGPU、一部をCPUへ置く状態 | VRAM、context、モデルサイズ、速度を別測定 |
- Ollama公式FAQ - PROCESSOR表示の意味を確認する
- Ollama APIの実行中モデル - size_vram、context_length、量子化をJSONで確認する
API usageを速度の原因切り分けに使う
usage fieldsは「自分の呼び出しでどこに時間がかかったか」を記録するための材料です。total_durationだけで遅いと判断せず、load_duration、prompt_eval_duration、eval_durationを入力・出力token数と一緒に残します。ストリーミングの場合は、usage fieldsがdone=trueの最終チャンクへ含まれると公式に説明されています。
POST http://localhost:11434/api/generate
model: 使用したモデル名
prompt: 短い固定プロンプト
stream: false
| フィールド | 意味 | 比較時の注意 |
|---|---|---|
| load_duration | モデルのロード時間 | 初回と再利用時を混ぜない |
| prompt_eval_duration | 入力promptの評価時間 | 入力長、履歴、contextを固定する |
| eval_duration | 出力tokenの生成時間 | 出力token数と一緒に見る |
| total_duration | 応答全体の時間 | ネットワークやAPI呼び出しの前後を含める場合がある |
context lengthとメモリを先に確認する
Ollama公式のContext length Docsでは、contextはモデルがメモリ上で参照できる最大token数で、大きくすると必要メモリが増えると説明されています。確認時点の公式ページでは、VRAMが24GiB未満なら4k、24〜48GiBなら32k、48GiB以上なら256kという既定値が案内されていますが、表示や既定値は利用時点のDocsを優先します。
| 確認 | なぜ速度に関係するか | 安全な比較 |
|---|---|---|
| context設定 | 大きい設定はメモリ要求を増やす | 同じモデルで設定値だけを変える |
| 実入力長 | 短文と長文のprompt evalを混ぜない | 固定文と長文を別テストにする |
| VRAM/共有メモリ | CPU/GPU分割やWindows全体の負荷に関係する | ollama psとタスクマネージャーを合わせる |
- [公式] Ollama Context length - context length、VRAM別の既定値、メモリ負荷、ollama psの見方を確認します。
- コンテキスト長とは - 長文・KV cacheとメモリの基本を読む
- メモリ8GB・16GB・32GBの目安 - Windows全体の空きメモリを含める
モデルサイズ・量子化・CPU fallbackを分ける
大きいモデルや重い量子化は、ロード時間やメモリ余白に影響しやすいものの、特定のPCでの速度をファイルサイズだけから保証できません。同じモデル系列、同じ量子化、同じcontextで比較し、GPUが使われない場合はCPU fallbackと断定する前にPROCESSORと公式GPU対応を確認します。
| 比較 | 固定するもの | 変えるもの |
|---|---|---|
| モデル差 | PC、context、prompt、Ollama版 | モデル名だけ |
| 量子化差 | 同じベースモデル、prompt、context | Q4/Q5/Q8などの配布物 |
| GPU差 | モデル、prompt、context | driver、対応GPU、実行環境 |
| 同時実行差 | モデルと入力 | 他モデル、他アプリ、複数request |
- ローカルAIの速度を測る方法 - ロード・TTFT・生成速度を同じ条件で測る
- モデルサイズ早見表 - モデル規模と安定性を分けて判断する
- Q4/Q5/Q8の違い - 量子化を安全ランクとみなさない
localモデルとcloudモデルを分ける
Ollamaという名前だけでは推論場所を決められません。localモデルとcloudモデルでは、PCのCPU/GPU、ネットワーク、サインイン、利用条件、ログやusageの見方が異なります。今回の記事の主対象はWindows上のローカルモデルです。
- Ollamaのローカルモデルとcloudモデルの違い - :cloudをPC内推論として扱わない
- Ollamaとは - 本体、local、cloud、APIの境界を読む
Windowsログでモデル以外の遅さを確認する
Ollama公式Windows Docsでは、%LOCALAPPDATA%\Ollamaにapp.log、server.log、upgrade.logが保存されると説明されています。Troubleshooting Docsではserver.logの確認や、必要な場合の追加debug loggingが案内されています。ログの全文を公開せず、日時、該当行、モデル名だけを安全に抜き出します。
| ファイル | 見るもの | 伏せるもの |
|---|---|---|
| app.log | GUIやtrayの直前の状態 | ユーザー名、個人パス、機密内容 |
| server.log | server、runtime、GPU検出、error | promptや秘密情報が含まれる場合 |
| upgrade.log | 更新処理の結果 | 環境固有のパスや識別子 |
- [公式] Ollama for Windows - Windows要件、localhost:11434、PATH、ログ保存場所、モデル保存場所を確認します。
- [公式] Ollama Troubleshooting - Windowsのserver.log、LLM library、追加ログ、GPU検出の切り分けを確認します。
同一条件での再現手順
- モデル名、量子化、context、Ollamaの版、PC、GPU/VRAMを記録する。
- ollama psでロード状態とPROCESSORを記録する。
- 短い固定promptを1回だけ送り、初回と同じモデル再利用時を分ける。
- APIならusage fieldsを保存し、CLIなら実行条件と終了状態を保存する。
- context、モデル、GPU設定、同時実行を1つずつ変更して比較する。
この手順で得た値は、あなたのPC・モデル・条件の記録です。サイト記事へ実測値として転記したり、一般的な快適ラインとして断定したりしません。
やってはいけないこと
- 実測していないtokens/sや、特定モデルの秒数を作る。
- PROCESSORを見ずにタスクマネージャーのGPU使用率だけでCPU実行と断定する。
- context、モデル、driver、並列処理を同時に変更する。
- Ollamaが遅いだけでモデルフォルダやログを削除する。
- cloudモデルをローカルモデルの速度比較へ混ぜる。
次に読む順番
- Ollama症状別トラブルシュート - 起動・停止・GPUなど別症状へ戻る
- Ollamaの回答が途中で止まる - generation後の終了理由とログを読む
- Ollamaが起動しない・localhost:11434につながらない - tray、CLI、APIの接続問題を切り分ける
- OllamaでGPUが使われない - PROCESSORとGPU対応表を確認する
- ローカルAIをAPIで使う方法 - API接続とモデル速度を分ける
よくある質問
Ollamaが遅い時は、まずcontextを下げればよいですか?
contextだけを先に変えるのではなく、load、prompt eval、generationのどこが遅いか、ollama psのPROCESSOR、入力長、RAM/VRAMを記録します。contextを変えた場合は別条件として比較します。
ollama psの100% GPUなら速いですか?
100% GPUはモデルがGPUへロードされた状態を示す表示で、速度の保証値ではありません。入力長、context、モデル、出力長、冷却、API usageも確認します。
API usageの時間単位は何ですか?
Ollama公式Usage Docsでは、usageの時間値はナノ秒で測定されると説明されています。load、prompt eval、generationのフィールドを分けて読みます。
Ollamaの既定contextはPCのVRAMで決まりますか?
公式Context length DocsではVRAMに応じた既定値が案内されていますが、実際の表示やモデル条件は利用時点の公式情報を確認してください。大きいcontextはメモリ要求を増やします。
Ollamaの速度をLM Studioと比較できますか?
比較できますが、同じモデル系列、量子化、context、入力・出力長、ロード状態、GPU条件をそろえ、load、TTFT、generationを別々に記録します。実行形式の差も注記します。
cloudモデルを速度比較に入れてよいですか?
ローカルモデルと同じ比較にはしません。cloudモデルは通信や提供条件が入り、PC内のCPU/GPU推論とは別の条件です。local/cloudの境界を確認してください。
次に読むおすすめルート
LM Studio・Ollamaの症状別トラブルを解決したい人
起動、モデルロード、Prompt Processing、generation、API接続、GPU確認をツール別に分けて読みます。
- 症状別トラブル解決ハブ
- LM StudioのPrompt Processingが遅い
- LM Studioの回答が途中で止まる
- LM Studioが起動しない
- LM StudioのGPUオフロード
- Ollamaの回答が途中で止まる
- Ollamaが起動しない・localhost:11434につながらない
- OllamaでGPUが使われない
- 速度・RAM・VRAMを測る方法
- コンテキスト長とメモリ負荷
- モデルサイズと量子化
- メモリ8GB・16GB・32GBの目安
- ローカルAI APIの接続確認
- PC診断ページ
あなたはどのタイプ?
- 初めてローカルAIを触る人 - まず全体像をつかみ、LM StudioとOllamaの違い、モデルサイズの考え方を順番に確認します。
- LM Studio・Ollamaの症状別トラブルを解決したい人 - 起動、モデルロード、Prompt Processing、generation、API接続、GPU確認をツール別に分けて読みます。
- GPUなし・低スペックPCの人 - 軽量モデル、メモリ別の目安、重いときの確認ポイントを先に見ます。
- PDFや資料を読ませたい人 - 先に基本を押さえ、モデル単体の確認後にAnythingLLMへ進みます。
- ローカルAIエージェントを試したい人 - Bionic、Ollama、AnythingLLM、Hermesを役割別に分け、local/cloud、tool、保存、PC負荷を順番に確認します。
- 開発・API連携したい人 - LM StudioとOllamaの違いを確認し、API、長文処理、RAGまで段階的に進みます。
関連チェック先
- [公式] Ollama for Windows - Windows要件、localhost:11434、PATH、ログ保存場所、モデル保存場所を確認します。
- [公式] Ollama Context length - context length、VRAM別の既定値、メモリ負荷、ollama psの見方を確認します。
- [公式] Ollama FAQ - ollama psのPROCESSOR表示とCPU/GPU分割、環境変数の公式説明を確認します。
- [公式] Ollama API Usage - total_duration、load_duration、prompt_eval_duration、eval_durationなどを確認します。
- [公式] Ollama Generate API - done、done_reason、使用量フィールド、ストリーミング最終チャンクを確認します。
- [公式] Ollama Chat API - チャットAPIの応答フィールドとストリーミング時の記録項目を確認します。
- [公式] Ollama List running models - 実行中モデルのsize_vram、context_length、quantization_levelなどを確認します。
- [公式] Ollama Troubleshooting - Windowsのserver.log、LLM library、追加ログ、GPU検出の切り分けを確認します。