Nemotron 3.5 Lightningはローカルで動く?30B MoE・3B active・メモリの見方
- 公開日
- 2026-08-25
- 更新日
- 2026-08-25
- 情報確認日
- 2026-08-25
- 編集・運営
- Local AI Compass
Nemotron 3.5 Lightningは30B total・3B activeのMoEモデルですが、「3B activeだから3Bモデルと同じメモリ」とは限りません。Ollamaタグの表示容量、BF16の参照weights、KV cache、context、backend、agentのtool loopを分けて、ローカル実行の範囲を判断します。
導入前に確認すること
- Windowsのバージョン、メモリ容量、GPU/VRAM、空き容量を確認する
- 最初は軽量モデル、短い質問、少ない同時作業から始める
- 公式サイトの対応OS、利用規約、モデルのライセンスを確認する
30秒で分かる結論
Nemotron 3.5 LightningはOllama公式Blog・モデルページで、30B total・3B activeのhybrid MoE、always-on agent向けとして案内されています。Ollamaの標準タグには約25GB・1M context、Apple Silicon向けMLXタグには約23GB・256K contextの表示があります。
3B activeは各tokenで計算に関わる一部のパラメータを指す説明で、保存するweightや実行時のKV cacheが3B相当になるという意味ではありません。ダウンロード容量、weight dtype、RAM/VRAM、unified memory、contextを別に確認します。
OllamaはWindowsで使えるruntimeですが、モデルの各backend、GPUドライバー、tag、量子化、agent harnessの組み合わせまでを1つの公式Windows動作保証として読めません。まず単体chatを短いcontextで確認し、その後にagent loopを足します。
30B totalと3B activeを分ける
| 項目 | 意味 | 実行時に起きること |
|---|---|---|
| 30B total | MoE全体に含まれるパラメータ規模 | weightの保存・ロードを3Bだけで見積もらない |
| 3B active | 各tokenの計算でactiveになる部分の目安 | 計算量の読み方には役立つが、weight容量やKV cacheを消さない |
| MoE / hybrid構成 | 専門家・attention等を組み合わせる設計 | backend、dtype、runtimeの対応を個別に確認する |
| agent workload | tool結果、ファイル、RAG、再試行を含む処理 | 通常chatよりcontext・呼び出し回数・待ち時間が増える |
「3B active」という数字だけで必要メモリを決めないことがこの記事の要点です。標準タグの約25GBやMLXタグの約23GBも、モデルライブラリが表示する取得対象の目安であり、RAM・VRAM・unified memoryの最低値や快適さの保証ではありません。
- Ollama Nemotron 3.5 Lightning公式Blog - Nemotronの30B total・3B active、agent用途、on-device、launch例を確認します。
- Ollama Nemotron 3.5 Lightning公式モデルページ - 通常タグとMLXタグに表示される容量・context、MoEとagent用途を確認します。
- NVIDIA Nemotron 3.5 Lightning公式Model Card - OpenMDW-1.1、BF16参照weights、30B/3B-A3B、hybrid構成、評価hardwareとcontextの境界を確認します。
weight・artifact・RAM・VRAM・KV cache
| 分ける項目 | 見る場所 | 注意点 |
|---|---|---|
| Ollama tagの表示容量 | Ollama公式モデルページ | 標準/MLXなどtagごとに異なる。保存容量と実行時の余裕は別 |
| BF16 reference weights | NVIDIA公式Model Card・NGC | 参照配布物のdtype・評価hardwareを示す。量子化Ollama tagと同じ容量ではない |
| RAM / VRAM / unified memory | OS・GPU・runtimeの実測 | offload、他アプリ、driver、context、並列数で変わる |
| KV cache | Ollama context docs・FAQと`ollama ps` | contextと並列で増える追加領域。3B activeやtag容量に含めない |
NVIDIAの公式Model CardやNGCには、reference weightsや評価環境として大きなGPU構成が示されています。これはBF16参照実装の境界であり、Ollamaの量子化タグをWindowsの同じhardware要件へ置き換える根拠ではありません。逆に、Ollamaタグが小さく見えても、長いcontext・agent並列・OSの余裕は必要です。
NVIDIAのBF16 Model CardはOpenMDW-1.1で提供されています。「open weights」をApache-2.0やMITと読み替えず、Ollama tagや変換・量子化artifactについても、配布元と利用時点のtermsを個別に確認します。
- Ollama context length - context length、VRAMに応じた既定値、OLLAMA_CONTEXT_LENGTH、ollama psの見方を確認します。
- Ollama API /api/ps - ロード中モデルのsize、size_vram、context_lengthなどを確認する公式APIです。
- モデルサイズ早見表 - モデル容量を読む前提を確認する
- メモリガイド - RAM、VRAM、他アプリの余裕を分ける
Windows・NVIDIA・Apple Siliconの境界
| 経路 | 公式情報から言えること | 一般化しないこと |
|---|---|---|
| Ollama on Windows | Ollama公式Windows docsとモデルページから、Windows上のOllamaとモデルtagを確認できる | Nemotronの全Windows GPU・CPUで同じ速度やcontextが保証される |
| NVIDIA RTX | NVIDIA公式BlogはRTX PCを含むlocal用途を紹介する | 4x throughputや30% faster task completionを全RTX・全Windows構成の実測とする |
| Apple Silicon / MLX | OllamaモデルページにMLX tagと256K表示がある | MLXの容量・速度をWindows CUDA/ROCm/CPUへ適用する |
| BF16 reference | NVIDIA公式Model Cardはpreferred/supported OSをLinuxとし、single H100/A100 80GB、single H100で256K、指定Blackwellまたは8×H100で1Mの検証構成を示す | このBF16検証構成をOllama量子化tagのWindows最低要件とする |
Ollama Blogの「on device」やNVIDIA BlogのRTX紹介は、クラウドAPIだけに限定されない配布・用途の説明です。特定のWindows PCでの起動、速度、VRAM使用量は、モデルtag・backend・driver・contextを揃えた実測で判断します。
公式Model Cardの1Mは、BlackwellのGB200/B200または8×H100など、指定されたBF16構成での検証値です。single H100 80GBはmemory-boundの256Kとして記載されているため、Ollamaの1M tag表示や一般PCでの常用可能性と同一視しません。
- Ollama Windows docs - Windowsアプリ、CLI、API、GPU・保存先の確認先を案内する公式ドキュメントです。
- NVIDIA Nemotron Lightning Blog - RTX PCなどでの位置づけと、4x throughput・30% faster task completionが公式ベンチマーク主張であることを確認します。
- Ollama Nemotron公式ページ - 通常タグとMLXタグに表示される容量・context、MoEとagent用途を確認します。
- ローカルAIエージェント比較 - runtimeとagent操作側の役割を分ける
Ollamaで最初に試す順番
- `ollama --version`で本体のバージョンを確認し、利用時点のCLI Referenceを見る。
- `ollama run nemotron-3.5-lightning`で単体chatを実行し、短い質問・短い出力から始める。
- `ollama ps`でロード中モデル、Processor、contextなどを確認し、RAM/VRAMの実測を記録する。
- 同じ質問でcontextだけを増やし、OOM、待ち時間、速度、回答差を確認する。
- `ollama launch hermes --model nemotron-3.5-lightning`などのagent例へ進む場合は、tool権限、ファイル操作、web search、外部通信を別に確認する。
Ollama公式BlogとモデルページにはClaude Code、OpenCode、Hermes、OpenClawなどとのlaunch例があります。これはagent harnessの入口であり、Nemotronのweight、Ollamaのbackend、agentの権限が自動的に同じlocal境界になることを意味しません。CLIの引数と利用可能な統合は、実行時の公式表示を優先します。
- Ollama CLI Reference - ollama run、ollama launch、psなど、利用時点のCLI表示を確認します。
- Nemotron公式Blog - Nemotronの30B total・3B active、agent用途、on-device、launch例を確認します。
agent向けモデルとしての限界
「always-on agent」やNVIDIA公式Blogの速度・task completion数字は、モデルの用途や公式ベンチマークの説明です。自分のPCで常駐agentが同じ速度になる根拠ではありません。NVIDIA Blogの4x throughput・30% faster task completionは、測定条件を含む公式主張として扱い、一般Windowsへの保証に変換しません。
tool loopでは、toolの結果、ファイル内容、RAG検索結果、再試行が次の入力へ入ります。3B activeの計算量だけでなく、入力context、KV cache、I/O、agent側の許可設定を測定してください。
- agentのPC負荷 - context、KV cache、tool loop、RAGを分けて測る
- Hermes DesktopとOllama - agent側とmodel runtime側を接続する
- Hermes AgentとDesktopの違い - 実行場所と操作側の役割を分ける
よくある誤解と限界
| 誤解 | 確認すること |
|---|---|
| 3B active=3Bモデルのメモリ | total weight、dtype、tag容量、KV cache、runtimeを別に見る |
| 25GB表示=RAM 25GBで快適 | OS・他アプリ・context・offload・並列の余裕を含めて実測する |
| 1M context=1Mを常用できる | タグの上限と、実際のcontext設定・速度・メモリを分ける |
| NVIDIAの4x/30%=自分のRTXの速度 | 公式benchmark claimと自分のhardware・driver・backendの測定を分ける |
| Ollamaで起動=agentの通信もlocal | model provider、tool、web search、ファイル、ネットワークを個別に確認する |
このページでは、Nemotron 3.5 LightningのWindows最低RAM・最低VRAM・tokens/sを提示していません。公式tagの表示容量、reference weights、context表記は判断材料ですが、実際の適合性は同じPC・同じbackend・同じcontext・同じagent手順で測る必要があります。
公式ソース
- Ollama Nemotron 3.5 Lightning公式Blog - Nemotronの30B total・3B active、agent用途、on-device、launch例を確認します。
- Ollama Nemotron 3.5 Lightning公式モデルページ - 通常タグとMLXタグに表示される容量・context、MoEとagent用途を確認します。
- NVIDIA Nemotron 3.5 Lightning公式Model Card - OpenMDW-1.1、BF16参照weights、30B/3B-A3B、hybrid構成、評価hardwareとcontextの境界を確認します。
- NVIDIA Nemotron Lightning公式Blog - RTX PCなどでの位置づけと、4x throughput・30% faster task completionが公式ベンチマーク主張であることを確認します。
- NVIDIA NGC Nemotron version history - BF16などの配布artifact表示を確認します。artifact容量をRAM要件とは扱いません。
- Ollama CLI Reference - ollama run、ollama launch、psなど、利用時点のCLI表示を確認します。
- Ollama Windows公式ドキュメント - Windowsアプリ、CLI、API、GPU・保存先の確認先を案内する公式ドキュメントです。
- Ollama Context length公式ドキュメント - context length、VRAMに応じた既定値、OLLAMA_CONTEXT_LENGTH、ollama psの見方を確認します。
- Ollama API /api/ps公式ドキュメント - ロード中モデルのsize、size_vram、context_lengthなどを確認する公式APIです。
よくある質問
Nemotron 3.5 Lightningは3Bモデルですか?
3B activeのMoEモデルですが、OllamaとNVIDIAの公式説明は30B total・3B activeです。active parameterだけでweight容量や実行時メモリを3B相当とは見積もりません。
Nemotronの25GB表示は必要RAMですか?
Ollama標準タグの約25GBはモデルページの表示容量です。RAM・VRAMの最低値や快適さの保証ではなく、KV cache、context、runtime、OS、他アプリの余裕を別に確認します。
Nemotron 3.5 LightningはWindowsで動きますか?
OllamaにはWindows docsとNemotronのモデルtagがありますが、全Windows GPU・CPUで同じbackendや速度が保証されるとは言えません。Ollama本体、driver、tag、contextを揃えて実機確認してください。
1M contextを使えばagentに向いていますか?
context上限だけでagent適性や快適さは決まりません。tool結果、RAG、並列、KV cache、I/O、再試行が増えるため、短いcontextから段階的に測ります。
NVIDIA公式の4倍高速・30%短縮は自分のPCでも出ますか?
保証できません。NVIDIAの数字は公式の測定条件に基づく主張です。自分のGPU、driver、backend、context、agent手順で別に実測してください。
次に読むおすすめルート
初めてローカルAIを触る人
まず全体像をつかみ、LM StudioとOllamaの違い、モデルサイズの考え方を順番に確認します。
- クラウドAIとローカルAIの使い分け
- ローカルLLMとは
- ローカルAIを入れる前に確認すること
- WindowsでローカルAIを始める完全ガイド
- Windows ARMでローカルAIを使う前の確認
- WindowsでOllamaをインストールする
- Windowsでローカル音声認識を始める
- WindowsでローカルOCRを始める
- Windowsで話者分離を始める
- WindowsでローカルAI翻訳を始める
- LM Studioとは
- GGUFとは
- GGUF版とは
- GGUFファイル名の読み方
- LM StudioでGGUFを入れる方法
- LM Studioで画像を読み込む方法
- LM Studioのモデル保存場所と移動
- 小型LLM・量子化の現実
- GGUF量子化安全とRAG/NPU研究
- Quant.npuとNPU向け静的量子化
- LENSで見るNPUレイテンシ予測
- Copilot+ PCのNPU期待値
- Hugging Face安全チェック
- PDF/RAG/引用確認の現実
- LM Studioで最初に選ぶモデル
- GGUFモデル選び診断
- Hugging FaceでGGUFモデルを探す方法
- Q4/Q5/Q8の違いと選び方
- 日本語GGUFモデルの選び方
- Q4/Q5/Q8研究ガイド
- Hermes Desktopとは
- Hermes DesktopとLM Studio接続
- Hermes DesktopとOllama接続
- Hermes Desktop接続トラブル
- Hermes AgentとDesktopの違い
- ローカルLLMツール比較
- ローカルAI更新メモ
- 診断ページ
あなたはどのタイプ?
- 初めてローカルAIを触る人 - まず全体像をつかみ、LM StudioとOllamaの違い、モデルサイズの考え方を順番に確認します。
- LM Studio・Ollamaの症状別トラブルを解決したい人 - 起動、モデルロード、Prompt Processing、generation、API接続、GPU確認をツール別に分けて読みます。
- GPUなし・低スペックPCの人 - 軽量モデル、メモリ別の目安、重いときの確認ポイントを先に見ます。
- PDFや資料を読ませたい人 - 先に基本を押さえ、モデル単体の確認後にAnythingLLMへ進みます。
- ローカルAIエージェントを試したい人 - Bionic、Ollama、AnythingLLM、Hermesを役割別に分け、local/cloud、tool、保存、PC負荷を順番に確認します。
- 開発・API連携したい人 - LM StudioとOllamaの違いを確認し、API、長文処理、RAGまで段階的に進みます。
関連チェック先
- Ollama Nemotron 3.5 Lightning公式Blog - Nemotronの30B total・3B active、agent用途、on-device、launch例を確認します。
- Ollama Nemotron 3.5 Lightning公式モデルページ - 通常タグとMLXタグに表示される容量・context、MoEとagent用途を確認します。
- NVIDIA Nemotron 3.5 Lightning公式Model Card - OpenMDW-1.1、BF16参照weights、30B/3B-A3B、hybrid構成、評価hardwareとcontextの境界を確認します。
- NVIDIA Nemotron Lightning公式Blog - RTX PCなどでの位置づけと、4x throughput・30% faster task completionが公式ベンチマーク主張であることを確認します。
- NVIDIA NGC Nemotron version history - BF16などの配布artifact表示を確認します。artifact容量をRAM要件とは扱いません。
- Ollama CLI Reference - ollama run、ollama launch、psなど、利用時点のCLI表示を確認します。
- Ollama Windows公式ドキュメント - Windowsアプリ、CLI、API、GPU・保存先の確認先を案内する公式ドキュメントです。
- Ollama Context length公式ドキュメント - context length、VRAMに応じた既定値、OLLAMA_CONTEXT_LENGTH、ollama psの見方を確認します。
- Ollama API /api/ps公式ドキュメント - ロード中モデルのsize、size_vram、context_lengthなどを確認する公式APIです。