Nemotron 3.5 Lightningはローカルで動く?30B MoE・3B active・メモリの見方

公開日
2026-08-25
更新日
2026-08-25
情報確認日
2026-08-25
編集・運営
Local AI Compass

Nemotron 3.5 Lightningは30B total・3B activeのMoEモデルですが、「3B activeだから3Bモデルと同じメモリ」とは限りません。Ollamaタグの表示容量、BF16の参照weights、KV cache、context、backend、agentのtool loopを分けて、ローカル実行の範囲を判断します。

導入前に確認すること

  • Windowsのバージョン、メモリ容量、GPU/VRAM、空き容量を確認する
  • 最初は軽量モデル、短い質問、少ない同時作業から始める
  • 公式サイトの対応OS、利用規約、モデルのライセンスを確認する

30秒で分かる結論

Nemotron 3.5 LightningはOllama公式Blog・モデルページで、30B total・3B activeのhybrid MoE、always-on agent向けとして案内されています。Ollamaの標準タグには約25GB・1M context、Apple Silicon向けMLXタグには約23GB・256K contextの表示があります。

3B activeは各tokenで計算に関わる一部のパラメータを指す説明で、保存するweightや実行時のKV cacheが3B相当になるという意味ではありません。ダウンロード容量、weight dtype、RAM/VRAM、unified memory、contextを別に確認します。

OllamaはWindowsで使えるruntimeですが、モデルの各backend、GPUドライバー、tag、量子化、agent harnessの組み合わせまでを1つの公式Windows動作保証として読めません。まず単体chatを短いcontextで確認し、その後にagent loopを足します。

30B totalと3B activeを分ける

Nemotron 3.5 Lightningのtotalとactive parameter
項目意味実行時に起きること
30B totalMoE全体に含まれるパラメータ規模weightの保存・ロードを3Bだけで見積もらない
3B active各tokenの計算でactiveになる部分の目安計算量の読み方には役立つが、weight容量やKV cacheを消さない
MoE / hybrid構成専門家・attention等を組み合わせる設計backend、dtype、runtimeの対応を個別に確認する
agent workloadtool結果、ファイル、RAG、再試行を含む処理通常chatよりcontext・呼び出し回数・待ち時間が増える

「3B active」という数字だけで必要メモリを決めないことがこの記事の要点です。標準タグの約25GBやMLXタグの約23GBも、モデルライブラリが表示する取得対象の目安であり、RAM・VRAM・unified memoryの最低値や快適さの保証ではありません。

weight・artifact・RAM・VRAM・KV cache

Nemotron 3.5 Lightningのメモリ要素
分ける項目見る場所注意点
Ollama tagの表示容量Ollama公式モデルページ標準/MLXなどtagごとに異なる。保存容量と実行時の余裕は別
BF16 reference weightsNVIDIA公式Model Card・NGC参照配布物のdtype・評価hardwareを示す。量子化Ollama tagと同じ容量ではない
RAM / VRAM / unified memoryOS・GPU・runtimeの実測offload、他アプリ、driver、context、並列数で変わる
KV cacheOllama context docs・FAQと`ollama ps`contextと並列で増える追加領域。3B activeやtag容量に含めない

NVIDIAの公式Model CardやNGCには、reference weightsや評価環境として大きなGPU構成が示されています。これはBF16参照実装の境界であり、Ollamaの量子化タグをWindowsの同じhardware要件へ置き換える根拠ではありません。逆に、Ollamaタグが小さく見えても、長いcontext・agent並列・OSの余裕は必要です。

NVIDIAのBF16 Model CardはOpenMDW-1.1で提供されています。「open weights」をApache-2.0やMITと読み替えず、Ollama tagや変換・量子化artifactについても、配布元と利用時点のtermsを個別に確認します。

Windows・NVIDIA・Apple Siliconの境界

Nemotron 3.5 Lightningのplatform境界
経路公式情報から言えること一般化しないこと
Ollama on WindowsOllama公式Windows docsとモデルページから、Windows上のOllamaとモデルtagを確認できるNemotronの全Windows GPU・CPUで同じ速度やcontextが保証される
NVIDIA RTXNVIDIA公式BlogはRTX PCを含むlocal用途を紹介する4x throughputや30% faster task completionを全RTX・全Windows構成の実測とする
Apple Silicon / MLXOllamaモデルページにMLX tagと256K表示があるMLXの容量・速度をWindows CUDA/ROCm/CPUへ適用する
BF16 referenceNVIDIA公式Model Cardはpreferred/supported OSをLinuxとし、single H100/A100 80GB、single H100で256K、指定Blackwellまたは8×H100で1Mの検証構成を示すこのBF16検証構成をOllama量子化tagのWindows最低要件とする

Ollama Blogの「on device」やNVIDIA BlogのRTX紹介は、クラウドAPIだけに限定されない配布・用途の説明です。特定のWindows PCでの起動、速度、VRAM使用量は、モデルtag・backend・driver・contextを揃えた実測で判断します。

公式Model Cardの1Mは、BlackwellのGB200/B200または8×H100など、指定されたBF16構成での検証値です。single H100 80GBはmemory-boundの256Kとして記載されているため、Ollamaの1M tag表示や一般PCでの常用可能性と同一視しません。

Ollamaで最初に試す順番

  1. `ollama --version`で本体のバージョンを確認し、利用時点のCLI Referenceを見る。
  2. `ollama run nemotron-3.5-lightning`で単体chatを実行し、短い質問・短い出力から始める。
  3. `ollama ps`でロード中モデル、Processor、contextなどを確認し、RAM/VRAMの実測を記録する。
  4. 同じ質問でcontextだけを増やし、OOM、待ち時間、速度、回答差を確認する。
  5. `ollama launch hermes --model nemotron-3.5-lightning`などのagent例へ進む場合は、tool権限、ファイル操作、web search、外部通信を別に確認する。

Ollama公式BlogとモデルページにはClaude Code、OpenCode、Hermes、OpenClawなどとのlaunch例があります。これはagent harnessの入口であり、Nemotronのweight、Ollamaのbackend、agentの権限が自動的に同じlocal境界になることを意味しません。CLIの引数と利用可能な統合は、実行時の公式表示を優先します。

  • Ollama CLI Reference - ollama run、ollama launch、psなど、利用時点のCLI表示を確認します。
  • Nemotron公式Blog - Nemotronの30B total・3B active、agent用途、on-device、launch例を確認します。

agent向けモデルとしての限界

「always-on agent」やNVIDIA公式Blogの速度・task completion数字は、モデルの用途や公式ベンチマークの説明です。自分のPCで常駐agentが同じ速度になる根拠ではありません。NVIDIA Blogの4x throughput・30% faster task completionは、測定条件を含む公式主張として扱い、一般Windowsへの保証に変換しません。

tool loopでは、toolの結果、ファイル内容、RAG検索結果、再試行が次の入力へ入ります。3B activeの計算量だけでなく、入力context、KV cache、I/O、agent側の許可設定を測定してください。

よくある誤解と限界

Nemotron 3.5 Lightningの誤解を避ける表
誤解確認すること
3B active=3Bモデルのメモリtotal weight、dtype、tag容量、KV cache、runtimeを別に見る
25GB表示=RAM 25GBで快適OS・他アプリ・context・offload・並列の余裕を含めて実測する
1M context=1Mを常用できるタグの上限と、実際のcontext設定・速度・メモリを分ける
NVIDIAの4x/30%=自分のRTXの速度公式benchmark claimと自分のhardware・driver・backendの測定を分ける
Ollamaで起動=agentの通信もlocalmodel provider、tool、web search、ファイル、ネットワークを個別に確認する

このページでは、Nemotron 3.5 LightningのWindows最低RAM・最低VRAM・tokens/sを提示していません。公式tagの表示容量、reference weights、context表記は判断材料ですが、実際の適合性は同じPC・同じbackend・同じcontext・同じagent手順で測る必要があります。

公式ソース

よくある質問

Nemotron 3.5 Lightningは3Bモデルですか?

3B activeのMoEモデルですが、OllamaとNVIDIAの公式説明は30B total・3B activeです。active parameterだけでweight容量や実行時メモリを3B相当とは見積もりません。

Nemotronの25GB表示は必要RAMですか?

Ollama標準タグの約25GBはモデルページの表示容量です。RAM・VRAMの最低値や快適さの保証ではなく、KV cache、context、runtime、OS、他アプリの余裕を別に確認します。

Nemotron 3.5 LightningはWindowsで動きますか?

OllamaにはWindows docsとNemotronのモデルtagがありますが、全Windows GPU・CPUで同じbackendや速度が保証されるとは言えません。Ollama本体、driver、tag、contextを揃えて実機確認してください。

1M contextを使えばagentに向いていますか?

context上限だけでagent適性や快適さは決まりません。tool結果、RAG、並列、KV cache、I/O、再試行が増えるため、短いcontextから段階的に測ります。

NVIDIA公式の4倍高速・30%短縮は自分のPCでも出ますか?

保証できません。NVIDIAの数字は公式の測定条件に基づく主張です。自分のGPU、driver、backend、context、agent手順で別に実測してください。

次に読むおすすめルート

初めてローカルAIを触る人

まず全体像をつかみ、LM StudioとOllamaの違い、モデルサイズの考え方を順番に確認します。

  1. クラウドAIとローカルAIの使い分け
  2. ローカルLLMとは
  3. ローカルAIを入れる前に確認すること
  4. WindowsでローカルAIを始める完全ガイド
  5. Windows ARMでローカルAIを使う前の確認
  6. WindowsでOllamaをインストールする
  7. Windowsでローカル音声認識を始める
  8. WindowsでローカルOCRを始める
  9. Windowsで話者分離を始める
  10. WindowsでローカルAI翻訳を始める
  11. LM Studioとは
  12. GGUFとは
  13. GGUF版とは
  14. GGUFファイル名の読み方
  15. LM StudioでGGUFを入れる方法
  16. LM Studioで画像を読み込む方法
  17. LM Studioのモデル保存場所と移動
  18. 小型LLM・量子化の現実
  19. GGUF量子化安全とRAG/NPU研究
  20. Quant.npuとNPU向け静的量子化
  21. LENSで見るNPUレイテンシ予測
  22. Copilot+ PCのNPU期待値
  23. Hugging Face安全チェック
  24. PDF/RAG/引用確認の現実
  25. LM Studioで最初に選ぶモデル
  26. GGUFモデル選び診断
  27. Hugging FaceでGGUFモデルを探す方法
  28. Q4/Q5/Q8の違いと選び方
  29. 日本語GGUFモデルの選び方
  30. Q4/Q5/Q8研究ガイド
  31. Hermes Desktopとは
  32. Hermes DesktopとLM Studio接続
  33. Hermes DesktopとOllama接続
  34. Hermes Desktop接続トラブル
  35. Hermes AgentとDesktopの違い
  36. ローカルLLMツール比較
  37. ローカルAI更新メモ
  38. 診断ページ

あなたはどのタイプ?

関連チェック先

関連ツール

比較表を見る / 最初に検討しやすいツールを確認する