GGUF・safetensors・MLX・Ollamaの違い|形式・実行基盤・管理方法を分けて見る

公開日
2026-07-05
更新日
2026-08-12
情報確認日
2026-08-12
編集・運営
Local AI Compass

GGUF、safetensors、MLX、Ollamaは同じ階層の言葉ではありません。GGUFとsafetensorsは主にモデル重み・推論ファイルの形式、MLXはApple silicon向けの機械学習framework、Ollamaはモデルを取得・実行・管理するruntimeの入口です。先に層を分けると、「どれが一番良いか」という比較で迷いにくくなります。

導入前に確認すること

  • Windowsのバージョン、メモリ容量、GPU/VRAM、空き容量を確認する
  • 最初は軽量モデル、短い質問、少ない同時作業から始める
  • 公式サイトの対応OS、利用規約、モデルのライセンスを確認する

この記事の役割:4つを同じ階層で比べない

この記事の役割:4つを同じ階層で比べないの表
名前主な層最初に確認すること
GGUFGGML系executorで推論するためのファイル形式拡張子、model ID、量子化、対応runtimeを確認
safetensorstensorを保存するモデル重み形式Model Card、framework、config、licenseを確認
MLXApple silicon向けの機械学習array frameworkMacのCPU/GPU経路とMLX対応モデルを確認
Ollamaモデル取得・作成・実行・API管理のruntimetag、Modelfile、FROM元、実行環境を確認

GGUFとsafetensors:形式と変換後の実行経路を分ける

ggmlの公式仕様では、GGUFはGGMLとGGML系executorで推論するモデルを保存するbinary formatで、PyTorchなどで開発したモデルをGGUFへ変換する流れが説明されています。単一ファイル配置やmetadataを持てる設計でも、すべてのruntimeで読めるという意味ではありません。

Hugging FaceのSafetensors docsは、tensorを安全かつ高速に保存・読み込む形式として`model.safetensors`と`safe_open`を説明しています。safetensorsを見つけた時点でGGUFと同じ実行手順だと考えず、Model Cardとframeworkの読み込み方法を確認します。

GGUFとsafetensors:形式と変換後の実行経路を分けるの表
目的最初に見るもの混同しないこと
LM Studioやllama.cppでローカル推論対応するGGUF、量子化、model cardGGUFだから全モデル・全backendで動くとは限らない
Transformers系で開発・変換safetensors、config、tokenizer、推奨frameworksafetensorsはそのままLM Studio用GGUFではない
形式を変換して別runtimeへ移す変換ツール、revision、quantization、再現条件変換後のmodel ID・品質・licenseを自動で同一視しない

MLX:Apple silicon向けのframeworkであり、GGUFの別名ではない

AppleのMLX公式リポジトリは、MLXをApple silicon向けのmachine learning array frameworkと説明し、CPUとGPUで動くmulti-deviceの仕組みを案内しています。したがってMLXは、GGUFやsafetensorsのような単一のモデルファイル形式と同じ欄へ置かないほうが正確です。

MacでMLX対応モデルを探す場合は、MLXの実行環境、モデル配布元、対応パッケージ、メモリ共有の前提を確認します。WindowsでGGUFを使う説明へそのまま移植したり、MLX対応だけでLM Studio・Ollamaの動作を保証したりしません。

Ollama:複数の入力形式を扱うruntime・管理層

Ollama公式のModelfileは、モデルの作成・共有・実行を定義するblueprintです。Ollama公式のImporting a Modelでは、SafetensorsのdirectoryやGGUF fileを`FROM`に指定して`ollama create`し、`ollama run`する経路が別々に説明されています。これはOllamaがGGUFという一つのファイル形式そのものではなく、入力モデルをruntimeへ取り込んで管理する層だと考える根拠になります。

FROM /path/to/safetensors/directory
# または
FROM /path/to/file.gguf

ollama create my-model
ollama run my-model

Hugging Faceや配布ページで確認する順番

  1. まずModel Cardで元モデル、推奨framework、用途、制限、licenseを見る。
  2. Filesで`.gguf`、`.safetensors`、MLX関連ファイルやconfigを層ごとに分ける。
  3. 使うOSとruntimeを先に決め、形式の対応表ではなく公式のimport・load手順を確認する。
  4. 変換する場合はrepo、revision、変換ツール、量子化、出力ファイルを記録する。
  5. 同じ名前でも配布元・tag・形式・quantが違う場合は、同じモデルとして速度や品質を比較しない。

近いGGUF記事との使い分け

このページは4つの言葉の階層を分ける比較記事です。GGUFの定義、GGUF版の出所、ファイル名、量子化、実際のLM Studio導入は、それぞれ専門記事へ分けて読みます。

Windows初心者の最初の選択

Windows初心者の最初の選択の表
状況最初に見る候補確認する層
Windowsで画面操作を先に試すGGUF + LM Studio形式、quant、LM Studioの対応runtime
Apple silicon Macでframeworkも見るMLXまたはGGUFMLXのdevice前提、モデル配布、memory model
コマンド/APIで管理するOllamaまたは別runtimetag、Modelfile、API、入力形式
研究・変換・fine-tuningを行うsafetensors + 推奨frameworkconfig、checkpoint、変換手順、license

よくある質問

GGUFとsafetensorsは同じモデルですか?

元モデルが同じでも、形式、変換、量子化、config、推奨runtimeが違う別の配布物として扱います。repo、revision、変換条件、licenseを記録し、同じモデル名だけで同一視しません。

MLXはGGUFの別形式ですか?

単純な別拡張子としてではなく、MLXはApple silicon向けの機械学習array frameworkとして確認します。MLX対応モデルの配布形式、Macのdevice経路、利用runtimeを個別に見ます。

OllamaはGGUFファイルですか?

いいえ。Ollamaはモデルの取得・作成・実行・管理を担うruntimeの入口です。公式docsにはSafetensors directoryやGGUF fileを`FROM`から取り込む手順があり、入力形式とOllamaの管理層は分けて考えます。

最初に読むべきGGUF記事はどれですか?

4つの言葉の違いならこの記事、GGUFの定義なら「GGUFとは」、配布元や変換者なら「GGUF版とは」、Q4/Q5/Q8なら量子化記事、実際のWindows導入ならLM Studioのロード記事を選びます。

次に読むおすすめルート

初めてローカルAIを触る人

まず全体像をつかみ、LM StudioとOllamaの違い、モデルサイズの考え方を順番に確認します。

  1. クラウドAIとローカルAIの使い分け
  2. ローカルLLMとは
  3. ローカルAIを入れる前に確認すること
  4. WindowsでローカルAIを始める完全ガイド
  5. Windows ARMでローカルAIを使う前の確認
  6. WindowsでOllamaをインストールする
  7. Windowsでローカル音声認識を始める
  8. WindowsでローカルOCRを始める
  9. Windowsで話者分離を始める
  10. WindowsでローカルAI翻訳を始める
  11. LM Studioとは
  12. GGUFとは
  13. GGUF版とは
  14. GGUFファイル名の読み方
  15. LM StudioでGGUFを入れる方法
  16. LM Studioで画像を読み込む方法
  17. LM Studioのモデル保存場所と移動
  18. 小型LLM・量子化の現実
  19. GGUF量子化安全とRAG/NPU研究
  20. Quant.npuとNPU向け静的量子化
  21. LENSで見るNPUレイテンシ予測
  22. Copilot+ PCのNPU期待値
  23. Hugging Face安全チェック
  24. PDF/RAG/引用確認の現実
  25. LM Studioで最初に選ぶモデル
  26. GGUFモデル選び診断
  27. Hugging FaceでGGUFモデルを探す方法
  28. Q4/Q5/Q8の違いと選び方
  29. 日本語GGUFモデルの選び方
  30. Q4/Q5/Q8研究ガイド
  31. Hermes Desktopとは
  32. Hermes DesktopとLM Studio接続
  33. Hermes DesktopとOllama接続
  34. Hermes Desktop接続トラブル
  35. Hermes AgentとDesktopの違い
  36. ローカルLLMツール比較
  37. ローカルAI更新メモ
  38. 診断ページ

あなたはどのタイプ?

関連チェック先

  • ggml GGUF specification - GGUFの仕様、推論向けファイル形式、メタデータ、命名規則、sidecarの考え方を確認できます。
  • Safetensors documentation - Safetensorsのtensor保存形式、safe_open、メタデータと変換の公式説明を確認できます。
  • MLX official repository - MLXがApple silicon向けの機械学習array frameworkであること、対応デバイスと公式導線を確認できます。
  • Ollama Modelfile Reference - Ollamaのモデル作成・実行・管理を担うModelfileとFROMの公式仕様を確認できます。
  • Ollama Importing a Model - OllamaがSafetensorsやGGUFを別の入力経路としてimportできる公式手順を確認できます。
  • Hugging Face Hub GGUF documentation - Hub上でGGUFファイルを探す方法、GGUF tag、変換・量子化の公式説明を確認できます。
  • Hugging Face GGUF usage with LM Studio - Hugging FaceからLM StudioへGGUF/MLXモデルを送る方法、アプリ内ダウンロード、量子化選択を確認できます。
  • ggml-org/llama.cpp - GGUFモデルを読み込む代表的なローカル推論実装です。

関連ツール

比較表を見る / 最初に検討しやすいツールを確認する