ローカルAI入門記事一覧
Windows初心者向けに、始め方、PCスペック、GPUなし、LM Studio、Ollama、モデル用語、中古PC・ミニPCの記事をカテゴリ別に整理しています。
新しいモデルやツール更新は、通常記事とは別にローカルAI更新メモで公開時点の情報として整理しています。運営方針や確認方法はこのサイトについてで確認できます。
検索クラスターから読む
目的ごとの順番で、迷わず次の記事へ
全体像、設定、失敗対策の順に進める読み方です。
GGUF量子化安全とオンデバイスRAG/NPUを読む
知らないGGUFを動かす前の配布元確認、Q4/Q5/Q8の安全誤解、Hugging Faceチェック、RAGの重さとNPU研究を一つの順番にまとめます。
- 1. 親ガイドGGUF量子化安全とRAG/NPUの全体像を確認する
- 2. GGUF安全入門GGUF・量子化・安全性を別軸で読む
- 3. Hugging Face確認Model Card、license、配布者を見る
- 4. 知らないGGUFLM Studio/Ollamaで動かす前の確認
- 5. Q4/Q5/Q8の誤解安全ランクとして読まない
- 6. Quant.npuNPU向け静的量子化を過剰一般化せず読む
- 7. LENSNPU推論のレイテンシ予測を読む
- 8. Copilot+ PCNPU搭載PCの期待値を整える
- 9. RAG/NPU研究NPUの可能性と限界を読む
- 10. RAG負荷分解CPU/GPU/NPU/RAM/APIで重さを切り分ける
PDFをローカルAIで読む
ツール比較から始め、AnythingLLMのPDF設定、RAG、埋め込み、引用確認、検索漏れへ必要な分だけ進みます。
Hermes Desktopを理解して接続する
Hermes Desktopの役割を先に理解し、LM Studio・Ollama・OpenRouterなどのproviderを目的別に選び、最後に接続トラブルを切り分けます。
ローカルAIエージェントを安全に選ぶ
Bionic、Ollama、AnythingLLM、Hermesを同じ種類のアプリとみなさず、local/cloud、ファイル、MCP、定期実行、PC負荷の順に比較します。
- 1. 親ハブモデル実行側とagent操作側の役割を分ける
- 2. LM Studio Bioniclocal・LM Link・Secure Cloudと本体を比較する
- 3. Kimi K3巨大open modelとlocal executionを混同しない
- 4. AnythingLLM Routerrule、fallback、sticky route、providerを確認する
- 5. Jobs・Memories自動実行、保存、allowed toolsの境界を見る
- 6. Magic Features音声・選択文字・画面コンテキストの通信を分ける
- 7. PC負荷context、KV cache、RAG、tool loopを測る
- 8. privacy確認local modelでも外部通信・保存・権限を確認する
LM Studioの速度と安定性を直す
まずロード・TTFT・tokens/sを測り、CPU 100%やGPU使用率の見え方を確認して、VRAM、モデルサイズ、コンテキスト長の順に負荷を下げます。
まず読む入門
ローカルAIとローカルLLMの全体像、ChatGPTとの違い、始め方をつかむ入口です。
LM Studio・GGUF
GGUFとは何か、LM Studioで最初に見るモデルサイズ・量子化・画像入力・保存先・診断ツールまで、モデル選びの順番をまとめています。
- GGUFとは?読み方・GGUF版・ファイル形式を初心者向けに解説
- GGUF版とは?元モデル・変換者・量子化・ライセンスを分けて見る初心者ガイド
- GGUFファイル名の読み方|Q4_K_M・Instruct・Chat・mmproj・MTPを初心者向けに整理
- LM StudioでGGUFをダウンロード・保存・読み込む方法|初心者向け手順と注意点
- LM Studioで画像を読み込む方法|VLM・GGUF・mmprojの確認ポイント
- LM Studioのモデル保存場所はどこ?Windowsで変更・移動する方法
- LM StudioでGGUFが表示されない・読み込めない時の確認ポイント|保存場所・形式・量子化・容量を切り分ける
- 日本語で使うGGUFモデルの選び方|LM Studio初心者向けに確認ポイントを整理
- GGUFモデルの保存先はSSDとHDDどっち?LM Studio初心者向けに速度・容量・移動方法を整理
- GGUF・safetensors・MLX・Ollamaの違い|形式・実行基盤・管理方法を分けて見る
- GGUF量子化モデルは安全なのか?Q4/Q5/Q8を選ぶ前に知るべきこと
- Hugging FaceでGGUFモデルを落とす前に見る安全チェックリスト
- LM StudioやOllamaで知らないGGUFを動かす前に確認すること
- Q4・Q5・Q8は安全ランクではない:量子化モデルを軽さだけで選ばない理由
- LM Studioで最初に選ぶモデルは?7B・8B・Q4_K_Mの選び方
- Q4_K_M・Q5_K_M・Q8_0の違い|GGUF量子化はどれを選ぶ?
- ローカルAIのモデルサイズ早見表|7B・8B・13BとQ4/Q5をPCメモリ別に解説
- ローカルAIの速度を測る方法|LM Studio・Ollamaでtokens/s・メモリ・VRAMを比較
- LM Studioのインストール手順|Windows初心者向けに始め方を解説
- LM StudioのGPUオフロードとは?CPU 100%・GPU使用率が低い時の確認
- 古いWindows PCでLM Studioを使うなら?軽量GGUFモデルの選び方
- Hugging FaceでGGUFモデルを探すには?LM Studio初心者向けにファイル名の見方を解説
- ローカルAIが重い・動かないときの確認順|LM Studio・Ollamaを症状別に切り分ける
- LM StudioのPrompt Processingが遅い時の直し方|長い入力・履歴・contextを切り分ける
- LM Studioの回答が途中で止まる・固まる時の確認順|メモリ・context・出力上限を切り分ける
- LM Studioが起動しない時の直し方|Windows・AVX2・インストーラー・runtime確認
- 診断ツールGGUFモデル選び診断
クラウドGPU・実験環境
手元PCを買い替える前に、Google ColabでGGUF・llama.cpp・MTPを条件付きで試します。Colabはローカル処理ではありません。
PCスペック・GPUなし
手元のWindows PCでどこまで試せるか、メモリやVRAMから判断します。
LM Studio/Ollama
Bionic、Ollama、AnythingLLM、Hermesの役割、Windows導入、Windows ARM互換性、VS Codeのlocal model、LM Studioのlms CLI・Tool Use・Structured Output・Responses、OllamaのOpenAI互換API・native API streaming・tool calling・Structured Outputs・embedding・Modelfile、モデルID・capabilities・実行状態、ローカルモデルとcloudモデルの境界、モデル保存先・一覧・削除、base URL、エラー時の切り分けを整理します。
- Windowsで使えるローカルAIエージェント比較|LM Studio Bionic・Ollama・AnythingLLM・Hermes
- LM Studio Bionicとは?LM Studio本体・local model・Secure Cloudの違い
- Kimi K3はローカルPCで動く?LM Studio Bionicのcloud modelとopen modelの違い
- AnythingLLM Model Routerとは?ローカルAIとクラウドAIを使い分ける設定と注意点
- AnythingLLM Scheduled JobsとMemoriesの使い方|自動実行前の安全確認
- AnythingLLM Magic Echo・Beacon・Tabとは?Windows全体で使う機能と通信の境界
- ローカルAIエージェントはなぜ重い?長文・KV cache・ツール呼び出しをPC負荷から解説
- Hermes Desktopとは?LM Studio・Ollamaとの違いとWindowsでの始め方
- Hermes DesktopとLM Studioを接続する方法|Base URL・Model ID・Local Server確認
- Hermes DesktopとOllamaを接続する方法|API URL・model名・ollama list確認
- Windows ARMでローカルAIは使える?Snapdragon X・LM Studio・Ollama
- VS CodeでローカルAIを使う方法|Ollama・LM Studio・BYOK
- LM StudioのCLI「lms」をWindowsで使う方法|基本コマンドとサーバー確認
- LM StudioのTool UseをWindowsで使う方法|/v1/chat/completions・function calling
- LM StudioのStructured OutputをWindowsで使う方法|response_format・JSON Schema・Python
- LM StudioのResponses APIをWindowsで使う方法|/v1/responses・stateful・streaming
- WindowsでOllamaをインストールする方法|初回確認
- Ollamaのローカルモデルとcloudモデルの違い|PC内で動く範囲・通信・注意点
- Ollamaのモデル保存場所はどこ?Windowsで移動する方法とOLLAMA_MODELS設定
- Ollamaのモデルを削除・一覧確認する方法|Windowsで容量を整理
- OllamaのOpenAI互換APIをWindowsで使う方法|/v1・モデル確認
- Ollamaのtool callingをWindowsで使う方法|/api/chat・Python・JavaScript
- OllamaのStructured OutputsをWindowsで使う方法|JSON Schema・Python・JavaScript
- LM StudioやOllamaの履歴はどこに残る?Windows初心者向けプライバシー確認ガイド
- Hermes Desktopがつながらない時の症状別チェック|LM Studio・Ollama・OpenRouter・DeepSeek対応
- Hermes DesktopがLM Studioにつながらない時の直し方|Base URL・Model ID・Server確認
- Hermes Desktopでconnection refusedが出る時|LM Studio local serverとport確認
- Hermes Desktopでmodel not foundが出る時|LM Studioのmodel ID確認
- Hermes Desktopの返事が遅い・止まる時|LM StudioのモデルサイズとGPU確認
- Hermes AgentとHermes Desktopの違い|本体・GUI・LM Studioとの関係
- LM StudioとOllamaの違い|Windows初心者にはどっち?
- Ollamaとは?ローカルモデル・cloudモデル・APIの違いを初心者向けに整理
- Ollamaが遅い時の確認順|WindowsでCPU・GPU・context・tokens/sを切り分ける
- Ollamaの回答が途中で止まる時の直し方|done_reason・context・メモリ・ログ確認
- Ollamaが起動しない・localhost:11434につながらない時の確認順|Windows
- OllamaでGPUが使われない時の確認順|Windowsの対応GPU・ollama ps・CPU fallback
- Hermes DesktopでLM Studio・Ollama・OpenRouter・DeepSeekを切り替える運用例
- Hermes DesktopでOpenRouterを使う方法|外部API・無料モデル・設定例を初心者向けに解説
- Hermes DesktopでOpenRouterにつながらない時|API key・model ID・無料枠の確認
- Hermes DesktopでDeepSeek APIを使う方法|モデル名・料金確認・OpenAI互換APIの注意点
- LM Studioのインストール手順|Windows初心者向けに始め方を解説
- ローカルAIをAPIで使うには?LM Studio・Ollama・JanのOpenAI互換APIを初心者向けに解説
- OllamaのモデルIDをWindowsで確認する方法|/v1/models・api/show・capabilities
- OllamaのModelfileをWindowsで使う方法|ollama create・SYSTEM・PARAMETER
- OllamaのAPI streamingをWindowsで使う方法|NDJSON・done・PowerShell
API・長文・RAG
ローカルAIをAPI、LM StudioのTool Use・Structured Output・Responses、OllamaのOpenAI互換API・native API streaming、tool calling・Structured Outputs、embedding、長文処理、PDF/RAG、外部API、provider切り替えまで広げるための技術入口です。
- ローカルAIをAPIで使うには?LM Studio・Ollama・JanのOpenAI互換APIを初心者向けに解説
- LM StudioのTool UseをWindowsで使う方法|/v1/chat/completions・function calling
- LM StudioのStructured OutputをWindowsで使う方法|response_format・JSON Schema・Python
- LM StudioのResponses APIをWindowsで使う方法|/v1/responses・stateful・streaming
- OllamaのOpenAI互換APIをWindowsで使う方法|/v1・モデル確認
- OllamaのAPI streamingをWindowsで使う方法|NDJSON・done・PowerShell
- Ollamaのtool callingをWindowsで使う方法|/api/chat・Python・JavaScript
- OllamaのStructured OutputsをWindowsで使う方法|JSON Schema・Python・JavaScript
- コンテキスト長とは?ローカルAIで長文・PDFが重くなる理由を初心者向けに解説
- オンデバイスRAGはNPUで速くなる?Snapdragon X Elite研究を初心者向けに読む
- ローカルRAGはなぜ重い?CPU・GPU・NPUで見るPDF読み込みと検索の負荷
- Quant.npuとは?NPUでローカルLLMを速くする静的量子化研究を初心者向けに解説
- NPUでローカルLLMは本当に速くなる?LENS論文で見るレイテンシ予測の考え方
- Hermes DesktopでLM Studio・Ollama・OpenRouter・DeepSeekを切り替える運用例
- Hermes DesktopでOpenRouterを使う方法|外部API・無料モデル・設定例を初心者向けに解説
- Hermes DesktopでOpenRouterにつながらない時|API key・model ID・無料枠の確認
- Hermes Desktopがつながらない時の症状別チェック|LM Studio・Ollama・OpenRouter・DeepSeek対応
- Hermes DesktopでDeepSeek APIを使う方法|モデル名・料金確認・OpenAI互換APIの注意点
- Hermes AgentとHermes Desktopの違い|本体・GUI・LM Studioとの関係
- Hermes DesktopとOllamaを接続する方法|API URL・model名・ollama list確認
- RAG・埋め込み・ベクトルDBとは?ローカルAIでPDFを読む仕組みを初心者向けに解説
- 埋め込みモデルとは?ローカルAIで検索・分類・RAGに使う意味を初心者向けに解説
- LM StudioのGPUオフロードとは?CPU 100%・GPU使用率が低い時の確認
実用化・ツール連携
安全性、JSON出力、LM Studio Structured Output・Responses、Ollama Structured Outputs、埋め込み、文書チャット、音声文字起こし、話者分離、画像OCR、翻訳、コーディング、MCP、LM StudioとOllamaのtool callingを理解して、ローカルAIを道具として使う入口です。
- ローカルAIモデル安全研究ガイド:GGUF量子化とオンデバイスRAG/NPUを初心者向けに読む
- Quant.npuとは?NPUでローカルLLMを速くする静的量子化研究を初心者向けに解説
- NPUでローカルLLMは本当に速くなる?LENS論文で見るレイテンシ予測の考え方
- Copilot+ PCのNPUに期待できること・できないこと:ローカルAI初心者向けチェックリスト
- ローカルLLMは安全?プライバシー・履歴・外部送信・モデルの注意点を解説
- LM StudioやOllamaの履歴はどこに残る?Windows初心者向けプライバシー確認ガイド
- LM StudioやOllamaで知らないGGUFを動かす前に確認すること
- ローカルAIでJSON出力するには?構造化出力・JSON Schemaを初心者向けに解説
- LM StudioのStructured OutputをWindowsで使う方法|response_format・JSON Schema・Python
- LM StudioのResponses APIをWindowsで使う方法|/v1/responses・stateful・streaming
- Windowsでローカル音声認識を始める方法|Whisper・whisper.cppの選び方
- Windowsでローカル話者分離を始める方法|WhisperX・pyannote.audioの選び方
- WindowsでローカルOCRを始める方法|PowerToys・Tesseract・PaddleOCR・OCRmyPDFの選び方
- WindowsでローカルAI翻訳を始める方法|モデルの選び方
- WindowsでローカルAIコーディングを始める方法|Bionic・Ollamaの選び方
- ローカルAIでPDF・文書チャットする方法|LM Studio・AnythingLLM・RAGの違い
- 埋め込みモデルとは?ローカルAIで検索・分類・RAGに使う意味を初心者向けに解説
- MCPとは?ローカルAIにツールを使わせる仕組みを初心者向けに解説
- Ollamaのtool callingをWindowsで使う方法|/api/chat・Python・JavaScript
- OllamaのStructured OutputsをWindowsで使う方法|JSON Schema・Python・JavaScript
- LM StudioのTool UseをWindowsで使う方法|/v1/chat/completions・function calling
モデル・用語
モデルサイズ、量子化、VRAMなど、最初につまずきやすい言葉を整理します。
PDF・文書活用
LM StudioやOllamaでモデルを動かし、OCR、AnythingLLM、RAGでPDF・資料を扱う前提を整理します。
- ローカルAIでPDF・文書チャットする方法|LM Studio・AnythingLLM・RAGの違い
- WindowsでローカルOCRを始める方法|PowerToys・Tesseract・PaddleOCR・OCRmyPDFの選び方
- AnythingLLMでPDFをローカルAIに読ませる方法|LM Studio・Ollama接続とRAG設定
- AnythingLLMでPDFを読めない・答えない原因|画像PDF・埋め込み・RAGの直し方
- オンデバイスRAGはNPUで速くなる?Snapdragon X Elite研究を初心者向けに読む
- ローカルRAGはなぜ重い?CPU・GPU・NPUで見るPDF読み込みと検索の負荷
- RAG・埋め込み・ベクトルDBとは?ローカルAIでPDFを読む仕組みを初心者向けに解説
- 埋め込みモデルとは?ローカルAIで検索・分類・RAGに使う意味を初心者向けに解説
- コンテキスト長とは?ローカルAIで長文・PDFが重くなる理由を初心者向けに解説
- AnythingLLMAnythingLLMの基本情報
Ollama Embedding API
WindowsのOllamaで文章をベクトル化し、batch、RAGのindex/query、OpenAI互換との違いを実装確認します。
LM Studio Embeddings
WindowsのLM Studioでembedding model、/v1/embeddings、PowerShell、Python・TypeScript、RAGのindex/queryを実装確認します。
Ollama Responses API
WindowsのOllamaで/v1/responses、PowerShell、Python・JavaScript、streaming、非statefulの境界を実装確認します。
Ollama API認証
WindowsのOllamaでlocalhost、OpenAI互換のapi_key、ollama signin、cloud、OLLAMA_API_KEY、local-only modeを分けて確認します。
OllamaモデルID・能力診断
WindowsのOllamaで/v1/models、/api/tags、/api/show、/api/psを照合し、model not found・capabilities・実行状態を切り分けます。
Ollama Modelfile
WindowsでFROM・SYSTEM・PARAMETER・TEMPLATEを設定し、ollama createでcustom modelを作成・検証します。
Ollama native API streaming
Windowsで/api/generate・/api/chatのNDJSON、stream=false、done、途中エラー、usageを確認します。
中古PC・ミニPC
購入前に、メモリ、GPU、ストレージ、冷却の見落としを減らします。
記事選びに迷ったら診断へ
診断フォームで、PCスペック、GPUの有無、目的、コマンド操作への抵抗感から最初に試す環境の目安を確認できます。