ローカルAI入門記事一覧

Windows初心者向けに、始め方、PCスペック、GPUなし、LM Studio、Ollama、モデル用語、中古PC・ミニPCの記事をカテゴリ別に整理しています。

新しいモデルやツール更新は、通常記事とは別にローカルAI更新メモで公開時点の情報として整理しています。運営方針や確認方法はこのサイトについてで確認できます。

検索クラスターから読む

目的ごとの順番で、迷わず次の記事へ

全体像、設定、失敗対策の順に進める読み方です。

安全と次世代RAG

GGUF量子化安全とオンデバイスRAG/NPUを読む

知らないGGUFを動かす前の配布元確認、Q4/Q5/Q8の安全誤解、Hugging Faceチェック、RAGの重さとNPU研究を一つの順番にまとめます。

  1. 1. 親ガイドGGUF量子化安全とRAG/NPUの全体像を確認する
  2. 2. GGUF安全入門GGUF・量子化・安全性を別軸で読む
  3. 3. Hugging Face確認Model Card、license、配布者を見る
  4. 4. 知らないGGUFLM Studio/Ollamaで動かす前の確認
  5. 5. Q4/Q5/Q8の誤解安全ランクとして読まない
  6. 6. Quant.npuNPU向け静的量子化を過剰一般化せず読む
  7. 7. LENSNPU推論のレイテンシ予測を読む
  8. 8. Copilot+ PCNPU搭載PCの期待値を整える
  9. 9. RAG/NPU研究NPUの可能性と限界を読む
  10. 10. RAG負荷分解CPU/GPU/NPU/RAM/APIで重さを切り分ける
新しい伸び筋

PDFをローカルAIで読む

ツール比較から始め、AnythingLLMのPDF設定、RAG、埋め込み、引用確認、検索漏れへ必要な分だけ進みます。

  1. 1. 方法を比較LM Studio単体・AnythingLLM・RAGの違いを選ぶ
  2. 2. PDFを設定文書追加から回答確認までの流れをつかむ
  3. 3. 精度を直す検索されない・根拠が弱い原因を確認する
  4. 4. 仕組みを理解RAG・埋め込み・ベクトルDBの役割を分ける
  5. 5. 間違う理由を読む抽出・検索・引用・生成のどこでずれるか確認する
  6. 6. 検証する公開PDFで根拠確認の手順を作る
接続クラスター

Hermes Desktopを理解して接続する

Hermes Desktopの役割を先に理解し、LM Studio・Ollama・OpenRouterなどのproviderを目的別に選び、最後に接続トラブルを切り分けます。

  1. 1. Hermes DesktopとはLM Studio・Ollamaとの役割の違いを先に整理する
  2. 2. LM Studio接続Local Server、Base URL、Model IDを合わせる
  3. 3. Ollama接続CLI/API寄りの接続と11434系endpointを分ける
  4. 4. 症状別ハブconnection refused・model not found・timeoutを入口に切り分ける
  5. 5. model ID確認モデル名・/v1/models・slugの違いを確認する
  6. 6. GGUF・負荷確認モデル形式、量子化、PC負荷の前提へ戻る
新しい実用クラスター

ローカルAIエージェントを安全に選ぶ

Bionic、Ollama、AnythingLLM、Hermesを同じ種類のアプリとみなさず、local/cloud、ファイル、MCP、定期実行、PC負荷の順に比較します。

  1. 1. 親ハブモデル実行側とagent操作側の役割を分ける
  2. 2. LM Studio Bioniclocal・LM Link・Secure Cloudと本体を比較する
  3. 3. Kimi K3巨大open modelとlocal executionを混同しない
  4. 4. AnythingLLM Routerrule、fallback、sticky route、providerを確認する
  5. 5. Jobs・Memories自動実行、保存、allowed toolsの境界を見る
  6. 6. Magic Features音声・選択文字・画面コンテキストの通信を分ける
  7. 7. PC負荷context、KV cache、RAG、tool loopを測る
  8. 8. privacy確認local modelでも外部通信・保存・権限を確認する
重い・止まるを解決

LM Studioの速度と安定性を直す

まずロード・TTFT・tokens/sを測り、CPU 100%やGPU使用率の見え方を確認して、VRAM、モデルサイズ、コンテキスト長の順に負荷を下げます。

  1. 1. 速度を測るロード・TTFT・tokens/s・RAM/VRAMを同じ条件で記録する
  2. 2. GPUオフロードGPUにどこまで処理を載せるか理解する
  3. 3. 症状を切り分け停止・固まり・極端な遅さを順番に確認する
  4. 4. サイズを下げるモデル規模と量子化をPCに合わせる
  5. 5. PC条件を確認メモリ・VRAM・ストレージの不足を見直す

まず読む入門

ローカルAIとローカルLLMの全体像、ChatGPTとの違い、始め方をつかむ入口です。

LM Studio・GGUF

GGUFとは何か、LM Studioで最初に見るモデルサイズ・量子化・画像入力・保存先・診断ツールまで、モデル選びの順番をまとめています。

クラウドGPU・実験環境

手元PCを買い替える前に、Google ColabでGGUF・llama.cpp・MTPを条件付きで試します。Colabはローカル処理ではありません。

PCスペック・GPUなし

手元のWindows PCでどこまで試せるか、メモリやVRAMから判断します。

LM Studio/Ollama

Bionic、Ollama、AnythingLLM、Hermesの役割、Windows導入、Windows ARM互換性、VS Codeのlocal model、LM Studioのlms CLI・Tool Use・Structured Output・Responses、OllamaのOpenAI互換API・native API streaming・tool calling・Structured Outputs・embedding・Modelfile、モデルID・capabilities・実行状態、ローカルモデルとcloudモデルの境界、モデル保存先・一覧・削除、base URL、エラー時の切り分けを整理します。

API・長文・RAG

ローカルAIをAPI、LM StudioのTool Use・Structured Output・Responses、OllamaのOpenAI互換API・native API streaming、tool calling・Structured Outputs、embedding、長文処理、PDF/RAG、外部API、provider切り替えまで広げるための技術入口です。

実用化・ツール連携

安全性、JSON出力、LM Studio Structured Output・Responses、Ollama Structured Outputs、埋め込み、文書チャット、音声文字起こし、話者分離、画像OCR、翻訳、コーディング、MCP、LM StudioとOllamaのtool callingを理解して、ローカルAIを道具として使う入口です。

モデル・用語

モデルサイズ、量子化、VRAMなど、最初につまずきやすい言葉を整理します。

PDF・文書活用

LM StudioやOllamaでモデルを動かし、OCR、AnythingLLM、RAGでPDF・資料を扱う前提を整理します。

Ollama Embedding API

WindowsのOllamaで文章をベクトル化し、batch、RAGのindex/query、OpenAI互換との違いを実装確認します。

LM Studio Embeddings

WindowsのLM Studioでembedding model、/v1/embeddings、PowerShell、Python・TypeScript、RAGのindex/queryを実装確認します。

Ollama Responses API

WindowsのOllamaで/v1/responses、PowerShell、Python・JavaScript、streaming、非statefulの境界を実装確認します。

Ollama API認証

WindowsのOllamaでlocalhost、OpenAI互換のapi_key、ollama signin、cloud、OLLAMA_API_KEY、local-only modeを分けて確認します。

OllamaモデルID・能力診断

WindowsのOllamaで/v1/models、/api/tags、/api/show、/api/psを照合し、model not found・capabilities・実行状態を切り分けます。

Ollama Modelfile

WindowsでFROM・SYSTEM・PARAMETER・TEMPLATEを設定し、ollama createでcustom modelを作成・検証します。

Ollama native API streaming

Windowsで/api/generate・/api/chatのNDJSON、stream=false、done、途中エラー、usageを確認します。

中古PC・ミニPC

購入前に、メモリ、GPU、ストレージ、冷却の見落としを減らします。

記事選びに迷ったら診断へ

診断フォームで、PCスペック、GPUの有無、目的、コマンド操作への抵抗感から最初に試す環境の目安を確認できます。