WindowsでローカルAI翻訳を始める方法|モデルの選び方
- 公開日
- 2026-08-09
- 更新日
- 2026-08-09
- 情報確認日
- 2026-08-09
- 編集・運営
- Local AI Compass
翻訳をクラウドへ送らずに試したいなら、まず翻訳用モデル、実行アプリ、入力データの境界を分けます。WindowsではTranslateGemmaを基準に、Transformersでの公式経路、互換量子化を使うLM Studio・Ollama、言語コード、長文分割、原文照合を順番に確認すると判断しやすくなります。
導入前に確認すること
- Windowsのバージョン、メモリ容量、GPU/VRAM、空き容量を確認する
- 最初は軽量モデル、短い質問、少ない同時作業から始める
- 公式サイトの対応OS、利用規約、モデルのライセンスを確認する
先に結論:翻訳用モデルと実行アプリを分けて選ぶ
WindowsでローカルAI翻訳を始めるときは、「モデルが翻訳向けか」「どのruntimeで動かすか」「翻訳する文章をどこへ保存するか」を別々に確認します。TranslateGemmaはGoogleが翻訳向けに公開したGemma 3ベースのモデル群で、4B・12B・27Bのサイズがあります。ただし、モデルのサイズだけで翻訳品質や自分のPCでの速度を保証できるわけではありません。
| やりたいこと | 最初の候補 | 確認すること |
|---|---|---|
| 文章を翻訳用モデルで処理する | TranslateGemma + Transformers | 対応言語コード、モデル取得条件、メモリ、入力長 |
| GUIで短文を試す | 互換量子化 + LM Studio | 配布元、quantization、chat template、外部送信設定 |
| コマンドやAPIから呼ぶ | 互換GGUF + Ollama | ModelfileのFROM、モデル形式、endpoint、ログ |
| 画像の文字を別言語にする | 画像入力対応モデル、またはOCR→翻訳 | 画像の読み取りと翻訳を同じ処理と考えない |
| 会話音声を翻訳する | Whisperの音声認識と翻訳工程 | 音声認識・話者分離・文書翻訳の役割 |
最初は短い文章を3本だけ用意し、原文、翻訳結果、使用モデル、言語コード、処理時間を保存します。文章の自然さ、固有名詞、数字、否定、専門用語を人が照合してから、長文や機密資料へ広げてください。
- TranslateGemma公式発表 - サイズ、言語、画像翻訳の位置づけを見る
- GGUF・量子化の基本 - 互換量子化ファイルを選ぶ前の用語を確認する
- LM Studioで最初に選ぶモデル - モデル単体を先に動かす順番を見る
ローカル翻訳でも通信経路は一つではない
「ローカルAI翻訳」は、推論を手元のPCで行う構成を指せますが、初回のモデル取得、Hugging Faceの認証、アプリの更新、外部API、クラウドfallbackまで自動的に消える意味ではありません。翻訳前の入力、モデル、出力、中間ファイルのそれぞれで通信と保存場所を確認します。
| 工程 | 起こり得る通信・保存 | 確認の観点 |
|---|---|---|
| モデルを探す・取得する | Hugging Face、Kaggle、アプリのdownload | 利用条件、license、cache、取得先 |
| ローカル推論する | PCのCPU/GPU/RAM、runtimeのログ | localhostか、ネットワーク公開か、ログの保存先 |
| 別アプリへつなぐ | OpenAI互換API、MCP、拡張機能 | 翻訳本文、prompt、履歴、fallback先 |
| 結果を共有する | クリップボード、同期フォルダ、メール、翻訳サービス | 原文・出力・派生データの扱い |
- 翻訳する文章の権利、機密性、保存期間を確認する。
- モデルの利用条件とlicenseを読み、Hugging Faceのaccess条件を先に満たす。
- モデル取得後に推論をローカルへ寄せられるか、runtimeとAPIの設定を確認する。
- 外部APIやcloud providerを使う場合は、local modelとは別の経路として記録する。
Gemma系モデルの利用条件は、モデル名だけで商用利用や再配布の可否を決めず、公式Termsとmodel cardを確認します。翻訳の結果だけでなく、原文と中間ファイルも機密情報として扱うと、削除漏れを減らせます。
- TranslateGemma model card - 利用条件、入力、制約、公式実装を見る
- Gemma Terms of Use - モデル利用条件を確認する
- ローカルAIのプライバシーは本当に安全? - local処理と外部連携の境界を整理する
TranslateGemmaの4B・12B・27Bをどう選ぶか
Googleの公式発表ではTranslateGemmaに4B、12B、27Bのサイズがあり、12Bはconsumer laptopでの実行を想定した位置づけ、27Bはより高い忠実度を狙う大きな候補として説明されています。これはPCごとの動作保証ではないため、メモリ、量子化、同時起動アプリ、入力長を合わせて判断します。
| 候補 | 最初の見方 | 避けたい判断 |
|---|---|---|
| 4B | 小さめの入力で動作と翻訳方向を確認する入口 | 小さいから全PCで快適だと決める |
| 12B | 品質と負荷のバランスを比較する候補 | Googleの位置づけを自分のPCの保証値にする |
| 27B | メモリ・GPUに余裕がある環境で比較する候補 | 最初から大きさだけで品質を断定する |
| 量子化版 | LM Studio・Ollamaなどへ接続しやすい経路 | 配布元、template、licenseを確認せず取得する |
Transformersのmodel cardで示されている翻訳入力は、source languageとtarget languageを明示する形式です。たとえば英語から日本語へ試す場合でも、利用するモデルがその組み合わせを受け付けるかを確認してから実行します。
messages = [
{
"role": "user",
"content": [
{
"type": "text",
"source_lang_code": "en",
"target_lang_code": "ja",
"text": "The local model runs on my Windows PC.",
}
],
}
]上記はTranslateGemmaのchat templateを読むための入力例です。実行時はmodel cardのTransformers例を使い、利用するモデル版、対応言語、dtype、device、必要な依存関係を現行資料で確認してください。記事内へtokenや秘密情報を貼り付けないでください。
- TranslateGemma公式発表 - 4B・12B・27Bの位置づけを確認する
- TranslateGemma model card - ISO言語コードと公式Transformers例を見る
- メモリ8GB・16GB・32GBの目安 - モデル単体以外のメモリ負荷も考える
LM Studioで試す:互換量子化とchat templateを確認する
LM Studioはモデルを探してロードし、GUIで短い入力を試す入口に向きます。TranslateGemmaのmodel cardには、量子化をllama.cpp、Ollama、LM Studioなどの互換アプリで使うための案内がありますが、すべての配布ファイルが同じ設定で動くわけではありません。
- Hugging Faceの公式モデルと、そこから参照される量子化の配布元・revision・licenseを確認する。
- LM Studioでモデル名、quantization、context、vision対応、chat templateの表示を確認する。
- まず短い一文を、翻訳方向を明示して実行し、出力が説明文ではなく翻訳だけになるかを見る。
- 同じ原文を別モデルでも試し、処理時間、メモリ、固有名詞、数字の差を記録する。
LM Studioの画面で動いたことは、長文PDF、画像翻訳、API連携、完全オフラインを保証しません。モデルをロードした場所、serverの公開範囲、ログ、履歴、外部拡張を別に確認します。
| LM Studioで見る場所 | 確認内容 |
|---|---|
| モデルカード・ファイル名 | 公式配布元、サイズ、quantization、revision |
| ロード設定 | context、GPU offload、RAM/VRAM、同時起動アプリ |
| チャット入力 | source/target language、原文だけの入力、出力形式 |
| Developer/API | localhost、network公開、API token、履歴とログ |
- LM Studio公式入門 - モデル取得・ロード・チャットの基本を見る
- LM Studioで画像を読む方法 - 画像対応と通常の文章翻訳を分ける
- LM Studioが重い・止まる時 - モデル・メモリ・入力を切り分ける
Ollamaで試す:モデル名を発明せず、互換形式から確認する
Ollamaを使う場合は、公式libraryにあるモデルtagをそのまま翻訳用モデルだと決めつけず、利用時点の公式情報とモデルカードを確認します。確認済みの互換GGUFを自分で登録する場合、OllamaのModelfileは`FROM`でGGUFを指定できますが、モデルのchat templateやマルチモーダル対応まで自動で正しくなるとは限りません。
FROM ./<verified-compatible-translation-model>.gguf
PARAMETER temperature 0このModelfileは形式の考え方を示すプレースホルダーです。存在を確認していないモデル名、ダウンロードURL、量子化ファイル名は記事へ固定しません。まず公式model cardと配布元のrevisionを照合し、短いテストで入力template、言語コード、出力の余計な説明を確認します。
| 確認項目 | 理由 |
|---|---|
| FROMのファイル | GGUFのarchitectureと量子化がruntimeに対応するかを見る |
| template | 翻訳方向を渡せず、通常のチャットとして解釈される可能性がある |
| temperature・stop | 翻訳結果の揺れや説明文の混入を比較する |
| API・ログ | localhostでも入力文、履歴、外部連携の設定を確認する |
- Ollama Modelfile公式リファレンス - FROMとモデル作成の仕様を見る
- Ollama公式ドキュメント - Windows・モデル・APIの現行入口を見る
- ローカルAIをAPIで使う方法 - localhostとOpenAI互換APIの境界を確認する
日本語・画像・長文を翻訳するときの注意点
TranslateGemmaのmodel cardは、textまたはimageの入力、source_lang_codeとtarget_lang_code、2K tokensの入力contextを説明しています。日本語を含む組み合わせでも、使うmodel versionが対象コードを受け付けるかを先に確認し、長い原稿を一度に押し込まないようにします。
| 用途 | 先にすること | 確認ポイント |
|---|---|---|
| 日本語の短文 | `ja`などのコードをmodel cardで確認する | 固有名詞、敬体、否定、数字 |
| 長い文書 | 見出し・段落・用語集単位で分割する | 文脈の断絶、重複、抜け、順序 |
| 画像内の文字 | 対応するimage inputかOCR→翻訳を選ぶ | 小さい文字、表、固有名詞、読み取り誤り |
| テキスト抽出・OCRを先に確認する | 抽出結果と翻訳結果を混同しない |
- 文章を段落単位に分け、見出し・箇条書き・表の順序を別に保存する。
- 用語集を先に作り、製品名・人名・API名を勝手に訳さない指示を固定する。
- 画像は解像度や切り抜きを確認し、OCRの誤りを翻訳品質の問題と混ぜない。
- 翻訳後に原文と突き合わせ、数字、単位、否定、条件文、固有名詞を人が確認する。
画像を翻訳できるモデルでも、文字の読み取りが常に正しいとは限りません。画像OCRを目的にする場合はOCR記事やvision記事の手順へ分け、翻訳モデルだけでPDF全体を自動処理できると考えないでください。
- WindowsでローカルOCRを選ぶ方法 - 画像・スキャンPDFの文字抽出を先に確認する
- LM Studioで画像を読み込む方法 - vision modelと画像入力の条件を見る
- PDF・文書チャットの使い分け - 抽出・RAG・翻訳の役割を分ける
品質・PC負荷・プライバシーを小さく検証する
| 症状 | 原因候補 | 最初の対処 |
|---|---|---|
| モデルが取得できない | Hugging Face条件、ログイン、revision、権限 | 公式model cardとTermsを確認する |
| ロード時にメモリ不足になる | BF16、モデルサイズ、context、同時起動アプリ | 4Bや互換量子化、短い入力から比較する |
| 原文のまま返る | 言語コード、template、modelの役割違い | source/target codeと公式入力形式を照合する |
| 説明が長く混ざる | 通常のchat prompt、temperature、stop設定 | 翻訳対象だけを渡し、同じ条件で比較する |
| 長文で抜ける・崩れる | 入力context、分割、文脈の欠落 | 段落分割と用語集を固定し、結合後に校正する |
| 画像の翻訳が不自然 | 解像度、文字認識、画像入力条件 | 切り抜き、OCR、原画像との照合を行う |
- 同じ短文3本を4B・12Bまたは別runtimeで比較し、条件を記録する。
- CPU、RAM、VRAM、処理時間、出力の誤りを分け、速度だけで品質を決めない。
- 公開または権利確認済みの素材で動作確認し、機密文書は保存・削除方針を決めてから扱う。
- 重要な翻訳は人が承認し、逆翻訳だけを正確さの証明にしない。
ローカルAI翻訳の価値は、すべての文章を自動で完成させることではなく、送信先、モデル、処理条件、校正箇所を自分で把握できることです。PCスペックやモデルの選び方を先に整理すると、重い・遅い・止まる問題の切り分けも行いやすくなります。
- ローカルAI用PCスペックの見方 - メモリ・GPU・VRAMから条件を考える
- GPUなしPCで使える範囲 - CPU中心で試すときの限界を見る
- ローカルLLMの安全性とプライバシー - ログ、file、provider、MCPの経路を確認する
よくある質問
ローカルAI翻訳なら完全オフラインですか?
モデル取得、Hugging Faceの認証、アプリ更新、API、cloud fallbackは別の通信経路です。モデル取得後の推論をローカルで行う構成は作れますが、設定とログを確認してから完全オフラインと判断してください。
TranslateGemmaは普通のチャットLLMと違いますか?
TranslateGemmaはGemma 3をベースにした翻訳向けモデル群です。通常のチャットモデルでも翻訳はできますが、翻訳用の入力形式、対応言語、出力傾向、利用条件を分けて比較します。
Windowsでは4B・12B・27Bのどれを選べばよいですか?
まず4Bや互換量子化版で短文を試し、メモリと処理時間に余裕があれば12Bを比較する順番が安全です。27Bは大きな候補なので、自分のPCで動くことや翻訳品質をサイズだけから保証しないでください。
TranslateGemmaをLM StudioやOllamaで使えますか?
model cardにはllama.cpp、Ollama、LM Studioなどで量子化を使う案内があります。ただし、配布ファイル、architecture、chat template、vision対応が一致するかを確認し、未確認のモデルtagやGGUF名を前提にしないでください。
画像やPDFもローカルAIで翻訳できますか?
画像入力に対応するモデルはありますが、文字の読み取りと翻訳は別の失敗要因です。PDFは抽出やOCRを先に確認し、画像・OCR・翻訳の各結果を原文と照合してください。
日本語翻訳の正確さは保証されますか?
保証されません。source/target language code、モデル版、入力長、専門用語、固有名詞、量子化、原文の品質で結果が変わります。短い代表文を人が確認し、重要な用途では最終承認を人が行います。
次に読むおすすめルート
初めてローカルAIを触る人
まず全体像をつかみ、LM StudioとOllamaの違い、モデルサイズの考え方を順番に確認します。
- クラウドAIとローカルAIの使い分け
- ローカルLLMとは
- ローカルAIを入れる前に確認すること
- WindowsでローカルAIを始める完全ガイド
- Windows ARMでローカルAIを使う前の確認
- WindowsでOllamaをインストールする
- Windowsでローカル音声認識を始める
- WindowsでローカルOCRを始める
- Windowsで話者分離を始める
- LM Studioとは
- GGUFとは
- GGUF版とは
- GGUFファイル名の読み方
- LM StudioでGGUFを入れる方法
- LM Studioで画像を読み込む方法
- LM Studioのモデル保存場所と移動
- 小型LLM・量子化の現実
- GGUF量子化安全とRAG/NPU研究
- Quant.npuとNPU向け静的量子化
- LENSで見るNPUレイテンシ予測
- Copilot+ PCのNPU期待値
- Hugging Face安全チェック
- PDF/RAG/引用確認の現実
- LM Studioで最初に選ぶモデル
- GGUFモデル選び診断
- Hugging FaceでGGUFモデルを探す方法
- Q4/Q5/Q8の違いと選び方
- 日本語GGUFモデルの選び方
- Q4/Q5/Q8研究ガイド
- Hermes Desktopとは
- Hermes DesktopとLM Studio接続
- Hermes DesktopとOllama接続
- Hermes Desktop接続トラブル
- Hermes AgentとDesktopの違い
- ローカルLLMツール比較
- ローカルAI更新メモ
- 診断ページ
あなたはどのタイプ?
- 初めてローカルAIを触る人 - まず全体像をつかみ、LM StudioとOllamaの違い、モデルサイズの考え方を順番に確認します。
- LM Studio・Ollamaの症状別トラブルを解決したい人 - 起動、モデルロード、Prompt Processing、generation、API接続、GPU確認をツール別に分けて読みます。
- GPUなし・低スペックPCの人 - 軽量モデル、メモリ別の目安、重いときの確認ポイントを先に見ます。
- PDFや資料を読ませたい人 - 先に基本を押さえ、モデル単体の確認後にAnythingLLMへ進みます。
- ローカルAIエージェントを試したい人 - Bionic、Ollama、AnythingLLM、Hermesを役割別に分け、local/cloud、tool、保存、PC負荷を順番に確認します。
- 開発・API連携したい人 - LM StudioとOllamaの違いを確認し、API、長文処理、RAGまで段階的に進みます。
関連チェック先
- TranslateGemma Google official announcement - TranslateGemmaの4B・12B・27B、55言語、画像翻訳、モデルの位置づけを確認できます。
- google/translategemma-12b-it model card - 入力形式、言語コード、chat template、Transformers、量子化アプリ、利用条件と制約を確認できます。
- Google Gemma Terms of Use - Gemma系モデルを使う前の利用条件と責任範囲を確認できます。
- LM Studio official getting started docs - Windowsでモデルを取得し、ロードしてローカルチャットを始める公式手順です。
- Ollama official Modelfile reference - 互換性を確認したGGUFをFROMで扱う場合の公式Modelfile仕様です。
- Ollama official documentation - Windows、モデル実行、API、ツール連携の現行公式入口です。