— Blog
ローカルAIの始め方:OllamaでWindows PCにAIを入れて話しかけるまで
目次
- この記事でできること
- 準備:必要なもの
- STEP 1:Ollama をインストールする
- 公式サイトのダウンロードページを開く
- ダウンロードが終わるのを待つ
- 「ファイルを開く」を押す
- 「Install」を押す
- インストールが終わるのを待つ
- 「Continue」を押す
- アカウント作成は「No thanks」で飛ばす
- 「Run Ollama」の画面は閉じてよい
- スタートメニューから Ollama を開く
- サイドバーを開いて「Chat」へ
- STEP 2:モデルを選ぶ(VRAM早見表)
- STEP 3:話しかけてみる
- 最初は「クラウドのモデル」が選ばれているので注意
- モデルの一覧を見る
- 早見表で選んだモデル名を入力する
- メッセージを送る
- 初回だけ、モデルのダウンロードを待つ
- 「Thinking…」は、考えている途中
- 返事が来たら成功
- (任意)PowerShell から使う
- PowerShell を開く
- ollama run と打つ
- 返事と速さを見る
- GPUで動いているか確かめる
- 次のステップ:やりたくなったら、この言葉で検索
- おまけ:試すと面白いモデル
- まとめ
- 参考・出典
「ローカルAI(自分のPCで動かすAI)を試してみたいけど、何から始めればいいのか分からない」──そんな方のために、Ollama(オラマ)というツールを使って、Windows PCにAIを入れて会話するところまでを、画面が切り替わるたびに1枚ずつ写真つきで説明します。
やることは「インストールする」「モデルを選ぶ」「話しかける」の3つだけ。早ければ15〜20分で終わります。
この記事でできること
- Ollama をインストールして、ChatGPT のような画面でAIと会話する
- 自分のPCのグラフィックボードのVRAM(GPUのメモリ)を見て、合うモデルを早見表で選ぶ
- 動いたあとに「次にやりたくなること」を、どんな言葉で検索すればいいか知る
準備:必要なもの
- Windows 10 / 11 のPC(この記事の画面は Windows 10、Ollama 0.35.1)
- ストレージの空き 10GB 以上(インストーラーが約1.5GB、モデルが1つ数GB〜20GB)
- グラフィックボード(GPU)があると快適です。NVIDIA の GeForce RTX、AMD の Radeon RX などに対応しています。
GPUがなくても動きますが、CPUだけだと返事がかなりゆっくりになります。 - インターネット回線(最初のダウンロードだけ。会話はオフラインでもできます)
💡 Ollama は自分のユーザーのフォルダにインストールされるので、管理者パスワードの確認画面(UAC)は出ませんでした。アカウント登録も不要です。
会社のPCでソフトのインストールが制限されている場合は、先に管理部門へ確認してください。
STEP 1:Ollama をインストールする
公式サイトのダウンロードページを開く
ブラウザで https://ollama.com/download を開きます。Windows が選ばれていることを確認して、枠の「Download for Windows」を押します。

「INSTALL」の欄に書かれている irm https://ollama.com/install.ps1 | iex は、PowerShell(黒い画面)に貼り付けてインストールする方法です。慣れている方はこちらでもかまいません。この記事では、画面で操作できる「Download for Windows」の方を使います。
ダウンロードが終わるのを待つ
ブラウザの右上にダウンロードの進み具合が出ます。OllamaSetup.exe は約1.5GBあるので、回線によっては数分かかります。

「ファイルを開く」を押す
ダウンロードが終わると「ファイルを開く」に変わるので、押します。

押しても何も起きないように見えるときは、Windowsがファイルの安全確認をしている最中です。少し待ってください。ダウンロードの吹き出しが消えてしまったら、ブラウザで Ctrl + J を押すとダウンロード一覧が開きます。
「Install」を押す
インストーラーが開いたら「Install」を押すだけです。インストール先などを選ぶ画面はありません。

インストールが終わるのを待つ

「Continue」を押す
インストールが終わると、Ollama の画面が「Welcome to Ollama!」で開きます。

アカウント作成は「No thanks」で飛ばす
アカウント作成をすすめる画面が出ますが、自分のPCだけで使うならアカウントは不要です。

「Run Ollama」の画面は閉じてよい
「ターミナルで ollama と打ってください」という案内が出ます。PowerShell からの使い方は後で説明するので、ここでは右上の×で閉じます。閉じても Ollama は裏で動き続けています。

スタートメニューから Ollama を開く
画面左下の検索欄に「Ollama」と入力して、出てきた Ollama を開きます。

サイドバーを開いて「Chat」へ
開くと「Apps」という、Ollama と連携できるアプリの一覧が出ます。ここは使わないので、左上のボタンでサイドバーを開きます。



これでインストールは完了です。次はいよいよ「モデル(AIの頭脳)」を選びます。
STEP 2:モデルを選ぶ(VRAM早見表)
Ollama は「AIを動かす器」で、実際に考えて答えるのはモデルです。モデルには大きさ(4b、9b、20bなど。bは10億=パラメータの数)があり、大きいほど賢いけれど、たくさんのメモリを使います。
選ぶときの目安は、グラフィックボードのVRAMに丸ごと収まるかどうかです。収まらないと、はみ出した分をCPUで計算することになり、返事が数分の1の速さに落ちます(くわしくはVRAMの検証記事で実測しています)。
自分のVRAMが分からない方は、表の下の「VRAMの見方」を開いてください。
| あなたのVRAM | まず入れるなら | ほかの候補 | ひとこと |
|---|---|---|---|
| GPUなし 〜4GB |
qwen3.5:2b2.7GB |
qwen3:4b2.5GB |
CPUでも動く小さめのモデル。まずは「動く」体験から |
| 6GB | qwen3.5:4b3.4GB |
gemma4:e2b4.6GB |
短い文章の要約・言い換えなら十分。この記事の画面もこれ |
| 8GB | qwen3.5:9b6.6GB |
gemma4:e4b6.6GBqwen3:8b5.2GB |
ふだん使いの入口。日本語の会話が自然になってくる |
| 12GB | gemma4:12b7.7GB |
qwen3:14b9.3GB |
文章作成・調べものの相棒になるクラス |
| 16GB | gpt-oss:20b14GB |
gemma4:26b16GB |
OpenAI が公開したモデル。速くて賢い、16GBの定番 |
| 24GB | qwen3.6:27b18GB |
gemma4:31b19GBqwen3.8:27b18GB |
ローカルでかなり本格的に使えるクラス |
| 32GB〜 | qwen3.6:35b-a3b23GB |
qwen3.5:35b24GB |
長い文章やプログラミングの補助にも |
| 64GB〜 (統合メモリのMac等) |
gpt-oss:120b65GB |
─ | 家庭用の上限クラス。一般的なGPU1枚では載らない |
※ 容量はOllama公式ライブラリに表示されているダウンロードサイズ(2026年10月時点)。実際に動かすと会話の記憶ぶん(コンテキスト)が上乗せされます。たとえば qwen3.5:4b はダウンロード3.2GBに対して、動かすと4.2GBを使いました。「VRAM − 1〜2GB」に収まるものを選ぶと安心です。
※ qwen はAlibaba、gemma はGoogle、gpt-oss はOpenAIが公開しているモデルです。迷ったら「まず入れるなら」の列を選んでください。
VRAMの見方(タスクマネージャーで確認)── 分かる方は読み飛ばしてOK
キーボードで Ctrl + Shift + Esc を同時に押すと、タスクマネージャーが開きます。小さな画面で開いたときは、左下の「詳細」を押してください。



見るのは「専用 GPU メモリ」だけです。すぐ下の「共有 GPU メモリ」はPC本体のメモリを借りている分なので、早見表では数えません。
この検証機のようにGPUが2つ表示されることもあります。そのときは「GPU 1」も押して比べ、専用GPUメモリが大きい方の数字で早見表を見てください。

「GPU」の項目が無い、または「Intel(R) UHD Graphics」などCPU内蔵のグラフィックしか無い場合は、表の「GPUなし」の行を選んでください。
コラム:モデル名の「b」って何?── 気になる方だけどうぞ
qwen3.5:4b や gpt-oss:20b の b は billion(ビリオン=10億)の頭文字です。4b なら40億、20b なら200億。数えているのはパラメータの数です。
パラメータは、AIが学習で身につけた「知識や言葉のつながり方」をしまっておくつまみ(数値)のようなものです。つまみが多いほど細かい知識や言い回しを覚えられるので、一般にbが大きいほど賢くなります。そのかわり、つまみを全部メモリに置いておく必要があるので、bが大きいほどVRAMをたくさん使います。
| モデル名 | パラメータ数 | 容量 |
|---|---|---|
| qwen3.5:0.8b | 8億 | 1.0GB |
| qwen3:8b | 80億 | 5.2GB |
| qwen3:14b | 140億 | 9.3GB |
| gpt-oss:20b | 約210億 | 14GB |
Ollama のモデルはふつう、つまみ1つを約4ビットに圧縮(量子化)して配られているので、目安は「1bあたり約0.6〜0.7GB」です。圧縮しない元の状態(16ビット)だと1bあたり約2GBなので、8bでも16GBになります。圧縮のおかげで家庭のPCに載る、というわけです。
名前には b の前に別の文字が付くこともあります。
e2b・e4bの e … effective(実質)。動かすときのメモリが実質2B/4B相当になるよう工夫されたモデル(gemma4など)30b-a3bの a … active(動く分)。全体は30Bあるけれど、1文字を出すたびに計算するのは3B分だけ、という MoE のモデル。速いけれど、VRAMは全体(30B分)を使う
STEP 3:話しかけてみる
最初は「クラウドのモデル」が選ばれているので注意
Chat の画面を開くと、入力欄の右下に glm-5.3-flash:cloud のような名前が出ています。名前の最後が :cloud のものはインターネットの向こう(Ollamaのサーバー)で動くモデルで、アカウントが必要です。
自分のPCで動かすには、ここを替えます。

モデルの一覧を見る

早見表で選んだモデル名を入力する
一覧の一番上の「Find model…」の欄に、早見表で選んだモデル名を入力します。ここでは qwen3.5:4b を入れました。
モデルがまだPCに入っていなくても大丈夫です。ここで選んでおけば、最初にメッセージを送ったときに自動でダウンロード(インストール)されます(下の手順5)。


メッセージを送る

初回だけ、モデルのダウンロードを待つ

「Thinking…」は、考えている途中
最近のモデルは、答える前に考える過程を書き出します。英語のことが多いですが、気にしなくて大丈夫です。

返事が来たら成功

(任意)PowerShell から使う
黒い画面(PowerShell)からも使えます。速さを数字で見たいときに便利です。
PowerShell を開く

ollama run と打つ

返事と速さを見る

--verbose を付けると、返事のあとに eval rate(1秒あたりに出る文字のかたまり=トークンの数)が出ます。15〜20 tokens/s あれば、人が読む速さと同じくらいです。終わるときは /bye と打ちます。
GPUで動いているか確かめる

30%/70% CPU/GPU のようにCPUが混じっていたら、モデルがVRAMからはみ出しています。ひとつ小さいモデルにしてみてください。
同じ質問をモデルを替えて聞き比べるのもおすすめです。モデルごとに得意・不得意がはっきり出ます。
次のステップ:やりたくなったら、この言葉で検索
動くようになると、たいてい次のどれかがやりたくなります。手順はここでは書きませんが、検索するときのキーワードを置いておきます(キーワードの丸をそのまま検索窓へ)。
Ollama の一覧に無いモデルを使いたい
Hugging Face(AIモデルの共有サイト)には、Ollamaの一覧に無いモデルがたくさんあります。GGUF形式のファイルなら Ollama でも読めます。
ollama hf.co GGUFollama Modelfile GGUF 読み込みLM Studio 使い方llama.cpp Windows
ChatGPT みたいな画面を、社内の複数人で使いたい
ブラウザから使える画面を立てて、会話履歴やユーザー管理をする方法です。
Open WebUI OllamaOllama OLLAMA_HOST 外部アクセス
社内の資料を読ませて答えさせたい
PDFやマニュアルを検索して答えさせる仕組みは「RAG」と呼ばれます。
RAG ローカルLLMOpen WebUI ナレッジ埋め込みモデル bge-m3
自分のプログラムやツールから呼びたい
Ollama は裏でAPIを公開しています。OpenAI と同じ書き方で呼べます。
Ollama APIOllama OpenAI互換n8n OllamaContinue VS Code Ollama
考える過程を省いて速くしたい・もっと長い文章を読ませたい
思考のオン・オフや、覚えていられる文章の長さ、モデルの圧縮の度合いを調整できます。
Ollama think falseOllama num_ctx量子化 Q4_K_M Q8_0 違い
画像を読ませたい・翻訳させたい
文字だけでなく、画像を見て答えるモデルや、翻訳専用のモデルもあります。
qwen3-vl Ollamaglm-ocrtranslategemma
おまけ:試すと面白いモデル
早見表は「まず無難に動くもの」を選びましたが、ローカルAIにはちょっと変わった、技術的に面白いモデルもあります。速度は、この記事の検証機(AMD Radeon RX 9060 XT・VRAM 16GB)で Ollama を使い、同じ日本語の質問を投げて測った値です。
LFM2.5-1.2B(Liquid AI)
1秒に160トークン。目で追えない速さ
実測で 160 tokens/s、質問してから答え終わるまで 0.19秒。同じPCで qwen3.5:4b が 61 tokens/s なので、2.5倍以上の速さです。
中身は、いまのAIの主流(Transformer)だけでなく、別の計算方式を組み合わせたハイブリッド構造。小さいPCやスマホで速く動かすことを狙った、技術的にも新しいモデルです。
ただし12億パラメータと小さいので、賢さは控えめです。下の画面でも「ローカルAIのメリット」に「高い精度」と答えていて、ちょっとずれています。速さを体感するためのモデルと考えてください。Ollama の公式一覧には無く、Hugging Face から直接入れます。

gpt-oss:20b
20B(200億)なのに、7Bのモデルより速い
実測で 58〜59 tokens/s。同じPCで qwen2.5:7b(70億)が 55〜56 tokens/s だったので、3倍近く大きいのに速いという逆転が起きます。
理由は MoE(Mixture of Experts=専門家の混合)という作り。中に「専門家」がたくさんいて、1文字ごとに必要な専門家だけを呼び出すため、実際に計算するのは全体の一部(約36億分)だけで済みます。
qwen3:30b-a3b / qwen3.6:35b-a3b
VRAMからはみ出しても、意外と速い
名前の a3b は「動くのは3B(30億)分だけ」という意味の MoE です。16GBのPCで、モデルの約3割がVRAMからはみ出した状態でも 21 tokens/s 出ました。
一方、同じくらいはみ出した普通の作りのモデル(gemma3:27b)は 4.5 tokens/s。「はみ出すと遅い」というローカルAIの常識が、MoEだとゆるくなるのが面白いところです。
Bonsai 27B(1-bit / 三値)
27B(270億)のモデルが、4〜6GB
AIの数字を「-1・0・+1」の3つ程度だけで表すように極端に圧縮したモデルです。普通なら50GB以上ある27Bクラスが、1-bit版で4.4GB。実測で 18 tokens/s、8GBのGPUにも27Bが載るという、少し前なら考えられなかった状態です。
ただし日本語の専門知識はまだ間違いが多く、仕事で使うより「技術の行方を見る」ためのモデルです。Ollama公式の一覧には無く、有志の配布版や専用のツールで動かします(くわしくはBonsaiの解説記事)。
gemma4:e2b / e4b
スマホ向けに作られた、省メモリ設計
名前の e は effective(実質)。中身はもう少し大きいのに、動かすときに使うメモリを実質2B/4B相当に抑える工夫が入ったGoogleのモデルです。VRAMの少ないノートPCで試すならこれ。画像も読めます。
qwen3.5:0.8b
1GBで動く、手のひらサイズ
ダウンロードサイズは約1GB。GPUのない古いPCでも動きます。賢さは控えめですが、「これだけ小さくても日本語で会話できる」こと自体に驚くはずです。大きいモデルと同じ質問を投げて、差を見るのもおすすめです。
まとめ
- Ollama はダウンロード → Install → Continue → No thanksでインストールできる。管理者権限もアカウントも不要
- Chat 画面では、最初に選ばれている
:cloudのモデルを、早見表で選んだモデルに替える - モデルはVRAMに丸ごと収まるサイズを選ぶ。
ollama psで100% GPUになっていれば、そのPCの実力どおりの速さが出ている
参考・出典
- Ollama 公式サイト・モデルライブラリ(モデル名・容量は 2026年10月3日時点の表示): https://ollama.com/ / https://ollama.com/library
- Liquid AI「LFM2.5-1.2B-Instruct-GGUF」(Hugging Face): https://huggingface.co/LiquidAI/LFM2.5-1.2B-Instruct-GGUF
- しゅしブログ「ローカルAIはGPUの世代よりVRAM」: https://syushi.com/blog/local-llm-gpu-vram-benchmark/
- しゅしブログ「Bonsai(三値化LLM)解説」: https://syushi.com/blog/bonsai-ternary-llm/
- 画面写真・速度の実測:弊社検証機(AMD Radeon RX 9060 XT 16GB / Windows 10 / Ollama 0.35.1)にて 2026年10月3日。速度は1回の生成(最大300トークン)の eval rate