{"componentChunkName":"component---src-templates-info-posts-js","path":"/information/AI/3055b03b-159d-5498-b4fc-3effe26e8c52","result":{"data":{"microcmsInformation":{"id":"3055b03b-159d-5498-b4fc-3effe26e8c52","title":"ChatGPT DesktopでローカルLLMを使う方法は？ollama launch chatgptの設定手順を解説【2026年8月版】","date":"2026 年 08 月 22 日","image":{"url":"https://images.microcms-assets.io/assets/52137c02cafa4450bbdc092b64fbadac/db30ae41fe574c6aa3eaed82c47bdd8a/chatgpt-desktop-local-llm-ollama.png"},"author":{"author":"Goubara"},"body":"<p>2026年7月のアップデートで、ChatGPTデスクトップアプリの推論先を、OpenAIのクラウドから手元のOllamaへ切り替えられるようになりました。使うのは<code>ollama launch chatgpt</code>という<strong>コマンド1つ</strong>です。</p><p style=\"text-align: start\">本記事では、ローカルLLMをこれから触る方に向けて、この仕組みと、Googleの<strong>gemma4:12b</strong>を使った設定手順を解説します。設定ファイルがどう書き換わるのか、元に戻す方法まで扱います。</p><blockquote><p>本記事は2026年8月時点の情報です。Ollama v0.32系、およびCodexと統合された新しいChatGPTデスクトップアプリを前提としています。バージョンやプランによって画面表示や挙動が異なる場合があります。</p></blockquote><h2 style=\"text-align: start\" id=\"h23bba3a9ca\">■背景：2026年7月に起きた2つの変化</h2><ul><li><strong>ChatGPTとCodexのデスクトップアプリが統合（7月9日）</strong>：別アプリだったコーディングエージェント「Codex」がChatGPTデスクトップアプリに取り込まれ、「Chat」「Work」「Codex」の3画面構成になりました。旧アプリは「ChatGPT Classic」に改称されています。</li><li><strong>Ollama 0.32.0で連携名が変更（7月11日）</strong>：従来の<code>ollama launch codex-app</code>が<code>ollama launch chatgpt</code>に改名されました。</li></ul><p style=\"text-align: start\">つまりこのコマンドは、<strong>統合後のChatGPTアプリのCodex部分をローカルモデルで動かすためのもの</strong>です。</p><h2 style=\"text-align: start\" id=\"ha4027c5263\">■何が置き換わって、何が置き換わらないのか</h2><p style=\"text-align: start\">誤解しやすいポイントなので、最初に整理しておきます。</p><ul><li><strong>置き換わる</strong>：<strong>Codex画面</strong>の推論先。接続先が<code>http://127.0.0.1:11434/v1/</code>、つまり自分のPCのOllamaになり、OpenAI側の利用枠を消費しなくなります</li><li><strong>置き換わらない</strong>：<strong>ChatタブとWorkタブ</strong>はクラウドのままです。GPT-5.6などのモデルがローカルで動くわけでもありません</li></ul><p style=\"text-align: start\">「ChatGPTを丸ごとローカル化する」機能ではなく、<strong>「使い慣れたエージェント環境を、ローカルモデルで動かす」</strong>機能だと捉えるのが正確です。</p><h2 style=\"text-align: start\" id=\"h28c662a746\">■事前準備</h2><p style=\"text-align: start\">作業を始める前に、次の3つを確認します。</p><ul><li><strong>Ollama v0.32.0以降</strong>：<code>ollama launch chatgpt</code>はこのバージョンから使えます。バージョンは<code>ollama --version</code>で確認できます</li><li><strong>ChatGPTデスクトップアプリ（統合版）</strong>：Codexタブがある新しいアプリが必要です。旧「ChatGPT Classic」では対象外です</li><li><strong>ストレージとメモリの空き</strong>：モデル本体で約7.6GB。加えて、後述するコンテキスト長の分だけメモリを消費します</li></ul><p style=\"text-align: start\">Ollamaのバージョンが古い場合は、<a href=\"https://ollama.com/download\">公式サイト</a>から最新版を入れ直してください。<br>Ollamaのインストール手順は<a href=\"https://devpediacode.com/information/AI/a8d3de03-bf9b-5a7d-afc0-1aa4fdced3b4\">こちらの記事</a>を参考にしてください。</p><h2 style=\"text-align: start\" id=\"h1d8aebe2cb\">■手順1：gemma4:12bを取得する</h2><p style=\"text-align: start\">まずはモデルをダウンロードします。約7.6GBあるので、回線によっては数分〜十数分かかります。</p><pre><code>ollama pull gemma4:12b</code></pre><p style=\"text-align: start\">単に<code>gemma4</code>とだけ指定するとエッジ向けの<code>e4b</code>が入るため、<code>:12b</code>までタグを書く点に注意してください。</p><p style=\"text-align: start\">完了したら、手元に入ったモデルの一覧を確認します。</p><pre><code>ollama list</code></pre><p style=\"text-align: start\">この段階で、ふつうにチャットして動作確認しておくと安心です。</p><pre><code>ollama run gemma4:12b</code></pre><p style=\"text-align: start\">モデルの詳細情報（対応機能やコンテキスト長）は次のコマンドで確認できます。<code>Capabilities</code>欄に<code>tools</code>が含まれていれば、エージェント用途に使えるモデルです。</p><pre><code>ollama show gemma4:12b</code></pre><h2 style=\"text-align: start\" id=\"h230ddfc35f\">■手順2：コンテキスト長を広げる（ここが最重要）</h2><p style=\"text-align: start\">初心者が最もつまずきやすいのがこの設定です。<strong>この手順を飛ばすと、エージェントがまともに動きません。</strong></p><p style=\"text-align: start\">Ollamaは、搭載VRAM量に応じてコンテキスト長を自動で決めています。公式ドキュメントによる既定値は次の通りです。</p><ul><li>VRAM 24GiB未満：<strong>4,000トークン</strong></li><li>VRAM 24〜48GiB：32,000トークン</li><li>VRAM 48GiB以上：256,000トークン</li></ul><p style=\"text-align: start\">つまり、多くの環境では初期状態で<strong>4Kトークンしか使えません</strong>。エージェントはシステムプロンプト、ツール定義、ファイルの中身、会話履歴を全部コンテキストに載せるため、4Kではすぐ溢れてしまいます。Ollama公式も「Web検索、エージェント、コーディングツールでは最低64,000トークンにすべき」と明記しています。</p><p style=\"text-align: start\"><strong>設定方法1：Ollamaアプリの設定画面</strong></p><p style=\"text-align: start\">Ollamaアプリを開き、設定（Settings）内のコンテキスト長のスライダーを64000以上に変更します。GUIで完結するのでこちらが手軽です。</p><figure><img src=\"https://images.microcms-assets.io/assets/52137c02cafa4450bbdc092b64fbadac/740adf8de3b14f2885689a61738918d5/ollama1.png\" alt=\"\" width=\"1075\" height=\"823\"></figure><p style=\"text-align: start\"><strong>設定方法2：環境変数で指定する</strong></p><p style=\"text-align: start\">アプリから変更できない場合は、Ollamaを起動する際に環境変数で指定します。</p><pre><code>OLLAMA_CONTEXT_LENGTH=64000 ollama serve</code></pre><p style=\"text-align: start\">設定が効いているかは、モデルを動かした状態で次のコマンドを実行して確認します。</p><pre><code>ollama ps</code></pre><p style=\"text-align: start\"><code>CONTEXT</code>列に設定した値が出ていればOKです。あわせて<code>PROCESSOR</code>列も見ておきましょう。ここが<code>100% GPU</code>になっていれば快適に動きますが、<code>CPU</code>の割合が混じっている場合はメモリに載り切っておらず、動作がかなり遅くなります。その場合はコンテキスト長を下げるか、より小さいモデル（<code>gemma4:e4b</code>など）に切り替えてください。</p><h2 style=\"text-align: start\" id=\"h613b5dd5b3\">■手順3：ChatGPTアプリをOllamaに切り替える</h2><p style=\"text-align: start\">ここまで準備できたら、いよいよ切り替えです。ターミナル（Windowsの場合はPowerShell）で次のコマンドを実行します。</p><pre><code>ollama launch chatgpt --model gemma4:12b</code></pre><p style=\"text-align: start\">成功すると、次のようなメッセージが表示されます。</p><pre><code>ChatGPT profile changed to Ollama.\n\nTo restore your usual ChatGPT profile, run: ollama launch chatgpt --restore</code></pre><p style=\"text-align: start\">あとはChatGPTデスクトップアプリを起動し、Codexタブでモデルとして<code>gemma4:12b</code>が選ばれていることを確認するだけです。</p><figure><img src=\"https://images.microcms-assets.io/assets/52137c02cafa4450bbdc092b64fbadac/7f2460e0f59e4635865ab87596e51ef0/ollama2.png\" alt=\"\" width=\"751\" height=\"112\"></figure><p style=\"text-align: start\">コマンドにはいくつかオプションがあります。</p><pre><code># 設定だけ書き換えて、アプリは起動しない\nollama launch chatgpt --model gemma4:12b --config\n\n# 確認プロンプトをすべて自動で承諾する\nollama launch chatgpt --model gemma4:12b -y\n\n# モデルを指定せず、対話メニューから選ぶ\nollama launch chatgpt</code></pre><p style=\"text-align: start\">なお<code>chatgpt</code>には<code>codex-app</code>、<code>codex-desktop</code>、<code>codex-gui</code>というエイリアスも残っています。以前の記事や解説で<code>ollama launch codex-app</code>と書かれていても、同じ動作をします。</p><h2 style=\"text-align: start\" id=\"h3dc023033d\">■実際に何が書き換わっているのか</h2><p style=\"text-align: start\">「よく分からないまま設定が変わるのは不安」という方のために、中身を見ておきましょう。書き換わるのはChatGPTアプリの設定ファイル<code>config.toml</code>で、場所は次の通りです。</p><pre><code># Windows\n%USERPROFILE%\\.codex\\config.toml\n\n# macOS / Linux\n~/.codex/config.toml</code></pre><p style=\"text-align: start\">アプリが統合された今も、設定ディレクトリはCodex時代の<code>.codex</code>のままである点に注意してください。ここに、次の内容が追記されます。</p><pre><code>model = &quot;gemma4:12b&quot;\nmodel_provider = &quot;ollama-launch-codex-app&quot;\nmodel_catalog_json = &quot;C:\\\\Users\\\\&lt;ユーザー名&gt;\\\\.codex\\\\ollama-launch-models.json&quot;\n\n[model_providers.ollama-launch-codex-app]\nname = &quot;Ollama&quot;\nbase_url = &quot;http://127.0.0.1:11434/v1/&quot;\nwire_api = &quot;responses&quot;</code></pre><p style=\"text-align: start\">読み解くと、やっていることは非常にシンプルです。</p><ul><li><strong>base_url</strong>：問い合わせ先を、OpenAIのAPIから自分のPCのOllama（ポート11434）に変更している</li><li><strong>wire_api = &quot;responses&quot;</strong>：OpenAIの「Responses API」形式で通信する指定。Ollamaはこの形式に対応しているため、ChatGPTアプリ側は相手がOllamaだと意識せずに動作できる</li><li><strong>model_catalog_json</strong>：アプリのモデル選択画面に、手元のOllamaモデル一覧を表示させるためのカタログファイル</li></ul><p style=\"text-align: start\">元の設定は<code>~/.ollama/backup/codex-app/</code>にタイムスタンプ付きで自動バックアップされるため、上書きされて消えてしまうことはありません。</p><h2 style=\"text-align: start\" id=\"h858d74fa84\">■元のChatGPT設定に戻す</h2><p style=\"text-align: start\">クラウドのモデルに戻したくなったら、<code>--restore</code>を付けて実行します。</p><pre><code>ollama launch chatgpt --restore</code></pre><p style=\"text-align: start\">アプリの再起動について確認を求められるので、そのまま進める場合は<code>--yes</code>（<code>-y</code>）を添えます。</p><pre><code>ollama launch chatgpt --restore --yes</code></pre><p style=\"text-align: start\">これで<code>config.toml</code>からOllama関連の記述が取り除かれ、元のモデル設定に戻ります。<strong>切り替えと復帰が1コマンドずつで済む</strong>ため、「今日は機密性の高いコードを触るからローカル、明日は通常運用に戻す」といった使い分けも現実的です。</p><h2 style=\"text-align: start\" id=\"h22cab7a407\">■注意点</h2><ul><li><strong>それなりのPCスペックが必要</strong>：gemma4:12bをコンテキスト64Kで動かす場合、モデル本体とKVキャッシュを合わせて<strong>10GB前後のVRAM</strong>を消費します。VRAM 12GB以上のGPU（RTX 4070クラス以上）が実用的なラインです。足りない場合は<code>ollama ps</code>の<code>PROCESSOR</code>列にCPUの割合が出ますが、この状態では実用に耐える速度が出ません。スペックが厳しいときは<code>gemma4:e4b</code>など軽量なモデルに落とすか、コンテキスト長を下げて調整してください。</li><li><strong>レスポンスはクラウドより明確に遅い</strong>：ローカル実行では応答が返り始めるまでの待ち時間、生成そのものの速度ともに、クラウドのChatGPTより体感で遅くなります。特にエージェント動作はツール呼び出しと生成を何往復も繰り返すため、1つのタスクが終わるまでの時間はクラウドの数倍かかることも珍しくありません。「即答してほしい調べもの」ではなく、「時間がかかっても手元で完結させたい作業」に向いた使い方だと考えてください。</li><li><strong>コンテキスト長の設定を忘れない</strong>：繰り返しになりますが、VRAM 24GiB未満の環境では既定が4Kです。エージェントが途中で話を見失う、指示を忘れる、といった症状の大半はこれが原因です。</li><li><strong>Responses APIの一部機能は使えない</strong>：Ollamaは非ステートフル版のResponses APIのみに対応しており、<code>previous_response_id</code>による会話の継続などには対応していません。クラウド版と完全に同じ挙動にはならない点は前提として押さえてください。</li><li><strong>ChatタブとWorkタブは切り替わらない</strong>：ローカル化されるのはCodex部分だけです。「アプリ全体がオフラインで動く」わけではありません。</li><li><strong>Ollamaを起動しておく必要がある</strong>：接続先は<code>127.0.0.1:11434</code>です。Ollamaが動いていない状態でChatGPTアプリのCodexを使おうとすると接続エラーになります。</li><li><strong>クラウドモデルも一覧に混ざる</strong>：モデルカタログには<code>glm-5.2:cloud</code>のようなOllamaのクラウドモデルも含まれます。完全にローカルで完結させたい場合は、選択したモデル名に<code>:cloud</code>が付いていないか確認してください。</li><li><strong>ツール呼び出しに対応したモデルを選ぶ</strong>：エージェントはファイル編集やコマンド実行をツール呼び出し（tool calling）で行うため、非対応のモデルでは作業がまったく進みません。<code>ollama show</code>の<code>Capabilities</code>欄に<code>tools</code>があるか確認してください。</li><li><strong>性能はクラウドと同じにはならない</strong>：gemma4:12bは12Bクラスとしては優秀ですが、フロンティアモデルと同等ではありません。複雑な多段タスクでは失敗率が上がります。まずは小さめのタスクで感触を掴むのがおすすめです。</li><li><strong>ライセンスの確認</strong>：gemma4はApache License 2.0ですが、モデルごとに条件は異なります。業務利用の前には個別に確認してください。</li></ul><h2 style=\"text-align: start\" id=\"h692cc5d9ea\">■まとめ</h2><p style=\"text-align: start\">ChatGPTデスクトップアプリでローカルLLMを使う手順は、突き詰めると次の3ステップです。</p><ul><li><code>ollama pull gemma4:12b</code> でモデルを取得する</li><li>Ollamaのコンテキスト長を<strong>64000以上</strong>に設定する</li><li><code>ollama launch chatgpt --model gemma4:12b</code> で切り替える</li></ul><p style=\"text-align: start\">やっていることは「ChatGPTアプリの接続先を、OpenAIのAPIから自分のPCのOllamaに差し替える」という単純な操作です。だからこそ<code>--restore</code>で確実に元へ戻せますし、設定ファイルを自分で書く必要もありません。</p><p style=\"text-align: start\">ローカルモデルには性能とコンテキストの現実的な制約がありますが、「コードを外部に出したくない」「利用枠を気にせず試行錯誤したい」という場面では十分に実用的な選択肢です。まずは<code>ollama launch chatgpt --model gemma4:12b</code>を実行して、手元のマシンがどこまでやれるかを確かめてみてください。</p><h2 style=\"text-align: start\" id=\"h1cf736121f\">■参考（一次情報）</h2><ul><li>Ollama v0.32.0 リリースノート：<a href=\"https://github.com/ollama/ollama/releases/tag/v0.32.0\">https://github.com/ollama/ollama/releases/tag/v0.32.0</a></li><li>ollama launch 解説：<a href=\"https://ollama.com/blog/launch\">https://ollama.com/blog/launch</a></li><li>コンテキスト長の設定：<a href=\"https://docs.ollama.com/context-length\">https://docs.ollama.com/context-length</a></li><li>OpenAI互換API（Responses API対応状況）：<a href=\"https://docs.ollama.com/api/openai-compatibility\">https://docs.ollama.com/api/openai-compatibility</a></li><li>gemma4 モデルページ：<a href=\"https://ollama.com/library/gemma4\">https://ollama.com/library/gemma4</a></li></ul>","category":{"category":"AI"}}},"pageContext":{"id":"3055b03b-159d-5498-b4fc-3effe26e8c52"}},"staticQueryHashes":["3649515864","63159454"]}