ChatGPT DesktopでローカルLLMを使う方法は?ollama launch chatgptの設定手順を解説【2026年8月版】

Posted at 2026 年 08 月 22 日

2026年7月のアップデートで、ChatGPTデスクトップアプリの推論先を、OpenAIのクラウドから手元のOllamaへ切り替えられるようになりました。使うのはollama launch chatgptというコマンド1つです。

本記事では、ローカルLLMをこれから触る方に向けて、この仕組みと、Googleのgemma4:12bを使った設定手順を解説します。設定ファイルがどう書き換わるのか、元に戻す方法まで扱います。

本記事は2026年8月時点の情報です。Ollama v0.32系、およびCodexと統合された新しいChatGPTデスクトップアプリを前提としています。バージョンやプランによって画面表示や挙動が異なる場合があります。

■背景:2026年7月に起きた2つの変化

  • ChatGPTとCodexのデスクトップアプリが統合(7月9日):別アプリだったコーディングエージェント「Codex」がChatGPTデスクトップアプリに取り込まれ、「Chat」「Work」「Codex」の3画面構成になりました。旧アプリは「ChatGPT Classic」に改称されています。
  • Ollama 0.32.0で連携名が変更(7月11日):従来のollama launch codex-appollama launch chatgptに改名されました。

つまりこのコマンドは、統合後のChatGPTアプリのCodex部分をローカルモデルで動かすためのものです。

■何が置き換わって、何が置き換わらないのか

誤解しやすいポイントなので、最初に整理しておきます。

  • 置き換わるCodex画面の推論先。接続先がhttp://127.0.0.1:11434/v1/、つまり自分のPCのOllamaになり、OpenAI側の利用枠を消費しなくなります
  • 置き換わらないChatタブとWorkタブはクラウドのままです。GPT-5.6などのモデルがローカルで動くわけでもありません

「ChatGPTを丸ごとローカル化する」機能ではなく、「使い慣れたエージェント環境を、ローカルモデルで動かす」機能だと捉えるのが正確です。

■事前準備

作業を始める前に、次の3つを確認します。

  • Ollama v0.32.0以降ollama launch chatgptはこのバージョンから使えます。バージョンはollama --versionで確認できます
  • ChatGPTデスクトップアプリ(統合版):Codexタブがある新しいアプリが必要です。旧「ChatGPT Classic」では対象外です
  • ストレージとメモリの空き:モデル本体で約7.6GB。加えて、後述するコンテキスト長の分だけメモリを消費します

Ollamaのバージョンが古い場合は、公式サイトから最新版を入れ直してください。
Ollamaのインストール手順はこちらの記事を参考にしてください。

■手順1:gemma4:12bを取得する

まずはモデルをダウンロードします。約7.6GBあるので、回線によっては数分〜十数分かかります。

ollama pull gemma4:12b

単にgemma4とだけ指定するとエッジ向けのe4bが入るため、:12bまでタグを書く点に注意してください。

完了したら、手元に入ったモデルの一覧を確認します。

ollama list

この段階で、ふつうにチャットして動作確認しておくと安心です。

ollama run gemma4:12b

モデルの詳細情報(対応機能やコンテキスト長)は次のコマンドで確認できます。Capabilities欄にtoolsが含まれていれば、エージェント用途に使えるモデルです。

ollama show gemma4:12b

■手順2:コンテキスト長を広げる(ここが最重要)

初心者が最もつまずきやすいのがこの設定です。この手順を飛ばすと、エージェントがまともに動きません。

Ollamaは、搭載VRAM量に応じてコンテキスト長を自動で決めています。公式ドキュメントによる既定値は次の通りです。

  • VRAM 24GiB未満:4,000トークン
  • VRAM 24〜48GiB:32,000トークン
  • VRAM 48GiB以上:256,000トークン

つまり、多くの環境では初期状態で4Kトークンしか使えません。エージェントはシステムプロンプト、ツール定義、ファイルの中身、会話履歴を全部コンテキストに載せるため、4Kではすぐ溢れてしまいます。Ollama公式も「Web検索、エージェント、コーディングツールでは最低64,000トークンにすべき」と明記しています。

設定方法1:Ollamaアプリの設定画面

Ollamaアプリを開き、設定(Settings)内のコンテキスト長のスライダーを64000以上に変更します。GUIで完結するのでこちらが手軽です。

設定方法2:環境変数で指定する

アプリから変更できない場合は、Ollamaを起動する際に環境変数で指定します。

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

設定が効いているかは、モデルを動かした状態で次のコマンドを実行して確認します。

ollama ps

CONTEXT列に設定した値が出ていればOKです。あわせてPROCESSOR列も見ておきましょう。ここが100% GPUになっていれば快適に動きますが、CPUの割合が混じっている場合はメモリに載り切っておらず、動作がかなり遅くなります。その場合はコンテキスト長を下げるか、より小さいモデル(gemma4:e4bなど)に切り替えてください。

■手順3:ChatGPTアプリをOllamaに切り替える

ここまで準備できたら、いよいよ切り替えです。ターミナル(Windowsの場合はPowerShell)で次のコマンドを実行します。

ollama launch chatgpt --model gemma4:12b

成功すると、次のようなメッセージが表示されます。

ChatGPT profile changed to Ollama.

To restore your usual ChatGPT profile, run: ollama launch chatgpt --restore

あとはChatGPTデスクトップアプリを起動し、Codexタブでモデルとしてgemma4:12bが選ばれていることを確認するだけです。

コマンドにはいくつかオプションがあります。

# 設定だけ書き換えて、アプリは起動しない
ollama launch chatgpt --model gemma4:12b --config

# 確認プロンプトをすべて自動で承諾する
ollama launch chatgpt --model gemma4:12b -y

# モデルを指定せず、対話メニューから選ぶ
ollama launch chatgpt

なおchatgptにはcodex-appcodex-desktopcodex-guiというエイリアスも残っています。以前の記事や解説でollama launch codex-appと書かれていても、同じ動作をします。

■実際に何が書き換わっているのか

「よく分からないまま設定が変わるのは不安」という方のために、中身を見ておきましょう。書き換わるのはChatGPTアプリの設定ファイルconfig.tomlで、場所は次の通りです。

# Windows
%USERPROFILE%\.codex\config.toml

# macOS / Linux
~/.codex/config.toml

アプリが統合された今も、設定ディレクトリはCodex時代の.codexのままである点に注意してください。ここに、次の内容が追記されます。

model = "gemma4:12b"
model_provider = "ollama-launch-codex-app"
model_catalog_json = "C:\\Users\\<ユーザー名>\\.codex\\ollama-launch-models.json"

[model_providers.ollama-launch-codex-app]
name = "Ollama"
base_url = "http://127.0.0.1:11434/v1/"
wire_api = "responses"

読み解くと、やっていることは非常にシンプルです。

  • base_url:問い合わせ先を、OpenAIのAPIから自分のPCのOllama(ポート11434)に変更している
  • wire_api = "responses":OpenAIの「Responses API」形式で通信する指定。Ollamaはこの形式に対応しているため、ChatGPTアプリ側は相手がOllamaだと意識せずに動作できる
  • model_catalog_json:アプリのモデル選択画面に、手元のOllamaモデル一覧を表示させるためのカタログファイル

元の設定は~/.ollama/backup/codex-app/にタイムスタンプ付きで自動バックアップされるため、上書きされて消えてしまうことはありません。

■元のChatGPT設定に戻す

クラウドのモデルに戻したくなったら、--restoreを付けて実行します。

ollama launch chatgpt --restore

アプリの再起動について確認を求められるので、そのまま進める場合は--yes-y)を添えます。

ollama launch chatgpt --restore --yes

これでconfig.tomlからOllama関連の記述が取り除かれ、元のモデル設定に戻ります。切り替えと復帰が1コマンドずつで済むため、「今日は機密性の高いコードを触るからローカル、明日は通常運用に戻す」といった使い分けも現実的です。

■注意点

  • それなりのPCスペックが必要:gemma4:12bをコンテキスト64Kで動かす場合、モデル本体とKVキャッシュを合わせて10GB前後のVRAMを消費します。VRAM 12GB以上のGPU(RTX 4070クラス以上)が実用的なラインです。足りない場合はollama psPROCESSOR列にCPUの割合が出ますが、この状態では実用に耐える速度が出ません。スペックが厳しいときはgemma4:e4bなど軽量なモデルに落とすか、コンテキスト長を下げて調整してください。
  • レスポンスはクラウドより明確に遅い:ローカル実行では応答が返り始めるまでの待ち時間、生成そのものの速度ともに、クラウドのChatGPTより体感で遅くなります。特にエージェント動作はツール呼び出しと生成を何往復も繰り返すため、1つのタスクが終わるまでの時間はクラウドの数倍かかることも珍しくありません。「即答してほしい調べもの」ではなく、「時間がかかっても手元で完結させたい作業」に向いた使い方だと考えてください。
  • コンテキスト長の設定を忘れない:繰り返しになりますが、VRAM 24GiB未満の環境では既定が4Kです。エージェントが途中で話を見失う、指示を忘れる、といった症状の大半はこれが原因です。
  • Responses APIの一部機能は使えない:Ollamaは非ステートフル版のResponses APIのみに対応しており、previous_response_idによる会話の継続などには対応していません。クラウド版と完全に同じ挙動にはならない点は前提として押さえてください。
  • ChatタブとWorkタブは切り替わらない:ローカル化されるのはCodex部分だけです。「アプリ全体がオフラインで動く」わけではありません。
  • Ollamaを起動しておく必要がある:接続先は127.0.0.1:11434です。Ollamaが動いていない状態でChatGPTアプリのCodexを使おうとすると接続エラーになります。
  • クラウドモデルも一覧に混ざる:モデルカタログにはglm-5.2:cloudのようなOllamaのクラウドモデルも含まれます。完全にローカルで完結させたい場合は、選択したモデル名に:cloudが付いていないか確認してください。
  • ツール呼び出しに対応したモデルを選ぶ:エージェントはファイル編集やコマンド実行をツール呼び出し(tool calling)で行うため、非対応のモデルでは作業がまったく進みません。ollama showCapabilities欄にtoolsがあるか確認してください。
  • 性能はクラウドと同じにはならない:gemma4:12bは12Bクラスとしては優秀ですが、フロンティアモデルと同等ではありません。複雑な多段タスクでは失敗率が上がります。まずは小さめのタスクで感触を掴むのがおすすめです。
  • ライセンスの確認:gemma4はApache License 2.0ですが、モデルごとに条件は異なります。業務利用の前には個別に確認してください。

■まとめ

ChatGPTデスクトップアプリでローカルLLMを使う手順は、突き詰めると次の3ステップです。

  • ollama pull gemma4:12b でモデルを取得する
  • Ollamaのコンテキスト長を64000以上に設定する
  • ollama launch chatgpt --model gemma4:12b で切り替える

やっていることは「ChatGPTアプリの接続先を、OpenAIのAPIから自分のPCのOllamaに差し替える」という単純な操作です。だからこそ--restoreで確実に元へ戻せますし、設定ファイルを自分で書く必要もありません。

ローカルモデルには性能とコンテキストの現実的な制約がありますが、「コードを外部に出したくない」「利用枠を気にせず試行錯誤したい」という場面では十分に実用的な選択肢です。まずはollama launch chatgpt --model gemma4:12bを実行して、手元のマシンがどこまでやれるかを確かめてみてください。

■参考(一次情報)

DevpediaCode編集部

DevpediaCodeはWeb、AIなどプログラムに関する最新ITテーマの情報を発信するメディアです。

お問合せ下記のURLからお願いします。

https://devpediacode.com/contact