やなぎまつ ← コラム一覧
ChatGPT・Codexのクレジット節約 完全解説

2026年9月18日公開 | 栁松聖吾

ChatGPT・Codexのクレジットを節約する、設定と運用の全部

この記事の内容
  1. 止まる理由は「使いすぎ」だけではない
  2. レートカードは「出力」を見る
  3. 設定4項目で、消費は下げられる
  4. いちばん見落とすのは「固定費」
  5. それでも足りない時の選択肢
  6. 結局、何をやると下がるのか
  7. よくある質問

ChatGPTやCodexを毎日使っていると、月の途中で「使用量の上限に達しました」と止まることがあります。弊社でも実際に止まりました。

調べてみると、止まる原因の多くは使い方そのものではなく、気づかないうちに単価の高い設定で回していたことでした。この記事は、その調査と対処をそのまま公開したものです。設定を見直しただけで消費が下がった部分と、それでも足りないときに何を選ぶかまで書きます。

止まる理由は「使いすぎ」だけではない

ChatGPTやCodexの使用量は、メッセージの本数ではなくトークン量で計算されます。同じ「1回の依頼」でも、渡した資料の量、考えさせた深さ、返ってきた文章の長さで消費はまったく違います。OpenAIの公式ドキュメントも、プロンプトの長さだけでは見積もれないと明記しています。

プランごとの目安として、公式には5時間あたりのローカル実行メッセージ数が幅で示されています。幅が大きいのは、1回の重さで何倍も変わるからです(主要4モデルの抜粋。全モデルは公式レートカードを参照)。以下の数値はいずれも2026年9月18日時点のもので、OpenAIの改定により変わります。最新の値は記事末の出典でご確認ください。

モデルPlusPro 5xPro 20x
GPT-6 Astra5〜4525〜225100〜900
GPT-5.6 Sol10〜10050〜500200〜2,000
GPT-5.6 Terra25〜200125〜1,000500〜4,000
GPT-5.6 Luna250〜2,0001,250〜10,0005,000〜40,000

同じPlusでも、上のモデルと下のモデルで40〜50倍の開きがあります。まずここを知らずに一番重いモデルを常用していると、何をしても足りません。

レートカードは「出力」を見る

公式のレートカードは、100万トークンあたりのクレジット数で示されています。ここで注目すべきなのは入力ではなく出力の単価です(こちらも主要4モデルの抜粋です)。

モデル入力キャッシュ入力出力
GPT-6 Astra250251,250
GPT-5.6 Sol10010500
GPT-5.6 Terra505300
GPT-5.6 Luna50.530

読み取れることは3つあります。

あわせて注意したいのが優先処理(Fast mode)です。応答を速くする代わりに、対応モデルではクレジット消費が標準の2倍から2.5倍になると公式に明記されています。弊社の設定ファイルには、これが入ったままになっていました。人が画面の前で待っている作業以外では、切っておくべき設定です。

設定4項目で、消費は下げられる

Codexには、消費に直結する設定項目があります。実際に弊社で見直したのは次の4つです。

設定何が変わるか
推論の深さ考える量を下げる。推論は出力として計算されるので、ここがいちばん直接的
回答の冗長さ返答そのものを短くする。読む側の負担も減る
ツール出力の上限コマンドの実行結果が長いと、以降の毎回の入力に乗り続ける。上限を切る
履歴の自動圧縮会話が長くなる前に畳む。膨らんだ履歴を毎回送り直さない

逆に、節約目的では意味がなかった設定もあります。推論の内容を画面に表示しない設定は、表示を消すだけで生成自体は行われるため、請求は変わりません。「見えない=使っていない」ではない、という分かりやすい例です。

いちばん見落とすのは「固定費」

ここが調べていて一番の発見でした。何もしていないのに毎回かかっている費用があります。

ひとつは拡張機能(MCPサーバー)です。接続しているだけで、そのツールの定義が毎回の入力に含まれます。OpenAIの公式ドキュメントでも、使用量を長持ちさせる方法として「使うMCPサーバーの数を制限する」「必要ないときは無効にする」が明記されています。弊社の環境は12個が常時有効になっていました。

もうひとつは指示書ファイル(AGENTS.md)です。プロジェクトの決まりごとを書いておくファイルですが、これも毎回先頭に読み込まれます。公式も、大きなプロジェクトではファイルを分割して必要な階層だけ読ませるよう案内しています。

この2つは、作業内容をどれだけ工夫しても減りません。使う分を減らす前に、置いてあるだけで課金されているものを外すほうが先です。

それでも足りない時の選択肢

設定を詰めたうえで足りないなら、次は契約側の話になります。公式に案内されている選択肢は4つです。

選択肢向いている場面注意点
クレジットを買い足す月に数回だけ足りない購入から12ヶ月で失効。返金は原則不可(法令上必要な場合を除く)、譲渡・再販も不可。購入できる金額や価格はアカウント・地域・プランにより異なるため購入画面で要確認
上位プランに上げる毎月のように足りない固定費が上がる。使い切れなければ割高
APIキーで動かす自動実行・CIなど無人の処理従量課金。クラウド連携機能は使えない
軽いモデルに寄せる調査・整理など定型作業設計判断や難しい調査には向かない

なお、複数のアカウントを契約して使い分ける方法について聞かれることがありますが、この記事では扱いません。OpenAIの利用規約は、禁止行為として「レート制限や制約の回避」を挙げています。弊社ではこの点を踏まえ、使用量の上限を超えるために契約を使い分ける運用は行っておらず、本記事でも推奨や手順の案内はしません。

結局、何をやると下がるのか

優先順位をつけるとこの順番です。

  1. 優先処理(Fast mode)を切る。人を待たせていないなら、2倍以上払う理由がない
  2. 常時有効な拡張機能を減らす。固定費なので、作業量に関係なく毎回かかっている
  3. 作業に合ったモデルを選ぶ。軽い作業は軽いモデルに寄せる
  4. 推論と回答の長さを下げる。重い判断のときだけ、そのセッションだけ上げる
  5. セッションを捨てずに、圧縮しながら続ける。新しく始め直すとキャッシュが効かなくなる(キャッシュ入力は通常の10分の1)

弊社の場合、止まった直接の原因は使いすぎではなく、優先処理が入ったまま、拡張機能を12個ぶら下げて、重いモデルで走っていたことでした。作業量を減らさずに、消費だけを落とせる余地がかなりありました。

AIの利用料は、人件費と違って「気をつける」では下がりません。どこで課金されているかを一度調べて、設定として固定してしまうほうが確実です。

よくある質問

設定を変えると、回答の質は落ちませんか?

作業の種類によります。定型的な修正や調査では、推論量を下げても結果はほとんど変わりません。一方で、設計判断や原因が読めない不具合の調査では差が出ます。常に低く固定するのではなく、普段は低めにしておき、重い判断のときだけそのセッションだけ上げる、という運用が現実的です。

クレジットを買い足すのと、上位プランに上げるのはどちらが得ですか?

毎月のように足りなくなるなら上位プラン、月に数回だけ足りないならクレジット購入が向いています。追加クレジットは購入から12ヶ月で失効します。返金は法令で義務づけられる場合を除いて不可で、譲渡・再販もできません。また購入できる金額や価格はアカウント・地域・プランによって異なるとOpenAIが案内しているため、実際の購入画面で確認してから判断してください。

MCPサーバーはそんなに影響がありますか?

影響します。MCPサーバーを有効にすると、そのツール定義が毎回の入力に含まれます。OpenAIの公式ドキュメントでも、使用量を長持ちさせる方法として「使うMCPサーバーの数を制限する」「必要ないときは無効にする」が挙げられています。数を増やすほど、何もしていない状態の固定費が上がります。

アカウントを複数持って使い分けてもよいですか?

OpenAIの利用規約は、禁止行為として「レート制限や制約の回避」を挙げています。弊社ではこの点を踏まえ、使用量の上限を超えるために契約を使い分ける運用は行っておらず、本記事でも推奨や手順の案内はしません。上限に達した場合は、記事内で挙げた公式の選択肢(クレジットの追加購入、上位プラン、APIキー、軽いモデルへの切り替え)で対応することをおすすめします。

参考(2026年9月18日時点)

社内のAI活用について、費用の見直しから仕組み化までご相談いただけます。

無料で相談する