Claude Code を使っていて、OpenAI の Codex も気になる。どちらが優秀なのか、乗り換えるべきなのか。比較記事を探すと、機能の一覧表と「用途によって使い分けましょう」という結びに行き当たります。
その結論は、実際に両方を毎日動かしてみると少しずれています。Saixでは25日間で519回、同じ依頼を両方へ同時に投げ続けました。そこで見えたのは性能の優劣ではなく、片方が思っていたよりずっと落ちるという事実でした。
- どちらが賢いかを知りたいのに、比較表を見ても判断できない
- 両方に課金するのはもったいない気がして、片方に絞ろうとしている
- 乗り換えた後に「前のほうが良かった」となるのが怖い
この記事では、Saixの実運用の記録から次のことに答えます。数字はすべて2026年9月13日から10月7日までの実測で、推定値は使っていません。
- 両方を同時に走らせたときの成功率と、失敗の中身
- 1回あたりに実際かかった金額と、25日間の累計
- 片方が止まったときに何が起きて、どう続けるか
- どちらに何を投げ分けると噛み合うか
Codexの成功率は実測で72%でした。4回に1回以上は返ってきません。性能を比べて片方に絞るより、両方を入れて横に並べ、落ちたほうを捨てて進めるほうが、結果として止まらずに済みます。
監修者
株式会社Saix 代表取締役
東証プライム上場企業含む100社以上のAI導入支援|リクルート(Indeed Japan)でHR領域のデジタルマーケティングとAI活用を経て、Claude・Claude Codeを実務で使い倒すメディア「AIエージェント研究所」を運営|YouTubeメディア「かいちのAI大学」4.8万人。
相場を押さえた次に要るのは、自社の場合いくら減るのかという数字です。3分で出せます。
会社のホームページのURLを入れるだけで、削減できる時間と、それを人件費に換算した金額がその場でわかります。入力は5つだけ、3分で終わります。費用はかかりません。
以下の画像の「無料で試算する」をクリックして、まず自社の金額を出してみてください。

※ 画像の金額は表示例です。実際の試算額は入力内容によって変わります。
結論|選んで絞るものではなく、両方入れて横に並べるもの

先に実測を出します。同じ依頼を両方へ同時に投げ、返ってきた票を数えた結果です。
| 使ったもの | 実行 | 成功 | 失敗 | 成功率 | 1回あたり | 25日の累計 |
|---|---|---|---|---|---|---|
| Codex | 242回 | 174 | 68 | 72% | 0円 | 0円 |
| Grok | 222回 | 214 | 8 | 96% | 5.1円 | 1,101円 |
| Gemini(控え) | 55回 | 52 | 3 | 95% | 10.0円 | 520円 |
Codexは契約しているプランの枠内で動くので、何回使ってもその場の支払いは増えません。かわりに242回のうち68回は返ってきませんでした。
Grokは使った分だけ払う形で、1回5.1円。25日間の累計で1,101円でした。
Claude Code 側も同じで、上位プランの枠の中で動きます。Anthropicのヘルプによると、Claude Code は契約しているプランの利用枠をそのまま使う形です。つまり両方とも、その場では現金が出ていかない代わりに、別々の枠を消費しています。
片方が止まる前提で組む:どちらが賢いかより、返ってくるかが先に効く
比較記事が答えてくれないのは、この部分です。出力の質を比べる前に、そもそも返ってこない回が4分の1以上あります。
Saixでは、重要な判断を3つのAIに同時にかける形にしています。Claude Codeが旗振り役になり、CodexとGrokへ同じ依頼を投げて、返ってきた意見を並べる。片方が落ちても、もう片方の意見は手元に残ります。
片方に絞っていたら、その日は意見がゼロです。絞ることの本当のコストは、お金ではなく「止まる日が生まれること」でした。
無料ダウンロード資料|PDF・全21ページ
Claude業務棚卸しシート
自社の業務のうちAIで減らせるものを30項目で棚卸しし、任せる・半分任せる・任せないに仕分けるシート。時間とコストの見積もりまで、この1枚で決められます。
資料を無料で受け取る →フォーム送信後、ご入力のメールアドレス宛にダウンロードURLをお送りします。
25日間519回の実測|失敗68回のほとんどは、性能ではなく枠切れ

Codexが返ってこなかった68回が何だったのかを見ます。大半はこのエラーでした。
失敗の中身:契約の枠を使い切ったという通知で、復帰時刻まで書いてある
エラー文には「使用量の上限に達した」という内容と、いつ戻るかの日時が入っています。上の画面では「10月10日 10:56」です。
これが分かると、判断が1秒で済みます。数時間後に戻るなら待てばいい。明日まで戻らないなら、いま別の手を打つ。何時に戻るかを教えてくれるエラーは、実はかなり親切です。
注意したいのは、これが性能の問題ではないという点です。Codexの出力が悪かったのではなく、順番が回ってこなかっただけです。だから「Codexは使えない」という結論にはなりません。
Codexの実際の動き|1行で走り、読み取り専用に閉じられる

Codexはターミナルから1行で呼べます。Claude Codeと同じ画面から使えるので、入れておいても邪魔になりません。
読み取り専用で止める:意見だけ聞きたいときは、ファイルを触らせない
上の画面で sandbox: read-only と出ている行があります。これは「ファイルを書き換えない」という指定です。
レビューや相談で呼ぶときは、この形で十分です。勝手に修正されると、どこが変わったのかを後から追う手間が増えます。Saixでは外部の意見を取るときは必ず読み取り専用で呼んでいます。
関連資料:「Claude業務棚卸しシート」(PDF・無料)を配布しています。
短い質問でも2万近く使う:軽いから安い、にはならない
同じ画面の最後に tokens used 19,017 と出ています。これはトークン(AIが文章を数える単位。日本語ならおおむね1文字が1トークン)の数です。投げた質問は「1+1は? 数字だけ答えて」の一言です。
短い質問でも、前提として読み込む情報があるぶん、消費はこれくらいになります。Claudeの制限がきつい本当の原因で書いたのと同じ構造で、Codex側にも土台があります。「短い質問だから軽い」は、どちらのツールでも成り立ちません。
ここまでの内容を自社に当てはめると、年間どれくらいの経費が減るのか。会社のURLを入れるだけで、その場で試算できます。
以下の画像の「無料で試算する」をクリックすると、入力から3分でその場に金額が出ます。

※ 画像の金額は表示例です。実際の試算額は入力内容によって変わります。
費用はどちらが高いか|現金が0円のほうが、枠は重い
費用の話は、見た目と実感が逆になります。実測を並べます。
| 使うもの | 支払い方 | 1回あたりの現金 | 実際に重いもの |
|---|---|---|---|
| Claude Code(旗振り役) | 上位プランの枠内 | 0円 | 使った分だけ払う形に換算して100〜270円相当 |
| Codex | ChatGPTの契約枠内 | 0円 | 契約枠(落ちると止まる) |
| Grok | 使った分だけ | 5.1円 | 現金のみ |
| Gemini(控え) | 使った分だけ | 10.0円 | 現金のみ |
25日間で現金として出ていったのは、GrokとGeminiを合わせて1,621円でした。1日あたり65円です。
一方で、旗振り役のClaude Code側が食っている枠を、使った分だけ払う形の料金(API料金)に置き換えて計算すると、1回あたり100〜270円相当になります。外部に払う数円より、自分の枠を使うほうが40倍から100倍重いという結果でした。
節約しようとすると、つい使った分だけ払うほうを削りたくなります。実測は逆を示していました。削るべきなのは数円の外部APIではなく、旗振り役が何往復するかのほうです。外部へ投げる回数を1回減らしても5円ですが、自分側のやり取りを1往復減らすと100円以上が浮きます。
無料ダウンロード資料|PDF・全21ページ
Claude業務棚卸しシート
自社の業務のうちAIで減らせるものを30項目で棚卸しし、任せる・半分任せる・任せないに仕分けるシート。時間とコストの見積もりまで、この1枚で決められます。
資料を無料で受け取る →フォーム送信後、ご入力のメールアドレス宛にダウンロードURLをお送りします。
併用の形|同じ依頼を同時に投げて、返ってきた票を並べる

実際の動かし方です。Claude Codeから、CodexとGrokへ同じ依頼を同時に投げます。待っている間は何もしません。両方から返ってきたら、意見を並べて読みます。
揃った日と落ちた日で費用が変わる:2.5円の日と、14円の日
上の画面の日はCodexが生きていたので、かかったのはGrokの2.5円だけでした。Geminiは控えなので呼ばれていません。
Codexが枠切れの期間は、代わりにGeminiが入ります。その場合は1回あたり約14円になります。費用が上がるのは、Codexが落ちている期間だけです。
この設計にしてから、外部の意見が取れずに止まった日はありません。3つのうち2つが同時に落ちることは、25日間で一度も起きませんでした。
この内容を自社に当てはめたい方は、無料のAI活用セッションで相談することもできます。
落ちた日に何が起きるか:待つ・捨てる・控えを呼ぶの3択になる
Codexが返ってこなかったとき、選べる手は3つです。エラー文に出ている復帰時刻まで待つか、その票を捨てて残りで進めるか、控えに回しているGeminiを呼ぶか。
Saixでは自動で控えを呼ぶ形にしました。人が気づいて判断する手間がなくなり、落ちた事実はあとからログで分かります。待つ選択を外したのは、止まっている時間のほうが数円より高くつくからです。
控えが入ると1回あたり約14円になりますが、これはCodexが落ちている期間だけです。25日間の累計でGeminiに払ったのは520円でした。
使い分けの基準|速さで分けず、立場で分ける
どちらに何を投げるか。性能で分けようとすると決まらないので、立場で分けています。
- 自分の手で動かすものはClaude Codeファイルを読んで直す、調べて書く、実際に手を動かす作業。旗振り役を1つに決めておかないと、どちらが何をしたか分からなくなります
- できあがったものを見せて意見をもらうのはCodexとGrok設計やコードのレビュー、重要な判断の検証。読み取り専用で呼べば、手は出さずに意見だけ返ります
- 意見が割れたときは、理由を読んで自分で決める多数決にしません。2対1で負けた側の指摘が正しいことは実際にありました
投げる前に整える:送るのは判断に必要な部分だけにする
外部に意見をもらうとき、手元の資料をまるごと渡したくなります。Saixではそうせず、判断に必要な部分だけを1枚にまとめてから投げています。
理由は2つあります。ひとつは顧客名や認証に関わるものを外へ出さないためです。もうひとつは、渡す量が増えるほど論点がぼやけて、返ってくる意見も散らかるからです。
実際、1回あたりに送っている量は2,000〜2,600トークン程度でした。資料をまるごと渡すのに比べると1桁小さく、それでも指摘の質は落ちていません。
自社の場合はいくらになるのか、この機会に出してみてください。削減できる時間と金額を、業務ごとに算出します。
以下の画像の「無料で試算する」をクリックして、AIで浮く金額を先に確認してください。

※ 画像の金額は表示例です。実際の試算額は入力内容によって変わります。
落とし穴|多数決で決めると、間違いのほうが通る
票の数で決めない:根拠を読まずに採ると、もっともらしい誤りが残る
複数のAIに聞くと、つい票の数で決めたくなります。Saixでこれをやらないのは、実際に少数側が正しかったことがあるからです。
直前に公開した記事のレビューでは、2つのAIが同じ箇所を指摘しました。ただしそのうち片方だけが、こちらの記事内の数字どうしが矛盾していることに気づいていました。票の数ではなく、根拠まで書いてある指摘を採る。これが実務での判断基準になっています。
もうひとつ、外部のAIが「問題なし」と言ったことを、動作確認の代わりにしないことも決めています。意見は意見であって、実際に動かして確かめるのは自分の仕事です。
無料ダウンロード資料|PDF・全21ページ
Claude業務棚卸しシート
自社の業務のうちAIで減らせるものを30項目で棚卸しし、任せる・半分任せる・任せないに仕分けるシート。時間とコストの見積もりまで、この1枚で決められます。
資料を無料で受け取る →フォーム送信後、ご入力のメールアドレス宛にダウンロードURLをお送りします。
よくある質問
Q. 両方に課金する必要がありますか
Codexは ChatGPT の契約に含まれる枠で動くので、その契約があれば追加の支払いは発生しません。Grokのように使った分だけ払うものを足すかは、落ちた日に止まってもよいかで決まります。Saixでは止まると困るので足していますが、25日間で1,101円でした。
Q. Claude Code から Codex に乗り換えたほうがいいですか
実測の範囲では、乗り換えを勧める材料は出ませんでした。Codexは4回に1回以上返ってこないので、これを主役にすると止まる日が生まれます。手を動かす役は1つに決めて、もう片方は意見をもらう役に回すほうが噛み合います。
Q. 2つ同時に動かすと、枠の消費は倍になりますか
別々の契約なので、枠は分かれています。Claude Code の枠とChatGPTの枠はそれぞれ独立していて、片方を使っても、もう片方は減りません。なおClaude側の枠の仕組みは公式のヘルプに、5時間ごとの枠と週ごとの枠として説明があります。
ただし旗振り役のClaude Code側は、外部へ投げる準備と結果の読み込みで往復が増えるぶん消費します。制限の仕組みはこちらに書きました。
どの作業をAIに渡すか、先に決めておきませんか
ツールを増やす前に必要なのは、自社のどの業務にどれだけ手間がかかっているかの棚卸しです。Saixが実務で使っている業務棚卸しシートを無料で配布しています。記入欄と記入例が入っているので、そのまま埋めれば優先順位が出ます。
まとめ
Claude CodeとCodexは、どちらが優秀かを決めて片方に絞るものではありませんでした。25日間519回の実測で出たのは、Codexの成功率が72%という数字です。4回に1回以上は返ってこないので、主役にすると止まる日が生まれます。
両方を入れて横に並べ、落ちたほうを捨てて進む。この形にしてから、意見が取れずに止まった日はゼロでした。費用は25日間で1,621円、1日あたり65円です。
費用の感覚も実測で逆転しました。外部に払う数円より、旗振り役が自分の枠を使うほうが40倍から100倍重い。削るなら外部APIではなく、自分側の往復数のほうです。
- 25日間519回の実測で、Codexの成功率は72%(242回中68回が失敗)、Grokは96%
- 失敗のほとんどは性能ではなく契約枠の使い切り。エラー文に復帰時刻が書いてある
- Codexは1行で呼べて、読み取り専用に閉じられる。ただし短い質問でも19,017トークン使う
- 現金の支出は25日で1,621円(1日65円)。旗振り役の枠消費は1回100〜270円相当で、そちらが40〜100倍重い
- 手を動かす役は1つに決め、もう片方は意見をもらう役に回す
- 票の数で決めない。2対1で負けた側の指摘が正しいことが実際にあった
Saixでは、こうした設計をそのまま社内に入れる伴走支援を行っています。関連する内容は次の記事にもまとめました。
制限の仕組みと土台の削り方はClaudeの制限がきつい本当の原因、Claude Code そのものの入門はClaude Codeとはにあります。
プランの選び方はClaudeのビジネス活用ガイド、他のAIを含めた比較はChatGPT・Gemini・Claude・Copilot比較、作業を渡す前のフォルダ設計はClaude Codeのフォルダ管理が該当します。
無料・オンライン・30分
AI活用の「次の一手」を、30分で具体化しませんか
経営者専用のAI活用パートナーが、御社の業務内容を伺いながら「どの業務から・どのAIで・どう進めるか」をその場で診断します。
- ✓東証プライム上場企業を含む100社以上の支援実績
- ✓その場で診断と助言まで行います(売り込みはしません)
- ✓費用はかかりません(オンライン・30分)
日程を選ぶと予約が完了します(Google Meet)


