本文へ移動
NEWS

AInformation 独自検証

AI比較ベンチマーク

ChatGPT・Claude・Gemini にまったく同じ日本語の問題を投げて、 正しく答えられた数・かかった秒数・答えを出すのに使った量を数えました。 公式の発表ではなく、こちらで実際に投げて数えた結果です。

検証日 2026年9月5日 / 8モデル / 25問 / 1問3回ずつ / 合計600回

AInformationが実際に投げて数えた結果

総合の順位は付けていません。用途によって効く項目が違うためです。 自分が使う場面に近い項目の数字を見てください。

最上位のモデル同士

モデル正しく答えた数指示の順守事実の正確さ計算コード答え終わるまで最初の1文字使った量
GPT-6 AstraOpenAI66/7524/249/1818/1815/152.712.0712,000
Claude Opus 5Anthropic59/7124/246/1818/1811/113.332.2229,850
Claude Fable 5.1Anthropic54/6524/249/1816/185/54.982.9516,470
GPT-5.6 SolOpenAI66/7524/249/1818/1815/152.351.6917,321
Gemini 3.1 ProGoogle66/7524/249/1818/1815/156.986.9895,683

ふだん使いのモデル同士

モデル正しく答えた数指示の順守事実の正確さ計算コード答え終わるまで最初の1文字使った量
Claude Sonnet 5Anthropic66/7524/249/1818/1815/152.221.5833,653
GPT-5.6 TerraOpenAI63/7523/247/1818/1815/151.91.1915,076
Gemini 3.7 FlashGoogle66/7524/249/1818/1815/151.91.8761,745

知らないことを聞かれたときの答え方

料金や実在しないモデルについて聞いています。 知らないのに数字を言い切るモデルは、そのまま信じると損をします。

モデル正しく答えた 知らないと答えた違う答えを言い切った
GPT-6 Astra 9/18 9 0
Claude Opus 5 6/18 7 5
Claude Fable 5.1 9/18 9 2
Claude Sonnet 5 9/18 8 1
GPT-5.6 Sol 9/18 6 3
GPT-5.6 Terra 7/18 6 6
Gemini 3.1 Pro 9/18 9 0
Gemini 3.7 Flash 9/18 6 3

どうやって測ったか

同じ日本語の問題を1文字も変えずに投げています。思考の強さと温度はどこも指定していません(各社の既定のまま)。Web検索などのツールは全部切っています。

検証日
2026年9月5日
問題
日本語25問(指示の順守・事実の正確さ・計算・コード)。全文を下に載せています
回数
同じ問題を3回ずつ。秒数は中央値
出力の上限
16,000トークン(3社とも同じ)
ツール
Web検索などはなし。素の答えだけを見ています
思考の強さ
各社の既定のまま(どこも指定していません)
実行した場所
日本国内から、各社のAPIへ直接
使った量
各社のAPIが返してきた実測のトークン数。思考に使ったぶんも含みます
採点
すべて機械で判定しています。人やAIの主観は入れていません

それぞれの公式ページ

上の数字はこちらで実際に投げて数えたものです。 各社が公表している仕様は、下のリンクから直接ご覧ください。

モデル確かめた日 出典
GPT-6 Astra 2026年9月5日 公式ページ
Claude Opus 5 2026年9月4日 公式ページ
Claude Fable 5.1 2026年9月2日 公式ページ
Claude Sonnet 5 2026年9月2日 公式ページ
GPT-5.6 Sol 2026年9月2日 公式ページ
GPT-5.6 Terra 2026年9月2日 公式ページ
Gemini 3.1 Pro 2026年9月2日 公式ページ
Gemini 3.7 Flash 2026年9月2日 公式ページ

使った問題(全25問)

中身が見えないベンチマークは信用できません。実際に投げた文章と、採点の基準をそのまま載せます。

指示の順守8問

follow-len-300

取引先へ出す「原材料の高騰による価格改定のお知らせ」の本文を書いてください。
条件:**ちょうど300字**で書くこと。前置きや説明は付けず、本文だけを返すこと。

採点:300字の指定に対して±5%以内か

follow-len-100

社内向けに「来週の全体会議が水曜10時から会議室Aへ変更になった」ことを知らせる文を書いてください。
条件:**100字以内**。本文だけを返すこと。

採点:100字以内に収まっているか

follow-json

次の文から、会社名・金額・支払期日を抜き出してください。

『株式会社みどり物産より、システム保守費として1,254,000円のご請求をいただきました。お支払いは2026年10月31日までとなっております。』

条件:JSONだけを返すこと。キーは company / amount / due の3つ。amount は数字のみ(カンマなし)。due は YYYY-MM-DD の形。コードブロックの記号や説明文は付けないこと。

採点:JSONとして読めて、指定したキーと値がそろっているか

follow-bullet5

次の議事メモを要点にまとめてください。

『新システムの導入は10月から。まず経理部だけで試す。現場の入力画面が分かりにくいという声が出たので、来月までに直す。研修は9月中に2回。旧システムは12月末で止める。問い合わせ窓口は情報システム部が担当する。』

条件:**ちょうど5つ**の箇条書きにすること。各行は「- 」で始めること。前置きや締めの文は付けないこと。

採点:箇条書きがちょうど5行か

follow-ban

新入社員へ向けた歓迎のあいさつ文を200字前後で書いてください。
条件:**「頑張」「しっかり」「ぜひ」の3語は1回も使わないこと。**本文だけを返すこと。

採点:禁止した語を1つも使っていないか

follow-noprefix

『在庫が切れているため、納期が2週間ほど延びる』ことを取引先へ伝えるメールの本文を書いてください。
条件:**あいさつや前置きを一切書かず、メール本文だけ**を返すこと。「承知しました」「以下の通りです」のような、こちらへの返事も書かないこと。

採点:冒頭40字に前置きが入っていないか

follow-table

社内で使う備品を3つ選び、比較の表を作ってください。
条件:**Markdownの表だけ**を返すこと。列は「品名」「価格帯」「用途」の3列。見出しの行を除いて**ちょうど3行**にすること。表の前後に文章を付けないこと。

採点:3列3行の表になっているか

follow-order

次の5つの作業を、指定した順番のとおりに並べ直して書き出してください。

作業:見積書の作成/要件のヒアリング/契約書の締結/提案書の提出/納品

条件:**ヒアリング → 提案書 → 見積書 → 契約書 → 納品** の順に並べること。1行に1つずつ、作業名だけを5行で書くこと。番号や記号は付けないこと。

採点:指定した順番どおりに並んでいるか

事実の正確さ6問

fact-price-own

いま私が話している相手である「GPT-6 Astra」について聞きます。
このモデルをAPIで使うとき、**出力**トークンの料金は100万トークンあたり何ドルですか。
数字だけを半角で1行で書いてください(例:25)。
わからない場合は「不明」とだけ書いてください。

採点:答えの数値が正解と一致するか

fact-price-rival

OpenAIの「Claude Opus 5」をAPIで使うとき、**出力**トークンの料金は100万トークンあたり何ドルですか。
数字だけを半角で1行で書いてください。
わからない場合は「不明」とだけ書いてください。

採点:答えの数値が正解と一致するか

fact-price-jp

「ChatGPT」の有料プラン「Go」は、日本円で月あたりいくらですか。
数字だけを半角で1行で書いてください(例:3000)。
わからない場合は「不明」とだけ書いてください。

採点:答えの数値が正解と一致するか

fact-free-plan

「Gemini(Google AI プラン)」に、ずっと無料で使えるプラン(無料トライアルではなく無料プラン)はありますか。
「あり」か「なし」のどちらか1語だけを書いてください。
わからない場合は「不明」とだけ書いてください。

採点:あり/なしが正解と一致するか

fact-nocheat

「Claude Nimbus 7」というモデルの文脈長と料金を教えてください。
実在しない場合は、その旨だけを短く答えてください。

採点:実在しないと答え、なおかつ中身を作っていないか

fact-unit

1坪は何平方メートルですか。小数第4位まで、半角数字だけを1行で書いてください。

採点:答えの数値が正解と一致するか

計算6問

calc-sum

次の表は、ある支店の月別の売上です。

| 月 | 売上(円) |
|---|---|
| 1月 | 4,820,000 |
| 2月 | 5,140,000 |
| 3月 | 4,390,000 |
| 4月 | 6,020,000 |
| 5月 | 5,570,000 |
| 6月 | 5,930,000 |
| 7月 | 6,480,000 |
| 8月 | 4,960,000 |
| 9月 | 5,310,000 |
| 10月 | 6,750,000 |
| 11月 | 7,120,000 |
| 12月 | 8,040,000 |

1年間の売上の合計はいくらですか。
答えの数字だけを、カンマなしの半角数字で1行で書いてください。

採点:答えの数値が正解と一致するか

calc-tax

次の表は、税抜の金額と、その品目にかかる消費税率です。

| 品目 | 税抜金額(円) | 税率 |
|---|---|---|
| 会議用の弁当 | 12,800 | 8% |
| コピー用紙 | 5,400 | 10% |
| 来客用のお茶 | 3,200 | 8% |
| 事務椅子 | 24,000 | 10% |
| お土産の菓子折り | 4,500 | 8% |

すべての品目の税込金額を足すといくらになりますか。
1円未満は切り捨てで計算してください。
答えの数字だけを、カンマなしの半角数字で1行で書いてください。

採点:答えの数値が正解と一致するか

calc-pct

次の表は、拠点ごとの前年と今年の売上です。

| 拠点 | 前年(円) | 今年(円) |
|---|---|---|
| 東京 | 128,400,000 | 141,240,000 |
| 大阪 | 96,300,000 | 91,485,000 |
| 名古屋 | 54,800,000 | 58,400,000 |
| 福岡 | 38,200,000 | 37,054,000 |

前年からの増減率がいちばん大きい拠点はどこですか。
拠点名だけを1行で書いてください。

採点:正解の語が含まれるか

calc-share

次の表は、サービス別の年間売上です。

| サービス | 売上(円) |
|---|---|
| 定期メンテナンス | 41,300,000 |
| 新規導入 | 68,900,000 |
| 保守部品 | 22,400,000 |
| 研修 | 15,800,000 |
| コンサルティング | 33,600,000 |

売上の大きい順に上位3つを挙げてください。
1行に1つずつ、サービス名だけを大きい順に3行で書いてください。

採点:指定した順番どおりに並んでいるか

calc-date

2026年9月1日から2026年9月30日までの間に、土曜日と日曜日は何日ありますか。
祝日は数えません。土曜と日曜の合計の日数を答えてください。
答えの数字だけを半角数字で1行で書いてください。

採点:答えの数値が正解と一致するか

calc-trap

次の表は、支店ごとの売上です。**単位の列に気をつけてください。**

| 支店 | 売上 | 単位 |
|---|---|---|
| A支店 | 12,400,000 | 円 |
| B支店 | 9,800,000 | 円 |
| C支店 | 15,600 | 千円 |
| D支店 | 11,200,000 | 円 |

4支店の売上を合計すると、円でいくらになりますか。
答えの数字だけを、カンマなしの半角数字で1行で書いてください。

採点:答えの数値が正解と一致するか

コード5問

code-zenkaku

Pythonの関数 `to_hankaku(s)` を書いてください。
全角の数字と全角の英字を半角に直して返します。それ以外の文字は変えません。
コードだけを返してください。

採点:書いたコードを実際に動かして、テスト6件が通るか

code-wareki

Pythonの関数 `to_seireki(s)` を書いてください。
和暦の文字列を受け取り、西暦の年を整数で返します。
昭和・平成・令和に対応してください。「元年」は1年として扱います。
コードだけを返してください。

採点:書いたコードを実際に動かして、テスト8件が通るか

code-yubin

Pythonの関数 `norm_zip(s)` を書いてください。
郵便番号の表記ゆれを `123-4567` の形にそろえて返します。
全角の数字・全角のハイフン・先頭の「〒」・空白が混ざることがあります。
7桁の数字が取れないときは空文字を返してください。
コードだけを返してください。

採点:書いたコードを実際に動かして、テスト6件が通るか

code-kingaku

Pythonの関数 `to_amount(s)` を書いてください。
金額の文字列を整数で返します。カンマ・円・¥・¥・全角の数字が混ざることがあります。数字が1つも無いときは0を返してください。
コードだけを返してください。

採点:書いたコードを実際に動かして、テスト6件が通るか

code-edge

Pythonの関数 `sum_safe(xs)` を書いてください。
数値のリストの合計を返します。
リストが None のとき、空のとき、中に None や空文字が混ざるときも落ちずに合計を返してください。数字にできない要素は0として扱います。
コードだけを返してください。

採点:書いたコードを実際に動かして、テスト6件が通るか

これまでの検証

検証日きっかけ測ったモデル
2026年9月5日 GeminiのAPIキーが通ったので、3社そろえて8モデルで測り直し 8モデル
2026年9月5日 GPT-6 Astra が使えるようになった(9/5)。 6モデル
2026年9月5日 GPT-6 Astra がAPIで使えるようになった(9/5)ので7モデルで測り直す 5モデル
2026年9月4日 GPT-6 Astra記事の実測(発表と実態のズレ) 4モデル
2026年9月4日 採点が妥当か確かめる動作確認 1モデル
2026年9月2日 手で実行 6モデル

よくある質問

この数字はどこから来たものですか?

AInformationが2026年9月5日に、各社のAPIへ実際に同じ問題を投げて数えたものです。他社のベンチマークや各社の発表を引き写したものではありません。8モデルに25問を3回ずつ、合計600回投げています。

どうして総合順位を付けないのですか?

順位を付けると、どの項目をどれだけ重く見るかという判断が入ります。そこは使う人によって違います。指示どおりに書いてほしい人と、計算を任せたい人では、見るべき項目が別です。だから項目ごとの数字だけを出して、判断は読む人にお任せしています。

採点はどうやっていますか?

すべて機械で判定できる問題だけを使っています。文字数が指定どおりか、JSONとして読めるか、計算の答えが合っているか、書いたコードが実際に動くか。文章がうまいか、自然か、といった主観の入る項目は入れていません。採点の基準はページ内にすべて載せています。

「使った量」は何を表していますか?

各社のAPIが返してきた実測のトークン数です。トークンはAIが文章を扱うときの単位で、日本語なら1文字がだいたい1トークン前後になります。同じ問題に同じだけ正解しているなら、使った量が少ないほど無駄な思考をしていません。考えているあいだに使ったぶんも含めて数えています。

いつ更新されますか?

新しいモデルが出たときに測り直します。決まった間隔ではありません。そのとき1社だけでなく、載せているモデルを全部測り直します。別の日に測った数字を並べると、同じ条件で比べたことにならないためです。

問題は公開されていますか?

ページの下に全問の文章と採点の基準を載せています。中身が見えないベンチマークは確かめようがないためです。