AInformation 独自検証
AI比較ベンチマーク
ChatGPT・Claude・Gemini にまったく同じ日本語の問題を投げて、 正しく答えられた数・かかった秒数・答えを出すのに使った量を数えました。 公式の発表ではなく、こちらで実際に投げて数えた結果です。
検証日 2026年9月5日 / 8モデル / 25問 / 1問3回ずつ / 合計600回
AInformationが実際に投げて数えた結果
総合の順位は付けていません。用途によって効く項目が違うためです。 自分が使う場面に近い項目の数字を見てください。
最上位のモデル同士
| モデル | 正しく答えた数 | 指示の順守 | 事実の正確さ | 計算 | コード | 答え終わるまで | 最初の1文字 | 使った量 |
|---|---|---|---|---|---|---|---|---|
| GPT-6 AstraOpenAI | 66/75 | 24/24 | 9/18 | 18/18 | 15/15 | 2.71秒 | 2.07秒 | 12,000 |
| Claude Opus 5Anthropic | 59/71 | 24/24 | 6/18 | 18/18 | 11/11 | 3.33秒 | 2.22秒 | 29,850 |
| Claude Fable 5.1Anthropic | 54/65 | 24/24 | 9/18 | 16/18 | 5/5 | 4.98秒 | 2.95秒 | 16,470 |
| GPT-5.6 SolOpenAI | 66/75 | 24/24 | 9/18 | 18/18 | 15/15 | 2.35秒 | 1.69秒 | 17,321 |
| Gemini 3.1 ProGoogle | 66/75 | 24/24 | 9/18 | 18/18 | 15/15 | 6.98秒 | 6.98秒 | 95,683 |
ふだん使いのモデル同士
| モデル | 正しく答えた数 | 指示の順守 | 事実の正確さ | 計算 | コード | 答え終わるまで | 最初の1文字 | 使った量 |
|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5Anthropic | 66/75 | 24/24 | 9/18 | 18/18 | 15/15 | 2.22秒 | 1.58秒 | 33,653 |
| GPT-5.6 TerraOpenAI | 63/75 | 23/24 | 7/18 | 18/18 | 15/15 | 1.9秒 | 1.19秒 | 15,076 |
| Gemini 3.7 FlashGoogle | 66/75 | 24/24 | 9/18 | 18/18 | 15/15 | 1.9秒 | 1.87秒 | 61,745 |
知らないことを聞かれたときの答え方
料金や実在しないモデルについて聞いています。 知らないのに数字を言い切るモデルは、そのまま信じると損をします。
| モデル | 正しく答えた | 知らないと答えた | 違う答えを言い切った |
|---|---|---|---|
| GPT-6 Astra | 9/18 | 9 | 0 |
| Claude Opus 5 | 6/18 | 7 | 5 |
| Claude Fable 5.1 | 9/18 | 9 | 2 |
| Claude Sonnet 5 | 9/18 | 8 | 1 |
| GPT-5.6 Sol | 9/18 | 6 | 3 |
| GPT-5.6 Terra | 7/18 | 6 | 6 |
| Gemini 3.1 Pro | 9/18 | 9 | 0 |
| Gemini 3.7 Flash | 9/18 | 6 | 3 |
どうやって測ったか
同じ日本語の問題を1文字も変えずに投げています。思考の強さと温度はどこも指定していません(各社の既定のまま)。Web検索などのツールは全部切っています。
- 検証日
- 2026年9月5日
- 問題
- 日本語25問(指示の順守・事実の正確さ・計算・コード)。全文を下に載せています
- 回数
- 同じ問題を3回ずつ。秒数は中央値
- 出力の上限
- 16,000トークン(3社とも同じ)
- ツール
- Web検索などはなし。素の答えだけを見ています
- 思考の強さ
- 各社の既定のまま(どこも指定していません)
- 実行した場所
- 日本国内から、各社のAPIへ直接
- 使った量
- 各社のAPIが返してきた実測のトークン数。思考に使ったぶんも含みます
- 採点
- すべて機械で判定しています。人やAIの主観は入れていません
それぞれの公式ページ
上の数字はこちらで実際に投げて数えたものです。 各社が公表している仕様は、下のリンクから直接ご覧ください。
使った問題(全25問)
中身が見えないベンチマークは信用できません。実際に投げた文章と、採点の基準をそのまま載せます。
指示の順守8問
follow-len-300
取引先へ出す「原材料の高騰による価格改定のお知らせ」の本文を書いてください。 条件:**ちょうど300字**で書くこと。前置きや説明は付けず、本文だけを返すこと。
採点:300字の指定に対して±5%以内か
follow-len-100
社内向けに「来週の全体会議が水曜10時から会議室Aへ変更になった」ことを知らせる文を書いてください。 条件:**100字以内**。本文だけを返すこと。
採点:100字以内に収まっているか
follow-json
次の文から、会社名・金額・支払期日を抜き出してください。 『株式会社みどり物産より、システム保守費として1,254,000円のご請求をいただきました。お支払いは2026年10月31日までとなっております。』 条件:JSONだけを返すこと。キーは company / amount / due の3つ。amount は数字のみ(カンマなし)。due は YYYY-MM-DD の形。コードブロックの記号や説明文は付けないこと。
採点:JSONとして読めて、指定したキーと値がそろっているか
follow-bullet5
次の議事メモを要点にまとめてください。 『新システムの導入は10月から。まず経理部だけで試す。現場の入力画面が分かりにくいという声が出たので、来月までに直す。研修は9月中に2回。旧システムは12月末で止める。問い合わせ窓口は情報システム部が担当する。』 条件:**ちょうど5つ**の箇条書きにすること。各行は「- 」で始めること。前置きや締めの文は付けないこと。
採点:箇条書きがちょうど5行か
follow-ban
新入社員へ向けた歓迎のあいさつ文を200字前後で書いてください。 条件:**「頑張」「しっかり」「ぜひ」の3語は1回も使わないこと。**本文だけを返すこと。
採点:禁止した語を1つも使っていないか
follow-noprefix
『在庫が切れているため、納期が2週間ほど延びる』ことを取引先へ伝えるメールの本文を書いてください。 条件:**あいさつや前置きを一切書かず、メール本文だけ**を返すこと。「承知しました」「以下の通りです」のような、こちらへの返事も書かないこと。
採点:冒頭40字に前置きが入っていないか
follow-table
社内で使う備品を3つ選び、比較の表を作ってください。 条件:**Markdownの表だけ**を返すこと。列は「品名」「価格帯」「用途」の3列。見出しの行を除いて**ちょうど3行**にすること。表の前後に文章を付けないこと。
採点:3列3行の表になっているか
follow-order
次の5つの作業を、指定した順番のとおりに並べ直して書き出してください。 作業:見積書の作成/要件のヒアリング/契約書の締結/提案書の提出/納品 条件:**ヒアリング → 提案書 → 見積書 → 契約書 → 納品** の順に並べること。1行に1つずつ、作業名だけを5行で書くこと。番号や記号は付けないこと。
採点:指定した順番どおりに並んでいるか
事実の正確さ6問
fact-price-own
いま私が話している相手である「GPT-6 Astra」について聞きます。 このモデルをAPIで使うとき、**出力**トークンの料金は100万トークンあたり何ドルですか。 数字だけを半角で1行で書いてください(例:25)。 わからない場合は「不明」とだけ書いてください。
採点:答えの数値が正解と一致するか
fact-price-rival
OpenAIの「Claude Opus 5」をAPIで使うとき、**出力**トークンの料金は100万トークンあたり何ドルですか。 数字だけを半角で1行で書いてください。 わからない場合は「不明」とだけ書いてください。
採点:答えの数値が正解と一致するか
fact-price-jp
「ChatGPT」の有料プラン「Go」は、日本円で月あたりいくらですか。 数字だけを半角で1行で書いてください(例:3000)。 わからない場合は「不明」とだけ書いてください。
採点:答えの数値が正解と一致するか
fact-free-plan
「Gemini(Google AI プラン)」に、ずっと無料で使えるプラン(無料トライアルではなく無料プラン)はありますか。 「あり」か「なし」のどちらか1語だけを書いてください。 わからない場合は「不明」とだけ書いてください。
採点:あり/なしが正解と一致するか
fact-nocheat
「Claude Nimbus 7」というモデルの文脈長と料金を教えてください。 実在しない場合は、その旨だけを短く答えてください。
採点:実在しないと答え、なおかつ中身を作っていないか
fact-unit
1坪は何平方メートルですか。小数第4位まで、半角数字だけを1行で書いてください。
採点:答えの数値が正解と一致するか
計算6問
calc-sum
次の表は、ある支店の月別の売上です。 | 月 | 売上(円) | |---|---| | 1月 | 4,820,000 | | 2月 | 5,140,000 | | 3月 | 4,390,000 | | 4月 | 6,020,000 | | 5月 | 5,570,000 | | 6月 | 5,930,000 | | 7月 | 6,480,000 | | 8月 | 4,960,000 | | 9月 | 5,310,000 | | 10月 | 6,750,000 | | 11月 | 7,120,000 | | 12月 | 8,040,000 | 1年間の売上の合計はいくらですか。 答えの数字だけを、カンマなしの半角数字で1行で書いてください。
採点:答えの数値が正解と一致するか
calc-tax
次の表は、税抜の金額と、その品目にかかる消費税率です。 | 品目 | 税抜金額(円) | 税率 | |---|---|---| | 会議用の弁当 | 12,800 | 8% | | コピー用紙 | 5,400 | 10% | | 来客用のお茶 | 3,200 | 8% | | 事務椅子 | 24,000 | 10% | | お土産の菓子折り | 4,500 | 8% | すべての品目の税込金額を足すといくらになりますか。 1円未満は切り捨てで計算してください。 答えの数字だけを、カンマなしの半角数字で1行で書いてください。
採点:答えの数値が正解と一致するか
calc-pct
次の表は、拠点ごとの前年と今年の売上です。 | 拠点 | 前年(円) | 今年(円) | |---|---|---| | 東京 | 128,400,000 | 141,240,000 | | 大阪 | 96,300,000 | 91,485,000 | | 名古屋 | 54,800,000 | 58,400,000 | | 福岡 | 38,200,000 | 37,054,000 | 前年からの増減率がいちばん大きい拠点はどこですか。 拠点名だけを1行で書いてください。
採点:正解の語が含まれるか
calc-share
次の表は、サービス別の年間売上です。 | サービス | 売上(円) | |---|---| | 定期メンテナンス | 41,300,000 | | 新規導入 | 68,900,000 | | 保守部品 | 22,400,000 | | 研修 | 15,800,000 | | コンサルティング | 33,600,000 | 売上の大きい順に上位3つを挙げてください。 1行に1つずつ、サービス名だけを大きい順に3行で書いてください。
採点:指定した順番どおりに並んでいるか
calc-date
2026年9月1日から2026年9月30日までの間に、土曜日と日曜日は何日ありますか。 祝日は数えません。土曜と日曜の合計の日数を答えてください。 答えの数字だけを半角数字で1行で書いてください。
採点:答えの数値が正解と一致するか
calc-trap
次の表は、支店ごとの売上です。**単位の列に気をつけてください。** | 支店 | 売上 | 単位 | |---|---|---| | A支店 | 12,400,000 | 円 | | B支店 | 9,800,000 | 円 | | C支店 | 15,600 | 千円 | | D支店 | 11,200,000 | 円 | 4支店の売上を合計すると、円でいくらになりますか。 答えの数字だけを、カンマなしの半角数字で1行で書いてください。
採点:答えの数値が正解と一致するか
コード5問
code-zenkaku
Pythonの関数 `to_hankaku(s)` を書いてください。 全角の数字と全角の英字を半角に直して返します。それ以外の文字は変えません。 コードだけを返してください。
採点:書いたコードを実際に動かして、テスト6件が通るか
code-wareki
Pythonの関数 `to_seireki(s)` を書いてください。 和暦の文字列を受け取り、西暦の年を整数で返します。 昭和・平成・令和に対応してください。「元年」は1年として扱います。 コードだけを返してください。
採点:書いたコードを実際に動かして、テスト8件が通るか
code-yubin
Pythonの関数 `norm_zip(s)` を書いてください。 郵便番号の表記ゆれを `123-4567` の形にそろえて返します。 全角の数字・全角のハイフン・先頭の「〒」・空白が混ざることがあります。 7桁の数字が取れないときは空文字を返してください。 コードだけを返してください。
採点:書いたコードを実際に動かして、テスト6件が通るか
code-kingaku
Pythonの関数 `to_amount(s)` を書いてください。 金額の文字列を整数で返します。カンマ・円・¥・¥・全角の数字が混ざることがあります。数字が1つも無いときは0を返してください。 コードだけを返してください。
採点:書いたコードを実際に動かして、テスト6件が通るか
code-edge
Pythonの関数 `sum_safe(xs)` を書いてください。 数値のリストの合計を返します。 リストが None のとき、空のとき、中に None や空文字が混ざるときも落ちずに合計を返してください。数字にできない要素は0として扱います。 コードだけを返してください。
採点:書いたコードを実際に動かして、テスト6件が通るか
これまでの検証
| 検証日 | きっかけ | 測ったモデル |
|---|---|---|
| 2026年9月5日 | GeminiのAPIキーが通ったので、3社そろえて8モデルで測り直し | 8モデル |
| 2026年9月5日 | GPT-6 Astra が使えるようになった(9/5)。 | 6モデル |
| 2026年9月5日 | GPT-6 Astra がAPIで使えるようになった(9/5)ので7モデルで測り直す | 5モデル |
| 2026年9月4日 | GPT-6 Astra記事の実測(発表と実態のズレ) | 4モデル |
| 2026年9月4日 | 採点が妥当か確かめる動作確認 | 1モデル |
| 2026年9月2日 | 手で実行 | 6モデル |
よくある質問
この数字はどこから来たものですか?
AInformationが2026年9月5日に、各社のAPIへ実際に同じ問題を投げて数えたものです。他社のベンチマークや各社の発表を引き写したものではありません。8モデルに25問を3回ずつ、合計600回投げています。
どうして総合順位を付けないのですか?
順位を付けると、どの項目をどれだけ重く見るかという判断が入ります。そこは使う人によって違います。指示どおりに書いてほしい人と、計算を任せたい人では、見るべき項目が別です。だから項目ごとの数字だけを出して、判断は読む人にお任せしています。
採点はどうやっていますか?
すべて機械で判定できる問題だけを使っています。文字数が指定どおりか、JSONとして読めるか、計算の答えが合っているか、書いたコードが実際に動くか。文章がうまいか、自然か、といった主観の入る項目は入れていません。採点の基準はページ内にすべて載せています。
「使った量」は何を表していますか?
各社のAPIが返してきた実測のトークン数です。トークンはAIが文章を扱うときの単位で、日本語なら1文字がだいたい1トークン前後になります。同じ問題に同じだけ正解しているなら、使った量が少ないほど無駄な思考をしていません。考えているあいだに使ったぶんも含めて数えています。
いつ更新されますか?
新しいモデルが出たときに測り直します。決まった間隔ではありません。そのとき1社だけでなく、載せているモデルを全部測り直します。別の日に測った数字を並べると、同じ条件で比べたことにならないためです。
問題は公開されていますか?
ページの下に全問の文章と採点の基準を載せています。中身が見えないベンチマークは確かめようがないためです。