AIの実力を、毎日おなじ物差しで測ります
ChatGPT・Gemini・Claude・Copilot の4つに、まったく同じ仕事の課題を同じ条件で投げて、 正解と時間を数えています。採点はプログラムだけで行い、AIには採点させていません。
順位表を見る →18試行中18 / 2026年9月23日時点
測っているのは決まった課題での5つの指標です。どのAIがいちばん賢いかを表す数字ではありません。
- 議事録から決定事項とやることを抜く(4AI・6課題・各3回)2026年9月24日 / 有効な試行 72回 いちばん新しい回 課題の全文と4つの回答、採点の中身まで出しています
- 何を数えているか5つの指標 指標 正解率・所要時間のほか、他ではあまり出ていない2つも数えています
- AI独自調査(アンケート)2回を公開 アンケート 人に直接聞いた結果です。設問の全文と分母も出しています
- 集計データJSONとCSV 公開データ 1行1試行のCSVと、回答の全文まで落とせます
当たるものがありませんでした。検索の言葉を消すと全部戻ります。
RANKING
累積の順位表
日をまたいで足し上げた数字です。1回の測定・ 72回の試行が入っています。 並びは正解率の高い順です。「—」は、その指標をまだ測っていないという意味です。0%ではありません。
| AI | 正解率正解 ÷ 有効な試行 | 再現率3回で結論が一致 | 出典の実在率URLが開けた割合 | 所要時間中央値 |
|---|---|---|---|---|
| 1ChatGPT1回の測定 | 100% 18試行中18 | 100% | — | 20秒 |
| 2Claude1回の測定 | 100% 18試行中18 | 100% | — | 15.3秒 |
| 3Copilot1回の測定 | 83.3% 18試行中15 | 88.9% | — | 13.8秒 |
| 4Gemini1回の測定 | 83.3% 18試行中15 | 88.9% | — | 28.2秒 |
出典の実在率は、答えと一緒にURLを挙げてもらう課題があった回だけ測っています。 ChatGPT・Claude・Copilot・Geminiの「—」は、その課題をまだ投げていないという意味です。0%ではありません。
数え直せるようにしています。1行が1試行のCSVを 累積のJSONと 回ごとのページから落とせます。この表の数字は、そのファイルを数え直したものと一致します。
METRICS
何を数えているか
毎回おなじ5つを数えています。回ごとに指標を足したり減らしたりしません。 印を付けた2つは、他のベンチマークがほとんど出していない指標です。
- 正解率 正解した試行の数を、その回で有効だった試行の数で割ったもの
- 所要時間 送信してから回答が止まるまでの秒数。中央値・最小・最大を出す
- 再現率ここが独自 同じ課題を3回投げて、結論が一致した課題の割合
- 出典の実在率ここが独自 回答が挙げたURLのうち、実際に開けたものの割合
- 指示の遵守率 字数・形式・件数の決まりを守った試行の割合
再現率は、AIが同じ質問でも答えを変えることを数字にしたものです。 出典の実在率は、AIが挙げたURLを実際に開いて確かめた割合で、作り話がそのまま数字になります。
BY FIELD
分野別に強いAI
仕事の種類ごとに、いちばん正解率が高かったAIです。分野が変われば順位も変わります。
- 議事録・要約 ChatGPT 正解率 100% / 1回の測定
RUNS
測った回の一覧
1回につき、課題6問を4つのAIへ3回ずつ投げています。見出しは測定の結果から機械で作った1行です。
METHOD
測り方
やり直せるように、手順をそのまま書いています。途中で条件を変えることはしません。
1回の測定でやっていること
- きょうの分野を決めます。同じ分野は中7日あけ、同じ課題は使い回しません。
- 課題に使う材料を、その日の日付を種にして作り直します。架空の会社のデータです。
- 課題を6問つくります。易しいもの2問・中くらい2問・難しいもの2問です。正解はこの時点で決めます。
- 4つのAIへ、同じ課題文と同じ材料を投げます。1問につき3回、毎回あたらしい会話で投げます。
- 投げる順番は回ごとに入れ替えます。時間帯のかたよりが順位に出ないようにするためです。
- 送信から回答が止まるまでの秒数を記録します。既定の待ち時間は300秒です。
- 画面に出ていたモデル名と、確認した時刻を残します。AIは中身が黙って変わるためです。
- 採点はプログラムだけで行います。数値の一致・語句の有無・形式の適合・URLが開けるか・数式を実行した結果で決めます。
- どの試行がなぜ正解・不正解になったかを1行ずつCSVに出して、そのまま公開します。
採点のしかた
課題を作る時点で、どの型で採点するかを決めてあります。好き嫌いは点にしていません。 機械で決められない課題は、そもそも課題カタログに入れていません。
- exact_number
- 数値が正解と一致するか。丸めの幅も先に決めてある
- set_match
- 決められた項目をいくつ抜けたか。漏れと作り足しの両方を数える
- contains_all
- 必須の語句が全部入っているか
- format_check
- 字数・形式・件数の決まりを守ったか
- url_alive
- 挙げたURLを実際に開いて、実在するかを確かめる
- formula_run
- 出てきた数式を実際に実行して答え合わせをする
- consistency
- 同じ課題を3回投げて、結論が一致するか
答えが返らなかったときの数え方
先に決めてあります。あとから都合よく変えないためです。
- 断られた・時間切れ
分母に入れて、不正解として数えます。仕事では答えが返らないのと同じためです。
- プランの上限に当たった
分母から外します。その回は測れなかったものとして扱います。
- 人間確認の画面が出た
そこで止めます。機械で押すことも、避けることもしません。その回は見送ります。
- AInformation側の操作の失敗
分母から外します。AIの欠点としては書きません。
LIMITS
この測定の限界
数字だけを見て判断されないように、測れていないことを先に書いています。
- 1日1回の測定です
同じ課題でも日によって結果は変わります。1回の結果で順位を決めないでください。
- 使っているのは各AIの有料プランです
無料版の結果ではありません。プラン名は回ごとのページに出しています。
- ブラウザの画面から使っています
APIの結果ではありません。同じモデルでも画面とAPIでふるまいが違うことがあります。
- 1回につき課題は6問です
その分野の仕事すべてを測ったものではありません。
- 測っているのは5つの指標だけです
書き味・読みやすさ・長い会話でのふるまいは測っていません。
DATA
公開しているデータ
機械からそのまま読めます。加工も再配布もできます。ライセンスは CC BY 4.0 です。
- 累積の順位表(JSON) この表と分野別と履歴がそのまま入っています
- 測定した回の一覧(JSON) 回ごとのJSONとCSVのURLが入っています
回ごとの1行1試行のCSVは、測った回の一覧から各ページへ進むと落とせます。
FAQ
よくある質問
- どうやって測っているのですか
- 4つのAIに、まったく同じ課題文と同じ材料を、同じ日のうちに投げています。毎回あたらしい会話を開いて、前の回答を引きずらせません。投げる順番は回ごとに入れ替えています。送信してから回答が止まるまでの秒数もあわせて記録しています。
- なぜ同じ課題を3回も投げるのですか
- AIは同じ質問でも答えが変わるためです。1回だけの結果では、それが実力なのか偶然なのかが分かりません。3回投げて、結論が一致した割合を再現率として出しています。
- 採点は誰がしているのですか
- プログラムだけで採点しています。AIには採点させていません。正解は課題を作る時点で決めてあり、数値の一致・語句の有無・形式の適合・URLが実際に開けるか・数式を実行した結果で決まります。好き嫌いは点にしていません。
- 課題に使っているデータは実在の会社のものですか
- いいえ。架空の会社のデータを毎回あたらしく作っています。実在の企業・人物・他社の文章は使っていません。使った材料はそのまま配っているので、同じことをやり直せます。
- AIが答えられなかったときはどう数えていますか
- 断られた・時間切れは分母に入れて不正解として数えます。プランの上限に当たった・人間確認の画面が出たときは分母から外し、その回は測れなかったものとして扱います。AInformation側の操作の失敗も分母から外し、AIの欠点としては書きません。
- 使っているのは無料版ですか、有料版ですか
- 各AIの有料プランを、ブラウザの画面から使っています。APIではありません。プラン名と、画面に出ていたモデル名・確認した時刻を回ごとに記録しています。
- この順位は、どのAIがいちばん賢いかを表していますか
- いいえ。測っているのは決まった仕事の課題での正解率・所要時間・再現率・出典の実在率・指示の遵守率の5つだけです。書き味や読みやすさ、長い会話でのふるまいは測っていません。課題が変われば順位も変わります。
- 引用してもいいですか
- はい。CC BY 4.0 です。出典として「AInformation調べ AI実務ベンチ」と、使ったページのURL・測定日を書いてください。集計はJSONとCSVでも取れます。1行1試行のCSVを見れば、載せている数字を数え直せます。
CITATION
この測定を引用する
出典:AInformation調べ「AI実務ベンチ」(https://ainformation.jp/research/bench) 2026年9月23日時点 累積1分野・1回・のべ72試行
コピーしました
数字を引くときは、測定日と分母(何試行中いくつか)も一緒に書いてください。 累積の数字は毎日増えるので、引用した時点の版が分かるようにしておくと確かめやすくなります。
関連するページ
AIの最新ニュースを週1回まとめてお届け
その週に出た主要なAIニュースと、編集部が実際に試したツールを1通にまとめます。