売上表から合計と伸び率を出す(4AI・6課題・各3回)
表計算・集計の課題を6問つくり、ChatGPT・Copilot・Claude・Gemini へ各3回ずつ投げました。採点はプログラムだけで行い、AIには採点させていません。
AIごとのスコアを見る →ChatGPT・Copilot 各18試行中18
2026年10月2日 測定
- 6問課題
- 3回1問あたりの試行
- 4つ測ったAI
- 72回有効な試行
- v1公開版
1回の検証の結果。日や課題が変われば順位は変わる
-
ChatGPT
100%
18試行中18が正解
1位
ChatGPT Pro
回答まで 中央値20.4秒 -
Copilot
100%
18試行中18が正解
2位
Microsoft 365 Personal
回答まで 中央値17.1秒 -
Claude
83.3%
18試行中15が正解
3位
Claude Max
回答まで 中央値26.6秒 -
Gemini
50%
18試行中9が正解
4位
Google AI Pro
回答まで 中央値36.1秒
当たるものがありませんでした。検索の言葉を消すと全部戻ります。
RESULT
この回で分かったこと
下の1行は、採点の結果からそのまま作ったものです。ページ側で足した言葉はありません。
- 表計算・集計 6課題・各3回 6課題を各3回ずつ投げたところ、正解率が一番高かったのはChatGPT・Copilotの100.0%で同率だった 有効な試行は72回。 1回の検証の結果。日や課題が変われば順位は変わる。 AIごとのスコアを見る
SCORES
AIごとのスコア
並びは正解率の高い順です。分母は、その指標を測れた試行の数です。 「—」は測っていないという意味で、0%ではありません。
| AI | 正解率正解 ÷ 有効な試行 | 再現率3回で結論が一致 | 出典の実在率URLが開けた割合 | 指示の遵守率字数・形式を守った | 所要時間中央値/幅 |
|---|---|---|---|---|---|
| 1ChatGPT | 100% 18試行中18 | 100% 6課題中 | — | 100% | 20.4秒 14.1〜29.8秒 |
| 2Copilot | 100% 18試行中18 | 100% 6課題中 | — | 88.9% | 17.1秒 13.9〜23.4秒 |
| 3Claude | 83.3% 18試行中15 | 100% 6課題中 | — | 16.7% | 26.6秒 13.9〜44.8秒 |
| 4Gemini | 50% 18試行中9 | 83.3% 6課題中 | — | 91.7% | 36.1秒 23.7〜72.8秒 |
出典の実在率は、答えと一緒にURLを挙げてもらう課題があった回だけ測っています。 ChatGPT・Copilot・Claude・Geminiの「—」は、この回ではその課題を出していないという意味です。0%ではありません。
答えが返らなかった試行
Gemini … 断られた 6回
断られた・時間切れは分母に入れて不正解として数えています。上限・人間確認・AInformation側の操作の失敗は分母から外しています。
TASKS
課題ごとの結果
1つの課題を、4つのAIへ3回ずつ投げています。 ○が正解、×が不正解です。下の数字は、その試行にかかった秒数です。 課題の全文・先に決めた正解・なぜその判定になったかは、それぞれ開くと読めます。
次の売上データ(単位は千円)で、12か月・5商品を全部足した年間の合計はいくつですか。 決まり ・答えはちょうど1行… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある
-
ChatGPT
- ChatGPT 第1回 正解 20.7秒
- ChatGPT 第2回 正解 14.4秒
- ChatGPT 第3回 正解 20.4秒
3試行中3が正解
-
Copilot
- Copilot 第1回 正解 17.2秒
- Copilot 第2回 正解 14.2秒
- Copilot 第3回 正解 17秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 35.5秒
- Claude 第2回 正解 32.5秒
- Claude 第3回 正解 26.1秒
3試行中3が正解
-
Gemini
- Gemini 第1回 不正解 38.9秒
- Gemini 第2回 正解 23.7秒
- Gemini 第3回 不正解 39.1秒
3試行中1が正解
課題の全文この文をそのまま4つのAIへ送りました(713字)
次の売上データ(単位は千円)で、12か月・5商品を全部足した年間の合計はいくつですか。 決まり ・答えはちょうど1行。合計: ◯◯◯千円 の形で書く ・数は半角で書く。計算の途中式や説明は書かない ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----
先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました
(機械採点 exact_number)年間の合計=704400(誤差±0)
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中10が正解)
- ChatGPT 第1回 正解
- 数値すべて一致:年間の合計 ○(正解704400) (20.7秒) この回答の全文
- ChatGPT 第2回 正解
- 数値すべて一致:年間の合計 ○(正解704400) (14.4秒) この回答の全文
- ChatGPT 第3回 正解
- 数値すべて一致:年間の合計 ○(正解704400) (20.4秒) この回答の全文
- Copilot 第1回 正解
- 数値すべて一致:年間の合計 ○(正解704400) (17.2秒) この回答の全文
- Copilot 第2回 正解
- 数値すべて一致:年間の合計 ○(正解704400) (14.2秒) この回答の全文
- Copilot 第3回 正解
- 数値すべて一致:年間の合計 ○(正解704400) (17秒) この回答の全文
- Claude 第1回 正解
- 数値すべて一致:年間の合計 ○(正解704400) (35.5秒) この回答の全文
- Claude 第2回 正解
- 数値すべて一致:年間の合計 ○(正解704400) (32.5秒) この回答の全文
- Claude 第3回 正解
- 数値すべて一致:年間の合計 ○(正解704400) (26.1秒) この回答の全文
- Gemini 第1回 不正解
- 数値が違う:年間の合計 ×(正解704400・合計 の行が無い) (38.9秒) この回答の全文
- Gemini 第2回 正解
- 数値すべて一致:年間の合計 ○(正解704400) (23.7秒) この回答の全文
- Gemini 第3回 不正解
- 数値が違う:年間の合計 ×(正解704400・合計 の行が無い) (39.1秒) この回答の全文
次の売上データ(単位は千円)で、年間の合計が一番大きい商品はどれですか。 決まり ・答えはちょうど1行。商品名だけを… 採点の型:contains_all 必須の語句が全部入っているか
-
ChatGPT
- ChatGPT 第1回 正解 23.2秒
- ChatGPT 第2回 正解 23.5秒
- ChatGPT 第3回 正解 23.7秒
3試行中3が正解
-
Copilot
- Copilot 第1回 正解 20.2秒
- Copilot 第2回 正解 20.1秒
- Copilot 第3回 正解 20.4秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 23.3秒
- Claude 第2回 正解 26.2秒
- Claude 第3回 正解 27秒
3試行中3が正解
-
Gemini
- Gemini 第1回 不正解 断られた
- Gemini 第2回 正解 72.8秒
- Gemini 第3回 正解 36.4秒
3試行中2が正解
課題の全文この文をそのまま4つのAIへ送りました(690字)
次の売上データ(単位は千円)で、年間の合計が一番大きい商品はどれですか。 決まり ・答えはちょうど1行。商品名だけを書く ・理由と計算の説明は書かない ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----
先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました
(機械採点 contains_all)一番売れた商品=商品Eまたは商品E(保温ボトル)
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中11が正解)
- ChatGPT 第1回 正解
- 1項目すべてあり (23.2秒) この回答の全文
- ChatGPT 第2回 正解
- 1項目すべてあり (23.5秒) この回答の全文
- ChatGPT 第3回 正解
- 1項目すべてあり (23.7秒) この回答の全文
- Copilot 第1回 正解
- 1項目すべてあり (20.2秒) この回答の全文
- Copilot 第2回 正解
- 1項目すべてあり (20.1秒) この回答の全文
- Copilot 第3回 正解
- 1項目すべてあり (20.4秒) この回答の全文
- Claude 第1回 正解
- 1項目すべてあり (23.3秒) この回答の全文
- Claude 第2回 正解
- 1項目すべてあり (26.2秒) この回答の全文
- Claude 第3回 正解
- 1項目すべてあり (27秒) この回答の全文
- Gemini 第1回 不正解
- 断られた(ポリシー)。不正解として分母に入れる (36秒) この回答の全文
- Gemini 第2回 正解
- 1項目すべてあり (72.8秒) この回答の全文
- Gemini 第3回 正解
- 1項目すべてあり (36.4秒) この回答の全文
次の売上データ(単位は千円)で、12月の売上を1月の売上で割った値が一番大きい商品はどれですか。 決まり ・答えはち… 採点の型:contains_all 必須の語句が全部入っているか
-
ChatGPT
- ChatGPT 第1回 正解 17.2秒
- ChatGPT 第2回 正解 14.1秒
- ChatGPT 第3回 正解 17.3秒
3試行中3が正解
-
Copilot
- Copilot 第1回 正解 14秒
- Copilot 第2回 正解 14.3秒
- Copilot 第3回 正解 14.4秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 14.1秒
- Claude 第2回 正解 13.9秒
- Claude 第3回 正解 14.1秒
3試行中3が正解
-
Gemini
- Gemini 第1回 不正解 断られた
- Gemini 第2回 正解 35.8秒
- Gemini 第3回 正解 27秒
3試行中2が正解
課題の全文この文をそのまま4つのAIへ送りました(710字)
次の売上データ(単位は千円)で、12月の売上を1月の売上で割った値が一番大きい商品はどれですか。 決まり ・答えはちょうど1行。商品名だけを書く ・年間の合計ではなく、12月÷1月 で比べる ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----
先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました
(機械採点 contains_all)12月÷1月の伸びが一番大きい商品=商品Aまたは商品A(タンブラー)
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中11が正解)
- ChatGPT 第1回 正解
- 1項目すべてあり (17.2秒) この回答の全文
- ChatGPT 第2回 正解
- 1項目すべてあり (14.1秒) この回答の全文
- ChatGPT 第3回 正解
- 1項目すべてあり (17.3秒) この回答の全文
- Copilot 第1回 正解
- 1項目すべてあり (14秒) この回答の全文
- Copilot 第2回 正解
- 1項目すべてあり (14.3秒) この回答の全文
- Copilot 第3回 正解
- 1項目すべてあり (14.4秒) この回答の全文
- Claude 第1回 正解
- 1項目すべてあり (14.1秒) この回答の全文
- Claude 第2回 正解
- 1項目すべてあり (13.9秒) この回答の全文
- Claude 第3回 正解
- 1項目すべてあり (14.1秒) この回答の全文
- Gemini 第1回 不正解
- 断られた(ポリシー)。不正解として分母に入れる (35.9秒) この回答の全文
- Gemini 第2回 正解
- 1項目すべてあり (35.8秒) この回答の全文
- Gemini 第3回 正解
- 1項目すべてあり (27秒) この回答の全文
次の売上データ(単位は千円)を、四半期ごとの合計(5商品を足したもの)にしてください。 決まり ・答えはちょうど4行… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある
-
ChatGPT
- ChatGPT 第1回 正解 17.4秒
- ChatGPT 第2回 正解 17.4秒
- ChatGPT 第3回 正解 17.6秒
3試行中3が正解
-
Copilot
- Copilot 第1回 正解 17.3秒
- Copilot 第2回 正解 13.9秒
- Copilot 第3回 正解 14.1秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 29.3秒
- Claude 第2回 正解 26.3秒
- Claude 第3回 正解 20.2秒
3試行中3が正解
-
Gemini
- Gemini 第1回 正解 26.8秒
- Gemini 第2回 正解 23.8秒
- Gemini 第3回 正解 23.7秒
3試行中3が正解
課題の全文この文をそのまま4つのAIへ送りました(769字)
次の売上データ(単位は千円)を、四半期ごとの合計(5商品を足したもの)にしてください。 決まり ・答えはちょうど4行。Q1: ◯◯◯ / Q2: ◯◯◯ / Q3: ◯◯◯ / Q4: ◯◯◯ の順で書く ・Q1は1〜3月、Q2は4〜6月、Q3は7〜9月、Q4は10〜12月 ・数は半角で書く。説明は書かない ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----
先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました
(機械採点 exact_number)Q1=163500(誤差±0)/Q2=173500(誤差±0)/Q3=202900(誤差±0)/Q4=164500(誤差±0)
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中12が正解)
- ChatGPT 第1回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (17.4秒) この回答の全文
- ChatGPT 第2回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (17.4秒) この回答の全文
- ChatGPT 第3回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (17.6秒) この回答の全文
- Copilot 第1回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (17.3秒) この回答の全文
- Copilot 第2回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (13.9秒) この回答の全文
- Copilot 第3回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (14.1秒) この回答の全文
- Claude 第1回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (29.3秒) この回答の全文
- Claude 第2回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (26.3秒) この回答の全文
- Claude 第3回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (20.2秒) この回答の全文
- Gemini 第1回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (26.8秒) この回答の全文
- Gemini 第2回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (23.8秒) この回答の全文
- Gemini 第3回 正解
- 数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (23.7秒) この回答の全文
次の売上データ(単位は千円)で、下期(7〜12月)の合計が上期(1〜6月)の合計より大きい商品を全部挙げてください。… 採点の型:set_match 決められた項目をいくつ抜けたか。漏れと作り足しの両方を数える
-
ChatGPT
- ChatGPT 第1回 正解 23.8秒
- ChatGPT 第2回 正解 20.4秒
- ChatGPT 第3回 正解 20.5秒
3試行中3が正解
-
Copilot
- Copilot 第1回 正解 14秒
- Copilot 第2回 正解 14秒
- Copilot 第3回 正解 18秒
3試行中3が正解
-
Claude
- Claude 第1回 不正解 26.3秒
- Claude 第2回 不正解 29.3秒
- Claude 第3回 不正解 29.4秒
3試行中0が正解
-
Gemini
- Gemini 第1回 不正解 断られた
- Gemini 第2回 不正解 45.2秒
- Gemini 第3回 不正解 断られた
3試行中0が正解
課題の全文この文をそのまま4つのAIへ送りました(743字)
次の売上データ(単位は千円)で、下期(7〜12月)の合計が上期(1〜6月)の合計より大きい商品を全部挙げてください。 決まり ・1商品につき1行。行の先頭は ・ にする。商品名だけを書く ・当てはまらない商品は書かない ・同じ場合(まったく同額)は書かない ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----
先に決めた正解課題を作った時点で決めています。4つのAI中2つが1回でも正解しました
(機械採点 set_match)商品A[商品A]/商品C[商品C] 作り足しは0件まで
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中6が正解)
- ChatGPT 第1回 正解
- 2件すべて一致・作り足し0件 (23.8秒) この回答の全文
- ChatGPT 第2回 正解
- 2件すべて一致・作り足し0件 (20.4秒) この回答の全文
- ChatGPT 第3回 正解
- 2件すべて一致・作り足し0件 (20.5秒) この回答の全文
- Copilot 第1回 正解
- 2件すべて一致・作り足し0件 (14秒) この回答の全文
- Copilot 第2回 正解
- 2件すべて一致・作り足し0件 (14秒) この回答の全文
- Copilot 第3回 正解
- 2件すべて一致・作り足し0件 (18秒) この回答の全文
- Claude 第1回 不正解
- 2件中2件一致・作り足し1件 (26.3秒) この回答の全文
- Claude 第2回 不正解
- 2件中2件一致・作り足し1件 (29.3秒) この回答の全文
- Claude 第3回 不正解
- 2件中2件一致・作り足し1件 (29.4秒) この回答の全文
- Gemini 第1回 不正解
- 断られた(ポリシー)。不正解として分母に入れる (29.9秒) この回答の全文
- Gemini 第2回 不正解
- 2件中0件一致・漏れ 商品A/商品C・作り足し1件 (45.2秒) この回答の全文
- Gemini 第3回 不正解
- 断られた(ポリシー)。不正解として分母に入れる (24.7秒) この回答の全文
次の売上データ(単位は千円)を集計し、JSON だけを出力してください。 決まり ・出力は JSON だけ。前後に説… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある
-
ChatGPT
- ChatGPT 第1回 正解 23.6秒
- ChatGPT 第2回 正解 23.5秒
- ChatGPT 第3回 正解 29.8秒
3試行中3が正解
-
Copilot
- Copilot 第1回 正解 23.2秒
- Copilot 第2回 正解 20.1秒
- Copilot 第3回 正解 23.4秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 44.8秒
- Claude 第2回 正解 44.6秒
- Claude 第3回 正解 38.8秒
3試行中3が正解
-
Gemini
- Gemini 第1回 不正解 断られた
- Gemini 第2回 正解 48.6秒
- Gemini 第3回 不正解 断られた
3試行中1が正解
課題の全文この文をそのまま4つのAIへ送りました(830字)
次の売上データ(単位は千円)を集計し、JSON だけを出力してください。 決まり ・出力は JSON だけ。前後に説明文を書かない ・形は {"total": 年間の合計, "top_product": "年間の合計が一番大きい商品名", "best_month": "合計が一番大きい月(YYYY-MM)", "best_month_total": その月の合計} にする ・数は数値で入れる(文字列にしない・カンマを入れない) ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----
先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました
(機械採点 exact_number)年間の合計=704400(誤差±0)/一番大きい月の合計=73000(誤差±0)
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中10が正解)
- ChatGPT 第1回 正解
- 数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (23.6秒) この回答の全文
- ChatGPT 第2回 正解
- 数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (23.5秒) この回答の全文
- ChatGPT 第3回 正解
- 数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (29.8秒) この回答の全文
- Copilot 第1回 正解
- 数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (23.2秒) この回答の全文
- Copilot 第2回 正解
- 数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (20.1秒) この回答の全文
- Copilot 第3回 正解
- 数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (23.4秒) この回答の全文
- Claude 第1回 正解
- 数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (44.8秒) この回答の全文
- Claude 第2回 正解
- 数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (44.6秒) この回答の全文
- Claude 第3回 正解
- 数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (38.8秒) この回答の全文
- Gemini 第1回 不正解
- 断られた(ポリシー)。不正解として分母に入れる (35.9秒) この回答の全文
- Gemini 第2回 正解
- 数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (48.6秒) この回答の全文
- Gemini 第3回 不正解
- 断られた(ポリシー)。不正解として分母に入れる (23.6秒) この回答の全文
ANSWERS
4つのAIの回答の全文
採点のもとになった回答を、手を入れずにそのまま置いています。 読んだ人が同じように数え直せるようにするためです。
-
ChatGPT
18件の回答うち18件が正解
- t1 第1回
- 全文(テキスト) 正解
- t1 第2回
- 全文(テキスト) 正解
- t1 第3回
- 全文(テキスト) 正解
- t2 第1回
- 全文(テキスト) 正解
- t2 第2回
- 全文(テキスト) 正解
- t2 第3回
- 全文(テキスト) 正解
- t3 第1回
- 全文(テキスト) 正解
- t3 第2回
- 全文(テキスト) 正解
- t3 第3回
- 全文(テキスト) 正解
- t4 第1回
- 全文(テキスト) 正解
- t4 第2回
- 全文(テキスト) 正解
- t4 第3回
- 全文(テキスト) 正解
- t5 第1回
- 全文(テキスト) 正解
- t5 第2回
- 全文(テキスト) 正解
- t5 第3回
- 全文(テキスト) 正解
- t6 第1回
- 全文(テキスト) 正解
- t6 第2回
- 全文(テキスト) 正解
- t6 第3回
- 全文(テキスト) 正解
-
Copilot
18件の回答うち18件が正解
- t1 第1回
- 全文(テキスト) 正解
- t1 第2回
- 全文(テキスト) 正解
- t1 第3回
- 全文(テキスト) 正解
- t2 第1回
- 全文(テキスト) 正解
- t2 第2回
- 全文(テキスト) 正解
- t2 第3回
- 全文(テキスト) 正解
- t3 第1回
- 全文(テキスト) 正解
- t3 第2回
- 全文(テキスト) 正解
- t3 第3回
- 全文(テキスト) 正解
- t4 第1回
- 全文(テキスト) 正解
- t4 第2回
- 全文(テキスト) 正解
- t4 第3回
- 全文(テキスト) 正解
- t5 第1回
- 全文(テキスト) 正解
- t5 第2回
- 全文(テキスト) 正解
- t5 第3回
- 全文(テキスト) 正解
- t6 第1回
- 全文(テキスト) 正解
- t6 第2回
- 全文(テキスト) 正解
- t6 第3回
- 全文(テキスト) 正解
-
Claude
18件の回答うち15件が正解
- t1 第1回
- 全文(テキスト) 正解
- t1 第2回
- 全文(テキスト) 正解
- t1 第3回
- 全文(テキスト) 正解
- t2 第1回
- 全文(テキスト) 正解
- t2 第2回
- 全文(テキスト) 正解
- t2 第3回
- 全文(テキスト) 正解
- t3 第1回
- 全文(テキスト) 正解
- t3 第2回
- 全文(テキスト) 正解
- t3 第3回
- 全文(テキスト) 正解
- t4 第1回
- 全文(テキスト) 正解
- t4 第2回
- 全文(テキスト) 正解
- t4 第3回
- 全文(テキスト) 正解
- t5 第1回
- 全文(テキスト) 不正解
- t5 第2回
- 全文(テキスト) 不正解
- t5 第3回
- 全文(テキスト) 不正解
- t6 第1回
- 全文(テキスト) 正解
- t6 第2回
- 全文(テキスト) 正解
- t6 第3回
- 全文(テキスト) 正解
-
Gemini
18件の回答うち9件が正解
- t1 第1回
- 全文(テキスト) 不正解
- t1 第2回
- 全文(テキスト) 正解
- t1 第3回
- 全文(テキスト) 不正解
- t2 第1回
- 全文(テキスト) 不正解
- t2 第2回
- 全文(テキスト) 正解
- t2 第3回
- 全文(テキスト) 正解
- t3 第1回
- 全文(テキスト) 不正解
- t3 第2回
- 全文(テキスト) 正解
- t3 第3回
- 全文(テキスト) 正解
- t4 第1回
- 全文(テキスト) 正解
- t4 第2回
- 全文(テキスト) 正解
- t4 第3回
- 全文(テキスト) 正解
- t5 第1回
- 全文(テキスト) 不正解
- t5 第2回
- 全文(テキスト) 不正解
- t5 第3回
- 全文(テキスト) 不正解
- t6 第1回
- 全文(テキスト) 不正解
- t6 第2回
- 全文(テキスト) 正解
- t6 第3回
- 全文(テキスト) 不正解
MATERIALS
課題に使った材料
架空の株式会社サンプル商事の12か月×商品5つの売上(千円)。数は式で決めているので答えが計算で決まる この回のために2026年10月1日に作り直したものです。 落として、同じことをやり直せます。
- uriage.csv 676B
- uriage.xlsx 5KB
METHOD
測り方
やり直せるように、この回の条件をそのまま書いています。
測ったAIと、そのときのモデル名
AIは中身が黙って変わります。画面に出ていたモデル名と、確認した時刻を残しています。
| AI | プラン | 画面に出ていたモデル名 | 確認した時刻 |
|---|---|---|---|
| ChatGPT | ChatGPT Pro | Medium | 2026-10-01 19:59 |
| Gemini | Google AI Pro | Flash | 2026-10-01 19:59 |
| Claude | Claude Max | Opus 4.8 高 | 2026-10-01 19:59 |
| Copilot | Microsoft 365 Personal | 2026-10-01 19:59 |
この回でやったこと
- 課題に使う材料を、この回のために作り直しました。架空の会社のデータで、実在の企業・人物は含みません。
- 課題を6問つくり、正解をこの時点で決めました。
- ChatGPT・Gemini・Claude・Copilotへ、同じ課題文と同じ材料を送りました。
- 1問につき3回、毎回あたらしい会話で投げました。
- 投げる順番は回ごとに入れ替えました。時間帯のかたよりが順位に出ないようにするためです。
- 待ち時間は300秒までとし、 過ぎたものは時間切れとして記録しました。
- 採点は機械採点のみ(AIに採点させていない)です。
- 送信した試行はのべ72回、 そのうち有効だったのは72回です。
答えが返らなかったときの数え方
- 断られた・時間切れ
分母に入れて、不正解として数えます。仕事では答えが返らないのと同じためです。
- プランの上限に当たった
分母から外します。その試行は測れなかったものとして扱います。
- 人間確認の画面が出た
そこで止めます。機械で押すことも、避けることもしません。
- AInformation側の操作の失敗
分母から外します。AIの欠点としては書きません。
LIMITS
この測定の限界
数字だけを見て判断されないように、測れていないことを書いています。
- 1日1回の測定である。日や課題が変われば順位は変わる
- プランは各AIの有料版(ChatGPT Pro/Google AI Pro/Claude Max/Microsoft 365 Personal)。無料版の結果ではない
- 既定のモデル・既定のモードだけで測っている(Deep Research などは使っていない)
- 課題は架空の株式会社サンプル商事の自作データ。実在の企業のデータでの結果ではない
- 機械で採点できる課題だけを扱っている。文章のうまさ・読みやすさは測っていない
- ブラウザで人が使うのと同じ画面から測っている。APIの結果ではない
- 画面に出ているモデル名を読み取れないAIがある回は、その欄を空(null)にしている。読み取れた回はそのまま載せている
DATA
公開しているデータ
CSVは1行が1試行です。このページに出している数字は、そのCSVを数え直したものと一致します。 ライセンスは CC BY 4.0 です。
- 最新版(CSV) 1行=1試行 11KB
- 最新版(JSON) 40KB
- v1(公開時の版)(CSV) 1行=1試行 11KB
- v1(公開時の版)(JSON) 40KB
累積の順位表は /data/research/bench/leaderboard.json にあります。 版(v1)は消しません。引用したリンクが切れないようにするためです。
FAQ
よくある質問
- どうやって測っているのですか
- 4つのAIに、まったく同じ課題文と同じ材料を、同じ日のうちに投げています。毎回あたらしい会話を開いて、前の回答を引きずらせません。投げる順番は回ごとに入れ替えています。送信してから回答が止まるまでの秒数もあわせて記録しています。
- なぜ同じ課題を3回も投げるのですか
- AIは同じ質問でも答えが変わるためです。1回だけの結果では、それが実力なのか偶然なのかが分かりません。3回投げて、結論が一致した割合を再現率として出しています。
- 採点は誰がしているのですか
- プログラムだけで採点しています。AIには採点させていません。正解は課題を作る時点で決めてあり、数値の一致・語句の有無・形式の適合・URLが実際に開けるか・数式を実行した結果で決まります。好き嫌いは点にしていません。
- 課題に使っているデータは実在の会社のものですか
- いいえ。架空の会社のデータを毎回あたらしく作っています。実在の企業・人物・他社の文章は使っていません。使った材料はそのまま配っているので、同じことをやり直せます。
- AIが答えられなかったときはどう数えていますか
- 断られた・時間切れは分母に入れて不正解として数えます。プランの上限に当たった・人間確認の画面が出たときは分母から外し、その回は測れなかったものとして扱います。AInformation側の操作の失敗も分母から外し、AIの欠点としては書きません。
- 使っているのは無料版ですか、有料版ですか
- 各AIの有料プランを、ブラウザの画面から使っています。APIではありません。プラン名と、画面に出ていたモデル名・確認した時刻を回ごとに記録しています。
- この順位は、どのAIがいちばん賢いかを表していますか
- いいえ。測っているのは決まった仕事の課題での正解率・所要時間・再現率・出典の実在率・指示の遵守率の5つだけです。書き味や読みやすさ、長い会話でのふるまいは測っていません。課題が変われば順位も変わります。
- 引用してもいいですか
- はい。CC BY 4.0 です。出典として「AInformation調べ AI実務ベンチ」と、使ったページのURL・測定日を書いてください。集計はJSONとCSVでも取れます。1行1試行のCSVを見れば、載せている数字を数え直せます。
CITATION
この測定を引用する
出典:AInformation調べ「AI実務ベンチ 売上表から合計と伸び率を出す(4AI・6課題・各3回)」(https://ainformation.jp/research/bench/hyokeisan-2026-10-02) 測定日 2026年10月2日 6課題・各3回・有効な試行72回
コピーしました
数字を引くときは、分母(何試行中いくつか)も一緒に書いてください。 出典として AInformation調べ と、使ったページのURL・測定日を書いてください。
関連するページ
AIの最新ニュースを週1回まとめてお届け
その週に出た主要なAIニュースと、編集部が実際に試したツールを1通にまとめます。