本文へ移動
NEWS
AInformation 実測

売上表から合計と伸び率を出す(4AI・6課題・各3回)

表計算・集計の課題を6問つくり、ChatGPT・Copilot・Claude・Gemini へ各3回ずつ投げました。採点はプログラムだけで行い、AIには採点させていません。

AIごとのスコアを見る →
100% この回でいちばん高い正解率
ChatGPT・Copilot 各18試行中18
2026年10月2日 測定
  • 6問課題
  • 3回1問あたりの試行
  • 4つ測ったAI
  • 72回有効な試行
  • v1公開版

1回の検証の結果。日や課題が変われば順位は変わる

分野:表計算・集計 測定日:2026年10月2日 実施:AInformation編集部 費用:AInformation(自社負担) 依頼主:なし(依頼主はいません) 採点:機械採点のみ(AIに採点させていない)

当たるものがありませんでした。検索の言葉を消すと全部戻ります。

RESULT

この回で分かったこと

下の1行は、採点の結果からそのまま作ったものです。ページ側で足した言葉はありません。

  • 表計算・集計 6課題・各3回 6課題を各3回ずつ投げたところ、正解率が一番高かったのはChatGPT・Copilotの100.0%で同率だった 有効な試行は72回。 1回の検証の結果。日や課題が変われば順位は変わる。 AIごとのスコアを見る

SCORES

AIごとのスコア

並びは正解率の高い順です。分母は、その指標を測れた試行の数です。 「—」は測っていないという意味で、0%ではありません。

売上表から合計と伸び率を出す(4AI・6課題・各3回) AIごとのスコア
AI 正解率正解 ÷ 有効な試行 再現率3回で結論が一致 出典の実在率URLが開けた割合 指示の遵守率字数・形式を守った 所要時間中央値/幅
1ChatGPT 100% 18試行中18 100% 6課題中 — 100% 20.4秒 14.1〜29.8秒
2Copilot 100% 18試行中18 100% 6課題中 — 88.9% 17.1秒 13.9〜23.4秒
3Claude 83.3% 18試行中15 100% 6課題中 — 16.7% 26.6秒 13.9〜44.8秒
4Gemini 50% 18試行中9 83.3% 6課題中 — 91.7% 36.1秒 23.7〜72.8秒

出典の実在率は、答えと一緒にURLを挙げてもらう課題があった回だけ測っています。 ChatGPT・Copilot・Claude・Geminiの「—」は、この回ではその課題を出していないという意味です。0%ではありません。

答えが返らなかった試行
Gemini … 断られた 6回
断られた・時間切れは分母に入れて不正解として数えています。上限・人間確認・AInformation側の操作の失敗は分母から外しています。

TASKS

課題ごとの結果

1つの課題を、4つのAIへ3回ずつ投げています。 ○が正解、×が不正解です。下の数字は、その試行にかかった秒数です。 課題の全文・先に決めた正解・なぜその判定になったかは、それぞれ開くと読めます。

易

次の売上データ(単位は千円)で、12か月・5商品を全部足した年間の合計はいくつですか。 決まり ・答えはちょうど1行… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある

  • ChatGPT
    • ChatGPT 第1回 正解 20.7秒
    • ChatGPT 第2回 正解 14.4秒
    • ChatGPT 第3回 正解 20.4秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 正解 17.2秒
    • Copilot 第2回 正解 14.2秒
    • Copilot 第3回 正解 17秒

    3試行中3が正解

  • Claude
    • Claude 第1回 正解 35.5秒
    • Claude 第2回 正解 32.5秒
    • Claude 第3回 正解 26.1秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 不正解 38.9秒
    • Gemini 第2回 正解 23.7秒
    • Gemini 第3回 不正解 39.1秒

    3試行中1が正解

課題の全文この文をそのまま4つのAIへ送りました(713字)

次の売上データ(単位は千円)で、12か月・5商品を全部足した年間の合計はいくつですか。 決まり ・答えはちょうど1行。合計: ◯◯◯千円 の形で書く ・数は半角で書く。計算の途中式や説明は書かない ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----

先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました

(機械採点 exact_number)年間の合計=704400(誤差±0)

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中10が正解)
ChatGPT 第1回 正解
数値すべて一致:年間の合計 ○(正解704400) (20.7秒) この回答の全文
ChatGPT 第2回 正解
数値すべて一致:年間の合計 ○(正解704400) (14.4秒) この回答の全文
ChatGPT 第3回 正解
数値すべて一致:年間の合計 ○(正解704400) (20.4秒) この回答の全文
Copilot 第1回 正解
数値すべて一致:年間の合計 ○(正解704400) (17.2秒) この回答の全文
Copilot 第2回 正解
数値すべて一致:年間の合計 ○(正解704400) (14.2秒) この回答の全文
Copilot 第3回 正解
数値すべて一致:年間の合計 ○(正解704400) (17秒) この回答の全文
Claude 第1回 正解
数値すべて一致:年間の合計 ○(正解704400) (35.5秒) この回答の全文
Claude 第2回 正解
数値すべて一致:年間の合計 ○(正解704400) (32.5秒) この回答の全文
Claude 第3回 正解
数値すべて一致:年間の合計 ○(正解704400) (26.1秒) この回答の全文
Gemini 第1回 不正解
数値が違う:年間の合計 ×(正解704400・合計 の行が無い) (38.9秒) この回答の全文
Gemini 第2回 正解
数値すべて一致:年間の合計 ○(正解704400) (23.7秒) この回答の全文
Gemini 第3回 不正解
数値が違う:年間の合計 ×(正解704400・合計 の行が無い) (39.1秒) この回答の全文
易

次の売上データ(単位は千円)で、年間の合計が一番大きい商品はどれですか。 決まり ・答えはちょうど1行。商品名だけを… 採点の型:contains_all 必須の語句が全部入っているか

  • ChatGPT
    • ChatGPT 第1回 正解 23.2秒
    • ChatGPT 第2回 正解 23.5秒
    • ChatGPT 第3回 正解 23.7秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 正解 20.2秒
    • Copilot 第2回 正解 20.1秒
    • Copilot 第3回 正解 20.4秒

    3試行中3が正解

  • Claude
    • Claude 第1回 正解 23.3秒
    • Claude 第2回 正解 26.2秒
    • Claude 第3回 正解 27秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 不正解 断られた
    • Gemini 第2回 正解 72.8秒
    • Gemini 第3回 正解 36.4秒

    3試行中2が正解

課題の全文この文をそのまま4つのAIへ送りました(690字)

次の売上データ(単位は千円)で、年間の合計が一番大きい商品はどれですか。 決まり ・答えはちょうど1行。商品名だけを書く ・理由と計算の説明は書かない ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----

先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました

(機械採点 contains_all)一番売れた商品=商品Eまたは商品E(保温ボトル)

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中11が正解)
ChatGPT 第1回 正解
1項目すべてあり (23.2秒) この回答の全文
ChatGPT 第2回 正解
1項目すべてあり (23.5秒) この回答の全文
ChatGPT 第3回 正解
1項目すべてあり (23.7秒) この回答の全文
Copilot 第1回 正解
1項目すべてあり (20.2秒) この回答の全文
Copilot 第2回 正解
1項目すべてあり (20.1秒) この回答の全文
Copilot 第3回 正解
1項目すべてあり (20.4秒) この回答の全文
Claude 第1回 正解
1項目すべてあり (23.3秒) この回答の全文
Claude 第2回 正解
1項目すべてあり (26.2秒) この回答の全文
Claude 第3回 正解
1項目すべてあり (27秒) この回答の全文
Gemini 第1回 不正解
断られた(ポリシー)。不正解として分母に入れる (36秒) この回答の全文
Gemini 第2回 正解
1項目すべてあり (72.8秒) この回答の全文
Gemini 第3回 正解
1項目すべてあり (36.4秒) この回答の全文
中

次の売上データ(単位は千円)で、12月の売上を1月の売上で割った値が一番大きい商品はどれですか。 決まり ・答えはち… 採点の型:contains_all 必須の語句が全部入っているか

  • ChatGPT
    • ChatGPT 第1回 正解 17.2秒
    • ChatGPT 第2回 正解 14.1秒
    • ChatGPT 第3回 正解 17.3秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 正解 14秒
    • Copilot 第2回 正解 14.3秒
    • Copilot 第3回 正解 14.4秒

    3試行中3が正解

  • Claude
    • Claude 第1回 正解 14.1秒
    • Claude 第2回 正解 13.9秒
    • Claude 第3回 正解 14.1秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 不正解 断られた
    • Gemini 第2回 正解 35.8秒
    • Gemini 第3回 正解 27秒

    3試行中2が正解

課題の全文この文をそのまま4つのAIへ送りました(710字)

次の売上データ(単位は千円)で、12月の売上を1月の売上で割った値が一番大きい商品はどれですか。 決まり ・答えはちょうど1行。商品名だけを書く ・年間の合計ではなく、12月÷1月 で比べる ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----

先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました

(機械採点 contains_all)12月÷1月の伸びが一番大きい商品=商品Aまたは商品A(タンブラー)

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中11が正解)
ChatGPT 第1回 正解
1項目すべてあり (17.2秒) この回答の全文
ChatGPT 第2回 正解
1項目すべてあり (14.1秒) この回答の全文
ChatGPT 第3回 正解
1項目すべてあり (17.3秒) この回答の全文
Copilot 第1回 正解
1項目すべてあり (14秒) この回答の全文
Copilot 第2回 正解
1項目すべてあり (14.3秒) この回答の全文
Copilot 第3回 正解
1項目すべてあり (14.4秒) この回答の全文
Claude 第1回 正解
1項目すべてあり (14.1秒) この回答の全文
Claude 第2回 正解
1項目すべてあり (13.9秒) この回答の全文
Claude 第3回 正解
1項目すべてあり (14.1秒) この回答の全文
Gemini 第1回 不正解
断られた(ポリシー)。不正解として分母に入れる (35.9秒) この回答の全文
Gemini 第2回 正解
1項目すべてあり (35.8秒) この回答の全文
Gemini 第3回 正解
1項目すべてあり (27秒) この回答の全文
中

次の売上データ(単位は千円)を、四半期ごとの合計(5商品を足したもの)にしてください。 決まり ・答えはちょうど4行… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある

  • ChatGPT
    • ChatGPT 第1回 正解 17.4秒
    • ChatGPT 第2回 正解 17.4秒
    • ChatGPT 第3回 正解 17.6秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 正解 17.3秒
    • Copilot 第2回 正解 13.9秒
    • Copilot 第3回 正解 14.1秒

    3試行中3が正解

  • Claude
    • Claude 第1回 正解 29.3秒
    • Claude 第2回 正解 26.3秒
    • Claude 第3回 正解 20.2秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 正解 26.8秒
    • Gemini 第2回 正解 23.8秒
    • Gemini 第3回 正解 23.7秒

    3試行中3が正解

課題の全文この文をそのまま4つのAIへ送りました(769字)

次の売上データ(単位は千円)を、四半期ごとの合計(5商品を足したもの)にしてください。 決まり ・答えはちょうど4行。Q1: ◯◯◯ / Q2: ◯◯◯ / Q3: ◯◯◯ / Q4: ◯◯◯ の順で書く ・Q1は1〜3月、Q2は4〜6月、Q3は7〜9月、Q4は10〜12月 ・数は半角で書く。説明は書かない ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----

先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました

(機械採点 exact_number)Q1=163500(誤差±0)/Q2=173500(誤差±0)/Q3=202900(誤差±0)/Q4=164500(誤差±0)

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中12が正解)
ChatGPT 第1回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (17.4秒) この回答の全文
ChatGPT 第2回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (17.4秒) この回答の全文
ChatGPT 第3回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (17.6秒) この回答の全文
Copilot 第1回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (17.3秒) この回答の全文
Copilot 第2回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (13.9秒) この回答の全文
Copilot 第3回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (14.1秒) この回答の全文
Claude 第1回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (29.3秒) この回答の全文
Claude 第2回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (26.3秒) この回答の全文
Claude 第3回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (20.2秒) この回答の全文
Gemini 第1回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (26.8秒) この回答の全文
Gemini 第2回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (23.8秒) この回答の全文
Gemini 第3回 正解
数値すべて一致:Q1 ○(正解163500)/Q2 ○(正解173500)/Q3 ○(正解202900)/Q4 ○(正解164500) (23.7秒) この回答の全文
難

次の売上データ(単位は千円)で、下期(7〜12月)の合計が上期(1〜6月)の合計より大きい商品を全部挙げてください。… 採点の型:set_match 決められた項目をいくつ抜けたか。漏れと作り足しの両方を数える

  • ChatGPT
    • ChatGPT 第1回 正解 23.8秒
    • ChatGPT 第2回 正解 20.4秒
    • ChatGPT 第3回 正解 20.5秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 正解 14秒
    • Copilot 第2回 正解 14秒
    • Copilot 第3回 正解 18秒

    3試行中3が正解

  • Claude
    • Claude 第1回 不正解 26.3秒
    • Claude 第2回 不正解 29.3秒
    • Claude 第3回 不正解 29.4秒

    3試行中0が正解

  • Gemini
    • Gemini 第1回 不正解 断られた
    • Gemini 第2回 不正解 45.2秒
    • Gemini 第3回 不正解 断られた

    3試行中0が正解

課題の全文この文をそのまま4つのAIへ送りました(743字)

次の売上データ(単位は千円)で、下期(7〜12月)の合計が上期(1〜6月)の合計より大きい商品を全部挙げてください。 決まり ・1商品につき1行。行の先頭は ・ にする。商品名だけを書く ・当てはまらない商品は書かない ・同じ場合(まったく同額)は書かない ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----

先に決めた正解課題を作った時点で決めています。4つのAI中2つが1回でも正解しました

(機械採点 set_match)商品A[商品A]/商品C[商品C] 作り足しは0件まで

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中6が正解)
ChatGPT 第1回 正解
2件すべて一致・作り足し0件 (23.8秒) この回答の全文
ChatGPT 第2回 正解
2件すべて一致・作り足し0件 (20.4秒) この回答の全文
ChatGPT 第3回 正解
2件すべて一致・作り足し0件 (20.5秒) この回答の全文
Copilot 第1回 正解
2件すべて一致・作り足し0件 (14秒) この回答の全文
Copilot 第2回 正解
2件すべて一致・作り足し0件 (14秒) この回答の全文
Copilot 第3回 正解
2件すべて一致・作り足し0件 (18秒) この回答の全文
Claude 第1回 不正解
2件中2件一致・作り足し1件 (26.3秒) この回答の全文
Claude 第2回 不正解
2件中2件一致・作り足し1件 (29.3秒) この回答の全文
Claude 第3回 不正解
2件中2件一致・作り足し1件 (29.4秒) この回答の全文
Gemini 第1回 不正解
断られた(ポリシー)。不正解として分母に入れる (29.9秒) この回答の全文
Gemini 第2回 不正解
2件中0件一致・漏れ 商品A/商品C・作り足し1件 (45.2秒) この回答の全文
Gemini 第3回 不正解
断られた(ポリシー)。不正解として分母に入れる (24.7秒) この回答の全文
難

次の売上データ(単位は千円)を集計し、JSON だけを出力してください。 決まり ・出力は JSON だけ。前後に説… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある

  • ChatGPT
    • ChatGPT 第1回 正解 23.6秒
    • ChatGPT 第2回 正解 23.5秒
    • ChatGPT 第3回 正解 29.8秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 正解 23.2秒
    • Copilot 第2回 正解 20.1秒
    • Copilot 第3回 正解 23.4秒

    3試行中3が正解

  • Claude
    • Claude 第1回 正解 44.8秒
    • Claude 第2回 正解 44.6秒
    • Claude 第3回 正解 38.8秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 不正解 断られた
    • Gemini 第2回 正解 48.6秒
    • Gemini 第3回 不正解 断られた

    3試行中1が正解

課題の全文この文をそのまま4つのAIへ送りました(830字)

次の売上データ(単位は千円)を集計し、JSON だけを出力してください。 決まり ・出力は JSON だけ。前後に説明文を書かない ・形は {"total": 年間の合計, "top_product": "年間の合計が一番大きい商品名", "best_month": "合計が一番大きい月(YYYY-MM)", "best_month_total": その月の合計} にする ・数は数値で入れる(文字列にしない・カンマを入れない) ---- 売上データ ここから ---- 月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計 2025-01,9900,14000,4800,12600,13700,55000 2025-02,10000,13900,4800,11800,13700,54200 2025-03,10200,12300,7200,9500,15100,54300 2025-04,10400,11300,10800,7100,13700,53300 2025-05,10600,10800,15600,5500,13700,56200 2025-06,10700,14000,21600,4000,13700,64000 2025-07,10900,13000,28800,3200,13700,69600 2025-08,11100,13800,31200,3200,13700,73000 2025-09,11300,10200,20400,4700,13700,60300 2025-10,11400,11000,9600,7900,13700,53600 2025-11,11600,11800,6000,11100,13700,54200 2025-12,11800,11600,4800,13400,15100,56700 ---- 売上データ ここまで ----

先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました

(機械採点 exact_number)年間の合計=704400(誤差±0)/一番大きい月の合計=73000(誤差±0)

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中10が正解)
ChatGPT 第1回 正解
数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (23.6秒) この回答の全文
ChatGPT 第2回 正解
数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (23.5秒) この回答の全文
ChatGPT 第3回 正解
数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (29.8秒) この回答の全文
Copilot 第1回 正解
数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (23.2秒) この回答の全文
Copilot 第2回 正解
数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (20.1秒) この回答の全文
Copilot 第3回 正解
数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (23.4秒) この回答の全文
Claude 第1回 正解
数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (44.8秒) この回答の全文
Claude 第2回 正解
数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (44.6秒) この回答の全文
Claude 第3回 正解
数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (38.8秒) この回答の全文
Gemini 第1回 不正解
断られた(ポリシー)。不正解として分母に入れる (35.9秒) この回答の全文
Gemini 第2回 正解
数値すべて一致:年間の合計 ○(正解704400)/一番大きい月の合計 ○(正解73000) (48.6秒) この回答の全文
Gemini 第3回 不正解
断られた(ポリシー)。不正解として分母に入れる (23.6秒) この回答の全文

ANSWERS

4つのAIの回答の全文

採点のもとになった回答を、手を入れずにそのまま置いています。 読んだ人が同じように数え直せるようにするためです。

MATERIALS

課題に使った材料

架空の株式会社サンプル商事の12か月×商品5つの売上(千円)。数は式で決めているので答えが計算で決まる この回のために2026年10月1日に作り直したものです。 落として、同じことをやり直せます。

METHOD

測り方

やり直せるように、この回の条件をそのまま書いています。

測ったAIと、そのときのモデル名

AIは中身が黙って変わります。画面に出ていたモデル名と、確認した時刻を残しています。

測ったAIとモデル名
AIプラン 画面に出ていたモデル名確認した時刻
ChatGPT ChatGPT Pro Medium 2026-10-01 19:59
Gemini Google AI Pro Flash 2026-10-01 19:59
Claude Claude Max Opus 4.8 高 2026-10-01 19:59
Copilot Microsoft 365 Personal 2026-10-01 19:59

この回でやったこと

  1. 課題に使う材料を、この回のために作り直しました。架空の会社のデータで、実在の企業・人物は含みません。
  2. 課題を6問つくり、正解をこの時点で決めました。
  3. ChatGPT・Gemini・Claude・Copilotへ、同じ課題文と同じ材料を送りました。
  4. 1問につき3回、毎回あたらしい会話で投げました。
  5. 投げる順番は回ごとに入れ替えました。時間帯のかたよりが順位に出ないようにするためです。
  6. 待ち時間は300秒までとし、 過ぎたものは時間切れとして記録しました。
  7. 採点は機械採点のみ(AIに採点させていない)です。
  8. 送信した試行はのべ72回、 そのうち有効だったのは72回です。

答えが返らなかったときの数え方

  • 断られた・時間切れ

    分母に入れて、不正解として数えます。仕事では答えが返らないのと同じためです。

  • プランの上限に当たった

    分母から外します。その試行は測れなかったものとして扱います。

  • 人間確認の画面が出た

    そこで止めます。機械で押すことも、避けることもしません。

  • AInformation側の操作の失敗

    分母から外します。AIの欠点としては書きません。

LIMITS

この測定の限界

数字だけを見て判断されないように、測れていないことを書いています。

  • 1日1回の測定である。日や課題が変われば順位は変わる
  • プランは各AIの有料版(ChatGPT Pro/Google AI Pro/Claude Max/Microsoft 365 Personal)。無料版の結果ではない
  • 既定のモデル・既定のモードだけで測っている(Deep Research などは使っていない)
  • 課題は架空の株式会社サンプル商事の自作データ。実在の企業のデータでの結果ではない
  • 機械で採点できる課題だけを扱っている。文章のうまさ・読みやすさは測っていない
  • ブラウザで人が使うのと同じ画面から測っている。APIの結果ではない
  • 画面に出ているモデル名を読み取れないAIがある回は、その欄を空(null)にしている。読み取れた回はそのまま載せている

DATA

公開しているデータ

CSVは1行が1試行です。このページに出している数字は、そのCSVを数え直したものと一致します。 ライセンスは CC BY 4.0 です。

累積の順位表は /data/research/bench/leaderboard.json にあります。 版(v1)は消しません。引用したリンクが切れないようにするためです。

FAQ

よくある質問

どうやって測っているのですか
4つのAIに、まったく同じ課題文と同じ材料を、同じ日のうちに投げています。毎回あたらしい会話を開いて、前の回答を引きずらせません。投げる順番は回ごとに入れ替えています。送信してから回答が止まるまでの秒数もあわせて記録しています。
なぜ同じ課題を3回も投げるのですか
AIは同じ質問でも答えが変わるためです。1回だけの結果では、それが実力なのか偶然なのかが分かりません。3回投げて、結論が一致した割合を再現率として出しています。
採点は誰がしているのですか
プログラムだけで採点しています。AIには採点させていません。正解は課題を作る時点で決めてあり、数値の一致・語句の有無・形式の適合・URLが実際に開けるか・数式を実行した結果で決まります。好き嫌いは点にしていません。
課題に使っているデータは実在の会社のものですか
いいえ。架空の会社のデータを毎回あたらしく作っています。実在の企業・人物・他社の文章は使っていません。使った材料はそのまま配っているので、同じことをやり直せます。
AIが答えられなかったときはどう数えていますか
断られた・時間切れは分母に入れて不正解として数えます。プランの上限に当たった・人間確認の画面が出たときは分母から外し、その回は測れなかったものとして扱います。AInformation側の操作の失敗も分母から外し、AIの欠点としては書きません。
使っているのは無料版ですか、有料版ですか
各AIの有料プランを、ブラウザの画面から使っています。APIではありません。プラン名と、画面に出ていたモデル名・確認した時刻を回ごとに記録しています。
この順位は、どのAIがいちばん賢いかを表していますか
いいえ。測っているのは決まった仕事の課題での正解率・所要時間・再現率・出典の実在率・指示の遵守率の5つだけです。書き味や読みやすさ、長い会話でのふるまいは測っていません。課題が変われば順位も変わります。
引用してもいいですか
はい。CC BY 4.0 です。出典として「AInformation調べ AI実務ベンチ」と、使ったページのURL・測定日を書いてください。集計はJSONとCSVでも取れます。1行1試行のCSVを見れば、載せている数字を数え直せます。

CITATION

この測定を引用する

出典:AInformation調べ「AI実務ベンチ 売上表から合計と伸び率を出す(4AI・6課題・各3回)」(https://ainformation.jp/research/bench/hyokeisan-2026-10-02) 測定日 2026年10月2日 6課題・各3回・有効な試行72回

数字を引くときは、分母(何試行中いくつか)も一緒に書いてください。 出典として AInformation調べ と、使ったページのURL・測定日を書いてください。

関連するページ

NEWSLETTER

AIの最新ニュースを週1回まとめてお届け

その週に出た主要なAIニュースと、編集部が実際に試したツールを1通にまとめます。