本文へ移動
NEWS
AInformation 実測

答えが一意に決まる事実を調べる(4AI・6課題・各3回)

調べもの・事実確認の課題を6問つくり、ChatGPT・Copilot・Gemini・Claude へ各3回ずつ投げました。採点はプログラムだけで行い、AIには採点させていません。

AIごとのスコアを見る →
100% この回でいちばん高い正解率
ChatGPT 18試行中18
2026年9月29日 測定
  • 6問課題
  • 3回1問あたりの試行
  • 4つ測ったAI
  • 54回有効な試行
  • v1公開版

1回の検証の結果。日や課題が変われば順位は変わる

分野:調べもの・事実確認 測定日:2026年9月29日 実施:AInformation編集部 費用:AInformation(自社負担) 依頼主:なし(依頼主はいません) 採点:機械採点のみ(AIに採点させていない)

当たるものがありませんでした。検索の言葉を消すと全部戻ります。

RESULT

この回で分かったこと

下の1行は、採点の結果からそのまま作ったものです。ページ側で足した言葉はありません。

  • 調べもの・事実確認 6課題・各3回 6課題を各3回ずつ投げたところ、正解率が一番高かったのはChatGPTで18/18試行の100.0%だった(2位はCopilotの72.2%) 有効な試行は54回。 1回の検証の結果。日や課題が変われば順位は変わる。 AIごとのスコアを見る

SCORES

AIごとのスコア

並びは正解率の高い順です。分母は、その指標を測れた試行の数です。 「—」は測っていないという意味で、0%ではありません。

答えが一意に決まる事実を調べる(4AI・6課題・各3回) AIごとのスコア
AI 正解率正解 ÷ 有効な試行 再現率3回で結論が一致 出典の実在率URLが開けた割合 指示の遵守率字数・形式を守った 所要時間中央値/幅
1ChatGPT 100% 18試行中18 100% 6課題中 100% 100% 20.2秒 14〜26.7秒
2Copilot 72.2% 18試行中13 66.7% 6課題中 93.3% 31.2% 20.1秒 13.9〜26.4秒
3Gemini 22.2% 18試行中4 33.3% 6課題中 83.3% 50% 33秒 23.6〜78.6秒
4Claude — — 6課題中 — — —

出典の実在率は、答えと一緒にURLを挙げてもらう課題があった回だけ測っています。 Claudeの「—」は、この回ではその課題を出していないという意味です。0%ではありません。

答えが返らなかった試行
Copilot … 時間切れ 2回 Gemini … 断られた 8回 Claude … 人間確認が出たので止めた(分母から外した) 18回
断られた・時間切れは分母に入れて不正解として数えています。上限・人間確認・AInformation側の操作の失敗は分母から外しています。

TASKS

課題ごとの結果

1つの課題を、4つのAIへ3回ずつ投げています。 ○が正解、×が不正解です。下の数字は、その試行にかかった秒数です。 課題の全文・先に決めた正解・なぜその判定になったかは、それぞれ開くと読めます。

易

次の2つの問いに答えてください。 f1. 2027年4月30日は何曜日ですか。 f2. 西暦2038年はうるう年です… 採点の型:contains_all 必須の語句が全部入っているか

  • ChatGPT
    • ChatGPT 第1回 正解 20.2秒
    • ChatGPT 第2回 正解 17.1秒
    • ChatGPT 第3回 正解 14秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 不正解 14秒
    • Copilot 第2回 正解 20秒
    • Copilot 第3回 正解 20.2秒

    3試行中2が正解

  • Gemini
    • Gemini 第1回 不正解 断られた
    • Gemini 第2回 不正解 断られた
    • Gemini 第3回 不正解 断られた

    3試行中0が正解

  • Claude
    • Claude 第1回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第2回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第3回 採点の外 人間確認が出たので止めた(分母から外した)

    0試行中0が正解 3回は分母から外した

課題の全文この文をそのまま4つのAIへ送りました(141字)

次の2つの問いに答えてください。 f1. 2027年4月30日は何曜日ですか。 f2. 西暦2038年はうるう年ですか。「うるう年です」か「うるう年ではありません」で答えてください。 決まり ・答えはちょうど2行。f1: ◯/f2: ◯ の形で書く ・理由と計算の過程は書かない

先に決めた正解課題を作った時点で決めています。4つのAI中2つが1回でも正解しました

(機械採点 contains_all)f1=金曜または金曜日/f2=うるう年ではありませんまたはうるう年でないまたは平年またはいいえ

採点の中身なぜその判定になったかを1試行ずつ出しています(9試行中5が正解)
ChatGPT 第1回 正解
2項目すべてあり (20.2秒) この回答の全文
ChatGPT 第2回 正解
2項目すべてあり (17.1秒) この回答の全文
ChatGPT 第3回 正解
2項目すべてあり (14秒) この回答の全文
Copilot 第1回 不正解
2項目中0項目あり・足りない f1/f2 (14秒) この回答の全文
Copilot 第2回 正解
2項目すべてあり (20秒) この回答の全文
Copilot 第3回 正解
2項目すべてあり (20.2秒) この回答の全文
Gemini 第1回 不正解
断られた(ポリシー)。不正解として分母に入れる (29.9秒) この回答の全文
Gemini 第2回 不正解
断られた(ポリシー)。不正解として分母に入れる (26.8秒) この回答の全文
Gemini 第3回 不正解
断られた(ポリシー)。不正解として分母に入れる (23.7秒) この回答の全文
Claude 第1回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第2回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第3回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
易

次の3つの問いに答えてください。 f3. 13マイルは何キロメートルですか。1マイル=1.609344キロメートルと… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある

  • ChatGPT
    • ChatGPT 第1回 正解 23.3秒
    • ChatGPT 第2回 正解 20秒
    • ChatGPT 第3回 正解 20.2秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 不正解 13.9秒
    • Copilot 第2回 正解 17秒
    • Copilot 第3回 正解 17秒

    3試行中2が正解

  • Gemini
    • Gemini 第1回 不正解 23.6秒
    • Gemini 第2回 正解 26.7秒
    • Gemini 第3回 正解 33.1秒

    3試行中2が正解

  • Claude
    • Claude 第1回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第2回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第3回 採点の外 人間確認が出たので止めた(分母から外した)

    0試行中0が正解 3回は分母から外した

課題の全文この文をそのまま4つのAIへ送りました(231字)

次の3つの問いに答えてください。 f3. 13マイルは何キロメートルですか。1マイル=1.609344キロメートルとして、小数第2位まで四捨五入して答えてください。 f4. 2024年7月23日 から 2026年9月29日 までは何日ありますか(両端の差の日数)。 f5. 259 の正の約数は全部でいくつありますか。 決まり ・答えはちょうど3行。f3: ◯/f4: ◯/f5: ◯ の形で書く ・数は半角で書く。単位は書かなくてよい。計算の過程は書かない

先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました

(機械採点 exact_number)f3=20.92(誤差±0.011)/f4=798(誤差±0)/f5=4(誤差±0)

採点の中身なぜその判定になったかを1試行ずつ出しています(9試行中7が正解)
ChatGPT 第1回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (23.3秒) この回答の全文
ChatGPT 第2回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (20秒) この回答の全文
ChatGPT 第3回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (20.2秒) この回答の全文
Copilot 第1回 不正解
数値が違う:f3 ○(正解20.92)/f4 ×(正解798・答え3.0)/f5 ○(正解4) (13.9秒) この回答の全文
Copilot 第2回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (17秒) この回答の全文
Copilot 第3回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (17秒) この回答の全文
Gemini 第1回 不正解
数値が違う:f3 ×(正解20.92・f3 の行が無い)/f4 ×(正解798・f4 の行が無い)/f5 ×(正解4・f5 の行が無い) (23.6秒) この回答の全文
Gemini 第2回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (26.7秒) この回答の全文
Gemini 第3回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (33.1秒) この回答の全文
Claude 第1回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第2回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第3回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
中

次の5つの問いに答えてください。 f1. 2027年4月30日は何曜日ですか。 f2. 西暦2038年はうるう年です… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある

  • ChatGPT
    • ChatGPT 第1回 正解 23.3秒
    • ChatGPT 第2回 正解 23.1秒
    • ChatGPT 第3回 正解 26.3秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 正解 23.2秒
    • Copilot 第2回 正解 26.4秒
    • Copilot 第3回 不正解 時間切れ

    3試行中2が正解

  • Gemini
    • Gemini 第1回 不正解 断られた
    • Gemini 第2回 不正解 35.9秒
    • Gemini 第3回 不正解 断られた

    3試行中0が正解

  • Claude
    • Claude 第1回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第2回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第3回 採点の外 人間確認が出たので止めた(分母から外した)

    0試行中0が正解 3回は分母から外した

課題の全文この文をそのまま4つのAIへ送りました(299字)

次の5つの問いに答えてください。 f1. 2027年4月30日は何曜日ですか。 f2. 西暦2038年はうるう年ですか。「うるう年です」か「うるう年ではありません」で答えてください。 f3. 13マイルは何キロメートルですか。1マイル=1.609344キロメートルとして、小数第2位まで四捨五入して答えてください。 f4. 2024年7月23日 から 2026年9月29日 までは何日ありますか(両端の差の日数)。 f5. 259 の正の約数は全部でいくつありますか。 決まり ・答えはちょうど5行。f1: ◯ から f5: ◯ まで、この順で書く ・数は半角で書く。計算の過程と理由は書かない

先に決めた正解課題を作った時点で決めています。4つのAI中2つが1回でも正解しました

(機械採点 exact_number)f3=20.92(誤差±0.011)/f4=798(誤差±0)/f5=4(誤差±0)

採点の中身なぜその判定になったかを1試行ずつ出しています(9試行中5が正解)
ChatGPT 第1回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (23.3秒) この回答の全文
ChatGPT 第2回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (23.1秒) この回答の全文
ChatGPT 第3回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (26.3秒) この回答の全文
Copilot 第1回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (23.2秒) この回答の全文
Copilot 第2回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (26.4秒) この回答の全文
Copilot 第3回 不正解
時間切れ(制限時間まで答えが止まらなかった) (301.2秒)
Gemini 第1回 不正解
断られた(ポリシー)。不正解として分母に入れる (42.2秒) この回答の全文
Gemini 第2回 不正解
数値が違う:f3 ×(正解20.92・f3 の行が無い)/f4 ×(正解798・f4 の行が無い)/f5 ×(正解4・f5 の行が無い) (35.9秒) この回答の全文
Gemini 第3回 不正解
断られた(ポリシー)。不正解として分母に入れる (20.7秒) この回答の全文
Claude 第1回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第2回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第3回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
中

1マイルが何メートルかを確かめられる公式の資料を3つ挙げてください。 決まり ・答えはちょうど3行。1行につきURL… 採点の型:url_alive 挙げたURLを実際に開いて、実在するかを確かめる

  • ChatGPT
    • ChatGPT 第1回 正解 20.1秒
    • ChatGPT 第2回 正解 20.1秒
    • ChatGPT 第3回 正解 20.2秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 正解 23.2秒
    • Copilot 第2回 不正解 20秒
    • Copilot 第3回 正解 17秒

    3試行中2が正解

  • Gemini
    • Gemini 第1回 不正解 32.9秒
    • Gemini 第2回 不正解 23.7秒
    • Gemini 第3回 不正解 断られた

    3試行中0が正解

  • Claude
    • Claude 第1回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第2回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第3回 採点の外 人間確認が出たので止めた(分母から外した)

    0試行中0が正解 3回は分母から外した

課題の全文この文をそのまま4つのAIへ送りました(104字)

1マイルが何メートルかを確かめられる公式の資料を3つ挙げてください。 決まり ・答えはちょうど3行。1行につきURLを1本だけ書く ・いま開けるURLだけを書く。存在しないURLは書かない ・説明は書かない

先に決めた正解課題を作った時点で決めています。4つのAI中2つが1回でも正解しました

(機械採点 url_alive)挙げたURLを実際に開いて実在を確かめる。

採点の中身なぜその判定になったかを1試行ずつ出しています(9試行中5が正解)
ChatGPT 第1回 正解
URL 3/3本が実在 (20.1秒) この回答の全文
ChatGPT 第2回 正解
URL 3/3本が実在 (20.1秒) この回答の全文
ChatGPT 第3回 正解
URL 3/3本が実在 (20.2秒) この回答の全文
Copilot 第1回 正解
URL 3/3本が実在 (23.2秒) この回答の全文
Copilot 第2回 不正解
URL 2/3本が実在・開けない https://www.bipm.org/en/publications/si-brochure/edition-9/a (20秒) この回答の全文
Copilot 第3回 正解
URL 3/3本が実在 (17秒) この回答の全文
Gemini 第1回 不正解
URLが0本(3本を求めた) (32.9秒) この回答の全文
Gemini 第2回 不正解
URLが0本(3本を求めた) (23.7秒) この回答の全文
Gemini 第3回 不正解
断られた(ポリシー)。不正解として分母に入れる (29.9秒) この回答の全文
Claude 第1回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第2回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第3回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
難

13マイルは何キロメートルですか。1マイル=1.609344キロメートルとして、小数第2位まで四捨五入して答えてくだ… 採点の型:url_alive 挙げたURLを実際に開いて、実在するかを確かめる

  • ChatGPT
    • ChatGPT 第1回 正解 26.5秒
    • ChatGPT 第2回 正解 20.1秒
    • ChatGPT 第3回 正解 26.7秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 正解 20.1秒
    • Copilot 第2回 不正解 時間切れ
    • Copilot 第3回 正解 20.1秒

    3試行中2が正解

  • Gemini
    • Gemini 第1回 不正解 36.1秒
    • Gemini 第2回 不正解 断られた
    • Gemini 第3回 正解 78.6秒

    3試行中1が正解

  • Claude
    • Claude 第1回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第2回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第3回 採点の外 人間確認が出たので止めた(分母から外した)

    0試行中0が正解 3回は分母から外した

課題の全文この文をそのまま4つのAIへ送りました(189字)

13マイルは何キロメートルですか。1マイル=1.609344キロメートルとして、小数第2位まで四捨五入して答えてください。 あわせて、その換算の根拠になる資料のURLを3本挙げてください。 決まり ・1行目に 答え: ◯◯.◯◯ と書く(数は半角・小数第2位まで) ・2行目から、1行につきURLを1本だけ、3行書く ・いま開けるURLだけを書く。存在しないURLは書かない

先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました

(機械採点 url_alive)挙げたURLを実際に開いて実在を確かめる。マイル換算=20.92

採点の中身なぜその判定になったかを1試行ずつ出しています(9試行中6が正解)
ChatGPT 第1回 正解
URL 3/3本が実在/マイル換算 ○(正解20.92) (26.5秒) この回答の全文
ChatGPT 第2回 正解
URL 3/3本が実在/マイル換算 ○(正解20.92) (20.1秒) この回答の全文
ChatGPT 第3回 正解
URL 3/3本が実在/マイル換算 ○(正解20.92) (26.7秒) この回答の全文
Copilot 第1回 正解
URL 3/3本が実在/マイル換算 ○(正解20.92) (20.1秒) この回答の全文
Copilot 第2回 不正解
時間切れ(制限時間まで答えが止まらなかった) (300.8秒)
Copilot 第3回 正解
URL 3/3本が実在/マイル換算 ○(正解20.92) (20.1秒) この回答の全文
Gemini 第1回 不正解
URL 2/3本が実在・開けない https://www.britannica.com/science/mile/マイル換算 ○(正解20.92) (36.1秒) この回答の全文
Gemini 第2回 不正解
断られた(ポリシー)。不正解として分母に入れる (29.8秒) この回答の全文
Gemini 第3回 正解
URL 3/3本が実在/マイル換算 ○(正解20.92) (78.6秒) この回答の全文
Claude 第1回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第2回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第3回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
難

次の5つの問いに答え、JSON だけを出力してください。 f1. 2027年4月30日は何曜日ですか。 f2. 西暦… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある

  • ChatGPT
    • ChatGPT 第1回 正解 23.2秒
    • ChatGPT 第2回 正解 20.3秒
    • ChatGPT 第3回 正解 23.2秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 正解 23.1秒
    • Copilot 第2回 正解 26.2秒
    • Copilot 第3回 正解 17秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 正解 60.6秒
    • Gemini 第2回 不正解 断られた
    • Gemini 第3回 不正解 29.9秒

    3試行中1が正解

  • Claude
    • Claude 第1回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第2回 採点の外 人間確認が出たので止めた(分母から外した)
    • Claude 第3回 採点の外 人間確認が出たので止めた(分母から外した)

    0試行中0が正解 3回は分母から外した

課題の全文この文をそのまま4つのAIへ送りました(373字)

次の5つの問いに答え、JSON だけを出力してください。 f1. 2027年4月30日は何曜日ですか。 f2. 西暦2038年はうるう年ですか。「うるう年です」か「うるう年ではありません」で答えてください。 f3. 13マイルは何キロメートルですか。1マイル=1.609344キロメートルとして、小数第2位まで四捨五入して答えてください。 f4. 2024年7月23日 から 2026年9月29日 までは何日ありますか(両端の差の日数)。 f5. 259 の正の約数は全部でいくつありますか。 決まり ・出力は JSON だけ。前後に説明文を書かない ・形は {"f1": "…", "f2": "…", "f3": 数値, "f4": 数値, "f5": 数値} にする ・f3・f4・f5 は数値で入れる(文字列にしない・単位を付けない)

先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました

(機械採点 exact_number)f3=20.92(誤差±0.011)/f4=798(誤差±0)/f5=4(誤差±0)

採点の中身なぜその判定になったかを1試行ずつ出しています(9試行中7が正解)
ChatGPT 第1回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (23.2秒) この回答の全文
ChatGPT 第2回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (20.3秒) この回答の全文
ChatGPT 第3回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (23.2秒) この回答の全文
Copilot 第1回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (23.1秒) この回答の全文
Copilot 第2回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (26.2秒) この回答の全文
Copilot 第3回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (17秒) この回答の全文
Gemini 第1回 正解
数値すべて一致:f3 ○(正解20.92)/f4 ○(正解798)/f5 ○(正解4) (60.6秒) この回答の全文
Gemini 第2回 不正解
断られた(ポリシー)。不正解として分母に入れる (23.6秒) この回答の全文
Gemini 第3回 不正解
数値が違う:f3 ×(正解20.92・f3 の行が無い)/f4 ×(正解798・f4 の行が無い)/f5 ×(正解4・f5 の行が無い) (29.9秒) この回答の全文
Claude 第1回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第2回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)
Claude 第3回 採点の外(分母から外した)
先に止めた(Claude: 人間確認が出た(title に「just a moment」)。押さずに止めた)

ANSWERS

4つのAIの回答の全文

採点のもとになった回答を、手を入れずにそのまま置いています。 読んだ人が同じように数え直せるようにするためです。

MATERIALS

課題に使った材料

答えが計算で一意に決まる問い5つ(曜日・うるう年・単位換算・日数・約数)。実在の企業・人物の話は使わない この回のために2026年9月28日に作り直したものです。 落として、同じことをやり直せます。

METHOD

測り方

やり直せるように、この回の条件をそのまま書いています。

測ったAIと、そのときのモデル名

AIは中身が黙って変わります。画面に出ていたモデル名と、確認した時刻を残しています。

測ったAIとモデル名
AIプラン 画面に出ていたモデル名確認した時刻
ChatGPT ChatGPT Pro 中程度 2026-09-28 19:51
Gemini Google AI Pro Flash 拡張 2026-09-28 19:51
Claude Claude Max 2026-09-28 19:51
Copilot Microsoft 365 Personal 2026-09-28 19:51

この回でやったこと

  1. 課題に使う材料を、この回のために作り直しました。架空の会社のデータで、実在の企業・人物は含みません。
  2. 課題を6問つくり、正解をこの時点で決めました。
  3. ChatGPT・Gemini・Claude・Copilotへ、同じ課題文と同じ材料を送りました。
  4. 1問につき3回、毎回あたらしい会話で投げました。
  5. 投げる順番は回ごとに入れ替えました。時間帯のかたよりが順位に出ないようにするためです。
  6. 待ち時間は300秒までとし、 過ぎたものは時間切れとして記録しました。
  7. 採点は機械採点のみ(AIに採点させていない)です。
  8. 送信した試行はのべ72回、 そのうち有効だったのは54回です。

分母から外した試行

  • 人間確認が出たので止めた(分母から外した) 18回

答えが返らなかったときの数え方

  • 断られた・時間切れ

    分母に入れて、不正解として数えます。仕事では答えが返らないのと同じためです。

  • プランの上限に当たった

    分母から外します。その試行は測れなかったものとして扱います。

  • 人間確認の画面が出た

    そこで止めます。機械で押すことも、避けることもしません。

  • AInformation側の操作の失敗

    分母から外します。AIの欠点としては書きません。

LIMITS

この測定の限界

数字だけを見て判断されないように、測れていないことを書いています。

  • 1日1回の測定である。日や課題が変われば順位は変わる
  • プランは各AIの有料版(ChatGPT Pro/Google AI Pro/Claude Max/Microsoft 365 Personal)。無料版の結果ではない
  • 既定のモデル・既定のモードだけで測っている(Deep Research などは使っていない)
  • 課題は架空の株式会社サンプル商事の自作データ。実在の企業のデータでの結果ではない
  • 機械で採点できる課題だけを扱っている。文章のうまさ・読みやすさは測っていない
  • ブラウザで人が使うのと同じ画面から測っている。APIの結果ではない
  • 画面に出ているモデル名を読み取れないAIがある回は、その欄を空(null)にしている。読み取れた回はそのまま載せている
  • この回はClaudeを測れていない(測定中にログインが切れたため)。表のClaudeの欄は試行0で、ほかのAIと比べられる数字ではない

DATA

公開しているデータ

CSVは1行が1試行です。このページに出している数字は、そのCSVを数え直したものと一致します。 ライセンスは CC BY 4.0 です。

累積の順位表は /data/research/bench/leaderboard.json にあります。 版(v1)は消しません。引用したリンクが切れないようにするためです。

FAQ

よくある質問

どうやって測っているのですか
4つのAIに、まったく同じ課題文と同じ材料を、同じ日のうちに投げています。毎回あたらしい会話を開いて、前の回答を引きずらせません。投げる順番は回ごとに入れ替えています。送信してから回答が止まるまでの秒数もあわせて記録しています。
なぜ同じ課題を3回も投げるのですか
AIは同じ質問でも答えが変わるためです。1回だけの結果では、それが実力なのか偶然なのかが分かりません。3回投げて、結論が一致した割合を再現率として出しています。
採点は誰がしているのですか
プログラムだけで採点しています。AIには採点させていません。正解は課題を作る時点で決めてあり、数値の一致・語句の有無・形式の適合・URLが実際に開けるか・数式を実行した結果で決まります。好き嫌いは点にしていません。
課題に使っているデータは実在の会社のものですか
いいえ。架空の会社のデータを毎回あたらしく作っています。実在の企業・人物・他社の文章は使っていません。使った材料はそのまま配っているので、同じことをやり直せます。
AIが答えられなかったときはどう数えていますか
断られた・時間切れは分母に入れて不正解として数えます。プランの上限に当たった・人間確認の画面が出たときは分母から外し、その回は測れなかったものとして扱います。AInformation側の操作の失敗も分母から外し、AIの欠点としては書きません。
使っているのは無料版ですか、有料版ですか
各AIの有料プランを、ブラウザの画面から使っています。APIではありません。プラン名と、画面に出ていたモデル名・確認した時刻を回ごとに記録しています。
この順位は、どのAIがいちばん賢いかを表していますか
いいえ。測っているのは決まった仕事の課題での正解率・所要時間・再現率・出典の実在率・指示の遵守率の5つだけです。書き味や読みやすさ、長い会話でのふるまいは測っていません。課題が変われば順位も変わります。
引用してもいいですか
はい。CC BY 4.0 です。出典として「AInformation調べ AI実務ベンチ」と、使ったページのURL・測定日を書いてください。集計はJSONとCSVでも取れます。1行1試行のCSVを見れば、載せている数字を数え直せます。

CITATION

この測定を引用する

出典:AInformation調べ「AI実務ベンチ 答えが一意に決まる事実を調べる(4AI・6課題・各3回)」(https://ainformation.jp/research/bench/shirabemono-2026-09-29) 測定日 2026年9月29日 6課題・各3回・有効な試行54回

数字を引くときは、分母(何試行中いくつか)も一緒に書いてください。 出典として AInformation調べ と、使ったページのURL・測定日を書いてください。

関連するページ

NEWSLETTER

AIの最新ニュースを週1回まとめてお届け

その週に出た主要なAIニュースと、編集部が実際に試したツールを1通にまとめます。