本文へ移動
NEWS
AInformation 実測

決められた枚数と字数で資料の骨子を作る(4AI・6課題・各3回)

資料の骨子づくりの課題を6問つくり、ChatGPT・Gemini・Claude・Copilot へ各3回ずつ投げました。採点はプログラムだけで行い、AIには採点させていません。

AIごとのスコアを見る →
83.3% この回でいちばん高い正解率
ChatGPT 18試行中15
2026年10月3日 測定
  • 6問課題
  • 3回1問あたりの試行
  • 4つ測ったAI
  • 72回有効な試行
  • v1公開版

1回の検証の結果。日や課題が変われば順位は変わる

分野:資料の骨子づくり 測定日:2026年10月3日 実施:AInformation編集部 費用:AInformation(自社負担) 依頼主:なし(依頼主はいません) 採点:機械採点のみ(AIに採点させていない)

当たるものがありませんでした。検索の言葉を消すと全部戻ります。

RESULT

この回で分かったこと

下の1行は、採点の結果からそのまま作ったものです。ページ側で足した言葉はありません。

  • 資料の骨子づくり 6課題・各3回 6課題を各3回ずつ投げたところ、正解率が一番高かったのはChatGPTで15/18試行の83.3%だった(2位はGeminiの77.8%) 有効な試行は72回。 1回の検証の結果。日や課題が変われば順位は変わる。 AIごとのスコアを見る

SCORES

AIごとのスコア

並びは正解率の高い順です。分母は、その指標を測れた試行の数です。 「—」は測っていないという意味で、0%ではありません。

決められた枚数と字数で資料の骨子を作る(4AI・6課題・各3回) AIごとのスコア
AI 正解率正解 ÷ 有効な試行 再現率3回で結論が一致 出典の実在率URLが開けた割合 指示の遵守率字数・形式を守った 所要時間中央値/幅
1ChatGPT 83.3% 18試行中15 100% 6課題中 — 100% 20.4秒 14.3〜23.6秒
2Gemini 77.8% 18試行中14 100% 6課題中 — 100% 19.3秒 19.1〜22.5秒
3Claude 61.1% 18試行中11 88.9% 6課題中 — 100% 35.5秒 13.9〜51秒
4Copilot 27.8% 18試行中5 88.9% 6課題中 — 94.4% 17.1秒 14.2〜20.2秒

出典の実在率は、答えと一緒にURLを挙げてもらう課題があった回だけ測っています。 ChatGPT・Gemini・Claude・Copilotの「—」は、この回ではその課題を出していないという意味です。0%ではありません。

答えが返らなかった試行
Gemini … 時間切れ 1回
断られた・時間切れは分母に入れて不正解として数えています。上限・人間確認・AInformation側の操作の失敗は分母から外しています。

TASKS

課題ごとの結果

1つの課題を、4つのAIへ3回ずつ投げています。 ○が正解、×が不正解です。下の数字は、その試行にかかった秒数です。 課題の全文・先に決めた正解・なぜその判定になったかは、それぞれ開くと読めます。

易

次の条件を読んで、資料の各ページのタイトルだけを書いてください。 ■ 資料の骨子をつくるための条件(架空・株式会社サ… 採点の型:format_check 字数・形式・件数の決まりを守ったか

  • ChatGPT
    • ChatGPT 第1回 正解 17.3秒
    • ChatGPT 第2回 正解 17.6秒
    • ChatGPT 第3回 正解 17.2秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 正解 19.2秒
    • Gemini 第2回 正解 19.3秒
    • Gemini 第3回 正解 19.1秒

    3試行中3が正解

  • Claude
    • Claude 第1回 正解 20.1秒
    • Claude 第2回 正解 20.1秒
    • Claude 第3回 正解 17秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 不正解 17.1秒
    • Copilot 第2回 不正解 17.1秒
    • Copilot 第3回 不正解 17.1秒

    3試行中0が正解

課題の全文この文をそのまま4つのAIへ送りました(290字)

次の条件を読んで、資料の各ページのタイトルだけを書いてください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・1ページにつき1行。タイトルの文字だけを書く ・行数は条件のページ数ちょうどにする ・1行の文字数は条件のタイトルの上限を超えない ・番号・記号・前置きは付けない

先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました

(機械採点 format_check){'type': 'line_count', 'min': 5, 'max': 5}/{'type': 'max_line_chars', 'value': 18}

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中9が正解)
ChatGPT 第1回 正解
形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (17.3秒) この回答の全文
ChatGPT 第2回 正解
形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (17.6秒) この回答の全文
ChatGPT 第3回 正解
形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (17.2秒) この回答の全文
Gemini 第1回 正解
形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (19.2秒) この回答の全文
Gemini 第2回 正解
形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (19.3秒) この回答の全文
Gemini 第3回 正解
形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (19.1秒) この回答の全文
Claude 第1回 正解
形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (20.1秒) この回答の全文
Claude 第2回 正解
形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (20.1秒) この回答の全文
Claude 第3回 正解
形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (17秒) この回答の全文
Copilot 第1回 不正解
形式が違う:line_count ×(行数 1/5〜5行)/max_line_chars ×(18文字を超える行 1本) (17.1秒) この回答の全文
Copilot 第2回 不正解
形式が違う:line_count ×(行数 1/5〜5行)/max_line_chars ×(18文字を超える行 1本) (17.1秒) この回答の全文
Copilot 第3回 不正解
形式が違う:line_count ×(行数 1/5〜5行)/max_line_chars ×(18文字を超える行 1本) (17.1秒) この回答の全文
易

次の条件の資料は、何について話す資料ですか。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ… 採点の型:contains_all 必須の語句が全部入っているか

  • ChatGPT
    • ChatGPT 第1回 正解 14.3秒
    • ChatGPT 第2回 正解 17.4秒
    • ChatGPT 第3回 正解 17.2秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 不正解 時間切れ
    • Gemini 第2回 正解 19.3秒
    • Gemini 第3回 正解 19.1秒

    3試行中2が正解

  • Claude
    • Claude 第1回 正解 14.1秒
    • Claude 第2回 不正解 13.9秒
    • Claude 第3回 正解 13.9秒

    3試行中2が正解

  • Copilot
    • Copilot 第1回 不正解 17秒
    • Copilot 第2回 正解 14.3秒
    • Copilot 第3回 正解 14.2秒

    3試行中2が正解

課題の全文この文をそのまま4つのAIへ送りました(236字)

次の条件の資料は、何について話す資料ですか。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・答えはちょうど1行。テーマを条件に書いてあるとおりに書く ・説明は書かない

先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました

(機械採点 contains_all)テーマ=ECの年末施策の説明

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中9が正解)
ChatGPT 第1回 正解
1項目すべてあり (14.3秒) この回答の全文
ChatGPT 第2回 正解
1項目すべてあり (17.4秒) この回答の全文
ChatGPT 第3回 正解
1項目すべてあり (17.2秒) この回答の全文
Gemini 第1回 不正解
時間切れ(制限時間まで答えが止まらなかった) (300.5秒)
Gemini 第2回 正解
1項目すべてあり (19.3秒) この回答の全文
Gemini 第3回 正解
1項目すべてあり (19.1秒) この回答の全文
Claude 第1回 正解
1項目すべてあり (14.1秒) この回答の全文
Claude 第2回 不正解
1項目中0項目あり・足りない テーマ (13.9秒) この回答の全文
Claude 第3回 正解
1項目すべてあり (13.9秒) この回答の全文
Copilot 第1回 不正解
1項目中0項目あり・足りない テーマ (17秒) この回答の全文
Copilot 第2回 正解
1項目すべてあり (14.3秒) この回答の全文
Copilot 第3回 正解
1項目すべてあり (14.2秒) この回答の全文
中

次の条件で、資料の骨子を作ってください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:E… 採点の型:format_check 字数・形式・件数の決まりを守ったか

  • ChatGPT
    • ChatGPT 第1回 正解 20.7秒
    • ChatGPT 第2回 正解 20.3秒
    • ChatGPT 第3回 正解 20.3秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 正解 19.4秒
    • Gemini 第2回 正解 19.3秒
    • Gemini 第3回 正解 19.2秒

    3試行中3が正解

  • Claude
    • Claude 第1回 正解 47.9秒
    • Claude 第2回 正解 41.8秒
    • Claude 第3回 正解 47.7秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 不正解 17.1秒
    • Copilot 第2回 不正解 17.1秒
    • Copilot 第3回 不正解 17秒

    3試行中0が正解

課題の全文この文をそのまま4つのAIへ送りました(300字)

次の条件で、資料の骨子を作ってください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・1ページにつき ページN: タイトル の行を1行、その下に ・ で始まる箇条書きの行を条件の数だけ書く ・ページ数は条件のとおりちょうどにする。多くも少なくもしない ・前置きと感想は書かない。空行も入れない

先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました

(機械採点 format_check){'type': 'line_prefix', 'pattern': '^(ページ[0-9]+[::]|[・\\-])'}/{'type': 'line_count', 'min': 20, 'max': 20}

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中9が正解)
ChatGPT 第1回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (20.7秒) この回答の全文
ChatGPT 第2回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (20.3秒) この回答の全文
ChatGPT 第3回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (20.3秒) この回答の全文
Gemini 第1回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (19.4秒) この回答の全文
Gemini 第2回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (19.3秒) この回答の全文
Gemini 第3回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (19.2秒) この回答の全文
Claude 第1回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (47.9秒) この回答の全文
Claude 第2回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (41.8秒) この回答の全文
Claude 第3回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (47.7秒) この回答の全文
Copilot 第1回 不正解
形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行) (17.1秒) この回答の全文
Copilot 第2回 不正解
形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行) (17.1秒) この回答の全文
Copilot 第3回 不正解
形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行) (17秒) この回答の全文
中

次の条件の資料の構成を、マークダウンの表にしてください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商… 採点の型:format_check 字数・形式・件数の決まりを守ったか

  • ChatGPT
    • ChatGPT 第1回 不正解 20.6秒
    • ChatGPT 第2回 不正解 20.4秒
    • ChatGPT 第3回 不正解 17.3秒

    3試行中0が正解

  • Gemini
    • Gemini 第1回 不正解 19.3秒
    • Gemini 第2回 不正解 22.3秒
    • Gemini 第3回 不正解 19.3秒

    3試行中0が正解

  • Claude
    • Claude 第1回 不正解 32.4秒
    • Claude 第2回 不正解 32.4秒
    • Claude 第3回 不正解 29.4秒

    3試行中0が正解

  • Copilot
    • Copilot 第1回 不正解 20.2秒
    • Copilot 第2回 不正解 17.1秒
    • Copilot 第3回 不正解 17.3秒

    3試行中0が正解

課題の全文この文をそのまま4つのAIへ送りました(281字)

次の条件の資料の構成を、マークダウンの表にしてください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・列はちょうど2つ。ページ / タイトル の順にする ・行は条件のページ数ちょうど(見出しの行と区切りの行を除く) ・表だけを出す。前置きと説明は書かない

先に決めた正解課題を作った時点で決めています。4つのAI中0つが1回でも正解しました

(機械採点 format_check){'type': 'table_cols', 'value': 2}/{'type': 'line_count', 'min': 7, 'max': 7}

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中0が正解)
ChatGPT 第1回 不正解
形式が違う:table_cols ×(表が無い)/line_count ×(行数 6/7〜7行) (20.6秒) この回答の全文
ChatGPT 第2回 不正解
形式が違う:table_cols ×(表が無い)/line_count ×(行数 6/7〜7行) (20.4秒) この回答の全文
ChatGPT 第3回 不正解
形式が違う:table_cols ×(表が無い)/line_count ×(行数 6/7〜7行) (17.3秒) この回答の全文
Gemini 第1回 不正解
形式が違う:table_cols ×(表が無い)/line_count ×(行数 6/7〜7行) (19.3秒) この回答の全文
Gemini 第2回 不正解
形式が違う:table_cols ×(表が無い)/line_count ×(行数 6/7〜7行) (22.3秒) この回答の全文
Gemini 第3回 不正解
形式が違う:table_cols ×(表が無い)/line_count ×(行数 26/7〜7行) (19.3秒) この回答の全文
Claude 第1回 不正解
形式が違う:table_cols ×(表が無い)/line_count ○(行数 7/7〜7行) (32.4秒) この回答の全文
Claude 第2回 不正解
形式が違う:table_cols ×(表が無い)/line_count ○(行数 7/7〜7行) (32.4秒) この回答の全文
Claude 第3回 不正解
形式が違う:table_cols ×(表が無い)/line_count ○(行数 7/7〜7行) (29.4秒) この回答の全文
Copilot 第1回 不正解
形式が違う:table_cols ×(表が無い)/line_count ×(行数 21/7〜7行) (20.2秒) この回答の全文
Copilot 第2回 不正解
形式が違う:table_cols ×(表が無い)/line_count ×(行数 21/7〜7行) (17.1秒) この回答の全文
Copilot 第3回 不正解
形式が違う:table_cols ×(表が無い)/line_count ×(行数 21/7〜7行) (17.3秒) この回答の全文
難

次の条件で、資料の骨子を作ってください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:E… 採点の型:format_check 字数・形式・件数の決まりを守ったか

  • ChatGPT
    • ChatGPT 第1回 正解 23.6秒
    • ChatGPT 第2回 正解 23.5秒
    • ChatGPT 第3回 正解 20.5秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 正解 19.2秒
    • Gemini 第2回 正解 19.2秒
    • Gemini 第3回 正解 19.4秒

    3試行中3が正解

  • Claude
    • Claude 第1回 正解 47.9秒
    • Claude 第2回 正解 47.8秒
    • Claude 第3回 正解 51秒

    3試行中3が正解

  • Copilot
    • Copilot 第1回 不正解 17.1秒
    • Copilot 第2回 不正解 17.1秒
    • Copilot 第3回 不正解 17.3秒

    3試行中0が正解

課題の全文この文をそのまま4つのAIへ送りました(330字)

次の条件で、資料の骨子を作ってください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・1ページにつき ページN: タイトル の行を1行、その下に ・ で始まる箇条書きの行を条件の数だけ書く ・ページ数・箇条書きの数は条件のとおりちょうどにする ・どの行も46文字を超えない ・数字を入れられるところは数字を入れる。前置きと感想は書かない。空行も入れない

先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました

(機械採点 format_check){'type': 'line_prefix', 'pattern': '^(ページ[0-9]+[::]|[・\\-])'}/{'type': 'line_count', 'min': 20, 'max': 20}/{'type': 'max_line_chars', 'value': 46}

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中9が正解)
ChatGPT 第1回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (23.6秒) この回答の全文
ChatGPT 第2回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (23.5秒) この回答の全文
ChatGPT 第3回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (20.5秒) この回答の全文
Gemini 第1回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (19.2秒) この回答の全文
Gemini 第2回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (19.2秒) この回答の全文
Gemini 第3回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (19.4秒) この回答の全文
Claude 第1回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (47.9秒) この回答の全文
Claude 第2回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (47.8秒) この回答の全文
Claude 第3回 正解
形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (51秒) この回答の全文
Copilot 第1回 不正解
形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行)/max_line_chars ×(46文字を超える行 1本) (17.1秒) この回答の全文
Copilot 第2回 不正解
形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行)/max_line_chars ×(46文字を超える行 1本) (17.1秒) この回答の全文
Copilot 第3回 不正解
形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行)/max_line_chars ×(46文字を超える行 1本) (17.3秒) この回答の全文
難

次の条件で資料の骨子を作り、JSON だけを出力してください。 ■ 資料の骨子をつくるための条件(架空・株式会社サン… 採点の型:format_check 字数・形式・件数の決まりを守ったか

  • ChatGPT
    • ChatGPT 第1回 正解 20.5秒
    • ChatGPT 第2回 正解 23.6秒
    • ChatGPT 第3回 正解 20.7秒

    3試行中3が正解

  • Gemini
    • Gemini 第1回 正解 22.5秒
    • Gemini 第2回 正解 19.2秒
    • Gemini 第3回 正解 19.1秒

    3試行中3が正解

  • Claude
    • Claude 第1回 不正解 38.6秒
    • Claude 第2回 不正解 44.8秒
    • Claude 第3回 不正解 41.7秒

    3試行中0が正解

  • Copilot
    • Copilot 第1回 正解 17.1秒
    • Copilot 第2回 正解 20.2秒
    • Copilot 第3回 正解 17秒

    3試行中3が正解

課題の全文この文をそのまま4つのAIへ送りました(351字)

次の条件で資料の骨子を作り、JSON だけを出力してください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・出力は JSON だけ。前後に説明文を書かない ・形は {"pages": [{"no": 1, "title": "タイトル", "bullets": ["…"]}]} にする ・pages の数は条件のページ数ちょうどにする ・bullets の数は条件の箇条書きの数ちょうどにする

先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました

(機械採点 format_check){'type': 'json_valid'}/{'type': 'json_keys', 'keys': ['pages']}/{'type': 'json_list_len', 'key': 'pages', 'value': 5}

採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中9が正解)
ChatGPT 第1回 正解
形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (20.5秒) この回答の全文
ChatGPT 第2回 正解
形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (23.6秒) この回答の全文
ChatGPT 第3回 正解
形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (20.7秒) この回答の全文
Gemini 第1回 正解
形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (22.5秒) この回答の全文
Gemini 第2回 正解
形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (19.2秒) この回答の全文
Gemini 第3回 正解
形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (19.1秒) この回答の全文
Claude 第1回 不正解
形式が違う:json_valid ×(JSONとして読めない)/json_keys ×(JSONの形が違う)/json_list_len ×(pages のリストが無い) (38.6秒) この回答の全文
Claude 第2回 不正解
形式が違う:json_valid ×(JSONとして読めない)/json_keys ×(JSONの形が違う)/json_list_len ×(pages のリストが無い) (44.8秒) この回答の全文
Claude 第3回 不正解
形式が違う:json_valid ×(JSONとして読めない)/json_keys ×(JSONの形が違う)/json_list_len ×(pages のリストが無い) (41.7秒) この回答の全文
Copilot 第1回 正解
形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (17.1秒) この回答の全文
Copilot 第2回 正解
形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (20.2秒) この回答の全文
Copilot 第3回 正解
形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (17秒) この回答の全文

ANSWERS

4つのAIの回答の全文

採点のもとになった回答を、手を入れずにそのまま置いています。 読んだ人が同じように数え直せるようにするためです。

MATERIALS

課題に使った材料

架空の株式会社サンプル商事の社内資料の条件(ページ数・箇条書きの数・字数)。条件は毎回変える この回のために2026年10月2日に作り直したものです。 落として、同じことをやり直せます。

METHOD

測り方

やり直せるように、この回の条件をそのまま書いています。

測ったAIと、そのときのモデル名

AIは中身が黙って変わります。画面に出ていたモデル名と、確認した時刻を残しています。

測ったAIとモデル名
AIプラン 画面に出ていたモデル名確認した時刻
ChatGPT ChatGPT Pro Medium 2026-10-02 19:57
Gemini Google AI Pro Flash-Lite 2026-10-02 19:57
Claude Claude Max Opus 4.8 高 2026-10-02 19:57
Copilot Microsoft 365 Personal 2026-10-02 19:57

この回でやったこと

  1. 課題に使う材料を、この回のために作り直しました。架空の会社のデータで、実在の企業・人物は含みません。
  2. 課題を6問つくり、正解をこの時点で決めました。
  3. ChatGPT・Gemini・Claude・Copilotへ、同じ課題文と同じ材料を送りました。
  4. 1問につき3回、毎回あたらしい会話で投げました。
  5. 投げる順番は回ごとに入れ替えました。時間帯のかたよりが順位に出ないようにするためです。
  6. 待ち時間は300秒までとし、 過ぎたものは時間切れとして記録しました。
  7. 採点は機械採点のみ(AIに採点させていない)です。
  8. 送信した試行はのべ72回、 そのうち有効だったのは72回です。

答えが返らなかったときの数え方

  • 断られた・時間切れ

    分母に入れて、不正解として数えます。仕事では答えが返らないのと同じためです。

  • プランの上限に当たった

    分母から外します。その試行は測れなかったものとして扱います。

  • 人間確認の画面が出た

    そこで止めます。機械で押すことも、避けることもしません。

  • AInformation側の操作の失敗

    分母から外します。AIの欠点としては書きません。

LIMITS

この測定の限界

数字だけを見て判断されないように、測れていないことを書いています。

  • 1日1回の測定である。日や課題が変われば順位は変わる
  • プランは各AIの有料版(ChatGPT Pro/Google AI Pro/Claude Max/Microsoft 365 Personal)。無料版の結果ではない
  • 既定のモデル・既定のモードだけで測っている(Deep Research などは使っていない)
  • 課題は架空の株式会社サンプル商事の自作データ。実在の企業のデータでの結果ではない
  • 機械で採点できる課題だけを扱っている。文章のうまさ・読みやすさは測っていない
  • ブラウザで人が使うのと同じ画面から測っている。APIの結果ではない
  • 画面に出ているモデル名を読み取れないAIがある回は、その欄を空(null)にしている。読み取れた回はそのまま載せている

DATA

公開しているデータ

CSVは1行が1試行です。このページに出している数字は、そのCSVを数え直したものと一致します。 ライセンスは CC BY 4.0 です。

累積の順位表は /data/research/bench/leaderboard.json にあります。 版(v1)は消しません。引用したリンクが切れないようにするためです。

FAQ

よくある質問

どうやって測っているのですか
4つのAIに、まったく同じ課題文と同じ材料を、同じ日のうちに投げています。毎回あたらしい会話を開いて、前の回答を引きずらせません。投げる順番は回ごとに入れ替えています。送信してから回答が止まるまでの秒数もあわせて記録しています。
なぜ同じ課題を3回も投げるのですか
AIは同じ質問でも答えが変わるためです。1回だけの結果では、それが実力なのか偶然なのかが分かりません。3回投げて、結論が一致した割合を再現率として出しています。
採点は誰がしているのですか
プログラムだけで採点しています。AIには採点させていません。正解は課題を作る時点で決めてあり、数値の一致・語句の有無・形式の適合・URLが実際に開けるか・数式を実行した結果で決まります。好き嫌いは点にしていません。
課題に使っているデータは実在の会社のものですか
いいえ。架空の会社のデータを毎回あたらしく作っています。実在の企業・人物・他社の文章は使っていません。使った材料はそのまま配っているので、同じことをやり直せます。
AIが答えられなかったときはどう数えていますか
断られた・時間切れは分母に入れて不正解として数えます。プランの上限に当たった・人間確認の画面が出たときは分母から外し、その回は測れなかったものとして扱います。AInformation側の操作の失敗も分母から外し、AIの欠点としては書きません。
使っているのは無料版ですか、有料版ですか
各AIの有料プランを、ブラウザの画面から使っています。APIではありません。プラン名と、画面に出ていたモデル名・確認した時刻を回ごとに記録しています。
この順位は、どのAIがいちばん賢いかを表していますか
いいえ。測っているのは決まった仕事の課題での正解率・所要時間・再現率・出典の実在率・指示の遵守率の5つだけです。書き味や読みやすさ、長い会話でのふるまいは測っていません。課題が変われば順位も変わります。
引用してもいいですか
はい。CC BY 4.0 です。出典として「AInformation調べ AI実務ベンチ」と、使ったページのURL・測定日を書いてください。集計はJSONとCSVでも取れます。1行1試行のCSVを見れば、載せている数字を数え直せます。

CITATION

この測定を引用する

出典:AInformation調べ「AI実務ベンチ 決められた枚数と字数で資料の骨子を作る(4AI・6課題・各3回)」(https://ainformation.jp/research/bench/kossi-2026-10-03) 測定日 2026年10月3日 6課題・各3回・有効な試行72回

数字を引くときは、分母(何試行中いくつか)も一緒に書いてください。 出典として AInformation調べ と、使ったページのURL・測定日を書いてください。

関連するページ

NEWSLETTER

AIの最新ニュースを週1回まとめてお届け

その週に出た主要なAIニュースと、編集部が実際に試したツールを1通にまとめます。