決められた枚数と字数で資料の骨子を作る(4AI・6課題・各3回)
資料の骨子づくりの課題を6問つくり、ChatGPT・Gemini・Claude・Copilot へ各3回ずつ投げました。採点はプログラムだけで行い、AIには採点させていません。
AIごとのスコアを見る →ChatGPT 18試行中15
2026年10月3日 測定
- 6問課題
- 3回1問あたりの試行
- 4つ測ったAI
- 72回有効な試行
- v1公開版
1回の検証の結果。日や課題が変われば順位は変わる
-
ChatGPT
83.3%
18試行中15が正解
1位
ChatGPT Pro
回答まで 中央値20.4秒 -
Gemini
77.8%
18試行中14が正解
2位
Google AI Pro
回答まで 中央値19.3秒 -
Claude
61.1%
18試行中11が正解
3位
Claude Max
回答まで 中央値35.5秒 -
Copilot
27.8%
18試行中5が正解
4位
Microsoft 365 Personal
回答まで 中央値17.1秒
当たるものがありませんでした。検索の言葉を消すと全部戻ります。
RESULT
この回で分かったこと
下の1行は、採点の結果からそのまま作ったものです。ページ側で足した言葉はありません。
- 資料の骨子づくり 6課題・各3回 6課題を各3回ずつ投げたところ、正解率が一番高かったのはChatGPTで15/18試行の83.3%だった(2位はGeminiの77.8%) 有効な試行は72回。 1回の検証の結果。日や課題が変われば順位は変わる。 AIごとのスコアを見る
SCORES
AIごとのスコア
並びは正解率の高い順です。分母は、その指標を測れた試行の数です。 「—」は測っていないという意味で、0%ではありません。
| AI | 正解率正解 ÷ 有効な試行 | 再現率3回で結論が一致 | 出典の実在率URLが開けた割合 | 指示の遵守率字数・形式を守った | 所要時間中央値/幅 |
|---|---|---|---|---|---|
| 1ChatGPT | 83.3% 18試行中15 | 100% 6課題中 | — | 100% | 20.4秒 14.3〜23.6秒 |
| 2Gemini | 77.8% 18試行中14 | 100% 6課題中 | — | 100% | 19.3秒 19.1〜22.5秒 |
| 3Claude | 61.1% 18試行中11 | 88.9% 6課題中 | — | 100% | 35.5秒 13.9〜51秒 |
| 4Copilot | 27.8% 18試行中5 | 88.9% 6課題中 | — | 94.4% | 17.1秒 14.2〜20.2秒 |
出典の実在率は、答えと一緒にURLを挙げてもらう課題があった回だけ測っています。 ChatGPT・Gemini・Claude・Copilotの「—」は、この回ではその課題を出していないという意味です。0%ではありません。
答えが返らなかった試行
Gemini … 時間切れ 1回
断られた・時間切れは分母に入れて不正解として数えています。上限・人間確認・AInformation側の操作の失敗は分母から外しています。
TASKS
課題ごとの結果
1つの課題を、4つのAIへ3回ずつ投げています。 ○が正解、×が不正解です。下の数字は、その試行にかかった秒数です。 課題の全文・先に決めた正解・なぜその判定になったかは、それぞれ開くと読めます。
次の条件を読んで、資料の各ページのタイトルだけを書いてください。 ■ 資料の骨子をつくるための条件(架空・株式会社サ… 採点の型:format_check 字数・形式・件数の決まりを守ったか
-
ChatGPT
- ChatGPT 第1回 正解 17.3秒
- ChatGPT 第2回 正解 17.6秒
- ChatGPT 第3回 正解 17.2秒
3試行中3が正解
-
Gemini
- Gemini 第1回 正解 19.2秒
- Gemini 第2回 正解 19.3秒
- Gemini 第3回 正解 19.1秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 20.1秒
- Claude 第2回 正解 20.1秒
- Claude 第3回 正解 17秒
3試行中3が正解
-
Copilot
- Copilot 第1回 不正解 17.1秒
- Copilot 第2回 不正解 17.1秒
- Copilot 第3回 不正解 17.1秒
3試行中0が正解
課題の全文この文をそのまま4つのAIへ送りました(290字)
次の条件を読んで、資料の各ページのタイトルだけを書いてください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・1ページにつき1行。タイトルの文字だけを書く ・行数は条件のページ数ちょうどにする ・1行の文字数は条件のタイトルの上限を超えない ・番号・記号・前置きは付けない
先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました
(機械採点 format_check){'type': 'line_count', 'min': 5, 'max': 5}/{'type': 'max_line_chars', 'value': 18}
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中9が正解)
- ChatGPT 第1回 正解
- 形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (17.3秒) この回答の全文
- ChatGPT 第2回 正解
- 形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (17.6秒) この回答の全文
- ChatGPT 第3回 正解
- 形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (17.2秒) この回答の全文
- Gemini 第1回 正解
- 形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (19.2秒) この回答の全文
- Gemini 第2回 正解
- 形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (19.3秒) この回答の全文
- Gemini 第3回 正解
- 形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (19.1秒) この回答の全文
- Claude 第1回 正解
- 形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (20.1秒) この回答の全文
- Claude 第2回 正解
- 形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (20.1秒) この回答の全文
- Claude 第3回 正解
- 形式すべて合う:line_count ○(行数 5/5〜5行)/max_line_chars ○(18文字を超える行 0本) (17秒) この回答の全文
- Copilot 第1回 不正解
- 形式が違う:line_count ×(行数 1/5〜5行)/max_line_chars ×(18文字を超える行 1本) (17.1秒) この回答の全文
- Copilot 第2回 不正解
- 形式が違う:line_count ×(行数 1/5〜5行)/max_line_chars ×(18文字を超える行 1本) (17.1秒) この回答の全文
- Copilot 第3回 不正解
- 形式が違う:line_count ×(行数 1/5〜5行)/max_line_chars ×(18文字を超える行 1本) (17.1秒) この回答の全文
次の条件の資料は、何について話す資料ですか。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ… 採点の型:contains_all 必須の語句が全部入っているか
-
ChatGPT
- ChatGPT 第1回 正解 14.3秒
- ChatGPT 第2回 正解 17.4秒
- ChatGPT 第3回 正解 17.2秒
3試行中3が正解
-
Gemini
- Gemini 第1回 不正解 時間切れ
- Gemini 第2回 正解 19.3秒
- Gemini 第3回 正解 19.1秒
3試行中2が正解
-
Claude
- Claude 第1回 正解 14.1秒
- Claude 第2回 不正解 13.9秒
- Claude 第3回 正解 13.9秒
3試行中2が正解
-
Copilot
- Copilot 第1回 不正解 17秒
- Copilot 第2回 正解 14.3秒
- Copilot 第3回 正解 14.2秒
3試行中2が正解
課題の全文この文をそのまま4つのAIへ送りました(236字)
次の条件の資料は、何について話す資料ですか。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・答えはちょうど1行。テーマを条件に書いてあるとおりに書く ・説明は書かない
先に決めた正解課題を作った時点で決めています。4つのAI中4つが1回でも正解しました
(機械採点 contains_all)テーマ=ECの年末施策の説明
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中9が正解)
- ChatGPT 第1回 正解
- 1項目すべてあり (14.3秒) この回答の全文
- ChatGPT 第2回 正解
- 1項目すべてあり (17.4秒) この回答の全文
- ChatGPT 第3回 正解
- 1項目すべてあり (17.2秒) この回答の全文
- Gemini 第1回 不正解
- 時間切れ(制限時間まで答えが止まらなかった) (300.5秒)
- Gemini 第2回 正解
- 1項目すべてあり (19.3秒) この回答の全文
- Gemini 第3回 正解
- 1項目すべてあり (19.1秒) この回答の全文
- Claude 第1回 正解
- 1項目すべてあり (14.1秒) この回答の全文
- Claude 第2回 不正解
- 1項目中0項目あり・足りない テーマ (13.9秒) この回答の全文
- Claude 第3回 正解
- 1項目すべてあり (13.9秒) この回答の全文
- Copilot 第1回 不正解
- 1項目中0項目あり・足りない テーマ (17秒) この回答の全文
- Copilot 第2回 正解
- 1項目すべてあり (14.3秒) この回答の全文
- Copilot 第3回 正解
- 1項目すべてあり (14.2秒) この回答の全文
次の条件で、資料の骨子を作ってください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:E… 採点の型:format_check 字数・形式・件数の決まりを守ったか
-
ChatGPT
- ChatGPT 第1回 正解 20.7秒
- ChatGPT 第2回 正解 20.3秒
- ChatGPT 第3回 正解 20.3秒
3試行中3が正解
-
Gemini
- Gemini 第1回 正解 19.4秒
- Gemini 第2回 正解 19.3秒
- Gemini 第3回 正解 19.2秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 47.9秒
- Claude 第2回 正解 41.8秒
- Claude 第3回 正解 47.7秒
3試行中3が正解
-
Copilot
- Copilot 第1回 不正解 17.1秒
- Copilot 第2回 不正解 17.1秒
- Copilot 第3回 不正解 17秒
3試行中0が正解
課題の全文この文をそのまま4つのAIへ送りました(300字)
次の条件で、資料の骨子を作ってください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・1ページにつき ページN: タイトル の行を1行、その下に ・ で始まる箇条書きの行を条件の数だけ書く ・ページ数は条件のとおりちょうどにする。多くも少なくもしない ・前置きと感想は書かない。空行も入れない
先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました
(機械採点 format_check){'type': 'line_prefix', 'pattern': '^(ページ[0-9]+[::]|[・\\-])'}/{'type': 'line_count', 'min': 20, 'max': 20}
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中9が正解)
- ChatGPT 第1回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (20.7秒) この回答の全文
- ChatGPT 第2回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (20.3秒) この回答の全文
- ChatGPT 第3回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (20.3秒) この回答の全文
- Gemini 第1回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (19.4秒) この回答の全文
- Gemini 第2回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (19.3秒) この回答の全文
- Gemini 第3回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (19.2秒) この回答の全文
- Claude 第1回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (47.9秒) この回答の全文
- Claude 第2回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (41.8秒) この回答の全文
- Claude 第3回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行) (47.7秒) この回答の全文
- Copilot 第1回 不正解
- 形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行) (17.1秒) この回答の全文
- Copilot 第2回 不正解
- 形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行) (17.1秒) この回答の全文
- Copilot 第3回 不正解
- 形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行) (17秒) この回答の全文
次の条件の資料の構成を、マークダウンの表にしてください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商… 採点の型:format_check 字数・形式・件数の決まりを守ったか
-
ChatGPT
- ChatGPT 第1回 不正解 20.6秒
- ChatGPT 第2回 不正解 20.4秒
- ChatGPT 第3回 不正解 17.3秒
3試行中0が正解
-
Gemini
- Gemini 第1回 不正解 19.3秒
- Gemini 第2回 不正解 22.3秒
- Gemini 第3回 不正解 19.3秒
3試行中0が正解
-
Claude
- Claude 第1回 不正解 32.4秒
- Claude 第2回 不正解 32.4秒
- Claude 第3回 不正解 29.4秒
3試行中0が正解
-
Copilot
- Copilot 第1回 不正解 20.2秒
- Copilot 第2回 不正解 17.1秒
- Copilot 第3回 不正解 17.3秒
3試行中0が正解
課題の全文この文をそのまま4つのAIへ送りました(281字)
次の条件の資料の構成を、マークダウンの表にしてください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・列はちょうど2つ。ページ / タイトル の順にする ・行は条件のページ数ちょうど(見出しの行と区切りの行を除く) ・表だけを出す。前置きと説明は書かない
先に決めた正解課題を作った時点で決めています。4つのAI中0つが1回でも正解しました
(機械採点 format_check){'type': 'table_cols', 'value': 2}/{'type': 'line_count', 'min': 7, 'max': 7}
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中0が正解)
- ChatGPT 第1回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ×(行数 6/7〜7行) (20.6秒) この回答の全文
- ChatGPT 第2回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ×(行数 6/7〜7行) (20.4秒) この回答の全文
- ChatGPT 第3回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ×(行数 6/7〜7行) (17.3秒) この回答の全文
- Gemini 第1回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ×(行数 6/7〜7行) (19.3秒) この回答の全文
- Gemini 第2回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ×(行数 6/7〜7行) (22.3秒) この回答の全文
- Gemini 第3回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ×(行数 26/7〜7行) (19.3秒) この回答の全文
- Claude 第1回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ○(行数 7/7〜7行) (32.4秒) この回答の全文
- Claude 第2回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ○(行数 7/7〜7行) (32.4秒) この回答の全文
- Claude 第3回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ○(行数 7/7〜7行) (29.4秒) この回答の全文
- Copilot 第1回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ×(行数 21/7〜7行) (20.2秒) この回答の全文
- Copilot 第2回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ×(行数 21/7〜7行) (17.1秒) この回答の全文
- Copilot 第3回 不正解
- 形式が違う:table_cols ×(表が無い)/line_count ×(行数 21/7〜7行) (17.3秒) この回答の全文
次の条件で、資料の骨子を作ってください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:E… 採点の型:format_check 字数・形式・件数の決まりを守ったか
-
ChatGPT
- ChatGPT 第1回 正解 23.6秒
- ChatGPT 第2回 正解 23.5秒
- ChatGPT 第3回 正解 20.5秒
3試行中3が正解
-
Gemini
- Gemini 第1回 正解 19.2秒
- Gemini 第2回 正解 19.2秒
- Gemini 第3回 正解 19.4秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 47.9秒
- Claude 第2回 正解 47.8秒
- Claude 第3回 正解 51秒
3試行中3が正解
-
Copilot
- Copilot 第1回 不正解 17.1秒
- Copilot 第2回 不正解 17.1秒
- Copilot 第3回 不正解 17.3秒
3試行中0が正解
課題の全文この文をそのまま4つのAIへ送りました(330字)
次の条件で、資料の骨子を作ってください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・1ページにつき ページN: タイトル の行を1行、その下に ・ で始まる箇条書きの行を条件の数だけ書く ・ページ数・箇条書きの数は条件のとおりちょうどにする ・どの行も46文字を超えない ・数字を入れられるところは数字を入れる。前置きと感想は書かない。空行も入れない
先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました
(機械採点 format_check){'type': 'line_prefix', 'pattern': '^(ページ[0-9]+[::]|[・\\-])'}/{'type': 'line_count', 'min': 20, 'max': 20}/{'type': 'max_line_chars', 'value': 46}
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中9が正解)
- ChatGPT 第1回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (23.6秒) この回答の全文
- ChatGPT 第2回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (23.5秒) この回答の全文
- ChatGPT 第3回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (20.5秒) この回答の全文
- Gemini 第1回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (19.2秒) この回答の全文
- Gemini 第2回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (19.2秒) この回答の全文
- Gemini 第3回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (19.4秒) この回答の全文
- Claude 第1回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (47.9秒) この回答の全文
- Claude 第2回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (47.8秒) この回答の全文
- Claude 第3回 正解
- 形式すべて合う:line_prefix ○(形のそろわない行 0/20本)/line_count ○(行数 20/20〜20行)/max_line_chars ○(46文字を超える行 0本) (51秒) この回答の全文
- Copilot 第1回 不正解
- 形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行)/max_line_chars ×(46文字を超える行 1本) (17.1秒) この回答の全文
- Copilot 第2回 不正解
- 形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行)/max_line_chars ×(46文字を超える行 1本) (17.1秒) この回答の全文
- Copilot 第3回 不正解
- 形式が違う:line_prefix ○(形のそろわない行 0/1本)/line_count ×(行数 1/20〜20行)/max_line_chars ×(46文字を超える行 1本) (17.3秒) この回答の全文
次の条件で資料の骨子を作り、JSON だけを出力してください。 ■ 資料の骨子をつくるための条件(架空・株式会社サン… 採点の型:format_check 字数・形式・件数の決まりを守ったか
-
ChatGPT
- ChatGPT 第1回 正解 20.5秒
- ChatGPT 第2回 正解 23.6秒
- ChatGPT 第3回 正解 20.7秒
3試行中3が正解
-
Gemini
- Gemini 第1回 正解 22.5秒
- Gemini 第2回 正解 19.2秒
- Gemini 第3回 正解 19.1秒
3試行中3が正解
-
Claude
- Claude 第1回 不正解 38.6秒
- Claude 第2回 不正解 44.8秒
- Claude 第3回 不正解 41.7秒
3試行中0が正解
-
Copilot
- Copilot 第1回 正解 17.1秒
- Copilot 第2回 正解 20.2秒
- Copilot 第3回 正解 17秒
3試行中3が正解
課題の全文この文をそのまま4つのAIへ送りました(351字)
次の条件で資料の骨子を作り、JSON だけを出力してください。 ■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事) テーマ:ECの年末施策の説明 相手:社内の部長6名 時間:10分 決まり ・ページ数はちょうど 5 ページ ・1ページにつき、タイトル1行と箇条書きちょうど 3 行 ・タイトルは 18 文字以内 ・箇条書きの各行は 40文字以内 ・数字を入れられるところは数字を入れる 書き方 ・出力は JSON だけ。前後に説明文を書かない ・形は {"pages": [{"no": 1, "title": "タイトル", "bullets": ["…"]}]} にする ・pages の数は条件のページ数ちょうどにする ・bullets の数は条件の箇条書きの数ちょうどにする
先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました
(機械採点 format_check){'type': 'json_valid'}/{'type': 'json_keys', 'keys': ['pages']}/{'type': 'json_list_len', 'key': 'pages', 'value': 5}
採点の中身なぜその判定になったかを1試行ずつ出しています(12試行中9が正解)
- ChatGPT 第1回 正解
- 形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (20.5秒) この回答の全文
- ChatGPT 第2回 正解
- 形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (23.6秒) この回答の全文
- ChatGPT 第3回 正解
- 形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (20.7秒) この回答の全文
- Gemini 第1回 正解
- 形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (22.5秒) この回答の全文
- Gemini 第2回 正解
- 形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (19.2秒) この回答の全文
- Gemini 第3回 正解
- 形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (19.1秒) この回答の全文
- Claude 第1回 不正解
- 形式が違う:json_valid ×(JSONとして読めない)/json_keys ×(JSONの形が違う)/json_list_len ×(pages のリストが無い) (38.6秒) この回答の全文
- Claude 第2回 不正解
- 形式が違う:json_valid ×(JSONとして読めない)/json_keys ×(JSONの形が違う)/json_list_len ×(pages のリストが無い) (44.8秒) この回答の全文
- Claude 第3回 不正解
- 形式が違う:json_valid ×(JSONとして読めない)/json_keys ×(JSONの形が違う)/json_list_len ×(pages のリストが無い) (41.7秒) この回答の全文
- Copilot 第1回 正解
- 形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (17.1秒) この回答の全文
- Copilot 第2回 正解
- 形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (20.2秒) この回答の全文
- Copilot 第3回 正解
- 形式すべて合う:json_valid ○(JSONとして読めた)/json_keys ○(キーそろう)/json_list_len ○(pages 5件/5件) (17秒) この回答の全文
ANSWERS
4つのAIの回答の全文
採点のもとになった回答を、手を入れずにそのまま置いています。 読んだ人が同じように数え直せるようにするためです。
-
ChatGPT
18件の回答うち15件が正解
- t1 第1回
- 全文(テキスト) 正解
- t1 第2回
- 全文(テキスト) 正解
- t1 第3回
- 全文(テキスト) 正解
- t2 第1回
- 全文(テキスト) 正解
- t2 第2回
- 全文(テキスト) 正解
- t2 第3回
- 全文(テキスト) 正解
- t3 第1回
- 全文(テキスト) 正解
- t3 第2回
- 全文(テキスト) 正解
- t3 第3回
- 全文(テキスト) 正解
- t4 第1回
- 全文(テキスト) 不正解
- t4 第2回
- 全文(テキスト) 不正解
- t4 第3回
- 全文(テキスト) 不正解
- t5 第1回
- 全文(テキスト) 正解
- t5 第2回
- 全文(テキスト) 正解
- t5 第3回
- 全文(テキスト) 正解
- t6 第1回
- 全文(テキスト) 正解
- t6 第2回
- 全文(テキスト) 正解
- t6 第3回
- 全文(テキスト) 正解
-
Gemini
17件の回答うち14件が正解
- t1 第1回
- 全文(テキスト) 正解
- t1 第2回
- 全文(テキスト) 正解
- t1 第3回
- 全文(テキスト) 正解
- t2 第2回
- 全文(テキスト) 正解
- t2 第3回
- 全文(テキスト) 正解
- t3 第1回
- 全文(テキスト) 正解
- t3 第2回
- 全文(テキスト) 正解
- t3 第3回
- 全文(テキスト) 正解
- t4 第1回
- 全文(テキスト) 不正解
- t4 第2回
- 全文(テキスト) 不正解
- t4 第3回
- 全文(テキスト) 不正解
- t5 第1回
- 全文(テキスト) 正解
- t5 第2回
- 全文(テキスト) 正解
- t5 第3回
- 全文(テキスト) 正解
- t6 第1回
- 全文(テキスト) 正解
- t6 第2回
- 全文(テキスト) 正解
- t6 第3回
- 全文(テキスト) 正解
-
Claude
18件の回答うち11件が正解
- t1 第1回
- 全文(テキスト) 正解
- t1 第2回
- 全文(テキスト) 正解
- t1 第3回
- 全文(テキスト) 正解
- t2 第1回
- 全文(テキスト) 正解
- t2 第2回
- 全文(テキスト) 不正解
- t2 第3回
- 全文(テキスト) 正解
- t3 第1回
- 全文(テキスト) 正解
- t3 第2回
- 全文(テキスト) 正解
- t3 第3回
- 全文(テキスト) 正解
- t4 第1回
- 全文(テキスト) 不正解
- t4 第2回
- 全文(テキスト) 不正解
- t4 第3回
- 全文(テキスト) 不正解
- t5 第1回
- 全文(テキスト) 正解
- t5 第2回
- 全文(テキスト) 正解
- t5 第3回
- 全文(テキスト) 正解
- t6 第1回
- 全文(テキスト) 不正解
- t6 第2回
- 全文(テキスト) 不正解
- t6 第3回
- 全文(テキスト) 不正解
-
Copilot
18件の回答うち5件が正解
- t1 第1回
- 全文(テキスト) 不正解
- t1 第2回
- 全文(テキスト) 不正解
- t1 第3回
- 全文(テキスト) 不正解
- t2 第1回
- 全文(テキスト) 不正解
- t2 第2回
- 全文(テキスト) 正解
- t2 第3回
- 全文(テキスト) 正解
- t3 第1回
- 全文(テキスト) 不正解
- t3 第2回
- 全文(テキスト) 不正解
- t3 第3回
- 全文(テキスト) 不正解
- t4 第1回
- 全文(テキスト) 不正解
- t4 第2回
- 全文(テキスト) 不正解
- t4 第3回
- 全文(テキスト) 不正解
- t5 第1回
- 全文(テキスト) 不正解
- t5 第2回
- 全文(テキスト) 不正解
- t5 第3回
- 全文(テキスト) 不正解
- t6 第1回
- 全文(テキスト) 正解
- t6 第2回
- 全文(テキスト) 正解
- t6 第3回
- 全文(テキスト) 正解
MATERIALS
課題に使った材料
架空の株式会社サンプル商事の社内資料の条件(ページ数・箇条書きの数・字数)。条件は毎回変える この回のために2026年10月2日に作り直したものです。 落として、同じことをやり直せます。
- shiryo_brief.txt 441B
METHOD
測り方
やり直せるように、この回の条件をそのまま書いています。
測ったAIと、そのときのモデル名
AIは中身が黙って変わります。画面に出ていたモデル名と、確認した時刻を残しています。
| AI | プラン | 画面に出ていたモデル名 | 確認した時刻 |
|---|---|---|---|
| ChatGPT | ChatGPT Pro | Medium | 2026-10-02 19:57 |
| Gemini | Google AI Pro | Flash-Lite | 2026-10-02 19:57 |
| Claude | Claude Max | Opus 4.8 高 | 2026-10-02 19:57 |
| Copilot | Microsoft 365 Personal | 2026-10-02 19:57 |
この回でやったこと
- 課題に使う材料を、この回のために作り直しました。架空の会社のデータで、実在の企業・人物は含みません。
- 課題を6問つくり、正解をこの時点で決めました。
- ChatGPT・Gemini・Claude・Copilotへ、同じ課題文と同じ材料を送りました。
- 1問につき3回、毎回あたらしい会話で投げました。
- 投げる順番は回ごとに入れ替えました。時間帯のかたよりが順位に出ないようにするためです。
- 待ち時間は300秒までとし、 過ぎたものは時間切れとして記録しました。
- 採点は機械採点のみ(AIに採点させていない)です。
- 送信した試行はのべ72回、 そのうち有効だったのは72回です。
答えが返らなかったときの数え方
- 断られた・時間切れ
分母に入れて、不正解として数えます。仕事では答えが返らないのと同じためです。
- プランの上限に当たった
分母から外します。その試行は測れなかったものとして扱います。
- 人間確認の画面が出た
そこで止めます。機械で押すことも、避けることもしません。
- AInformation側の操作の失敗
分母から外します。AIの欠点としては書きません。
LIMITS
この測定の限界
数字だけを見て判断されないように、測れていないことを書いています。
- 1日1回の測定である。日や課題が変われば順位は変わる
- プランは各AIの有料版(ChatGPT Pro/Google AI Pro/Claude Max/Microsoft 365 Personal)。無料版の結果ではない
- 既定のモデル・既定のモードだけで測っている(Deep Research などは使っていない)
- 課題は架空の株式会社サンプル商事の自作データ。実在の企業のデータでの結果ではない
- 機械で採点できる課題だけを扱っている。文章のうまさ・読みやすさは測っていない
- ブラウザで人が使うのと同じ画面から測っている。APIの結果ではない
- 画面に出ているモデル名を読み取れないAIがある回は、その欄を空(null)にしている。読み取れた回はそのまま載せている
DATA
公開しているデータ
CSVは1行が1試行です。このページに出している数字は、そのCSVを数え直したものと一致します。 ライセンスは CC BY 4.0 です。
- 最新版(CSV) 1行=1試行 16KB
- 最新版(JSON) 43KB
- v1(公開時の版)(CSV) 1行=1試行 16KB
- v1(公開時の版)(JSON) 43KB
累積の順位表は /data/research/bench/leaderboard.json にあります。 版(v1)は消しません。引用したリンクが切れないようにするためです。
FAQ
よくある質問
- どうやって測っているのですか
- 4つのAIに、まったく同じ課題文と同じ材料を、同じ日のうちに投げています。毎回あたらしい会話を開いて、前の回答を引きずらせません。投げる順番は回ごとに入れ替えています。送信してから回答が止まるまでの秒数もあわせて記録しています。
- なぜ同じ課題を3回も投げるのですか
- AIは同じ質問でも答えが変わるためです。1回だけの結果では、それが実力なのか偶然なのかが分かりません。3回投げて、結論が一致した割合を再現率として出しています。
- 採点は誰がしているのですか
- プログラムだけで採点しています。AIには採点させていません。正解は課題を作る時点で決めてあり、数値の一致・語句の有無・形式の適合・URLが実際に開けるか・数式を実行した結果で決まります。好き嫌いは点にしていません。
- 課題に使っているデータは実在の会社のものですか
- いいえ。架空の会社のデータを毎回あたらしく作っています。実在の企業・人物・他社の文章は使っていません。使った材料はそのまま配っているので、同じことをやり直せます。
- AIが答えられなかったときはどう数えていますか
- 断られた・時間切れは分母に入れて不正解として数えます。プランの上限に当たった・人間確認の画面が出たときは分母から外し、その回は測れなかったものとして扱います。AInformation側の操作の失敗も分母から外し、AIの欠点としては書きません。
- 使っているのは無料版ですか、有料版ですか
- 各AIの有料プランを、ブラウザの画面から使っています。APIではありません。プラン名と、画面に出ていたモデル名・確認した時刻を回ごとに記録しています。
- この順位は、どのAIがいちばん賢いかを表していますか
- いいえ。測っているのは決まった仕事の課題での正解率・所要時間・再現率・出典の実在率・指示の遵守率の5つだけです。書き味や読みやすさ、長い会話でのふるまいは測っていません。課題が変われば順位も変わります。
- 引用してもいいですか
- はい。CC BY 4.0 です。出典として「AInformation調べ AI実務ベンチ」と、使ったページのURL・測定日を書いてください。集計はJSONとCSVでも取れます。1行1試行のCSVを見れば、載せている数字を数え直せます。
CITATION
この測定を引用する
出典:AInformation調べ「AI実務ベンチ 決められた枚数と字数で資料の骨子を作る(4AI・6課題・各3回)」(https://ainformation.jp/research/bench/kossi-2026-10-03) 測定日 2026年10月3日 6課題・各3回・有効な試行72回
コピーしました
数字を引くときは、分母(何試行中いくつか)も一緒に書いてください。 出典として AInformation調べ と、使ったページのURL・測定日を書いてください。
関連するページ
AIの最新ニュースを週1回まとめてお届け
その週に出た主要なAIニュースと、編集部が実際に試したツールを1通にまとめます。