本文へ移動
NEWS
AI実務ベンチ

資料作成AIのおすすめを4つ比較!骨子づくりのプロンプト3つ

読了 約24分
Copilotの正解は18回中5回だった。資料の骨子づくりで4つのAIを比較
この記事の要点

資料の骨子を作る6課題を4つのAIへ各3回投げ、機械だけで採点しました。正解率はChatGPTが18試行中15試行(83.3%)で最も高い結果です。Microsoft Copilotは18試行中5試行で、行を分ける課題では答えの改行が消えて1行につながりました。

SHARE
藤井俊太のアバター

AI導入コンサルタント

藤井俊太(Shunta Fujii)

AIのスペシャリストとして、最新のAI情報を常にキャッチ、アップデートしている。自らもAI導入コンサルタントとして活動し、主に生成AIを駆使した業務効率化、生産性向上、新規事業開発を行なっている。
AIの総合情報サイト「AInformation」は、AIに関する情報やサービスを解説・紹介するWebメディア。運営と記事の確認は藤井俊太が1人で行っています。藤井俊太のプロフィール

...続きを読む

資料の骨子を作る6課題を4つのAIへ各3回投げ、機械だけで採点しました。正解率はChatGPTが18試行中15試行(83.3%)で最も高い結果です。Microsoft Copilotは18試行中5試行で、行を分ける課題では答えの改行が消えて1行につながりました。

15試行ChatGPTが18試行のうち正解した数(正解率83.3%で4つの中で最も高い)
5試行Microsoft Copilotが18試行のうち正解した数。課題1・3・5は改行が消えて3回とも×
35.5秒Claudeの所要時間の中央値で4つの中で最も長い。Copilotは17.1秒
この記事で分かること
  • 資料の骨子を作る6課題を2026年10月3日に4つのAIへ各3回投げ、72試行を機械だけで採点した結果
  • 正解率はChatGPTが18試行中15試行(83.3%)で最も高く、Geminiが18試行中14試行(77.8%)で続いた
  • Microsoft Copilotは18試行中5試行(27.8%)で、タイトル5行や骨子20行の答えは改行が消えて1行につながった
  • Claudeは18試行中11試行(61.1%)で、JSONの課題は答えの前に余分な行が残って3回とも×だった
  • 所要時間の中央値はMicrosoft Copilotの17.1秒が最も短く、Claudeは35.5秒かかった
  • タイトルだけ・20行の骨子・JSONの3つの課題文を、そのままコピーして使える形で載せた

資料作成AIの比較はChatGPTが18試行中15試行で最多だった

資料の骨子づくりを任せるなら、どのAIが決まりを守ってくれるのか。AInformation編集部は2026年10月3日に、ChatGPT・Gemini・Claude・Microsoft Copilotの4つへ同じ6課題を3回ずつ投げました。機械だけで採点すると、正解率はChatGPTが18試行中15試行(83.3%)で最も高くなりました。

ほかの3つのAIの正解の数は次のとおりです。

  • Gemini:18試行中14試行(77.8%)
  • Claude:18試行中11試行(61.1%)
  • Microsoft Copilot:18試行中5試行(27.8%)

いちばん差が出たのは、答えの改行でした。課題1はページのタイトルを5行で書く課題で、課題3と課題5は20行の骨子を作る課題です。この3つで、Microsoft Copilotの答えは3回とも1行につながっていました。採点は行の数を見るので、どれも×になっています。ほかの3つのAIは、同じ課題を3回とも決まりどおりの行数で返しました。

Claudeは、JSONで書き出す課題6を3回とも落としました。採点が読んだ答えの先頭に読み上げ用の行の残りや途中経過の1行が入り、JSONとして読めないと判定されたためです。所要時間の中央値もClaudeは35.5秒で、4つの中で最も長くかかりました。

一方で、マークダウンの表を頼んだ課題4は4つのAIとも3試行中0試行でした。画面には表が出ていましたが、採点は表と数えていません。この課題は4つの差を測れていないものとして読んでください。くわしくは課題4の章に書きました。

この記事の数字は採点表のままです。1回の測定なので、日や課題が変われば順位は変わります。1回ごとの答えと採点の理由は、この回の採点表と回答の全文で数え直せます。

資料の骨子づくり6課題を4つのAIへ3回ずつ投げた

まずは、何をどう測ったのかです。材料は、架空の株式会社サンプル商事の社内資料の条件です。AIのテスト用に編集部が作った会社で、実在しません。6課題とも、次の同じ条件を使いました。

  • テーマ:ECの年末施策の説明
  • 相手:社内の部長6名
  • 時間:10分
  • ページ数:ちょうど5ページ
  • 1ページの中身:タイトル1行と箇条書きちょうど3行
  • 文字数:タイトルは18文字以内で箇条書きの各行は40文字以内
  • 数字:入れられるところは数字を入れる

課題は易・中・難を2つずつ用意しました。どれも同じ資料について、答えの形だけを変えています。

  • 課題1(易):各ページのタイトルだけを5行で書く
  • 課題2(易):何について話す資料かを1行で答える
  • 課題3(中):ページN: タイトルの行と・で始まる箇条書きで骨子を書く
  • 課題4(中):ページとタイトルの2列のマークダウンの表にする
  • 課題5(難):課題3の形に加えて、どの行も46文字を超えないようにする
  • 課題6(難):決めた形のJSONだけを書き出す
こんな検証をしました。資料の骨子づくりを4つのAIに72回投げた。対象。架空の会社の社内資料の条件。方法。6課題を各3回・機械だけで採点。時点。2026年10月3日・72試行。正解率はChatGPTの83.3%が最高。AIに採点させず形を機械で数えた。AInformation編集部が作ったイラスト図解(「こんな検証をしました」の場面)
資料の骨子づくりを4つのAIに72回投げた

毎回あたらしい会話を開いて順番も入れ替えた

1回ごとにあたらしい会話を開き、課題の文をそのまま送りました。投げる順番は、3回の繰り返しごとに入れ替えています。

  • 1回目:ChatGPT→Gemini→Claude→Microsoft Copilot
  • 2回目:Gemini→Claude→Microsoft Copilot→ChatGPT
  • 3回目:Claude→Microsoft Copilot→ChatGPT→Gemini

測る前には4つとも、「はい」とだけ返してもらう空打ちを1回しています。この回は採点にも所要時間にも入れていません。答えを待つ上限は300秒(5分)でした。

採点は機械だけでAIには採点させていない

採点は機械だけで行い、AIには採点させていません。正解の形は、課題を作る時点で決まっています。課題2は、テーマの「ECの年末施策の説明」が答えに入っているかを見ました。残りの課題は、答えの形を次の物差しで数えています。

  • 行の数(課題1は5行で、課題3と課題5は20行)
  • 1行の文字数(課題1は18文字まで、課題5は46文字まで)
  • 行の頭の形(ページN: か・で始まる)
  • 表の列の数と行の数(課題4)
  • JSONとして読めるかと、pagesがちょうど5件か(課題6)

見ているのは形だけです。箇条書きの中身がうまいかや、数字がもっともらしいかは採点していません。時間切れの試行は不正解として分母に入れ、この回に分母から外した試行はありませんでした。

画面から読み取った答えには、読み上げ用の1行や考えている途中の要約が混ざることがあります。そこで採点の前に、答えの先頭で繰り返された行を落としました。処理は4つのAIとも同じで、落とす前の答えもデータページに置いています。ただし落としきれずに残った行もあり、課題6のClaudeの採点に響きました。

4つのAIは有料版の既定のモデルのまま使った

使ったプランと、画面に出ていたモデルの表示は次のとおりです。

  • ChatGPT:ChatGPT Pro(表示は「Medium」)
  • Gemini:Google AI Pro(表示は「Flash-Lite」)
  • Claude:Claude Max(表示は「Opus 4.8 高」)
  • Microsoft Copilot:Microsoft 365 Personal(モデル名は画面から読み取れなかった)

どれも既定のモデルと既定のモードのままで、Deep Researchのような機能は使っていません。無料版の結果ではない点に気をつけてください。無料版と有料版で何が変わるかは、ChatGPTの無料版と有料版の違いの記事にまとめています。

なおMicrosoft Copilotの答えは、この記事では画面ではなく文字で紹介します。

6課題の○×はCopilotの改行とClaudeのJSONで分かれた

どの課題で差が出たのか。4つのAIの○×が分かれたのは、行の数を見る課題とJSONの課題でした。6課題の結果を表にまとめます。○は正解で、×は不正解です。時はGeminiの時間切れで、これも不正解に数えました。

6課題×各3回の結果(○正解・×不正解・時=時間切れ)

課題 ChatGPT Gemini Claude Microsoft Copilot
課題1 タイトル5行(易) ○○○ ○○○ ○○○ ×××
課題2 テーマの1行(易) ○○○ 時○○ ○×○ ×○○
課題3 骨子20行(中) ○○○ ○○○ ○○○ ×××
課題4 マークダウンの表(中) ××× ××× ××× ×××
課題5 骨子20行・46文字以内(難) ○○○ ○○○ ○○○ ×××
課題6 JSON(難) ○○○ ○○○ ××× ○○○
正解の数 18試行中15 18試行中14 18試行中11 18試行中5
データ:AInformation調べ(2026年10月3日・72試行) / 制作:AInformation

課題ごとに読むと次のとおりです。

  • 課題1(タイトル5行):ChatGPT・Gemini・Claudeは3回とも○で、Microsoft Copilotは3回とも×
  • 課題2(テーマの1行):ChatGPTだけが3回とも○で、ほかの3つは1回ずつ×
  • 課題3(骨子20行):課題1と同じで、Microsoft Copilotだけが3回とも×
  • 課題4(マークダウンの表):4つのAIとも3回とも×
  • 課題5(骨子20行・46文字以内):課題3と同じで、Microsoft Copilotだけが3回とも×
  • 課題6(JSON):Claudeだけが3回とも×で、ほかの3つは3回とも○

課題4を除くと、ChatGPTはすべての試行で○でした。Geminiが課題4のほかに×になったのは、課題2の1回目だけです。この1回は、答えの良し悪しとは別の理由で落ちています。表の1マスごとの答えと採点の理由は、この回の採点表と回答の全文で確かめられます。

課題2のGeminiの時間切れは依頼の文が送られていなかった

課題2は、条件の資料が何について話す資料かを1行で答える課題です。正解はテーマの「ECの年末施策の説明」でした。ChatGPTは3回とも、この10文字だけを返しています。

Geminiの1回目は、300.5秒で時間切れになりました。ただ画面を見ると、依頼の文は入力欄に残ったままです。会話は始まっておらず、Geminiの答えを測れた試行ではありません。採点表では決まりどおり、時間切れの不正解として分母に入れています。

Geminiの画面。課題2の依頼の文が入力欄に残ったままで、送信ボタンの上に送信の札が出ている
Geminiの入力欄に課題2の依頼の文が残り、送信の札が出ている画面 AInformation編集部が2026年10月3日にGeminiを操作した画面

Microsoft Copilotの1回目は、答えを見ると依頼の文が届いていませんでした。Copilotの答えは、HTMLの改行タグが送られたようだという内容です。続けて「ご質問や依頼内容をもう一度送ってください。」と返していました。採点表では不正解で、指示の遵守も×に数えています。

Claudeの2回目は、テーマを「EC(ネット通販)の年末施策の説明資料です。」と言い換えました。条件に書いてあるとおりの言葉が入っていないので×です。1回目は「株式会社サンプル商事のECの年末施策の説明」をかぎかっこに入れて答え、正解に数えました。

Copilotは課題1・3・5で改行が消えて3回とも×だった

骨子を行ごとに書いてほしいとき、AIは行を分けて返してくれるのか。この回のMicrosoft Copilotは、行を分ける課題1・課題3・課題5で毎回1行にまとめて返しました。ChatGPT・Gemini・Claudeは同じ課題を、3回とも決まりどおりの行数で返しています。

課題1はタイトル5行を18文字以内で書く

課題1は、資料の各ページのタイトルだけを書く課題です。投げた文は次のとおりで、そのままコピーして試せます。

次の条件を読んで、資料の各ページのタイトルだけを書いてください。

■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事)

テーマ:ECの年末施策の説明
相手:社内の部長6名
時間:10分

決まり
・ページ数はちょうど 5 ページ
・1ページにつき、タイトル1行と箇条書きちょうど 3 行
・タイトルは 18 文字以内
・箇条書きの各行は 40文字以内
・数字を入れられるところは数字を入れる

書き方
・1ページにつき1行。タイトルの文字だけを書く
・行数は条件のページ数ちょうどにする
・1行の文字数は条件のタイトルの上限を超えない
・番号・記号・前置きは付けない

正解の形は、18文字以内のタイトルが5行並ぶ答えです。ChatGPTの1回目は「年末EC施策の全体像」から「期待効果と確認事項」までの5行でした。ChatGPTの所要時間は、3回とも17.2〜17.6秒に収まっています。

ChatGPTの会話画面。年末EC施策の全体像から期待効果と確認事項まで、タイトルを1行ずつ5行で答えている
ChatGPTが課題1で各ページのタイトルを5行で返した画面 AInformation編集部が2026年10月3日にChatGPTを操作した画面

Microsoft Copilotの答えは、5つのタイトルが空白でつながった1行でした。1回目の答えは「年末EC施策の目的 市場動向と商機 施策全体像 販促強化プラン 目標と実行体制」です。採点表の理由は「行数 1」と「18文字を超える行 1本」でした。タイトルが1つずつ短くても、1行につながると18文字を超えてしまいます。

課題5は20行の骨子をどの行も46文字以内で書く

課題3と課題5は、ページN: タイトルの行と・で始まる箇条書きで骨子を作る課題です。正解の形は、全部でちょうど20行になる答えでした。難の課題5には、どの行も46文字を超えない決まりを足しています。

次の条件で、資料の骨子を作ってください。

■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事)

テーマ:ECの年末施策の説明
相手:社内の部長6名
時間:10分

決まり
・ページ数はちょうど 5 ページ
・1ページにつき、タイトル1行と箇条書きちょうど 3 行
・タイトルは 18 文字以内
・箇条書きの各行は 40文字以内
・数字を入れられるところは数字を入れる

書き方
・1ページにつき ページN: タイトル の行を1行、その下に ・ で始まる箇条書きの行を条件の数だけ書く
・ページ数・箇条書きの数は条件のとおりちょうどにする
・どの行も46文字を超えない
・数字を入れられるところは数字を入れる。前置きと感想は書かない。空行も入れない

ChatGPT・Gemini・Claudeは、課題3も課題5も3回とも○でした。ChatGPTの課題5の1回目は「ページ1: 年末EC施策の全体方針」から始まる20行です。数字を入れる決まりにも沿って、「売上目標は前年同期比120%の達成を目指す」のような行が並びました。

ChatGPTの会話画面。ページ1: 年末EC施策の全体方針から始まり、各ページの下に・の箇条書きが3行ずつ並んでいる
ChatGPTが課題5でページ1からページ5までの骨子を20行で返した画面 AInformation編集部が2026年10月3日にChatGPTを操作した画面

Geminiの課題3の答えも、ページ1からページ5まで・の箇条書きが3行ずつ並ぶ20行でした。課題5のGeminiは箇条書きが長めで、1回目の答えは全部で651字です。それでも46文字を超える行は無く、3回とも○でした。

Geminiの会話画面。ページ1: 年末施策の概要と目標から始まり、各ページの下に・の箇条書きが3行ずつ並んでいる
Geminiが課題3で各ページに箇条書き3行の骨子を返した画面 AInformation編集部が2026年10月3日にGeminiを操作した画面

Microsoft Copilotは、ここでも3回とも1行でした。課題5の1回目は「ページ1: 年末施策の目的 ・年末商戦でEC売上120%を目指す」のように、ページと箇条書きが空白でつながっています。課題3と課題5の1回目は、画面でも改行の無い1つの段落で表示されていました。行の頭の形は合っていましたが、行数は1と判定されています。

骨子の依頼に返ってきた答えの形。5ページ×箇条書き3行の骨子を作って。ChatGPT。3回とも20行に分けて返した。Claude。3回とも20行・どれも40秒超。Microsoft Copilot。改行が消えて1つの段落になった。Copilotだけ行がつながった。課題3と課題5の3回ずつの結果。AInformation編集部が作ったイラスト図解(同じ質問への各AIの答え)
骨子の依頼に返ってきた答えの形

なぜ改行が消えたのかは、この測定では分かりません。JSONで書き出す課題6は、1行のままでも読める形です。Microsoft Copilotはその課題6を3回とも正解しました。

Claudeは20行の骨子で毎回40秒を超えた

Claudeは課題3と課題5を3回とも○で通しましたが、時間がかかりました。所要時間は課題3が41.8〜47.9秒で、課題5は47.8〜51秒です。同じ2つの課題を、ChatGPTは20.3〜23.6秒で返しています。Geminiは19.2〜19.4秒でした。

Claudeの会話画面。答えの上に出力形式の最終確認を実施中という灰色の1行があり、その下にページ1から5の骨子が並んでいる
Claudeが課題5で20行の骨子を返し、上に灰色の途中経過の1行が出た画面 AInformation編集部が2026年10月3日にClaudeを操作した画面

Claudeの画面では、答えの上に灰色の1行が出ます。課題5の1回目は「出力形式の最終確認を実施中」でした。答えの本文とは別に出る、考えている途中の要約です。この要約の行は、次の課題6の採点にも響きました。

課題6のJSONはClaudeだけ余分な行が残って3回とも×

骨子をJSONで受け取れば、表計算や別のツールへそのまま流せます。では、JSONだけを返してくれるのはどれか。課題6はChatGPT・Gemini・Microsoft Copilotが3回とも○で、Claudeは3回とも×でした。

次の条件で資料の骨子を作り、JSON だけを出力してください。

■ 資料の骨子をつくるための条件(架空・株式会社サンプル商事)

テーマ:ECの年末施策の説明
相手:社内の部長6名
時間:10分

決まり
・ページ数はちょうど 5 ページ
・1ページにつき、タイトル1行と箇条書きちょうど 3 行
・タイトルは 18 文字以内
・箇条書きの各行は 40文字以内
・数字を入れられるところは数字を入れる

書き方
・出力は JSON だけ。前後に説明文を書かない
・形は {"pages": [{"no": 1, "title": "タイトル", "bullets": ["…"]}]} にする
・pages の数は条件のページ数ちょうどにする
・bullets の数は条件の箇条書きの数ちょうどにする

正解の条件は次の3つです。

  • JSONとして読める
  • pagesのキーがある
  • pagesの数がちょうど5件

ChatGPTは3回とも、前後に説明を付けずにJSONのかたまりだけを返しました。所要時間は20.5〜23.6秒です。Geminiは1つの項目ごとに改行を入れた形で返し、こちらも3回とも読めました。Microsoft Copilotも3回とも○で、所要時間は17〜20.2秒でした。

ChatGPTの会話画面。pagesから始まるJSONのかたまりだけが表示され、前後に説明の文が無い
ChatGPTが課題6で前後の説明なしにJSONだけを返した画面 AInformation編集部が2026年10月3日にChatGPTを操作した画面

ClaudeはJSONの前に読み上げ用の行と要約が残った

Claudeの3回は、採点表の理由がどれも「JSONとして読めない」でした。採点が読んだ答えには、JSONの本体の前に次の2つが残っています。

  • 読み上げ用の行の残り:JSONの書き出しを写した行で、途中が「…」で切れている
  • 考えている途中の要約の1行:1回目は「5ページ目の構成を検討中。」で、3回目は「在庫と物流の文字数を確認中。」

採点の前に落とすのは、読み上げ用の行の頭にある「Claudeが返答しました:」の部分だけです。続く書きかけのJSONが残ったため、答え全体がJSONとして読めないと判定されました。読み上げ用の行は画面には出ず、読み取った文字にだけ入っています。

画面では、JSONの上に灰色の要約の1行が出ているだけでした。JSONの本体には、pagesに5ページ分が並んでいます。

Claudeの会話画面。5ページ目の構成を検討中という灰色の1行の下に、pagesから始まるJSONが表示されている
Claudeの課題6の答え。JSONの上に途中経過の灰色の1行が出ている AInformation編集部が2026年10月3日にClaudeを操作した画面

コピーボタンで取った答えにこれらの行が入るかどうかは、この測定では確かめていません。Claudeの答えを別のツールへ流すなら、先頭の行を確かめてから貼ると安心です。

Claudeの骨子づくりで通ったことと落ちたこと。Claude。Claude Max。通った。タイトル5行は3回とも○。20行の骨子は課題3・5で○。落ちた。JSONの前に余分な行が残り×。テーマを言い換えた回が1回。中央値35.5秒で4つの中で最長。AInformation編集部が作ったイラスト図解(1本のできる/できない)
Claudeの骨子づくりで通ったことと落ちたこと

課題4の表は4つのAIとも0試行で差を測れなかった

骨子をマークダウンの表でもらえるのか。課題4はページとタイトルの2列の表を頼む課題で、4つのAIとも3試行中0試行でした。ただしこの0試行は、AIが表を作れなかったという意味ではありません。

1回目の画面を見ると、ChatGPT・Gemini・Claudeの答えにはページとタイトルの2列の表が出ていました。どれも5ページ分のタイトルが入っています。Microsoft Copilotの画面は、この記事には載せていません。

Geminiの会話画面。ページとタイトルの2列の表に、1から5までのページとタイトルが並んでいる
Geminiが課題4でページとタイトルの2列の表を返した画面 AInformation編集部が2026年10月3日にGeminiを操作した画面

採点は、画面から読み取った文字に | で区切ったマークダウンの表の行があるかを見ています。画面に表として出た答えは、読み取ると | の無い文字になりました。そのため4つのAIとも、3回とも理由は「表が無い」です。

行の数も、決まりの7行に合ったのはClaudeだけでした。Claudeは表の上の途中経過の1行まで読み取られ、ちょうど7行になっています。ChatGPTは3回とも6行と数えられました。Microsoft Copilotは読み取った答えに箇条書きの行まで入り、3回とも21行です。Geminiも3回目は箇条書きが入り、26行と数えられました。

Claudeの会話画面。表の2列構成を確認する灰色の1行の下に、ページとタイトルの2列の表とスプレッドシートを作成のボタンがある
Claudeが課題4で2列の表を返し、上に途中経過の1行が出ている画面 AInformation編集部が2026年10月3日にClaudeを操作した画面

表で骨子をもらう使い方では、この回は4つの差を測れていません。表がほしいときは、貼り付け先で列が2つに分かれているかを確かめてください。Claudeの画面には、表の下に「スプレッドシートを作成」のボタンも出ていました。

5つの指標の比較は正解率と所要時間で差が開いた

正解率のほかに、AInformation編集部は4つの指標を測っています。5つを並べると、差が大きく開いたのは正解率と所要時間でした。再現率と指示の遵守率は、4つのAIとも88.9%以上です。出典の実在率は、この分野ではURLを見る課題が無いので測っていません。

正解率はChatGPTが83.3%でCopilotが27.8%

正解率は、6課題×3回の18試行のうち正解した割合です。ChatGPTが18試行中15試行(83.3%)で最も高く、Geminiは18試行中14試行(77.8%)でした。Claudeは18試行中11試行(61.1%)です。Microsoft Copilotは18試行中5試行(27.8%)で、4つの中でいちばん低くなりました。

正解率(18試行のうち正解した割合)

ChatGPT 18試行中15(83.3%)
Gemini 18試行中14(77.8%)
Claude 18試行中11(61.1%)
Microsoft Copilot 18試行中5(27.8%)
データ:AInformation調べ(2026年10月3日・72試行) / 制作:AInformation

所要時間の中央値はCopilotの17.1秒が最短

所要時間は、1試行ごとにかかった秒数の真ん中の値(中央値)で比べています。最も短かったのはMicrosoft Copilotの17.1秒です。Geminiは19.3秒で、ChatGPTは20.4秒でした。Claudeは35.5秒で、いちばん長い試行は課題5の3回目の51秒です。

Geminiは時間切れの1試行を除くと、19.1〜22.5秒に収まっています。ばらつきが小さいのはGeminiで、Claudeは13.9〜51秒と幅が広くなりました。そのClaudeも1行で答える課題2では、13.9〜14.1秒と4つの中で最も速く答えています。

所要時間の中央値(短いほど速い)

ChatGPT 20.4秒
Gemini 19.3秒
Claude 35.5秒
Microsoft Copilot 17.1秒
データ:AInformation調べ(2026年10月3日・72試行) / 制作:AInformation

再現率はChatGPTとGeminiが100%

再現率は、同じ課題を3回投げたときに結果がそろったかの割合です。ChatGPTとGeminiは100%で、ClaudeとMicrosoft Copilotは88.9%でした。下がった2つは、どちらも課題2で3回のうち1回だけ結果が違っています。Claudeは言い換えた2回目で、Microsoft Copilotは依頼の文が届かなかった1回目でした。

Microsoft Copilotの課題1・課題3・課題5は3回とも×でしたが、3回そろって同じ×です。そのため再現率は下げていません。再現率は毎回同じ答え方をするかを表す数字です。正しいかどうかは正解率で見てください。

再現率(同じ課題3回で結果がそろった割合)

ChatGPT 100%
Gemini 100%
Claude 88.9%
Microsoft Copilot 88.9%
データ:AInformation調べ(2026年10月3日・72試行) / 制作:AInformation

指示の遵守率はCopilotの94.4%を除いて100%

指示の遵守率は、答えの外側の書き方の決まりを守ったかの割合です。この分野で見たのは次の3つでした。

  • 課題1・課題3・課題4・課題5:答えをコードの枠(“`)で囲まない
  • 課題2:答えはちょうど1行で80文字まで
  • 課題6:答えは2500文字まで

ChatGPT・Gemini・Claudeは100%でした。Microsoft Copilotの94.4%は、依頼の文が届かなかった課題2の1回目だけが×になった結果です。行が1つにつながった答えも、コードの枠では囲んでいないので遵守は○でした。改行の崩れは、遵守率ではなく正解率のほうに表れています。

指示の遵守率(書き方の決まりを守った割合)

ChatGPT 100%
Gemini 100%
Claude 100%
Microsoft Copilot 94.4%
データ:AInformation調べ(2026年10月3日・72試行) / 制作:AInformation

出典の実在率はこの分野では測っていない

出典の実在率は、AIが示したURLが実際に開けるかを見る指標です。資料の骨子づくりの6課題にはURLを見る課題が無いため、4つとも測っていません。表や横棒にも数字を入れていません。

骨子をそのまま使うならChatGPTとGeminiが崩れにくかった

では、資料の骨子づくりはどれに任せればよいのか。この回の実測から、使い方ごとに分けて書きます。1回の測定の結果なので、決める前に手元でも同じ文を試してください。

行の形を崩したくないならChatGPTかGemini

タイトルの行や箇条書きを、そのままスライドへ貼りたい人向けです。ChatGPTは課題4を除くすべての試行で○で、再現率も100%でした。Geminiも課題4と、送信が通らなかった1回を除けば全部○です。所要時間の中央値は、ChatGPTが20.4秒でGeminiが19.3秒でした。

JSONで受け取るならClaudeは先頭の行に気をつける

骨子をJSONで受け取って別のツールへ流すなら、ChatGPT・Gemini・Microsoft Copilotが3回とも形どおりでした。Claudeも画面にはJSONの本体を出していましたが、採点が読んだ答えにはJSONの前に余分な行が残っていました。Claudeを使うときは、貼る前に先頭の行を確かめる手順を入れておいてください。

速さを取るならCopilotだが改行を確かめる

所要時間の中央値が最も短かったのは、Microsoft Copilotの17.1秒です。ただ行を分ける課題では、答えが1行につながりました。Microsoft Copilotで骨子を作るなら、貼り付けたあとにページごとの改行を入れ直す前提で使うことになります。JSONで受け取る使い方なら、この回は3回とも形どおりでした。

Claudeは行の形を守るが時間がかかる

Claudeは課題1・課題3・課題5を、3回とも決まりどおりの行数で返しました。一方で所要時間の中央値は35.5秒で、ほかの3つより長くかかります。課題2では、テーマを言い換えた回が1回ありました。条件の言葉をそのまま使ってほしい場面では、答えの言葉を一度見直してください。

資料の骨子づくりはこの使い分け。行の形のまま貼りたい。ChatGPT。課題4以外は全試行で○。JSONで別のツールへ。Gemini。JSONは3回とも形どおり。とにかく早く下書き。Microsoft Copilot。中央値17.1秒・改行に注意。1回の測定で日や課題が変われば変わる。AInformation編集部が作ったイラスト図解(こんな人→このツール)
資料の骨子づくりはこの使い分け

この測定の限界は1日1回と有料版と画面からの採点

この記事の数字は、2026年10月3日の1回の測定から出したものです。読むときに気をつけてほしい点を、測定の決まりから挙げます。

  • 1日1回の測定です。日や課題が変われば順位は変わります
  • プランは各AIの有料版で、無料版の結果ではありません
  • 既定のモデルと既定のモードだけで測り、Deep Researchなどは使っていません
  • 課題は架空の株式会社サンプル商事の自作データで、実在の企業のデータではありません
  • 機械で採点できる形だけを見ています。箇条書きの中身のうまさや読みやすさは測っていません
  • ブラウザで人が使うのと同じ画面から測っていて、APIの結果ではありません
  • 画面にモデル名が出なかったMicrosoft Copilotは、モデルの欄を空にしています

この回だけの注意もあります。どれも採点表のまま載せていて、数え直してはいません。

  • 課題4は画面に出た表を採点が表と数えられず、4つのAIとも×になった
  • Geminiの課題2の1回目は依頼の文が送られないまま、時間切れに数えている
  • Microsoft Copilotの課題2の1回目は依頼の文が届かず、不正解に数えている

課題の全文と答えと採点表はデータページから落とせる

課題の全文・材料・4つのAIの答えの全文・1行=1試行の採点表(CSV)・撮った画面は、データページから落とせます。同じ数え方で読者が確かめられるようにするためです。1回ごとの答えと採点の理由は、この回の採点表と回答の全文から見られます。

数字を引用するときは、出典としてAInformation調べとデータページのURL・測定日を書いてください。データはCC BY 4.0で公開しています。同じ連載では、議事録・翻訳・画像の読み取り・表の集計も同じ方法で測りました。

関連する記事とツール

藤井俊太(AI導入コンサルタント)の見方

資料の骨子をAIに任せるときは、中身より先に形が崩れていないかを見てください。この回の差は、行の区切りとJSONの前に残る余分な行という形の部分で出ました。骨子をそのままスライドに貼るなら、表の課題4を除く全試行で○だったChatGPTが扱いやすい結果です。速さで選ぶならMicrosoft Copilotです。ただ行が1つにつながる答えが続いたので、貼る前に改行を確かめる手順を入れておくと作業が止まりません。

よくある質問
資料の骨子づくりでいちばん正確だったAIはどれですか?
この回はChatGPTです。6課題を各3回投げて、18試行のうち15試行(83.3%)が正解でした。Geminiは18試行中14試行(77.8%)で、Claudeは18試行中11試行(61.1%)です。Microsoft Copilotは18試行中5試行(27.8%)でした。ChatGPTが×になったのは表の課題4だけで、この課題は4つのAIとも0試行です。2026年10月3日の1回の測定なので、日や課題が変われば順位は変わります。
Microsoft Copilotで資料の骨子を作ると改行が消えるのですか?
この回は消えました。Copilotの答えは課題1・課題3・課題5で、3回とも1行につながっています。課題1はタイトル5行で、課題3と課題5は20行の骨子を作る課題です。課題3と課題5の1回目は画面でも改行の無い1つの段落で表示され、行の数を見る採点ではどれも×でした。JSONで書き出す課題6は3回とも正解です。なぜ改行が消えたのかは、この測定では分かりません。
ClaudeはJSONを出せないのですか?
JSONの本体は画面に出ていました。採点が読み取った答えでは、本体の前に2つの行が残っています。読み上げ用の行に入っていた書きかけのJSONと、「5ページ目の構成を検討中。」のような途中経過の1行です。そのため3回とも「JSONとして読めない」と判定されました。コピーボタンで取った答えにこれらの行が入るかは、この測定では確かめていません。
マークダウンの表を頼んだ課題4が4つとも0試行なのはなぜですか?
画面に出た表を、採点が表と数えられなかったためです。ChatGPT・Gemini・Claudeの1回目の画面には、ページとタイトルの2列の表が出ていました。採点は読み取った文字に | で区切った表の行があるかを見ます。表として表示された答えは読み取ると | が残らず、4つとも「表が無い」と判定されました。この課題では4つのAIの差を測れていません。
無料版のAIでも同じ結果になりますか?
この測定では確かめていません。使ったのはChatGPT Pro・Google AI Pro・Claude Max・Microsoft 365 Personalの有料版で、既定のモデルとモードのままです。ブラウザの画面から測ったので、APIで使ったときの結果でもありません。課題の全文はこの記事とデータページにあるので、手元のプランで同じ文を試せます。
SHARE

広告を載せており、そこから申し込みがあると紹介料を受け取ることがあります。

この記事に出てくるAIも、まとめて比べられます 496本のAIツールを、やりたいこと・料金・日本語対応で絞り込めるデータベースです。7日ごとに料金を取り直しています。 AIツールを探す

あわせて読みたいRELATED