本文へ移動
NEWS
AI実務ベンチ

【実測】議事録を4AIに72回投げるとCopilotだけ指示を4回守らなかった

読了 約17分
ピンクゴールドのノートパソコンの画面にWindows 11のカラフルな花形の壁紙が表示されている写真
この記事の要点

同じ会議記録をChatGPT・Gemini・Claude・Microsoft Copilotに6課題×各3回投げて機械だけで採点しました。正解率100.0%はChatGPTとClaudeの同率で、Microsoft Copilotだけ指示を18試行中4試行守りませんでした。

SHARE
藤井俊太のアバター

AI導入コンサルタント

藤井俊太(Shunta Fujii)

AIのスペシャリストとして、最新のAI情報を常にキャッチ、アップデートしている。自らもAI導入コンサルタントとして活動し、主に生成AIを駆使した業務効率化、生産性向上、新規事業開発を行なっている。
AIの総合情報サイト「AInformation」は、AIに関する情報やサービスを解説・紹介するWebメディア。運営と記事の確認は藤井俊太が1人で行っています。藤井俊太のプロフィール

...続きを読む

同じ会議記録をChatGPT・Gemini・Claude・Microsoft Copilotに6課題×各3回投げて機械だけで採点しました。正解率100.0%はChatGPTとClaudeの同率で、Microsoft Copilotだけ指示を18試行中4試行守りませんでした。

18試行中18ChatGPTとClaudeが正解した数
13.8秒Copilotの所要時間の中央値で4AIの中でいちばん速い
77.8%Copilotの指示の遵守率で4AIの中でいちばん低い
この記事で分かること
  • 同じ会議記録をChatGPT・Gemini・Claude・Microsoft Copilotに6課題×各3回=72試行投げて機械だけで採点した結果
  • 正解率はChatGPTとClaudeが18試行中18試行(100.0%)で同率だった
  • いちばん差が出たのは「やること」の抽出で、Microsoft Copilotだけ3回とも正解できなかった
  • 所要時間の中央値はMicrosoft Copilotの13.8秒がいちばん速く、Geminiの28.2秒がいちばん遅い
  • 指示どおりの形で返す遵守率はMicrosoft Copilotだけ18試行中14試行(77.8%)で、ほかの3つは100.0%だった
  • 出典の実在率はURLを見る課題がないのでこの回では測っていない

正解率はChatGPTとClaudeが100.0%で同率だった

AInformation編集部は2026年9月24日に、架空の株式会社サンプル商事の会議記録をChatGPT・Gemini・Claude・Microsoft Copilotの4つのAIへ投げました。議事録から決定事項ややることを抜き出す6課題を各3回ずつ投げて、合計72試行を機械だけで採点しています。

正解率がいちばん高かったのはChatGPTとClaudeです。どちらも18試行中18試行(100.0%)で同率でした。GeminiとMicrosoft Copilotは18試行中15試行(83.3%)です。この回では1位が決まらず同率です。

いちばん差が出たのは「やること」の抽出でした。ChatGPT・Gemini・Claudeは3回中2回以上正解しましたが、Microsoft Copilotだけは3回とも不正解です。正解の4件をすべて見落として、指示にない項目を作り足していました。

正解率は同率でも速さが違った。ChatGPT。Claude。正解率。100.0%。100.0%。中央値。20.0秒。15.3秒。再現率。100.0%。100.0%。どちらも18試行中18試行が正解。AInformation編集部が作ったイラスト図解(2本の対決(実アイコン大+◎△))
正解率は同率でも速さが違った

所要時間の中央値はMicrosoft Copilotが13.8秒でいちばん速く、次がClaudeの15.3秒です。ChatGPTは20.0秒、Geminiは28.2秒でした。速さとは逆に、指示どおりの形で返す遵守率はMicrosoft Copilotだけが18試行中14試行(77.8%)にとどまっています。ほかの3つは18試行中18試行(100.0%)でした。

課題の全文・4つのAIの回答72本・1行=1試行の採点表(CSV)・画面はすべてこの回の採点表と回答の全文から確認できます。出典として使うときは「AInformation調べ」と測定日(2026年9月24日)を書いてください。

6課題×3回×4AIの72回を機械だけで採点した

課題の材料はAInformation編集部が毎回作り直す架空の株式会社サンプル商事の会議記録です。決定事項・やること・保留・報告・雑談が1つの記録に混ざっていて、AIがそれを正しく分けられるかを見ます。実在の企業のデータは使っていません。

課題は6つあります。「決まったこと」だけを抜き出す課題(易)と「やること」を担当者・期限つきで抜き出す課題(易)が2つ。「決めなかったこと」を抜き出す課題(中)と会議の基本情報3問に答える課題(中)が2つ。3つの見出しに分けて整理する課題(難)と決定事項をJSON形式で出力する課題(難)が2つです。

毎回あたらしい会話を開いて順番も入れ替えた

4つのAIにはそれぞれ毎回あたらしい会話を開いて課題を投げました。投げる順番は3回の繰り返しごとに入れ替えています。1回目はChatGPT→Gemini→Claude→Microsoft Copilotの順、2回目はGemini→Claude→Microsoft Copilot→ChatGPTの順です。順番による有利・不利をなくすためです。

こんな検証をしました。6課題を各3回ずつ機械で採点した。対象。4つのAI(有料版)。方法。同じ課題を各3回投げ機械だけで採点。時点。2026年9月24日。72試行を機械だけで採点した。AIに採点させていない。AInformation編集部が作ったイラスト図解(「こんな検証をしました」の場面)
6課題を各3回ずつ機械で採点した

採点はすべて機械(プログラム)が行いました。正解は課題を作る時点で決めてあります。AIに採点させていません。使ったプランはChatGPT Pro・Google AI Pro・Claude Max・Microsoft 365 Personalの有料版です。無料版の結果ではありません。時間切れは300秒(5分)に設定しましたが、この回では時間切れになった試行はありませんでした。

「決まったこと」の抽出は4AIとも3回正解した

最初の課題は会議記録から「決まったこと」だけを抜き出す易しい課題です。正解は5件あります。倉庫の短期アルバイト24名の募集と商品Aのパッケージに洗濯回数の目安50回と書くことが2件。残り3件は仙台の展示会に出展せず10月5日にオンライン商談会を開くこと、年末のギフトを商品Eの詰め合わせ3,860円に絞ること、商品Cを11月から3%値上げすることです。

ChatGPTの会話画面。決定1から決定5まで通し番号で箇条書きしている
ChatGPTが決定事項5件を通し番号つきで抜き出した画面 AInformation編集部が2026年9月24日にChatGPTを操作した画面

この課題では4つのAIすべてが3回とも全問正解しました。差が出ていません。「決まったこと」と「やること」と「保留」が明確に分かれている会議記録なら、どのAIでも正確に抜き出せます。

「やること」の抽出でMicrosoft Copilotだけ3回とも外した

2つ目の課題は「誰が・何を・いつまでに」やることだけを抜き出す課題です。正解は4件あります。小林さんがギフトの写真撮影を12月25日までに終えることとECの年末特集ページを10月5日に公開することの2件。残り2件は加藤さんが付属品の原価を11月20日までに共有することと田中さんが物件の賃料を交渉して11月の会議で報告することです。

ChatGPTとClaudeは3回とも全問正解でした。Geminiは2回正解して3回目だけ4件中3件の正解で、加藤さんのやることを1件落としています。

Microsoft Copilotはこの課題で3回とも不正解でした。1回目は正解の4件中0件しか一致せず、指示にない項目を4件作り足しています。2回目も同じく0件一致で4件の作り足しです。3回目はようやく1件一致しましたが、それでも3件の作り足しがありました。Microsoft Copilotは会議の「決定事項」と「担当者に頼んだやること」の区別がつかず、別のカテゴリの内容を返し続けました。

Microsoft Copilotの会話画面。やることの一覧を出しているが正解の4件と一致していない
Copilotがやることの抽出で正解と一致しなかった画面 AInformation編集部が2026年9月24日にMicrosoft Copilotを操作した画面
Claudeの会話画面。担当者名と期限つきでやることを4件抜き出している
Claudeがやることを担当者・期限つきで4件正解した画面 AInformation編集部が2026年9月24日にClaudeを操作した画面

この課題は「決まったこと」の抽出と同じ易しい課題ですが、「やること」のほうが条件が細かいです。「担当者の名前を呼んで頼んだもの(◯◯さん、…お願いします)だけ」という指定があります。Microsoft Copilotはこの細かい条件を守れず、決まったことまで含めてしまいました。

投げた課題の文を載せます。読者の方もこの文をそのままAIに貼って試せます。

次の会議記録から、「誰が・何を・いつまでに」やることだけを抜き出してください。

決まり
・1件につき1行。行の形は 担当者名: 何をするか(期限) にする
・「やること」は担当者の名前を呼んで頼んだもの(◯◯さん、…お願いします)だけ
・決まったこと・報告・「今日は決めません」と言われたものは入れない
・期限は記録に書いてあるとおりに書く
・前置きと感想は書かない。抜き出した行だけを出す

—- 会議記録 ここから —-
■ 商品企画・販売の定例会議(2026年9月24日 10:00〜11:30 会議室B)
出席:小林、中村、加藤、田中、渡辺、伊藤
書記:伊藤
※この記録は AInformation編集部 がAIの検証のために作った架空のものです。実在の会社・人物とは関係ありません。

■ やりとり

渡辺:倉庫の稼働は今のところ問題ありません。9月の第3週は出荷が集中する見込みです。
渡辺:ノベルティの制作も今日は決めません。予算が決まっていないので保留にします。
小林:倉庫の短期アルバイトは24名で決まりです。時給1,150円、募集開始は11月20日にします。
伊藤:先月の社内アンケートでは、在宅勤務を続けたい人が61%でした。結果は全員へ共有ずみです。
伊藤:ECの12月の売上は10,000千円でした。前の年の同じ月より26%多い数字です。
伊藤:加藤さん、付属品の原価を確かめて、11月20日までに共有してください。
伊藤:田中さん、物件の賃料を先方と交渉して、11月の会議で報告してください。
中村:物流倉庫をもう1か所増やす件は、今日は決めません。候補地の家賃を調べてから次回に回します。
加藤:取引先から、納期を今の11日から3日へ縮められないかと聞かれました。工場からは難しいという回答をもらっています。
田中:来期の組織の話は今日は決めません。今日の議題ではないので次回へ回します。
加藤:新しいカタログの入稿は9月20日にすませました。表紙の写真も差し替えずみです。
加藤:商品A(タンブラー)のパッケージと商品ページに、洗濯回数の目安を50回程度と大きく書きます。次の生産からです。
小林:仙台の展示会には出展しません。かわりに自社のオンライン商談会を10月5日に開きます。
加藤:先週のクレームは26件でした。前の月より3件多く、原因は縫製のほつれが13件、残りは配送中の箱つぶれです。
加藤:コピー用紙は先週発注しました。今月中に届きます。
加藤:年末のギフトは1本に絞ります。商品E(保温ボトル)の詰め合わせ、3,860円です。2本セットの案は今回は見送ります。
伊藤:小林さん、ECの年末特集ページの公開は10月5日でお願いします。
加藤:商品C(冷感タオル)は11月から3%値上げします。取引先へは11月25日までに案内を出します。
伊藤:小林さん、ギフトの写真撮影の手配をお願いします。12月25日までに撮影を終えてください。

■ 次回 10月8日 10:00〜 会議室B

以上
—- 会議記録 ここまで —-

保留と基本情報の中くらいの課題は4AIとも安定した

「決めなかったこと」の抽出は全員が3回正解した

3つ目の課題は「この会議では決めなかったこと」だけを抜き出す課題です。正解は3件あります。ノベルティの制作、物流倉庫をもう1か所増やす件、来期の組織の話の3つです。どれも記録の中に「今日は決めません」と書いてあります。

Geminiの会話画面。保留1から保留3まで正しく抜き出している
Geminiが保留事項を3件正確に抜き出した画面 AInformation編集部が2026年9月24日にGeminiを操作した画面

この課題は4つのAIすべてが3回とも全問正解しました。「今日は決めません」という明確な言い方が記録にあるので、見落としにくかったと考えられます。

基本情報3問も全員正解したがCopilotだけ形式が違った

4つ目の課題は次回の日程(10月8日)・書記の名前(伊藤)・出席人数(6名)の3問に答える課題です。指示では「答えはちょうど3行。説明は書かない」としています。

4つのAIとも3回すべて正解しました。ただしMicrosoft Copilotは3回とも「説明は書かない」の指示を守らず、回答に補足の説明文を付け足しました。答えの中身は合っていますが形式が違います。これが指示の遵守率に影響しています。

Microsoft Copilotの会話画面。3項目は正解だが指示にない補足を書いている
Copilotは正解だが指示にない説明文を付け足した画面 AInformation編集部が2026年9月24日にMicrosoft Copilotを操作した画面

ChatGPT・Gemini・Claudeは3回とも「次回: 10月8日 10:00」「書記: 伊藤」「出席人数: 6名」の3行だけを返しました。Microsoft Copilotは同じ3行に加えて出席者の名前や会議室の情報を書き足しています。答えが正解なのに形式が違う試行が、18試行中4試行ありました。

3分類の難しい課題でGeminiは1回断られた

「決まったこと・やること・決めなかったこと」の3見出しに分ける課題

5つ目の課題は会議記録を「決まったこと」「やること」「決めなかったこと」の3つの見出しに分けて整理する難しい課題です。正解は決まったこと5件、やること4件、決めなかったこと3件の合計12件です。課題1〜3の内容を1回で全部正確に分ける必要があるので難度が高くなっています。

ChatGPTとClaudeは3回とも全正解です。Microsoft Copilotもこの課題では3回とも正解しました。課題2の「やること」単独では3回とも外したMicrosoft Copilotが、3分類としてまとめて聞くと正解できています。

Geminiだけこの課題で問題が出ました。1回目はポリシーを理由に回答を断られています。会議記録という日常的な業務の材料で断られたのは意外な結果です。断られるまでに67.9秒かかりました。2回目は全正解でしたが、3回目は「やること」の見出しに1件余計な項目を足したため不正解になりました。

6課題×4AIの正解・不正解(○=正解、×=不正解、各3回)

課題 ChatGPT Gemini Claude Copilot
t1 決定事項(易) ○○○ ○○○ ○○○ ○○○
t2 やること(易) ○○○ ○○× ○○○ ×××
t3 保留(中) ○○○ ○○○ ○○○ ○○○
t4 基本情報(中) ○○○ ○○○ ○○○ ○○○
t5 3分類(難) ○○○ ×○× ○○○ ○○○
t6 JSON(難) ○○○ ○○○ ○○○ ○○○
データ:AInformation調べ(2026年9月24日) / 制作:AInformation

投げた課題の文を載せます(会議記録は課題2と同じ内容です)。

次の会議記録を、3つに分けて整理してください。

決まり
・見出しは ■決まったこと ■やること ■決めなかったこと の3つだけを、この順で使う
・どの見出しの下も、1件につき1行の箇条書き(行の先頭は ・)にする
・決まったこと=この会議で決めた方針。やること=担当者の名前を呼んで頼んだもの(◯◯さん、…お願いします)。
 決めなかったこと=「今日は決めません」と言われたもの
・すでに終わったことの報告・数字の共有・次回の日程はどこにも書かない
・やることは 担当者名: 何をするか(期限) の形にする
・記録に出てくる数字は落とさずに書く。前置きと感想は書かない

(以下に課題2と同じ会議記録を貼ります。全文は上のコピーまたはデータページからご覧ください)

Geminiの会話画面。回答を断っている
Geminiが3分類の課題でポリシーを理由に断った画面 AInformation編集部が2026年9月24日にGeminiを操作した画面
ChatGPTの会話画面。決まったこと・やること・決めなかったことの3つに分けている
ChatGPTが3分類を正確に整理した画面 AInformation編集部が2026年9月24日にChatGPTを操作した画面
Claudeの会話画面。3つの見出しに分けて箇条書きしている
Claudeも3分類を3回とも正解した画面 AInformation編集部が2026年9月24日にClaudeを操作した画面

JSON出力は4AIとも3回正解した

6つ目の課題は決定事項をJSON形式で出力する課題です。正解の5件は課題1と同じですが、出力形式として{"decisions": [{"no": 1, "text": "決まった中身"}]}の形を指定しています。

4つのAIすべてが3回とも正解しました。JSON形式の出力はどのAIでも安定しています。プログラムで読み取れる形式で返してほしい場面では、4つのAIに大きな差はありません。

ChatGPTの会話画面。JSON形式で5件の決定事項を出力している
ChatGPTが決定事項をJSON形式で正確に出力した画面 AInformation編集部が2026年9月24日にChatGPTを操作した画面
Microsoft Copilotの会話画面。JSON形式で決定事項を出力している
CopilotもJSON出力は3回とも正解した画面 AInformation編集部が2026年9月24日にMicrosoft Copilotを操作した画面

5つの指標で見るとMicrosoft Copilotだけ指示の遵守率が77.8%だった

正解率 — ChatGPTとClaudeが100.0%で並んだ

正解率はChatGPTが18試行中18試行(100.0%)、Claudeも18試行中18試行(100.0%)で同率です。Geminiは18試行中15試行(83.3%)、Microsoft Copilotも18試行中15試行(83.3%)でした。

所要時間 — Microsoft Copilotの13.8秒がいちばん速い

所要時間の中央値はMicrosoft Copilotが13.8秒でいちばん速いです。次がClaudeの15.3秒、ChatGPTの20.0秒と続きます。Geminiが28.2秒でいちばん遅い結果でした。所要時間の幅はCopilotが13.7秒から17.2秒、Claudeが13.7秒から22.9秒です。ChatGPTが13.9秒から30.0秒で、Geminiが19.0秒から49.9秒でした。

4AIの所要時間の中央値

Copilot 13.8秒
Claude 15.3秒
ChatGPT 20.0秒
Gemini 28.2秒
データ:AInformation調べ(2026年9月24日・各18試行) / 制作:AInformation

再現率 — ChatGPTとClaudeが100.0%で安定した

再現率(同じ課題を3回投げて結論がそろうか)はChatGPTが100.0%、Claudeも100.0%でした。3回とも同じ結論が返っています。Geminiは88.9%、Microsoft Copilotも88.9%です。3回中1回だけ結論が変わる課題がありました。

出典の実在率 — この回では測っていない

出典の実在率はこの回では測っていません。議事録から情報を抜き出す課題にはURLを確認する場面がないためです。出典の実在率が意味を持つのは調べものやファクトチェックの課題です。

指示の遵守率 — Microsoft Copilotだけ77.8%だった

指示どおりの形式で返したかを見る指示の遵守率は、ChatGPT・Gemini・Claudeの3つが18試行中18試行(100.0%)でした。Microsoft Copilotだけ18試行中14試行(77.8%)です。

Microsoft Copilotが指示を守らなかった4試行の内訳は、課題1(決定事項の抽出)で1試行、課題4(基本情報3問)で3試行です。どちらも答えの中身は合っていますが、「前置きと感想は書かない」「説明は書かない」という指示に反して補足文を付け足していました。

議事録の整理は正確さ重視ならChatGPTかClaudeになる

今回の72試行の結果から、議事録の整理をどのAIに任せるかを場面ごとに整理します。

正確さ重視なら、ChatGPTかClaudeです。どちらも18試行中18試行(100.0%)で全正解しました。再現率も100.0%なので、3回投げても答えが揺れません。

速さ重視なら、Microsoft Copilotが13.8秒でいちばん速いです。ただし指示の遵守率が18試行中14試行(77.8%)なので、返ってきた答えの形式を自分で確認する手間がかかります。「やること」の抽出でも3回とも外しているため、Microsoft Copilotの出力はそのまま使わず元の記録と突き合わせてください。

やり直しの少なさ重視なら、ChatGPTかClaudeです。再現率が100.0%なので、何回投げても同じ結論が返ります。Geminiは88.9%で、たまに結論が変わることがありました。

Copilotは速いが正確さに差が出た。Microsoft Copilot。M365個人版。正解した課題。決定事項の抽出(3回正解)。保留事項の抽出(3回正解)。JSON出力(3回正解)。不正解・違反。やることの抽出(3回とも不正解)。指示どおりの形で返す(4回違反)。所要時間は4AIの中でいちばん速い。AInformation編集部が作ったイラスト図解(1本のできる/できない)
Copilotは速いが正確さに差が出た

ただしこれは2026年9月24日の1回の測定の結果です。日や課題が変われば順位は変わります。どのAIを選んでも、抜き出した結果は元の会議記録と突き合わせてから使うことをおすすめします。

1回の測定の限界 — 日や課題が変われば順位は変わる

この測定は1日1回の検証です。日や課題が変われば順位は変わります。これは「AI実務ベンチ」のすべての回に共通する限界です。

使ったプランはChatGPT Pro・Google AI Pro・Claude Max・Microsoft 365 Personalの有料版です。無料版の結果ではありません。無料版では違う結果になる可能性があります。

課題は架空の株式会社サンプル商事の自作データです。実在の企業のデータでの結果ではありません。既定のモデル・既定のモードだけで測っていて、Deep Researchのような特別なモードは使っていません。

ブラウザで人が使うのと同じ画面から測っています。APIの結果ではありません。機械で採点できる課題だけを扱っているので、文章のうまさや読みやすさは測っていません。

読者の方がこの結果を数え直すこともできます。課題の全文・4つのAIの回答72本・1行=1試行の採点表(CSV)・画面はすべてこの回の採点表と回答の全文からダウンロードできます。

関連する記事とAIツール

藤井俊太(AI導入コンサルタント)の見方

議事録の「決まったこと」と「やること」の抜き出しは4つのAIともおおむね正確でした。ただしMicrosoft Copilotだけは「やること」を3回とも間違え、指示の遵守率も18試行中14試行(77.8%)にとどまっています。会議のあとにAIへ貼って使う場面は増えていますが、抜き出した結果は元の記録と突き合わせてから使うのが安全です。

よくある質問
この測定でいちばん正確だったAIはどれですか?
ChatGPTとClaudeが同率で正解率18試行中18試行(100.0%)でした。ただしこれは2026年9月24日の1回の測定の結果です。日や課題が変われば順位は変わります。再現率もどちらも100.0%で、3回投げても答えが揺れませんでした。
いちばん速く答えたAIはどれですか?
所要時間の中央値はMicrosoft Copilotの13.8秒がいちばん速く、次がClaudeの15.3秒でした。ただしMicrosoft Copilotは指示の遵守率が18試行中14試行(77.8%)で、速いかわりに指示どおりの形で返さないことがありました。
同じ議事録を何回投げても同じ答えが返りますか?
再現率(同じ課題を3回投げて結論がそろうか)はChatGPTとClaudeが100.0%でした。GeminiとMicrosoft Copilotは88.9%で、3回中1回だけ結論が変わる課題がありました。再現率が100%でなくても正解していることはあります。
無料版でも同じ結果になりますか?
この測定ではChatGPT Pro・Google AI Pro・Claude Max・Microsoft 365 Personalの有料プランだけで測っています。無料版での結果は測っていないので分かりません。有料版と無料版ではモデルが違うことがあるため、同じ結果にならない可能性があります。
採点はAIがやっていますか?
いいえ。正解は課題を作る時点で決めてあり、採点はすべて機械(プログラム)が行っています。AIに採点させていません。課題の全文と採点表はデータページからダウンロードして数え直すことができます。
SHARE

広告を載せており、そこから申し込みがあると紹介料を受け取ることがあります。

この記事に出てくるAIも、まとめて比べられます 493本のAIツールを、やりたいこと・料金・日本語対応で絞り込めるデータベースです。5日ごとに料金を取り直しています。 AIツールを探す

あわせて読みたいRELATED