本文へ移動
NEWS

生成AI比較表

ChatGPT・Gemini・Claude・Copilotの4つに、AInformation編集部が同じ課題を同じ文で投げて比べた結果です。AI実務ベンチ(プログラムで採点)の7分野と4AI検証ラボ(記事ごとの実測)の4機能を、調べ方ごとに検証した日つきの表にしました。機能の名前を押すと、測り方と答えの全文が載った元の記事へ飛びます。

検証した日は行ごとに書いています。2026年10月3日の検証まで反映

11機能 比べた機能
454回 同じ課題を投げた回数
9本 くわしく書いた記事
よく使う条件

11の機能を比べた生成AIの比較表

生成AIの正解率を7分野で比較

AI実務ベンチ。6つの課題を3回ずつ同じ文で投げ、プログラムだけで採点した正解率です。太い青字がその分野の1位です。

分野ChatGPTGeminiClaudeCopilot測った日
画像・写真の読み取り 100% 83.3% 100% 測れず
PDF・決算書の読み取り 100% 73.3% 100% 測っていない
議事録・要約 100% 83.3% 100% 83.3%
調べもの・事実確認 100% 22.2% 測れず 72.2%
英文・翻訳 83.3% 16.7% 50% 55.6%
表計算・集計 100% 50% 83.3% 100%
資料の骨子づくり 83.3% 77.8% 61.1% 27.8%

生成AIを4つの機能で試して比較

4AI検証ラボ。易・中・難の3つの課題を1回ずつ投げ、答えを記事で確かめました。○△×は課題ごとの正しさで、太い青字が記事で出した1位です。

機能ChatGPTGeminiClaudeCopilot測った日
画像生成 試せず ○3 ○1 △2 ○1 △2
写真・画像を送って聞く(画像の読み取り) 試せず ○3 ○2 △1 試せず
音声から議事録を作る 試せず ○1 ×1 試せず
文書を一緒に作る・直す(Canvas・Docs・Pages) 試せず スライドだけ 3問とも 2問目と3問目

ChatGPT・Gemini・Claude・Copilotの成績を比較

AI実務ベンチ7分野・のべ424試行を足し上げた累積です。4AI検証ラボの行は数字の取り方が違うので入れていません。いちばん右の列だけは、上の比較表で1位になった機能の数です。

AI正解率かかった秒(中央値)3回とも同じ答え指示どおりの形出典のURLが開けたこの表で1位
ChatGPT117試行・7分野 94.9%18.8秒100%98.1%100% 7機能うち同率4
Claude100試行・7分野 81%21.4秒96.3%78.2%— 4機能うち同率3
Copilot90試行・6分野 67.8%17秒85.6%69.6%93.3% 1機能うち同率1
Gemini117試行・7分野 56.4%29.2秒83.7%77.2%83.3% 3機能

AI実務ベンチで課題と4つの回答の全文を見る ›

このページの作り方

ChatGPT・Gemini・Claude・Copilotの4つを、AInformation編集部が同じ課題で比べた結果を表にまとめています。材料はAI実務ベンチの7分野(のべ424試行)と、4AI検証ラボの比較記事4本(答えまで取れた送信30回)です。

AI実務ベンチは架空の会社の資料を毎回作り直し、4つのAIへ同じ課題を投げています。正解かどうかは数値の一致・語句の有無・形式・URLが開けるかでプログラムが判定し、AIには採点させていません。

4AI検証ラボは1つの機能を易・中・難の3課題で4つのAIへ投げています。かかった秒数と答えの中身は記事で1つずつ確かめ、何を基準にしたかは各記事の検証の条件に書いています。

勝ちの印はベンチでは正解率がいちばん高いAIに付けています(同じ値なら同率)。ラボでは記事で編集部が出した結論に付けています。1回の検証の結果なので、日や課題が変われば順位は変わります。

比較記事は4AI検証ラボに、課題と回答の全文はAI実務ベンチにあります。この表のデータはJSONでも公開しています(CC BY 4.0)。

よくある質問

生成AIを比べると、いちばん正確なのはどれですか?

AI実務ベンチの累積(7分野・のべ424試行)では、正解率がいちばん高かったのはChatGPTの94.9%(117試行中111)でした。2位はClaudeの81%で、Copilotの67.8%とGeminiの56.4%が続きます。ただし機能ごとに勝ち負けは入れ替わります。使いたい機能の行で選んでください。

ChatGPT・Gemini・Claude・Copilotをどうやって比べましたか?

AInformation編集部が4つのAIの有料プランの画面へ、同じ課題を同じ文で投げました。AI実務ベンチは1つの分野につき6課題を3回ずつ投げ、正解かどうかをプログラムだけで判定しています。4AI検証ラボは易・中・難の3課題を1回ずつ投げ、答えを記事の中で1つずつ確かめています。どちらも毎回あたらしい会話から始めています。

無料版でも同じ結果になりますか?

同じになるとは限りません。使ったのはChatGPT Pro・Google AI Pro・ClaudeのMaxプラン・Microsoft 365 Personalで、画面に出ていたモデルの名前を採点表に残しています。無料版は使えるモデルや回数が違うので、答えの速さと正しさも変わります。

「試せず」や「測れず」と書いてあるのはなぜですか?

測れなかった理由は3つです。編集部の操作が止まった回と、プランの上限に当たった回と、人間かどうかの確認が出て止めた回です。AIが答えを間違えたわけではないので、正解率の分母には入れていません。断られた回と時間切れの回はAIの結果なので、分母に入れて不正解として数えています。

この比較表はいつ更新されますか?

4AI検証ラボの比較記事は公開した日のうちに表へ足されます。AI実務ベンチは測った翌日に足されます。同じ機能を測り直したときは新しい結果に入れ替えます。いま載っているのは11の機能で、いちばん新しい検証は2026年10月3日です。データはCC BY 4.0で公開しているので、出典を書けば引用できます。

4AI検証ラボの記事をすべて読む ›

11機能