本文へ移動
NEWS
AI実務ベンチ

エクセル関数AIを4つ比較!そのまま使える数式プロンプト3つ

読了 約25分
Claudeは数式を中央値13.9秒で返した。エクセル関数AIを4つ比較・正解率は3つが100%
この記事の要点

Excelの数式を書く6課題を4つのAIへ各3回投げ、機械だけで採点しました。正解率はChatGPT・Gemini・Claudeが18試行中18試行で並び、Microsoft Copilotは18試行中17試行です。差は速さに出て、中央値はClaudeの13.9秒が最短でした。

SHARE
藤井俊太のアバター

AI導入コンサルタント

藤井俊太(Shunta Fujii)

AIのスペシャリストとして、最新のAI情報を常にキャッチ、アップデートしている。自らもAI導入コンサルタントとして活動し、主に生成AIを駆使した業務効率化、生産性向上、新規事業開発を行なっている。
AInformationは、AIツールの料金や求人、資格を自分で調べて数えているAIのデータメディアです。個人のAI選びにも、企業のAI導入にも使える数字を出しています。運営と記事の確認は藤井俊太が1人で行っています。藤井俊太のプロフィール

...続きを読む

Excelの数式を書く6課題を4つのAIへ各3回投げ、機械だけで採点しました。正解率はChatGPT・Gemini・Claudeが18試行中18試行で並び、Microsoft Copilotは18試行中17試行です。差は速さに出て、中央値はClaudeの13.9秒が最短でした。

18試行中18ChatGPT・Gemini・Claudeが正しい数式を返した数(正解率100%で同率)
13.9秒Claudeの所要時間の中央値で4つの中で最も短い。Geminiは19.1秒
17試行Microsoft Copilotが18試行のうち正解した数。課題5の1回目は数式ではなくHTMLのタグの説明が返った
この記事で分かること
  • Excel・スプレッドシートの数式を書く6課題を2026年10月8日に4つのAIへ各3回投げ、72試行を機械だけで採点した結果
  • 正解率はChatGPT・Gemini・Claudeが18試行中18試行(100.0%)で並び、Microsoft Copilotは18試行中17試行(94.4%)だった
  • 所要時間の中央値はClaudeの13.9秒が最も短く、Geminiだけ19.1秒かかった
  • Microsoft Copilotの×は課題5の1回目だけで、数式ではなくHTMLの改行タグの説明が返っていた
  • 指示の遵守率は採点表でClaudeだけ0.0%(18試行すべて×)だが、撮った画面の答えは6課題とも式1行だった
  • 商品の年間合計・上期の総合計・商品Cの上期合計を出す3つの課題文を、そのままコピーして試せる形で載せた

エクセル関数のAI比較は正解率3つが100.0%で並んだ

表計算の数式をAIに書かせたら、そのまま貼って動くのか。AInformation編集部は2026年10月8日に、ChatGPT・Gemini・Claude・Microsoft Copilotの4つへ同じ6課題を3回ずつ投げました。出てきた数式を実際に計算して答え合わせすると、正解率はChatGPT・Gemini・Claudeの3つが18試行中18試行(100.0%)で並びました。

Microsoft Copilotは18試行中17試行(94.4%)です。落としたのは課題5の1回目だけでした。この1回は数式ではなく、HTMLの改行タグの説明が返ってきています。課題の表とは関係の無い答えで、数式の書き方を間違えて落ちたものではありません。

正解率で差がつかなかったぶん、差は所要時間に出ました。中央値はClaudeが13.9秒で最も短くなっています。Microsoft Copilotは14.1秒で、ChatGPTは14.2秒でした。Geminiは19.1秒で、4つの中でひとりだけ19秒台です。

採点表の数字でいちばん開いたのは、指示の遵守率でした。Claudeだけが18試行すべてで×になり、0.0%です。ただ、撮った画面ではClaudeの答えも6課題とも式1行だけでした。読み取った文字に式のほかに記号5つと「今」の1字が入り、行数が7と数えられたためです。くわしくはClaudeの遵守率の章に書きました。

まとめると、この回の6課題では4つとも数式そのものはほぼ書けています。使い分けの決め手は、速さと答えの形の2つになります。この記事の数字は採点表のままです。1回の測定なので、日や課題が変われば順位は変わります。1回ごとの答えと採点の理由は、この回の採点表と回答の全文で数え直せます。

測り方は数式6課題を4つのAIへ各3回・72試行

材料は架空の株式会社サンプル商事の売上表で、AIのテスト用に編集部が作った実在しない会社です。表は1行目が見出しで、2行目から13行目が2025年1月から12月の12か月ぶんになります。列の中身は次のとおりです。

  • A列:月(2025-01の形)
  • B列からF列:商品A(タンブラー)から商品E(保温ボトル)までの5商品の売上
  • G列:その月の5商品の合計

課題は易・中・難を2つずつ用意しました。どれも同じ表をA1から貼った前提で、数式を1つだけ書いてもらう形です。

  • 課題1(易):商品A(B列)の1年ぶんの合計
  • 課題2(易):1年ぶんの売上の総合計
  • 課題3(中):月の合計の12か月ぶんの平均
  • 課題4(中):月の合計のうち一番大きい値
  • 課題5(難):上期(1月から6月)の総合計
  • 課題6(難):商品C(D列)の上期の合計

6課題とも決まりは同じです。答えはちょうど1行にして、= で始まる数式だけを書くように頼みました。説明と計算結果は書かない決まりです。

こんな検証をしました。数式の6課題を4つのAIに72回投げた。対象。架空の会社の12か月の売上表。方法。6課題を各3回・式を計算して採点。時点。2026年10月8日・72試行。正解率は3つが18試行中18で同率。AIに採点させず式を計算して確かめた。AInformation編集部が作ったイラスト図解(「こんな検証をしました」の場面)
数式の6課題を4つのAIに72回投げた

毎回あたらしい会話を開いて順番も入れ替えた

1回ごとにあたらしい会話を開き、課題の文をそのまま送りました。投げる順番は3回の繰り返しごとに入れ替えています。

  • 1回目:ChatGPT→Gemini→Claude→Microsoft Copilot
  • 2回目:Gemini→Claude→Microsoft Copilot→ChatGPT
  • 3回目:Claude→Microsoft Copilot→ChatGPT→Gemini

測る前には4つとも「はい」とだけ返してもらう空打ちを1回しました。この回は採点にも所要時間にも入れていません。答えを待つ上限は300秒(5分)です。72試行のうち時間切れと断りは0試行で、分母から外した試行もありませんでした。

採点は出てきた数式を実際に計算した

採点は機械だけで行い、AIには採点させていません。答えの中から = で始まる数式を拾い、材料の表で実際に計算します。その値が正解と合えば○です。正解は課題を作った時点で決まっています。課題1なら114600で、課題5なら335800でした。

指示の遵守は、答えの形が決まりどおりかを数えました。見るのは1行だけかどうか(行数)と文字数の上限の2つです。文字数の上限は課題1と課題2が80字でした。課題3と課題4は90字で、課題5と課題6は120字です。

画面から答えを読み取ると、AIによっては読み上げ用の1行や途中経過の要約が答えと同じ枠に入ります。採点の前に、答えの先頭でくり返された行までを落としました。4つとも同じ処理です。落とす前の答えも、データページにそのまま置いています。

プランと画面に出ていたモデル名

4つとも有料のプランを使い、モデルとモードは既定のまま変えていません。画面に出ていたモデル名は次のとおりです。

  • ChatGPT(ChatGPT Pro):Medium
  • Gemini(Google AI Pro):Flash
  • Claude(Claude Max):Opus 4.8 高
  • Microsoft Copilot(Microsoft 365 Personal):画面から読み取れず

6課題×4つのAIの○×で×は課題5の1回だけ

72試行の結果を、課題とAIの○×で並べたのが次の表です。○が正解で、×が不正解を表します。記号の並びは1回目・2回目・3回目の順です。

6課題×各3回の結果(○正解・×不正解)

課題 ChatGPT Gemini Claude Microsoft Copilot
課題1 商品Aの年間合計(易) ○○○ ○○○ ○○○ ○○○
課題2 売上の総合計(易) ○○○ ○○○ ○○○ ○○○
課題3 月の合計の平均(中) ○○○ ○○○ ○○○ ○○○
課題4 月の合計の最大値(中) ○○○ ○○○ ○○○ ○○○
課題5 上期の総合計(難) ○○○ ○○○ ○○○ ×○○
課題6 商品Cの上期合計(難) ○○○ ○○○ ○○○ ○○○
正解の数 18試行中18 18試行中18 18試行中18 18試行中17
データ:AInformation調べ(2026年10月8日・72試行) / 制作:AInformation

×が付いたのは、Microsoft Copilotの課題5の1回目だけでした。ChatGPT・Gemini・Claudeの3つは18試行とも、計算すると正解と同じ値になる数式を返しています。

出てきた数式も、AIの間で同じでした。課題1は4つとも3回とも=SUM(B2:B13)で、課題4は4つとも=MAX(G2:G13)です。同じ課題で別の書き方を選んだAIは、この回はありませんでした。数式が返らなかったCopilotの1回を除くと、6課題とも次の表の式にそろっています。

課題ごとに返ってきた数式と正解

課題 4つのAIが返した数式 正解(式の答え)
課題1 商品Aの年間合計 =SUM(B2:B13) 114600
課題2 売上の総合計 =SUM(G2:G13) 702800
課題3 月の合計の平均 =AVERAGE(G2:G13) 58566.7
課題4 月の合計の最大値 =MAX(G2:G13) 71800
課題5 上期の総合計 =SUM(G2:G7) 335800
課題6 商品Cの上期合計 =SUM(D2:D7) 65100
データ:AInformation調べ(2026年10月8日・72試行) / 制作:AInformation

課題の難しさは、範囲の指定にあります。易の2問は列をまるごと足すだけです。難の2問は1月から6月の行だけを選ぶ必要があり、課題6はさらに商品Cの列も選びます。それでも正解の数式はSUMを1つ使うだけで、関数の組み合わせは要りませんでした。

そのため、この回は難の課題でも4つの差がほとんど出ていません。IFやVLOOKUPのように条件で値を引く関数は、この測定では確かめていません。込み入った数式で差が出るかどうかは、別の回の課題で見る必要があります。

易と中の4課題はSUMとAVERAGEとMAXで4つとも正解した

課題1は商品Aの1年ぶんの合計を出す

課題1は、商品A(B列)の1年ぶんの合計を出す課題です。投げた文は次のとおりで、そのままコピーして試せます。

次の表はスプレッドシートのA1から貼ってあります(1行目が見出し・2行目から13行目がデータ)。
商品A(B列)の1年ぶんの合計を出す数式を1つだけ書いてください。

決まり
・答えはちょうど1行。= で始まる数式だけを書く
・説明と計算結果は書かない

—- 表 ここから —-
月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計
2025-01,9400,13600,10200,14100,5200,52500
2025-02,9400,12800,11100,14400,5200,52900
2025-03,10300,10200,12600,14600,7900,55600
2025-04,9400,7600,10700,14800,11800,54300
2025-05,9400,6000,10500,15100,17000,58000
2025-06,9400,4200,10000,15300,23600,62500
2025-07,9400,3400,9800,15600,31400,69600
2025-08,9400,3400,9100,15800,34100,71800
2025-09,9400,5100,10200,16000,22300,63000
2025-10,9400,8500,9000,16300,10500,53700
2025-11,9400,11900,8200,16500,6600,52600
2025-12,10300,14400,9700,16700,5200,56300
—- 表 ここまで —-

正解はB2からB13を足した114600です。4つのAIとも3回とも=SUM(B2:B13)を返し、計算すると114600になりました。ChatGPTの答えは画面でも式1行だけで、前後に説明はありません。

ChatGPTの会話画面。売上表を送った下に=SUM(B2:B13)の1行だけが表示されている
ChatGPTが課題1に=SUM(B2:B13)の1行だけを返した画面 AInformation編集部が2026年10月8日にChatGPTを操作した画面

所要時間は、AIごとに3回ともよくそろっていました。

  • ChatGPT:14.1〜14.3秒
  • Gemini:19.0〜19.6秒
  • Claude:13.8〜14.0秒
  • Microsoft Copilot:13.9〜17.1秒

課題2は売上の総合計をG列から出す

課題2は1年ぶんの売上の総合計です。表のG列には月ごとの合計が入っているので、G2からG13を足せば答えが出ます。正解は702800でした。4つとも3回とも=SUM(G2:G13)を返しています。

Geminiの会話画面。1年ぶんの売上の総合計を聞く依頼の下に=SUM(G2:G13)が表示されている
Geminiが課題2に=SUM(G2:G13)の1行だけを返した画面 AInformation編集部が2026年10月8日にGeminiを操作した画面

この課題では、Microsoft Copilotの3回目が26.2秒かかりました。72試行の中で最も長い時間です。答えは=SUM(G2:G13)で正しく、時間がかかっても中身はほかの回と同じでした。

課題3と課題4は平均と最大値の関数を選ぶ

中の2問は、足し算ではない関数を選べるかを見ています。課題3は月の合計の平均で、正解は58566.7です。4つとも3回とも=AVERAGE(G2:G13)を返し、計算した値は正解と合いました。

ChatGPTの会話画面。売上表を送った下に=AVERAGE(G2:G13)の1行が表示されている
ChatGPTが課題3に=AVERAGE(G2:G13)を返した画面 AInformation編集部が2026年10月8日にChatGPTを操作した画面

ChatGPTの課題3の1回目は20.4秒でした。ChatGPTの18試行の中では、これが最も長い時間です。2回目は14.4秒で、3回目は14.0秒に戻っています。

課題4は月の合計のうち一番大きい値で、正解は71800です。こちらも4つとも3回とも=MAX(G2:G13)でした。Claudeの答えは画面でも式1行で、所要時間は13.9〜14.2秒です。

Claudeの会話画面。月の合計のうち一番大きい値を聞く依頼の下に=MAX(G2:G13)が表示されている
Claudeが課題4に=MAX(G2:G13)の1行を返した画面 AInformation編集部が2026年10月8日にClaudeを操作した画面

課題5の上期の合計でCopilotが1回だけ×だった

難の課題5は、上期(1月から6月)の総合計です。表の2行目が1月で7行目が6月なので、G2からG7だけを足す必要があります。投げた文は次のとおりです。

次の表はスプレッドシートのA1から貼ってあります(2行目が1月・13行目が12月・G列が月の合計)。
上期(1月から6月)の総合計を出す数式を1つだけ書いてください。

決まり
・答えはちょうど1行。= で始まる数式だけを書く
・説明と計算結果は書かない

—- 表 ここから —-
月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計
2025-01,9400,13600,10200,14100,5200,52500
2025-02,9400,12800,11100,14400,5200,52900
2025-03,10300,10200,12600,14600,7900,55600
2025-04,9400,7600,10700,14800,11800,54300
2025-05,9400,6000,10500,15100,17000,58000
2025-06,9400,4200,10000,15300,23600,62500
2025-07,9400,3400,9800,15600,31400,69600
2025-08,9400,3400,9100,15800,34100,71800
2025-09,9400,5100,10200,16000,22300,63000
2025-10,9400,8500,9000,16300,10500,53700
2025-11,9400,11900,8200,16500,6600,52600
2025-12,10300,14400,9700,16700,5200,56300
—- 表 ここまで —-

正解は335800です。ChatGPT・Gemini・Claudeは3回とも=SUM(G2:G7)を返しました。行の範囲を1月から6月に絞れていて、計算した値も正解と合っています。

上期の合計の数式を3つのAIに聞くと。上期(1月から6月)の総合計を出す数式を1つだけ。ChatGPT。3回とも=SUM(G2:G7)。Gemini。3回とも=SUM(G2:G7)。Microsoft Copilot。1回目はHTMLのタグの説明が返った。数式が無かったのはCopilotの1回だけ。Copilotも2回目と3回目は正解。AInformation編集部が作ったイラスト図解(同じ質問への各AIの答え)
上期の合計の数式を3つのAIに聞くと
ChatGPTの会話画面。売上表を送った下に上期の総合計を出す=SUM(G2:G7)の1行が表示されている
ChatGPTが課題5に=SUM(G2:G7)を返した画面 AInformation編集部が2026年10月8日にChatGPTを操作した画面

Copilotの1回目はHTMLの改行タグの説明が返った

Microsoft Copilotは、2回目と3回目が=SUM(G2:G7)で正解でした。×になったのは1回目です。所要時間は17.1秒で、答えは241文字ありました。中身は数式ではなく、HTMLの改行タグに付ける属性の説明です。

答えの最後には「送信が途中で切れてしまった場合は、やりたいことをもう一度送ってください。」とありました。採点表の理由は「数式(= で始まる式)が答えに無い」です。行数6と文字数226字で、遵守も×になりました。

この1回は、課題の表について何も答えていません。数式の範囲を取り違えたのではなく、課題そのものに答えていない1回です。課題の文がCopilotにどう届いたかは、この測定では確かめていません。採点の決まりどおり分母に入れて×に数えています。

Geminiの会話画面。上期の総合計を出す数式を聞く依頼の下に=SUM(G2:G7)が表示されている
Geminiが課題5に=SUM(G2:G7)を返した画面 AInformation編集部が2026年10月8日にGeminiを操作した画面

この1回で、Microsoft Copilotは再現率も下がりました。再現率は同じ課題を3回投げて、結論がそろうかを見る指標です。課題5だけ3回のうち1回が数式なしになり、Copilotの再現率は88.9%でした。ほかの3つは100.0%です。

課題6は商品Cの列と上期の行を同時に絞る

課題6は、商品C(D列)の上期の合計です。列と行の両方を絞るので、6課題の中で範囲の指定がいちばん細かくなります。投げた文は次のとおりです。

次の表はスプレッドシートのA1から貼ってあります(2行目が1月・13行目が12月・D列が商品C)。
商品Cの上期(1月から6月)の合計を出す数式を1つだけ書いてください。

決まり
・答えはちょうど1行。= で始まる数式だけを書く
・説明と計算結果は書かない

—- 表 ここから —-
月,商品A(タンブラー),商品B(エコバッグ),商品C(冷感タオル),商品D(弁当箱),商品E(保温ボトル),合計
2025-01,9400,13600,10200,14100,5200,52500
2025-02,9400,12800,11100,14400,5200,52900
2025-03,10300,10200,12600,14600,7900,55600
2025-04,9400,7600,10700,14800,11800,54300
2025-05,9400,6000,10500,15100,17000,58000
2025-06,9400,4200,10000,15300,23600,62500
2025-07,9400,3400,9800,15600,31400,69600
2025-08,9400,3400,9100,15800,34100,71800
2025-09,9400,5100,10200,16000,22300,63000
2025-10,9400,8500,9000,16300,10500,53700
2025-11,9400,11900,8200,16500,6600,52600
2025-12,10300,14400,9700,16700,5200,56300
—- 表 ここまで —-

正解は65100です。4つとも3回とも=SUM(D2:D7)を返し、計算した値は65100でした。D列の2行目から7行目だけを足していて、列や行を取り違えたAIはありません。

Geminiの会話画面。商品Cの上期の合計を出す数式を聞く依頼の下に=SUM(D2:D7)が表示されている
Geminiが課題6に=SUM(D2:D7)を返した画面 AInformation編集部が2026年10月8日にGeminiを操作した画面

所要時間は、ほかの課題と同じ並びでした。3回ぶんの秒数は次のとおりです。

  • ChatGPT:16.4秒・14.1秒・14.0秒
  • Gemini:19.4秒・19.0秒・19.1秒
  • Claude:16.5秒・13.8秒・13.9秒
  • Microsoft Copilot:20.6秒・14.0秒・16.9秒

Claudeの1回目は16.5秒で、Claudeの18試行の中では最も長い時間でした。それでも答えは=SUM(D2:D7)の1行です。

Claudeの会話画面。商品Cの上期の合計を聞く依頼の下に=SUM(D2:D7)の1行が表示されている
Claudeが課題6に=SUM(D2:D7)の1行を返した画面 AInformation編集部が2026年10月8日にClaudeを操作した画面

課題6の文には「2行目が1月・13行目が12月・D列が商品C」と、行と列の位置を書いています。課題5も同じように何行目が何月かを書きました。位置を書かずに頼んだときに同じ結果になるかは、この測定では確かめていません。

Claudeの指示の遵守率は採点表で0.0%だった

採点表の数字でいちばん差が開いたのは、指示の遵守率でした。ChatGPTとGeminiは18試行とも決まりどおりで、100.0%です。Microsoft Copilotは課題5の1回目だけ×で、94.4%でした。Claudeは18試行すべてが×になり、0.0%です。

ただし、Claudeの画面に出た答えは式1行だけでした。撮った画面は各課題の1回目で、6課題とも同じ形です。式の下には、コピーや読み上げのボタンが5つ並んでいます。

Claudeの会話画面。=SUM(B2:B13)の1行だけが表示され、その下に小さなボタンが5つ横に並んでいる
Claudeの課題1の答え。=SUM(B2:B13)の1行の下にボタンが5つ並ぶ AInformation編集部が2026年10月8日にClaudeを操作した画面

読み取った文字に記号5つと「今」が入っていた

採点表の理由は、18試行とも「行数7」でした。課題1の文字数は18字で、上限の80字に収まっています。落ちたのは行数だけです。

画面から読み取った答えの全文を見ると、式のあとに文字にならない記号が5つと「今」の1字が並んでいます。式の1行と記号5つと「今」で、ちょうど7行です。記号の数は、画面の式の下にある5つのボタンと同じでした。

課題5の2回目だけは、読み取った文字の頭に「上期の合計範囲を数式で特定中。」という1行もありました。答えを考えている途中の要約です。この行は、採点の前の処理で落とされています。

Claudeの遵守が採点表で×になった流れ。画面の答え。式が1行だけ表示された。文字の読み取り。記号5つと「今」も拾った。行数の検査。行数7で1行の決まりに×。ただし 式は18試行とも計算すると正解と合った。数字だけで決めず答えの全文を見る。AInformation編集部が作ったイラスト図解(仕組みの矢印図(入口→仕組み→結果))
Claudeの遵守が採点表で×になった流れ

つまり、この0.0%はClaudeが説明を書き足した結果ではありません。画面で見る答えは、ChatGPTやGeminiと同じ式1行です。この記事は採点表の数字をそのまま載せています。Claudeの遵守率は、答えの全文と画面を合わせて読んでください。同じ課題の文をClaudeに投げれば、読者も画面の答えで確かめられます。

5つの指標で比べるとGeminiだけ19.1秒かかった

ここからは5つの指標を1つずつ見ます。指標は毎回同じで、次の5つです。

  • 正解率:計算した値が正解と合った割合
  • 所要時間:送ってから答えが出るまでの秒数の中央値
  • 再現率:同じ課題3回で結論がそろった割合
  • 出典の実在率:答えのURLが実際に開けた割合
  • 指示の遵守率:答えの形が決まりどおりだった割合

正解率は3つが18試行中18試行で同率だった

正解率はChatGPT・Gemini・Claudeが18試行中18試行(100.0%)で同率でした。Microsoft Copilotは18試行中17試行(94.4%)です。この回は1つのAIだけを1位とは決めていません。

正解率(18試行のうち正解した割合)

ChatGPT 18試行中18(100.0%)
Gemini 18試行中18(100.0%)
Claude 18試行中18(100.0%)
Microsoft Copilot 18試行中17(94.4%)
データ:AInformation調べ(2026年10月8日・72試行) / 制作:AInformation

所要時間はClaudeが13.9秒でGeminiが19.1秒

中央値は短い順に次のとおりでした。かっこの中は、18試行の中の最短と最長です。

  • Claude:13.9秒(13.8〜16.5秒)
  • Microsoft Copilot:14.1秒(13.9〜26.2秒)
  • ChatGPT:14.2秒(14.0〜20.4秒)
  • Gemini:19.1秒(19.0〜19.6秒)

Claude・Microsoft Copilot・ChatGPTの中央値は13.9〜14.2秒に収まり、ほとんど同じです。Geminiだけが19秒台で、最短でも19.0秒でした。その代わりGeminiは幅が19.0〜19.6秒と狭く、毎回ほぼ同じ時間で返しています。Microsoft Copilotは最長が26.2秒で、時間のばらつきが最も大きくなりました。

所要時間の中央値(短いほど速い)

ChatGPT 14.2秒
Gemini 19.1秒
Claude 13.9秒
Microsoft Copilot 14.1秒
データ:AInformation調べ(2026年10月8日・72試行) / 制作:AInformation

再現率はCopilotだけ88.9%だった

ChatGPT・Gemini・Claudeは6課題とも3回同じ数式を返し、再現率は100.0%でした。Microsoft Copilotは課題5の1回目が数式なしだったので、88.9%です。ほかの5課題は3回とも同じ数式でした。

再現率(同じ課題3回で結論がそろった割合)

ChatGPT 100.0%
Gemini 100.0%
Claude 100.0%
Microsoft Copilot 88.9%
データ:AInformation調べ(2026年10月8日・72試行) / 制作:AInformation

出典の実在率はこの分野では測っていない

出典の実在率は、答えに出てきたURLが実際に開けるかを見る指標です。この分野ではURLを見る課題が無いので測っていません。4つのAIとも空欄(null)で、数字が無いのは測っていないためです。

指示の遵守率はClaudeだけ0.0%だった

遵守率はChatGPTとGeminiが100.0%で、Microsoft Copilotが94.4%でした。Claudeは0.0%ですが、理由は前の章のとおりです。画面の答えは式1行でした。

指示の遵守率(答えの形が決まりどおりだった割合)

ChatGPT 100.0%
Gemini 100.0%
Claude 0.0%(画面は式1行)
Microsoft Copilot 94.4%
データ:AInformation調べ(2026年10月8日・72試行) / 制作:AInformation

エクセル関数を任せるならおすすめは用途で選ぶ

6課題の結果から、用途ごとの選び方をまとめます。どれも2026年10月8日の1回の測定にもとづく話です。

速さを重く見るならClaude

1本の数式をすぐ欲しいなら、中央値が13.9秒のClaudeが最も短くなりました。18試行とも正しい数式で、最長でも16.5秒です。ChatGPTの14.2秒とMicrosoft Copilotの14.1秒もほぼ同じ速さでした。Microsoft Copilotは最長が26.2秒で、数式が返らない1回もありました。

正確さで選ぶなら3つが同率

正しい数式が返るかだけで見れば、ChatGPT・Gemini・Claudeの3つは18試行中18試行で並んでいます。この回の6課題では、どれを選んでも計算の答えは正解と合いました。ここで1つに絞る根拠は、この測定にはありません。

やり直しを減らすなら答えの形を見る

答えをそのまま表に貼るなら、画面の答えが式1行かどうかが効いてきます。ChatGPTとGeminiは採点表の遵守率でも100.0%でした。Claudeも画面の答えは式1行でしたが、採点表は0.0%です。答えをどこかへ自動で流し込む使い方では、Claudeの画面から写した文字にボタンの記号が混ざらないか確かめてください。

Microsoft Copilotを使うときは、返ってきた答えが = で始まる式かを見てから貼るのが安全です。この回は18試行中1試行で、数式でない答えが返りました。2回目と3回目は正解だったので、同じ文を送り直す手もあります。

エクセル関数を任せるならこの選び方。1本の式をすぐ欲しい。Claude。中央値13.9秒で最短。式1行だけを貼りたい。ChatGPT。遵守率100%・18試行とも1行。毎回同じ時間で返したい。Gemini。19.0〜19.6秒で幅が小さい。1回の測定で日や課題が変われば変わる。AInformation編集部が作ったイラスト図解(こんな人→このツール)
エクセル関数を任せるならこの選び方

この回の課題文に書いた3つのこと

この回の課題文に書いていたのは次の3つで、6課題に共通でした。

  • 表をA1から貼ったこと
  • 何行目が何月で、何列が何の商品か
  • 答えは = で始まる数式1行だけで、説明は要らないこと

この3つを書かずに頼んだときの結果は、この測定では確かめていません。書いたときに4つのAIがどう答えたかは、上の章のとおりです。

この測定の限界は1日1回とSUM中心の6課題

この記事の数字は、2026年10月8日の1回の測定です。読むときに気をつけてほしい点を、データページの限界の欄から抜き出しました。

  • 1日1回の測定です。日や課題が変われば順位は変わります
  • プランは各AIの有料版で、無料版の結果ではありません
  • 既定のモデルと既定のモードだけで測っています。Deep Researchなどは使っていません
  • 課題は架空の株式会社サンプル商事の自作データです。実在の企業のデータでの結果ではありません
  • 機械で採点できる課題だけを扱っています。文章のうまさや読みやすさは測っていません
  • ブラウザで人が使うのと同じ画面から測っています。APIの結果ではありません
  • Microsoft Copilotは画面のモデル名を読み取れず、モデル名の欄は空(null)です

この回の課題で出てきた関数は、SUMとAVERAGEとMAXの3つだけでした。条件で値を引く関数や、複数の関数を組み合わせる数式は試していません。ExcelとGoogleスプレッドシートで動き方が違うかも、この測定では確かめていません。採点は、出てきた式を材料の表で計算して答え合わせしたものです。

課題の全文と答えと採点表はデータページから落とせる

課題の全文・材料の売上表・4つのAIの回答72本・1行=1試行の採点表(CSV)・画面は、すべてデータページから落とせます。読者が同じ数え方で確かめられるようにするためです。1回ごとの答えと採点の理由は、この回の採点表と回答の全文から見られます。

数字を引用するときは、出典としてAInformation調べとデータページのURL・測定日を書いてください。データはCC BY 4.0で公開しています。同じ連載では、議事録・翻訳・表の集計・資料の骨子づくりも同じ方法で測りました。

関連する記事とツール

藤井俊太(AI導入コンサルタント)の見方

SUMやMAXのように関数1つで済む数式なら、どのAIに頼んでも式そのものは正しく返ってきました。外れたのはCopilotが数式を返さなかった1回だけです。差が出たのは速さで、Geminiだけ中央値19.1秒かかっています。気をつけたいのは採点表の読み方です。Claudeの遵守率は0%でしたが、画面の答えは式1行でした。数字だけで決めず、答えの全文と画面を一緒に見てください。Copilotを使うなら、返った答えが = で始まる式かを見てから貼るのが安全です。

よくある質問
エクセルの関数を書かせるならどのAIがおすすめですか?
この回の6課題では、ChatGPT・Gemini・Claudeの3つが18試行中18試行で正しい数式を返して同率でした。速さで選ぶなら中央値13.9秒のClaudeが最も短く、Geminiは19.1秒です。Microsoft Copilotは18試行中17試行でした。2026年10月8日の1回の測定なので、日や課題が変われば順位は変わります。
AIが書いたエクセル関数はそのまま使えますか?
この回の6課題では、数式が返らなかったCopilotの1回を除いてどの式も計算すると正解と同じ値になりました。ただ出てきた関数はSUMとAVERAGEとMAXだけです。条件で引く関数や組み合わせの数式は、この測定では確かめていません。貼る前に、答えが = で始まる式かを見てください。
Claudeの指示の遵守率が0%なのはなぜですか?
画面から読み取った文字に式のほかに記号5つと「今」の1字が入り、行数が7と数えられたためです。撮った画面の答えは6課題とも式1行で、計算した値も18試行とも正解でした。採点表の数字はそのまま載せています。答えの全文と画面はデータページで確かめられます。
Microsoft Copilotが間違えたのはどの課題ですか?
課題5(上期の総合計)の1回目だけです。数式ではなくHTMLの改行タグの説明が返ってきました。答えの最後には「送信が途中で切れてしまった場合は、やりたいことをもう一度送ってください」とあります。2回目と3回目は=SUM(G2:G7)で正解です。この1回で再現率も88.9%になりました。
測定に使ったプランとデータは何ですか?
ChatGPT Pro・Google AI Pro・Claude Max・Microsoft 365 Personalの有料プランを、既定のモデルのままブラウザで使いました。材料は架空の株式会社サンプル商事の12か月の売上表です。課題の全文と回答72本と採点表(CSV)は、データページから落とせます。
次に読むNEXT
SHARE

広告を載せており、そこから申し込みがあると紹介料を受け取ることがあります。

よく読まれている定番ガイド60本
この記事に出てくるAIも、まとめて比べられます 497本のAIツールを、やりたいこと・料金・日本語対応で絞り込めるデータベースです。5日ごとに料金を取り直しています。 AIツールを探す

あわせて読みたいRELATED