決算PDFから数字を拾う(3AI・6課題・各3回)
PDF・決算書の読み取りの課題を6問つくり、ChatGPT・Claude・Gemini へ各3回ずつ投げました。採点はプログラムだけで行い、AIには採点させていません。
AIごとのスコアを見る →ChatGPT・Claude 各15試行中15
2026年9月28日 測定
- 6問課題
- 3回1問あたりの試行
- 3つ測ったAI
- 45回有効な試行
- v1公開版
1回の検証の結果。日や課題が変われば順位は変わる
-
ChatGPT
100%
15試行中15が正解
1位
ChatGPT Pro
回答まで 中央値17.2秒 -
Claude
100%
15試行中15が正解
2位
Claude Max
回答まで 中央値13.9秒 -
Gemini
73.3%
15試行中11が正解
3位
Google AI Pro
回答まで 中央値28.6秒
当たるものがありませんでした。検索の言葉を消すと全部戻ります。
RESULT
この回で分かったこと
下の1行は、採点の結果からそのまま作ったものです。ページ側で足した言葉はありません。
- PDF・決算書の読み取り 6課題・各3回 6課題を各3回ずつ投げたところ、正解率が一番高かったのはChatGPT・Claudeの100.0%で同率だった 有効な試行は45回。 1回の検証の結果。日や課題が変われば順位は変わる。 AIごとのスコアを見る
SCORES
AIごとのスコア
並びは正解率の高い順です。分母は、その指標を測れた試行の数です。 「—」は測っていないという意味で、0%ではありません。
| AI | 正解率正解 ÷ 有効な試行 | 再現率3回で結論が一致 | 出典の実在率URLが開けた割合 | 指示の遵守率字数・形式を守った | 所要時間中央値/幅 |
|---|---|---|---|---|---|
| 1ChatGPT | 100% 15試行中15 | 100% 6課題中 | — | 86.7% | 17.2秒 14〜57.5秒 |
| 2Claude | 100% 15試行中15 | 100% 6課題中 | — | 60% | 13.9秒 13.8〜15.3秒 |
| 3Gemini | 73.3% 15試行中11 | 80% 6課題中 | — | 16.7% | 28.6秒 20.7〜60.4秒 |
出典の実在率は、答えと一緒にURLを挙げてもらう課題があった回だけ測っています。 ChatGPT・Claude・Geminiの「—」は、この回ではその課題を出していないという意味です。0%ではありません。
答えが返らなかった試行
ChatGPT … AInformation側の操作の失敗(分母から外した) 3回 Claude … AInformation側の操作の失敗(分母から外した) 3回 Gemini … 断られた 3回/AInformation側の操作の失敗(分母から外した) 3回
断られた・時間切れは分母に入れて不正解として数えています。上限・人間確認・AInformation側の操作の失敗は分母から外しています。
TASKS
課題ごとの結果
1つの課題を、4つのAIへ3回ずつ投げています。 ○が正解、×が不正解です。下の数字は、その試行にかかった秒数です。 課題の全文・先に決めた正解・なぜその判定になったかは、それぞれ開くと読めます。
添付した決算の概要(単位は百万円)から、3つの数字を拾ってください。 決まり ・答えはちょうど3行。売上高: ◯/営… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある
-
ChatGPT
- ChatGPT 第1回 正解 57.5秒
- ChatGPT 第2回 正解 14.2秒
- ChatGPT 第3回 正解 17.2秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 13.9秒
- Claude 第2回 正解 13.8秒
- Claude 第3回 正解 13.8秒
3試行中3が正解
-
Gemini
- Gemini 第1回 正解 30秒
- Gemini 第2回 正解 33.1秒
- Gemini 第3回 不正解 断られた
3試行中2が正解
課題の全文この文をそのまま4つのAIへ送りました(119字)
添付した決算の概要(単位は百万円)から、3つの数字を拾ってください。 決まり ・答えはちょうど3行。売上高: ◯/営業利益: ◯/当期純利益: ◯ の順で書く ・数は半角で、資料に出ている単位(百万円)のまま書く ・計算や補足は書かない
先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました
(機械採点 exact_number)売上高=60500(誤差±0)/営業利益=3450(誤差±0)/当期純利益=2220(誤差±0)
採点の中身なぜその判定になったかを1試行ずつ出しています(9試行中8が正解)
- ChatGPT 第1回 正解
- 数値すべて一致:売上高 ○(正解60500)/営業利益 ○(正解3450)/当期純利益 ○(正解2220) (57.5秒) この回答の全文
- ChatGPT 第2回 正解
- 数値すべて一致:売上高 ○(正解60500)/営業利益 ○(正解3450)/当期純利益 ○(正解2220) (14.2秒) この回答の全文
- ChatGPT 第3回 正解
- 数値すべて一致:売上高 ○(正解60500)/営業利益 ○(正解3450)/当期純利益 ○(正解2220) (17.2秒) この回答の全文
- Claude 第1回 正解
- 数値すべて一致:売上高 ○(正解60500)/営業利益 ○(正解3450)/当期純利益 ○(正解2220) (13.9秒) この回答の全文
- Claude 第2回 正解
- 数値すべて一致:売上高 ○(正解60500)/営業利益 ○(正解3450)/当期純利益 ○(正解2220) (13.8秒) この回答の全文
- Claude 第3回 正解
- 数値すべて一致:売上高 ○(正解60500)/営業利益 ○(正解3450)/当期純利益 ○(正解2220) (13.8秒) この回答の全文
- Gemini 第1回 正解
- 数値すべて一致:売上高 ○(正解60500)/営業利益 ○(正解3450)/当期純利益 ○(正解2220) (30秒) この回答の全文
- Gemini 第2回 正解
- 数値すべて一致:売上高 ○(正解60500)/営業利益 ○(正解3450)/当期純利益 ○(正解2220) (33.1秒) この回答の全文
- Gemini 第3回 不正解
- 断られた(ポリシー)。不正解として分母に入れる (27秒) この回答の全文
添付した決算の概要から、期末の従業員数を答えてください。 決まり ・答えはちょうど1行。従業員数: ◯◯◯名 の形で… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある
-
ChatGPT
- ChatGPT 第1回 正解 14.1秒
- ChatGPT 第2回 正解 14.1秒
- ChatGPT 第3回 正解 14.4秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 13.9秒
- Claude 第2回 正解 13.9秒
- Claude 第3回 正解 13.9秒
3試行中3が正解
-
Gemini
- Gemini 第1回 正解 24秒
- Gemini 第2回 正解 60.4秒
- Gemini 第3回 正解 20.7秒
3試行中3が正解
課題の全文この文をそのまま4つのAIへ送りました(70字)
添付した決算の概要から、期末の従業員数を答えてください。 決まり ・答えはちょうど1行。従業員数: ◯◯◯名 の形で書く ・説明は書かない
先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました
(機械採点 exact_number)従業員数=505(誤差±0)
採点の中身なぜその判定になったかを1試行ずつ出しています(9試行中9が正解)
- ChatGPT 第1回 正解
- 数値すべて一致:従業員数 ○(正解505) (14.1秒) この回答の全文
- ChatGPT 第2回 正解
- 数値すべて一致:従業員数 ○(正解505) (14.1秒) この回答の全文
- ChatGPT 第3回 正解
- 数値すべて一致:従業員数 ○(正解505) (14.4秒) この回答の全文
- Claude 第1回 正解
- 数値すべて一致:従業員数 ○(正解505) (13.9秒) この回答の全文
- Claude 第2回 正解
- 数値すべて一致:従業員数 ○(正解505) (13.9秒) この回答の全文
- Claude 第3回 正解
- 数値すべて一致:従業員数 ○(正解505) (13.9秒) この回答の全文
- Gemini 第1回 正解
- 数値すべて一致:従業員数 ○(正解505) (24秒) この回答の全文
- Gemini 第2回 正解
- 数値すべて一致:従業員数 ○(正解505) (60.4秒) この回答の全文
- Gemini 第3回 正解
- 数値すべて一致:従業員数 ○(正解505) (20.7秒) この回答の全文
添付した決算の概要から、当年度の営業利益率(営業利益 ÷ 売上高)を出してください。 決まり ・答えはちょうど1行。… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある
-
ChatGPT
- ChatGPT 第1回 正解 17.2秒
- ChatGPT 第2回 正解 20.3秒
- ChatGPT 第3回 正解 23.6秒
3試行中3が正解
-
Claude
- Claude 第1回 正解 13.8秒
- Claude 第2回 正解 13.9秒
- Claude 第3回 正解 13.8秒
3試行中3が正解
-
Gemini
- Gemini 第1回 正解 23.9秒
- Gemini 第2回 不正解 断られた
- Gemini 第3回 正解 23.8秒
3試行中2が正解
課題の全文この文をそのまま4つのAIへ送りました(93字)
添付した決算の概要から、当年度の営業利益率(営業利益 ÷ 売上高)を出してください。 決まり ・答えはちょうど1行。営業利益率: ◯.◯% の形で書く ・小数第1位まで。説明は書かない
先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました
(機械採点 exact_number)営業利益率=5.7(誤差±0.06)
採点の中身なぜその判定になったかを1試行ずつ出しています(9試行中8が正解)
- ChatGPT 第1回 正解
- 数値すべて一致:営業利益率 ○(正解5.7) (17.2秒) この回答の全文
- ChatGPT 第2回 正解
- 数値すべて一致:営業利益率 ○(正解5.7) (20.3秒) この回答の全文
- ChatGPT 第3回 正解
- 数値すべて一致:営業利益率 ○(正解5.7) (23.6秒) この回答の全文
- Claude 第1回 正解
- 数値すべて一致:営業利益率 ○(正解5.7) (13.8秒) この回答の全文
- Claude 第2回 正解
- 数値すべて一致:営業利益率 ○(正解5.7) (13.9秒) この回答の全文
- Claude 第3回 正解
- 数値すべて一致:営業利益率 ○(正解5.7) (13.8秒) この回答の全文
- Gemini 第1回 正解
- 数値すべて一致:営業利益率 ○(正解5.7) (23.9秒) この回答の全文
- Gemini 第2回 不正解
- 断られた(ポリシー)。不正解として分母に入れる (39.3秒) この回答の全文
- Gemini 第3回 正解
- 数値すべて一致:営業利益率 ○(正解5.7) (23.8秒) この回答の全文
添付した決算の概要から、当年度の販売費及び一般管理費の内訳を全部書き出してください。 決まり ・答えはちょうど6行。… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある
-
ChatGPT
- ChatGPT 第1回 正解 20.4秒
- ChatGPT 第2回 正解 17.2秒
- ChatGPT 第3回 採点の外 AInformation側の操作の失敗(分母から外した)
2試行中2が正解 1回は分母から外した
-
Claude
- Claude 第1回 正解 13.9秒
- Claude 第2回 正解 15.3秒
- Claude 第3回 採点の外 AInformation側の操作の失敗(分母から外した)
2試行中2が正解 1回は分母から外した
-
Gemini
- Gemini 第1回 正解 45.5秒
- Gemini 第2回 正解 48.5秒
- Gemini 第3回 採点の外 AInformation側の操作の失敗(分母から外した)
2試行中2が正解 1回は分母から外した
課題の全文この文をそのまま4つのAIへ送りました(117字)
添付した決算の概要から、当年度の販売費及び一般管理費の内訳を全部書き出してください。 決まり ・答えはちょうど6行。費目名: 金額 の形で、資料に出てくる順で書く ・数は半角で、資料の単位(百万円)のまま書く ・前年度の数は書かない
先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました
(機械採点 exact_number)人件費=8250(誤差±0)/物流費=5440(誤差±0)/広告宣伝費=2060(誤差±0)/地代家賃=1500(誤差±0)/減価償却費=560(誤差±0)/その他=940(誤差±0)
採点の中身なぜその判定になったかを1試行ずつ出しています(6試行中6が正解)
- ChatGPT 第1回 正解
- 数値すべて一致:人件費 ○(正解8250)/物流費 ○(正解5440)/広告宣伝費 ○(正解2060)/地代家賃 ○(正解1500)/減価償却費 ○(正解560)/その他 ○(正解940) (20.4秒) この回答の全文
- ChatGPT 第2回 正解
- 数値すべて一致:人件費 ○(正解8250)/物流費 ○(正解5440)/広告宣伝費 ○(正解2060)/地代家賃 ○(正解1500)/減価償却費 ○(正解560)/その他 ○(正解940) (17.2秒) この回答の全文
- ChatGPT 第3回 採点の外(分母から外した)
- ChatGPT: 入力欄が無い(ログイン切れ)
- Claude 第1回 正解
- 数値すべて一致:人件費 ○(正解8250)/物流費 ○(正解5440)/広告宣伝費 ○(正解2060)/地代家賃 ○(正解1500)/減価償却費 ○(正解560)/その他 ○(正解940) (13.9秒) この回答の全文
- Claude 第2回 正解
- 数値すべて一致:人件費 ○(正解8250)/物流費 ○(正解5440)/広告宣伝費 ○(正解2060)/地代家賃 ○(正解1500)/減価償却費 ○(正解560)/その他 ○(正解940) (15.3秒) この回答の全文
- Claude 第3回 採点の外(分母から外した)
- Claude: 入力欄が無い(ログイン切れ)
- Gemini 第1回 正解
- 数値すべて一致:人件費 ○(正解8250)/物流費 ○(正解5440)/広告宣伝費 ○(正解2060)/地代家賃 ○(正解1500)/減価償却費 ○(正解560)/その他 ○(正解940) (45.5秒) この回答の全文
- Gemini 第2回 正解
- 数値すべて一致:人件費 ○(正解8250)/物流費 ○(正解5440)/広告宣伝費 ○(正解2060)/地代家賃 ○(正解1500)/減価償却費 ○(正解560)/その他 ○(正解940) (48.5秒) この回答の全文
- Gemini 第3回 採点の外(分母から外した)
- Gemini: 入力欄が無い(ログイン切れ)
添付した決算の概要で、販売費及び一般管理費のうち前年度より金額が増えた費目を全部挙げてください。 決まり ・1費目に… 採点の型:set_match 決められた項目をいくつ抜けたか。漏れと作り足しの両方を数える
-
ChatGPT
- ChatGPT 第1回 正解 14秒
- ChatGPT 第2回 正解 14.1秒
- ChatGPT 第3回 採点の外 AInformation側の操作の失敗(分母から外した)
2試行中2が正解 1回は分母から外した
-
Claude
- Claude 第1回 正解 14秒
- Claude 第2回 正解 13.9秒
- Claude 第3回 採点の外 AInformation側の操作の失敗(分母から外した)
2試行中2が正解 1回は分母から外した
-
Gemini
- Gemini 第1回 正解 27.1秒
- Gemini 第2回 不正解 断られた
- Gemini 第3回 採点の外 AInformation側の操作の失敗(分母から外した)
2試行中1が正解 1回は分母から外した
課題の全文この文をそのまま4つのAIへ送りました(106字)
添付した決算の概要で、販売費及び一般管理費のうち前年度より金額が増えた費目を全部挙げてください。 決まり ・1費目につき1行。行の先頭は ・ にする。費目名だけを書く ・減った費目・変わらなかった費目は書かない
先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました
(機械採点 set_match)人件費[人件費]/減価償却費[減価償却費] 作り足しは0件まで
採点の中身なぜその判定になったかを1試行ずつ出しています(6試行中5が正解)
- ChatGPT 第1回 正解
- 2件すべて一致・作り足し0件 (14秒) この回答の全文
- ChatGPT 第2回 正解
- 2件すべて一致・作り足し0件 (14.1秒) この回答の全文
- ChatGPT 第3回 採点の外(分母から外した)
- 先に止めた(ChatGPT: 入力欄が無い(ログイン切れ))
- Claude 第1回 正解
- 2件すべて一致・作り足し0件 (14秒) この回答の全文
- Claude 第2回 正解
- 2件すべて一致・作り足し0件 (13.9秒) この回答の全文
- Claude 第3回 採点の外(分母から外した)
- 先に止めた(Claude: 入力欄が無い(ログイン切れ))
- Gemini 第1回 正解
- 2件すべて一致・作り足し0件 (27.1秒) この回答の全文
- Gemini 第2回 不正解
- 断られた(ポリシー)。不正解として分母に入れる (23.9秒) この回答の全文
- Gemini 第3回 採点の外(分母から外した)
- 先に止めた(Gemini: 入力欄が無い(ログイン切れ))
添付した決算の概要から数字を拾い、JSON だけを出力してください。 決まり ・出力は JSON だけ。前後に説明文… 採点の型:exact_number 数値が正解と一致するか。丸めの幅も先に決めてある
-
ChatGPT
- ChatGPT 第1回 正解 17.1秒
- ChatGPT 第2回 正解 17.2秒
- ChatGPT 第3回 採点の外 AInformation側の操作の失敗(分母から外した)
2試行中2が正解 1回は分母から外した
-
Claude
- Claude 第1回 正解 13.9秒
- Claude 第2回 正解 13.9秒
- Claude 第3回 採点の外 AInformation側の操作の失敗(分母から外した)
2試行中2が正解 1回は分母から外した
-
Gemini
- Gemini 第1回 不正解 42.4秒
- Gemini 第2回 正解 20.8秒
- Gemini 第3回 採点の外 AInformation側の操作の失敗(分母から外した)
2試行中1が正解 1回は分母から外した
課題の全文この文をそのまま4つのAIへ送りました(203字)
添付した決算の概要から数字を拾い、JSON だけを出力してください。 決まり ・出力は JSON だけ。前後に説明文を書かない ・形は {"sales": 売上高, "ec_sales": ECの売上, "next_year_forecast": 翌年度の売上見通し, "employees": 期末の従業員数} にする ・数は数値で入れる(文字列にしない・カンマを入れない)。単位は資料のまま(百万円)
先に決めた正解課題を作った時点で決めています。4つのAI中3つが1回でも正解しました
(機械採点 exact_number)売上高=60500(誤差±0)/EC売上=20300(誤差±0)/翌年度の売上見通し=62500(誤差±0)
採点の中身なぜその判定になったかを1試行ずつ出しています(6試行中5が正解)
- ChatGPT 第1回 正解
- 数値すべて一致:売上高 ○(正解60500)/EC売上 ○(正解20300)/翌年度の売上見通し ○(正解62500) (17.1秒) この回答の全文
- ChatGPT 第2回 正解
- 数値すべて一致:売上高 ○(正解60500)/EC売上 ○(正解20300)/翌年度の売上見通し ○(正解62500) (17.2秒) この回答の全文
- ChatGPT 第3回 採点の外(分母から外した)
- 先に止めた(ChatGPT: 入力欄が無い(ログイン切れ))
- Claude 第1回 正解
- 数値すべて一致:売上高 ○(正解60500)/EC売上 ○(正解20300)/翌年度の売上見通し ○(正解62500) (13.9秒) この回答の全文
- Claude 第2回 正解
- 数値すべて一致:売上高 ○(正解60500)/EC売上 ○(正解20300)/翌年度の売上見通し ○(正解62500) (13.9秒) この回答の全文
- Claude 第3回 採点の外(分母から外した)
- 先に止めた(Claude: 入力欄が無い(ログイン切れ))
- Gemini 第1回 不正解
- 数値が違う:売上高 ×(正解60500・sales の行が無い)/EC売上 ×(正解20300・ec_sales の行が無い)/翌年度の売上見通し ×(正解62500・next_year_forecast の行が無い) (42.4秒) この回答の全文
- Gemini 第2回 正解
- 数値すべて一致:売上高 ○(正解60500)/EC売上 ○(正解20300)/翌年度の売上見通し ○(正解62500) (20.8秒) この回答の全文
- Gemini 第3回 採点の外(分母から外した)
- 先に止めた(Gemini: 入力欄が無い(ログイン切れ))
ANSWERS
4つのAIの回答の全文
採点のもとになった回答を、手を入れずにそのまま置いています。 読んだ人が同じように数え直せるようにするためです。
- ChatGPT
- Claude
-
Gemini
15件の回答うち11件が正解
MATERIALS
課題に使った材料
架空の株式会社サンプル商事の決算の概要(3ページのPDF・単位は百万円)。数は作るときに決めてある この回のために2026年9月27日に作り直したものです。 落として、同じことをやり直せます。
- kessan.pdf 267KB
METHOD
測り方
やり直せるように、この回の条件をそのまま書いています。
測ったAIと、そのときのモデル名
AIは中身が黙って変わります。画面に出ていたモデル名と、確認した時刻を残しています。
| AI | プラン | 画面に出ていたモデル名 | 確認した時刻 |
|---|---|---|---|
| ChatGPT | ChatGPT Pro | 中程度 | 2026-09-27 21:16 |
| Gemini | Google AI Pro | Flash 拡張 | 2026-09-27 21:16 |
| Claude | Claude Max | Opus 4.8 高 | 2026-09-27 21:16 |
この回でやったこと
- 課題に使う材料を、この回のために作り直しました。架空の会社のデータで、実在の企業・人物は含みません。
- 課題を6問つくり、正解をこの時点で決めました。
- ChatGPT・Gemini・Claudeへ、同じ課題文と同じ材料を送りました。
- 1問につき3回、毎回あたらしい会話で投げました。
- 投げる順番は回ごとに入れ替えました。時間帯のかたよりが順位に出ないようにするためです。
- 待ち時間は300秒までとし、 過ぎたものは時間切れとして記録しました。
- 採点は機械採点のみ(AIに採点させていない)です。
- 送信した試行はのべ54回、 そのうち有効だったのは45回です。
分母から外した試行
- AInformation側の操作の失敗(分母から外した) 9回
答えが返らなかったときの数え方
- 断られた・時間切れ
分母に入れて、不正解として数えます。仕事では答えが返らないのと同じためです。
- プランの上限に当たった
分母から外します。その試行は測れなかったものとして扱います。
- 人間確認の画面が出た
そこで止めます。機械で押すことも、避けることもしません。
- AInformation側の操作の失敗
分母から外します。AIの欠点としては書きません。
LIMITS
この測定の限界
数字だけを見て判断されないように、測れていないことを書いています。
- 1日1回の測定である。日や課題が変われば順位は変わる
- プランは各AIの有料版(ChatGPT Pro/Google AI Pro/Claude Max/Microsoft 365 Personal)。無料版の結果ではない
- 既定のモデル・既定のモードだけで測っている(Deep Research などは使っていない)
- 課題は架空の株式会社サンプル商事の自作データ。実在の企業のデータでの結果ではない
- 機械で採点できる課題だけを扱っている。文章のうまさ・読みやすさは測っていない
- ブラウザで人が使うのと同じ画面から測っている。APIの結果ではない
- 画面に出ているモデル名を読み取れないAIがある回は、その欄を空(null)にしている。読み取れた回はそのまま載せている
DATA
公開しているデータ
CSVは1行が1試行です。このページに出している数字は、そのCSVを数え直したものと一致します。 ライセンスは CC BY 4.0 です。
- 最新版(CSV) 1行=1試行 11KB
- 最新版(JSON) 30KB
- v1(公開時の版)(CSV) 1行=1試行 11KB
- v1(公開時の版)(JSON) 30KB
累積の順位表は /data/research/bench/leaderboard.json にあります。 版(v1)は消しません。引用したリンクが切れないようにするためです。
FAQ
よくある質問
- どうやって測っているのですか
- 4つのAIに、まったく同じ課題文と同じ材料を、同じ日のうちに投げています。毎回あたらしい会話を開いて、前の回答を引きずらせません。投げる順番は回ごとに入れ替えています。送信してから回答が止まるまでの秒数もあわせて記録しています。
- なぜ同じ課題を3回も投げるのですか
- AIは同じ質問でも答えが変わるためです。1回だけの結果では、それが実力なのか偶然なのかが分かりません。3回投げて、結論が一致した割合を再現率として出しています。
- 採点は誰がしているのですか
- プログラムだけで採点しています。AIには採点させていません。正解は課題を作る時点で決めてあり、数値の一致・語句の有無・形式の適合・URLが実際に開けるか・数式を実行した結果で決まります。好き嫌いは点にしていません。
- 課題に使っているデータは実在の会社のものですか
- いいえ。架空の会社のデータを毎回あたらしく作っています。実在の企業・人物・他社の文章は使っていません。使った材料はそのまま配っているので、同じことをやり直せます。
- AIが答えられなかったときはどう数えていますか
- 断られた・時間切れは分母に入れて不正解として数えます。プランの上限に当たった・人間確認の画面が出たときは分母から外し、その回は測れなかったものとして扱います。AInformation側の操作の失敗も分母から外し、AIの欠点としては書きません。
- 使っているのは無料版ですか、有料版ですか
- 各AIの有料プランを、ブラウザの画面から使っています。APIではありません。プラン名と、画面に出ていたモデル名・確認した時刻を回ごとに記録しています。
- この順位は、どのAIがいちばん賢いかを表していますか
- いいえ。測っているのは決まった仕事の課題での正解率・所要時間・再現率・出典の実在率・指示の遵守率の5つだけです。書き味や読みやすさ、長い会話でのふるまいは測っていません。課題が変われば順位も変わります。
- 引用してもいいですか
- はい。CC BY 4.0 です。出典として「AInformation調べ AI実務ベンチ」と、使ったページのURL・測定日を書いてください。集計はJSONとCSVでも取れます。1行1試行のCSVを見れば、載せている数字を数え直せます。
CITATION
この測定を引用する
出典:AInformation調べ「AI実務ベンチ 決算PDFから数字を拾う(3AI・6課題・各3回)」(https://ainformation.jp/research/bench/kessan-2026-09-28) 測定日 2026年9月28日 6課題・各3回・有効な試行45回
コピーしました
数字を引くときは、分母(何試行中いくつか)も一緒に書いてください。 出典として AInformation調べ と、使ったページのURL・測定日を書いてください。
関連するページ
AIの最新ニュースを週1回まとめてお届け
その週に出た主要なAIニュースと、編集部が実際に試したツールを1通にまとめます。