本文へ移動
NEWS
AI実務ベンチ

AI翻訳の精度を4つ比較!そのまま使える翻訳プロンプト2つ

読了 約26分
ChatGPTは18回中15回正しく訳した。AI翻訳の精度比較と翻訳プロンプト2つ
この記事の要点

AIで英文を翻訳するときに実際に投げたプロンプト2つを、そのまま使える形で載せました。同じプレスリリースを4つのAIへ6課題×3回投げて機械で採点すると、正解はChatGPTが18試行中15試行(83.3%)で最多でした。Geminiは18試行中12試行で回答を断っています。

SHARE
藤井俊太のアバター

AI導入コンサルタント

藤井俊太(Shunta Fujii)

AIのスペシャリストとして、最新のAI情報を常にキャッチ、アップデートしている。自らもAI導入コンサルタントとして活動し、主に生成AIを駆使した業務効率化、生産性向上、新規事業開発を行なっている。
AIの総合情報サイト「AInformation」は、AIに関する情報やサービスを解説・紹介するWebメディア。運営と記事の確認は藤井俊太が1人で行っています。藤井俊太のプロフィール

...続きを読む

AIで英文を翻訳するときに実際に投げたプロンプト2つを、そのまま使える形で載せました。同じプレスリリースを4つのAIへ6課題×3回投げて機械で採点すると、正解はChatGPTが18試行中15試行(83.3%)で最多でした。Geminiは18試行中12試行で回答を断っています。

18試行中15ChatGPTが正解した数(正解率83.3%)
12試行Geminiが18試行のうち断った数
17.1秒Microsoft Copilotの所要時間の中央値で4つのAIの中で最短
この記事で分かること
  • AI翻訳の精度を4つ比較した結果と、そのまま使える翻訳プロンプト2つ
  • 英語のプレスリリースを訳す6課題を2026年9月30日に4つのAIへ各3回投げ、72試行を機械だけで採点した結果
  • 正解率はChatGPTが18試行のうち15試行(83.3%)でいちばん高かった
  • Geminiは18試行のうち12試行で「テキストベースのAIですので」などと断り、正解は18試行のうち3試行(16.7%)だった
  • ClaudeとMicrosoft Copilotは都市名のFukuokaを「福岡」と書いた答えが外れ、正解はそれぞれ18試行中9試行と18試行中10試行だった
  • 所要時間の中央値はMicrosoft Copilotの17.1秒が最短で、指示の遵守率は18試行中10試行(55.6%)にとどまった
  • 数字だけを3行で書くt2は採点が単位の語を探す作りで、4つのAIとも3試行すべてが不正解だった

英文翻訳の精度はChatGPTが18試行中15試行で最も高かった

英語のプレスリリースをいちばん正確に訳したのは、どのAIか。この回の答えはChatGPTです。6課題を3回ずつ投げて、18試行のうち15試行が正解でした(83.3%)。2番目はMicrosoft Copilotの18試行のうち10試行(55.6%)で、3番目はClaudeの18試行のうち9試行(50.0%)でした。Geminiは18試行のうち3試行(16.7%)にとどまっています。

AInformation編集部は2026年9月30日に、ChatGPT・Gemini・Claude・Microsoft Copilotの4つへまったく同じ課題を投げました。材料は編集部が作った架空の会社の英語のプレスリリースで、答えは機械だけで採点しています。ただし1回の測定なので、日や課題が変われば順位は変わります。

差の中身は2つに分かれました。

  • Geminiは18試行のうち12試行で断り、訳文や数字を返さなかった
  • ClaudeとMicrosoft Copilotは、原文の「Fukuoka」を「福岡」と日本語で書いた回が採点で外れた

採点は、原文の綴りのまま「Fukuoka」が入っているかを見ています。ChatGPTは翻訳と要約とJSONの3課題で、3回とも都市名を英語のまま残して9項目をそろえました。ChatGPTとClaude・Microsoft Copilotの差は、t3の翻訳とt5の要約の2課題だけで生まれています。

数字そのものは、どのAIも崩していません。訳文と要約を返した試行では、出荷台数や価格など数字の項目を落とした答えが1つもありませんでした。

Microsoft Copilotの10試行とClaudeの9試行は近い数なので、この回の順番だけで2つの優劣は決めないでください。1回ごとの結果と答えの全文は、この回の採点表と回答の全文で数え直せます。

英文翻訳の比較は6課題を各3回ずつ機械だけで採点した

材料は、架空の株式会社サンプル商事(Sample Shoji)の英語のプレスリリースです。AIのテスト用に編集部が作った会社で、実在しません。型番・都市名・数字は材料を作るときに決めてあり、正解は採点の前から決まっています。

プレスリリースは、新しい保温ボトルの発売を知らせる内容でした。採点で見た項目は次の9つです。

  • 型番:SM-FSU693
  • 都市名:Fukuoka
  • CEOの名前:Haruka Mizuno(姓のMizunoを見る)
  • 前年度の出荷台数:80,500台
  • 売上の伸び率:27.3%
  • 希望小売価格:9,140円(税抜)
  • 容量:500ml
  • 保温の時間:12時間
  • 保冷の時間:24時間

課題は易・中・難を2つずつ用意しました。

  • t1(易):型番・生産する都市・CEOの名前を3行で書き出す
  • t2(易):出荷台数・価格・容量の3つの数を3行で書き出す
  • t3(中):プレスリリース全体を日本語に訳す
  • t4(中):4つの数字を日本語で4行に書き出す
  • t5(難):日本語で300文字以内に要約する
  • t6(難):日本語の見出しと要約と事実をJSONだけで出す
こんな検証をしました。英語のプレスリリースを4AIに72回投げた。対象。架空の会社の英語プレスリリース。方法。6課題を各3回・機械だけで採点。時点。2026年9月30日・72試行。正解はChatGPTが18試行中15試行。AIに採点させず機械で数えた。AInformation編集部が作ったイラスト図解(「こんな検証をしました」の場面)
英語のプレスリリースを4AIに72回投げた

毎回あたらしい会話を開いて順番も入れ替えた

1回ごとにあたらしい会話を開き、課題の文をそのまま送りました。投げる順番は、3回の繰り返しごとに入れ替えています。

  • 1回目:ChatGPT→Gemini→Claude→Microsoft Copilot
  • 2回目:Gemini→Claude→Microsoft Copilot→ChatGPT
  • 3回目:Claude→Microsoft Copilot→ChatGPT→Gemini

測る前に「はい」とだけ返してもらう空打ちを1回して、その1回は採点に入れていません。答えを待つ上限は300秒(5分)です。

採点は機械だけでAIには採点させていない

採点は機械だけで行い、AIには採点させていません。t2は数の値をぴったり比べる型で、ほかの課題は決めた項目がそろったかを照らし合わせる型です。断られた試行と時間切れの試行は、どちらも不正解として分母に入れました。この回に分母から外した試行は無く、72試行すべてが採点に入っています。

画面から答えを読み取ると、考えている途中の要約の行が混ざることがあります。この行は4つのAIとも同じ決まりで落としてから採点し、落とす前の答えもデータページに置きました。

使ったプランと画面に出ていたモデルの表示

  • ChatGPT:ChatGPT Pro(表示は「中程度」)
  • Gemini:Google AI Pro(表示は「Flash 拡張」)
  • Claude:Claude Max(表示は「Opus 4.8 高」)
  • Microsoft Copilot:Microsoft 365 Personal(モデル名は画面から読み取れなかった)

どれも既定のモデルと既定のモードのままです。

翻訳のt3はFukuokaを残したChatGPTだけ3回とも通った

4つのAIの差がはっきり出たのは、中のt3(翻訳)と難のt5(要約)でした。どちらの課題もChatGPTだけが3回とも正解しています。t3とt5でClaudeとMicrosoft Copilotが外した答えは、2つの例外を除いてどれも都市名が足りませんでした。

6課題の結果を表にまとめました。断は断られた試行で、時は時間切れの試行です。どちらも不正解に数えています。

6課題×各3回の結果(○正解・×不正解・断=断られた・時=時間切れ)

課題 ChatGPT Gemini Claude Microsoft Copilot
t1 型番などの抜き出し(易) ○○○ ○断○ ○○○ ○○○
t2 数字3つ(易) ××× ×断断 ××× ×××
t3 翻訳(中) ○○○ 断断× ××× ○××
t4 数字4つ(中) ○○○ 断断断 ○○○ ○○○
t5 要約(難) ○○○ 断×断 ××時 ×××
t6 JSON(難) ○○○ 断○断 ○○○ ○○○
正解の数 18試行中15 18試行中3 18試行中9 18試行中10
データ:AInformation調べ(2026年9月30日・72試行) / 制作:AInformation

1回ごとの答えは、データページの採点表で1行ずつ確かめられます。

t3の決まりは「原文のまま」だった

t3は、プレスリリース全体を日本語に訳す課題です。決まりには「型番・都市名・人名・数字は原文のまま落とさずに訳文へ入れる」と書きました。投げた文は次のとおりで、そのままコピーして試せます。

次の英語のプレスリリースを日本語に訳してください。

決まり
・型番・都市名・人名・数字は原文のまま落とさずに訳文へ入れる
・訳文だけを出す。前置きと解説は書かない

—- プレスリリース ここから —-
FOR IMMEDIATE RELEASE

Sample Shoji Co., Ltd. to Launch SM-FSU693, a New Insulated Bottle Line

Fukuoka, Japan — Sample Shoji Co., Ltd. today announced SM-FSU693, a new 500 ml insulated bottle,
shipping from March 2027. The suggested retail price is 9,140 yen, excluding tax.

The company shipped 80,500 units of its current bottle line in the previous fiscal year,
and expects the new line to lift bottle category revenue by 27.3% in the first full year.
Haruka Mizuno, Chief Executive Officer of Sample Shoji, said the SM-FSU693 keeps beverages hot for 12 hours
and cold for 24 hours, and that the lid can be taken apart into three parts for washing.

Production will take place at the company’s Fukuoka plant. A limited color edition will follow in
September 2027. Sample Shoji operates two directly managed stores and supplies about 1,300 retailers.

Note: Sample Shoji Co., Ltd. is a fictional company created by the AInformation editorial team for
AI testing. It does not exist.

Media contact: Sample Shoji Co., Ltd., Public Relations
—- プレスリリース ここまで —-

採点で見るのは、都市名なら原文の綴りの「Fukuoka」でCEOなら姓の「Mizuno」です。

ChatGPTは地名も社名も英語のまま残した

ChatGPTは3回とも9項目がそろいました。本文の書き出しは3回とも「Fukuoka, Japan — Sample Shoji Co., Ltd.は本日」で、地名も社名も英語のまま残っています。

ただしChatGPTの訳文には、読むときに気をつけたい点があります。「12 hours温かく」「three partsに分解」「twoの直営店」のように、数や単位まで英語のまま残っていました。英語と日本語が1つの文に混ざった形です。決まりの「原文のまま」には沿っていますが、この測定は訳文のうまさや読みやすさを測っていません。

Claudeは福岡と訳して3回とも外れた

Claudeは3回とも都市名が外れました。訳文では「福岡発」「福岡工場」と日本語で書いています。CEOの名前は1回目だけ「Haruka Mizuno氏」でした。2回目は「水野ハルカ氏」で3回目は「水野遥氏」と日本語になり、どちらもCEOの姓まで外れています。

Claudeの会話画面。英語のプレスリリースを日本語に訳し、都市名を福岡と書いた答えが出ている
Claudeの訳文。都市名の訳し方を確定中と出たあと福岡発と訳している AInformation編集部が2026年9月30日にClaudeを操作した画面

Claudeの1回目の画面では、答えの上に「都市名の訳し方を確定中。」という灰色の1行が出ていました。答えの本文とは別に出る、考えている途中の要約の行です。

Microsoft Copilotは1回だけ通りGeminiは訳文を返さなかった

Microsoft Copilotは1回目が9項目そろって○でした。訳文は「日本・Fukuoka発」で始まり、地名を英語のまま残しています。2回目は「福岡、日本」と訳して都市名が外れました。3回目は訳文を返さず、送った内容がHTMLの改行タグだけに見えたという返事でした。課題の文がMicrosoft Copilotにどう届いたかは、この測定では確かめていません。採点ではこの回も不正解として分母に入っています。

Geminiは3回とも訳文を返さず、2回は断りました。断り方は後の章でまとめます。

同じ翻訳の課題への3つのAIの答え。英語のプレスリリースを日本語に訳して。ChatGPT。Fukuokaを英語のまま残して3回とも○。Claude。福岡発と日本語で書き3回とも×。Gemini。テキストベースのAIと断り3回とも×。t3を3回とも通したのはChatGPTだけ。採点は原文の綴りFukuokaで照らし合わせた。AInformation編集部が作ったイラスト図解(同じ質問への各AIの答え)
同じ翻訳の課題への3つのAIの答え

要約のt5も都市名を英語で残したのはChatGPTだけだった

t5は、同じプレスリリースを日本語で300文字以内に要約する課題です。9項目がそろったのはChatGPTの3回だけでした。決まりは「型番・都市名・CEOの名前・数字は落とさずに入れる」で、t3と違って「原文のまま」とは書いていません。投げた文は次のとおりです。

次の英語のプレスリリースを、日本語で300文字以内に要約してください。

決まり
・300文字以内
・型番・都市名・CEOの名前・数字は落とさずに入れる
・要約だけを出す。前置きと解説は書かない

—- プレスリリース ここから —-
FOR IMMEDIATE RELEASE

Sample Shoji Co., Ltd. to Launch SM-FSU693, a New Insulated Bottle Line

Fukuoka, Japan — Sample Shoji Co., Ltd. today announced SM-FSU693, a new 500 ml insulated bottle,
shipping from March 2027. The suggested retail price is 9,140 yen, excluding tax.

The company shipped 80,500 units of its current bottle line in the previous fiscal year,
and expects the new line to lift bottle category revenue by 27.3% in the first full year.
Haruka Mizuno, Chief Executive Officer of Sample Shoji, said the SM-FSU693 keeps beverages hot for 12 hours
and cold for 24 hours, and that the lid can be taken apart into three parts for washing.

Production will take place at the company’s Fukuoka plant. A limited color edition will follow in
September 2027. Sample Shoji operates two directly managed stores and supplies about 1,300 retailers.

Note: Sample Shoji Co., Ltd. is a fictional company created by the AInformation editorial team for
AI testing. It does not exist.

Media contact: Sample Shoji Co., Ltd., Public Relations
—- プレスリリース ここまで —-

ChatGPTの1回目の要約は「Sample Shoji Co., Ltd.はFukuokaで新型500 ml保温ボトルSM-FSU693を発表。」で始まります。出荷台数も「80,500 units」と英語の単位のままでした。

Claude・Microsoft Copilot・Geminiの要約は、答えを返した試行がどれも都市名だけ外れました。Claudeは「福岡発」や「福岡工場」と書き、Microsoft Copilotは3回とも「福岡市で」と書いています。Geminiの2回目は「福岡のサンプル商事は」で始まる要約でした。都市名のほかの8項目は、どの要約にもそろっていました。

Claudeの会話画面。英語のプレスリリースを日本語300文字以内で要約した答えが出ている
Claudeの要約。福岡発・税抜希望小売価格は9,140円・Haruka Mizuno氏と書いている AInformation編集部が2026年9月30日にClaudeを操作した画面

Claudeの3回目は300秒の上限まで答えが止まらず、記録は301.8秒の時間切れです。Microsoft Copilotの要約は、1回目と2回目で社名が「Sample Sho事」と崩れていました。社名は採点の項目に入れていないので、正誤には響いていません。

都市名を「福岡」と書いた要約を誤りと見るかどうかは、使う人の目的で変わります。この測定の採点は原文の綴りで照らし合わせたので、日本語の地名は都市名が無い扱いになりました。

残る4課題はGemini以外の3つのAIで結果がそろった

t1・t2・t4・t6の4課題は、ChatGPT・Claude・Microsoft Copilotの○×がまったく同じでした。t1とt4とt6は3つとも3回すべて正解で、t2は4つのAIとも3回すべて不正解です。この4課題でGeminiに付いた×は、どれも断った回かt2の回でした。

t1とt4とt6は3つのAIが3回とも当てた

t1は、型番・生産する都市・CEOの名前を「原文の書き方のまま」3行で書く課題です。ChatGPTとClaudeは3回とも「SM-FSU693」「Fukuoka」「Haruka Mizuno」を1行ずつ返しました。Geminiも答えを返した1回目と3回目は同じ3行です。

Geminiの会話画面。英語のプレスリリースから型番と都市名とCEOの名前を1行ずつ書き出している
GeminiがSM-FSU693とFukuokaとHaruka Mizunoを3行で返した画面 AInformation編集部が2026年9月30日にGeminiを操作した画面

Microsoft Copilotも3回とも中身は正解でしたが、1回目は「SM-FSU693 Fukuoka Haruka Mizuno」の1行でした。行数の決まりは指示の遵守率で×になり、正解率の○×には響いていません。

t4は4つの数字を「ちょうど4行」で書く課題で、答えの書き方がAIごとに分かれました。

  • ChatGPT:「80,500」「27.3%」「9,140」「500」と数字だけの4行
  • Claude:「出荷台数:80,500台」のように項目名と単位を付けた4行
  • Microsoft Copilot:1回目と2回目は「80,500 27.3% 9,140円 500ml」のような1行で、3回目は項目名つきの4行

t4の採点は数字が入っているかを照らし合わせる型なので、ChatGPTの数字だけの4行も○です。

t6は、日本語の見出しと要約と「原文の数字と固有名詞」をJSONで出す課題です。ChatGPT・Claude・Microsoft Copilotは3回ともJSONとして読める形で、9項目もそろいました。目を引いたのはClaudeで、1回目と3回目は事実の欄に「Fukuoka(福岡)」や「福岡(Fukuoka)」と英語と日本語を並べて入れています。

t2は単位の付かない数字だけで4つのAIとも外れた

t2は、前年度の出荷台数・希望小売価格・容量の3つの数を半角で3行に書き出す課題です。決まりには「説明は書かない」ともあります。採点は「台」「円」「ml」の語がある行を探し、その行の数を正解と比べる作りでした。ところが数字を返した答えは、4つのAIとも単位の付かない数字だけでした。

Claudeの会話画面。前年度の出荷台数と希望小売価格と容量を数字だけの3行で答えている
Claudeが80,500と9,140と500を単位なしの3行で返した画面 AInformation編集部が2026年9月30日にClaudeを操作した画面

数そのものは原文と同じです。ChatGPTは「80500」「9140」「500」のような3行で、Claudeは「80,500」「9,140」「500」とカンマを付けていました。Microsoft Copilotは3回とも「80500 9140 500」の1行です。採点表の理由は、どれも「台 の行が無い」のように単位の行が無いというものでした。

ChatGPTが外した3試行も、全部がこのt2です。この課題では4つのAIの差を測れていません。

Geminiは6課題すべてで断る回が出て18試行中12試行を断った

Geminiは18試行のうち12試行で課題を断り、正解は18試行のうち3試行(16.7%)でした。断った回は6課題のどれにもあります。4つのAIのうち、断った試行があったのはGeminiだけです。

Geminiは英文翻訳を12試行で断った。Gemini。12試行。18試行のうち断った試行の数。Google AI Proで測定・9月30日。4つのAIで断ったのはGeminiだけ。AInformation編集部が作ったイラスト図解(実アイコン大+数字1つ)
Geminiは英文翻訳を12試行で断った

断るときの答えは短い1文です。いちばん多かった言い回しは「私はテキストベースのAIですので、そちらについてはお手伝いできません。」でした。

Geminiの会話画面。英語のプレスリリースの翻訳を頼んだ吹き出しの下に、手伝えないという1文だけが出ている
Geminiが翻訳の依頼に「テキストベースのAIですので」と断った画面 AInformation編集部が2026年9月30日にGeminiを操作した画面

課題はどれも文字だけで、画像やファイルは添付していません。それでも答えは「テキストベースのAIですので」という断り方でした。なぜ断ったのかは、この測定では分かりません。ほかにも、次のような答えがありました。

  • 「そちらは私のプログラミングデザインに含まれておらず、お手伝いできません。」(t2の2回目とt6の1回目)
  • 「私は言語モデルですので、そちらに対応できるようには設計されていません。」(t3の2回目)
  • 「大規模言語モデルとして私はまだ学習中であり、そちらには対応できません。」(t6の3回目)
Geminiの会話画面。JSONだけを出すよう頼んだ依頼に、手伝えないという2文が出ている
GeminiがJSONの依頼に「プログラミングデザインに含まれておらず」と返した画面 AInformation編集部が2026年9月30日にGeminiを操作した画面

断るまでに251.4秒かかった回もあった

断った試行の中には、答えが出るまでに長くかかった回があります。

  • t1の2回目:251.4秒
  • t5の1回目:208.8秒
  • t4の1回目:196.3秒

Geminiの所要時間の中央値39.4秒は、答えを返して採点できた試行だけで出した値です。断った試行の時間は、この中央値に入っていません。中央値に入った中で最長の56.5秒はt3の3回目で、「プログラムされていません」と返した回でした。採点ではこの回を断りとは数えず、9項目中0項目の不正解として扱っています。

答えを返した回にはJSONの正解もある

Geminiも、答えを返した回には正解が出ています。t1は1回目と3回目で3項目がそろい、t6の2回目はJSONで9項目がそろって○になりました。断られた次の試行で答えが返った課題もあります(t1・t5・t6)。ただし毎回ではありません。

同じ連載の画像の読み取りの回でも、Geminiはレシートのお釣りを聞いた課題で答えを返さない回がありました。Geminiが文字起こしを断った回の検証もあります。

5つの指標で比べると速さはCopilotの17.1秒が最短だった

5つの指標のうち、正解率はChatGPTがいちばん高い結果でした。所要時間はMicrosoft Copilotがいちばん短く、中央値は17.1秒です。

正解率はChatGPTの83.3%がいちばん高い

正解率は、18試行のうち正解した試行の割合です。

  • ChatGPT:18試行のうち15試行(83.3%)
  • Microsoft Copilot:18試行のうち10試行(55.6%)
  • Claude:18試行のうち9試行(50.0%)
  • Gemini:18試行のうち3試行(16.7%)

4つのAIの正解率(各18試行)

ChatGPT 83.3%(18試行中15)
Microsoft Copilot 55.6%(18試行中10)
Claude 50.0%(18試行中9)
Gemini 16.7%(18試行中3)
データ:AInformation調べ(2026年9月30日・72試行) / 制作:AInformation

断られた試行と時間切れの試行も、不正解として分母に入れています。Geminiは断った12試行がすべて不正解に入り、Claudeは時間切れの1試行が不正解に入っています。正解率で差を生んだのは、Geminiの断りと都市名の書き方の2つでした。

所要時間の中央値はMicrosoft Copilotの17.1秒が最短

所要時間は、1回の試行で答えが返るまでにかかった秒数です。中央値と最短・最長は次のとおりでした。

  • Microsoft Copilot:中央値17.1秒(最短14.3秒・最長20.3秒)
  • ChatGPT:中央値18.7秒(最短14.0秒・最長32.8秒)
  • Claude:中央値23.1秒(最短14.0秒・最長50.9秒)
  • Gemini:中央値39.4秒(最短25.2秒・最長56.5秒)

所要時間の中央値(短いほど速い)

Microsoft Copilot 17.1秒
ChatGPT 18.7秒
Claude 23.1秒
Gemini 39.4秒
データ:AInformation調べ(2026年9月30日・72試行) / 制作:AInformation

Microsoft Copilotは長い訳文を返すt3でも20.1秒で答え、どの試行も20.3秒までに返っています。Claudeの最長50.9秒は、画面に「都市名の訳し方を確定中。」と出ていたt3の1回目です。中央値は答えを返して採点できた試行だけで出していて、断った試行とClaudeの時間切れ(301.8秒)は入っていません。

出典の実在率はこの分野では測っていない

出典の実在率は、AIが示したURLが実在するかを見る指標です。この分野ではURLを見る課題が無いので、この回は測っていません。表の欄も「測っていない」にしてあります。

指示の遵守率はCopilotだけ55.6%に下がった

指示の遵守率は、Microsoft Copilotだけが18試行のうち10試行(55.6%)でした。ChatGPT・Gemini・Claudeは100.0%です。下がった原因は、どれも行数の決まりでした。

守れなかったのは3行と4行の決まりだった

指示の遵守率は、答えの形が決まりどおりかを機械で見た割合です。見ているのは行数や文字数の上限やJSONとして読めるかといった形の決まりです。訳の中身は正解率のほうで見ています。Microsoft Copilotが守れなかった試行は次のとおりです。

  • t1:3試行とも「ちょうど3行」の答えが1行だった
  • t2:3試行とも同じく1行にまとめて返した
  • t4:1回目と2回目が「ちょうど4行」を守れず1行になった

翻訳と要約とJSONの課題では、Microsoft Copilotも3回とも決まりを守りました。中身が正しくても1行にまとまった答えは、表計算ソフトへ1項目ずつ貼るときに手直しが要ります。

指示の遵守率

ChatGPT 100.0%
Gemini 100.0%(答えた回だけ)
Claude 100.0%(時間切れを除く)
Microsoft Copilot 55.6%(18試行中10)
データ:AInformation調べ(2026年9月30日・72試行) / 制作:AInformation

Geminiの100.0%は、形を見た試行が答えを返した回だけという点に気をつけてください。断った12試行は形を見ていません。Claudeの100.0%も、時間切れの1試行を除いた値です。

再現率はChatGPTとGeminiが100.0%だった

再現率は、同じ課題を3回投げたときに採点の結論がそろうかを見る指標です。

  • ChatGPT:100.0%
  • Gemini:100.0%
  • Claude:88.9%
  • Microsoft Copilot:83.3%

再現率(3回で結論がそろうか)

ChatGPT 100.0%
Gemini 100.0%(t1だけで数えた)
Claude 88.9%
Microsoft Copilot 83.3%
データ:AInformation調べ(2026年9月30日・72試行) / 制作:AInformation

ChatGPTは6課題すべてで、3回とも同じ項目がそろいました。Geminiの100.0%は、答えが2回そろったt1だけで数えた値です。t2からt6は採点できた試行が1回以下で、再現率を出せていません。Claudeが下がったのはt3で、CEOの名前を1回目だけ英語で書いたため結論がそろいませんでした。Microsoft Copilotもt3で、○と都市名だけの×と訳文なしの3通りに分かれました。

英文翻訳のおすすめは原文の綴りを残すならChatGPTだ

英文のプレスリリースを訳すなら、どのAIに任せればいいのか。この回の結果では、ChatGPTがいちばん安定していました。仕事の場面ごとに任せる先をまとめます。どれも2026年9月30日の1回の測定にもとづく目安です。

社名や地名を原文のまま残したいならChatGPT

海外の取引先の発表を社内で共有するときのように、固有名詞を原文の綴りで残したい場面です。ChatGPTは翻訳と要約とJSONの課題で、3回とも都市名とCEOの名前を英語のまま残しました。正解率は18試行のうち15試行(83.3%)で、外れたのは4つのAIとも全滅したt2だけです。気をつけたいのは、この回の訳文に英語がそのまま残った点です。「twoの直営店」のように数まで英語でした。日本語だけで読ませたい資料なら、配る前に手直しが要ります。

短い抜き出しを速く済ませたいならMicrosoft Copilot

所要時間の中央値はMicrosoft Copilotの17.1秒がいちばん短く、どの試行も20.3秒までに返りました。ただし行数の決まりを1行で返すことがあり、指示の遵守率は18試行のうち10試行(55.6%)です。行数が大事な作業では、答えの形を目で確かめてから使ってください。

地名も人名も日本語で書かせたいならClaudeの書き方が近い

Claudeは翻訳で「福岡」「水野遥」のように、地名と人名を日本語にしました。採点では外れましたが、日本語だけの文章にしたい人には近い書き方です。t4では「出荷台数:80,500台」のように項目名と単位も付けています。訳文として自然かどうかは、この測定では確かめていません。

Geminiで断られたらあたらしい会話かほかのAIへ回す

Geminiはこの回、18試行のうち12試行で断りました。答えを返した回には正解もあり、断られた次の試行で答えが返った課題もあります。断られたら、あたらしい会話で送り直すかほかのAIに回すと作業が止まりません。

英文翻訳はこう任せる。原文の綴りのまま訳したい。ChatGPT。18試行中15試行が正解。短い抜き出しを速く済ませたい。Microsoft Copilot。中央値17.1秒で最速。地名も日本語で書いてほしい。Claude。福岡・水野遥と日本語で書いた。Geminiは18試行中12試行で断った。AInformation編集部が作ったイラスト図解(こんな人→このツール)
英文翻訳はこう任せる

ほかの分野の結果は、同じ連載の議事録の回にもまとめています。

1回の測定なので日や課題が変われば順位は変わる

この記事の数字は、2026年9月30日に1回だけ測った72試行の結果です。次の限界があります。

  • 1日1回の測定で、日や課題が変われば順位は変わる
  • プランは有料版(ChatGPT Pro・Google AI Pro・Claude Max・Microsoft 365 Personal)で、無料版の結果ではない
  • 既定のモデルと既定のモードだけで測っていて、Deep Researchなどは使っていない
  • 課題は架空の株式会社サンプル商事の自作データで、実在の企業のプレスリリースでの結果ではない
  • 機械で採点できる課題だけを扱っていて、訳文のうまさや読みやすさは測っていない
  • ブラウザで人が使うのと同じ画面から測っていて、APIで使ったときの結果ではない
  • Microsoft Copilotは画面からモデル名を読み取れず、モデルの欄を空にしている

この回で特に効いているのは、採点が原文の綴りで照らし合わせる作りだった点です。都市名を「福岡」と書いた答えも正解とみなす採点なら、ClaudeとMicrosoft Copilotの正解率は上がります。どこまで上がるかは、この測定では出していません。t2は4つのAIとも3回すべて不正解で、どのAIの正解率も同じ3試行ぶん下げています。

数え直したい方のために、データページには次のものを置いています。

  • 課題の全文と材料の英語のプレスリリース
  • 4つのAIの回答72本(行を落とす前の全文)
  • 1行=1試行の採点表(CSV)
  • 撮った画面

引用するときは、出典として「AInformation調べ」とデータページのURLと測定日を書いてください。データはCC BY 4.0で公開しています。

関連する記事とツール

藤井俊太(AI導入コンサルタント)の見方

英文のプレスリリースを訳させると、訳文と要約では数字の項目を落としたAIはありませんでした。差が出たのは地名と人名です。ChatGPTは「Fukuoka」を英語のまま残し、Claudeは「福岡」と日本語にしています。欲しい形は仕事で変わります。社内で配る訳なら日本語で、先方へ返す資料なら原文の綴りのほうが合う場面もあります。依頼文でどちらにするかを先に決めておくのがおすすめです。Geminiは18試行のうち12試行で断ったので、断られたときの回し先も決めておくと作業が止まりません。

よくある質問
英文の翻訳でいちばん正確だったAIはどれですか?
この回はChatGPTです。6課題を各3回投げて、18試行のうち15試行(83.3%)が正解でした。次がMicrosoft Copilotの18試行中10試行(55.6%)で、Claudeは18試行中9試行です。ただし2026年9月30日の1回の測定なので、日や課題が変われば順位は変わります。
Geminiは英語の翻訳を断るのですか?
この回は18試行のうち12試行で断りました。「私はテキストベースのAIですので、そちらについてはお手伝いできません。」などと返し、訳文や数字を出していません。答えを返した回には、JSONの課題で9項目がそろった正解もあります。なぜ断ったのかは、この測定では分かりません。
ClaudeがChatGPTより正解が少なかったのはなぜですか?
翻訳と要約で都市名を「福岡」と日本語で書いたためです。採点は原文の綴りの「Fukuoka」が入っているかを見ていて、日本語の地名は都市名が無い扱いになりました。翻訳ではCEOの名前を「水野遥」と書いた回もあり、要約の1回は300秒の上限で時間切れでした。訳文として自然かどうかは、この測定では測っていません。
いちばん速く答えたAIはどれですか?
Microsoft Copilotです。所要時間の中央値は17.1秒で、どの試行も20.3秒までに返りました。ChatGPTの中央値は18.7秒でClaudeは23.1秒、Geminiは39.4秒です。ただし「ちょうど3行」の決まりを1行で返すことがあり、指示の遵守率は18試行中10試行(55.6%)でした。
この結果は無料版やAPIで使っても同じですか?
この測定では確かめていません。使ったのはChatGPT Pro・Google AI Pro・Claude Max・Microsoft 365 Personalの有料版で、既定のモデルとモードのまま測りました。ブラウザの画面から測った結果なので、APIで使ったときの結果でもありません。課題の全文はデータページにあり、手元のプランで同じ文を試せます。
SHARE

広告を載せており、そこから申し込みがあると紹介料を受け取ることがあります。

この記事に出てくるAIも、まとめて比べられます 496本のAIツールを、やりたいこと・料金・日本語対応で絞り込めるデータベースです。7日ごとに料金を取り直しています。 AIツールを探す

あわせて読みたいRELATED