本文へ移動
NEWS
開発・技術

GPT-6 Astraは合格率28.0%、Geminiは8.0%で7位だ

更新 2026/9/28 読了 約7分
Googleのロゴと『D. Veloper』の名札を首から下げた緑のAndroidロボット像が屋外に立つ写真。Googleの開発テストで自社Geminiは合格率8%の7位だった
この記事の要点

GoogleのAI開発力テスト「Android Bench 2.0」で、自社のGemini 3.8 Flashは合格率8.0%の7位だった。1位はCodexで動かしたGPT-6 Astraの28.0%。30作業のうち16はどのAIも通せず、何日もかかる開発を任せるのはまだ早い。

みんなの意見

合格率28%でもAIに開発を任せますか?

まだ回答がありません。最初の1票をどうぞ

SHARE
28%長期タスクの最高合格率
91%従来タスクの最高通過率

1週間級の30作業で1位はGPT-6 Astra 合格は28.0%

Googleが9月17日(米国時間)に公開した「Android Bench 2.0」で、1位はCodexで動かしたGPT-6 Astraの合格率28.0%だった。AIのAndroidアプリ開発の力を測るテストで、今回からエンジニアが数日から1週間かけて取り組む長期タスクを加えた。従来の作業で約91%あった最高の通過率は、約28%まで下がった。

AInformationは9月26日に公式のリーダーボードを開き、11モデルの結果を確かめた。表は9月17日時点のもので、どのモデルも30の作業を5回ずつ解いている。合格率は、テストと検証を最後まで通った回の割合だ。

2位はClaude Codeで動かしたClaude Fable 5.1の22.7%で、GPT-6 Astraには届かなかった。Google自身のGemini 3.8 Flashは8.0%で7位にとどまり、表に入ったGeminiはFlashの2つだけだ。

11モデルの成績 合格率と1周の時間と費用

モデル 動かした道具 合格率 完了率 1周の時間 1周の費用
GPT-6 Astra Codex 28.0% 82.2% 7.9時間 375.7ドル
Claude Fable 5.1 Claude Code 22.7% 82.4% 22.2時間 492.6ドル
GPT-5.6 Sol Codex 19.3% 74.3% 8.6時間 235.8ドル
Claude Opus 5 Claude Code 16.7% 77.8% 27.0時間 861.4ドル
Qwen3.8 Max qwen-coder 14.0% 74.3% 47.2時間 260.2ドル
Kimi K3 kimi-code 12.0% 72.8% 66.2時間 418.3ドル
Gemini 3.8 Flash antigravity-sdk 8.0% 47.4% 12.1時間 34.5ドル
Gemini 3.7 Flash antigravity-sdk 7.3% 50.1% 9.9時間 26.0ドル
Claude Sonnet 5 Claude Code 6.7% 59.8% 14.7時間 283.7ドル
GPT-5.6 Terra Codex 4.7% 53.4% 5.1時間 53.2ドル
GPT-5.6 Luna Codex 3.3% 55.2% 7.6時間 13.5ドル

出典はAndroid Benchの公式リーダーボード(9月17日時点の結果をAInformationが9月26日に確認)。時間と費用は30の作業を1周させたときの平均で、Googleの公表値だ。

Google公式ブログのAIのページ
Google公式ブログのAIのページ / 出典:blog.google / 制作:AInformation

30作業のうち16はどのAIも通せず 移植は11モデル全滅

タスク別の明細をAInformationが数えると、30の作業のうち16はどのモデルも5回中1回も合格できなかった。FlutterとReact NativeのアプリをAndroidへ移す2つの作業は、11モデルとも全滅だ。出前アプリにSMS認証の画面を足す作業も、合格したモデルは無い。

1位のGPT-6 Astraでも、1回でも合格した作業は30のうち11にとどまる。Flutterで作られた習慣管理アプリの移植は完了率99%まで進んだが、5回ともテストで落ちた。GPT-6 Astraで完了率が90%を超えたのに合格0回だった作業は7つある。

5回とも合格した作業は6つ 決まった書き換えは強い

反対に、GPT-6 Astraが5回とも合格した作業は6つあった。JavaからKotlinへの書き換えとRetrofitからKtorへの置き換えに加え、本の検索アプリを一から作る作業も通している。Googleも手順が決まった書き換えはAIが得意だと分析している。

ただしGoogleが得意な作業に挙げたViewModel層の導入は、GPT-6 Astraでも完了率94%のまま5回とも不合格だった。影響が大きいのは、FlutterやReact Nativeで作ったアプリをAndroid向けに作り直したい会社だ。古いライブラリの置き換えのような型の決まった作業なら、AIに任せる候補になる。

GPT-6 Astraの30作業では。AIが通せた作業と通せない作業。開発をAIに任せたい…。5回とも合格。JavaからKotlinへ。RetrofitからKtorへ。本の検索アプリ。5回とも不合格。Flutterアプリの移植。SMS認証の画面づくり。ViewModel層の導入。完了率99%でも合格は0回。AInformation編集部が作ったイラスト図解(人物の悩み+◎△の2枚カード)
Android Bench公式リーダーボードのタスク別の結果をもとに整理した / 制作:AInformation

従来1位のClaude Opus 5は4位 評判で選ぶと外れる

短い作業の評判でAIを選ぶと外れる可能性がある。従来の100作業ではClaude Opus 5が91.8%で1位だったが、長期タスクでは16.7%の4位に下がった。短い修正が得意なことと、何日もかかる開発をやり切れることは別の力だ。

時間と費用 1周861.4ドルから13.5ドルまで開く

30の作業を1周させる平均の費用は、最も高いClaude Opus 5の861.4ドルから最も安いGPT-5.6 Lunaの13.5ドルまで開く。1位のGPT-6 Astraは7.9時間と375.7ドルだった。2位のClaude Fable 5.1は22.2時間と492.6ドルで、合格率が下なのに時間も費用も上回る。

Gemini 3.8 Flashは34.5ドルと安いが、合格率も完了率も上位のモデルには及ばない。日本の現場で効いてくるのは、外に出していたAndroid開発をAIに回すときの見積もりだ。1周に数百ドルかけても合格が3割に届かない以上、AIに回すのは型の決まった作業から始めることになる。

表は9月17日時点なので、その後に出たClaude Opus 5.5はまだ入っていない。

Android Benchの公式リーダーボードの長期タスクの表。GPT 6 Astra(codex)が合格率28.0%・費用375.7ドルで1位、Gemini 3.8 Flash(antigravity-sdk)は8.0%で7位に並ぶ
Android Benchの公式リーダーボード。長期タスクの合格率・完了率・時間・費用が並ぶ 出典:developer.android.com(2026年9月26日時点の画面)

任せる前に3つ決める 作業の種類と合格テストと上限額

AIに開発を任せる前に決めておきたいのは、作業の種類と合格テストと費用の上限の3つだ。

  • 任せる作業を「決まった書き換え」「新しい機能づくり」「アプリの移植」に分け、移植はまだ人が持つ
  • 合格の条件をテストで先に書く。完了率が高くても合格しない作業が多いので、見た目の仕上がりでは判断しない
  • 1回あたりの費用と時間の上限を決める。同じ作業を何回か流し、何回通るかも数えておく

Googleは今後、モデルと道具の組み合わせを増やして結果を広げるとしている。Claude Opus 5.5のような新しいモデルが入れば、今回の順位はまた入れ替わる可能性がある。

この記事に出てくることば
長期タスク
エンジニアが数日から1週間かけて取り組む開発作業。依存関係の更新や新機能の追加、アプリの一からの構築や移植が入る。
完了率
合格か不合格かだけでなく、どこまで仕上がったかを示す値。機能と画面の再現度、既存の機能を壊していないかを合わせて計算する。
藤井俊太(AI導入コンサルタント)の見方

見ておきたいのは完了率と合格率の開きだ。GPT-6 Astraの完了率は82.2%あるのに合格は28.0%で、8割方できた成果物の多くが最後のテストで落ちている。現場ではこの残りを直す人の時間が見積もりから抜けやすい。AIに開発を任せる会社は合格テストを書ける人を先に社内へ置かないと、レビュー待ちの成果物が積み上がるとみている。

よくある質問
AIに1週間分の開発を任せると何割が合格する?
最高でも28.0%だ。GoogleのAndroid Bench 2.0では、1位のGPT-6 AstraをCodexで動かしても30の作業の合格は28.0%だった。2位のClaude Fable 5.1は22.7%で、GoogleのGemini 3.8 Flashは8.0%にとどまる。30の作業のうち16はどのモデルも5回中1回も合格できなかった。
Claude CodeとCodexはどちらが長い開発に強い?
上位の組み合わせ同士ではCodexで動かしたGPT-6 Astraが上だった。合格率は28.0%で、Claude Codeで動かしたClaude Fable 5.1の22.7%を上回る。完了率は82.2%と82.4%でほぼ並ぶ。30の作業を1周する平均はGPT-6 Astraが7.9時間と375.7ドルで、Claude Fable 5.1は22.2時間と492.6ドルだった。
AIに任せやすい開発作業と任せにくい作業は?
手順の決まった書き換えは任せやすく、アプリの移植は任せにくい。GPT-6 AstraはJavaからKotlinへの書き換えとRetrofitからKtorへの置き換えを5回とも通した。FlutterとReact NativeのアプリをAndroidへ移す2つの作業は、11モデルとも1回も合格しなかった。GPT-6 AstraはFlutterの移植で完了率99%まで進んだが、テストで5回とも落ちている。
Android Benchで最も費用がかかったAIは?
Claude Opus 5で、30の作業を1周させる平均が861.4ドルだった。時間も27.0時間かかり、合格率は16.7%で4位だ。1位のGPT-6 Astraは375.7ドルと7.9時間で済んでいる。安いほうではGemini 3.8 Flashが34.5ドルだったが、合格率は8.0%にとどまった。

この記事の出典

補助資料

  • [1]ITmedia AI+ITmedia AI+・補助的な二次資料・確認 2026-09-26この記事の元にした報道

出典の最終確認日:2026年9月26日

SHARE

広告を載せており、そこから申し込みがあると紹介料を受け取ることがあります。

この記事に出てくるAIも、まとめて比べられます 496本のAIツールを、やりたいこと・料金・日本語対応で絞り込めるデータベースです。7日ごとに料金を取り直しています。 AIツールを探す

あわせて読みたいRELATED