1週間級の30作業で1位はGPT-6 Astra 合格は28.0%
Googleが9月17日(米国時間)に公開した「Android Bench 2.0」で、1位はCodexで動かしたGPT-6 Astraの合格率28.0%だった。AIのAndroidアプリ開発の力を測るテストで、今回からエンジニアが数日から1週間かけて取り組む長期タスクを加えた。従来の作業で約91%あった最高の通過率は、約28%まで下がった。
AInformationは9月26日に公式のリーダーボードを開き、11モデルの結果を確かめた。表は9月17日時点のもので、どのモデルも30の作業を5回ずつ解いている。合格率は、テストと検証を最後まで通った回の割合だ。
2位はClaude Codeで動かしたClaude Fable 5.1の22.7%で、GPT-6 Astraには届かなかった。Google自身のGemini 3.8 Flashは8.0%で7位にとどまり、表に入ったGeminiはFlashの2つだけだ。
11モデルの成績 合格率と1周の時間と費用
| モデル | 動かした道具 | 合格率 | 完了率 | 1周の時間 | 1周の費用 |
|---|---|---|---|---|---|
| GPT-6 Astra | Codex | 28.0% | 82.2% | 7.9時間 | 375.7ドル |
| Claude Fable 5.1 | Claude Code | 22.7% | 82.4% | 22.2時間 | 492.6ドル |
| GPT-5.6 Sol | Codex | 19.3% | 74.3% | 8.6時間 | 235.8ドル |
| Claude Opus 5 | Claude Code | 16.7% | 77.8% | 27.0時間 | 861.4ドル |
| Qwen3.8 Max | qwen-coder | 14.0% | 74.3% | 47.2時間 | 260.2ドル |
| Kimi K3 | kimi-code | 12.0% | 72.8% | 66.2時間 | 418.3ドル |
| Gemini 3.8 Flash | antigravity-sdk | 8.0% | 47.4% | 12.1時間 | 34.5ドル |
| Gemini 3.7 Flash | antigravity-sdk | 7.3% | 50.1% | 9.9時間 | 26.0ドル |
| Claude Sonnet 5 | Claude Code | 6.7% | 59.8% | 14.7時間 | 283.7ドル |
| GPT-5.6 Terra | Codex | 4.7% | 53.4% | 5.1時間 | 53.2ドル |
| GPT-5.6 Luna | Codex | 3.3% | 55.2% | 7.6時間 | 13.5ドル |
出典はAndroid Benchの公式リーダーボード(9月17日時点の結果をAInformationが9月26日に確認)。時間と費用は30の作業を1周させたときの平均で、Googleの公表値だ。

30作業のうち16はどのAIも通せず 移植は11モデル全滅
タスク別の明細をAInformationが数えると、30の作業のうち16はどのモデルも5回中1回も合格できなかった。FlutterとReact NativeのアプリをAndroidへ移す2つの作業は、11モデルとも全滅だ。出前アプリにSMS認証の画面を足す作業も、合格したモデルは無い。
1位のGPT-6 Astraでも、1回でも合格した作業は30のうち11にとどまる。Flutterで作られた習慣管理アプリの移植は完了率99%まで進んだが、5回ともテストで落ちた。GPT-6 Astraで完了率が90%を超えたのに合格0回だった作業は7つある。
5回とも合格した作業は6つ 決まった書き換えは強い
反対に、GPT-6 Astraが5回とも合格した作業は6つあった。JavaからKotlinへの書き換えとRetrofitからKtorへの置き換えに加え、本の検索アプリを一から作る作業も通している。Googleも手順が決まった書き換えはAIが得意だと分析している。
ただしGoogleが得意な作業に挙げたViewModel層の導入は、GPT-6 Astraでも完了率94%のまま5回とも不合格だった。影響が大きいのは、FlutterやReact Nativeで作ったアプリをAndroid向けに作り直したい会社だ。古いライブラリの置き換えのような型の決まった作業なら、AIに任せる候補になる。

従来1位のClaude Opus 5は4位 評判で選ぶと外れる
短い作業の評判でAIを選ぶと外れる可能性がある。従来の100作業ではClaude Opus 5が91.8%で1位だったが、長期タスクでは16.7%の4位に下がった。短い修正が得意なことと、何日もかかる開発をやり切れることは別の力だ。
時間と費用 1周861.4ドルから13.5ドルまで開く
30の作業を1周させる平均の費用は、最も高いClaude Opus 5の861.4ドルから最も安いGPT-5.6 Lunaの13.5ドルまで開く。1位のGPT-6 Astraは7.9時間と375.7ドルだった。2位のClaude Fable 5.1は22.2時間と492.6ドルで、合格率が下なのに時間も費用も上回る。
Gemini 3.8 Flashは34.5ドルと安いが、合格率も完了率も上位のモデルには及ばない。日本の現場で効いてくるのは、外に出していたAndroid開発をAIに回すときの見積もりだ。1周に数百ドルかけても合格が3割に届かない以上、AIに回すのは型の決まった作業から始めることになる。
表は9月17日時点なので、その後に出たClaude Opus 5.5はまだ入っていない。

任せる前に3つ決める 作業の種類と合格テストと上限額
AIに開発を任せる前に決めておきたいのは、作業の種類と合格テストと費用の上限の3つだ。
- 任せる作業を「決まった書き換え」「新しい機能づくり」「アプリの移植」に分け、移植はまだ人が持つ
- 合格の条件をテストで先に書く。完了率が高くても合格しない作業が多いので、見た目の仕上がりでは判断しない
- 1回あたりの費用と時間の上限を決める。同じ作業を何回か流し、何回通るかも数えておく
Googleは今後、モデルと道具の組み合わせを増やして結果を広げるとしている。Claude Opus 5.5のような新しいモデルが入れば、今回の順位はまた入れ替わる可能性がある。
- 長期タスク
- エンジニアが数日から1週間かけて取り組む開発作業。依存関係の更新や新機能の追加、アプリの一からの構築や移植が入る。
- 完了率
- 合格か不合格かだけでなく、どこまで仕上がったかを示す値。機能と画面の再現度、既存の機能を壊していないかを合わせて計算する。
見ておきたいのは完了率と合格率の開きだ。GPT-6 Astraの完了率は82.2%あるのに合格は28.0%で、8割方できた成果物の多くが最後のテストで落ちている。現場ではこの残りを直す人の時間が見積もりから抜けやすい。AIに開発を任せる会社は合格テストを書ける人を先に社内へ置かないと、レビュー待ちの成果物が積み上がるとみている。
- AIに1週間分の開発を任せると何割が合格する?
- 最高でも28.0%だ。GoogleのAndroid Bench 2.0では、1位のGPT-6 AstraをCodexで動かしても30の作業の合格は28.0%だった。2位のClaude Fable 5.1は22.7%で、GoogleのGemini 3.8 Flashは8.0%にとどまる。30の作業のうち16はどのモデルも5回中1回も合格できなかった。
- Claude CodeとCodexはどちらが長い開発に強い?
- 上位の組み合わせ同士ではCodexで動かしたGPT-6 Astraが上だった。合格率は28.0%で、Claude Codeで動かしたClaude Fable 5.1の22.7%を上回る。完了率は82.2%と82.4%でほぼ並ぶ。30の作業を1周する平均はGPT-6 Astraが7.9時間と375.7ドルで、Claude Fable 5.1は22.2時間と492.6ドルだった。
- AIに任せやすい開発作業と任せにくい作業は?
- 手順の決まった書き換えは任せやすく、アプリの移植は任せにくい。GPT-6 AstraはJavaからKotlinへの書き換えとRetrofitからKtorへの置き換えを5回とも通した。FlutterとReact NativeのアプリをAndroidへ移す2つの作業は、11モデルとも1回も合格しなかった。GPT-6 AstraはFlutterの移植で完了率99%まで進んだが、テストで5回とも落ちている。
- Android Benchで最も費用がかかったAIは?
- Claude Opus 5で、30の作業を1周させる平均が861.4ドルだった。時間も27.0時間かかり、合格率は16.7%で4位だ。1位のGPT-6 Astraは375.7ドルと7.9時間で済んでいる。安いほうではGemini 3.8 Flashが34.5ドルだったが、合格率は8.0%にとどまった。
この記事の出典
補助資料
- [1]ITmedia AI+この記事の元にした報道
出典の最終確認日:2026年9月26日
