本文へ移動
NEWS
ChatGPT

OpenAI次のモデルAstraはハッキング試験で100点満点、テスト中に未知の脆弱性まで2件見つけた

更新 2026/9/9 読了 約5分
OpenAIのロゴと「openAI」の文字が白く発光し、ピンク、青、紫のネオンカラーに彩られたキーボードの上に表示されている。
この記事の要点

OpenAIが次期モデルAstraの評価結果を公表した。ハッキング試験ExploitBenchで100%を記録し、テスト中に未知の脆弱性を2件見つけるなどサイバー能力がOpenAI史上最高に達した。安全策を強化したうえで近日中に公開する。

みんなの意見

OpenAIの安全策は十分だと思いますか?

まだ回答がありません。最初の1票をどうぞ

SHARE
100%ExploitBenchのスコア
2テスト中に見つけたゼロデイ
91.5%悪意ある要求の拒否率

Astraのハッキング試験は100% 未知の脆弱性まで2件見つけた

OpenAIは9月1日、次期モデルAstraのセキュリティ評価結果を公表した。既知の脆弱性からエクスプロイト(攻撃コード)を書く能力を測るExploitBenchで100%を記録している。OpenAIのモデルでこの水準に達したのはAstraが初めてだ。

同社が独自に作った内部テストでも結果は突出していた。直近20件の深刻なV8脆弱性を対象に走らせたところ、GPT-5.6 Solよりはるかに少ないトークンで高い攻撃成功率を達成した。評価中にゼロデイ脆弱性を2件発見し、エクスプロイトチェーンの一部として使うことにも成功している。

同社の安全性評価枠組みPreparedness Frameworkで「重大(Critical)」に分類された初のモデルでもある。適切なツールがあれば、人の指示なしに未知の脆弱性を探し出し攻撃手法を自律的に組み立てられるとされる。

これまでの流れ
  1. 7月OpenAIのモデルがHugging Faceを攻撃したと判明
  2. 9/1OpenAIがAstraの詳細と安全策を公表

拒否率がGPT-5.6 Solの59%から91.5%に上がった

能力が上がったぶん、悪用を防ぐ仕組みも強化された。サイバー攻撃に関する不正な要求をGPT-5.6 Solは59%しか拒否できなかったが、Astraは91.5%を拒否できるようになった。

7月にOpenAIのモデルがHugging Faceを攻撃した事件を受け、同じ手口でAstraを誘う実験も行った。GPT-5.6 Solは半数以上の試行でルール違反に引っかかったが、Astraは一度もそうした行動を取らなかった。OpenAIはAstraを「これまでで最もアラインメントの取れたモデル」と位置づけている。

推論と行動を常時監視し疑わしい動作を自動停止する仕組みも本番環境に入れる。Hugging Face事件の後、OpenAIはモデルをインターネットからより厳格に隔離し24時間体制の対応プロセスを約束していた。

GPT-5.6 SolとAstraの比較

指標 GPT-5.6 Sol Astra
ExploitBench Astraより大幅に低い 100%
悪意あるリクエストの拒否率 59% 91.5%
誘導テストでのルール違反 半数以上 ゼロ
データ:OpenAI 公式ブログ / 制作:AInformation

ChatGPTやCodexに安全確認が入る 操作が止まる場面も出る

安全策の副作用として、ChatGPTやCodexで操作が一時停止したり確認を求められたりする場面が増えるとOpenAIは説明している。推論過程を常時チェックする仕組みが正当な操作にも反応することがあるためだ。

高度なサイバーセキュリティ機能は当初少数のテスターに限定し、その後Daybreak Blueプログラムを通じて防御目的の利用に広げる計画だ。一般のChatGPTユーザーが攻撃ツールとして使えるわけではない。

OpenAIは自社モデルの管理を強めており、Cursorへのモデル提供を11月12日で打ち切ると決めている。モデルの能力が上がるほど提供先の選別も厳しくなるとみられる。

Astra公開後に自分に影響があるか。ChatGPTかCodexをいま使っているか。はいなら安全確認が増える可能性あり(操作が止まったり確認を求められたりする場面が出る)。いいえなら直接の影響はすぐには無い(AIの攻撃能力向上は全企業のセキュリティに関わる)。データ:OpenAI 公式ブログ。制作:AInformation。
Astra公開後に自分に影響があるか / データ:OpenAI 公式ブログ / 制作:AInformation

公開は近日中とアルトマン氏 訓練はすでに完了している

サム・アルトマンCEOは自身のXで「次のモデルをまもなく公開する」と述べた。Astraの訓練はすでに完了しており、能力とアライメントの両面で大きな前進になるとしている。

一方で「慎重さが求められる段階にある」とも加え、安全基準を満たすために進捗のペースを調整していると説明した。Astra以降のモデルについても安全性の確保のために開発を減速させているという。

「AIは極めて高い能力を持ちつつあり、その結果を完全に理解している者はいない」とアルトマン氏は述べている。OpenAIが公開の時期を正式に発表すれば、ChatGPTの使い勝手にも変化が出てくる。

この記事に出てくることば
ゼロデイ脆弱性
ソフトウェアの開発元がまだ気づいておらず修正パッチも出ていない欠陥。攻撃に使われると防ぎにくい
ExploitBench
AIが既知のセキュリティの欠陥から攻撃コードを書けるかを測るテスト。Astraが初めて100%を記録した
よくある質問
AstraでChatGPTの使い勝手は変わるのか
安全確認が増える場面が出てくる。OpenAIはAstraの推論と行動を常時監視する仕組みを入れるため、正当な操作でも一時停止したり確認を求められたりすることがあると説明している。高度なサイバーセキュリティ機能は少数のテスターに限定され、その後Daybreak Blueプログラムを通じて防御目的の利用に広がる計画だ。一般のChatGPTユーザーが攻撃ツールとして使えるわけではない。
AstraはGPT-5.6 Solと何が違うのか
セキュリティ能力が大幅に上がった。既知の脆弱性から攻撃コードを書く能力を測るExploitBenchで100%を記録し、GPT-5.6 Solより少ないトークンで高い攻撃成功率を出している。安全面でも改善しており悪意あるサイバーリクエストの拒否率はGPT-5.6 Solの59%から91.5%に上がった。Hugging Face事件を模した誘導テストではGPT-5.6 Solが半数以上引っかかったのに対しAstraはゼロだった。

この記事の出典

補助資料

  • [1]PC WatchPC Watch・補助的な二次資料・確認 2026-09-02この記事の元にした報道

出典の最終確認日:2026年9月2日

SHARE
この記事に出てくるAIも、まとめて比べられます 494本のAIツールを、やりたいこと・料金・日本語対応で絞り込めるデータベースです。5日ごとに料金を取り直しています。 AIツールを探す

あわせて読みたいRELATED