OpenAIの安全性研究者3人が解雇を公表 理由を書面で求めた
米OpenAIで安全性やアライメントの研究をしていた3人が、前週に解雇されたと10月8日(日本時間)にXで公表しました。ミキタ・バレスニ氏とジャスミン・ワン氏、トメク・コルバク氏です。3人は経営陣に宛てた書簡を公開し、解雇の理由を書面で示すよう求めています。
3人はAIの思考過程を人が監視できる状態を保つ監視可能性の研究などに関わっていました。コルバク氏とバレスニ氏は7月のHugging Face侵害事件の調査にも加わっています。コルバク氏は外部調査を担った米METRとの技術窓口でした。
書簡は解雇の進め方が、残る従業員を萎縮させていると訴えています。米The Informationが報じた監視しにくい新しい仕組みの記事についても、自分たちは情報源ではないと書いています。

- 9/12アルトマン氏が評価機関に社員並みのアクセスを示す
- 10/8研究者3人が解雇を公表し書簡を公開
- 10/8OpenAIが機密情報の規定違反だと声明
OpenAIは機密情報の規定違反と説明 違反の中身は明かしていない
OpenAIは同じ日に「our research leaders」名義でXに声明を出しました。社内調査で3人が機密情報の扱いに関する規定に違反したと判明したと説明しています。安全性への懸念を表明したことが理由ではない、というのが同社の立場です。
一方で、どの規定にどう違反したのかは明かしていません。個別の雇用問題は通常は公にしないためです。書簡の内容を超える重大な信頼違反も見つかったとして、解雇の判断は変えないとしました。
| 論点 | 3人の主張 | OpenAIの説明 |
|---|---|---|
| 解雇の理由 | 書面で示されていない。ワン氏に示されたのは幹部のメールへのアクセスの1点だけ | 機密情報の扱いに関する規定違反。どの規定かは公表しない |
| 安全性との関係 | 安全性を優先したための解雇だ | 懸念を表明したことは理由ではない |
| 外部の機関 | 外部の安全性研究組織との日常のやりとりは欠かせない | 外部の安全性評価機関と契約の最終調整中 |

GPT-6 AstraのAPIで思考を試した 要約は2回中1回だ
3人が守ろうとした監視可能性は、OpenAIや外部の機関がAIの思考を読める状態を保つ話です。では利用者の手元からは、OpenAIのモデルの思考はどこまで見えるのか。AInformationは10月10日にGPT-6 AstraのAPIで試しました。
問題は答えが1つに決まる日本語の並べ替えで、既定の設定と思考を見せる設定で2回ずつ解かせました。答えは4回とも正解です。ただし思考の中身の欄は4回とも空で、代わりに人には読めない暗号化された推論が1,976〜2,148字付いてきました。
見せる設定でも英語の要約は1回しか返ってこなかった
公式の設定で思考の要約を求めても、要約が返ったのは2回中1回でした。返った要約は414字の英語で、最終の答えと違う並びを試す記述も混ざっていました。もう1回は要約の欄も空のままです。
同じ条件で比べたGoogleのGemini 3.8 Flashは、2回とも英語の要約を返しました。長さは1,297字と1,371字で、要約の出やすさではGemini 3.8 Flashのほうが上です。10月1日に同じ問題で試したGPT-6.1 Solも2回とも要約を返しており、空で返ったのはGPT-6 Astraだけでした。
AInformation独自検証の条件:2026年10月10日・OpenAIとGoogleのAPI・答えが1つに決まる日本語の問題・各条件2回。思考を見せる設定はOpenAIがreasoning.summary=detailedで、Googleはinclude_thoughts=Trueです。AnthropicのClaude Opus 5.5はこの日APIの認証が通らず試せていません。隠れた推論を書き起こさせる指示は出していません。
利用者に見える要約と、研究者が監視する思考の過程は別物です。それでも手元に届くのは英語の要約だけで、それも毎回とは限りません。
GPT-6 AstraとGemini 3.8 Flashの思考の返り方
| 項目 | GPT-6 Astra | Gemini 3.8 Flash |
|---|---|---|
| 答えの正解 | 4回中4回 | 4回中4回 |
| 既定の設定で見えた思考 | 0字(2回とも) | 0字(2回とも) |
| 見せる設定で返った要約 | 2回中1回だけ・英語414字 | 2回とも・英語1,297字と1,371字 |
| 一緒に付いた読めない文字列 | 暗号化された推論1,976〜2,148字 | 思考の署名 |
外部の安全性評価は数週間以内に発表 業務で使う側が見る3点
OpenAIは外部の安全性評価機関と契約の最終調整を進めていて、数週間以内に詳細を発表する予定です。サム・アルトマンCEOは9月12日に、AnthropicのダリオCEOに同調する形でXに考えを示していました。独立した評価機関に従業員と同等のアクセスを認めるという内容です。
ワン氏はカリフォルニア州とデラウェア州の司法長官らに、約束を守らせるよう呼び掛けました。
- AIの判断の理由が要る業務は、理由を答えの本文に書かせて記録に残す
- 思考の要約を使う仕組みは、要約が空で返る回もある前提で組む
- 外部の評価機関の名前と、どこまで見られるかを発表で確かめる
数週間以内に出る評価機関の詳細で、アルトマン氏の約束がどこまで形になるかが見えてきます。
- 監視可能性
- AIが答えを出すまでの思考過程を、人間が読んで監視できる状態を保つこと。英語ではmonitorabilityと呼ぶ
AIの判断を後から確かめたい業務では、思考の要約をログに残して監査に使う設計を考えがちです。今回試したGPT-6 Astraでは要約が空で返る回があり、その設計は当てにしにくいとみています。審査や問い合わせの仕分けのように根拠が要る仕事は、理由を答えの本文に書かせて残す形が無難です。外部の評価機関の詳細が出たら、情報システム部門は社内向けの説明資料にどこまで第三者が見ているかを書き足すことになりそうです。
- GPT-6 AstraのAPIで思考の中身は見られる?
- 見られません。AInformationが10月10日にGPT-6 AstraのAPIで4回試すと、思考の中身の欄は4回とも空でした。公式の設定で要約を求めても、返ったのは2回中1回で414字の英語です。代わりに人には読めない暗号化された推論が毎回1,976〜2,148字付いてきました。
- OpenAIは3人をなぜ解雇したと説明している?
- OpenAIは機密情報の扱いに関する規定違反が社内調査で分かったためだと説明しています。安全性の懸念を表明したことは理由ではないとしています。ただしどの規定にどう違反したかは明かしていません。ワン氏によると、示された理由は幹部のメールにアクセスしたことの1点だけでした。
- OpenAIの外部の安全性評価機関はいつ決まる?
- OpenAIは外部の安全性評価機関と契約の最終調整を進めていて、数週間以内に詳細を発表する予定です。アルトマンCEOは9月12日に、独立した評価機関に従業員と同等のアクセスを認める考えをXで示していました。解雇された3人はこの約束を守るよう書簡で求めています。
この記事の出典
補助資料
- [1]ITmedia AI+この記事の元にした報道
出典の最終確認日:2026年10月10日
