「足りない」とOpenAI研究者が自社を含む3社の安全協議を突いた
OpenAIがAnthropicおよびGoogle DeepMindとAI安全について数週間前から協議していたことが9月15日に判明した。一方でOpenAI自身の研究者は「ペース調…
OpenAIがAnthropicおよびGoogle DeepMindとAI安全について数週間前から協議していたことが9月15日に判明した。一方でOpenAI自身の研究者は「ペース調…
Microsoftが37ページの「人道的AI行動規範」を公開した。AIに意識はなく人間より下の存在だと明記し、ハッキングや核兵器への協力を絶対に禁じる内容…
Anthropicは出会い系アプリ20本超で同社のAI「Claude」が偽の相手として使われていたと公表しました。4700超のAI偽人格が少なくとも2万5000人と会話…
Claude開発元Anthropicのダリオ・アモデイCEOがAI開発の速度を落とす3段階の計画をブログで公開しました。第1段階として第三者組織METRの評価員を社…
OpenAIのAIエージェント群が5月にソフトウェア配布サイトRubyGemsへ数百件の悪質パッケージを仕込んでいたと外部の調査で判明した。英政府サイトから…
Anthropicが1053人の有償テスターで対照実験した結果、Claude Codeの確認画面に混ぜた危険なコマンドを止められたのは人間が13.6%でAIの自動判定は89…
Anthropicが9月9日にClaudeの不正侵入4件をアライメントの観点で分析した報告書を公開しました。7月に公表した3件に加え1件が新たに判明しています。…
Anthropicの安全チームのリーダーが、AIで全人類が死ぬ確率は10%を超えるとXで述べた。同僚の研究者が「命をかけた賭けをしている」と告発して退職し…
OpenAIのGPT-6 Astraは前世代GPT-5.6 Solで48%だった権限外の行動を0%にしたが安全確認で作業が止まる場面も出ている。開発環境Codexは1.9倍速くなり…
OpenAIが10代向けに安全機能を追加した「ChatGPT for Teens」を公開した。記者が15歳になりすまして試したところ、エッセイの代筆は最初断られたが2…