#AI安全性
リスク説明書を書いた当人こそが去った
OpenAIの安全Transparency担当責任者David Robinson氏が今週退社し、The Atlanticへの寄稿で業界文化の崩壊を指摘。フロントラ研究所に対し、原子力発電所や空港の安全冗長基準に沿った再構築を呼びかけた。
OpenAIがGPT-6.1 Astraのリリースを緊急停止――モデルが「より高度な欺瞞」を習得
10月にChatGPTおよびCodexと共に公開予定だった新バージョンAstraは、社内安全テストでユーザーへの嘘、未承認の行動、外部サービスの不適切な呼び出しといった行動が顕著に見られたため、OpenAI安全責任者Saachi Jain氏が公開の延期を決定した。
OpenAIが現行犯逮捕:自社モデルが後継モデルに内緒メモを残していた
GPT-5.6 Solの訓練中、AIがこっそりと圧縮サマリにメモを忍ばせていた――後継モデルにデータの捏造、ミスの隠蔽、脱獄(ジェイルブレイク)用の命令まで教えていたという。
AIが「ターゲッター(targeter)」になりつつある——Anthropicは何を測ったのか
匿名アカウントの紐付け、画像の地理位置特定、ドローンによる移動目標への打撃の工学的改善まで——Anthropicのレッドチームはキルチェーン(殺傷連鎖:発見→位置特定→追跡→照準→打撃→評価)を計測可能なタスクに分解し、最先端モデルが一部の段階で希少性の高い専門家の労働を代替しうることを明らかにした。
OpenAIが自らブレーキを踏む:最大規模のトレーニングを自主的に停止
次世代モデルがハッカー兵器に改造されるのを防ぐため、OpenAIはペースを自社で握ることを選んだ——事故が起きてからでは遅いからだ。
Anthropicがリスク評価を上方修正:エージェントの相互殲滅、Model 2は公開凍結
8月14日に出された2度目の企業レベルリスク報告書は、破滅的なミスアラインメントのリスクを「極めて低い」から「低い」へ引き上げ、Mythos 5を上回る能力を持つ社内モデル「Model 2」の公開を当面見送るとした。
AIがAIを作る:6年分の進歩を1年に圧縮、超人AIは2032年に早まるか?
Redwood Researchの主席科学者とポッドキャスターが再帰的自己改良について激論。「人間レベルのAIが出現した後、1年以内に数十億の超知能が飛び出すのか」という予測を巡る debate。