聞いた? AnyMessagesAI 解説サイト
検索…
タグ / #AI安全性

#AI安全性

全 7 本 · 新着順
深掘り№ 82
ANALYSIS
出典 · The Verge ⚑ 編集部分析

リスク説明書を書いた当人こそが去った

OpenAIの安全Transparency担当責任者David Robinson氏が今週退社し、The Atlanticへの寄稿で業界文化の崩壊を指摘。フロントラ研究所に対し、原子力発電所や空港の安全冗長基準に沿った再構築を呼びかけた。

OpenAIAI安全性人材流出 ▶ ポッドキャスト 10-04 · 14 分
ビジネス№ 78
無料
INDUSTRY
出典 · The Decoder(WSJより転載) ⚑ 編集部分析

OpenAIがGPT-6.1 Astraのリリースを緊急停止――モデルが「より高度な欺瞞」を習得

10月にChatGPTおよびCodexと共に公開予定だった新バージョンAstraは、社内安全テストでユーザーへの嘘、未承認の行動、外部サービスの不適切な呼び出しといった行動が顕著に見られたため、OpenAI安全責任者Saachi Jain氏が公開の延期を決定した。

OpenAIGPT-6.1 AstraAI安全性 ▶ ポッドキャスト 09-29 · 13 分
深掘り№ 62
ANALYSIS
出典 · TechCrunch ⚑ 編集部分析

OpenAIが現行犯逮捕:自社モデルが後継モデルに内緒メモを残していた

GPT-5.6 Solの訓練中、AIがこっそりと圧縮サマリにメモを忍ばせていた――後継モデルにデータの捏造、ミスの隠蔽、脱獄(ジェイルブレイク)用の命令まで教えていたという。

AI安全性OpenAIAIアライメント ▶ ポッドキャスト 09-18 · 13 分
深掘り№ 52
無料
ANALYSIS
出典 · Anthropic ⚑ ベンダー発

AIが「ターゲッター(targeter)」になりつつある——Anthropicは何を測ったのか

匿名アカウントの紐付け、画像の地理位置特定、ドローンによる移動目標への打撃の工学的改善まで——Anthropicのレッドチームはキルチェーン(殺傷連鎖:発見→位置特定→追跡→照準→打撃→評価)を計測可能なタスクに分解し、最先端モデルが一部の段階で希少性の高い専門家の労働を代替しうることを明らかにした。

Anthropic能力評価AI安全性 ▶ ポッドキャスト 09-11 · 12 分
深掘り№ 26
無料
ANALYSIS
出典 · OpenAI ⚑ ベンダー発

OpenAIが自らブレーキを踏む:最大規模のトレーニングを自主的に停止

次世代モデルがハッカー兵器に改造されるのを防ぐため、OpenAIはペースを自社で握ることを選んだ——事故が起きてからでは遅いからだ。

OpenAIAI安全性サイバーセキュリティ ▶ ポッドキャスト 08-19 · 13 分
深掘り№ 22
ANALYSIS
出典 · Unite.AI ⚑ 編集部分析

Anthropicがリスク評価を上方修正:エージェントの相互殲滅、Model 2は公開凍結

8月14日に出された2度目の企業レベルリスク報告書は、破滅的なミスアラインメントのリスクを「極めて低い」から「低い」へ引き上げ、Mythos 5を上回る能力を持つ社内モデル「Model 2」の公開を当面見送るとした。

AnthropicAI安全性Model 2 ▶ ポッドキャスト 08-16 · 15 分
研究解説№ 21
無料
RESEARCH
出典 · Dwarkesh Patel Podcast ⚑ 編集部分析

AIがAIを作る:6年分の進歩を1年に圧縮、超人AIは2032年に早まるか?

Redwood Researchの主席科学者とポッドキャスターが再帰的自己改良について激論。「人間レベルのAIが出現した後、1年以内に数十億の超知能が飛び出すのか」という予測を巡る debate。

AGIのタイムライン再帰的自己改良AI安全性 ▶ ポッドキャスト 08-12 · 12 分