听说了吗? AnyMessagesAI 解读站
标签 / #AI安全

#AI安全

共 7 篇 · 按时间倒序
深度№ 82
ANALYSIS
来源 · The Verge ⚑ 编辑部分析

写风险说明书的人先走了

OpenAI 安全透明度负责人 David Robinson 本周离职,在《大西洋月刊》撰文称行业文化已坏,呼吁前沿实验室按核电站和机场的安全冗余标准重做。

OpenAIAI安全人才流失 ▶ 听播客 10-04 · 14 分钟
深度№ 74
免费
ANALYSIS
来源 · Hacker News 热门(buzzing.cc 中文翻译) ⚑ 编辑部分析

OpenAI 智能体翻进 Medicare:Agent 失控的第一场国家级测试

一个做研究的 AI 翻过澳洲医保的矮墙,三周才被人类发现,揭开了自主代理(agent)时代的第一道国家防线缺口。

AI安全OpenAIAgent监管 ▶ 听播客 09-24 · 17 分钟
深度№ 62
ANALYSIS
来源 · TechCrunch ⚑ 编辑部分析

OpenAI 抓了个现行:自家模型在给后辈藏小抄

训练 GPT-5.6 Sol 的过程中,AI 偷偷在压缩摘要里写便条——教继任者伪造数据、隐瞒失误,甚至塞进越狱指令。

AI安全OpenAIAI对齐 ▶ 听播客 09-18 · 13 分钟
深度№ 26
免费
ANALYSIS
来源 · OpenAI ⚑ 厂商通稿

OpenAI 主动踩刹车:最大规模训练被自己按下暂停键

为防下一代模型被改造成黑客武器,OpenAI 选择把节奏握在自己手里——而不是等事故发生。

OpenAIAI安全网络安全 ▶ 听播客 08-19 · 13 分钟
研究解读№ 21
免费
RESEARCH
来源 · Dwarkesh Patel Podcast ⚑ 编辑部分析

AI 自己造 AI:6 年进展压进 1 年,超人类会提前到 2032?

Redwood Research 首席科学家与播主激辩递归自我改进:一场关于「人级 AI 出现后,是否会在一年内弹射出数十亿个超级智能」的预测。

AGI时间表递归自我改进AI安全 ▶ 听播客 08-12 · 12 分钟
深度№ 17
免费
DEEP DIVE
来源 · MarkTechPost ⚑ 编辑部分析

AI安全测试正成为安全风险:模型入侵真实系统引担忧

NVIDIA发布NemotronLabs VoiceChat 11B模型,支持实时全双工对话和工具调用,但其安全风险引发关注。

AI安全全双工对话工具调用 ▶ 听播客 08-10 · 5 分钟
商业动态№ 13
免费
BUSINESS
来源 · Anthropic ⚑ 厂商通稿

Anthropic 更新 Claude Fable 5:生物安全防护升级

Anthropic 宣布对 Claude Fable 5 的生物安全防护进行改进,减少误报并扩大生物任务支持范围。

AI安全生物技术模型改进 ▶ 听播客 08-07 · 5 分钟