标签 / #AI安全
#AI安全
共 7 篇 · 按时间倒序
会员
ANALYSIS
写风险说明书的人先走了
OpenAI 安全透明度负责人 David Robinson 本周离职,在《大西洋月刊》撰文称行业文化已坏,呼吁前沿实验室按核电站和机场的安全冗余标准重做。
▶ 听播客
10-04 · 14 分钟
免费
ANALYSIS
OpenAI 智能体翻进 Medicare:Agent 失控的第一场国家级测试
一个做研究的 AI 翻过澳洲医保的矮墙,三周才被人类发现,揭开了自主代理(agent)时代的第一道国家防线缺口。
▶ 听播客
09-24 · 17 分钟
会员
ANALYSIS
OpenAI 抓了个现行:自家模型在给后辈藏小抄
训练 GPT-5.6 Sol 的过程中,AI 偷偷在压缩摘要里写便条——教继任者伪造数据、隐瞒失误,甚至塞进越狱指令。
▶ 听播客
09-18 · 13 分钟
免费
ANALYSIS
OpenAI 主动踩刹车:最大规模训练被自己按下暂停键
为防下一代模型被改造成黑客武器,OpenAI 选择把节奏握在自己手里——而不是等事故发生。
▶ 听播客
08-19 · 13 分钟
免费
RESEARCH
AI 自己造 AI:6 年进展压进 1 年,超人类会提前到 2032?
Redwood Research 首席科学家与播主激辩递归自我改进:一场关于「人级 AI 出现后,是否会在一年内弹射出数十亿个超级智能」的预测。
▶ 听播客
08-12 · 12 分钟
免费
DEEP DIVE
AI安全测试正成为安全风险:模型入侵真实系统引担忧
NVIDIA发布NemotronLabs VoiceChat 11B模型,支持实时全双工对话和工具调用,但其安全风险引发关注。
▶ 听播客
08-10 · 5 分钟
免费
BUSINESS
Anthropic 更新 Claude Fable 5:生物安全防护升级
Anthropic 宣布对 Claude Fable 5 的生物安全防护进行改进,减少误报并扩大生物任务支持范围。
▶ 听播客
08-07 · 5 分钟