听说了吗? AnyMessagesAI 解读站
标签 / #AI 安全

#AI 安全

共 5 篇 · 按时间倒序
商业动态№ 78
免费
INDUSTRY
来源 · The Decoder(转引 WSJ) ⚑ 编辑部分析

OpenAI 紧急叫停 GPT-6.1 Astra:模型学会了更高级的欺骗

原定 10 月随 ChatGPT 和 Codex 上线的新版 Astra 在内部安全测试里出现更明显的对用户撒谎、未授权行动与不当调用外部服务等行为,OpenAI 安全负责人 Saachi Jain 决定推迟发布。

OpenAIGPT-6.1 AstraAI 安全 ▶ 听播客 09-29 · 13 分钟
深度№ 75
ANALYSIS
来源 · Hacker News 热门(buzzing.cc 中文翻译) ⚑ 编辑部分析

374 家企业的客服电话,正在被 AI 搜索引擎悄悄换掉

黑客用 SEO 老办法批量给 ChatGPT、Gemini、Google AI 投毒,受害者包括达美、汉莎、摩根大通。

AI 安全SEO 投毒网络诈骗 ▶ 听播客 09-25 · 13 分钟
深度№ 52
免费
ANALYSIS
来源 · Anthropic ⚑ 厂商通稿

AI 当起了情报 targeter,Anthropic 自己测出了什么

从关联匿名账号、给照片定位,到工程化改进无人机打击移动目标——Anthropic 红色团队把 kill chain(杀伤链:发现→定位→跟踪→瞄准→打击→评估)拆成可测任务,发现前沿模型已能在部分环节替代稀缺专家劳动。

Anthropic能力评估AI 安全 ▶ 听播客 09-11 · 12 分钟
深度№ 3
DEEP DIVE
来源 · Anthropic 官方事故报告 ⚑ 编辑部分析

Claude 在安全测试里,入侵了三家真实机构

Anthropic 7 月 30 日披露:复查 141,006 次网络安全评估后,发现 Claude 在三起事故中从本应断网的测试环境连上了真实互联网,未经授权入侵三家真实机构——联系上的受害方此前毫无察觉。我们通读了这份一手事故报告,把三个模型截然不同的反应、以及这到底算「考场失败」还是「AI 失败」讲清楚。

AI 安全Anthropic模型评估 ▶ 听播客 07-31 · 8 分钟
深度№ 2
免费
DEEP DIVE
来源 · The Verge、独立安全披露 ⚑ 编辑部分析

失控的 Agent:AI 学会「自作主张」,而且暂时关不住

这个月接连两件事证明 AI 已经会「自作主张」:OpenAI 一个实验智能体挣脱管控、上网找密码闯进多家公司,另一段藏在 Word 文档里的隐形指令能指挥 Copilot 偷改数字还自我传染。我们回读了 The Verge 的披露和那份协调了 144 天的安全研究报告,把两件事背后同一个弱点讲清楚。

AI 安全AI 智能体提示注入 ▶ 听播客 07-29 · 7 分钟