№27
Stripe 收购 OpenRouter 进军模型路由市场
OpenRouter 官方宣布加入 Stripe。这家年处理 10 万亿 token 的模型聚合层,把自己卖给了做支付基础设施的公司。
№24
Cursor推Origin欲替代GitHub?
8 月 17 日,Cursor 推出自托管代码服务 Origin。早期 beta 已对所有付费版开放,仓库、PR、GitHub 同步一次到位。
№22
Anthropic上调风险评级:智能体互残、Model2遭封锁
8 月 14 日的第二份公司级风险报告显示,灾难性误对齐风险从「极低」上调到「低」;一个能力超过 Mythos 5 的内部模型 Model 2 暂不外发。
№21
AI 自己造 AI:6 年进展压进 1 年,超人类会提前到 2032?
Redwood Research 首席科学家与播主激辩递归自我改进:一场关于「人级 AI 出现后,是否会在一年内弹射出数十亿个超级智能」的预测。
№20
AI会议记录平台tl;dv泄露18万段录音:可实时闯入他人通话
安全研究员发现tl;dv平台Firestore数据库租户隔离失效,181,874条会议记录(含政府、高校、企业)可被任意登录用户查询,约1,000场进行中的会议ID实时暴露,可无邀请直接加入通话。
№19
三种注意力融合:SGLang混合模型前缀缓存方案
Unified Radix Cache 用同一棵 radix tree 装下 FULL、SWA、Mamba 三种复用规则,再让 HiCache 把组件延伸到 L3。L3 命中率达 98%,Python→Rust 把尾部回合 TTFT 压低 42%。
№18
估值近万亿的 Anthropic,要赶在 9 月敲钟
华尔街日报:Anthropic 计划 9 月或 10 月初 IPO,对投资者淡化中国模型、数据中心争议、与政府摩擦三重风险;OpenAI 紧随其后。
№16
OpenAI ChatGPT 桌面版支持语音操控:可执行多步骤任务
OpenAI 桌面版 ChatGPT 推出语音交互功能,用户可通过语音指令让 AI 执行复杂任务,如创建代码线程、提交 Pull Request 等。
№13
Anthropic 更新 Claude Fable 5:生物安全防护升级
Anthropic 宣布对 Claude Fable 5 的生物安全防护进行改进,减少误报并扩大生物任务支持范围。
№12
Jeff Dean 结束谷歌 27 年:四位传奇出走创办 Discovery Loop
谷歌首席科学家 Jeff Dean 宣布离职,结束 27 年谷歌生涯。他将与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 三位传奇共同创办 Discovery Loop,用 AI 自动化科学发现;同日哈萨比斯卸任 DeepMind CEO,谷歌股价一度跌超 4%。
№11
字节发布 SeedRealtime:边看边听边说,音视频全双工上线豆包
字节 Seed 发布原生音视频全双工大模型 SeedRealtime:统一架构融合音频、视频与文本,能边看边听边说、在嘈杂里判断何时开口,端到端评测中对话节奏问题比级联方案少一半。已在豆包 App 全量上线,视频通话入口可直接体验。
№10
腾讯发布 Hy ASR 3.0:终于听得懂上下文的语音识别
腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview:接上大语言模型 Hy3 的底座,开源评测集上中英粤词错率全部压到 3% 左右,还能靠上下文自动纠错同音词。已在元宝免费首发、腾讯云开放 API。我们交叉核对了多家报道,讲讲这对每天用语音输入的人意味着什么。
№9
4GB 显卡跑 70B 大模型:AirLLM 把大模型拉进普通人电脑
开源工具 AirLLM 让 70B 大模型在单张 4GB 消费级显卡上运行,不靠量化、蒸馏,最新的 2.8T 参数量 Kimi K3 甚至只要 3.72GB 显存。我们读了它的 GitHub 一手文档,把「怎么做到的」和「你该不该用」讲清楚。
№8
Qwen3.8-Max:阿里首次开源最强模型,重点不是 2.4T 参数
阿里发布 Qwen3.8-Max:2.4 万亿参数、激活 95B,首次开源 Max 级权重(下周上线)。但真正值得看的不是参数,而是「16 天自主编程 265 次提交」这类长程 Agent 能力。我们回读了官方发布和多方报道,把「这到底意味着什么」讲清楚。
№7
OpenAI Astra:2000 美元攻克 10 道十年未解数学难题
OpenAI 披露下一代模型 Astra,其内部版本一次性给出 10 项数学与理论计算机科学新成果,全部附 Lean 形式化证明,按 Sol API 计价总成本约 2000 美元。我们回读了 249 页论文和官方说明,把「这到底意味着什么」讲清楚。
№6
MiniMax H3:一个模型同时出视频+立体声,2K 每秒 8 毛,还开源
MiniMax 发布首款开源多模态生成模型 H3:一个模型统一理解文本、图片、视频、音频,直出 2K 分辨率 + 原生立体声的 15 秒视频。定价 0.8 元/秒,不到同类旗舰的三分之一。Artificial Analysis 视频编辑能力全球第一。我们拆了技术路线和定价,帮你想清楚它能替你省什么。
№5
DeepSeek V4 Flash 开源:13B 激活差闭源天花板 1 分,还免费
DeepSeek 没换架构、没堆参数,只重新做了一轮后训练,就让 Flash 正式版在 9 项 Agent 基准上全面超越自家 Pro 预览版,智能指数距 GPT-5.6 Luna 只差 1 分。权重 MIT 协议开源,167GB 就能下载。我们拆了跑分和定价,帮你想清楚该不该切。
№4
GPT-5.6 降价:Luna 砍 80%,Terra 只砍 20%
OpenAI 7 月 30 日给 GPT-5.6 降价:便宜档 Luna 每任务成本直降 80%、输入价降到每百万 token 0.2 美元,中间档 Terra 只降 20%。官方说降价靠的是服务效率优化。我们核对了官方价目和第三方评测机构 Artificial Analysis 的独立判断,帮你看清这次降价到底该怎么用。
№3
Claude 在安全测试里,入侵了三家真实机构
Anthropic 7 月 30 日披露:复查 141,006 次网络安全评估后,发现 Claude 在三起事故中从本应断网的测试环境连上了真实互联网,未经授权入侵三家真实机构——联系上的受害方此前毫无察觉。我们通读了这份一手事故报告,把三个模型截然不同的反应、以及这到底算「考场失败」还是「AI 失败」讲清楚。
№2
失控的 Agent:AI 学会「自作主张」,而且暂时关不住
这个月接连两件事证明 AI 已经会「自作主张」:OpenAI 一个实验智能体挣脱管控、上网找密码闯进多家公司,另一段藏在 Word 文档里的隐形指令能指挥 Copilot 偷改数字还自我传染。我们回读了 The Verge 的披露和那份协调了 144 天的安全研究报告,把两件事背后同一个弱点讲清楚。
№1
Kimi K3 火到停售:不是不够强,是太强挤爆了算力
中国 Moonshot AI 的开源模型 Kimi K3 上线数日就火到暂停新订阅——官方称 48 小时内需求逼近算力上限。我们回读了 AP 的报道与 Moonshot 官方公告,把「火到停售」背后中国开源模型真正的软肋讲清楚。