减少误报(把正常问题误判为危险的错误拦截),扩大支持范围
通过改进生物安全(防止 AI 被滥用制造生物危害的安全防线)防护,Claude Fable 5 的误报大幅减少,用户在日常健康和教育问题上的体验得到提升。
2026年8月7日,Anthropic 宣布对 Claude Fable 5 的生物安全防护机制进行了更新。这些更新让误报减少了八成以上。在测试中,更新后的系统在产品界面上与生物学相关的回退(fallbacks,即系统在被询问生物学相关问题时切换到能力较低的模型)减少了约85%。换句话说 Fable 5 现在能够协助处理更广泛的生物学任务。
在实际应用中,用户在日常健康和教育问题上遇到的回退现象将大幅减少。例如,在解释实验室结果、了解症状以及在教育环境中学习生物学知识时,用户将获得更多支持。医疗专业人员也将在临床任务上获得 Fable 5 的更多帮助。尽管如此,Fable 5 目前仍无法用于专业的生物学研究和药物开发,因为它在处理我们认为具有双重用途的请求(如病毒学、毒理学和分子设计)时仍会回退到 Opus 5 模型。
生物安全防护如何运作
Claude Fable 5 的生物安全防护机制通过分类器(自动判断请求是否越界的小型 AI 哨兵)系统来识别和拦截潜在的有害请求,同时减少误报,让更多日常健康和教育相关的生物问题得到解答。
Claude Fable 5 的生物安全防护主要依赖于分类器(小型自动化 AI 系统),这些系统能够检测模型何时被要求执行受保护的生物任务或产生有害输出。当分类器被触发时,用户的请求会被重新路由到 Opus 5,这是一个不具备相同生物能力的模型,从而无法为恶意用户提供同等程度的帮助。这就是用户在请求被拦截时所经历的“回退”机制。
开发精确且健壮的分类器并非易事。为了让分类器能够快速且一致地工作,它必须学会区分我们认为“范围内”和“范围外”的主题和查询,这些主题和查询可能被视为潜在的有害内容。调整分类器需要时间和迭代,以避免误报(分类器对范围外的内容触发)和漏报(范围内内容未被捕捉)。我们还要求分类器能够抵御试图绕过它们的行为(称为 jailbreaks),这需要更多的研究和测试。
通过从非常广泛的生物分类器开始,我们能够在继续进行旨在改进它的研究的同时,让用户能够访问 Fable 5。另一种选择——在安全防护取得更多进展之前保留模型——将会延迟模型的普遍访问及其对用户的潜在好处数周或数月。
在过去的几周里,我们仔细地重写了分类器的构成(由一组帮助模型区分受保护和允许内容的规则组成),并详细地划分了良性用途。我们从不同领域的专家(内部和外部的 Anthropic)那里征求了对这些变化的反馈。然后,我们根据该构成开发了分类器的更新训练数据,并对其进行重新训练,并验证了新的分类器是否仍然会针对有害和双重用途的研究生物内容触发,但现在将启用更广泛的良性用途。
分类器与安全边界:误报的减少与风险的平衡
Claude Fable 5 通过改进分类器,减少了误报数量,但这种改进并非简单的“放宽限制”,而是在复杂的生物安全风险中寻找新的平衡点。
在生物安全领域,最反直觉的一点是:
这种改进的挑战在于,生物技术的进步往往伴随着“双重用途”风险,即同一项技术既可用于造福人类,也可能被恶意利用。例如,研究疾病治疗方法可能需要科学家生产出引发该疾病的危险化合物;开发治疗高血压的药物卡托普利时,科学家们从蛇毒中分离出降低血压的有毒成分。这些案例表明,生物技术的良性用途和危险用途之间的界限并不总是清晰的。
为了应对这种复杂性,Fable 5 的分类器需要不断学习和调整,以区分哪些查询是安全的,哪些可能带来风险。开发精确且稳健的分类器并非易事,需要大量时间和迭代来避免误报(将安全内容误判为危险)和漏报(未能识别出危险内容)。此外,分类器还需要具备抵御试图绕过其限制的能力,这进一步增加了开发和测试的难度。
通过改进分类器,Fable 5 在减少误报的同时,仍然保持了对其认为具有双重用途或高风险的生物查询的限制。这种平衡措施确保了模型在生物安全领域的负责任使用,同时也为用户在日常健康和教育方面的查询提供了更大的支持。
持续改进与受信任的访问
Anthropic 正在努力开发安全的访问途径,以便研究人员能够使用其最先进的模型,同时保持生物安全。
Claude Fable 5 的生物安全防护升级体现出 Anthropic 在平衡 AI 能力与潜在风险方面迈出了重要一步。通过减少误报,Fable 5 现在能够支持更广泛的日常健康和教育问题,例如解释实验室结果、理解症状以及在教育环境中学习生物学。这使得医疗专业人员能够在临床任务中获得更多支持。
然而,专业生物研究仍受到限制。Anthropic 明确表示,对于涉及双重用途的请求,如病毒学、毒理学和分子设计,Fable 5 仍然会回退到 Opus 5。换句话说目前该模型还不能用于专业生物学研究和药物开发。Anthropic 承诺通过受信任的访问途径来弥补这一差距,以便前沿生物学能力能够被负责任地使用。
这种方法的背后是对 AI 在生物学和医学领域巨大潜力的信念。Anthropic 正在大力投资于构建一个负责任的方式,以便生物学家能够使用最先进的技术,同时确保新风险不会在潜在的科学益处之前显现出来。
为了实现这一目标,Anthropic 正在开发更精确、更强大的分类器,这些分类器能够快速且一致地检测何时请求执行受保护的生物学任务或产生有害输出。通过不断迭代和改进,这些分类器将能够在减少误报的同时,保持对规避尝试的鲁棒性。
未来,Anthropic 计划继续开发受信任的访问途径,以便在保持生物安全的同时,将 Fable 5 的前沿能力交到更多用户手中。这包括与专家合作,识别和定义安全的访问标准,并开发技术解决方案,以确保只有经过验证的用户才能访问这些高级功能。
Anthropic 的目标是随着时间的推移,逐步扩大 Fable 5 的访问范围,同时确保其生物安全防护措施能够有效应对新出现的风险。这种方法不仅有助于推动生物学和医学领域的进步,还能确保 AI 技术的使用符合伦理和安全标准。
如何体验 Claude Fable 5 的生物安全防护升级
Claude Fable 5 的生物安全防护机制已经更新,减少了误报并扩大了对日常健康和教育问题的支持。以下是一些你可以亲自体验和验证的具体操作。
解读实验室结果:输入一些常见的实验室检测数据,观察 Claude Fable 5 如何提供解释和建议。
了解症状:描述一些常见的健康症状,看看模型是否能够提供准确的初步诊断或建议。
学习生物学知识:在教育背景下提出一些生物学问题,例如基因编辑或细胞生物学,观察模型的回答。
临床任务支持:如果你是一名医疗专业人员,尝试询问一些临床相关的问题,看看模型在提供支持方面的表现。
值得注意的是,尽管 Claude Fable 5 在日常健康和教育问题上的表现有所提升,但对于专业生物研究,如病毒学、毒理学和分子设计等,模型仍然会回退到 Opus 5。这是因为这些领域存在潜在的“双重用途”风险,即技术可能被用于有益或有害的目的。Anthropic 正在努力通过可信的访问途径来缩小这一差距,以便在不远的将来为生物学家提供前沿的 AI 能力。
本文基于 Anthropic 官方公告(2026-08-07)撰写。误报率降低 85% 等数字为官方口径,尚未经第三方独立复测;「双重用途」风险评估为厂商自述。