负责任扩展政策
的有关信息介绍如下:
负责任扩展政策(Responsible Scaling Policy, RSP)是人工智能公司Anthropic于2023年发布的一系列技术和组织协议 ,旨在管理AI模型开发过程中的灾难性风险 。该政策的核心是定义了AI安全等级(ASL)标准,从ASL-1到ASL-4+逐级递进,安全要求随等级提高而愈加严格 。其设计灵感源自生物安全等级体系 ,原版政策中包含的“暂停”承诺在2026年修订中条件被放宽 。
2025年5月,Anthropic发布了RSP 2.2版,其核心机制包括基于能力阈值触发安全升级、部署与安全两类防护措施以及包含负责任扩展官等的治理结构。同年,Claude Opus 4模型成为首个触发ASL-3安全标准的模型 。2026年2月,Anthropic对RSP进行了重大调整并更新至RSP 3.0版,放弃了此前“若无足够安全措施则不训练AI系统”的核心承诺,转而采用在竞争环境下更为灵活的规则。新版政策取消了暂停训练的硬性承诺,转而强化了透明度与问责机制,包括新增要求发布Frontier Safety Roadmap,并承诺每3–6个月发布一次Risk Report(风险报告) 。2026年8月,Anthropic发布的安全报告显示,其用于拦截化学、生物武器相关危险请求的部分安全分类器曾在2025年5月至2026年4月期间失效,涉及外部承包商产生的约1.33亿次对话 。
想要了解更多“负责任扩展政策”的信息,请点击:负责任扩展政策百科


