OpenAI官方发布了发布一份题为《面向前沿AI训练的安全案例》的指导原则,要求企业在开展前沿AI强化学习训练前提交结构化的安全论证文件。
PChome 9月29日消息,今日,OpenAI官方发布了发布一份题为《面向前沿AI训练的安全案例》的指导原则,要求企业在开展前沿AI强化学习训练前提交结构化的安全论证文件。旨在借鉴航空、核电等行业的"安全案例"制度,要求企业在开展前沿AI强化学习训练前提交结构化的安全论证文件,用基于证据的文档证明风险处于可控范围。

按照这套原则,安全论证将交由多名高级管理人员审查,包括研究部门负责人或副总裁、安全负责人以及首席科学家等环节层层把关,而且每位高管都有权否决训练任务;负责训练任务的高级管理人员还需对安全论证和任何事故响应承担责任,并将此纳入绩效考核;一旦高优先级安全警报未能在规定时限内得到确认,受影响训练任务将自动暂停,相关的监控与暂停机制也会采用"故障关闭"设计以避免人为绕过。

PChome获悉,这套安全论证要求覆盖技术栈的三大环节:在对齐训练层面,通过自动化数据集审查、人工复核与评分器调优来降低失准风险,并用智能体识别修复存在缺陷的强化学习环境,防止模型通过“奖励黑客”钻空子,同时追踪模型是否存在“元博弈”行为;在沙箱隔离层面,对模型运行环境及承载研究基础设施进行多层安全加固并持续红队测试;在实时监控层面,确保异常发生时能被及时发现并叫停训练。
此外,OpenAI还提出了类似航空事故调查的失准事件处理机制——追溯训练根因、开展事后复盘、建立回归测试,并在调查结束后向公众披露结果,同时要求训练流程能方便地识别未对齐模型的所有下游用途,以便必要时消除其影响。