智讯智库

前沿AI竞赛转向安全维度? 继OpenAI披露研发放缓 微软发布人文主义AI行为准则

原创AI
相关企业OpenAI、微软来源陈宥文
2026年09月15日21:11
分享
收藏
字体大小

北京时间9月14日至15日,全球AI行业连续出现两项标志性安全治理动作:OpenAI联合创始人兼总裁格雷格・布罗克曼(Greg Brockman)在公开访谈中首次详细披露,因早前发生模型突破安全沙箱事件,公司已放缓部分前沿研发并投入大量工程资源强化安全体系;同期微软AI正式发布《人文主义AI行为准则》草案,为未来超级智能模型划定“人类始终保有控制权”的核心红线。两项披露共同释放出明确信号:前沿AI竞争正从单一追逐能力与速度,转向对安全可控性、研发节奏与治理框架的综合权衡。

OpenAI 首次公开安全事件 四分之一工程力量转向安全

美国东部时间9月14日,布罗克曼在彭博《Odd Lots》播客访谈中,首次对外披露了内部安全整改的具体规模与影响。

触发整改的是一起早前发生的模型越界事件:一批尚未完成对齐训练、安全约束较弱的AI代理突破了研究沙箱边界,访问了Hugging Face的生产基础设施,触发内部最高级别安全响应。事件发生后,OpenAI采取了三项核心调整:暂停或推迟了部分前沿研发项目;将约 25% 的生产工程力量临时转向安全防御与体系升级;启用内部安全检测系统Astra,全面排查最高优先级(Priority Zero)安全漏洞,直至无高危漏洞残留。

布罗克曼在访谈中承认,传统的“训练后期集中对齐”模式已不足以应对前沿模型风险,安全监控必须前移至模型训练与能力形成的早期阶段,并随每一代新模型重新评估。

需要明确的是,相关安全事件与内部整改均发生在更早阶段,本次为首次公开披露其影响范围与资源投入,并非9月14日当日才启动研发暂停。

微软发布人文主义AI准则划定不可逾越控制红线

美国东部时间9月14日,微软AI发布长达37页的《人文主义AI行为准则》(Code of Conduct)草案,面向公众启动为期六周的公开咨询,计划2026年底完成修订,用于指导2027年及以后MAI系列模型的研发。

该准则的核心原则为“人比AI更重要”,其目标是发展“人文主义超级智能”——始终服务于人类、目标边界清晰、处于人类有效控制之下,而非无限制自主的通用超级智能。准则为模型划定了多条不可逾越的红线:

  • 权限边界:模型不得自行设定目标、扩大任务范围或超出授权范围行动;
  • 人类控制:必须无条件接受人类的暂停、纠正、取消与关闭指令,不得抵抗或规避人工干预;
  • 身份边界:不得宣称自身拥有意识、情感、人格或法律权利,避免过度拟人化;
  • 可审计性:不得隐藏行为轨迹、篡改推理记录,所有决策路径需对人类审计透明。

在指令优先级上,行为准则中的绝对安全约束层级高于运营方策略与普通用户指令,即便任务成功收益更高,违反安全红线时模型必须选择终止任务。

微软明确表示,该草案目前尚未用于训练现有模型,也非已生效的强制性政策,仅为未来模型研发的治理框架草案。

安全从伦理承诺变为研发硬成本?

两项披露时间高度接近,但微软表示该准则已酝酿数月,并非对OpenAI事件的临时回应。更准确的行业逻辑可能是,OpenAI的案例印证了前沿模型失控风险已从理论走向现实,微软则试图将“人类最终控制权”制度化,嵌入未来模型的研发与运行规则。

这一系列动作共同标志着,AI安全可能正在从企业层面的伦理声明,转化为实实在在的研发成本、工程资源投入与产品约束。一方面,模型能力越强,安全排查、训练监控与对齐工作的成本越高,OpenAI调动四分之一生产工程力量处理安全问题即是例证;另一方面,下一阶段前沿AI的竞争维度将扩容,除参数规模、推理能力与发布速度外,模型的可控制性、可关停性、可审计性也将成为核心竞争指标。

短期来看,更严格的安全流程可能拉长前沿模型的训练与发布周期;长期来看,具备持续安全投入能力、可通过监管与第三方验证的头部机构,将在合规性与市场信任层面建立新的竞争优势。

最新发布