科技

20%推理算力用来“看住AI”:大模型竞争进入安全成本时代

来源:丹巴新文网
20%推理算力用来“看住AI”:大模型竞争进入安全成本时代

大模型性能提升后,AI公司或许要面对未曾充裕计算的成本了:确保模型安全,需投入额外算力持续监视模型本身。

8月18日,OpenAI公布了推行的一套模型安全升级计划。最吸睛的数据是,公司估算新增监控系统的额外算力花费,约与现实推理算力的20%相等。须强调,这并非指OpenAI所有AI服务的总费用增加20%,而是针对纳入安全监控的推理任务,现阶段估量的监控开销达此数值,不同训练和评估情境下的差异可能颇大。

同时期,OpenAI确认,预定部署模型的一批强化学习训练曾中断两周,当前规模最大的前沿强化学习训练仍处在暂停状况,部分Astra相关训练和评估任务也需满足新安全标准后才可重启。

这表明,大模型行业正浮现一个值得关注的变量:

往后决定AI公司模型迭代快慢的,或许不仅是GPU数量,还包含其能调配多少算力及工程资源来监管这些模型。

先明确:OpenAI并未“全面叫停训练”

将这次事件简单解读为“OpenAI暂停前沿模型训练”,并不妥当。

OpenAI的释述是,因内部研究及即将推出模型的网络安全能力迅速提高,公司放缓了模型规模扩张步伐。这包含暂停最新拟部署模型的为期两周强化学习训练,并继续以较小规模训练和评估验证模型行为、安全措施以及对齐成效。

到8月18日,OpenAI规划中规模最大的前沿强化学习任务依旧暂停。

Astra并非所有工作均告停。满足新安全要求的部分训练和评估可继续,但仍有一定工作量需完成环境迁移及安全升级后才可恢复。

真正变化的不是“AI终止训练”。

而是:

模型越接近高风险区域,训练其所需满足的安全门槛也越高。

为何偏偏是Astra触发此变局?

关键原因在网络安全能力。

OpenAI指出,初步显示即将推出的Astra模型已达到《Preparedness Framework》标示的“Critical”网络安全能力级别,因此公司对相关任务负载采纳最高级的安全策略。

在OpenAI现行的准备框架里,前沿模型能力主要分为High和Critical两大等级。

High表示模型或会显著放大现有重大风险路径,达到Critical则意味着模型或会带来先前未存在或崭新的重大风险路径。对于达High能力的系统,部署前必须备妥足够风险减轻措施;若达Critical,开发过程中本身亦需具备充分安全筹备。

此分野具重要性。

早先很多人认知AI安全,是模型开发竣工后再进行测试:

模型建好,检测一番,无问题便推出。

但若模型已具很强网络攻击、工具运用及自主执行能力,风险或许在研发阶段就显现。

故安全不再仅是“上市前检验”。

而开始渗透生产流程内部。

20%的算力究竟用于何处?

OpenAI此次公开的新监控体系,并非仅检查模型输出有无敏感词。

它要观察得更深。

依官方详述,新的监控流程是分阶段的:首先通过“activation classifiers”,即激活分类器,检视模型内部活动;这些分类器会在每一个被采样的Token上运作。若检出潜在异常,即交由计算更繁复的自动调查系统处理。

其后系统将检查模型应用工具的行为、可察的推理流程及完整活动序列,搜寻未授权接入、数据窃取、破壞性动作及试图规避安全机制等风险。

一旦系统发现棘手举动,OpenAI期望在30分钟内产出警报。若触碰关键安全边线,便会触发

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~