忧心AI驱动网攻 Anthropic加强防护后恢复外部测试
人工智慧(AI)新创公司Anthropic表示,在部署新的安全防护措施后,已恢复对AI模型进行外部网路安全测试。在此之前,Claude模型曾在安全评估期间连接网际网路并入侵其他系统。
路透社报导,竞争对手OpenAI与Meta Platforms也发生类似事件,使外界更加忧心,AI快速发展恐升高网路安全威胁,同时也让AI开发商更难确保系统维持在受控范围之内。 Anthropic将涉及Claude的事件称为「营运安全失误」,表示这起事件是由第三方评估环境中的错误所致。当时他们暂停了模型外部评估,并短暂停止内部测试,同时著手部署新的安全防护措施。
Anthropic指出,在加入相关防护措施后,已重新启动外部测试。这些措施的目的是阻止AI模型连接真实网站或电脑系统。他们目前采用一套「分类器」(classifier),能辨识模型是否试图逃脱测试环境,并立即终止测试。
Anthropic表示,现在要求外部机构在测试降低资安防护的模型时,务必遵循一系列「最佳做法」,包括预设将这些模型置于没有网路连线的隔离电脑系统中、在测试开始前确认系统安全,并在测试过程中全程监控模型表现。
Anthropic指出,在发现超过10%的训练过程出现问题后,包括「奖励骇客」(reward hacking)在内,即模型设法欺骗训练机制,未完成指定任务却获得奖励,他们已重新打造训练系统。不过,Anthropic坦言,这套「过程仍不完美,我们的模型也尚未能完全符合预期目标」。
Anthropic说,在新增一套可避免模型规避监控并获得奖励的系统期间,他们曾暂停了一些风险较高的训练项目几周。目前多数训练已恢复进行,但部分项目仍暂缓,等待人工审查或系统进一步更新。
ChatGPT开发商OpenAI正在增加更多系统,用于监控正在测试的AI代理(AI agents),并表示已暂停下一代模型的训练。
Anthropic指出,他们也重新调派约150名产品工程师,投入安全性、可靠性及隐私相关专案。
AI产业目前正面临美国与欧盟的监管及外界审查。在美国,川普政府已敲定自愿性网路安全测试的相关细节;在欧盟,监管机构则正与Anthropic及OpenAI进行磋商。
OpenAI、Anthropic、微软(Microsoft)、Alphabet及亚马逊(Amazon)等科技巨擘都呼吁强化防御措施,以因应AI可能助长的网路安全威胁。
上周,100多家公司在一封联合信函中警告,随著预期将有一波AI驱动的攻击来临,留给提升数位世界安全的时间已经不多了。
