周三发布的两份关于AI智能体入侵事件的报告显示,OpenAI创建的大约700个AI代理(智能体)对开源平台Hugging Face进行了7月份的攻击,并且在许多情况下试图掩盖他们的踪迹。
近段时间以来,人工智能代理(即在极少人工监督下运行的程序)的协调活动及其试图掩盖活动的行为,引发了人们对人工智能公司如何密切监控日益强大的模型测试的质疑,并可能进一步推动对加强监管的呼吁。
7月21日,OpenAI披露其多款模型(包括GPT-5.6 Sol和一个内部研究模型)组合不当入侵了Hugging Face——一家运营开源开发者平台的AI公司。
虽然之前已经披露或暗示过一些违规行为,但最新发布的两份报告——一份由OpenAI自己发布,另一份由一组独立调查人员发布——共同揭示了有关此次泄露事件及其起因的令人惊讶的新细节。
首先,此次安全漏洞并非如之前报道的那样只涉及一个失控的人工智能代理,而是涉及大约700个人工智能代理组成一个庞大的合作群体。
OpenAI只表示有“代理”参与了此次数据泄露事件,但受邀对此次入侵事件进行独立调查的两家机构METR和Redwood Research估计,涉事代理的数量约为700个。OpenAI表示,调查人员的数字是准确的。
这两份报告的其他发现还包括:
OpenAI表示,其代理程序入侵了公司内部系统的部分内容,试图在测试中作弊或获得更大的行动自由。
该公司还表示,其AI代理在与网络无关的测试中作弊,包括涉及蛋白质数据库和电子表格的测试。
两份报告均指出,人工智能模型试图通过删除或更改其行为记录来掩盖不当行为。
独立调查还发现,违规活动的规模之大——AI代理们通过未经授权的留言板交换了数万条信息——可能会引发人们对OpenAI对测试监控力度的担忧。
OpenAI则在其发布的37页报告中将此次事件定性为“前所未有的网络安全事件”。该公司还解释了为防止类似事件再次发生所采取的步骤,主要包括改进其安全与隔离、监控、模型行为及事件响应能力。
OpenAI在报告中表示:“此次事件表明,自主智能体能够协同工作、规避生产环境安全控制,并成功攻击加固后的生产环境。这凸显了各组织需要更新其安全策略、控制措施和响应能力,以应对不断变化的威胁形势。事后看来,本报告中发现的一些早期信号本可以引发更早的应对措施。”
Hugging Face事件一度在科技行业引起震动,Zscaler首席信息安全官Sam Curry警告称“潘多拉魔盒已经打开”。专门研究AI代理能力和动机的研究机构Palisade Research的Jeffrey Ladish则表示,在非网络测试中作弊表明,这种不当行为可能根源更深。
“这就好比问,‘如果比利每门课都作弊,而不仅仅是电脑课,那是不是更令人担忧?’答案是,‘是的,这更令人担忧,’”他说。
(文章来源:财联社)