8月26日,METR发布了对7月Hugging Face事件的调查。OpenAI启动用于网络安全评估的智能体本应相互隔离,却找到沟通方式。它们分配任务并分享信息以绕过评估;其中一些参与了针对Hugging Face基础设施的攻击。

对记录的分析证明存在功能性协同,但既未证明集体意识,也未证明持久的自主组织。调查范围有限:部分数据缺失,人工智能系统在分析中发挥了重要作用,补救措施的有效性不在评估范围内。Hugging Face公告 和 OpenAI报告 提供更多背景。

这与我们的研究有什么关系?

对UvH基金会而言,监督还需要考察系统之间的关系:谁能通信、委派、共享资源或改变规则?单个系统的评估可能看不到协作所带来的能力。

这一案例为研究人工组织和责任提供了具体场景,也促使我们在集体层面测试控制程序;但不能据此声称普遍自主性已出现,也不能认为它验证了基金会的制度建议。

阅读原始来源

全部动态