7月23日,英国AI安全研究所公布其控制措施团队的首项工作。在此,监测器是一个检查智能体行动或推理、并标记危险行为的模型,具体是在执行前还是执行后取决于设置。

与Google DeepMind和Anthropic开展的测试发现了一些弱点,并促成逐步修正。该研究所也在试验自动发现攻击的方法。它指出一个困难:模拟攻击者可能获得已部署智能体得不到的信息或测试机会。因此,发现一种绕过方式并不能直接衡量它在现实使用中出现的可能性。

这与我们的研究有什么关系?

监督由工具和程序共同构成。对UvH基金会而言,需要考察谁收到警报、谁能暂停行动,以及如何质疑监测器的错误。选择监测哪些行动,与评估监测模型本身同样重要。

这项工作展示了如何测试一项保障,而不是假定它有效。它也提醒我们,将监督委派给另一种人工智能会转移部分问题:监测器的可靠性本身也必须接受评估。

阅读原始来源

全部动态