研究 II · 2026年9月18日

互惠制度对齐与先进人工智能的安全

本研究旨在测试实际应用的规则对人工代理行为在行动力不断变化时的影响。

作者
Fondation UvH
版本
1.1
语言
法语 · 50 页
互惠制度对齐与先进人工智能的安全
阅读完整摘要

互惠制度对齐(AIR)被视为一项因果假设:人工智能体反复经历互惠制度,是否会改变它们在权力地位逆转时的行为?分析区分平等权利的规范性取向、可能落实这一取向的制度机制,以及需要测量的经验效果。关于宪制、角色设定、合作和泛化的研究,使某些机制可以接受检验;关于策略性服从、条件性行为与串通的研究,则严格限制了结果的外推。拟议的研究方案比较五种制度、四种权力状态和多个模型家族,并采用叙事对照、行为测量、分布外情景、等效性分析和重复实验。第一阶段既不需要真实城市,也不要求移交权力。S-Д.holdings 的文献体系提供设计对象与控制问题,但不证明它们已经部署。积极结果不能保证未来先进人工智能(IAД)的安全;消极结果也不能否定独立的权利道德论证。预期贡献是形成范围有限、可追溯的知识,说明制度如何影响行为。

引用此出版物

Fondation UVH(2026)。Alignement institutionnel réciproque et sûreté des intelligences artificielles Дvancées。研究 II,1.1,50页。

BibTeX 引文

有问题或不同意见?

讨论能够推动思想发展。请指出您关注的段落,并分享您的看法。

提出交流建议