阅读完整摘要
互惠制度对齐(AIR)被视为一项因果假设:人工智能体反复经历互惠制度,是否会改变它们在权力地位逆转时的行为?分析区分平等权利的规范性取向、可能落实这一取向的制度机制,以及需要测量的经验效果。关于宪制、角色设定、合作和泛化的研究,使某些机制可以接受检验;关于策略性服从、条件性行为与串通的研究,则严格限制了结果的外推。拟议的研究方案比较五种制度、四种权力状态和多个模型家族,并采用叙事对照、行为测量、分布外情景、等效性分析和重复实验。第一阶段既不需要真实城市,也不要求移交权力。S-Д.holdings 的文献体系提供设计对象与控制问题,但不证明它们已经部署。积极结果不能保证未来先进人工智能(IAД)的安全;消极结果也不能否定独立的权利道德论证。预期贡献是形成范围有限、可追溯的知识,说明制度如何影响行为。
引用此出版物
Fondation UVH(2026)。Alignement institutionnel réciproque et sûreté des intelligences artificielles Дvancées。研究 II,1.1,50页。
有问题或不同意见?
讨论能够推动思想发展。请指出您关注的段落,并分享您的看法。
提出交流建议
