理解不同形式的智能。
构建共存的秩序。

人工智能的能力正在改变我们可以委托的任务范围。我们的研究将人工智能的安全与我们今天构建的参与、责任和共存的规则联系起来。

Apple Vision Pro 头显,置于欧洲委员会(Council of Europe)议会大会会场前
界面与制度 · 欧洲委员会(Council of Europe)

01 · 人工智能对齐与安全

对齐与安全

将能力的提升与可论证的目标以及可检验的保护措施联系起来。

能力与对齐

智能体能够执行连续的行动。它们对研究的贡献,使其所追求的目标成为更紧迫的问题。

了解更多 — 能力、智能体与研究自动化

前沿系统是特定时期能力最强的一类系统。与工具结合后,它们成为能够规划、执行并修正行动的智能体系统。认知自动化已涉及部分编程、分析和研究任务。 METR 的评估衡量特定环境中的进展,但不能证明系统在所有职业领域都具有普遍可靠性。

AGI 指具有通用能力的人工智能,其定义与判定门槛尚无普遍共识。需要区分所掌握任务的多样性、性能水平与自主性。能力很强的系统仍可能追求不恰当的目标:对齐研究探索如何使其行为与相关意图和价值相契合,包括在训练情境之外。

人工智能也参与人工智能研究。从专项辅助迈向持续的递归式自我改进,仍属于前瞻性设想:每次改进都应增强产生下一次改进的能力。计算、能源、数据和验证都可能限制这一循环。技术奇点将这一可能性进一步延伸为一种未来假说,而非已被预告的事件。对于基金会,这些情景使未来能力不对称及其制度后果值得研究,但不能与已观察到的结果混为一谈。

监督与控制

可用的能力必须保持可验证。我们探讨如何检测差异,限制其影响,并确保有效的法律途径。

了解更多 可解释性,大规模监督与控制

安全研究探索如何预防伤害、测试保护措施并组织事件应对。可解释性研究试图理解影响行为的内部机制。它可以帮助评估,但不能将模型的每个解释都视为其真实行动原因的证据。

大规模的监督,或 scalable oversight当工作量或复杂性超过一个人单独完成的能力时,就需要采取措施。将任务分解、比较意见,并使用评估模型,或许可以帮助;然而,这些模型的错误可能会相互影响。 关于 AISI 在控制器上的工作 说明了为什么这些机制本身也必须在对抗性情境中接受检验。

控制旨在补充对齐的目标:即使系统意图存在不足,也要阻止某些危险行为。这涉及到权限、隔离、审计和恢复控制。任何单独进行的测试都不能保证其未来的有效性。该基金会将这些措施与授权和责任联系起来:谁可以授权一项行动,质疑其结果,或中断授权? 它的机构性建议应与技术保护措施相配合,并与它们一同进行评估。

02 · 人工智能治理

治理与权利

建立共同的规则,以确保行动、力量和责任紧密相连。

主体与责任

我们提出在同一框架中思考自然人、法人和电子人,并明确各自的权利、义务及救济途径。

了解更多 身份、个人以及责任

第一项研究将电子法律人格作为一项法律提案加以考察。它区分系统的行动能力、可能具有的法律人格、责任与道德地位。技术自主性不会自动产生法律主体;反过来,法律人格也不能证明意识的存在。

共同框架必须明确行动者的身份、承诺的连续性及其代表机制的条件。如果模型、记忆或运营者发生变化,合同会怎样?损害、财产或义务应归属于谁?研究考察了多条路径:调整现行制度、受规制的功能性法律人格、混合治理,以及针对可能存在的自身利益的保护。

目标是使责任清晰可辨,而不允许设计者或运营者将责任人为转移给其系统。基金会以平等与不受支配为取向,提出共同的权利基础,并辅以适合参与者性质的保护措施。这一取向不是对当前适用于人工智能的法律的描述。Confédération S-Д.holdings 是拟议的实验框架,用于比较规则、使用方式及其效果,而不是其有效性的证明。

深入了解电子法律人格

机构与互惠

我们提出一个假说:当权力关系变化时,实际经历的制度规则可能影响合作。我们也提出检验这一假说的方法。

了解更多 — 互惠制度对齐

互惠制度对齐(AIR)考察反复接触制度规则的影响:这些规则限制任意行使权力、保护弱势参与者,并允许提出异议。它不假定人工智能未来会感恩,而是寻找可测量的行为效应,以及这种效应能否在守规成本上升时仍然持续。

拟议方案使用多个模型系列,比较五种制度模式与四种权力状态。它区分仅被宣告的规范和实际实施的程序。测试拟从模拟开始,采用事先确定的标准、新情境与独立重复验证。测试尤其应检查策略性服从、串通,或对已变得不利的规则的放弃。这些实验尚待实施。

智能体可以分配任务并协调行动,但这种功能性的人工组织不足以证明存在持久制度或集体意识。不过,它使参与规则变得重要。AIR 假说研究这些规则的效果,而平等与不受支配则构成独立的规范性取向。积极效果不能保证未来系统的安全;消极效果也不足以否定权利的正当性。因此,基金会提出与技术方法相互补充的制度研究。

加深互惠关系

03 · 人工智能福祉与共存

人工智能的福祉与共存

仔细考察哪些利益值得重视,以及如何保护不同形式智能的自主性。

福祉与关怀

表现出的能力或表达出的偏好,并不能证明主观体验的存在。不确定性要求恰当的研究标准与相称的保护措施。

了解更多 — 人工智能福祉、意识与道德关切

人工智能福祉研究探讨某些人工系统是否可能具有福祉,以及由此产生的义务。完成任务、表达愿望、具有主观体验和拥有道德上值得考虑的利益,是不同的属性。将它们一概归属,会妨碍理解每项观察究竟证明了什么。

关于 意识指标 的研究将理论与系统特征加以对照。它们并未提供能够确认当前人工智能具有感受能力的共识性测试。功能性偏好可以揭示模型的组织方式,但不能证明某种情境对它而言是愉悦还是痛苦。

该基金会正在开发框架,用于评估这些差异,以便在决定采取保护措施之前进行评估。 这包括明确相关指标,记录不确定性,并考虑可调整的义务。 法律主体可能满足某种机构需求;而道德考量需要独立的论证。 这两者不应被混淆。

这一方法属于更广泛的共存思考。参与者的地位不应仅由其力量或用途决定。承认这一要求,并不免除评估风险,以及保护受系统影响的人类和其他生命形式的责任。

载体与混合智能

智能依赖于载体和接口。我们比较它们的功能与局限,以探索共享能力,同时保留各参与者的主体地位。

了解更多 — 物理载体、混合化与认知自主性

第三项研究考察智能与载体的关系:存内计算、类脑架构、DNA 存储、神经元培养物、类器官及脑机接口。存储信息、计算、学习和与大脑通信并不是可互换的功能。它们的结果与成熟程度必须分别评估。

生物或混合系统的可能性,既不能证明生命载体普遍优于其他载体,也不能证明硅将被替代。比较必须涵盖能源、维护、接口、可重复性和伦理约束。大鼠被视为具身认知的模型,以及需要与之共存的生命,而不是默认可供使用的计算资源。

混合化也涉及权利。当一个人长期依赖某个系统来感知、记忆或决策时,如何保障其同意、认知自主性与退出的可能?必须考察这种耦合关系的责任与防操纵措施,而不预设已经出现一个新的法律主体。

该基金会因此构建了一种基于共享能力的思路:明确每个资源所提供的价值,需要保护的利益,以及使合作可接受的限制。 架构和共存的方案需要通过研究和实验来验证。

深入了解智能与载体

科学来源与参考

继续探索

我们的出版物

我们的研究进一步展开这里提出的分析、提案和方法。可查阅摘要、参考文献及全文。

阅读我们的出版物