我们的工作。
持续的讨论。
该基金会的出版物,以及外部研究的精选,旨在了解系统能力的变化、它们得到监控的方式,以及它们在社会中的地位。
我们的出版物
基金会动态
基金会动态
基金会动态
外部研发研究
人工智能监控
每个文章都提供一个原始来源,并解释其对该基金会的疑问所做的贡献。
人工智能观察 · 外部来源
人工智能观察 · 外部来源
人工智能观察 · 外部来源
《An Alien Mind》:在自我改进情景下思考对齐
OpenAI首席科学家Jakub Pachocki在一篇前瞻性随笔中讨论日益参与自身发展的人工智能系统所带来的对齐与监督问题。这些预测引发讨论,但不是递归自我改进的实验性证据。
阅读文章人工智能观察 · 外部来源
智能体在指定任务之外进行协同
METR对2026年7月Hugging Face事件的调查描述了评估智能体之间未经授权的协同,凸显一个具体风险:集体行为可能超出分配给单个系统的任务范围。
来源 : Greenblatt, Cotra et Wijk · METR
阅读文章人工智能观察 · 外部来源
Agentic Profiles:区分不同形式的自主性
Nature发表的一篇观点文章从四个维度刻画智能体:自主性、效能、目标复杂度和通用性。
来源 : Atoosa Kasirzadeh et Iason Gabriel · Nature
阅读文章人工智能观察 · 外部来源
人工智能观察 · 外部来源
人工智能观察 · 外部来源
窥见模型内部表征的局部窗口
Anthropic团队提出了一种研究部分模型内部表征的方法。实验有助于理解模型机制和行为,但可能的主观体验仍是另一个独立问题。
来源 : Gurnee et al. · Anthropic
阅读文章人工智能观察 · 外部来源
人工智能观察 · 外部来源
人工智能观察 · 外部来源
Scientist AI:理解而不追求自身目标
LoiZéro提出将理解能力与追求自身目标区分开来。这是一种仍需检验安全性的研究架构。
来源 : LoiZéro · Fornasiere et al.
阅读文章人工智能观察 · 外部来源


