7月6日,Anthropic研究人员提出“雅可比透镜”。该方法识别与模型能够表达的某些概念相关的内部表征。在有针对性的实验中,干预这些表征会改变回答或行为。
观察仍不完整:某些概念难以分离,一些读数仍无法解释。作者研究的是功能属性;他们的观察并不能证明模型具有主观体验。
这与我们的研究有什么关系?
对UvH基金会而言,更深入地研究系统机制,或许有助于理解仅靠回答无法核验的内容。这也提出监督问题:什么信息真正支持调查,矛盾证据又该如何比较?
道德问题还需要进一步论证。识别出有助于推理的内部组织方式,并不能证明系统能够体验幸福或痛苦。我们的工作把这些问题放在一起研究,但不将其混为一谈:理解机制、评估可能的利益、论证法律身份,需要不同论据。
