Anthropic提出,可以把预训练理解为学习许多种人格,再把后训练理解为精炼一种助手性格。该框架旨在解释类似人类的行为及一些意外的行为变化。
作者明确区分模拟的人格与生成它的系统。这是行为理论,既不能证明个人身份,也不能证明主观体验。
这与我们的研究有什么关系?
将意图归于助手或许有助于描述它的回答,但不足以确立道德或法律身份。该模型促使我们分别考察行为、训练机制和身份承认的条件。
Persona Selection Model通过训练中学到并逐渐精炼的人格来解释助手行为。这是一种解释理论,并非意识证据。