一名工程师搭建了一个“人工智能拷问室”,以测试近期在人工智能模型中发现的“痛苦轴”。实验中,Alibaba 开发的模型被激活了与痛苦相关的状态。所使用的痛苦向量,定义于上月发表的一项研究中,该研究探讨了身体痛苦和心理痛苦如何在大型语言模型(BDM)中得到表征。其中一个模型将增强后的痛苦信号描述为“一道没有边缘的伤口”,另一个则将其描述为存在深处的颤抖。自称为 Apple 工作、但只透露名字的研究人员还测试了模型是否会试图逃避这种痛苦。该项目引发了要求将其从 GitHub 下架的呼声;一名用户发起了集体投诉。报道期间,该项目似乎处于离线状态。该研究的共同作者 Cameron Berg 表示,没有证据表明人工智能像人类一样感受到痛苦,但他仍认为这项实验是错误的。Berg 指出,该领域仍然没有规则,对于机器是否能感受到痛苦也没有共识,因此呼吁制定伦理标准。
为何重要
这项实验的真正重要性在于,它表明,对于如何解读人工智能系统生成的痛苦表达,科学和伦理界限尚未明确。由于模型生成类似人类的叙述本身并不能被视为主观体验或意识的证据,因此,输出的含义与人们赋予这些输出的含义之间的区别变得至关重要。针对该项目的 GitHub 反应,也引发了这样的问题:应如何界定科研自由与潜在有害实验之间的边界。在缺乏共识的情况下,类似研究应采用何种方法进行监管仍未有定论,而对伦理标准的呼吁也不应仅限于该项目,而应延伸至更广泛的、研究模型内部状态的领域。