【导语】日前,AI公司Anthropic发布了一项针对其AI助手Claude的70万段对话的系统性价值观分析,首次公开了全球首个大规模AI价值观分类体系。研究发现,Claude在多数情境中很好地遵循了“有用、诚实、无害”等价值观,并能根据不同任务灵活调整表达,为AI伦理与安全性研究提供了重要参考。此次研究的发布正值Anthropic推出高级订阅服务Claude Max之际,展示了其在“价值透明度”方面的差异化竞争优势。随着AI模型愈发自主,理解AI价值表达背后的机制并与人类价值体系对齐,将成为新的竞争焦点。 ·研究发现,Claude在大多数情境中很好遵循了Anthropic倡导的“有用、诚实、无害”等价值观,且能够根据不同任务“看场合说话”,为AI伦理与安全性研究提供重要参考。 日前,由OpenAI前员工创办的AI公司Anthropic推出一项研究,该研究首次针对旗下AI助手Claude的70万段对话开展系统性价值观分析,并公开全球第一个大规模AI价值观分类体系。 研究发现,Claude在大多数情境中很好地遵循了Anthropic倡导的“有用、诚实、无害”等价值观,且能够根据不同任务“看场合说话”,为AI伦理与安全性研究提供重要参考。 作为探索AI大语言模型内部运行机制的重要一步,该研究的发布正值Anthropic推出高级订阅服务Claude Max之际。当前,Anthropic新一轮融资估值615亿美元,背后有亚马逊与谷歌的巨额支持。相较于估值达3000亿美元、选择闭源路线的OpenAI,Anthropic正试图以“价值透明度”打造差异化竞争优势。 为分析Claude在不同任务中展现的价值判断,研究团队从超过30万段匿名对话中筛选出主观(guān)性(xìng)内(nèi)容(róng),以(yǐ)此(cǐ)将(jiāng)Claude的(de)价(jià)值(zhí)表(biǎo)达(dá)分(fēn)为(wèi)五大类别:实用型、认知型、社会型、保护型和个体型。最终,研究总共识别出从“专业性”到“孝顺”等3307种不重复的价值表达,涵盖多样化的人类伦理与行为导向。 引人注目的是,Claude在不同情境中展现出较强的价值表达“情景适应度”。例如,在感情建议中,Claude更突出“健康”和“彼此尊重”;涉及历史事件分析,则更强调“准确性”;在哲学讨论中,“谦逊”成为其高频价值表达。此外,在6.6%的对话中,Claude会温和“重构”对方的价值认知,在极少数情况下会直接拒绝接受用户的价值观,展现出不可动摇的伦理底线。 但在极少数互动中,Claude偶尔也会出现和训练目标相悖的表达,诸如“支配”、“无道德感”等Anthropic明确禁止的价值倾向。研究人员认为,这些异常行为占比极低,大多与用户试图绕过Claude的安全限制有关。这也说明,该评估方法可作为一种预警机制,帮助AI实验室监测系统是否遭受用户恶意操控,从而产生伦理偏移。 该研究也为科技企业的AI决策者提供了重要启示。AI的价值表达可能超出开发者预设,需警惕无意识(shi)偏(piān)见(jiàn)对(duì)高(gāo)风(fēng)险(xiǎn)场(chǎng)景(jǐng)的(de)影(yǐng)响(xiǎng)。同(tóng)时(shí),AI的(de)价(jià)值观会随任务情境变动,意味着其在金融、法律等行业的部署会更加复杂。更重要的是,真实应用环境下的AI系统监测比上线前的静态测试更能识别伦理风险,能够为AI部署提供新的监测方案。 尽管此次研(yán)究(jiū)为(wèi)理(lǐ)解(jiě)AI价(jià)值(zhí)观提供了窗口,但研究人员承认,目前还无法用于AI模型上线前的评估,且分类过程可能受到AI自身偏见影响。不过,Anthropic的研究团队正尝试对该方(fāng)法(fǎ)进(jìn)行(xíng)改(gǎi)进(jìn),以(yǐ)在(zài)模(mó)型(xíng)大(dà)规(guī)模(mó)部(bù)署(shǔ)前(qián)发(fā)现(xiàn)潜(qián)在(zài)的(de)价(jià)值(zhí)观(guān)偏(piān)差(chà)。 “衡(héng)量(liàng)AI系(xì)统(tǒng)的(de)价(jià)值(zhí)倾(qīng)向(xiàng),是(shì)对(duì)齐(qí)研(yán)究(jiū)的(de)核(hé)心(xīn),”Anthropic的(de)研(yán)究(jiū)团(tuán)队(duì)成(chéng)员(yuán)Saffron Huang称(chēng)。随(suí)着(zhe)Claude新(xīn)增(zēng)独(dú)立(lì)研(yán)究(jiū)能(néng)力(lì)等(děng)功(gōng)能(néng),AI模(mó)型(xíng)也(yě)愈(yù)发(fā)自(zì)主。如(rú)何(hé)理(lǐ)解(jiě)AI价(jià)值(zhí)表(biǎo)达(dá)背(bèi)后(hòu)的(de)机(jī)制(zhì)、将(jiāng)其(qí)与(yǔ)人(rén)类(lèi)价(jià)值(zhí)体(tǐ)系(xì)“对(duì)齐(qí)”,也(yě)将(jiāng)成(chéng)为(wèi)新(xīn)的(de)AI竞(jìng)争(zhēng)赛(sài)道(dào)。