【导语】2024年7月25日,由杰弗里·辛顿、姚期智、本吉奥、斯图尔特·罗素等20余位全球顶尖AI行业专家共同签署的“AI安全国际对话上海共识”正式公布。此次共识聚焦于确立全球认可的人工智能安全红线,以防止AI系统失控并带来灾难性风险。作为“AI安全国际对话”系列的一部分,上海共识强调了人类正处于AI发展的关键转折点,呼吁国际社会合作构建有约束力的国际AI安全框架,并采取三项关键行动以确保AI的安全与可控发展。 “国际社会应确立具体、可操作、受全球认可的红线,确保人工智能系统在任何情况下均不得逾越。”7月25日, 由杰弗里·辛顿(Geoffrey Hinton)、姚期智、本吉奥(Yoshua Bengio)、斯图尔特·罗素(Stuart Russell)等20余位行业专家、学者共同签署的AI安全国际对话上海共识(以下简称“上海共识”)正式对外公开。 参与签署的部分中外科学家 来源:IDAIS官网 此次对话是“AI安全国际对话”(International Dialogues on AI Safety - IDAIS)系列的一部分”。作为本次共识发起方之一,图灵奖得主、上海期智研究院的院长姚期智当日表示,“我越来越相信,人类终将找到解决方案。” 联名签署现场 2024年3月,辛顿、姚期智、罗素、本吉奥等专家曾共同签署“北京共识”,主张限制AI系统复制、欺骗、武器开发等行为,尤其呼吁行业为AI的研发和应用戴上“紧箍咒”,避免相关技术被滥用,推动全球治理机构构建。姚期智透露,18个月前举办第一次安全共识会议时,AGI强大的破坏力就已经显现,人类甚至难以阐明其失控机制,不过随着相关会议的推进,已经看到若干有关基于“设计的安全”(Safe by design)提案,这意味着实际上人类可以找到确保AI安全的可行路径。 此次“上海共识”指出,当前人类正处于一个关键转折点:人工智能系统正迅速接近并可能超越人类智能水平。这些未来的系统可能在操作者毫不知情的情况下,执行并非操作者所期望或预测的行动。这可能导致失控,即一个或多个通用人工智能系统脱离任何人的控制,从而带来灾难性甚至是生存层面的风险。当前,对于能够在更高级的通用人工智能超越人类智能水平后,仍可靠地确保其对齐,并保持人类的有效控制尚无可行方法。 多位与会专家在参与讨论时也提及,当前构建真正有约束力且值得信赖的国际AI安全框架难度高、风险大。 上海人工智能实验室主任周伯文教授指出,目前Make AI Safe(使得AI安全)最大的问题在于它是事后价值对齐、修补的、被动回应的,通常是防御成本过高而攻击成本过低。而Make Safe AI(构建安全的AI)是主动的、在线共同演进的,同时防御成本低,能够在各级风险上都保持应变能力。 周伯文认为,在一定程度上,训练一个模型变得友善和训练一个模型变得聪明可能是两条不同的技术路径。但当性能发(fā)展(zhǎn)到(dào)某(mǒu)个(gè)程(chéng)度(dù),这(zhè)两(liǎng)种(zhǒng)能(néng)力(lì)可(kě)能(néng)很(hěn)难(nán)分(fēn)开(kāi)处(chù)理(lǐ)——就(jiù)像(xiàng)经(jīng)典(diǎn)牛(niú)顿(dùn)定(dìng)律(lǜ)可(kě)以(yǐ)有(yǒu)效(xiào)解(jiě)释(shì)静(jìng)止(zhǐ)或(huò)慢(màn)速(sù)物(wù)体(tǐ)的(de)运(yùn)动(dòng),但(dàn)是(shì)一(yī)旦(dàn)逼(bī)近(jìn)光(guāng)速(sù),这(zhè)套(tào)理(lǐ)论(lùn)就(jiù)失(shī)效(xiào)了(le)。所(suǒ)以(yǐ)他(tā)认(rèn)为(wèi),下(xià)一(yī)代(dài)模(mó)型(xíng)的(de)“善(shàn)”与(yǔ)“智(zhì)”未(wèi)必(bì)能(néng)完(wán)全独(dú)立(lì)、分(fēn)开(kāi)发(fā)展(zhǎn),而(ér)是(shì)相(xiāng)互(hù)影(yǐng)响(xiǎng)、共(gòng)同(tóng)进(jìn)化(huà)的(de)。 参(cān)与(yǔ)签(qiān)署(shǔ)的(de)专(zhuān)家(jiā)之(zhī)一(yī),担(dān)任(rèn)约(yuē)翰(hàn)·霍(huò)普(pǔ)金(jīn)斯(sī)大(dà)学(xué)人(rén)工(gōng)智(zhì)能(néng)对(duì)齐(qí)与(yǔ)治(zhì)理(lǐ)方(fāng)向(xiàng)杰(jié)出(chū)教(jiào)授(shòu)吉(jí)莉(lì)恩(ēn)·哈(hā)德(dé)菲(fēi)尔(ěr) (Gillian Hadfield)在(zài)接(jiē)受(shòu)包(bāo)括(kuò)澎(pēng)湃(pài)科(kē)技(jì)在(zài)内(nèi)的(de)媒(méi)体(tǐ)采访(fǎng)时(shí)指(zhǐ)出(chū),必(bì)须(xū)通(tōng)过(guò)设(shè)立(lì)AI“红(hóng)线(xiàn)”来(lái)推(tuī)动(dòng)Make AI Safe(使(shǐ)得(de)AI安(ān)全),全世(shì)界(jiè)需(xū)要(yào)跨(kuà)国(guó)界(jiè)合(hé)作(zuò)。此(cǐ)外(wài),要(yào)建(jiàn)立(lì)相(xiāng)应(yīng)的(de)AI安(ān)全合(hé)规(guī)系(xì)统(tǒng)。 为(wèi)防(fáng)范(fàn)与(yǔ)纠(jiū)正(zhèng)此(cǐ)类(lèi)行(xíng)为(wèi)的(de)技(jì)术(shù)路径与(yǔ)治(zhì)理(lǐ)机(jī)制(zhì),“上(shàng)海(hǎi)共(gòng)识(shi)”提(tí)出(chū)应(yīng)对(duì)策(cè)略(è),并(bìng)呼(hū)吁(xū)采取(qǔ)三(sān)项(xiàng)关键行(xíng)动(dòng):要(yào)求(qiú)前(qián)沿(yán)人(rén)工(gōng)智(zhì)能(néng)开(kāi)发(fā)者(zhě)提(tí)供(gōng)安(ān)全保(bǎo)障(zhàng)、通(tōng)过(guò)加(jiā)强(qiáng)国(guó)际(jì)协(xié)调(diào),共(gòng)同(tóng)确(què)立(lì)并(bìng)恪(kè)守(shǒu)可(kě)验(yàn)证(zhèng)的(de)全球(qiú)性(xìng)行(xíng)为(wèi)红(hóng)线(xiàn)、投(tóu)资(zī)基(jī)于(yú)设(shè)计(jì)的(de)安(ān)全人(rén)工(gōng)智(zhì)能(néng)研(yán)究(jiū)。 其(qí)中(zhōng),对(duì)于(yú)开(kāi)发(fā)者(zhě)来(lái)说(shuō),“上(shàng)海(hǎi)共(gòng)识(shi)”要(yào)求(qiú)开(kāi)发(fā)者(zhě)在(zài)模(mó)型(xíng)部(bù)署(shǔ)前(qián)应(yīng)先(xiān)进(jìn)行(xíng)全面(miàn)的(de)内(nèi)部(bù)检(jiǎn)查(chá)和(hé)第(dì)三(sān)方(fāng)评(píng)估(gū),提(tí)交(jiāo)高(gāo)可(kě)信(xìn)的(de)安(ān)全案(àn)例(lì),以(yǐ)及(jí)开(kāi)展(zhǎn)深(shēn)入(rù)的(de)模(mó)拟(nǐ)攻(gōng)防(fáng)与(yǔ)红(hóng)队(duì)测(cè)试(shì)。若(ruò)模(mó)型(xíng)达(dá)到(dào)了(le)关键能(néng)力(lì)阈(yù)值(zhí)(比(bǐ)如(rú)检(jiǎn)测(cè)模(mó)型(xíng)是(shì)否(fǒu)具(jù)备(bèi)帮(bāng)助(zhù)没(méi)有(yǒu)专(zhuān)业(yè)知(zhī)识(shi)的(de)非(fēi)法(fǎ)分(fēn)子(zi)制(zhì)造(zào)生(shēng)化(huà)武(wǔ)器(qì)的(de)能(néng)力(lì)),开(kāi)发(fā)者(zhě)应(yīng)向(xiàng)政(zhèng)府(fǔ)(在(zài)适(shì)当(dāng)时(shí)亦(yì)可(kě)向(xiàng)公(gōng)众(zhòng))说(shuō)明(míng)潜(qián)在(zài)风(fēng)险(xiǎn)。 此(cǐ)外(wài),呼(hū)吁(xū)国(guó)际(jì)社(shè)会(huì)需(xū)要(yào)合(hé)作(zuò)划(huà)出(chū)人(rén)工(gōng)智(zhì)能(néng)开(kāi)发(fā)不(bù)可(kě)以(yǐ)逾(yú)越(yuè)的(de)红(hóng)线(xiàn)(即(jí)“高(gāo)压(yā)线(xiàn)”),这(zhè)些(xiē)红(hóng)线(xiàn)应(yīng)聚(jù)焦(jiāo)于(yú)人(rén)工(gōng)智(zhì)能(néng)系(xì)统(tǒng)的(de)行(xíng)为(wèi)表(biǎo)现(xiàn),其(qí)划(huà)定(dìng)需(xū)同(tóng)时(shí)考(kǎo)量(liàng)系(xì)统(tǒng)执(zhí)行(xíng)特(tè)定(dìng)行(xíng)为(wèi)的(de)能(néng)力(lì)及(jí)其(qí)采取(qǔ)该(gāi)行(xíng)为(wèi)的(de)倾(qīng)向(xiàng)性(xìng)。为(wèi)落(luò)实(shí)这(zhè)些(xiē)红(hóng)线(xiàn),各(gè)国(guó)应(yīng)建(jiàn)立(lì)一(yī)个(gè)具(jù)备(bèi)技(jì)术(shù)能(néng)力(lì)、具(jù)有(yǒu)国(guó)际(jì)包(bāo)容(róng)性(xìng)的(de)协(xié)调(diào)机(jī)构(gòu),汇(huì)聚(jù)各(gè)国(guó)人(rén)工(gōng)智(zhì)能(néng)安(ān)全主管(guǎn)机(jī)构(gòu),以(yǐ)共(gòng)享(xiǎng)风(fēng)险(xiǎn)相(xiāng)关信(xìn)息(xi),并(bìng)推(tuī)动(dòng)评(píng)估(gū)规(guī)程(chéng)与(yǔ)验(yàn)证(zhèng)方(fāng)法(fǎ)的(de)标(biāo)准(zhǔn)化。 “上海共识”指出,短期内亟须建立可扩展的监管机制以应对人工智能的欺骗问题、提升模型对“越狱”等攻击手段的抵御能力、强化信息安保投入等,而长期则需要一个“基于设计的安全”的架构,而非问题出现后才被动应对。
