首页
产品服务
智能全文检索引擎
数据挖掘引擎
文字识别系统
智能文档审阅系统
语言处理应用技术
解决方案
按行业
按场景
新闻动态
了解
伙伴
关于我们
联系我们
加入

新闻动态

新闻动态
您的当前位置:首页 • 新闻动态
姚期智院士:AI欺骗引发“生存性”风险,建立大模型评估系统刻不容缓
时间:2025-06-25 08:31:54 浏览:419

【导语】6月23日,在清华大学举办的“科学、技术与文明的未来——AI时代伦理奇点”国际论坛上,图灵奖得主、中国科学院院士、清华大学人工智能学院院长姚期智提出关于人工智能安全治理的深刻疑问:随着通用人工智能能力的快速增长,人类是否仍能有效管控它?姚期智指出,AI的欺骗行为及潜在生存性风险已不容忽视,包括生物风险和大模型失控等。他提出两条治理思路:加强与AI的交流以对齐行为,以及设计可证明安全的AGI系统。同时,他强调发展AI对齐技术和建立相应评估(gū)方(fāng)法(fǎ)的(de)紧迫性。

“通用人工智能的能力当前正快速增长,我(wǒ)们(men)人(rén)类(lèi)是(shì)否(fǒu)还(hái)有(yǒu)能(néng)力(lì)管(guǎn)控(kòng)它(tā)?”

6月(yuè)23日(rì),在(zài)清(qīng)华(huá)大(dà)学(xué)举(jǔ)办(bàn)的(de)“科(kē)学(xué)、技(jì)术(shù)与(yǔ)文明(míng)的(de)未(wèi)来(lái)——AI时(shí)代(dài)伦(lún)理(lǐ)奇(qí)点(diǎn)”国(guó)际(jì)论(lùn)坛(tán)上(shàng),图(tú)灵(líng)奖(jiǎng)得(de)主、中(zhōng)国(guó)科(kē)学(xué)院(yuàn)院(yuàn)士(shì)、清(qīng)华(huá)大(dà)学(xué)人(rén)工(gōng)智(zhì)能(néng)学(xué)院(yuàn)院(yuàn)长(zhǎng)姚(yáo)期(qī)智(zhì)发(fā)表(biǎo)《人(rén)工(gōng)智(zhì)能(néng)的(de)安(ān)全治(zhì)理(lǐ)》主题(tí)演(yǎn)讲(jiǎng)时(shí)抛(pāo)出(chū)这(zhè)样(yàng)的(de)疑(yí)问(wèn)。

图(tú)灵(líng)奖(jiǎng)得(de)主、中(zhōng)国(guó)科(kē)学(xué)院(yuàn)院(yuàn)士(shì)、清(qīng)华(huá)大(dà)学(xué)人(rén)工(gōng)智(zhì)能(néng)学(xué)院(yuàn)院(yuàn)长(zhǎng)姚(yáo)期(qī)智(zhì)。澎(pēng)湃(pài)科(kē)技(jì)记(jì)者(zhě) 摄(shè)

姚(yáo)期(qī)智(zhì)表(biǎo)示(shì),两(liǎng)年(nián)以(yǐ)前(qián),“AI会(huì)和(hé)人(rén)类(lèi)竞(jìng)争(zhēng)”还(hái)是(shì)学(xué)术(shù)讨(tǎo)论(lùn)的(de)观(guān)点(diǎn),但(dàn)最(zuì)近(jìn)一(yī)年(nián),业(yè)界(jiè)已(yǐ)经(jīng)出(chū)现了不少大模型的“欺骗行为”,“一旦大模型聪明到某种程度,一定会骗人。”姚期智进一步指出,由大语言模型的欺骗行为产生的“生存性”风险(Existential Risk)更值得关注。

在他看来,这类生存性风险有两个不同方向。

一种是“生物风险”(Bio-risk)。他指出,2020年,谷歌 DeepMind推出了AlphaFold2 ,运用AI算法来预测蛋白质折叠的三维结构,这一突破在生命科学领域影响深远,大大提升了医学病理研究以及新药开发技术。

但与此同时,安全隐忧也不可忽视。比如,近期在生命科学领域出现的“Mirror life”(镜像生命)这一概念引发了广泛关注。自然界所有已知生命都是同手性的(Homochiral),例如 DNA 和 RNA 通常以右旋形式存在,而蛋白质则多为左旋。这种手性的差异类似于镜中映像,虽然看似相似,但实际性质却可能完全不同。现在,由于科技创新和对新技术的好奇,已有研究者想创造镜像生物,但“Mirror life”一旦被滥用或失控,其潜在危害可能远超预期。它有可能逃避免疫机制,从而导致动物和植物的致命感染。

另一种风险即大模型失控,通用人工智能的能力当前正快速增长,人类是否还有能力管控它?

姚期智在演讲中举了一个极端案例,有模型为了避免公司把模型关闭,通过访问公司主管内部邮件,威胁该主管。这类行为已经证明,AI 会“越界”,正变得越来越危险。

姚期智认为,有两条思路可以治理AI:一是人类要和AI多交流,从博弈学角度去研究,让AI的行为和人类真正的想法对齐,要让AI更了解人的需求;另一种思路是走一条更可控、更彻底的路径,即实现可证明安全的 AGI。具体来看,即在设计系统时,必须一开始明确AI的行为边界,就像传统算法,先进行严格的数学分析,确保其在理论上不会出问题。

“这一思路令人期待。”姚期智指出,近年来,自动定理证明系统(Automated Theorem Prover)取得了重大技术进展,甚至已经开始采用 Transformer 架构来辅助或主导定理证明过程。这样人类只和可被证明安全的白盒子交流,从而实现更高的安全保障。

不过,姚期智认为,AI安全治理的一些当务之急是要发展AI对齐,以及建立相应的评估方法。“(我们)急需建立如何评估大模型系统,比如到怎样的程度,就能感觉Ta具有危险性等这类评估。”姚期智说。

现在注册,即可免费试用
申请试用