新(xīn)智(zhì)元(yuán)报(bào)道(dào) 编(biān)辑(ji):编(biān)辑(ji)部(bù) 【新(xīn)智(zhì)元(yuán)导(dǎo)读(dú)】2025年(nián)斯(sī)坦(tǎn)福(fú)HAI报(bào)告(gào)重(zhòng)磅发布,456页深度剖析全球(qiú)AI领(lǐng)域的(de)最(zuì)新(xīn)趋(qū)势(shì):中(zhōng)美(měi)顶(dǐng)级(jí)模(mó)型(xíng)性(xìng)能(néng)差(chà)距(jù)缩(suō)至(zhì)0.3%,以(yǐ)DeepSeek为(wèi)代(dài)表(biǎo)的(de)模(mó)型(xíng)强(qiáng)势(shì)崛(jué)起(qǐ),逼(bī)近(jìn)闭(bì)源(yuán)巨(jù)头(tóu);推(tuī)理(lǐ)成(chéng)本(běn)暴(bào)降(jiàng),小(xiǎo)模(mó)型(xíng)性(xìng)能(néng)飙(biāo)升(shēng),AI正(zhèng)变(biàn)得(de)更(gèng)高(gāo)效(xiào)、更(gèng)普(pǔ)惠(huì)。 就(jiù)在(zài)刚(gāng)刚(gāng),每(měi)年(nián)都备受瞩目的斯坦福AI指数报告,重磅发布了! 这份报告由斯坦福大学以人为本AI研究员发布,代表着每年AI领域最核心和前沿的动向总结。 今年,这份报告长达456页,抛出不少惊人观点。 比如,如今在2025年,中美顶级AI模型的性能差距已经缩小到了0.3%(2023年,这一数字还是20%),中国模型正在快速追赶美国的领先地位! 而DeepSeek领衔的开放权重模型,更是以1.7%之差,逼宫各大闭源巨头。前者和后者的差距,已经由2024年的8%,缩小至2025年的1.7%。 当然,目前从行业主导企业来看,美国仍然领先于中国。在2024年,90%的知名AI模型来自企业,美国以40个模型领先,中国有15个。 更明显的一个趋势,就是如今大模型的性能已经趋同!在2024年,TOP1和TOP10的模型的差距能有12%,但如今,它(tā)们(men)的(de)差(chà)距(jù)已(yǐ)经(jīng)越(yuè)来(lái)越(yuè)小(xiǎo),锐(ruì)减(jiǎn)至(zhì)5%。 十二大亮点 最新的斯坦福HAI两篇博文中,浓缩了2025年AI指数报告的十二大亮点。 1. AI性能再攀高峰,从基准测试到视频生成全面突破 2023年,研究人员推出了MMMU、GPQA和SWE-bench等新基准来测试先进AI系统的极限。 仅一年后,性能便大幅提升:AI在三项基准得分分别飙升18.8%、48.9%和67.3%。 不仅如此,AI在生成高质量视频方面取得重大突破,甚至,在某些场景下AI智能体甚至超越人类表现。 · 更有用智能体崛起 2024年发布的RE-Bench基准测试,为评估AI智能体复杂任务能力设立了严苛标准。 数据显示:在短期任务(2小时内)场景下,顶级AI系统的表现可达人类专家的4倍;但当任务时限延长至32小时,人类则以2:1的优势反超。 值得注意的是,AI已在特(tè)定(dìng)领(lǐng)域,如(rú)编(biān)写(xiě)特(tè)定(dìng)类(lèi)型(xíng)代(dài)码(mǎ),展(zhǎn)现(xiàn)出(chū)与(yǔ)人(rén)类(lèi)相(xiāng)当(dāng)的(de)专(zhuān)业(yè)水(shuǐ)平(píng),且(qiě)执(zhí)行(xíng)效(xiào)率(lǜ)更(gèng)胜(shèng)一(yī)筹(chóu)。 2. 美(měi)国(guó)领(lǐng)跑(pǎo)顶(dǐng)尖(jiān)模(mó)型(xíng)研(yán)发(fā),但(dàn)中(zhōng)国(guó)与(yǔ)之(zhī)差(chà)距(jù)逐(zhú)渐(jiàn)缩小 2024年,美国产出40个重要AI模型,远超中国的15个和欧洲的3个。 然而,中国模型在性能上的差距正加速缩小:MMLU等基准测试中,中美AI差异从两位数缩小至近乎持平。 同时,中(zhōng)国(guó)在(zài)AI学(xué)术论文和专利申请量上持续领跑,中东、拉美和东南亚地区也涌现出具有竞争力的模型。 3. AI正变得高效且普惠,推理成本暴降280倍 随着小模型性能提升,达到GPT-3.5水平的推理成本在两年间下降280倍,硬件成本以每年30%的速度递减,能效年提升率达40%。 更(gèng)令(lìng)人(rén)振(zhèn)奋(fèn)的(de)是(shì),开(kāi)源(yuán)模(mó)型(xíng)性(xìng)能(néng)突(tū)飞(fēi)猛(měng)进(jìn),部(bù)分(fēn)基(jī)准(zhǔn)测(cè)试(shì)中(zhōng)与(yǔ)闭(bì)源(yuán)模(mó)型(xíng)的(de)差(chà)距(jù)从(cóng)8%缩(suō)至(zhì)1.7%。 · 大(dà)模型使用成本持续走低,年降幅最高900倍 在MMLU基准测试中达到GPT-3.5水平(MMLU准确率64.8%)的AI模型调用成本,已从2022年11月的20美元/每百万token,骤降至2024年10月的0.07美元/每百万token(谷歌DeepMind的Gemini-1.5-Flash-8B模型),18个月内AI成本下降280倍。 视具体任务需求,LLM推理服务价格的年降幅可达9-900倍不等。 · 小模型性能显著提升,参数暴减142倍 2022年,在大规模多任务语言理解(MMLU)基准测试中,得分超60%的最小模型是 PaLM,参数量为5400亿。 到了2024年,微软Phi-3-mini仅用38亿参数,就取得了同样的实力。 这代表,两年多的时间里模型参数减少了142倍。 4. 科技巨头称霸AI前沿,但竞争白热化 2024年,近90%的重要模型源自企业,学术界则保持基础研究优势。 模型规模呈指数增长:训练算力每5个月翻番,数据集每8个月扩容一倍。 值得注意的是,头部模型性能差距显著缩小,榜首与第十名得分差已从11.9%降至5.4%。 5. AI逻辑短板,推理能力仍是瓶颈 采用符号推理方法的AI系统,能较好解决IMO问题(虽未达人类顶(dǐng)尖(jiān)水(shuǐ)平(píng)),但(dàn)LLM在(zài)MMMU等(děng)复(fù)杂(zá)推(tuī)理(lǐ)任(rèn)务(wu)中(zhōng)表(biǎo)现(xiàn)欠(qiàn)佳(jiā),尤(yóu)其(qí)不(bù)擅(shàn)长(zhǎng)算(suàn)术(shù)推(tuī)导(dǎo)和(hé)规(guī)划(huà)类(lèi)强(qiáng)逻(luó)辑(ji)性(xìng)任(rèn)务(wu)。 这(zhè)一(yī)局(jú)限(xiàn)影(yǐng)响(xiǎng)了(le)其(qí)在(zài)医(yī)疗(liáo)诊(zhěn)断(duàn)等(děng)高(gāo)风(fēng)险(xiǎn)场(chǎng)景(jǐng)的(de)应(yīng)用(yòng)可(kě)靠(kào)性(xìng)。 6. 大(dà)厂(chǎng)ALL in AI,投(tóu)资(zī)与(yǔ)采用(yòng)率(lǜ)创(chuàng)双(shuāng)纪(jì)录(lù) 科(kē)技(jì)大(dà)厂(chǎng)们(men),正(zhèng)全力(lì)押(yā)注(zhù)AI。 2024年(nián),美(měi)国(guó)私(sī)营(yíng)AI投(tóu)资(zī)达(dá)1091亿(yì)美(měi)元(yuán),约(yuē)为(wèi)中(zhōng)国(guó)(93亿(yì))的(de)12倍(bèi)、英(yīng)国(guó)(45亿(yì))的(de)24倍(bèi)。 生(shēng)成(chéng)式(shì)AI势(shì)头(tóu)尤(yóu)猛(měng),全球(qiú)私(sī)募(mù)投(tóu)资(zī)达(dá)339亿(yì)美(měi)元(yuán)(同(tóng)比(bǐ)增(zēng)18.7%)。 与(yǔ)此(cǐ)同(tóng)时(shí),企(qǐ)业(yè)AI采用(yòng)率(lǜ)从(cóng)55%升(shēng)至(zhì)78%。研(yán)究(jiū)证(zhèng)实(shí),AI不(bù)仅(jǐn)能(néng)提(tí)升(shēng)生(shēng)产(chǎn)力(lì),多(duō)数(shù)情(qíng)况(kuàng)下(xià)还(hái)可(kě)缩(suō)小(xiǎo)劳(láo)动(dòng)力(lì)技(jì)能(néng)差(chà)距(jù)。 更(gèng)引(yǐn)人(rén)注(zhù)目(mù)的(de)是(shì),将(jiāng)生(shēng)成(chéng)式(shì)AI应(yīng)用(yòng)于(yú)至(zhì)少(shǎo)一(yī)项(xiàng)业(yè)务(wu)职(zhí)能(néng)的(de)企(qǐ)业(yè)数(shù)量(liàng)激(jī)增(zēng)——从(cóng)2023年(nián)的(de)33%跃(yuè)升(shēng)至(zhì)去(qù)年(nián)的(de)71%,增(zēng)幅(fú)超(chāo)一(yī)倍(bèi)。 7. AI荣(róng)膺(yīng)科(kē)学(xué)界(jiè)最(zuì)高(gāo)荣(róng)誉(yù),摘(zhāi)诺(nuò)奖(jiǎng)桂(guì)冠(guān) 2024年(nián),两(liǎng)项(xiàng)诺(nuò)贝(bèi)尔(ěr)奖(jiǎng)分(fēn)别(bié)授(shòu)予(yǔ)深(shēn)度(dù)学(xué)习(xí)理(lǐ)论(lùn)基(jī)础(chǔ)(物(wù)理(lǐ)学(xué))和(hé)蛋(dàn)白(bái)质(zhì)折(zhé)叠(dié)预(yù)测(cè)(化(huà)学(xué))研(yán)究(jiū),图(tú)灵(líng)奖(jiǎng)则(zé)花(huā)落强化学习领域。 8. AI教育普及加速,但资源差距仍存 全球2/3国家已或计划开展K-12计算机科学教育,但非洲地区受限于电力等基础设施,推进缓慢。 美国81%的计算机教师认为AI应纳入基础课程,但仅47%具备相应教学能力。 9. AI正深度融入日常生活 从医疗到交通,AI正快速从实验室走向现实。 1995年,FDA批准了第一款AI赋能的医疗器械。 截至2024年8月,FDA已批准950款AI医疗设备——较2015年的6款和2023年的221款,增长迅猛。 而在自动驾驶领域,汽车已脱离实验阶段:美国头部运营商Waymo每周提供超15万次无人驾驶服务。 10. 全球AI乐观情绪上升,但地区差异显著 中国(83%)、印尼(80%)和泰国(77%)民众对AI持积极态度,而加拿大(40%)、美国(39%)等发达国家则相对保守。 值得关注的是,德国(+10%)、法国(+10%)等原怀疑论国家态度明显转变。 11. 负责任AI生(shēng)态发展不均 虽然AI安全事件激增,但主流模型开发商仍缺乏标准(zhǔn)化(huà)评(píng)估(gū)体(tǐ)系(xì)。 HELM Safety、AIR-Bench和(hé)FACTS等(děng)新(xīn)基(jī)准(zhǔn)为(wèi)事(shì)实(shí)性(xìng)与(yǔ)安(ān)全性(xìng)评(píng)估(gū)提(tí)供(gōng)工(gōng)具(jù)。 企(qǐ)业(yè)普(pǔ)遍(biàn)存(cún)在(zài)「认(rèn)知(zhī)与(yǔ)行(xíng)动(dòng)脱(tuō)节」,而各国政府加速协作:2024年,经合组织、欧盟等国(guó)际(jì)机构相继发布聚焦透明度、可信度的治理框架。 · 问题AI数量跃升 根据权威AI危害追踪数据库「AI事件库」(AI Incidents Database)统计,2024年全球AI相关危害事件激增至233起,创下历史新高,较2023年暴涨56.4%。 其中既包括深度伪造私密图像案件,也涉及聊天机器人疑似导致青少年自杀等恶性事件。 尽管该统计未能涵盖全部案例,但已清晰揭(jiē)示(shì)AI技(jì)术(shù)滥(làn)用(yòng)正(zhèng)在呈现惊人增长态势。 12. 全球监管力度持续加强 2024年美国联邦机构颁布59项AI法规,涉及部门数量翻倍。 75个国家立法机构提及AI频次同比增长21.3%,较2016年增长九倍。 投资方面:加拿大承诺24亿美元,中国设(shè)立(lì)475亿(yì)美元半导体基(jī)金(jīn),法(fǎ)国(guó)投(tóu)入(rù)1090亿(yì)欧(ōu)元(yuán),印(yìn)度(dù)拨(bō)款(kuǎn)12.5亿(yì)美(měi)元(yuán),沙(shā)特(tè)启(qǐ)动(dòng)千(qiān)亿(yì)美(měi)元(yuán)级(jí)的(de)「超(chāo)越(yuè)计(jì)划(huà)」。 详细亮点解读 下面,我们将摘出报告中的亮点内容,提供更详细的解读。 中美差距仅剩0.3% 翻开502页的报告,最吸睛的部分,莫过于中美AI差异这部分了。 报告中强调,虽然2024年,美国在顶尖AI模型的研发上依然领先,但中美模型之间的性能差距,正在迅速缩小! 为了衡量AI领域过去一年演变的全球格局,HAI特意用AI指数,列出了具有代表性的模型所属国家,美国依然居首。 数据显示,在2024年,美国机构以拥有40个知名模型领先,远远超过中国的15个和欧洲的3个。 总(zǒng)体(tǐ)来(lái)说(shuō),模(mó)型(xíng)发(fā)布(bù)总(zǒng)量(liàng)已(yǐ)经(jīng)下(xià)降(jiàng),可(kě)能(néng)是(shì)多(duō)个(gè)因(yīn)素(sù)共(gòng)同(tóng)导(dǎo)致(zhì)的(de),比(bǐ)如(rú)训(xun)练(liàn)规(guī)模(mó)日(rì)益(yì)庞(páng)大(dà)、AI技(jì)术(shù)日(rì)益(yì)复(fù)杂(zá),开(kāi)发(fā)新(xīn)模(mó)型(xíng)方(fāng)法(fǎ)的(de)难(nán)度(dù)也(yě)在(zài)增加。 AI模型已成为算力巨兽 · 参数趋势 简单的说,参数就是AI模型通过训练学到的一些数字,这些数字决定了模型如何理解输入和怎样输出。 AI的参数越多需要的训练数据也越多,但同时性能也更厉害。 从2010年代初开始,模型的参数量就蹭蹭往上涨,这背后是因为模型设计得越来越复杂、数据更容易获取、硬件算力也更强了。 更重要的是,大模型确实效果好。 下图用了对数刻度,方便大家看清楚AI模型参数和算力近年来的爆炸式增长。 随(suí)着(zhe)模(mó)型(xíng)参(cān)数(shù)数(shù)量(liàng)的(de)增(zēng)加(jiā),训(xun)练(liàn)所需的数(shù)据(jù)量(liàng)也(yě)在(zài)暴(bào)涨(zhǎng)。 2017年(nián)发(fā)布(bù)的(de)Transformer模(mó)型(xíng),掀(xiān)起(qǐ)了(le)大(dà)型(xíng)语(yǔ)言(yán)模(mó)型(xíng)的(de)热(rè)潮(cháo),当(dāng)时(shí)它(tā)用(yòng)了(le)大(dà)约(yuē)20亿(yì)个(gè)token来(lái)训(xun)练(liàn)。 到(dào)了(le)2020年(nián),GPT-3 175B模(mó)型(xíng)的训练数据已经飙到了约3740亿个token。 而Meta在2024年夏天发布的模型Llama 3.3,更是用了大约15万亿个token来训练。 根据Epoch AI的数据,大型语言模型的训练数据集规模大约每八(bā)个(gè)月(yuè)翻(fān)一(yī)倍(bèi)。 训练数据集越来越大,导致的训练时间也变得越来越长。 像Llama 3.1-405B这样的模型,训练大概需要90天,这在如今已经算是「正常」的了。 谷歌在2023年底发布的Gemini 1.0 Ultra,训练(liàn)时(shí)间(jiān)大(dà)约(yuē)是(shì)100天(tiān)。 相(xiāng)比(bǐ)之(zhī)下(xià),2012年(nián)的(de)AlexNet就(jiù)显(xiǎn)得(de)快(kuài)多(duō)了,训练只花了五六天,而且AlexNet当时用的硬件还远没有现在的先进。 · 算力趋势 「算力」指的是训练和运行(xíng)AI模(mó)型(xíng)所(suǒ)需的计算资源。 最近,知名AI模型的算力消耗呈指数级增长。据Epoch AI估计,知名AI模型的训练算力大约每五个月翻一番。 这种趋势在过去五年尤为(wèi)明(míng)显(xiǎn)。 去年12月,DeepSeek V3一经推出就引发了广泛关注,主要就是因为它在性能上极其出色,但用的计算资源却比许多顶尖大型语(yǔ)言(yán)模(mó)型(xíng)少(shǎo)得(de)多(duō)。 下(xià)图(tú)1.3.17比(bǐ)较(jiào)了(le)中(zhōng)国(guó)和(hé)美(měi)国(guó)知(zhī)名AI模型的训练算力,揭示了一个重要趋势:美国的顶级AI模型通常比中国模型需要多得多的计算资源。 · 推理成本 推理成本,指的是对一个已训练模型进行查询所需的费用,通常以「每百万tokens的美元价格」来衡量。 这份报告中AI token的价格数据,来源于Artificial Analysis和Epoch AI的API定价专有数据库,而价格是根据输入与输出token的价格按3:1的权重平均计算得出的。 可以看出,单位性能的AI成本正在显著下降。 而Epoch AI估计,根据不同任务类型,大型语言模型的推理成本每年下降幅度可达9倍至900倍不等。 虽然如此,想要获得来自OpenAI、Meta和Anthropic的模型,仍需支付不小的溢价。 · 训练成本 虽然很少有AI公司披露具体的训练成本,但这个数字普遍已达到数百位美元。 OpenAI CEO奥特曼曾表示,训练GPT-4的训练成本超过了1亿美元。 Anthropic的CEO Dario Amodei指出,目前正在训练的模型,成本约为10亿美元。 DeepSeek-V3的600万美元,则打破了新低。 图1.3.24展示了基于云计算租赁价格的部分AI模型的训练成本估算。 图1.3.25展示了AI指数所估算的所有AI模型的训练成本。 在2024年,Epoch能估算的少数模型之一,就是Llama 3.1-405B,训练成本约为1.7亿美元。 另外,AI模型的训练成本与其计算需求之间存在直接的关联。如图1.3.26所示,计算需求更大的模型训练成本显著更高。 参考资料:YZNH https://www.nature.com/articles/d41586-025-01033-y https://hai.stanford.edu/ai-index/2025-ai-index-report https://hai.stanford.edu/news/ai-index-2025-state-of-ai-in-10-charts 原(yuán)标(biāo)题(tí):《斯(sī)坦(tǎn)福(fú)2025 AI指(zhǐ)数(shù)出(chū)炉(lú)!中(zhōng)美(měi)AI终(zhōng)极(jí)对(duì)决(jué)差距仅剩0.3%,DeepSeek领(lǐng)衔(xián)》






























