首页
产品服务
智能全文检索引擎
数据挖掘引擎
文字识别系统
智能文档审阅系统
语言处理应用技术
解决方案
按行业
按场景
新闻动态
了解
伙伴
关于我们
联系我们
加入

新闻动态

新闻动态
您的当前位置:首页 • 新闻动态
最新大模型被质疑训练“刷分”,Meta承认有漏洞但否认作弊
时间:2025-04-08 17:02:03 浏览:498

科技巨头Meta回应了对公司最新开源AI(人工智能)模型Llama 4的质疑,否认该模型在训练集中作弊“刷分”。

当地时间4月7日,Meta的生成式AI负责人Ahmad Al-Dahle在社交平台上发布了一篇长文,回应了对于Llama 4的质疑。Ahmad表示,由于Llama 4刚开发完就迅速发布,所以模型“在不同服务中表现出了参差不齐的质量”,公司会尽快修复漏洞。同时,Ahmad否认了Llama 4在训练集中作弊“刷分”的说法。

两天前,4月5日,Meta推出了旗下最受欢迎的模型系列Llama的最新一代模型,包括较小模型Scout和标准模型Maverick这两个版本。此外,Meta还展示了被称为“迄今最强大、最智能”的模型Llama 4 Behemoth的预览。

据介绍,Llama 4模型是Llama系列模型中首批采用混合专家(MoE)架构的模型,在多模态性能上表现出众。其中,最先进的Llama 4 Behemoth的总参数高达2万亿,担当了其他模型的“老师”;Scout和Maverick的活跃参数量为170亿,Scout主要面向文档摘要与大型代码库推理任务,Maverick则专注于多模态能力。

Meta一次性介绍三款Llama 4模型。来源:Meta

作为原生多模态(tài)模(mó)型(xíng),Llama 4采用(yòng)了(le)早(zǎo)期(qī)融(róng)合(hé)(Early Fusion)的(de)技(jì)术(shù),通(tōng)过(guò)使(shǐ)用(yòng)大(dà)量(liàng)无(wú)标(biāo)签(qiān)文本(běn)、图(tú)片(piàn)和(hé)视(shì)频(pín)数(shù)据(jù)一(yī)起(qǐ)来(lái)预(yù)训(xun)练(liàn)模(mó)型(xíng),将(jiāng)文本(běn)和(hé)视(shì)觉(jué)token无(wú)缝(fèng)整(zhěng)合(hé)到(dào)统(tǒng)一(yī)的(de)模(mó)型(xíng)框(kuāng)架(jià)中(zhōng)。此(cǐ)外(wài),Llama 4在(zài)长(zhǎng)文本(běn)能(néng)力(lì)上(shàng)也(yě)取(qǔ)得(de)了(le)突(tū)破(pò),Scout模(mó)型(xíng)支(zhī)持(chí)高(gāo)达(dá)1000万(wàn)token的(de)上(shàng)下(xià)文窗(chuāng)口(kǒu),Maverick模(mó)型(xíng)则(zé)支(zhī)持(chí)100万(wàn)token的(de)上(shàng)下(xià)文窗(chuāng)口(kǒu)。

不(bù)过(guò),Llama 4一(yī)经(jīng)发(fā)布(bù)就(jiù)遭(zāo)到(dào)了(le)质(zhì)疑(yí)。Meta的(de)发(fā)布(bù)界(jiè)面(miàn)显(xiǎn)示(shì),在(zài)评(píng)估(gū)代(dài)码(mǎ)能(néng)力(lì)的(de)LiveCodeBench测(cè)试(shì)集和(hé)大(dà)模(mó)型(xíng)竞(jìng)技(jì)场(chǎng)(Chatbot Arena)中(zhōng),Scout和(hé)Maverick都(dōu)表(biǎo)现(xiàn)得(de)很(hěn)不(bù)错(cuò)。但(dàn)许(xǔ)多(duō)开(kāi)发(fā)者(zhě)发(fā)现(xiàn),这(zhè)些(xiē)模(mó)型(xíng)在(zài)小(xiǎo)型(xíng)基(jī)准(zhǔn)测(cè)试(shì)中(zhōng)的(de)表(biǎo)现(xiàn)令(lìng)人(rén)失(shī)望(wàng)。

例(lì)如(rú),有(yǒu)网(wǎng)友(you)指(zhǐ)出(chū),在(zài)一(yī)项(xiàng)让(ràng)模(mó)型(xíng)完(wán)成(chéng)225项(xiàng)编(biān)程(chéng)任(rèn)务(wu)的(de)名为(wèi)aider polyglot的(de)基(jī)准(zhǔn)测(cè)试(shì)中(zhōng),Llama 4 Maverick只(zhǐ)取(qǔ)得了16%的成绩,远低于Gemini 2.5 Pro、Claude 3.7 Sonnet和DeepSeek -V3等规模(mó)相(xiāng)近(jìn)的(de)旧(jiù)模(mó)型(xíng)。

Llama 4 Maverick在小型测试集上成绩不如人意。来源:X平台

AI工程师和技术作家Andriy Burkov则在社交平台X上指出,Meta称Llama 4 Scout拥有1000万token的上下文窗口,而这其实是一个“伪命题”:“实际上,不会有任何模型针对超过256000个token的提示词进行训练。如果你向它发送这么多token,在大多数时候只会得到低质量的输出。”

对于Llama 4令人失望的表现,一些开发者开始怀疑,为了在测试集中取得更好的成(chéng)绩(jī),Meta为(wèi)这(zhè)些(xiē)测(cè)试(shì)集制(zhì)作(zuò)了“特供版”Llama 4。例如,前Meta研究员、现任AI2(艾伦人工智能研究所)的高级研究员Nathan Lambert在经过比较测试后指出,在大模型竞技场中取得成绩的Llama 4 Maverick与该公司公开发布的版本不同,前者是“在对话性上进行了优化”的版本。

此外,就在Llama 4发(fā)布的前几天,在Meta工作了8年的AI研究主管Joelle Pineau宣布离职。联系到Llama 4的表现,更加深了网友对于Llama 4“暗(àn)箱(xiāng)操(cāo)作(zuò)”的质疑。而在国内社交平台上,也有自称为Meta内部员工的网友称“Llama 4的训练存在严重问题”,自己已经(jīng)向(xiàng)公(gōng)司(sī)提交了离职申请,AI研究主管的离任也是出于同种原因。

这位网友表示:“经过反复训练,其实内部模型的表现依然未能达到开源SOTA(指在研究任务中表现最好的模型),甚至与之(zhī)相(xiāng)差(chà)甚(shén)远(yuǎn)。公(gōng)司(sī)领(lǐng)导(dǎo)层(céng)建(jiàn)议(yì)将(jiāng)各(gè)个(gè)benchmark(基(jī)准(zhǔn))的(de)测(cè)试(shì)集混(hùn)合(hé)在(zài)post-training(后(hòu)训(xun)练(liàn))过(guò)程(chéng)中(zhōng),目(mù)的(de)是(shì)希(xī)望(wàng)能(néng)够(gòu)在(zài)各(gè)项(xiàng)指标上交差,拿出一个‘看起来可以’的结果。”

可以肯定的是,Llama 4的初始发布并没有给AI社区带来巨大的积极反响。目前,面对进步迅速的中国AI模型,Meta急于稳住Llama系列在开源领域的领先地位。今年2月,阿里通义千问(Qwen)系列模型的下载量已经达到了(le)1.8亿(yì),累(lèi)计(jì)衍(yǎn)生(shēng)模(mó)型(xíng)总(zǒng)数(shù)达(dá)到(dào)9万(wàn)个(gè),衍(yǎn)生(shēng)模(mó)型(xíng)数(shù)超(chāo)越(yuè)Meta的(de)Llama系(xì)列(liè),成(chéng)为(wèi)了(le)全球(qiú)第(dì)一(yī)大(dà)开(kāi)源(yuán)模(mó)型(xíng)系(xì)列(liè)。

7日(rì)当(dāng)天(tiān),Meta(Nasdaq:META)股(gǔ)价(jià)涨(zhǎng)2.28%,收(shōu)于(yú)每(měi)股(gǔ)516.25美(měi)元(yuán),总(zǒng)市(shì)值(zhí)1.31万亿美元。

现在注册,即可免费试用
申请试用