·研究人员发现,在生物医疗领域,尽管“定制版”垂类模型应用对于医学自然语言处理上仍有优势,但涉及复杂的推理,尤其是医学问答方面,闭源通用大模型GPT-4则更有明显优势。 记者 蒋立冬 AI创意 大模型在生物医疗领域的应用情况如何?哪种模型更加适用?4月6日,《自然·通(tōng)讯(xùn)》(Nature Communications)杂志刊登了一项由耶鲁大学医学院的研究人员对大语言模型(LLMs)在生物医学自然语言处理(BioNLP)中的全面评估与应用指南(《Benchmarking large language models for biomedical natural language processing applications and recommendations》,以下简称“指南”)。在该份指南中,研究人员选择了12个来自 BioNLP 不同应用领域的数据集,评估了四种具有代表性的大模型GPT-3.5、GPT-4、LLaMA 2 和 PMC LLaMA在零样本、少样本和微调设置下的性能。 生物医学自然语言处理(BioNLP)技术是一种将自然语言处理技术应用于生物医学领域的交叉学科技术,核心是从大量的生物医学文本比如医学论文、电子病历、基因数据库等中自动提取有用的信息。 研究人员发现,在生物医疗领域,仅靠持续扩充预训练数据并不能显著提升开源生物医学大语言模型的整体表现,针对具体医学任务的微调才是关键。比如生物医学领域特定大模型的代表PMC -LLaMA,使用了32个A100 GPU对模型进行预训练,但最终评估并未发现该模型的性能有显著提升。PMC -LLaMA是(shì)由(yóu)上海交通大学长聘轨副教授谢伟迪研究团队于2023年4月研发的垂类模型,基座模型使用的是LLaMA 2;研究人员发现,直接微调LLaMA 2可以获得更好或至少相似的性能。通过微调,模型可以针对性地学习医学领域的专业知识和复杂推理要求,从而在信息抽取、医学问答等任务上实现显著性能提升。 研究人员建议,未来在生物医疗应用中,应更多关注如何优化微调策略,以弥补预训练在处理专业医学文本时的不足。“需要一种(zhǒng)更(gèng)有(yǒu)效(xiào)、更(gèng)可(kě)持(chí)续(xù)的(de)方(fāng)法(fǎ)来(lái)开(kāi)发(fā)特(tè)定(dìng)于(yú)生(shēng)物(wù)医(yī)学(xué)领(lǐng)域的(de)大(dà)语(yǔ)言(yán)模(mó)型(xíng)。”研(yán)究(jiū)人(rén)员(yuán)称(chēng)。 相(xiāng)较(jiào)于(yú)通(tōng)用(yòng)大(dà)模(mó)型(xíng),针(zhēn)对(duì)生(shēng)物(wù)医(yī)疗(liáo)领(lǐng)域里(lǐ)的(de)“定(dìng)制(zhì)版(bǎn)”模(mó)型(xíng)BioBERT和(hé)PubMedBERT(注(zhù)释(shì):Bert是(shì)一(yī)款(kuǎn)由(yóu)谷(gǔ)歌(gē)开(kāi)发(fā)的(de)预(yù)训(xun)练(liàn)语(yǔ)言(yán)模(mó)型(xíng)),在(zài)医(yī)学(xué)自(zì)然(rán)语(yǔ)言(yán)处(chù)理(lǐ)表(biǎo)现(xiàn)更(gèng)出(chū)色(sè)。由(yóu)于(yú)经(jīng)过(guò)专(zhuān)业(yè)的(de)医(yī)学(xué)数(shù)据(jù)训(xun)练(liàn),BioBERT和(hé)PubMedBERT这(zhè)类(lèi)“定(dìng)制(zhì)版(bǎn)”模(mó)型(xíng)能(néng)够(gòu)更(gèng)精(jīng)准(zhǔn)地(de)识(shi)别(bié)疾(jí)病(bìng)名称(chēng)、基(jī)因(yīn)、化(huà)学(xué)物(wù)质(zhì)以(yǐ)及(jí)理(lǐ)解(jiě)医(yī)学(xué)术(shù)语(yǔ),这(zhè)一(yī)点(diǎn)表(biǎo)现(xiàn)比(bǐ)GPT-3.5和(hé)GPT-4为(wèi)代(dài)表(biǎo)的(de)通(tōng)用(yòng)大(dà)型(xíng)语(yǔ)言(yán)模(mó)型(xíng)更(gèng)好(hǎo)。但(dàn)涉(shè)及(jí)较(jiào)为(wèi)复(fù)杂(zá)的(de)推(tuī)理(lǐ)任(rèn)务(wu),尤(yóu)其(qí)是(shì)医(yī)学(xué)问(wèn)答(dá)方(fāng)面(miàn),GPT-4则(zé)更(gèng)有(yǒu)明(míng)显(xiǎn)优(yōu)势(shì),能(néng)够(gòu)“看(kàn)懂(dǒng)并(bìng)能(néng)思(sī)考(kǎo)”,生(shēng)成(chéng)更(gèng)合(hé)理(lǐ)以(yǐ)及(jí)准(zhǔn)确(què)的(de)回(huí)应(yīng)。 对(duì)于(yú)生(shēng)物(wù)医(yī)药(yào)行(xíng)业(yè)普(pǔ)遍关心的大模型幻觉问题,此次研究结果表明,GPT-4在两个数据集上几乎没有出现幻觉问题。在零样本条件下,通用开源模型LLaMA 2则更容易出现幻觉问题,比如输出时常常出现信息不完整、格式不一致或提示无关内容的情况,它产生的幻觉案例约占测试样本的32%,比例远超GPT-3.5和GPT-4。 尽管GPT-4在众多评估任务中表现优异,但研究人员指出,其调用成本相当于GPT-3.5的60至100倍。对于预算有限的实际应用场景,医学机构可能会倾向于选用成本较低且效果可接受的GPT-3.5;而(ér)对(duì)于(yú)准(zhǔn)确(què)性(xìng)要(yào)求(qiú)极(jí)高(gāo)、尤(yóu)其是医学问答这类依赖复杂推理的任务中,GPT-4可能会是更理想(xiǎng)的选择。