【导语】在人工智能竞争日益激烈的当下,数据已成为推动其发展的关键燃料和动力。然而,数据挑战也随之而来,包括训练数据枯竭、质量不一、隐私安(ān)全等(děng)问(wèn)题(tí)。在(zài)第(dì)三(sān)届(jiè)数(shù)字(zì)化(huà)发(fā)展(zhǎn)大(dà)会(huì)暨(jì)数(shù)字(zì)经(jīng)济(jì)高(gāo)峰论坛上,中国计算机学会数据发展委员会主任陆志鹏揭示了当前人工智能面临的数据困境,并提出了基于数据元件的数据治理新方案。他指出,高质量数据集对模型训练至关重要,但构建过程复杂且缺乏统一标准。数据元件作为数据的初级产品,不仅解决了数据确权、安全等核心问题,还促进了数据的流通(tōng)和(hé)应(yīng)用(yòng)。陆(lù)志鹏的团队通过一系列业务逻辑梳理,形成了一体机解决方案,打破了数据孤岛,为企业数字化转型提供了有力支持。 数据是人工智能的燃料和动力,人工智能竞争在某种意义上进入了“数据决胜”阶段,谁拥有数据谁就占领高地。但当前人工智能发展面临数据挑战,如训练数据枯竭、质量参差不齐、隐私安全难保障、数据确权和计量难等问题。在4月17日举行的第三届数字化发展大会暨数字经济高峰论坛上,CCF(中国计算机学会)数据发展委员会主任陆志鹏对外介绍了其所在团队正在开发的新的数据解决方案,即基于数据元件的数据治理方式。 中国计算机学会数据发展委员会主任陆志鹏。 陆志鹏称,今年DeepSeek爆火,让模型平权,人工智能走进企业、走向社会。市场上推出了一批DeepSeek一体机,一些企业以为把DeepSeek模型部署到服务器上就是一体机,就可以开箱即用,结果客户采购后发现并没有达到说明书上的效果,从而引起法律纠纷。 如何部署有价值的大模型?其中数据起着重要作用。高质量数据集是人工智能模型训练的关键支撑,但构建过程复杂。目前很多数据集的构建集中在大模型公司,而大模型公司往往基于自己的大模型构建数据集,导致数据集通用性不足,不同数据集之间的架构和标准也不同,构建高质量数据集缺乏统一衡量标准。领域数据集生成涉及的数据海量且庞杂,需要高效的数据存储解决方案和强大的计算资源来支撑数据的存储、治理和生成。 目前随着数据的重要性被强调,数据共享反而出现了倒退。2024年,用于模型训练的数据中,60%是合成数据,数据质量影响大模型开发效率,因此要确保合成数据的可靠性、安全性、精确性。 如何解决数据难题?陆志鹏谈到了基于数据元件的数据治理方式。“数据元件”是通过对数据脱敏处理后,根据需要由若干相关字段形成的数据集或由数据的关联字段通过建模形成的数据特征。数据元件同隐私计算、区块链、数联网、数据空间等被确立为国家数据基础建设的主要技术路线。陆志鹏表示,数据元件不是原始数据,而是数据的初级产品,具有安全属性、价值属性、品质属性,可解决数据确权、估值、定价、安全、隐私问题,及数据质量和处理效率问题。数据元件在实现数据风险隔离和安全管控的同时,提升数据价值密度,实现数据资产的产品化流通和规模化应用。 陆志鹏表示,其所在的团队通过梳理包括场景需(xū)求(qiú)分(fēn)析(xī)和(hé)数(shù)据(jù)资(zī)源(yuán)调(diào)查(chá)、数(shù)据(jù)归(guī)集和(hé)治(zhì)理(lǐ)、领(lǐng)域高(gāo)质(zhì)量(liàng)数(shù)据(jù)集构(gòu)建(jiàn)、领(lǐng)域知(zhī)识(shi)库(kù)构(gòu)建(jiàn)、模(mó)型(xíng)微(wēi)调(diào)和(hé)训(xun)练(liàn)、模(mó)型(xíng)应(yīng)用(yòng)等(děng)六(liù)大(dà)高(gāo)质(zhì)量(liàng)数(shù)据(jù)构(gòu)建(jiàn)的(de)业(yè)务(wu)逻(luó)辑(ji),最(zuì)终(zhōng)形(xíng)成(chéng)一(yī)体(tǐ)机(jī)解(jiě)决(jué)方(fāng)案(àn),落(luò)地(de)经(jīng)过(guò)部(bù)署(shǔ)和(hé)场(chǎng)景(jǐng)化微调,模型答题逻辑和流畅性提升。此外,基于数据元件的数据治理打消了企业部门间不愿共享数据的顾虑,打破了数据孤岛,支持企业数字化转型。