大数跨境

DeepSeek引爆热潮,数据要素市场迎来价值化新机遇

DeepSeek引爆热潮,数据要素市场迎来价值化新机遇 前海数据服务中心
2025-02-21
0

1 月 20 日,中国 AI 初创企业深度求索(DeepSeek) 发布的开源模型 DeepSeek - R1 横空出世,以破圈之势迅速引发各界关注。它以强推理能力和低训练成本脱颖而出,更在开源策略下,为数据要素市场带来了新的发展机遇。

1月20日,中国AI初创企业深度求索(DeepSeek)发布开源模型DeepSeek-R1,其以强推理能力、低训练成本的特点区别于过往的AI模型,一经发布就以破圈之势引发各界广泛关注。
DeepSeek-R1在数学、代码、自然语言推理等任务上,测评性能与美国开放人工智能研究中心(OpenAI)开发的GPT-o1模型正式版接近。
在高性价比API服务和模型开源的策略下,DeepSeek-R1有望带动全行业持续降本,助力一大批大模型和AI应用的涌现与繁荣,从而催生对高质量数据集的旺盛需求,驱动数据标注产业升级发展,为数据要素市场化价值化带来新机遇。

高质量数据集是AI大模型创新涌现的关键“燃料”


数据、算法和算力被视为AI大模型的核心三元素。其中,训练数据对大模型发展的重要性不容忽视,尤其是在深度学习和自然语言处理领域,大模型依赖大量的训练数据来理解语言、完成推理,并生成有意义的回答。


DeepSeek-R1的出现,体现出我国在AI大模型技术方面的强大创新力和竞争力,同时,我国算力规模位居全球第二,为AI产业发展提供有力支撑。在此背景下,高质量训练数据将成为AI大模型发展的核心驱动力,也是其面临的重要挑战。


作为AI技术发展的基石与燃料,训练数据的规模与质量直接决定大模型的性能。当前,业界普遍认为,长文本、跨语言、多任务和生成式是大模型未来发展的主要方向,这对训练数据的规模、质量和多样性提出更高要求,具体而言:


  • 第一,训练数据规模越大,模型能捕捉和学习的语言模式和语义结构更多,进而提高其理解能力和生成能力。


  • 第二,当训练数据中包含大量错误或不准确信息,模型会学习到这些错误模式并在推理时产生错误输出,降低模型的准确性。即使拥有强大计算资源和先进技术架构,如果训练数据质量不高,模型的性能也会受到显著制约。

  • 第三,训练数据在语言、模态、情景、文化等方面的多样性,对模型的准确性、灵活性和公平性产生直接影响,进而影响模型应用的深度与广度。


随着AI大模型落地数量的不断增加,我国在训练数据集建设方面取得一定成绩,同时面临整体规模小、丰富度不足等实际挑战。


一方面,尽管国内已有较为成熟的大模型训练数据集,例如WuDaoCorpora、CLUECorpus,但中文训练数据集建设“先天根基薄弱”。根据阿里研究院《大模型训练数据白皮书》,互联网上的中文内容仅占1.3%,中文训练数据的整体匮乏正在制约我国大模型本土化发展与性能飞跃。


另一方面,我国AI训练数据以通用单语为主,高质量垂直领域的数据集相对短缺,而这往往是训练提升模型精准性和专业性的关键。尤其对于医疗诊断、金融服务、自动驾驶、智能客服等特定应用场景而言,开发训练数据集需要更深入的专业知识和细粒度的理解。


数据标注是自然语言处理的关键过程,包括对数据进行筛选、清洗、分类、注释、标记和质量检验等加工处理环节,在很大程度上决定训练数据质量。我国数据标注产业呈持续增长态势,据统计,2023年中国数据标注年行业市场规模达到69.72亿元,同比增长25.8%。


同时,我国标注产业还存在流程规范性不强、行业人才缺口大、无法满足特定场景大模型需求等问题。根据《中国AIGC数据标注产业全景报告》,数据标注行业从劳动密集型向知识密集型转变,未来5年人才缺口将或达百万。据此,培育壮大数据标注产业对于提升训练数据供给质量,进而推动AI创新发展具有重要支撑作用。

DeepSeek构建的开源生态将成为激发数据要素市场价值化的新引擎


数据作为数字经济时代的核心生产要素,其价值释放依赖于技术创新与生态协同。DeepSeek通过构建开源生态,不仅加速实现AI技术与应用的普惠化,更在高质量数据集需求和数据标注产业升级等方面形成共振效应,为数据要素的价值释放和数据产业的高质量发展注入新动能。


一方面,以技术开源催生高质量数据集需求,驱动数据要素价值发现。DeepSeek开源的大模型及工具链有望显著降低大模型产业整体成本及AI应用门槛,推动行业从“模型能力验证”向“场景价值深挖”转变,对高质量数据集需求将爆发式增长。


为增加高质量数据集供给:


  • 第一,加快公共数据资源开发利用,提高高质量公共数据资源供给规模,降低公共数据资源使用成本;


  • 第二,培育和发展一批大模型训练数据的开发及经营主体,在科研、制造、农业、能源、交通、金融、通信、广电、医疗、教育、商贸流通、文化旅游等重点行业领域,围绕具身智能、低空经济、医疗健康、无人驾驶等场景,开发高质量数据集;


  • 第三,推动数据交易场所与大模型企业等相关主体共建可信数据空间,实现训练数据安全有序高效流通,并布局引进境外优质训练数据;


  • 第四,发挥行业协会、产业联盟等组织机制作用,推动建立大模型训练数据开放社区,支持开源数据集建设。


另一方面,以需求牵引数据标注产业升级,构筑数据产业高质量发展新格局。对高质量数据集的迫切需要意味着数据标注的质量与效率应当迈向新的台阶,具体而言:


  • 第一,开展标注领域关键技术攻关,加强自动化、智能化标注工具研发,引导数据标注从劳动力密集型向知识密集型转变,提升数据标注的效率和质量。


  • 第二,以大模型需求为牵引,尤其针对特定场景的垂类模型,提高数据标注服务能力。


  • 第三,制定数据标注技术、质量、能力等标准,通过提高数据标注产业规范化水平实现数据集高质量供给。


综上,DeepSeek带来的AI技术革新及其构建的开源生态,本质上形成了数据要素价值创造的正向循环——在以技术创新激活数据需求的同时,以标注升级优化数据供给,这将成为驱动生产要素向新质生产力转化的新引擎。


来源:上海数据交易所研究院高级研究员牟冰清、数据要素社


● 数说新语 | 广深企业融资规模被杭州赶超

● 企业动态 | 国际数据产业联盟在香港正式成立!

● 数据分享丨10组数据 看春节假期消费新亮点


【声明】内容源于网络
0
0
前海数据服务中心
1234
内容 276
粉丝 0
前海数据服务中心 1234
总阅读2
粉丝0
内容276