IDC发布的《中国AI训练数据集市场研究报告》显示,2025年中国AI训练数据集市场规模达到65.6亿元人民币,同比增长41.8%。预计到2027年,市场规模将突破150亿元。
报告指出,大模型技术的快速迭代是推动数据市场增长的核心动力。以GPT系列、LLaMA系列、文心一言、通义千问为代表的大模型,参数量从数十亿增长到数千亿甚至万亿级别,对训练数据的需求量也呈指数级增长。
**外部采购比例已超35%**。IDC调研显示,头部大模型企业中,外部采购的训练数据占总数据量的比例已经超过35%。企业自身生产的数据主要集中在特定领域(如搜索、电商、社交),而通用知识、多语言、多模态等数据仍然严重依赖外部供应商。
**高质量数据成为核心竞争点**。业内共识是:「垃圾进,垃圾出」(Garbage In, Garbage Out)。低质量、重复、有偏见的数据不仅浪费算力,还会导致模型性能下降。IDC数据显示,高质量数据集的溢价可达普通数据集的3-5倍,且供不应求。
**多模态数据增速最快**。随着多模态大模型的兴起,图文对、视频-文本、音频-文本等多模态训练数据的需求增速远高于单一模态。2025年多模态训练数据市场增速达63.5%,是增长最快的细分领域。
**合规化日益重要**。随着《生成式人工智能服务管理暂行办法》《数据安全法》《个人信息保护法》等法规的落地,数据合规已经成为AI企业的生命线。IDC指出,具备合规资质、能够提供数据来源证明和合规审核服务的供应商,将在未来竞争中占据优势。
