构筑人工智能高质量数据供给体系
人工智能作为引领新一轮科技革命和产业变革的核心引擎,正深刻重塑人类的生产与生活。“十五五”时期是AI技术加速突破与普及的关键窗口期。在此进程中,数据要素的地位愈发关键,既是决定模型性能上限的核心,也是应用成败的决定性变量。构建面向AI的高质量数据供给体系,是推动我国AI跨越式发展及“人工智能+”行动落地的关键举措,对加速产业智能化升级和新型工业化进程具有重大意义。
当前AI技术的爆发式增长对数据要素提出了全新要求。我国AI产业取得显著成绩,数据支撑功不可没。据国家数据局统计,截至2026年3月,日均词元调用量突破140万亿,较2024年初激增逾千倍。《全国数据资源调查报告(2025年)》显示,2025年我国年度数据生产总量达52.26泽字节,同比增长27.28%,占全球总量的27.44%,持续保持领先。其中,用于AI训练和推理的数据总量达199.48艾字节,同比增长42.86%;推理数据量首次超越训练数据,标志着AI应用正加速从模型训练向规模化落地转型。截至2026年3月,全国建成的高质量数据集超11.6万个、规模逾960拍字节,为AI突破性发展提供了坚实底座。随着AI迈向通用智能新阶段,数据需求将不断升级。
模型迭代亟需实现“数据+场景”的深度融合。近年来,基础模型能力突飞猛进,多模态理解与复杂推理能力增强,智能体成为主流应用形态,推动生成式AI向现实生产力转化。前沿模型在复杂任务处理上已逼近甚至局部超越人类专家水平,应用重心正从“生成内容”转向“执行任务”。然而,单纯依赖互联网公开语料的路径难以为继,“数据墙”问题凸显,单纯依靠数据规模扩张的边际效益递减,通用数据已难以支撑模型代际突破。与此同时,AI应用落地需深度绑定垂直场景,场景既是技术转化的载体,也是高质量垂直数据的源头。数据供需矛盾已从“量不足”转向“体系支撑缺失”。因此,需着眼长远,构建自动化、标准化的数据工程体系,提升数据自我造血能力。建立数据与场景的双向赋能机制,形成“场景沉淀数据、数据优化模型、模型赋能场景”的正向循环,为AI持续演进提供关键支撑。
模型训练重心的转移要求更加聚焦动态交互行为。大模型初期依赖互联网公开“静态语料”,但随着训练重心从通用预训练向强化学习转变,静态语料已无法满足智能体自主决策与闭环执行的高阶需求,数据需求结构随之发生重大变革。需推动数据需求向动态行为数据与交互流数据倾斜,涵盖智能体调用API工具、规划执行路径、试错修正及反馈流数据等更丰富的现实世界数据。特别是高质量的动态交互样本与人类对齐反馈数据,正成为突破智能体自主性不足、运行可靠性偏弱瓶颈的关键要素。
通用智能演进需进一步拓展物理空间数据。具身智能与世界模型是通往通用人工智能的必经之路。世界模型承担物理世界规律建模与决策推演的“认知大脑”功能,具身智能则是与真实环境交互的“行动载体”,二者深度耦合推动AI从被动感知向主动具身交互、自主决策演进。当前,具身智能与世界模型尚未迎来类似大语言模型的“GPT时刻”,核心瓶颈在于物理世界高质量交互数据积累未达能力涌现阈值。据测算,支撑通用大模型跃升的训练语料达万亿词元级,而全球可用于具身智能训练的高质量真机交互数据集多在百万级轨迹规模,两者在体量和丰富度上存在数量级差距。具身智能与世界模型的进一步发展,对数据供给的范畴、形态、结构与质量提出更高要求:数据范畴从数字空间的静态内容向物理世界的多模态交互、连续运动控制、环境因果规律数据延伸;数据形态从离散单模态样本转向“感知—决策—执行—反馈”全链路闭环时序数据;且需兼顾场景丰富度、物理真实性与因果逻辑性。
面对AI发展对数据要素提出的新需求,应以“人工智能+”行动为牵引,以模数共振为路径,统筹推进数据扩容提质、流通共享、治理赋能和机制创新,加快构建系统完备、安全可控、充分激活的高质量数据供给体系。
扩充数据资源供给,筑牢要素支撑底座。紧扣大模型能力跃升、智能体落地、具身智能攻关的核心需求,聚焦科研、制造、医疗、交通等主战场及低空经济、生物制造等新兴未来产业,针对性布局多类型数据集。围绕智能体自主决策,积累任务规划、工具调用、多轮交互等决策轨迹数据;围绕具身智能,搭建机器人操作、多模态感知、人机协同等真机数据集;围绕世界模型训练,探索数字环境交互与仿真生成数据体系。发挥行业龙头与科研机构作用,形成多主体参与的数据供给格局。利用合成数据弥补物理场景短板,通过仿真引擎生成符合物理规律的三维交互数据,填补高危、小众场景缺口;建立覆盖生成、标注、入库全流程的质量评估机制,打通数据闭环。
升级数据加工能力,培育专业服务体系。数据工程体系是破解作坊式治理、实现数据自主供给的根本抓手。需适配大模型、具身智能等高标准需求,顺应数据标注从劳动密集型向知识、技术密集型转型,发展大模型驱动的人机协同加工模式,推广智能标注、自动质检等新技术。面向医疗、工业、法律等专业领域,培育兼具行业认知与技术能力的数据服务机构,推动数据加工向知识提炼、逻辑组织升级,完善人才培养体系。同步推动标注范式向三维空间、多模态时序升级,拓展点云、关节位姿、动作序列等标注维度,做好时空对齐,采用仿真预标注加人工精细化校验模式提升精度。构建标准化数据工程体系,布局AI数据工程技术基础设施,攻关多模态清洗、向量检索、合成生成等核心技术,打造可复用工具链,探索“云—边—端”协同架构;加快研制相关国家标准与评估体系,形成“需求—采集—治理—应用—迭代”的全周期闭环。
构建可信流通体系,释放数据要素价值。围绕AI跨主体协同创新需求,建设数据流通利用设施,运用隐私计算、区块链、数据沙箱、可信执行环境等技术,实现价值共享与安全流通,破解数据共享顾虑。完善数据产权登记、价值评估、收益分配等制度,形成技术制度协同保障体系。推动行业数据从分散封闭向标准化、服务化供给转变,依托统一标准整合资源,搭建逻辑统一、物理分布的数据供给网络,破除跨主体、跨行业、跨区域壁垒。打造公共数据服务平台,将隐私计算、合规脱敏等共性能力封装为普惠服务,降低中小企业与科研机构的数据门槛,持续盘活存量数据,赋能全域创新。
完善价值激励机制,激发数据供给内生动力。遵循AI产业发展规律,探索适配的数据价值实现机制,完善资源托管、收益分配和权益保护制度,保障提供者权益。坚持“谁贡献、谁受益”原则,建立科学的数据收益分配体系,增强经营主体参与积极性。引导企业加大数据投入,推动产业竞争从比拼算力、模型参数向提升数据质量、释放数据价值转变,形成“优质数据支撑模型迭代、模型价值反哺数据供给”的良性循环。坚持鼓励创新与规范发展并重,建立分级分类监管体系,在守住安全底线前提下,为新业态、新模式预留空间,健全容错纠错机制,营造包容审慎环境。
强化产业协同联动,构建数据飞轮生态。聚焦全链条创新生态,发挥行业组织、龙头企业的桥梁作用,构建跨企业、跨领域、产学研用深度融合的协同机制。鼓励标杆企业、服务商、研发企业结成创新联合体,通过场景开放、数据共享、联合攻关,实现场景牵引、数据驱动和模型迭代的良性互动。统筹用好政策与市场工具,引导社会资本参与数据要素市场建设,形成多元化投入格局。聚焦行业痛点打造标杆数据集,持续赋能AI与实体经济融合。加大对高价值中文开源数据集扶持力度,以开源带动标准统一,降低创新成本。依托智库、院所与龙头共建共性平台,积极参与全球AI数据治理规则制定,牢牢把握战略主动权。
AI时代的竞争,不仅是模型和算力的较量,更是高质量数据供给体系的博弈。谁率先构建起覆盖数据生产、治理、流通、利用和价值实现的完整体系,谁就能在智能化发展中占据主动。因此,要坚持自主创新、应用牵引、生态协同、开放共享、安全可控的发展路径,以高质量数据供给支撑AI高质量发展,为发展新质生产力、建设制造强国和网络强国、推进中国式现代化作出更大贡献。