参考消息网9月5日报道西班牙知华讲堂网站9月2日刊登文章《中国建成超12.6万个高质量数据集:人工智能发展的另一个基础设施》,作者是苏珊娜·加西亚·加西亚-图尼翁。文章编译如下:
中国国家数据局在贵阳举行的2026中国国际大数据产业博览会上发布的最新数据显示,中国已为人工智能(AI)发展累计建成超过12.6万个高质量数据集,数据总体量超1815拍字节(PB)。
这一数字本身规模可观,但更值得关注的是其背后折射出的战略动向:中国正试图将专业数据的生产、整理和应用组织起来,作为人工智能发展的新基础设施,正如近年来中国不断扩建数据中心、算力网络、训练算力和自研模型一样。
原因很简单:拥有先进的模型和强大的算力并不足以有效地将人工智能应用于工厂、医院、科研实验室、电网或机器人等领域。要在这些环境中发挥作用,还需要专门的、经过适当整理的数据,这些数据能够教会系统各个特定领域的运作方式。而这些信息大多无法在互联网上免费获取。
中国国家数据局6月发布的实施方案展现了这一战略的广度。中国旨在推动与科学研究、工业、农业、能源、交通、金融、医疗、教育、电子商务、气象和城市治理等相关的数据集建设,以及自动驾驶、具身智能和世界模型等新兴技术领域的数据集建设。
这一官方战略背后的逻辑是,数据集的构建必须越来越围绕特定问题展开。这并非简单地收集信息然后决定其用途,而是首先确定模型需要学习哪些内容才能解决特定任务,然后以此为基础构建必要的数据。
与此同时,中国也已开始构建整合这些资源的机制。4月底,国家数据集管理服务平台正式发布并启动试运行。该平台旨在打造一个公共基础服务设施,用于登记现有数据集、数据集供给方、潜在使用方以及数据集的获取方式。
中国的这一战略旨在解决新数据经济面临的主要问题之一:海量信息分散在企业、研究中心、政府机构和大学之中,这些信息可能彼此孤立,难以查找、共享或重复利用。建立国家数据集管理服务平台的目标是创建一个协调层,使人们能够了解现有资源,并将资源拥有者与潜在使用者联系起来。
中国希望各省市建立与其自身经济专长相关的数据集项目。例如,汽车产业实力雄厚的地区可以集中精力开发与车辆和自动驾驶相关的数据资源,而制造业发达的地区则可主攻工业数据资源建设。
贵州省本身就是中国这一战略的典型例证。多年来,当地持续布局数据中心等算力基础设施,力争将自身打造成中国数字经济发展的领先地区。现阶段,贵州正着力拓展算力基础设施带动的各类产业。(编译/王萌)