AI语料短缺瓶颈凸显 数据基建新机遇有望释放
创始人
2026-08-17 07:53:41
0

◎记者 李兴彩 AI发展的又一个关键瓶颈浮出水面——高质量、高可信度的数据,正成为AI竞争的胜负手。这也为出版、新闻等传统内容服务商向AI语料供应商转型创造了机遇,相关企业的商业价值有望迎来重估。 科技公司加码内容资源布局 近日,A股AI语料板块走强,读客文化、中信出版、利欧股份、中国出版、海天瑞声等股价显著上涨。 有消息称,苹果正与多家出版商洽谈新的合作协议,希望使用它们的内容来提供最新的新闻和信息,这是苹果升级AI驱动版Siri语音助手计划的重要一部分。苹果还计划采用灵活付费模式,当合作出版商的内容被Siri用户使用时,再支付相应的版权费用。 据悉,苹果此前已与部分出版商达成协议,向出版商支付费用,以获取相关内容以及用于AI模型训练方面的使用权。 Anthropic等科技公司也在加码布局内容资源。今年7月,一份解封的法庭文件显示,Anthropic通过代号为“巴拿马计划”的项目,斥资数千万美元批量采购数百万册2022年前出版的纸质书,完成高速扫描用于AI训练后,将这些书籍粉碎销毁,该行为被舆论称之为“AI焚书”。 科技公司为何纷纷盯上了传统媒体的内容资源?在AI大模型快速发展的初期,行业训练大模型所用语料主要来自互联网上公开的信息,这些语料信息的合法性、准确度长期未得到充分重视。更为重要的是,在生成式AI爆发后,大量AI生成内容、合成数据也涌入互联网,再度回流成为大模型训练素材。但是,若持续使用AI生成内容迭代训练模型,将引发模型退化,出现“模型坍缩”现象。 为获取未被AI生成内容污染的原生语料,硅谷科技巨头开始挖掘传统媒体文稿与纸质书籍价值。这类原生内容能够保障模型输出的准确度,支撑模型能力持续迭代提升。 数据基建新机遇有望释放 AI产业发展应具备能源、算力、数据、模型和应用五大核心要素。数据是AI大模型的“燃料”,其质量与安全性直接决定了模型价值的上限。 据2026机器人全产业链接会披露信息,GPT-2、GPT-3对应的训练数据时长分别约为79万小时、1100万小时,想要实现具备实用能力的具身智能,至少需要1000万小时量级多模态数据。叠加多场景适配、多模态类型、数据良率等因素,产业实际所需多模态数据集规模将远超1000万小时。 当前,高质量语料短缺已成为制约人工智能大模型发展的核心瓶颈,据Epoch AI预测,人类公开的高质量文本数据可能在2026年至2032年间被完全耗尽。在此背景下,高质量、高可信度的数据资源正在成为“稀缺”资源,重要性持续提升。多位接近出版社、图片版权机构等传统内容企业的人士向记者透露,国内也已经有AI公司开始向传统内容机构采购合规数据集。 复旦大学计算与智能创新学院特聘教授、北电数智首席科学家窦德景认为,谁能掌握高质量、高可信度的行业数据,谁就能在AI竞争中占据先机。上述接近传统内容企业人士表示,传统媒体沉淀的大量优质原创内容,恰好是AI大模型所需的优质“燃料”,不仅具备高度准确、数据可信等优势,还能够规避“模型坍缩”风险。 高质量内容数据的“语料价值”持续提升下,传统版权资产价值迎来重新评估窗口。兴业证券研报认为,数据集建设重估版权语料价值,AI应用打开IP商业化空间,网文、出版企业有望从传统内容提供商转变为合规AI训练语料供给方,自有版权文本数据稀缺性上升,资产价值具备重估空间。 国金证券分析称,当前,数据采集已经成为物理AI发展的最大短板之一,数据基础设施加快建设有望带动数采产业链持续扩容。

◎记者 李兴彩

AI发展的又一个关键瓶颈浮出水面——高质量、高可信度的数据,正成为AI竞争的胜负手。这也为出版、新闻等传统内容服务商向AI语料供应商转型创造了机遇,相关企业的商业价值有望迎来重估。

科技公司加码内容资源布局

近日,A股AI语料板块走强,读客文化、中信出版、利欧股份、中国出版、海天瑞声等股价显著上涨。

有消息称,苹果正与多家出版商洽谈新的合作协议,希望使用它们的内容来提供最新的新闻和信息,这是苹果升级AI驱动版Siri语音助手计划的重要一部分。苹果还计划采用灵活付费模式,当合作出版商的内容被Siri用户使用时,再支付相应的版权费用。

据悉,苹果此前已与部分出版商达成协议,向出版商支付费用,以获取相关内容以及用于AI模型训练方面的使用权。

Anthropic等科技公司也在加码布局内容资源。今年7月,一份解封的法庭文件显示,Anthropic通过代号为“巴拿马计划”的项目,斥资数千万美元批量采购数百万册2022年前出版的纸质书,完成高速扫描用于AI训练后,将这些书籍粉碎销毁,该行为被舆论称之为“AI焚书”。

科技公司为何纷纷盯上了传统媒体的内容资源?在AI大模型快速发展的初期,行业训练大模型所用语料主要来自互联网上公开的信息,这些语料信息的合法性、准确度长期未得到充分重视。更为重要的是,在生成式AI爆发后,大量AI生成内容、合成数据也涌入互联网,再度回流成为大模型训练素材。但是,若持续使用AI生成内容迭代训练模型,将引发模型退化,出现“模型坍缩”现象。

为获取未被AI生成内容污染的原生语料,硅谷科技巨头开始挖掘传统媒体文稿与纸质书籍价值。这类原生内容能够保障模型输出的准确度,支撑模型能力持续迭代提升。

数据基建新机遇有望释放

AI产业发展应具备能源、算力、数据、模型和应用五大核心要素。数据是AI大模型的“燃料”,其质量与安全性直接决定了模型价值的上限。

据2026机器人全产业链接会披露信息,GPT-2、GPT-3对应的训练数据时长分别约为79万小时、1100万小时,想要实现具备实用能力的具身智能,至少需要1000万小时量级多模态数据。叠加多场景适配、多模态类型、数据良率等因素,产业实际所需多模态数据集规模将远超1000万小时。

当前,高质量语料短缺已成为制约人工智能大模型发展的核心瓶颈,据Epoch AI预测,人类公开的高质量文本数据可能在2026年至2032年间被完全耗尽。在此背景下,高质量、高可信度的数据资源正在成为“稀缺”资源,重要性持续提升。多位接近出版社、图片版权机构等传统内容企业的人士向记者透露,国内也已经有AI公司开始向传统内容机构采购合规数据集。

复旦大学计算与智能创新学院特聘教授、北电数智首席科学家窦德景认为,谁能掌握高质量、高可信度的行业数据,谁就能在AI竞争中占据先机。上述接近传统内容企业人士表示,传统媒体沉淀的大量优质原创内容,恰好是AI大模型所需的优质“燃料”,不仅具备高度准确、数据可信等优势,还能够规避“模型坍缩”风险。

高质量内容数据的“语料价值”持续提升下,传统版权资产价值迎来重新评估窗口。兴业证券研报认为,数据集建设重估版权语料价值,AI应用打开IP商业化空间,网文、出版企业有望从传统内容提供商转变为合规AI训练语料供给方,自有版权文本数据稀缺性上升,资产价值具备重估空间。

国金证券分析称,当前,数据采集已经成为物理AI发展的最大短板之一,数据基础设施加快建设有望带动数采产业链持续扩容。

相关内容

热门资讯

基金经理 探讨AI“软硬件再平... ◎记者 陈玥 当前,市场风格开启了新一轮的“温和再平衡”。基金经理对存储、算力、硬件等前期热门方向的...
走过平坝老街:那些埋在石板缝隙... 在滇东南喀斯特群山褶皱之间,平坝镇静静坐落于文山西南部,处在文山、马关、屏边三地往来通行的地理节点之...
云南:针对“低价团”等暑期游乱... 据央视新闻消息,8月16日晚,总台《财经调查》曝光暑期游乱象。其中,云南昆明、西双版纳等地一些旅游行...
黑龙江:制造业装上“AI大脑”... 日前,人工智能+制造产业应用对接会在哈尔滨召开。该对接会由黑龙江省工业和信息化厅指导,华为技术有限公...
券商AI应用持续扩展 !投顾“... 818理财节已行至第十年。十年间,技术不断迭代,AI逐渐成为重点。 记者采访获悉,今年的理财节,部分...
苹果macOS高危漏洞已被利用... IT之家 8 月 17 日消息,荷兰国家网络安全中心(NCSC-NL)8 月 12 日报告称,攻击者...
青海多点发力撬动文旅消费市场 ... 原标题:青海多点发力撬动文旅消费市场青海新闻网·江源新闻客户端讯 8月12日,记者从青海省文化和旅游...
AI集群规模进一步扩张,光通信... 近日,海内外多家光通信产业链公司透露在手订单充裕,且订单能见度不断拉长,部分企业订单已排产至2027...
全AI制作网络故事片《热血大陈... 本报杭州8月16日电 (记者顾春)日前,全AI(人工智能)制作网络故事片《热血大陈岛》在视频平台上线...
AI语料短缺瓶颈凸显 数据基建... ◎记者 李兴彩 AI发展的又一个关键瓶颈浮出水面——高质量、高可信度的数据,正成为AI竞争的胜负手。...