【人工智能普及应用遇到“数据墙” “数据工厂”能破局吗?】随着人工智能由模型训练加快转向推理应用,高质量数据集的供给能力正在成为影响行业大模型和智能体落地的重要因素。
近日,我国首份《数据工厂白皮书》(以下简称“白皮书”)正式发布,提出以数据工厂推动高质量数据集规模化、体系化、设施化生产。白皮书数据显示,2025年国内AI推理数据量达到101.34EB,首次超过98.14EB的训练数据量。
《国家数据要素化系列丛书》总主编、北京交通大学教授张向宏向《中国经营报》记者表示,数据设施已经历了数据中心(IDC)、算力中心和存力中心等不同发展阶段,目前正在向数据工厂转型。数据工厂是规模化生产高质量数据集的生产设施,是词元(Token)工厂的组成部分之一。
“词元工厂是智能经济的基本业态,由数据工厂、智能体工厂和算力工厂构成。其中,智能体工厂和算力工厂分别由模型企业和算力企业独立创新开发,已形成初步的独立业态,而数据工厂还未形成独立业态,成为词元工厂的最薄弱环节。面对人工智能普及应用遇到了‘数据墙’等问题,数据工厂正是突破人工智能发展瓶颈的根本举措,未来将进一步向词元工厂升级。”对于数据工厂和词元工厂的区别,张向宏进一步说。中经记者 许璐 李晖 北京报道http://t.cn/AX9yIcvs
