西湖论剑丨张向宏:“数据工厂——人工智能下半场竞争的关键选择”


他的判断是,人工智能正处于“奇点时刻”。全国词元调用量从2024年初的1000亿跃升至2025年底的100万亿,2026年3月突破140万亿,6月突破500万亿;人工智能数据应用总量达199.48EB,其中推理数据量101.34EB,首次超过训练数据量;系统软件与人工智能产生的数据量达26.92ZB,首次超过物联感知数据的25.34ZB。在他看来,这意味着“人工智能毕业了”,而且深度嵌入了日常工作、生活和学习。

对此的破解之道是建设数据工厂。“农业社会有农场,工业社会有工厂……数据工厂是生产高质量数据集的。”他解释,大规模的原始数据进来,大规模体系化、规模化、设施化、标准化的高质量数据集出去,为人工智能提供源源不断的燃料。数据工厂由储备、生产、中试三个车间构成,承担从采集、清洗、标注到模型训练评估的全流程,并具备多样化、规模化、设施化、标准化、AI化五个特征。研究源自国家数据局委托课题,团队已发布《数据工厂白皮书》,数据工厂也已列入明年标准计划,预计出台总体框架、技术要求与评估规范。


立即体验恒脑安全智能体 



立即解锁AI安服数字员工 




行业解决方案
技术解决方案









