8月28日,“高质量数据集和数据标注”主题交流活动在2026数博会期间举行,来自政产学研各界人士齐聚一堂,聚焦“夯实高质量数据底座 赋能人工智能创新发展”主题,展示行业高质量数据集成果和前沿动态,共同探讨数据和智能创新融合发展新路径。
“大模型也好、AIGC也好,它们发展最重要的基础就是我们今天讨论的训练数据。”主旨演讲阶段,中国工程院院士、深圳大学电子与信息工程学院院长丁文华结合国内外模型实测数据,从大模型、AIGC 延伸到具身智能,指出技术蓬勃发展的背后数据集建设的核心贡献,提出对当前亟待突破关键瓶颈的思考。
“人工智能需要大量数据,中国最多数据是生产活动中产生的数据,但是人工智能的大脑是以语言数据为基础进行推理的大脑,而我们中文语言数据非常稀缺。”新加坡工程院院士、香港中文大学(深圳)人工智能学院院长李海洲通过回溯语言技术发展脉络,拆解大模型背后的数据密码,剖析当前中文数据资源的现实困境与国产平台的实践探索。
会场,与会代表们共同见证了高质量数据集开源社区的启动。该社区面向数据集建设单位、使用单位、技术企业、科研机构和高校等各方主体,围绕数据集、质量方法、技术工具和应用场景开展交流协作,促进建设经验交流和优秀成果展示。
主题演讲环节,嘉宾们带来了高质量数据集与数据标注领域的最新研究成果,并毫不吝惜地分享了各自领域的建设实践经验。
中国信息通信研究院副院长魏亮分析了我国高质量数据集建设的发展现状、建设方法和应用场景,引人深思。
中国移动通信集团数智事业部副总经理陶涛展示了中国移动促进数据要素价值释放的经验做法,带来了重要启发。
国家数据发展研究院院长胡坚波介绍了系统定位、运行情况与下一步建设规划,清晰阐释了数据赋能人工智能创新发展的关键支撑作用。
国家医保局大数据中心主任付超奇展现了数据要素如何赋能“三医”协同发展和治理,保障民生福祉、服务经济社会发展。
智源研究院具身数据负责人、北京大学多媒体信息处理全国重点实验室副研究员姚国才从破解具身智能循环的困境出发,探索破局之道,发挥数据的飞轮效应,为搭建数据和模型研究体系提供路径和指引。
腾讯云副总裁、混元数据负责人刘煜宏围绕央企经验、产业洞察、模型建设、智能体应用全链条,分享行业前沿动态和实践案例。
在中国科学院计算机网络信息中心主任周园春的主持下,活动还举行了圆桌对话。中国科学院文献情报中心副主任钱力,鹏城国家实验室主任助理、研究员贺志学,广州国家实验室研究员苗智超,中国科学院自动化研究所研究员陈盈盈,围绕科学研究领域高质量数据集建设展开交流。大家结合研究成果与经验,分享科学研究领域高质量数据集建设经验、创新方法与实施路径,以高质量数据底座赋能人工智能创新发展。
天眼新闻记者 岳端 周梓颜
编辑 胥芬芳 施平
二审 杨韬
三审 闵捷