快讯 23:57Meta One订阅服务上线,最高月费499美元瞄准AI重度用户23:41Gergely Orosz 探访 OpenAI 总部:Codex 已渗透几乎所有日常工作23:33华为郭平座谈新员工:供应链对标苹果,计算领域瞄准英伟达 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期三 · 09-16 22:49 约 1 分钟读完

中文互联网基础语料4.0发布:120GB可信数据上线,多方共建中文语料底座

摘要

9月15日,中文互联网基础语料4.0在济南发布,数据量120GB,已上线“中文互联网语料资源平台”,用户可注册认证后下载。该语料由网安协会联合国家互联网应急中心及百度、科大讯飞等企业共建,旨在为大模型训练提供可信数据支撑。

在2026年国家网络安全宣传周人工智能安全治理分论坛上,中文互联网基础语料4.0于9月15日下午在济南正式亮相。这一版本的数据量达到120GB,并同步在“中文互联网语料资源平台”上线,面向社会开放获取。

据官方介绍,用户可通过中国网络空间安全协会官网进入该平台,完成注册与认证流程后,即可下载或联系获取相关数据。该语料项目在中央网信办指导下,由中国网络空间安全协会联合国家互联网应急中心,并协同百度、中科闻歌、开普云、拓尔思、科大讯飞、知乎等单位共同推进。

此次发布的4.0版本建立在1.0至3.0版本的基础之上,依托网安协会人工智能安全治理专委会建立的语料共建共享机制,汇聚了一批新的高质量可信数据,并经过严格的数据加工处理。网安协会负责人表示,这是社会各界协同共建高质量中文语料的重要阶段性成果,进一步丰富了国内高质量中文语料的供给体系。

下一步,协会将继续联合国家互联网应急中心等单位,联动各行业领域深化中文互联网基础语料建设,持续为人工智能产业高质量发展筑牢数据底座。此举也被视为国内AI大模型训练数据生态建设的重要一步,为行业提供了更可信的中文数据来源。

中文语料大模型训练数据共建AI安全治理
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
41
企业落地案例
4
完整版提示词