蚂蚁统一宽表系统获VLDB最佳论文,35PB语料处理提速5.6倍
蚂蚁集团研发的统一宽表系统OmniTable荣获VLDB 2026工业赛道最佳论文。该系统以一套宽表架构高效管理35PB规模语料,将大模型数据清洗效率提升5.6倍,为行业提供了规模化数据处理的新范式。
大模型训练数据的清洗与整理,历来是耗时费力的基础工程。蚂蚁集团最新披露的技术成果,试图为这一环节提供更高效的解法。在日前公布的VLDB 2026论文评选中,蚂蚁集团关于统一宽表系统OmniTable的研究摘得工业赛道最佳论文桂冠,标志着其数据处理方案获得国际数据库学术界的认可。
该系统的核心思路,是将传统上分散于多张表、多种格式中的异构语料,整合进一套逻辑统一的宽表结构中。据论文披露,基于这一架构,蚂蚁内部成功管理了规模高达35PB的训练语料,覆盖了从文本、代码到多模态数据的多种类型。这种模式减少了数据搬运和格式转换的中间环节,从底层简化了数据流水线。
效率层面的提升是此次成果的关键看点。在蚂蚁集团的实际业务场景中,应用OmniTable后,大模型语料的处理速度相较原有方案实现了5.6倍的跃升。这意味着原本需要耗费数周的数据准备工作,现在可以在更短的时间窗口内完成,显著缩短了模型迭代的周期。
值得注意的是,该系统的设计并不仅限于存储优化。论文进一步阐述了其在数据检索、去重、质量过滤等环节的协同能力,通过统一的元数据管理和计算下推策略,让数据清洗的多个步骤可以在同一套存储引擎内高效流转。这为行业内处理超大规模、多源异构数据提供了具有参考价值的工程实践样本。
随着AI模型的参数规模与训练数据量持续攀升,数据工程正成为制约模型能力释放的关键瓶颈之一。蚂蚁此次获得VLDB工业赛道最佳论文,也从侧面反映出产业界正将更多研发重心投向数据基础设施的深水区。OmniTable的落地效果,为后续同类系统的设计提供了新的比较基准。