快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期六 · 09-05 10:31 约 1 分钟读完

小米发布开源表格大模型TabLDM,回归能力登顶OpenML-CTR23

摘要

小米今日发布开源通用表格数据基础大模型Xiaomi-TabLDM,以单一预训练模型适配不同表格数据集,无需任务级调参。在四大公开基准评测中均位列第一梯队,其中回归能力在OpenML-CTR23上登顶,为金融、医疗等领域的表格数据预测提供新范式。

小米于9月5日正式推出通用表格数据基础大模型Xiaomi-TabLDM,并将其开源。该模型的核心突破在于,通过单一预训练模型和统一默认配置,即可直接适配多种表格数据集,免去传统方法中针对每个任务重新训练、调参或后置集成的繁琐步骤。

在金融、医疗、制造、物流等行业,大量核心数据以表格形式存储,但传统机器学习管线常需为每个新数据集重复建模,带来高昂的部署与维护成本。小米此举旨在将‘一次预训练、跨任务使用’的基础模型范式引入结构化数据领域,降低表格预测任务的门槛。

为实现这一目标,Xiaomi-TabLDM在预训练阶段完全基于结构因果模型(SCM)生成的合成数据,覆盖多样化的数据规模、变量类型和依赖关系,从而拓宽任务分布。在架构设计上,模型引入了双流特征分组、轻量级注意力残差和稀疏混合专家机制,从不同粒度捕捉特征交互,并通过稀疏化策略扩展模型容量。

推理阶段,该模型还探索了Test-Time Scaling策略,即在保持预训练参数不变的前提下,通过增加推理计算量来持续优化预测表现。这一路径为表格大模型在算力与精度间的权衡提供了新思路。

在四大公开基准评测中,Xiaomi-TabLDM均进入第一梯队,尤其在OpenML-CTR23基准上,其回归能力排名第一。该模型已开源,开发者可基于其构建面向特定业务场景的表格预测应用。

小米TabLDM表格大模型开源
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词