小米推结构化数据大模型Xiaomi-TabLDM:开启表格数据Scaling Law

发布时间:2026-09-05 14:53

  小米今日正式发布通用表格数据基础大模型 Xiaomi-TabLDM。

  据介绍,该模型以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或后置集成,即可完成分类与回归预测。

  长期以来,金融、医疗、制造、物流等领域大量核心数据以表格形式存在,但传统表格机器学习通常需要针对每一个新数据集重新训练、调参甚至集成模型,存在多次训练及版本管理等繁重的部署代价。Xiaomi-TabLDM 旨在将“一次预训练、跨任务使用”的基础模型范式带入结构化数据领域。

  该模型从三个方向推进表格基础模型能力。预训练方面,Xiaomi-TabLDM 完全基于结构因果模型生成的大规模合成数据进行预训练,覆盖不同数据规模、变量类型、依赖关系和函数关系,扩大预训练任务分布。模型架构方面,引入双流特征分组、轻量级注意力残差和稀疏混合专家,从不同粒度建模特征关系,通过稀疏专家扩大模型容量。推理方面,该模型进一步探索了 Test-Time Scaling,在保持预训练模型参数不变的情况下,通过增加推理阶段计算量持续提升预测性能。

  在四大公开基准评测中,Xiaomi-TabLDM 均跻身第一梯队。回归能力表现突出:在 OpenML-CTR23 回归榜排名第一;在 TALENT、TabArena 和 BCCO 的回归任务中均排名第二;在 TALENT 二分类任务中同样排名第一。在性能与效率的平衡上,以 TabArena 回归任务为例,Xiaomi-TabLDM 取得第二高 Elo 评分的同时,训练时间比排名第一的 TabFM 减少 82%,预测时间减少 68%。

  在真实工业场景验证中,Xiaomi-TabLDM 相比传统机器学习展现出更高的预测精度和跨工况适应能力。材料性能预测场景下,该模型无需微调即可将预测精度提升 130%,减少约 90% 的无效试模与装机测试。零件重量预测场景中,相比 XGBoost,失误样本比例降低约 31%。生产组分预测场景中,平均误差相比 XGBoost 降低约 54%;当生产工况发生变化时,仅补充约 30 条新工况样本作为上下文,即可将平均误差降低约 62%。

  目前,Xiaomi-TabLDM 相关模型权重与代码已正式开源,附相关代码及模型权重:

  特别

  胡锡进发声!批评武大处理“付磊和曾梦琪”事件,处理得太慢了!都有经验了,也有教训了,处理事情还这样拖泥带水

  蒋介石初次携宋美龄前去拜见杜月笙,杜月笙看了她落座的姿态后,悄悄跟心腹说了一番话,没想到这话成了他一辈子最准的预言

  罗志祥复出登上热搜,

  福建土楼景区宣布闭园,“云水谣”600年古榕树被洪水冲倒,土楼管委会:已派工作人员去现场处理,后续将妥善安排

  专门给娃喝矿泉水补矿物质?营养医师:没必要 自来水就行,过度纯净的水反而会影响水里的矿物质#矿物质 #孩子 #喝水 #矿泉水

  孩子不长个 爱吃炸鸡喝可乐?可以从这两个方面改变,营养师:家长一定要狠心一点#孩子 #炸鸡可乐 #饥饿疗法 #孩子不长个

排行

精选