小米表格结构化数据大模型 TabLDM 发布开源:四大基准评测第一梯队,回归能力登顶 OpenML-CTR23
IT之家 9 月 5 日消息,小米今日正式发布通用表格数据基础大模型 Xiaomi-TabLDM。据介绍,该模型以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或后置集成,即可完成分类与回归预测。长期以来,金融、医疗、制造、物流等领域大量核心数据以表格形式存在,但传统表格机器学习通常需要针对每一个新数据集重新训练、调参甚至集成模型,存在多次训练及版本管理等繁重的部署代价。Xiaomi-TabLDM 旨在将“一次预训练、跨任务使用”的基础模型范式带入结构化数据领域。该模型从三个方向推进表格基础模型能力。预训练方面,Xiaomi-TabLDM 完全基于结构因果模型(SCM)生成的大规模合成数据进行预训练,覆盖不同数据规模、变量类型、依赖关系和函数关系,扩大预训练任务分布。模型架构方面,引入双流特征分组(dual-stream feature grouping
原文:IT之家