9月16日,稳准智能联合清华大学计算机系崔鹏教授发布新一代数据大模型LimiX-2,模型参数规模提升至400M。在TabArena、BCCO、TALENT三个国际主流结构化数据Benchmark中,LimiX-2总体Elo分数分别达到1935、1432和1506,均位列榜单第一,超过Google、SAP、Amazon等国际大厂的同类模型。Elo是衡量模型综合能力的排名指标,这三个基准覆盖多类任务,用于评估模型在不同数据集上的泛化能力和预测性能。
此次模型能力升级主要沿三条技术路线推进。其一是上下文机制网络CMNs,作为预测依赖关系的系统,将建模重点从预先指定的目标变量转向变量之间的相互关联;其二是在预训练阶段升级自动化合成数据的生成引擎;其三是进一步Scaling,将模型参数规模扩大至400M。
LimiX团队提出的CMNs开辟了从“目标预测”走向“结构发现”的结构化数据建模新范式。传统经典PFNs以指定目标的预测分布为核心,CMNs则将上下文数据的全变量联合依赖作为建模对象,不仅关注变量取什么值,更着眼于发现变量如何相互关联。LimiX通过上下文条件掩码建模(CCMM)在不同观测模式下组织跨变量监督,将变量关系推断确立为明确的预训练目标,并采用单元格级建模,保留列身份、具体取值和缺失状态,支持跨变量、跨样本的信息交互。
在训练数据上,LimiX-2升级了大规模自动化合成数据的生成引擎,可自动生成线性、非线性、多变量交互、周期变化和噪声扰动等不同分布的数据,让模型在进入真实企业之前接触更多数据结构和变量关系。继去年11月稳准智能发现并提出“结构化数据基础模型遵循Scaling Law”之后,此次新模型再次沿这一路线将参数规模提升到400M,以在更大尺度上验证技术路线并获得更强泛化能力。除榜单体现的分类、回归等预测能力外,LimiX-2在因果发现方面也展现突破,在Sachs、UF、Causal Chamber等多个公开标准数据集上显著领先传统因果发现方法。
截至2026年世界人工智能大会,上一代LimiX已完成800余个结构化数据场景的通用性验证,并与60多个客户达成战略合作。此前在多个真实场景的验证中,LimiX把过去“一项任务训练一个专用模型”的传统机器学习方式,转变为由一个基础模型跨场景、跨数据集的通用预测能力,工艺参数优化、设备故障预测、电力预测、能耗优化和材料科学都是目前较典型的应用方向。