在大语言模型持续升温的同时,另一条面向结构化数据的AI路线LDM(Large Data Model,结构化数据基础模型)正吸引越来越多头部玩家入场。谷歌、亚马逊、德国软件巨头SAP等企业纷纷布局,瞄准的是生产侧的核心痛点:如何让基础模型直接学习不同结构化数据中的变量关系、条件关系和生成机制。

9月15日,SAP发布TabPFN-3.5,几小时后,由清华博士组成的团队稳准智能发布400M参数的结构化数据基础模型LimiX-2,在TabArena、TALENT、BCCO三个国际主流基准测试的二分类、多分类、回归等各项任务中拿下第一,呈现断层领先。这并非该团队首次登顶,去年其发布的国内首个结构化数据基础模型LimiX就曾长期霸榜。

与TabPFN偏目标预测的行级建模路线不同,LimiX-2将面向变量关系建模前置为核心目标,学习跨变量、跨样本的联合依赖结构,并自建高质量自动化数据合成引擎,让模型先见过足够复杂的数据世界,再处理真实任务。团队认为,真正重要的不是拿下一次第一,而是每到关键节点都有能力重新回到第一。

LLM已吃透文本、语音、视频,但面对工业生产、科学研究等真正用于决策的场景,对因果关系、准确性和稳定性的要求陡然提高。制造业中温度、压力、转速、原料配比等成百上千个变量同时变化,大量关键规律未被总结成规则或文本,若先转写成文本再交给LLM处理,中间会经历一次信息压缩,而压缩掉的细粒度差异恰恰可能决定预测精度与良率。LDM直接进入真实世界留下的高维数据空间,从变量关系本身理解规律,正成为基础模型体系中越来越重要的一块拼图。