← 全部笔记

TABULAR FOUNDATION MODELS · 演化与研究问题

TabPFN:把学习算法装进一次前向传播

已知训练集不再只用来更新参数,也可以直接成为预测时的输入。沿着这一个变化,理解 PFN 的目标、表格注意力的演化,以及大表上的取舍。

中文研究笔记面向有 AI 基础的读者由 gpt-6-astra 完成

1. 相对普通表格模型,究竟改了哪一步?

假设你已经会用 XGBoost、MLP 或 Transformer 做分类。通常拿到一张新表,会在这张表的训练集上优化参数,再预测测试样本。TabPFN 的基础用法把这件事改成:把已知样本及其标签放进上下文,让一个预训练好的网络直接预测未知标签。

对照项 每个数据集训练一个模型 TabPFN 的基础上下文预测
新任务的训练集 用来计算损失、更新模型参数 作为带标签的输入,参与注意力计算
学到的东西保存在哪 该任务的参数中 当前上下文及其隐藏表示中;预训练权重通常冻结
训练发生在哪 主要发生在目标任务上 大量成本提前付在跨任务预训练阶段
新测试样本怎么预测 输入已拟合的模型 查询训练上下文;实现可缓存上下文表示

这里的“无需训练”只指基础推理时不用对目标任务做梯度更新。它有昂贵的预训练,也有预处理、上下文编码和预测成本;后来的微调、集成和蒸馏又引入了不同的训练流程。T1 T3 T4

图 1 · 被搬走的是目标任务上的参数优化
① 离线:生成很多任务每次换一个数据生成规则,再生成一张表;拆成带标签的 support 和待预测的 query。
② 预训练:学会利用上下文输入 support 和 query 特征,预测 query 标签。误差更新同一组跨任务参数 θ。
③ 新任务:冻结 θ换成真实训练集和测试特征。训练标签进入上下文,测试标签不输入模型。
这是基础 PFN 流程的重绘示意。箭头从预训练走向部署,不表示部署时还要生成合成数据。目标任务微调属于可选分支。[T1]

PFN 为什么和贝叶斯推断有关?

PFN 是 Prior-data Fitted Network。先规定“任务可能怎样产生”的先验:例如随机采样一个函数、噪声水平和输入分布,再从中生成数据。网络训练时不断遇到不同任务,必须从少量已知样本判断这一次更像哪一种规则。

设已知数据为 \(D=\{(x_i,y_i)\}\),未知样本为 \(x_*\)。预训练目标可以简写成:

\[\begin{aligned} \min_\theta\quad &\mathbb E\left[-\log q_\theta(y_*\mid x_*,D)\right],\\ &f\sim p(f),\\ &(D,x_*,y_*)\sim p(\cdot\mid f). \end{aligned}\]

交叉熵的理想解是该任务分布下的后验预测分布:它综合所有仍能解释 \(D\) 的规则,而非只选一个最优参数。实际网络只是有限数据、有限容量下的近似;先验覆盖什么,决定它在哪些任务上容易泛化。 T1

一个能手算的例子:它在综合什么?

下面是说明目标的自造例子,不是某个 TabPFN 检查点内部的真实计算。只有两种可能规则:A 为 \(y=x\),B 为 \(y=1-x\),先验各占一半。每个标签有 20% 的概率被独立翻转。现在观察到两条训练数据:\((0,0)\)、\((1,1)\)。

计算 规则 A 规则 B
生成这两条观测的概率 \(0.8^2=0.64\) \(0.2^2=0.04\)
乘先验后归一化 \(16/17\) \(1/17\)

因为两个先验相同,归一化时把 0.64 除以 0.64 + 0.04,就得到 A 的后验权重 16/17。对一个新的 \(x_*=1\) 样本,再加权两种规则的预测:

\[\begin{aligned} &p(y_*=1\mid x_*=1,D)\\ &\quad=\frac{16}{17}\times0.8+\frac{1}{17}\times0.2\\ &\quad=\frac{13}{17}\approx0.765. \end{aligned}\]

这个概率不是 1,因为还存在标签噪声与规则不确定性。

真正的 PFN 不会在每次预测时枚举这两个公式。它在预训练中学习一个映射,使前向传播的输出接近这种“看到证据后重新分配可能性”的结果。这也解释了为什么只换上下文、不更新权重,预测仍会改变。

2. 演化主线:先学会小表,再改变大表的表示方式

这条历史有三条相互影响的线:任务先验决定模型见过什么;架构决定能读多大的表;适配与评测决定收益是否落到真实任务上。 TabICL 是独立工作,后来影响了 TabPFN-3,并不是 TabPFN 的一个旧版本。

时间与工作 当时要解决的问题 带来的具体变化
2021 · PFN 能否预先学会一个推断过程? 用先验生成任务,训练网络逼近后验预测。T1
2022 / ICLR 2023 · TabPFN 这一思路在真实小表分类上是否有效? 神经网络与结构因果模型等合成先验;早期评测以不超过 1,000 行、100 个数值特征、10 类的小表为主。T2
2024 · TabForestPFN 等适配工作 冻结上下文预测是否就是终点? 研究目标任务微调,以及微调时更适合的合成先验;预训练后不更新参数成为一种选择。T8
2025.01 · TabPFN v2 处理更复杂的数据类型与回归 特征轴和样本轴交替注意力;扩展到论文中的 10,000 行、500 特征范围,并处理类别特征、缺失值等。T3
2025.02 · TabICL 二维表格表示怎样降低大表成本? 先形成每行的固定长度表示,再在行之间做上下文学习。T5
2025.07 · Real-TabPFN 合成先验与真实任务之间有距离怎么办? 在真实表格任务上继续预训练;这是跨任务适配,与在当前目标表上微调不同。T9
2025.11 · TabPFN-2.5 扩大可处理的任务范围 保留二维架构,增加深度、特征分组和学习到的辅助行,丰富先验;报告设计范围到 50,000 行、2,000 特征。T4
2026.02 · TabICLv2 行表示路线怎样继续扩展? 更丰富的先验、适应长度的 softmax 与 Muon 等共同改进训练和扩展性,不能把收益归给单一改动。T6
2026 · TabPFN-2.6 → 3 从扩展训练分布,走向改变表示拓扑 官方文档把 2.6 描述为沿用 2.5 架构、扩展先验的中间版本;v3 采用受 TabICLv2 启发的行表示路线。T15 T7
2026 · 压缩、检索、关系数据 单张表直接放进上下文仍有边界 TACO 压缩训练上下文;Localized TabICLv2 做局部检索;TabPFN-Rel / RelArena-α 把问题扩展到关系数据与工具流程。T16 T13 T14

几个版本的数字描述的是各自论文或文档的使用范围,不能直接拿来比较速度。还要同时固定行数、列数、类别数、硬件、集成次数和软件版本。尤其不要把“训练过的规模”“本地可装下的规模”和“API 接受的上限”当成同一个量。

3. 输入进去以后,到底怎样利用整张表?

第一步:训练标签是输入,测试标签是预测目标

以 3 条训练行、2 条测试行、4 个特征为例。模型拿到的是 \(X_{train}\in\mathbb R^{3\times4}\)、\(y_{train}\in\{0,1\}^{3}\)、\(X_{test}\in\mathbb R^{2\times4}\),输出两组类别概率。测试行只提供特征,不能把真实标签编码进去。

这不是把 CSV 转成一长段自然语言再喂给 LLM:表格模型可以直接编码数值、类别与标签信息。上下文中的“示例”是一行特征和对应标签;不同论文用不同的行列组织和注意力掩码来完成信息交换。T2 T3

# 概念接口:不代表某一版本的实际 API
context = encode_support(X_train, y_train)
query = encode_query(X_test)          # 不含 y_test
probabilities = pretrained_model(context, query)
# 基础 ICL 不在这里执行 optimizer.step()

第二步:v2 为什么在“列”和“行”之间轮流做 attention?

先暂时忽略特征分组和标签通道,把表编码成 \(N\times F\times d\) 的网格。同行不同列交流,帮助模型表示“年龄和某个指标组合起来意味着什么”;同列不同行交流,帮助它判断该指标在这张表里的分布,以及与已知样本的关系。交替堆叠后,跨列的组合信息也能传给其他行。T3

如果把全部 \(NF\) 个单元格直接做完整自注意力,仅注意力配对数量就是 \(O(N^2F^2)\)。上述轴向分解对应 \(O(NF^2+FN^2)\)。这是按形状推导的配对量,省略了隐藏维度、分组、掩码和具体 kernel,不能直接当作实测运行时间。

v2.5 在这一路线上继续扩展。它的辅助 “thinking rows” 是可训练表示,给模型额外的内部计算位置;它们不是带真实观测的新样本,也不是文本思维链。 报告同时提供蒸馏到更小预测器的路径:这改变的是重复服务时的成本结构。T4

第三步:为什么 TabICL / v3 要先把每一行压成固定长度?

如果每一层跨行 attention 都要为很多特征重复执行,列数会持续放大开销。行表示路线先完成表内特征处理,之后主要让 \(N\) 个行向量交流,把“跨样本建模”与特征数量部分解耦。TabICL 提出了这种分工;v3 的三段式结构进一步采用列分布编码、行内汇总和行间 ICL。T5 T7

图 2 · 从二维表,进入行表示的上下文
① 列内:认识分布同一个数值需要结合所在列来编码。列编码得到带有分布信息的特征表示。
② 行内:组合特征汇总一行的多个特征,形成固定宽度的行向量。此后不必一直保留 F 份跨行表示。
③ 行间:利用标签已知行及其标签构成上下文;测试行查询它们,得到预测分布。
图示保留数据流,省略特征分组、汇总 token 与多头细节。①②属于行表示构建,③属于 ICL,因此也常被概括为两大阶段。不是把原始特征简单求平均。[T5、T7]

回到 5 行、4 特征的例子:中间网格可以示意为 \(5\times4\times d\),行汇总后变为 \(5\times d_{row}\),其中前 3 行是已知上下文、后 2 行是查询。\(d_{row}\) 不必等于 \(d\)。省下持续携带特征轴的开销,也就引出一个研究问题:如果少数列的罕见组合非常重要,有限宽度的行表示是否总能保留它?这个问题需要实验,不能仅凭“压缩”二字判断会丢失预测信息。

v3 用诱导点注意力和分块缓存处理前面的编码阶段,并在查询训练上下文时使用 MQA 等设计。它公布的扩展范围包括“百万行、200 特征”或“千行、两万特征”等不同组合,不是百万行与两万列可以同时任意组合;降低峰值显存也不等于所有跨行计算都变成线性。T7 T15

第四步:分类头怎样利用训练标签?

普通固定分类头常写作 \(\mathrm{softmax}(Wh)\),输出维度和类别数绑定。v3 则采用训练标签检索式分类头:查询与训练表示计算注意力,取训练标签的 one-hot 向量作为 value,再汇总成类别概率。其标签置换等变性有 EquiTabPFN 等前序研究。T7 T10

举一个只有一个头的教学例子:三条训练行标签为 [红, 蓝, 红],某个测试行对它们的注意力权重为 [0.2, 0.5, 0.3]。它得到:

\[\begin{aligned} p(\text{红})&=0.2+0.3=0.5,\\ p(\text{蓝})&=0.5. \end{aligned}\]

把“红”和“蓝”的编号互换,只会互换概率向量里的两个位置。这与直接比较原始特征的 kNN 仍有区别:注意力的相似性来自学到的表示,而且这一步之前已经做过上下文计算。分类头能适配类别数,也不代表整个发布检查点没有限制;v3 报告中的检查点仍有 160 类的实现约束。T7

回归任务输出什么?

以 v2 为例,它用分段常数密度表示连续目标的预测分布,从而允许多峰结果,而不只是输出一个经过 MSE 训练的数值。T3 可以把这种输出理解为“各个数值区间分别有多少概率质量”;区间宽度不同时,概率质量与密度高度还要区分。由分布再提取点预测或分位数,是后续读出选择;分布的存在本身不保证置信区间已经校准。

别把四种“变快”混在一起

路径 改变了什么 仍然要付什么成本
列 → 行汇总 后续主要处理行向量,减少持续携带的特征轴 前端列编码;行间上下文计算;表示容量的取舍 T5
上下文压缩 / 检索 让模型读更少的训练上下文 压缩器或索引;查询与选择;可能遗漏重要样本 T16 T13
蒸馏 用教师预测训练一个便宜的学生 额外拟合成本;只有足够多次预测才可能摊薄 T4
减少执行层数 对部分输入提前结束计算 出口训练与调度;精度与延迟的实测取舍 T18

因此 fit() 很快、单条 predict() 很快和整个系统服务便宜,可以是三种不同的结论。

4. 目前的证据支持到哪里?

小中型表格上,预训练的上下文模型已经构成强基线;它不是所有表格任务的统一赢家。 v2 的 Nature 结果与后续 TabArena 工作值得作为出发点,但排行榜同时受到调参、集成、数据划分和预算影响。报告结果时要锁定基准与版本,而不是只写模型家族名。T3 T11

有三个边界特别影响研究设计。第一,合成任务分布和真实世界并不相同;v2 的开放环境评测已经讨论分布变化等问题,这不能直接当作 v3 仍存在同样缺陷的实验证据。T12 第二,采用结构因果模型生成预训练数据,并不使普通预测接口自动获得干预效应识别能力。第三,真实数据继续预训练后,目标基准是否与预训练任务重叠,成为必须记录的变量。T2 T9

对照实验至少应说明:数据集及划分版本、模型与权重版本、预处理和集成次数、硬件、是否允许目标任务微调、总调参预算。预处理、检索器与校准器只能利用协议允许的数据;时间预测必须按时间切分,测试标签不能参与样本选择。需要同时报告预测质量、冷启动和复用上下文后的延迟,以及峰值显存。

官方产品名中的 “Thinking” 也不能直接解释为深度循环或文本 CoT。公开结构支持什么就写什么,未披露的配方不能靠名称补全。T15

5. 三个值得做成实验的研究方向

以下是基于文献关系提出的研究假设,还没有跑实验,也不声称已经证明新颖性。优先顺序按“先验证问题,再增加方法复杂度”排列。

方向 A · 检索更近的样本,是否反而破坏概率校准?

已有工作与尚需区分的问题。 Localized TabICLv2 已经在学习到的行表示上做 kNN;AWARE 也研究检索与任务的对齐。因此“加一个检索器”本身不够。结合开放环境评测,更具体的问题是:在固定上下文预算下,检索提高局部判别能力的同时,是否改变了模型看到的类别比例,使置信度在分布变化后更不可靠?T13 T17 T12

可证伪假设。 对局部邻域中类别比例偏移明显的任务,混合少量全局分层样本能改善 NLL / Brier score,且不牺牲主要判别指标。先观察偏移与失准是否相关,再考虑修改检索策略。

最小实验。 固定同一个模型、表示空间和总上下文数,例如 256 行。比较随机样本、分层随机、纯 kNN、学习对齐的检索,以及“局部样本 + 全局锚点”;另设仅加校准器的对照。混合比例与校准参数只在验证集选择。用独立数据集与时间/群组划分测试,所有检索候选仅来自允许使用的训练数据。

成功标准与失败条件。 除 AUROC / AUPRC,报告 NLL、Brier、少数类召回和最差群组表现,并计入建索引及查询时间。如果分层随机或普通校准已经达到同样效果,或收益被检索开销抵消,就不支持更复杂的方法。能放下完整上下文的子集还必须加入完整上下文对照。

方向 B · 行表示的瓶颈,会不会吞掉罕见的特征交互?

已有工作与问题。 TabICL 与 v3 把多个特征汇总成行表示;TACO 则主要压缩训练上下文。两者压缩的轴不同,值得先定位:在“小样本、多特征、信号只存在于少数列组合”的条件下,误差到底来自表示容量、先验覆盖,还是有限上下文?T5 T7 T16

可证伪假设。 固定训练预算与上下文大小时,行表示对稀有高阶交互存在可测的容量瓶颈;受控的少量特征旁路能修复这一类错误,而不只是靠增加参数获得普遍收益。

最小实验。 在合成任务中分别控制无关列比例、交互阶数、信号出现频率与样本数,并把未见过的生成机制留作测试;再用真实高维小样本任务检查外推。先改变行向量宽度、特征分组与列顺序,观察错误是否随压缩强度系统变化。只有定位到问题,才加入“行摘要 + 查询相关的少量特征表示”双路径。

必须有的对照。 同预算更宽的行模型、特征选择、随机旁路、无旁路,以及合适的树模型。评测要同时看预测质量、稀有交互子群、训练计算和显存。如果简单增加宽度或筛列就解决了问题,或者打乱列分组后优势消失,应先解释这些现象,而不是宣称新的推理能力。

方向 C · 关系数据上的收益,究竟来自模型还是特征构造?

已有工作与问题。 RelArena-α、TabPFN-Rel 与 RPI 已经把关系表和工具流程纳入研究。接下来可以把特征生成过程单独作为可审计的变量:一项跨表聚合带来提升,是因为它含有可迁移信号,还是因为时间边界、实体重叠或预算不一致?T14 T11

可证伪假设。 在严格时间切分和固定查询预算下,利用特征来源、可用时间与验证集增益进行选择,比无差别扩大跨表聚合更稳定。

最小实验。 先复现现有关系数据流程,固定同一套聚合特征,分别接树模型和表格基础模型;再固定预测器,比较已有流程、随机等量特征与来源感知的选择器。每个特征记录来源表、连接键、时间窗口和计算成本,禁止使用预测时刻之后的记录。用删除特征组的实验估计增益,而非只读注意力权重。

成功标准与失败条件。 报告跨时间、跨实体的质量与总计算预算。如果修正时间切分后提升消失,首先得到的是评测问题;如果树模型取得同样收益,应把贡献归于特征构造,而非 TabPFN 专属优势。这两种结果仍有价值,但论文论点不同。

如果先做一个小项目,我会从方向 A 的诊断实验开始:它可以冻结已有模型,把变量集中在上下文选择和概率质量上。方向 B 需要可控制的训练资源;方向 C 更依赖数据与时间语义。三者都应先复现最近的工作,再决定是否值得新增模型模块。

参考文献与阅读范围

年份通常指 arXiv 首发年,发表时间可能更晚。下面区分已读正文相关章节和仅依据摘要的文献;结论按对应版本记录。研究方向是待验证的提案。

  1. T1 Transformers Can Do Bayesian Inference
    Samuel Müller, Noah Hollmann, Sebastian Pineda Arango et al. · 2021 · arXiv(年份为首发) · 摘要与元数据
  2. T2 TabPFN: A Transformer That Solves Small Tabular Classification Problems in a Second
    Noah Hollmann, Samuel Müller, Katharina Eggensperger et al. · 2022 · arXiv(年份为首发) · 摘要与元数据
  3. T3 Accurate predictions on small data with a tabular foundation model
    Noah Hollmann, Samuel Müller, Lennart Purucker et al. · 2025 · Nature 637, 319–326 · 正文相关章节
  4. T4 TabPFN-2.5: Advancing the State of the Art in Tabular Foundation Models
    Léo Grinsztajn, Klemens Flöge, Oscar Key et al. · 2025 · arXiv(年份为首发) · 正文相关章节
  5. T5 TabICL: A Tabular Foundation Model for In-Context Learning on Large Data
    Jingang Qu, David Holzmüller, Gaël Varoquaux et al. · 2025 · arXiv(年份为首发) · 摘要与元数据
  6. T6 TabICLv2: A better, faster, scalable, and open tabular foundation model
    Jingang Qu, David Holzmüller, Gaël Varoquaux et al. · 2026 · arXiv(年份为首发) · 摘要与元数据
  7. T7 TabPFN-3: Technical Report
    Léo Grinsztajn, Klemens Flöge, Oscar Key et al. · 2026 · arXiv(年份为首发) · 正文相关章节
  8. T8 Fine-tuned In-Context Learning Transformers are Excellent Tabular Data Classifiers
    Felix den Breejen, Sangmin Bae, Stephen Cha et al. · 2024 · arXiv(年份为首发) · 摘要与元数据
  9. T9 Real-TabPFN: Improving Tabular Foundation Models via Continued Pre-training With Real-World Data
    Anurag Garg, Muhammad Ali, Noah Hollmann et al. · 2025 · arXiv(年份为首发) · 摘要与元数据
  10. T10 EquiTabPFN: A Target-Permutation Equivariant Prior Fitted Networks
    Michael Arbel, David Salinas, Frank Hutter · 2025 · arXiv(年份为首发) · 摘要与元数据
  11. T11 TabArena: A Living Benchmark for Machine Learning on Tabular Data
    Nick Erickson, Lennart Purucker, Andrej Tschalzev et al. · 2025 · arXiv(年份为首发) · 摘要与元数据
  12. T12 Realistic Evaluation of TabPFN v2 in Open Environments
    Zi-Jian Cheng, Zi-Yi Jia, Zhi Zhou et al. · 2025 · arXiv(年份为首发) · 摘要与元数据
  13. T13 Localized TabICLv2: Scaling Tabular In-Context Learning through k-NN
    Beimnet Bekele Guta · 2026 · arXiv(年份为首发) · 摘要与元数据
  14. T14 Advancing Open and Reproducible Relational Learning: RelArena-α, TabPFN-Rel and RPI
    Adrian Hayler, Klemens Flöge, Alan Arazi et al. · 2026 · arXiv(年份为首发) · 摘要与元数据
  15. T15 TabPFN models and version capabilities
    Prior Labs · 2026 · 模型文档 · 官方文档
  16. T16 End-to-End Compression for Tabular Foundation Models
    Guri Zabërgja, Rafiq Kamel, Arlind Kadra et al. · 2026 · arXiv(年份为首发) · 摘要与元数据
  17. T17 Retrieval-aligned Tabular Foundation Models Enable Robust Clinical Risk Prediction in Electronic Health Records Under Real-world Constraints
    Minh-Khoi Pham, Thang-Long Nguyen Ho, Thao Thi Phuong Dao et al. · 2026 · arXiv(年份为首发) · 摘要与元数据
  18. T18 TabSwift: An Efficient Tabular Foundation Model with Row-Wise Attention
    Si-Yang Liu, Han-Jia Ye · 2026 · arXiv(年份为首发) · 摘要与元数据

关联笔记:Loop LLM:同一组参数,多算几遍为什么会更好?