测量依赖缺口:诊断表格生成模型中的列间保真度
表格数据合成技术旨在保留单列边际分布的同时,更关键的是保留列间依赖关系——这种结构承载了不平衡领域(如欺诈检测和临床风险)中少数类的大部分判别信号。然而,最新研究揭示了一个令人担忧的现象:当前最常用的合成数据认证指标在很大程度上对列间依赖关系“视而不见”。
来自 arXiv 的最新论文(2607.21636)通过实验证明,一个完全独立建模每一列(从而破坏所有依赖关系)的基线模型,在使用逻辑回归分类器进行两样本测试(C2ST)时,竟被判断为与真实数据无异;而常用的成对趋势评分(Trend score)也仅部分敏感。这种“依赖盲区”意味着,即使合成数据完全丢失了列间结构,现有指标仍可能给出虚假的保真度评分。
依赖感知诊断框架
为解决这一问题,研究者提出了一种依赖感知的保真度诊断方法。该方法将强分类器两样本测试(XGB-C2ST)分解为边际、依赖和数值-类别交叉三个组件,并以两个极端为锚点:最坏情况是完全因子化参考(所有依赖被破坏),最佳情况是真实数据。通过将这一框架应用于最先进的流匹配生成器(TabbyFlow/EF-VFM),研究者发现了一个真实存在的依赖缺口,而标准指标完全遗漏了它。
依赖缺口的实际影响
研究进一步量化了依赖缺口的后果:彻底破坏依赖关系会导致少数类效用急剧下降,而生成器残留的依赖缺口虽然较小,但仍会造成一致的效用损失。这意味着,即使合成数据的边际分布完美,如果列间依赖关系失真,其在少数类识别等下游任务中的价值将大打折扣。
缺口根源探析
那么,这个依赖缺口是否反映了平均场生成目标的结构性局限?答案是否定的。根据变分流匹配的最新恢复结果,该目标在渐近意义上是精确的。然而,缺口却异常顽固:将模型容量扩大16倍也无法关闭它。这指向了问题的核心——缺乏直接的依赖监督,而非容量或结构限制。
更令人警醒的是,由于残留缺口属于高阶依赖,任何简单的干预措施均告无效:无论是模型内部的依赖机制、事后copula修正,还是16倍的容量扩展,都无法弥补这一缺口。这一结论对业界普遍假设的“修复手段有效”提出了严肃警告。
行业启示
对于依赖合成数据做模型训练、数据增强或隐私保护的应用方,这项研究提供了一个重要提醒:仅依赖传统指标(如C2ST、趋势评分)来评估合成数据质量是远远不够的。在欺诈检测、临床风险建模等高度依赖列间关联的场景中,必须引入依赖感知的评估工具,否则合成数据可能“形似而神不似”,导致下游模型性能严重退化。
论文提出的诊断框架有望成为业界新的评估标准,推动表格生成模型从“拟合边际分布”向“真正理解数据依赖结构”演进。



