SheepNav
新上线今天0 投票

算子感知混合精度容差校准:让张量核测试更精准

从“拍脑袋”到数据驱动:张量核测试的容差校准新思路

在深度学习模型的开发与部署中,**张量核(Tensor Kernel)**的正确性测试是保障模型可靠性的关键一环。然而,当前主流做法是使用固定的“all close”检查,搭配人工指定的绝对和相对容差(atol/rtol)。这些阈值往往在不同测试间直接复制,很少根据实际算子行为进行动态调整。

近日,一篇 arXiv 论文(arXiv:2607.16228)提出了一种算子感知的混合精度容差校准方法,通过挖掘大规模云 GPU 运行数据,为每个测试用例自动确定更合理的容差阈值。

核心发现:手工容差过于宽松

研究团队基于 gpuemu 语料库中的 26 个测试条目和 2 种数据类型,收集了累计 8,076 行结果数据。他们分析每个测试用例的元素级误差分布,并提出一个关键问题:在正确实现下,内核本身能证明多大的绝对容差?

答案令人惊讶:自动校准的容差比手工设定的要严格得多。例如,attention_triton 在 fp16 精度下的容差可收紧 2,184 倍。这意味着很多原本通过测试的代码可能实际上存在细微错误。

实战效果:Bug 检测率提升 9.3 个百分点

为了验证方法的实用性,论文聚焦于语料库中 7 个 LLM 风格的错误变体(每个都有对应的正确实现)。使用校准后的 per-(op, dtype) 容差,Bug 检测召回率从 73.2%(1,805/2,467)提升至 82.4%(2,034/2,467),绝对提升了 9.3 个百分点,多检测出 229 个新错误

副作用是误报率略有上升:在 1,882 个正确控制案例中,误报从 0 增加到 20 个(+1.1 个百分点)。但考虑到检测收益,这一权衡是值得的。

行业意义:通向更可靠的 AI 基础设施

这项工作对 AI 工程化实践有直接启示:

  • 告别“一刀切”:不同算子、不同数据类型有独特的误差分布,统一容差会掩盖真实问题。
  • 数据驱动校准:利用云 GPU 运行积累的误差数据,可以自动生成更精准的测试标准。
  • LLM 场景尤其受益:大型语言模型依赖大量张量运算,更严格的测试有助于提前发现数值不稳定或实现错误。

该方法已作为 8 页短文以 LNCS 格式发表,并有一系列配套论文(如 arXiv:2606.20128)进一步探讨相关主题。

小结

这项研究提醒我们,在快速迭代的 AI 框架和硬件中,测试本身也需要持续优化。算子感知的容差校准不仅提升了测试的敏感性,也为混合精度训练和推理的可靠性提供了新工具。未来,随着更多 GPU 运行数据的积累,这种数据驱动的方法有望成为行业标准。

延伸阅读

  1. America needs to stop getting shocked by Chinese AI
  2. ‘It’s a Modern-Day Draft’: Why Stanford Students Walked Out on Sundar Pichai’s Commencement Speech
  3. Best tablets for note-taking 2026: Expert tested and reviewed
查看原文