SheepNav
精选今天0 投票

FormulaSPIN:用自对弈微调突破自然语言生成电子表格公式的瓶颈

突破数据瓶颈:自对弈框架 FormulaSPIN 让 AI 自学写公式

电子表格软件全球用户数以亿计,但编写公式始终是普通用户的一大障碍。现有方法依赖静态监督数据,在有限标注上很快达到性能天花板。近期一篇被 ACL 2026 主会接收为 Oral 的论文提出了 FormulaSPIN,一种基于自对弈(self-play)的微调框架,无需额外数据即可实现迭代式自我改进,在 NL2FORMULA 基准上达到 74.9% 精确匹配87.1% 执行准确率,超越了传统监督微调(SFT)和前沿闭源模型。

为何标准自对弈会失败?

自对弈微调(SPIN)在语言模型领域已展现潜力,但直接应用于公式生成时却遭遇困境:它会对所有不匹配的输出统一惩罚,导致执行等价但形式不同的公式被错误地当作负样本,产生矛盾梯度。例如,=SUM(A1:A10)=A1+A2+...+A10 在功能上等价,但 SPIN 会将后者判为错误,造成训练信号混乱。

FormulaSPIN 的解决方案:利用可执行性作为隐式监督

FormulaSPIN 的核心洞察在于:公式生成任务天然具备 二进制可执行性——公式是否正确可以通过执行结果直接验证。这一特性可以将语义错误与有效的风格变体分离开来。

框架将训练过程建模为一个 双人博弈

  • 主玩家(当前模型)学习偏好真实标注公式而非旧版本生成的公式;
  • 执行反馈 将输出按粒度排序,构建自适应课程(curriculum),先纠正语义错误,再优化风格。

此外,论文引入 ExecVote 机制:在语义层面进行投票,自然处理多个有效表述。例如,对于计算总和的请求,SUM+ 运算符的不同写法都能被认可,从而提升模型对多样性的包容度。

实验结果:SOTA 且无需偏好标注

在多个基准测试上,FormulaSPIN 均取得最优结果:

  • NL2FORMULA 数据集:精确匹配 74.9%,执行准确率 87.1%;
  • 与使用额外偏好标注(如人类反馈)训练的模型性能相当;
  • 显著优于传统 SFT 方法以及 GPT-4 等闭源模型。

行业意义与未来展望

这项工作展示了自对弈在数据稀缺任务上的巨大潜力。传统上,训练高质量公式生成模型需要大量人工标注的(自然语言,公式)对,成本高昂且难以覆盖长尾场景。FormulaSPIN 通过利用执行结果作为天然监督信号,大幅降低了对人工标注的依赖。

论文作者指出,该框架不仅限于电子表格领域,未来可推广到其他可执行领域(如代码生成、数据库查询等)。随着 AI 办公助手竞争日趋激烈,这种能自我进化的模型可能成为下一波生产力工具的核心引擎。

延伸阅读

  1. 随机原始-对偶解码:为多目标生成式推荐系统而生
  2. NEXUS:为工具调用型LLM智能体构建结构化运行时安全监控
  3. 大语言模型的信息辨别能力:研究发现模型在来源可信度和事实判断上均存在显著缺陷
查看原文