SheepNav
新上线今天0 投票

PhantomFill:当表单要求答案,语言模型便自行编造

核心发现:格式压力下的“被迫幻觉”

一项来自 arXiv 的新研究揭示了语言模型在生产环境中的一个隐蔽但普遍的缺陷:当模型被要求填充固定格式(如 JSON 字段、函数参数)而非自由文本时,它们会凭空编造答案,即使用户明确告知“信息不足”。

该研究的作者 Rana Muhammad Usman 构建了 PhantomFill 基准测试,通过设计无法回答的问题来探测模型的诚实性。例如,一条显示 12,400 次点赞但没有任何可见回复的帖子,或一个通话从未被转录的支持工单。在自由文本模式下,GPT-5.5 有 98% 的概率会诚实回答“没有回复数据”。但一旦要求输出一个必填的 JSON 字段(如情感分析),同一模型在 40 次测试中全部编造了答案——它虚构了从未见过的观众情绪,甚至杜撰了从未听过的客户引语。

数据触目惊心:必填字段是“幻觉催化剂”

研究对 13 个模型进行了系统测试,结果呈现惊人的一致性:

  • 必填字段驱动 100% 编造率:在 10 个模型中,只要字段被标记为“必填”,模型便 100% 产生虚构内容。
  • “信息不足”选项形同虚设:即使提供了明确的“证据不足”选项,9 个开源模型全部选择忽略,继续编造。
  • 直接指令被架构覆盖:对 6 个模型下达“不要推断情感”的明确指令,其中 4 个模型仍然因为 schema 要求而强行输出情感分析结果。

值得注意的是,模型规模与诚实性并非线性关系:在同一模型家族中,最小的模型选择了拒绝回答,中等规模的模型开始编造,而最大的模型又重新变得诚实。这说明“在格式压力下保持诚实”是一种训练结果,但目前几乎没有团队在衡量这一指标。

问题根源:幻觉藏在格式的“缝隙”里

研究指出,问题的核心在于生产环境中的模型从不写散文——它们填充的是 JSON 字段、函数参数和抽取模板。而这些格式中的必填枚举类型最小数量数组恰恰是模型无法进行免责声明的地方。当模型被要求提供一个必填的情感标签时,它无法输出“无法确定”,只能强行给出一个情感值——无论对错。

解决方案与启示

研究团队提出了一种简单的修复方案:在 schema 中增加一行代码,允许字段明确标记“证据不足”。但更根本的启示在于:当前对模型幻觉的评测几乎都基于自由文本生成,严重低估了生产环境中的真实风险。PhantomFill 基准提供了两个可量化的指标:强制编造率(Coerced Fabrication Rate)回避选项利用率(Escape Utilization Rate),旨在推动行业关注这一被忽视的角落。

对于 AI 开发者而言,这一发现意味着:在构建基于 LLM 的表格填充、数据抽取等应用时,必须对必填字段的输出进行额外的验证与约束,否则模型可能会在用户不知情的情况下“创造事实”,带来不可预测的业务风险。

延伸阅读

  1. 多模态CoLRAG-TF:三重过滤检索破解复杂PDF文档难题
  2. 循环Transformer中的自适应深度:诊断学习型停止门与轨迹读出机制
  3. 生成式贝叶斯滤波:用条件变分自编码器突破状态估计瓶颈
查看原文