SheepNav
精选今天0 投票

随机采样在认知上是浅薄的:LLM中温度变化与模型多样性之间的维度差距

大型语言模型(LLM)在重复运行时给出不同答案,这种随机性是否揭示了模型不知道什么?一项新研究给出了否定的答案。来自arXiv的论文《随机采样在认知上是浅薄的:LLM中温度变化与模型多样性之间的维度差距》指出,仅通过调整温度参数(如τ=1)获得的随机采样,虽然能通过多数投票提供每个问题的不确定性估计,但无法揭示跨问题的结构——即相关问题是否同时出现错误,而这正是多样化模型集成所能做到的。

方法对比

研究者比较了两种方案在同一组问题上的表现:

  • 单模型多次采样:一个LLM在温度τ=1下运行100次
  • 多模型集成:24个不同LLM各运行一次,温度τ=0

使用Marchenko-Pastur随机矩阵检验来区分信号与采样噪声。结果发现:

  • 在五个模型家族和三个基准测试(MMLU、HellaSwag、GSM8K)上,单模型内部最多只有一个维度高于噪声水平。
  • 而集成方案中,有四个特征值显著高于噪声阈值;相比之下,匹配难度的伯努利零模型在500次蒙特卡洛模拟中最多出现一个。

核心结论

自一致性(Self-consistency) 能够提供准确的每个问题的不确定性,但无法检测到跨问题结构;只有多样化集成才能揭示模型真正不知道什么

行业启示

这项研究对当前LLM应用有重要影响:

  • 许多生产系统依赖温度采样来获取多样性,但论文表明这种多样性是“认知浅薄”的——它只是表面波动,没有反映模型知识的深层结构。
  • 相比之下,使用多个不同模型集成虽然计算成本更高,但能提供更丰富的不确定性信号,尤其在需要跨问题一致性评估的场景(如考试、医疗诊断)中更有价值。

论文已被EIML@ICML 2026接收,作者为Izhar Ali。该工作提醒社区:随机采样并非万能,模型多样性才是关键。

延伸阅读

  1. AINTMA:多智能体AI架构如何将软件测试管理带入自主质量智能时代
  2. ClickGuard:用信息度量和大语言模型识别并“剧透”点击诱饵新闻
  3. JAXBench:为TPU内核自动优化设立新标杆
查看原文