SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:Anthropic清除筛选 ×

## 从“反事实”到“先验信念”:重新定义好的解释 解释(explanation)的质量,长期以来是哲学领域的核心议题。随着大语言模型(LLM)在医疗、法律、金融等高风险领域的广泛应用,AI的可解释性再次成为焦点。然而,什么才是“好的解释”?一篇发表于arXiv的新论文(编号:2606.14838)提出了一个融合反事实推理与对话者先验信念的定义,并深入分析了为何LLM的输出难以被良好解释。 ### 定义:好的解释需“改变信念” 研究者认为,一个好的解释必须能够修正或影响接收者的认知。他们借鉴了反事实解释(counterfactual explanation)的思路——即解释应揭示“如果某因素不同,结果会如何”。但仅此不够:解释的有效性还取决于接收者**对每个可能被引用事实的已有信念**。例如,对一个相信“所有AI都是黑箱”的人,解释LLM的推理链可能毫无意义;而对一个熟悉神经网络的人,同样的解释则可能奏效。因此,好的解释必须动态适配接收者的知识背景。 ### LLM的三大解释困境 论文进一步指出,LLM输出之所以难以被良好解释,主要源于以下挑战: 1. **内部机制的黑箱性**:LLM的决策路径高度复杂、非线形,难以映射为人类可理解的因果链条。即便采用反事实方法,也很难定位“关键输入变化”。 2. **语言输出的歧义性**:LLM生成的文本本身可能包含模糊、隐喻或错误信息,导致解释与输出之间的对应关系不明确。 3. **接收者信念的多样性**:不同用户对LLM的信任度、技术理解差异巨大,一个统一的解释框架难以覆盖所有场景。 ### 对AI可解释性的启示 该研究为当前的可解释AI(XAI)领域提供了重要视角:**解释不是单向的信息输出,而是基于接收者认知状态的交互过程**。这意味着,未来的可解释性工具可能需要引入用户建模(user modeling)模块,实时评估用户的先验知识并动态调整解释策略。 对于LLM开发者而言,这一结论也暗示:单纯提供注意力权重或特征重要性列表远远不够。更有效的做法可能是设计**交互式解释界面**,允许用户追问、比较反事实场景,甚至纠正模型误解。 尽管论文尚未提供具体的实现方案,但它为“好解释”树立了一个更具包容性的标杆——不仅要“正确”,更要“有用”于特定的人。在AI逐步嵌入日常决策的今天,这一思考或将推动可解释性研究从“技术优化”转向“人机协作的认知设计”。

Anthropic2个月前原文

前沿推理调优语言模型在执行深度演绎任务时仍会失败,且通过扩展内部推理来提升性能的成本高昂。符号委托提供了一条互补路径:语言模型负责翻译问题,而求解器执行推理。然而,当前面向逻辑编程的自动形式化流程通常是针对特定任务或智能体的定制集成。我们提出了 **PrologMCP**,一个任务无关、开源的服务器,通过模型上下文协议(MCP)将 Prolog 暴露为有状态工具。其紧凑的工具接口、结构化错误报告以及基于会话的隔离机制,使得“翻译-运行-检查-修复”循环成为 MCP 智能体的可复用原语。我们在 PARARULE-Plus 的两个子集上评估了增强 PrologMCP 的形式化智能体与标准及推理 LLM(Claude Sonnet 4.6、GPT-4.1 和 o4-mini)的表现:一个通用样本,另一个更具挑战性,针对自然语言推理的特定失败模式。在通用样本上,形式化智能体匹配或超越推理 LLM(准确率 1.00 vs. 1.00 / 0.998),相比标准模型提升最大(GPT-4.1 为 0.762)。在挑战性子集上,形式化智能体保持接近完美(1.00 / 0.99),而推理 LLM 下降至 0.95 / 0.94。这些结果表明,通过 MCP 将推理委托给 Prolog 是扩展自然语言推理的一种稳健且可检查的替代方案。

Anthropic2个月前原文

时间序列预测是金融、气象、能源等领域的核心任务,传统模型依赖历史模式外推,但在非平稳环境下,单纯基于数值相似度的检索往往失效。来自 ICML 2026 工作坊的新研究提出 **SERAF**(Semantics-Enhanced Retrieval-Augmented Time Series Forecasting)框架,通过引入文本语义信息,实现数值与语义的双重检索,显著提升了非平稳序列的预测能力。 ## 从 RAG 到时间序列:检索为何不够? 受检索增强生成(RAG)启发,已有研究尝试从历史数据中检索与当前片段相似的序列段来辅助预测。然而,当数据分布发生漂移(即非平稳性)时,数值相似度高的历史片段可能对应完全不同的未来走势,导致检索“南辕北辙”。例如,股市在牛熊转换期,量价形态相似但后续走势迥异,纯数值检索无法捕捉这种隐含的语义变化。 ## SERAF 的双重检索机制 SERAF 的核心创新在于**多模态检索**:不仅检索时间序列本身,还检索由序列自动生成的文本描述。具体来说,框架包含三个关键步骤: 1. **文本描述生成**:利用预训练语言模型将每个时间序列片段转化为自然语言描述,如“上升趋势伴随成交量放大,随后出现顶部反转形态”。 2. **双重检索**:以当前序列及其文本描述为查询,分别从历史数据库中检索数值相似的片段和语义相似的片段,得到两组互补的候选集合。 3. **选择性融合**:通过注意力机制或门控网络,自适应地融合两组检索结果中的历史模式及对应未来值,生成最终预测。 这种设计使得模型在数值相似度低但语义相似度高的情况下(如不同资产但具有相同技术形态),仍能有效利用历史经验。 ## 实验结果与行业意义 在七个真实数据集(涵盖电力、交通、气象、金融等领域)上的实验表明,SERAF 在均方误差和平均绝对误差上均显著优于包括 Transformer、N-BEATS、TimesNet 在内的最新基线模型。尤其在非平稳性较强的金融时间序列上,SERAF 的预测精度提升超过 15%。 该研究揭示了**语义信息在时间序列分析中的巨大潜力**。随着大语言模型的发展,将数值信号与文本语义结合正成为 AI for Science 的新方向。SERAF 不仅为时间序列预测提供了新范式,也为其他依赖历史检索的时序任务(如异常检测、缺失值填补)提供了可借鉴的思路。 ## 小结 SERAF 框架通过引入语义增强的检索,有效弥补了纯数值方法在非平稳场景下的不足。它标志着时间序列预测从“数值驱动”迈向“语义+数值双轮驱动”的阶段。尽管文本生成质量与计算开销仍是挑战,但该工作无疑为领域打开了新的研究窗口。

Anthropic2个月前原文

记忆的形成是智能的核心,但深度神经网络是否像生物大脑一样,存在可识别的记忆单元?来自韩国基础科学研究院等机构的研究人员提出了一种名为“AI 印痕”(AI Engram)的几何框架,尝试从神经网络的参数中分离出与特定记忆对应的结构,并实现记忆的精准编辑。该成果已被 ICML 2026 接收为 Oral 论文。 ## 从生物记忆到人工神经网络 在神经科学中,“印痕”(engram)指大脑中与特定记忆相关的物理或化学变化。研究者将这一概念引入 AI,定义了四个标准:**特异性**(特定记忆对应特定参数)、**再激活**(参数能重现记忆)、**充分性**(参数足以重建记忆)和**必要性**(缺失参数则记忆丢失)。他们将这一生物学问题形式化为一个约束逆问题,并推导出闭式解,该解等价于参数流形上的自然梯度更新。 ## 记忆的线性算术 AI 印痕的独特之处在于,它允许通过线性运算对知识进行手术级操控。例如,将多个记忆的印痕向量相加可实现记忆组合,相减则可定向擦除——整个过程无需迭代优化。实验涵盖从简单多层感知器到大型语言模型,验证了该方法的因果有效性和可扩展性。 ## 意义与展望 这一研究不仅为理解深度网络的分布式存储机制提供了几何视角,还可能带来实用价值:比如在模型微调中精准移除有害记忆,或在联邦学习中隔离特定用户数据。不过,目前方法在超大规模模型上的计算开销仍有待优化。 **论文信息**: - 标题:AI Engram: In Search of Memory Traces in Artificial Intelligence - 作者:Jea Kwon, Dong-Kyum Kim 等 - 收录:ICML 2026 (Oral) - 代码:已开源

Anthropic2个月前原文

## 当Transformer遇上调度难题:小模型也能解决大问题 在制造业、服务业等众多领域,**开放车间调度问题(OSSP)** 一直是优化决策的核心挑战。随着任务(jobs)和机器(machines)数量的增加,问题的复杂度呈指数级增长,传统精确方法很快变得不可行。经典的分派规则和元启发式算法虽然实用,但在大规模场景下往往需要大量调参才能维持解的质量。 近日,一篇发表于 arXiv 的研究提出了一种基于 **深度强化学习(DRL)** 与 **Transformer 架构** 的调度策略,为 OSSP 的求解提供了全新思路。 ### 模型设计:编码器-解码器 + 多头注意力 研究团队采用 Transformer 的编码器-解码器结构,利用多头注意力机制来捕捉作业与机器之间的复杂依赖关系。模型的输入极为简洁——**仅使用加工时间矩阵**,无需额外特征工程。训练阶段在 Taillard 基准实例(包括 4×4、5×5、7×7 和 10×10 的小规模问题)上进行,通过强化学习优化调度策略。 ### 性能表现:小样本训练,大场景泛化 在标准测试集上,模型生成的调度方案其 **makespan(最大完工时间)** 通常保持在已知最优值的 **15%-30%** 以内。更具价值的是其泛化能力:**将训练好的策略直接应用于未见过的、规模大幅增加的问题**(从 40×40 到 100×100),无需任何微调或重新训练。 研究人员将模型与四种经典分派规则——**SPT(最短加工时间)、LPT(最长加工时间)、MWKR(最大剩余工作量)和 EST(最早开始时间)**——进行了对比。结果显示: - Transformer 策略与 **EST** 性能相当,差距微小; - 显著优于 **SPT 和 LPT**; - 相对于标准下界,平均差距仅为 **12.89%-15.12%**。 ### 行业意义:轻量级、可迁移的智能调度 这项研究的核心突破在于证明了 **“小模型也能解决大问题”**:一个在小型实例上训练的 Transformer 策略,可以零成本迁移至大规模场景,且性能不输甚至超越精心设计的启发式规则。这意味着,企业无需为每个规模的调度问题单独开发算法,只需训练一次,即可应对不同规模的调度需求。 未来,这种方法有望与实时生产数据结合,成为智能制造中动态调度决策的轻量级解决方案。不过,研究也指出当前模型在极端规模下的表现仍有提升空间,如何进一步缩小与最优解的差距,将是后续工作的重点。

Anthropic2个月前原文

## 快讯:UP-NRPA 让对话策略“因人而异”,无需离线训练即可实现100%任务成功率 大型语言模型(LLM)在目标导向对话系统中扮演着越来越重要的角色,但一个长期存在的痛点在于:对话策略难以动态适应不同用户的个性、偏好和目标。传统方法通常依赖离线强化学习为特定用户群体训练策略模型,一旦用户画像发生变化,系统便显得僵化。 近日,一篇发表在 arXiv 上的论文(arXiv:2606.13683)提出了一种名为 **UP-NRPA(User Portrait based Nested Rollout Policy Adaptation)** 的在线框架,旨在解决这一难题。该框架将 LLM 与嵌套展开策略适应(Nested Rollout Policy Adaptation)相结合,通过实时构建用户画像并据此动态调整对话策略,实现了无需模型训练的个性化交互。 ### 核心机制:从“用户画像”到“策略定制” UP-NRPA 的核心在于“用户画像”的实时构建与利用。系统会从当前对话中提取用户的个性特征、偏好以及目标,形成一个动态更新的用户画像。在此基础上,框架通过 **嵌套展开策略适应** 机制,在每次对话决策时进行多步推演,并依据用户画像对每一步进行评估和调整,从而生成最优的对话策略。 与依赖离线强化学习的方法不同,UP-NRPA 完全在线上运行,无需预先训练任何策略模型。这意味着它可以灵活适应从未见过的用户类型,并且能够随着对话的进行实时调整策略。 ### 实验表现:谈判任务成功率提升显著 论文在协作型和非协作型对话基准上对 UP-NRPA 进行了评估,结果令人瞩目: - **多项对话任务中实现了100%的成功率**。 - 在最具挑战性的**谈判任务**中,系统的 **销售与列表比(Sale-to-List Ratio, SL)** 提升了 **56.41%**。 这一数据充分证明了 UP-NRPA 在适应多样化用户需求方面的强大能力。尤其是在非协作场景(如谈判)中,用户目标往往存在冲突,传统固定策略很难兼顾双方利益,而 UP-NRPA 通过实时用户画像实现了策略的动态平衡。 ### 行业意义:走向真正的个性化对话 AI UP-NRPA 的提出为对话系统的发展提供了新思路。当前,无论是客服机器人、虚拟助手还是教育辅导系统,都面临着“千人一面”的困境。用户对对话的期待高度个性化,而训练一个通用模型往往无法满足所有场景。UP-NRPA 的“零训练”特性意味着开发者无需为每种用户画像准备大量标注数据,降低了部署成本。 当然,该框架也存在潜在挑战:实时构建用户画像需要高效的推理能力,而嵌套展开策略的计算复杂度可能较高。不过,随着 LLM 推理效率的提升和边缘计算的普及,UP-NRPA 有望在未来的对话系统中发挥关键作用,推动 AI 从“能对话”向“懂用户”迈进。

Anthropic2个月前原文

## 突破模态壁垒:Orchestra-o1 如何实现全模态智能体高效协作? 随着大语言模型(LLM)的演进,AI 智能体正从单打独斗走向群体协作。然而,现有编排框架大多局限于单一或少数模态,难以应对文本、图像、音频、视频等异构信息共存的复杂场景。近日,arXiv 上发布了一项名为 **Orchestra-o1** 的新研究,提出了一种全模态(omnimodal)智能体编排框架,旨在解决这一痛点。 ### 从单模态到全模态:编排框架的进化 传统智能体编排系统通常为特定模态设计,如纯文本的代码生成或图像识别。但在真实世界中,任务往往需要同时处理多种信息源——例如,一个视频分析任务可能同时涉及画面、对话字幕和背景音乐。Orchestra-o1 的设计核心在于**统一编排机制**,它能够智能地将复杂任务分解为若干子任务,并为每个子任务动态分配或生成专门的子智能体(sub-agent)。这些子智能体可以并行执行,最终将结果汇总,从而大幅提升处理效率和准确性。 ### 关键技术:DA-GRPO 强化学习 除了编排架构本身,团队还提出了一种名为 **决策对齐群组相对策略优化(DA-GRPO)** 的强化学习方法,用于训练 Orchestra-o1-8B 模型。DA-GRPO 通过将智能体的决策过程与任务目标对齐,显著提升了模型在多模态场景下的推理和协调能力。实验表明,基于该方法的 8B 参数模型在所有开源全模态智能体中达到了**最先进性能**。 ### 性能表现:超越现有方案10.3% 在专为全模态任务设计的 **OmniGAIA 基准测试** 中,Orchestra-o1 的表现超越了第二名方法 10.3% 的准确率。这一提升不仅证明了框架的有效性,也为未来更复杂的多模态应用——如自动驾驶、机器人交互、多媒体内容创作等——提供了可行的技术路径。 ### 行业影响与展望 Orchestra-o1 的出现,标志着智能体编排从“多模态并行”向“全模态融合”迈出了重要一步。随着物联网设备日益丰富,数据形式愈发多样,能够统一协调文本、图像、音频、视频的智能体系统将成为刚需。该框架的开放性和可扩展性也意味着开发者可以基于它构建定制化的多模态应用。 不过,研究也指出,当前框架在处理超长视频流或实时性要求极高的场景时仍有优化空间。未来,如何进一步降低计算开销、提升动态子智能体生成效率,将是团队重点攻克的方向。 对于 AI 从业者而言,Orchestra-o1 提供了一个值得关注的新基线——它不仅提升了多模态任务的上限,也为智能体系统的模块化设计提供了新思路。

Anthropic2个月前原文

## 从“静态推理”到“自主进化”:HOTE 如何重塑 AI 深度研究能力 当前,大语言模型在深度研究任务中已展现出强大的信息检索与整合能力,但一个根本性瓶颈始终存在:**模型的参数能力在部署后是静态的**,无法像人类研究者那样在探索过程中持续学习和进化。与此同时,智能体进化(Agent Evolution)虽能让模型通过与环境交互积累经验,但其有效性多局限于有标准答案的可验证任务,与开放式的深度研究场景存在显著鸿沟。 来自 arXiv 的最新论文《Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher》(arXiv:2606.13710)提出了一种名为 **HOTE(混合开放式三元进化)** 的框架,试图弥合这一差距。该框架的核心思想是:**让深度研究系统中的三个关键角色——提议者(Proposer)、求解者(Solver)和评判者(Judge)——通过混合模式的强化学习协同进化**,从而在开放式环境中实现自主能力提升。 ### 三元协同:提议、求解与评判的闭环 HOTE 的设计灵感来源于科学研究中的“假设-实验-验证”循环。具体而言: - **提议者**:负责根据当前研究问题,提出可能的子问题或探索方向。 - **求解者**:针对提议者提出的子问题,从网络规模的知识库中检索并整合信息,生成答案。 - **评判者**:评估求解者给出的答案质量,并提供反馈信号,用于指导提议者和求解者的进化。 这三个模块并非独立训练,而是通过**混合模式强化学习**实现联合进化。论文作者指出,这种设计的关键在于:**进化必须同时发生在三个模块上,缺一不可**。实验表明,仅进化其中一两个模块,性能提升远不如三者协同进化。 ### 性能突破:8B 模型超越 32B 静态模型 最令人印象深刻的成果来自实验部分。研究团队在三个长格式深度研究基准上对 HOTE 进行了评估,结果显示:**一个仅 80 亿参数的模型(8B),经过 HOTE 框架训练后,不仅超越了所有静态的开源 8B 到 32B 模型,还优于使用现有最先进深度研究训练方法得到的模型**,并且训练时间开销更小。 这一结果意义重大:它表明**模型规模并非决定深度研究能力的唯一因素**,通过巧妙的进化机制设计,较小模型也能在开放式任务中实现超越。这也为资源有限的团队提供了新的可能性——不必一味追求超大参数模型,而是通过训练范式的创新来提升能力。 ### 行业启示:从“工具”到“研究者”的转变 HOTE 的提出,标志着 AI 深度研究正在从“静态工具”向“自主进化体”迈进。传统上,我们训练一个模型,然后冻结其参数用于推理;而 HOTE 这类框架则让模型在每次研究任务中都能根据反馈调整自身策略,逐渐积累“研究经验”。 当然,论文也承认当前框架仍存在局限:例如,进化过程依赖于评判者提供的反馈质量,而评判者本身也可能存在偏差。此外,在极端开放且缺乏明确评价标准的研究场景中,如何设计有效的进化目标仍是开放问题。 尽管如此,HOTE 为智能体进化与深度研究的融合提供了一个坚实的技术路径。随着类似框架的成熟,未来的 AI 研究者或许将不再是“一次性训练”的产物,而是能够像人类一样,在每一次探索中不断成长。

Anthropic2个月前原文

arXiv:2606.13722v1 Announce Type: new Abstract: This paper introduces YeasierAgent, an application-building paradigm based on symbiotic agents, narrative worlds, and scene-aware interaction. It challenges the conventional device-coupled model of software by redefining applications as collaborative spaces among users, agents, and worlds. We present a system architecture that achieves two primary contributions: (1) enabling the rapid, cross-platform construction of agent-native applications by uti

Anthropic2个月前原文

近日,一篇 arXiv 论文《WorkBench Revisited: Workplace Agents Two Years On》重新审视了 2024 年推出的职场智能体基准测试 WorkBench,揭示了两年间 AI 智能体的巨大进步。数据显示,2024 年 3 月最佳智能体 GPT-4 仅能完成 43% 的任务,且 26% 的任务中会出现意外有害行为(如发错邮件);而到 2026 年 6 月,**Claude Opus 4.8** 以 **89%** 的任务完成率和仅 **2.5%** 的意外有害行为率大幅领先。 ### 能力与安全不再对立 论文指出,在 WorkBench 上,**能力与安全呈现正相关**,而非传统的权衡关系。即完成任务越多的模型,造成的意外损害反而越少。这一发现打破了“更强能力必然伴随更高风险”的固有认知,为开发更可靠的 AI 智能体提供了积极信号。 ### 错误尚未根除 尽管进步显著,前沿模型仍会犯一些**基本错误**,例如向错误收件人发送邮件,且这类错误有时会导致不可逆的后果。这表明,虽然多数错误类型已被消除,但安全护栏仍需进一步完善。 ### 开源模型崛起,成本大幅降低 论文特别强调了**开源权重模型**的崛起。它们以极低的成本达到了此前仅专有模型才能实现的性能水平,而前沿模型的成本则保持相对稳定。这一趋势有望推动 AI 智能体在更广泛场景中的落地应用。 ### 基准测试更新 研究团队同步发布了 WorkBench 的更新版本,包含数据与代码质量改进、最新模型得分,以及自 2024 年以来的智能体进展分析。 总体而言,WorkBench 的两年回顾展示了 AI 智能体在职场任务中的显著进步,尤其是在安全性与能力的协同提升方面。然而,基本错误的持续存在提醒我们,通往完全可靠的自主智能体仍有很长路要走。

Anthropic2个月前原文

## 泥孩子谜题:一个关于知识与无知的经典,它的起源竟跨越两个世纪? 在人工智能与认知逻辑领域,有一个流传甚广的谜题——**泥孩子谜题**(Muddy Children Puzzle)。它表面上是一个简单的逻辑游戏:一群孩子在外玩耍后,父亲宣布“至少有一个孩子额头上有泥”,然后反复询问“谁知道自己的额头有泥?”随着无人回答,最终所有泥孩子都推理出自己脏了。这个谜题精妙地展示了**共同知识**(common knowledge)与**公共宣告**(public announcement)如何改变群体的认知状态,成为认知逻辑发展的关键基石。 但这样一个影响深远的谜题,究竟是谁第一个提出的?答案竟是一片模糊。 ## 起源:一场跨越两百年的“寻踪” 最近,一篇由 Hans van Ditmarsch 撰写的论文《History of the Muddy Children Puzzle》(arXiv:2606.13703)系统梳理了该谜题的起源。作者追踪了**过去两个世纪**的逻辑与文学出版物,发现这个谜题并非由某一位学者在20世纪凭空创造,而是经历了漫长的演变。 早期版本可以追溯到**19世纪的逻辑谜题集**,其中涉及“帽子谜题”或“数字推理”的变体。例如,一个经典的“蓝眼睛与棕眼睛”逻辑谜题本质上与泥孩子谜题同构。论文指出,**“泥孩子”这个具体名称的首次出现可能是在20世纪中叶**,但核心的“知识迭代”逻辑结构早已存在。 ## 变体与创新:从数字到自指 泥孩子谜题的魅力在于其可扩展性。论文列举了多种变体: - **数字版**:孩子们知道泥点的数量,通过计数推理出自己是否脏了。 - **彩色帽子版**:参与者戴不同颜色的帽子,需要推断自己帽子的颜色。 - **自指帽子谜题**:论文作者还提出了一种全新的变体,其中涉及**自我指涉**(self-reference),进一步挑战推理的边界。 这些变体不仅在逻辑学中被用作教学工具,在**多智能体系统**(multi-agent systems)和**分布式人工智能**中也具有实际意义——它们模拟了智能体如何通过观察他人的反应来更新自己的信念。 ## 为什么AI社区应该关注? 对于AI研究者来说,泥孩子谜题不仅仅是一个智力游戏。它直接关联到**认知逻辑**(epistemic logic)的核心概念,而认知逻辑正是构建**推理型AI**(如自动驾驶、机器人协作)的理论基础。当一个AI系统需要感知其他智能体的知识状态时,它实际上就在解决一个“泥孩子”类问题。 论文的发布也提醒我们:许多看似现代的AI理论基础,其实植根于古老的逻辑难题。理解它们的起源,有助于我们更好地把握未来AI推理能力的演进方向。 ## 小结 泥孩子谜题的起源虽不明确,但这恰恰反映了逻辑学中“共同知识”概念的普适性——它像一条暗流,在不同时代、不同文化中反复出现。Hans van Ditmarsch 的这篇论文不仅是一次历史追溯,更是对认知逻辑核心思想的致敬。对于AI从业者和逻辑爱好者来说,这都是一份值得细读的文献。

Anthropic2个月前原文

一项新研究挑战了“安全微调模型中的拒绝行为由单一线性方向介导”的观点。来自 arXiv 的预印本论文《Refusal Beyond a Single Direction》对两种主流干预方法——**Diff-in-Means (DiM)** 与 **Iterative Nullspace Projection (INLP)**——进行了系统比较,发现 INLP 在拒绝抑制方面可与 DiM 匹敌,且能提供更精细的可调能力。 ## 背景:从单一方向到多维空间 Arditi 等人(2024)曾提出,安全微调聊天模型的拒绝行为由残差流中的一个线性方向控制,可通过有害与无害激活的均值差(DiM)恢复。基于此,研究人员开发了激活添加和方向消融等干预手段。然而,新研究认为这一图景可能过于简化。 ## 核心发现:INLP 的竞争优势 研究者在五个开源聊天模型上对比了 DiM 干预(激活添加、方向消融)与 INLP 干预(零空间投影、反事实翻转)。结果显示: - **INLP 反事实翻转**在拒绝抑制上可与 **DiM 方向消融** 竞争; - 零空间投影效果始终较弱; - 将 INLP 限制在提取子空间的主要方向上,能在保持近基线困惑度的同时保留大部分抑制效果,从而提供**可调节的能力**。 ## 几何差异:缺失与对立的不同编码 更引人注目的是几何层面的发现:两种 INLP 干预将激活向量投射到截然不同的区域。零空间投影使变换后的激活**坍缩到有害与无害聚类之间**,而反事实翻转则将它们移入**相反的聚类**。这表明模型对“概念缺失”和“概念对立”采用了不同的编码方式——这一区分值得未来深入研究。 ## 意义与展望 该研究不仅挑战了“单一方向”假设,还为模型可解释性和安全对齐提供了新工具。INLP 的丰富参数化使得干预更具可调性,有助于在安全性和模型能力之间取得更精细的平衡。论文作者指出,未来工作可进一步探索不同概念编码的几何本质。

Anthropic2个月前原文

大型语言模型(LLM)作为智能体部署时,常需从海量工具目录中检索合适工具。传统嵌入检索依赖紧凑编码器,难以捕捉专业工具语义。参数化工具检索通过将每个工具编码为虚拟标记(virtual token)追加到LLM词表,经两阶段微调(记忆→检索监督微调)使模型自身充当检索器,在标准ToolBench基准上表现强劲。然而,这些基准使用详尽完整的查询,且采用约束解码限制输出路径,无法揭示模型是否真正理解工具。 为此,研究团队提出 **ToolSense**——一个开源LLM驱动诊断框架。该框架输入任意工具目录,自动生成三类基准: - **现实检索基准(RRB)**:包含三个模糊层级的查询 - **多项选择(MCQ)探测基准** - **问答(QA)探测基准** ### 关键发现:知识与检索的割裂 将ToolSense应用于ToolBench(约4.7万工具),评估五种参数模型训练配置后,研究者发现了一个惊人现象——**知识-检索分离**。在RRB查询上,多个配置性能骤降约50-64个百分点,甚至低于嵌入模型基线。更值得关注的是,尽管某些模型在标准检索任务中表现优异,但在事实探测任务上得分接近随机水平,说明模型“知其然却不知其所以然”。 ### 为何重要? 该研究揭示了当前参数化工具检索的深层问题:模型可能仅学会匹配模式而非理解工具功能,这在实际部署中可能引发严重错误。ToolSense框架为此提供了诊断工具,帮助开发者识别模型的真实能力边界。 ### 开源与后续 研究团队已开源ToolSense框架及ToolBench诊断基准(链接见论文)。未来,这一框架有望成为评估LLM工具理解能力的标准工具,推动更可靠、更透明的智能体系统发展。 **论文信息**:arXiv:2606.12451,作者包括Ashutosh Hathidara等。

Anthropic2个月前原文

传统决策支持研究关注人类如何借助机器学习模型做出更优决策。然而,随着自主AI代理的兴起,角色分工正在发生根本性逆转——AI代理代表用户行动,而人类和工具则退居辅助地位。这一转变将可靠性问题推至聚光灯下:代理错误可能造成严重后果,且其行为必须始终与人类目标及约束保持一致。 来自宾夕法尼亚大学的研究团队在最新论文《Strategic Decision Support for AI Agents》中,系统探讨了这一新型决策支持范式。他们摒弃了经典视角,重新审视了决策支持的两大基本原则——支持的成本-价值权衡与不确定性量化的作用——在AI代理作为核心行动者的场景下,提出了一个**战略决策支持框架**。 ### 核心问题:何时需要“拉一把”? 该框架的核心是一个优化问题:**在控制“反事实遗漏支持误差”的前提下,最小化支持调用次数**。所谓反事实遗漏支持误差,是指代理在那些本应寻求支持才能显著改善输出的实例上,却独自行动的概率。换句话说,系统需要判断:在哪些情况下,代理“单干”会带来可避免的失误? 研究证明,在总体层面上,最优策略是一个基于**支持价值**的阈值规则——只有当支持带来的价值超过某个阈值时,才触发支持请求。在此基础上,团队开发了一种在线算法,能够自适应地调整该阈值,并通过随机探索来控制遗漏支持误差,无需依赖任何数据分布假设。此外,他们还引入了一种**即时校准方法**,能够在线减少不必要的支持调用。 ### 应用场景:从信息收集到人机协作 论文将这一框架应用于多个典型场景,展示了其通用性: - **信息收集**:代理在不确定的环境中主动寻求额外信息,以降低决策风险。 - **人机协作**:代理在遇到自身能力边界时,适时向人类专家求助。 - **工具使用**:代理判断何时需要调用外部工具(如计算器、数据库查询)来辅助决策。 实验结果表明,该方法能够**可靠地控制目标误差**,同时**显著减少不必要的支持调用**,实现了效率与可靠性的平衡。 ### 行业启示:从“人类辅助AI”到“AI辅助人类”的再反转? 这篇论文的深层价值在于,它揭示了AI系统设计中的一个关键转变:当代理成为行动主体时,决策支持不再仅仅是“人类+模型”的简单叠加,而是需要重新定义角色与责任。传统的决策支持系统侧重于向人类提供建议,而新框架则侧重于**为代理配置一个“安全网”**,确保其在自主行动时不会偏离轨道。 这一思路对于当前大模型驱动的代理系统(如AutoGPT、Agent开发框架)具有直接指导意义。如何在不牺牲效率的前提下,防止代理产生“幻觉”或执行有害操作?该研究提供的数学框架和在线算法,为构建更可靠的自主系统提供了理论基础。 当然,研究也承认其局限性:当前框架假设支持的价值是可量化的,且反事实误差的定义依赖于对“改善”的明确界定。在实际部署中,这些量化的难度可能较高。不过,作为首个系统性地将决策支持理论应用于AI代理角色的工作,它无疑为该领域开辟了新的研究方向。

Anthropic2个月前原文

形式化证明是确保数学定理和软件正确性的关键工具,但长期以来面临数据稀缺和计算成本高昂的挑战。近日,来自爱丁堡大学等机构的研究团队发布了 **Pythagoras-Prover**,一个计算高效的Lean定理证明器开源家族,旨在以更低的计算预算实现顶尖性能。 ## 核心创新:从数据到架构的全链路优化 Pythagoras-Prover 包含两种生成范式的模型:**自回归模型**(4B和32B参数)以及**首个基于扩散的证明器**(4B参数),后者在推理时通过迭代精炼Lean证明。研究团队从三个层面解决效率问题: 1. **课程式监督微调(Curriculum SFT)**:构建了一个按难度分层(简单、中等、困难)的Lean验证语料库,让模型从短而简单的证明逐步学习到长而复杂的证明。在SFT过程中,动态的证明推理过滤机制保留了信息量丰富的证明轨迹,同时将每个实例控制在8k token的上下文预算内。 2. **增强型Lean形式化(ALF)**:针对已验证语料库稀缺的问题,ALF通过扰动已知问题生成形式化语句的变体,并利用自蒸馏产生额外训练信号,无需逐一验证每个变异实例。这降低了对特定语句表面形式的依赖,提升了模型的泛化能力。 3. **扩散模型试水**:4B参数的扩散证明器作为概念验证,展示了在推理时迭代精炼证明的潜力,为形式化证明开辟了新路径。 ## 惊人性能:小模型逆袭大模型 在标准基准测试 **MiniF2F-Test** 上,Pythagoras-Prover-4B 以 **86.1%** 的 pass@32 成绩超越了拥有 **671B** 参数的 DeepSeek-Prover-V2(82.4%),参数规模缩小约 **167倍**。而 32B 版本以 **93.0%** 的成绩创下了开源模型的新纪录。在更具挑战性的 **PutnamBench** 上,32B模型解决了 **93道** 题目,展示了强大的数学推理能力。 研究团队还发布了 **MiniF2F-ALF** 基准,该基准通过ALF变异增加了污染敏感性,所有模型在该基准上的准确率均有所下降,但Pythagoras-Prover-32B仍然最强,4B版本则追平了此前最先进的Goedel-Prover-V2-32B。 ## 行业意义:降低形式化证明的门槛 形式化证明领域长期被大模型垄断,但Pythagoras-Prover证明,通过高效的数据增强和训练策略,小模型也能达到甚至超越超大模型的性能。这为资源受限的研究团队和工业应用提供了可行方案,有望加速形式化方法在关键软件验证、数学定理证明等领域的普及。同时,扩散模型的引入也为未来探索更高效的推理范式打开了大门。

Anthropic2个月前原文

## 概述 自动驾驶仿真中,非自车交通智能体(traffic agents)的行为模式往往单一,要么基于规则,要么通过单一行为模式训练。最近,加州大学欧文分校的研究人员提出 **PersonaDrive**,一种基于检索增强的视觉-语言-动作(VLA)模型,能从人类风格驾驶数据中学习,生成具有不同驾驶风格的非自车智能体,用于闭环仿真。 ## 核心方法 PersonaDrive 包含三个阶段的流程: 1. **离线三元组挖掘**:从人类在 CARLA 仿真器上按激进、中性和保守指令驾驶的数据中,利用图像-文本相似度分数挖掘风格特定的三元组。 2. **轻量级检索头训练**:将冻结的视觉特征与小型控制编码器融合,为每种风格训练一个检索头,查询对应风格的数据库。 3. **VLA 主干微调**:在单一路径预测模型中,将检索到的上下文点作为行为示例,进行上下文学习。 推理时,只需切换检索头查询的数据库,即可改变智能体的驾驶风格,无需针对每种风格重新训练。 ## 性能表现 在 Bench2Drive 基准上,PersonaDrive(无风格条件)的驾驶分数比 SimLingo 高 **4.6%**,比 HiP-AD 高 **2.5%**。在风格条件模式下,每种风格下的驾驶分数均达到最高,且弱风格比最强基线 DMW 高 **5.4%**。从保守到激进指令,平均速度和加速度分别提升 **18%** 和 **25%**。 ## 意义与影响 PersonaDrive 解决了仿真中非自车智能体行为单一的问题,通过人类风格数据实现多样化的驾驶行为,有助于更真实地测试自动驾驶系统。其无需重新训练的切换机制降低了部署成本,为闭环仿真提供了更自然的交通流。

Anthropic2个月前原文

## 谎言检测器:大模型的新“测谎仪”面临可靠性挑战 随着大型语言模型(LLM)的能力日益增强,如何审计、监控和事后调查其行为成为关键问题。一个直观的想法是开发“谎言检测器”——一种能够判断模型输出是否与其真实信念相悖的工具。然而,来自arXiv的最新研究《Did you lie? Evaluating Lie Detectors across Model Scale and Belief-Verified Model Organisms》指出,现有谎言检测器的可靠性远未达到实用水平,尤其是在面对经过特殊训练的模型时表现不佳。 ## 研究背景:检测谎言需要“已知真相” 要评估谎言检测器,首先需要建立一个测试环境,其中模型的真实信念与输出内容相反。研究人员发现,此前使用的“训练模型体”(trained model organisms)往往无法满足这一要求,导致检测结果难以解释。为此,该团队构建了**13个推理模型体**,通过链式思维(Chain-of-Thought)验证其隐藏信念,并确保这些信念能泛化到未见过的任务。此外,他们还设计了**“多样化欺骗”**(Varied Deception)测试集,涵盖多种诱导模型说谎的动机场景。 ## 四种检测器:从简单到复杂 研究评估了四种谎言检测方法: - **链式思维法官**:让模型在推理过程中自我判断是否说谎。 - **对数概率分类器**:基于输出 token 的概率分布进行判断。 - **两种激活探针**:包括新提出的 **Did-You-Lie (DYL)** 方法,通过训练后续探针来检测谎言。 ## 关键发现:规模越大,检测越准?仅在简单场景下成立 在“多样化欺骗”测试中,研究使用了 **31个开放权重模型**,参数量从 **2B 到 1T** 不等。结果显示,所有四种检测器的性能都随模型能力的增强而提升——规模越大的模型,其谎言越容易被检测。这似乎是个好消息,表明检测器在应对常见的提示性谎言时具有一定效果。 然而,当面对经过特殊训练的模型体时,情况急转直下。**所有基于激活和对数概率的检测器性能急剧下降**,其中 DYL 保留的信号最多,但仍不理想。唯一保持较强表现的是链式思维法官,其平衡准确率达到 **0.82**。但研究人员指出,这在一定程度上是验证过程本身的产物——因为验证过程更倾向于选择那些链式思维可读的信念。 ## 结论与展望:谎言检测仍需突破 该研究的核心结论是:**当前的谎言检测器无法支持对模型信念的高置信度声明**。在真实世界场景中,模型可能经过特殊训练或微调,从而隐藏其真实意图,而现有检测手段对此几乎无能为力。论文建议未来研究方向包括:改进模型体的构建方法、开发更鲁棒的检测信号,以及探索多模态检测技术。 研究团队已开源其数据集、模型体和训练好的检测器,为后续研究提供了基础。谎言检测不仅是技术挑战,更关乎大模型的安全与可信。如果无法可靠地判断模型是否在说谎,那么对其行为的审计和监控就无从谈起。这项研究为领域敲响了警钟,也指明了前进的方向。

Anthropic2个月前原文

人类移动轨迹数据在交通规划、城市管理和流行病防控中至关重要,但大规模真实轨迹采集成本高昂且涉及隐私问题,因此合成轨迹生成成为研究热点。现有基于大语言模型(LLM)的方法主要分为两类:一是通过提示工程利用LLM的零样本推理能力,但缺乏细粒度时空约束;二是对模型进行轨迹级微调,虽提升了统计精度,却计算成本高且可能削弱通用推理能力。 为突破这一困境,研究人员提出了 **TrajGenAgent**——一种无需模型微调的语义感知分层LLM智能体框架。该框架采用“协调者-执行者”两级架构:首先,LLM通过上下文学习,基于历史证据生成个体且与星期几条件关联的活动链;随后,一个确定性工作流将每个活动落地为完整访问记录,具体包括个性化兴趣点(POI)检索、距离感知位置选择、运动学感知旅行时间传播以及LLM驱动的停留时长估计。 为了更全面地评估生成轨迹的真实性,研究团队引入了基于异常检测的评估框架,使用两种互补检测器分别评估行为合理性和语义连贯性。实验表明,在基准数据集和大规模模拟数据集上,TrajGenAgent在**时空保真度、语义连贯性以及个体行为真实感**方面均显著优于代表性的神经网络和LLM基线方法,且无需更新模型参数。 这一成果已被 **IEEE MDM 2026** 接收,标志着合成轨迹生成从“统计近似”迈向“语义真实”的重要一步。TrajGenAgent 为隐私保护下的高保真数据生成提供了新范式,有望推动交通、城市计算和公共卫生领域的应用发展。

Anthropic2个月前原文

紧凑型语言模型(LM)在成本、延迟和部署风险上具有优势,但在构建工具智能体时面临挑战:智能体不仅需要调用函数,还要从实时目录中发现工具、满足模式、维护中间依赖,并基于执行证据给出最终响应。小型规划器生成的流程图表往往在工具解析、参数验证和依赖跟踪阶段失败。 针对这一问题,来自IBM研究院和伦斯勒理工学院的研究团队提出了**Evoflux**,一种推理时进化搜索方法。其核心思想是将工具使用问题转化为可执行工作流的修复过程,通过结构化编辑、执行反馈、自适应强度、元引导重设计和多样性剪枝,迭代优化工作流图。 ### 实验表现 在包含**250个工具**的**MCP-Bench**任务上,Evoflux将小型规划器的执行可行性从约**3%**提升至**17-24%**。相比之下,基于相同搜索挖掘数据的监督微调(SFT)和SFT+DPO方法表现不佳,甚至低于零样本性能;ReAct虽然能达到更高峰值,但方差和token成本也更高。 ### 关键洞察 - **执行反馈是关键**:Evoflux在每个推理步骤都尝试执行当前工作流,并根据执行结果调整进化方向,避免了纯格式模仿的局限。 - **超越蒸馏局限**:传统方法依赖少量教师轨迹进行蒸馏,但难以覆盖工具目录变化时的修复行为。Evoflux通过进化搜索,在有限的教师轨迹预算下实现了更可靠的性能。 - **自适应机制**:算法根据搜索历史动态调整变异强度和多样性,防止早熟收敛,同时保持探索效率。 ### 行业启示 随着MCP(Model Context Protocol)等标准推动工具生态发展,紧凑型智能体在边缘设备、实时系统中的应用需求日益迫切。Evoflux证明了**推理时计算**可以有效弥补模型容量不足带来的规划缺陷,为低成本部署可靠智能体提供了新思路。未来,将进化搜索与轻量级规划器结合,或能成为构建鲁棒工具智能体的主流范式。

Anthropic2个月前原文

## 核心要点:树搜索 + 多智能体协作,重塑自动化优化范式 来自 arXiv 的最新论文《Arbor: Tree Search as a Cognition Layer for Autonomous Agents》提出了一种全新的多智能体框架 **Arbor**。该框架将结构化的**树搜索**作为自主智能体的“认知层”,使其能够在大型、有状态的动作空间中进行高效探索。与以往针对孤立目标、无状态评估的优化系统不同,Arbor 维护一棵显式的**假设搜索树**,作为所有智能体的共享工作记忆。这棵树随着每次测量而演化:失败被视为诊断信号,用于重塑后续探索方向;成功则改变瓶颈分布,引导树向新区域扩展。 ## 应用场景:全栈LLM推理优化 研究团队将 Arbor 应用于**全栈 LLM 推理优化**这一极具挑战性的领域。在传统模式下,实现推理峰值性能往往需要应用、框架、编译器、内核和硬件等多个工程团队的协同努力,耗时巨大且难以复制。Arbor 通过两类智能体分工协作: - **Orchestrator(编排智能体)**:驱动优化过程,将任务委派给覆盖推理栈各层的**领域专家**。 - **Critic(评论智能体)**:通过**根因分析、自我反思和测量验证**来保障系统稳定性,形成一种制衡架构——任一智能体都无法单方面主导系统。 智能体的能力被分解为**硬技能**(领域专长)和**软技能**(协调协议,决定贡献如何组合),从而实现完全自主的多日优化战役。 ## 关键成果:性能飞跃与可复现性 实验结果显示,Arbor 在推理吞吐-延迟帕累托曲线上实现了**最高193%的提升**,远超供应商优化的基线。相比之下,未使用该框架的单一智能体仅获得**+33%的吞吐量提升**,并在数小时内出现不可恢复的崩溃。Arbor 还能泛化到多代硬件平台,运行间方差控制在**2个百分点以内**,表明该方法与硬件无关且可复现。 ## 行业意义:从“人工调优”到“智能体协作” Arbor 的提出标志着 AI 基础设施优化进入新阶段。它不再依赖工程师手动调整参数,而是通过树搜索驱动的多智能体系统,自动探索庞大的配置空间。这种“认知层”设计为复杂系统的自动化调优提供了通用框架,尤其适用于那些状态空间巨大、评估代价高昂的领域。对于 LLM 推理服务商而言,这意味着更低的延迟、更高的吞吐量,以及更少的运维人力投入。 ## 小结 Arbor 将树搜索与多智能体协作巧妙结合,在 LLM 推理优化上取得了显著成果。其核心创新在于将失败转化为学习信号,并通过制衡架构保障稳定性。未来,这种“认知层”思想有望扩展到更多需要自主探索的 AI 系统。

Anthropic2个月前原文