SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:Anthropic清除筛选 ×

随着大型语言模型(LLM)智能体的广泛应用,多智能体协作系统成为AI领域的热点。然而,现有架构要么预先固定通信模式,要么采用全广播方式,导致令牌成本、延迟、冗余和错误传播等问题。最新研究提出一种基于合作博弈的动态联盟形成与通信定价框架,旨在优化智能体选择与通信过程。 ## 研究背景与核心思想 在多智能体系统中,每个智能体具备不同的技能,但传统的固定通信或全广播方式效率低下。研究者将智能体选择与通信建模为合作博弈,定义任务条件下的净效用函数,区分联盟级成本与智能体激活成本。通过边际价值激活规则和贪婪路由器,系统能够动态决定哪些智能体应参与任务,以及哪些通信链路值得建立。 ## 关键技术与理论贡献 研究利用Shapley值预测智能体的价值,在任务执行前和执行中动态调整联盟。同时,将问题与子模最大化联系起来,并证明了两个有限保证:对于单调、基数受限的特例,给出了曲率精化界;对于无约束的非单调情况,通过双重贪婪算法实现了紧的1/2近似。此外,还提出了Shapley-子模夹逼界,将边际价值路由的误差与每智能体递减收益量联系起来。 ## 实验效果与鲁棒性分析 在合成实验中,贪婪路由达到了暴力搜索最优效用的**99.5%**,平均仅激活8个智能体中的1.96个,而全广播只能达到38.8%的效用。性能对激活成本和冗余权重具有鲁棒性,但在子模性严重违反或价值估计有噪声时,性能降至66%。这表明该框架在理想条件下高效,但在实际复杂环境中仍需改进。 ## 与现有方法的区别及未来方向 该框架与Shapley定价、享乐联盟形成和通信图剪枝等方法有明确区别,强调动态性和成本效益。未来工作将评估在真实多智能体LLM基准上的表现,以验证其实际应用价值。 总之,这项研究为多智能体协作提供了一种成本感知的动态决策思路,有望在复杂任务中降低通信开销并提升整体效率。

Anthropic20天前原文

## 背景:知识图谱校验的痛点 在知识图谱(KG)领域,**SHACL**(Shapes Constraint Language)是确保数据符合特定规则的核心技术。然而,编写SHACL形状(shapes)需要较高的技术门槛,大多数领域专家并不具备这种能力。如果能将自然语言需求直接翻译成SHACL(即NL2SHACL),将大大降低使用门槛,让更多人参与到知识图谱的构建与维护中。 ## 现有评估方法的局限 目前,**NL2SHACL领域缺乏专门的评估基准**,且评估生成的SHACL形状不能简单依赖字符串比较——因为语义等价的形状可能在序列化形式或结构上存在差异。这意味着,即使两个形状在文本上不同,它们可能表达相同的约束逻辑,反之亦然。因此,需要一种更智能的评估方式。 ## NL2SHACL-Bench:填补空白 针对上述挑战,来自慕尼黑工业大学(TUM)等机构的研究团队(Yuchen Zhou、Niels Bobet、Maribel Acosta)提出了 **NL2SHACL-Bench**,这是一个专门用于自然语言到SHACL翻译的基准测试套件。该套件旨在系统性地衡量模型在将自然语言描述转化为SHACL形状时的性能。 ## 主要发现:语法易,语义难 研究团队利用NL2SHACL-Bench对**四个最先进的大语言模型(LLMs)**进行了评估。结果显示,当前LLM在生成语法合法的SHACL方面表现出色,但在处理复杂逻辑和结构模式时,**难以生成语义等价的约束**。这意味着,模型可能生成“看起来正确”的SHACL,但实际约束与原始需求不符。 ## 意义与展望 NL2SHACL-Bench的发布为NL2SHACL领域提供了一个标准化的评估平台,有助于推动该方向的研究进展。随着LLM能力的提升,未来有望通过自然语言直接生成可靠的SHACL形状,进一步降低知识图谱的应用门槛。不过,当前模型在语义理解上的短板也提醒我们,**自然语言到形式语言的转换仍有很长的路要走**。 该研究论文《NL2SHACL-Bench: A Benchmark Suite for Natural Language to SHACL Translation》已发布于arXiv(编号:2608.07530),共18页,包含8张图和2张表格。

Anthropic20天前原文

近年来,人工智能系统在辅助人类决策时,往往倾向于给出一个“最优”建议,但这种方式在复杂、高风险场景下可能掩盖了决策背后的不确定性。为此,研究者提出了**评价型AI(Evaluative AI, EAI)**的新范式:它不直接给出唯一推荐,而是同时呈现多个竞争性假设,并附上支持与反对的证据,让决策者在充分权衡后自行判断。 然而,EAI要想真正落地,还需要一个坚实的理论基础。在近期发表于arXiv的一篇立场论文中,来自伦敦帝国理工学院等机构的研究者(Xiang Yin、Tim Miller、Nico Potyka、Antonio Rago与Francesca Toni)主张,**计算论证(computational argumentation)**是构建EAI形式化基础的理想范式。论文题为《Towards an Argumentative Foundation for Evaluative AI》,于2026年4月25日提交。 ## 为什么是论证? 论证框架天然适合EAI的需求。在论证系统中,一个观点由多个论据支持,同时存在反驳与攻击关系,这与EAI呈现“正反证据”的目标高度契合。通过形式化的论证语义,系统可以自动评估哪些假设在证据冲突中胜出,并为每个假设生成可解释的论证链。更重要的是,论证过程支持**争议性(contestability)**:如果人类决策者不认同某个结论,可以提出新的论据进行反驳,系统则能动态更新评估结果。这种交互性正是EAI区别于传统黑箱AI的关键。 ## 迈向分布式与人本化EAI 论文作者指出,当前AI系统往往集中于中心化的推荐引擎,而EAI的未来应走向**分布式**与**人本化**。分布式意味着多个AI智能体可以各自提出假设与证据,通过论证协议进行交互;人本化则强调系统必须能向人类解释其推理过程,并接受人类的质疑与干预。计算论证为此提供了现成的工具:抽象论证、结构化论证、假设性论证等理论均可用于建模多智能体间的辩论。 ## 长期研究议程 这篇立场论文并非提出具体算法,而是勾勒了一个长期研究蓝图。作者呼吁学界关注以下几个方向: - **形式化EAI语义**:如何将EAI的“假设-证据”结构映射到论证框架中? - **可解释性与透明度**:如何让论证链对人类用户清晰可见? - **交互式争议机制**:如何设计支持人类反驳的协议,确保系统能吸收反馈? - **分布式论证**:如何在多智能体环境中高效协调论证过程? 尽管目前EAI仍处于早期阶段,但这一方向的提出,反映了AI研究从“预测准确”向“决策透明”的转变。在医疗、司法、金融等高风险领域,EAI或许能成为人机协作的更好桥梁。 值得注意的是,本文仅代表作者观点,尚未经过同行评审。但作为一篇立场论文,它无疑为后续研究提供了有价值的起点。

Anthropic20天前原文

近日,一篇题为《结构理论中的确定性化:通过闭包、可比性与联合可接受性的统一框架》的论文在 arXiv 上发布,提出了一种从多元结构理论中构建规范解释的形式化框架。该研究由 Hai Hai Fu 完成,涉及人工智能与逻辑计算领域,为处理多源理论中的不确定性和不一致性提供了新的数学工具。 ## 核心概念 论文将**结构理论**定义为一个三元组 \( T = (\Sigma, A, I) \),其中 \( \Sigma \) 是签名(signature),\( A \) 是公理(axioms),\( I \) 是推理策略(inference policy)。每个结构理论都对应一个**可接受解释族**(admissible interpretation family),即所有全局一致的结构结论赋值集合。这一形式化使得不同理论之间的比较和整合成为可能。 ## 三个层次的规范化 作者区分了三个层次的规范化(canonicalization): - **闭包稳定化**(closure stabilization):针对每个种子(seed)的收敛,即从不同初始条件出发最终趋于一致。 - **全局完成**(global completion):与种子无关的收敛,即所有路径都导向同一个结果。 - **确定性化**(determinization):存在唯一的可接受解释,这是最强的规范化形式。 ## 不确定性的分类 非确定性被分为两类:**认知多元性**(Type E)和**结构多元性**(Type S)。其中,Type S 又细分为强子类(Type S-strong),其特点是缺乏共同上界(common upper bounds)。这一分类有助于针对不同性质的非确定性采取相应的处理策略。 ## 两种规范化机制 论文提出了两种主要的规范化机制: 1. **基于算子的完成**(operator-based completion):通过定义闭包算子来逐步消除不确定性。 2. **基于选择器的构造**(selector-based construction):通过选择规则从多个候选解释中确定唯一结果。 作者证明了在纯推理完成中,若规则满足**正性、非反驱性**(positive, non-retractive)且具有**健全性条件**,则完成可归结为饱和闭包算子(saturated closure operator)。 ## 主要结果 - 对于 **Type E 理论**,闭包稳定化总是成立的,但完全确定性化依赖于一个全局合流性质(global confluence property),该性质目前仍是一个开放问题。 - 对于 **Type S-strong 理论**,可以通过规范选择实现确定性化。 - 多层级规范化系统通过**分层算子**(staged operators)构成一个结构上非交换的系统,这意味着操作顺序会影响最终结果。 - 作者还提供了一个**条件分类定理**,将理论内在机制归结为闭包或选择两类。 ## 对 AI 推理的启示 值得注意的是,该框架可应用于 **LLM 辅助推理**。论文提出,**幻觉(hallucination)**可以被视为**无支持的规范化**(unsupported canonicalization),即模型在没有充分依据的情况下强行生成唯一解释。这一视角为理解大语言模型的不确定性提供了新的理论视角,也可能为改进推理可靠性提供指导。 总的来说,这项研究为结构理论中的规范化和确定性化提供了一个统一的数学框架,不仅深化了逻辑学的基础理论,也为 AI 系统中的多源信息融合与一致性维护提供了潜在的工具。未来,随着全局合流性质等开放问题的解决,该框架有望在更多实际场景中发挥作用。

Anthropic20天前原文

在人工智能的版图中,**创意能力**始终是一块难以精确测量的高地。与那些有明确对错、可以量化评分的任务不同,创意往往缺乏显式的目标和奖励信号,这让评估变得异常棘手。然而,创意在**设计、沟通、教育以及人机协作**中又扮演着至关重要的角色。近日,一篇发表于arXiv的论文提出了一个名为 **C4** 的新评估框架,旨在填补这一空白,专门用于测试多模态大语言模型(MLLMs)的**跨概念理解**能力。 ## 从“理解”到“解码”:创意的认知基础 论文作者指出,**跨概念理解**是支撑“接受性创意”(receptive creativity)的核心认知能力。它指的是,一个观察者能够从看似不相关、但存在意义关联的概念组合中,解读出创作者的意图。例如,当我们看到一幅将“时间”具象化为“流水”的画作时,能立刻领会其中的隐喻。 为了将这一抽象概念操作化,研究团队提出了一种新颖的视角:将**项目构建视为“跨概念编码”**,而将**模型推理视为“跨概念解码”**。这就好比,创作者在编码一个只有“懂行”的人才能解开的谜题,而模型的任务就是解开这个谜题。 ## C4框架:以成语为载体的创意测试 基于这一思路,团队构建了 **C4(Chengyu-based Cross-Concept Creativity)** 评估框架,其载体是**中文成语**。成语本身就是高度凝练的跨概念表达,一个四字短语往往浓缩了一个故事、一种哲理或一幅画面,非常适合用来测试模型对“言外之意”的把握。 C4框架的巧妙之处在于其**显式的结构**和**可量化的难度**。它通过一个人工标注并经过第三方审查的**跨概念网络**,将目标概念与可具象化的替代概念连接起来,形成“桥梁路径”。每个测试项的难度由路径中的**桥梁数量**和**深度**决定,这使得评估具备了清晰的难度梯度。 ## C4-Eval:数据与结果 基于该框架,研究团队发布了 **C4-Eval** 评估集,包含**184个合成项目**和**37个人类创作的成语谜题**。每个项目被实例化为**五种任务设置**,最终产生了**884个主要答案恢复案例**。 在对**十个主流MLLM**的测试中,结果显示: - 最强的**闭源模型**在主要任务上的准确率分别达到**50.7%** 和**48.0%**; - **开源模型**的表现则明显逊色,准确率低得多。 有趣的是,当提供**候选约束**时,模型的准确率大幅提升;但提供**桥梁提示**或要求**解释推理过程**,对性能的提升却相当有限。这表明,当前MLLMs在解码通过跨概念关系编码的创意意义时,存在明显的短板。 ## 小结:创意的“最后一公里” 这项研究不仅提供了一个全新的评估工具,更揭示了当前MLLMs在**高级认知能力**上的真实边界。理解成语背后的隐喻,看似简单,却需要模型具备**联想、抽象和背景知识**的综合能力。C4框架的推出,为未来模型在创意维度的改进提供了清晰的标尺。或许,让机器真正“读懂”人类的创意表达,仍是通往通用人工智能道路上需要跨越的一道重要关卡。

Anthropic21天前原文

**WebGrader** 是一种新型的自演进程序化评分器,旨在解决大语言模型(LLM)在网页开发训练中的奖励设计瓶颈。通过自动生成可执行的交互流程(Flow Contract),并在真实浏览器环境中收集多维度证据,WebGrader 能够提供更准确的强化学习信号,显著提升模型的功能成功率。实验表明,在 WebGen-Bench 基准上,8B 参数模型的功能成功率达到了 **52.01%**,超越了多个更大规模的模型。 ### 背景:网页生成中的奖励困境 当前,LLM 已能根据自然语言描述生成完整网站,但功能正确性仍是一大挑战。强化学习(RL)是缩小这一差距的核心方法,而奖励设计则是关键瓶颈。传统的奖励方式包括手工编写的浏览器脚本和基于视觉语言模型(VLM)或 GUI 代理的评分器。前者虽然可执行,但难以覆盖开放式需求;后者虽然可扩展,但可能在观察到关键状态前就作出判断,导致奖励不准确。 ### WebGrader 的解决方案 WebGrader 提出了一种全新的思路:**自动从每个网站请求中推导出所需的交互流程**,并将其表示为可执行的“Flow Contract”。在训练过程中,WebGrader 会在真实浏览器中运行生成的网站,将目标操作与源代码和实时 DOM 对齐,并沿着浏览器轨迹收集视觉、DOM、响应和持久状态等证据。通过分离测试规划、操作定位、证据收集和语义判断,WebGrader 只有在观察到请求的状态转换后才会给出通过(Pass)判定,从而保证了奖励的可靠性。 此外,WebGrader 还引入了一个**残差驱动的离线循环**,用于发现可复用的验证器技能,并在不相交的验证页面上进行筛选,最终在策略训练前冻结这些技能图。这种机制使得评分器能够不断自我演进,适应更多样的任务。 ### 实验结果 在 WebGen-Bench 基准上,WebGrader 训练的 8B 参数策略模型达到了 **52.01%** 的功能成功率,比匹配的外观加脚本奖励高出 **7.88 个百分点**,并超过了 o4-mini 和 DeepSeek-v4-flash 等模型。在 WG-core-250 数据集上,该策略的满分(Full Score)达到 **44.953**,超过了 Qwen3-Coder-480B。这些结果表明,WebGrader 不仅提升了奖励的准确性,还显著增强了模型的网页开发能力。 ### 意义与展望 WebGrader 为 LLM 在网页开发领域的训练提供了一种可扩展且可靠的奖励机制,有望推动更复杂的交互式网页生成应用。未来,这种自演进评分器或许也能应用于其他需要多步骤交互的任务,如自动化测试和机器人控制。不过,该研究仍处于 arXiv 预印本阶段,其实际应用效果还有待进一步验证。

Anthropic21天前原文

**EntropyMoE:熵感知稀疏专家路由,推动无分词器大语言模型新突破** 近年来,字节级大语言模型(LLM)通过将字节分组为动态大小的补丁(patch),逐渐展现出无需分词器的建模潜力。然而,现有字节补丁架构对所有补丁仍采用相同的稠密前馈计算,这导致模型容量无法根据补丁语义和粒度的变化进行自适应调整。针对这一局限,研究团队提出了 EntropyMoE,一种专为动态字节补丁设计的混合专家(MoE)架构。 EntropyMoE 的核心创新在于,将全局补丁 Transformer 中的稠密前馈模块替换为 Top-K 专家层,每个动态补丁作为专家路由的基本单元,其字节覆盖范围决定了工作量统计中的贡献。路由器直接根据补丁熵选择专家,利用与动态补丁构建相同的粒度信号来组织稀疏计算。补丁熵和长度共同定义了调节专家专业化的特征空间。 实验结果表明,EntropyMoE 在匹配的稠密和稀疏基线中取得了最低的保留字节困惑度(bits-per-byte),同时保持可比较的下游任务准确率。这些结果确立了补丁熵作为稀疏条件计算的有效路由坐标,并将 MoE 建模扩展到基于分词器的表示之外。 该研究由 Bo Liu、Muxuab Yu、Yu Zhang、Pengfei Gao 和 Yongping Zhang 共同完成,论文已提交至 arXiv(编号:2608.06398),并于 2026 年 7 月 31 日发布。 这一进展对于 AI 行业具有重要意义。一方面,无分词器模型有望消除传统分词器带来的词汇表限制和语言覆盖不均问题,提升多语言和低资源语言的处理能力;另一方面,MoE 架构的引入使得模型能够更高效地分配计算资源,为构建更大规模、更高效的 LLM 提供了新思路。不过,该研究仍处于预印本阶段,其在实际应用中的表现和扩展性尚需进一步验证。未来,我们期待看到 EntropyMoE 在更多场景中的测试,以及它如何与现有的模型压缩和加速技术相结合。

Anthropic21天前原文

奖励模型是从人类反馈中学习的关键,但理解其预测依据一直是个难题。近期,稀疏混合专家(MoE)奖励模型通过将提示路由到专门专家,并利用高路由权重的示例来刻画专家行为,试图提升可解释性。然而,路由权重仅能揭示专家"接收"了哪些提示,却无法说明它如何"评判"响应,因此只能提供部分行为解释。为此,研究者提出了**贡献对比(CoCo)**方法,一种响应级解释技术,通过选择具有最大贡献差异的"选中-拒绝"响应对来忠实刻画专家角色,同时捕捉路由和偏好行为。自动与人工评估显示,CoCo相比基于路由、基于分数和基于稀疏自编码器的替代方法,能产生更连贯、更忠实且更专门化的解释,同时保持有竞争力的奖励建模精度。据作者所知,这是首个针对MoE奖励模型解释方法的系统性研究。 该研究由Yifan Wang、Jinyi Mu、Mayank Jobanputra、Yu Wang、Soyoung Oh、Isabel Valera和Vera Demberg共同完成,论文以arXiv:2608.06400发布。 ## 背景:MoE奖励模型的解释挑战 奖励模型在强化学习与人类反馈(RLHF)中扮演核心角色,但它们的内部决策过程往往如同"黑箱"。稀疏MoE架构通过将输入路由到不同的专家网络,旨在提升效率与专业性,但同时也引入了新的解释维度:我们不仅要理解每个专家擅长什么,还要知道它们如何影响最终的奖励分数。传统方法依赖路由权重,即通过统计哪些提示被分配给哪个专家,来推断专家的功能。但这种方法存在明显局限——它只能告诉我们专家"看到了什么",却无法揭示专家"如何评价"。 ## CoCo方法:响应级解释的新思路 CoCo的核心创新在于,它不再仅仅关注路由分配,而是将注意力放在**响应对的贡献差异**上。具体来说,CoCo会寻找那些让某个专家产生最大贡献差异的"选中-拒绝"响应对,即该专家对选中响应的贡献远高于对拒绝响应的贡献。这样的响应对最能体现该专家的偏好特征,从而更准确地刻画其在奖励评估中的角色。 这种方法同时考虑了路由行为和偏好行为,弥补了路由权重解释的不足。实验表明,CoCo生成的解释在连贯性、忠实性和专门化程度上都优于现有的替代方案,包括基于路由权重、基于得分和基于稀疏自编码器的方法。同时,使用CoCo解释的模型在奖励建模精度上并未妥协,保持了与原始模型相当的性能。 ## 意义与展望 这项研究首次系统地探讨了MoE奖励模型的解释方法,为理解这类复杂模型提供了新的工具。CoCo不仅有助于研究人员验证模型是否按照预期工作,还能帮助识别潜在偏见或错误,从而改进模型设计。未来,该框架可能扩展到其他类型的MoE模型,甚至用于解释多模态或更大型的模型。 尽管CoCo展示了令人鼓舞的结果,但作者也指出,解释的忠实性仍依赖于响应对的选取质量,且不同任务可能需要调整对比策略。这一领域仍处于早期阶段,更多探索值得期待。

Anthropic21天前原文

社区检测是图分析中的基础任务,旨在识别具有相似行为或兴趣的实体群组。传统方法在复杂图结构上表现不佳,深度学习方法虽提升了性能,却牺牲了可解释性,且依赖标注数据和训练过程。大语言模型(LLM)凭借强大的推理能力和世界知识,为可解释、无标签的社区检测带来了新可能。 近期,一项发表于 arXiv 的研究提出了 **LUCID**,一种由 LLM 引导的可解释、无需训练、无监督的社区检测方法。该方法受自然系统中相变动力学的启发,将社区检测设计为四个阶段的流程,让 LLM 将隐式知识转化为显式、可解释的逻辑规则。 ## 四阶段流程 LUCID 的流程包括: - **局部视图社区初始化**:利用 k-ego 上下文和无监督节点角色编码局部图结构。 - **多因素社区合并**:使用 LLM 诱导的规则迭代合并局部社区。 - **多粒度社区细化**:并行应用 LLM 诱导的从粗到细的规则,减少边界噪声。 - **全局视图社区选择**:基于拓扑紧凑性和边界清晰度识别高质量社区。 这一设计完全摆脱了对标注数据的依赖,同时保持了过程的可解释性。 ## 性能与意义 在真实数据集上的大量实验表明,LUCID 作为无监督方法,取得了当前最优的性能,并持续优于领先的无监督和半监督基线。这验证了 LLM 在无监督图分析任务中的巨大潜力。 LUCID 的意义不仅在于性能提升,更在于其可解释性。传统深度学习方法常被视为“黑箱”,而 LUCID 通过 LLM 生成的规则,让用户能理解社区形成的原因。这对于需要审计和信任的应用(如社交网络分析、生物网络研究)尤为重要。 ## 局限与展望 尽管 LUCID 表现出色,但论文未提及计算成本与可扩展性等细节。未来工作可能包括优化 LLM 推理效率、扩展到更大规模图,以及探索在动态图上的应用。 总体而言,LUCID 为社区检测提供了一种新颖的范式,展示了 LLM 在无监督、可解释图分析中的潜力。随着 LLM 能力的提升,这类方法有望在更多领域落地。

Anthropic21天前原文

**ADIAS 框架提出“问题中心”优化范式,显著提升智能体自动化设计效率** 近日,一篇题为《ADIAS: Automated Design of Interactive Agentic Systems》的论文在 arXiv 上发布,提出了一种全新的自动化智能体设计框架。该研究由 Lekang Jiang、Bohan Tang、Stephan Goetz 和 Yiwen Guo 共同完成,旨在解决现有自动化智能体设计方法中的核心痛点。 ### 现有方法的局限 传统的自动化智能体设计(如基于候选智能体的迭代优化)通常以“候选中心”的方式组织跨轮次经验。每一轮迭代中,系统会生成多个候选智能体方案,对其进行评估,并将反馈汇总用于下一轮改进。然而,这种模式存在三个明显问题: - **修复目标不精准**:跨轮次的改进经验围绕候选方案展开,导致系统难以精准定位真正需要修复的环节。 - **部分进展整合缓慢**:有价值的局部改进难以在后续轮次中快速累积和复用。 - **无效干预传播**:某些无效的调整可能被错误地延续到后续迭代中,降低整体优化效率。 ### ADIAS 的创新:问题中心优化 针对上述问题,研究团队提出了一种全新的范式——“**问题中心智能体优化**”(Issue-Centric Agent Optimization)。与候选中心方法不同,该范式将修复进展显式地建模为持久的“问题状态”(Persistent Issue State),并以此指导后续优化,而非每轮从零开始重新推导。 ADIAS 框架包含两个核心机制: 1. **持久问题状态**:维护稳定的问题标识、生命周期状态、支持证据以及干预-结果历史。这使得系统能够持续追踪每个问题从发现到解决的完整过程。 2. **问题引导优化**:基于持久问题状态,联合提出下一轮的修复目标和修订方向,实现全代码级别的智能体设计修改。 ### 实验结果与性能提升 研究团队在五个交互式基准测试上对 ADIAS 进行了评估,结果显示: - 与最强基线相比,ADIAS 平均性能提升 **25.2%**。 - 在四种不同的骨干模型上均取得了一致的性能增益。 - 消融实验表明,移除持久问题状态或用候选中心策略替代问题中心修订,会导致性能下降高达 **40.7%**。 这些数据充分证明了问题中心优化范式的有效性。 ### 行业意义与展望 ADIAS 的提出为自动化智能体设计领域提供了新的思路。在人工智能日益复杂的今天,智能体系统的自动化设计能够大幅降低人工干预成本,提升开发效率。ADIAS 通过显式建模问题状态,使得优化过程更加透明、可控,有望在复杂任务求解、多智能体协作等场景中发挥重要作用。 未来,研究团队计划进一步探索 ADIAS 在更多实际应用中的潜力,并优化其计算效率。该论文的详细内容可在 arXiv 上获取(arXiv:2608.06410)。

Anthropic21天前原文

多模态大语言模型(MLLMs)在各类视觉-语言任务中表现出色,但其推理效率受制于大量视觉标记的处理开销。视觉标记剪枝能有效降低计算成本,但前提是准确评估每个标记的重要性。近期研究显示,语言模型中层的文本到视觉注意力可作为剪枝的有效指导,通常的做法是选取一个固定的中间层,利用其注意力分数筛选需要保留的视觉标记。然而,这种方法存在两个关键问题:**其一,不同样本所对应的最优注意力层差异显著**,固定层难以适应所有情况;**其二,获取中间层注意力需要先处理大量视觉标记,计算开销已经产生**,削弱了剪枝带来的收益。 针对上述挑战,来自北京航空航天大学等机构的研究团队提出了一种名为 **Middle-layer Attention Prediction(MAP)** 的方法。MAP 的核心创新在于**引入“问题对比教师选择”机制**:通过对比原始问题和参考问题下的注意力差异,为每个样本动态挑选最合适的教师层,再将该层的注意力知识蒸馏到一个轻量级预测器中。该预测器能够直接从多模态输入特征中估算视觉标记的重要性,无需实际计算注意力图。在推理阶段,MAP 结合预测的重要性分数与多样性准则,在进入语言模型第一层之前就完成视觉标记的剪枝,从而与现有的推理加速技术无缝兼容。 在 LLaVA-NeXT-7B 模型上的十项基准测试中,MAP 仅保留 **5.56%** 的视觉标记,便维持了未剪枝模型 **97.5%** 的性能,同时实现了 **3.09 倍** 的端到端加速。这一结果表明,MAP 在保持模型性能的同时显著提升了推理效率,为多模态大模型在实际场景中的部署提供了新的可能性。 ## 深度解析:为什么固定层不可靠? 传统方法依赖固定的中间层注意力,但研究团队通过分析发现,**不同样本对注意力层的敏感性差异极大**。例如,在回答“图中有什么颜色?”这类简单问题时,浅层注意力可能已足够;而面对“图中的物体在做什么?”这类复杂推理时,深层注意力才更有效。因此,固定层往往只能覆盖部分样本,导致剪枝效果不稳定。 ## MAP 的解决之道:动态教师 + 轻量预测 MAP 通过对比原始问题与参考问题(如“描述这张图片”)的注意力差异,识别出对当前问题最敏感的层,将其作为教师。随后,通过知识蒸馏,将教师层的注意力模式压缩进一个轻量预测器,该预测器直接由多模态输入特征生成重要性分数。这样一来,推理时无需计算任何注意力图,极大减少了计算负担。 ## 实际应用与前景 MAP 的设计使其易于集成到现有 MLLMs 中,且不干扰其他加速技术(如 KV 缓存压缩)。未来,该方法有望成为多模态模型高效推理的标准组件,尤其适用于图像密集、需要实时响应的应用场景,如自动驾驶、智能助手等。不过,研究者也指出,当前方法在极端剪枝率下的性能保持仍有待提升,未来将探索更精细的多样性控制策略。 总之,MAP 通过动态选择教师层和轻量预测,有效解决了视觉标记剪枝中的关键痛点,为多模态大模型的效率优化提供了新思路。

Anthropic21天前原文

**多标签节点分类**是图学习中的一个重要且具有挑战性的任务,因为节点往往同时具有多种语义。现有方法虽然能有效建模多标签,但大多局限于同域场景,即模型在同一图域内训练和测试,导致跨域泛化能力有限。近年来,**图基础模型(GFMs)** 作为跨域学习的新范式崭露头角,但现有GFMs基于单标签假设,将所有节点视为仅含单一语义并嵌入为单个向量。对于多标签节点,这种表示本质上是用一个点近似多种语义,不可避免地导致语义纠缠,难以同时区分多个标签。 针对这一局限,研究者提出了**多语义基图基础模型(MSB-GFM)**,这是一个面向跨域多标签节点分类的框架。其核心创新在于引入**多语义基表示学习范式**,将每个多标签节点建模为多个语义基的自适应组合,从而灵活地表达多种语义。此外,模型还设计了**语义-结构双通道架构**,并结合**域对抗训练**,以实现有效的跨域知识迁移。大量实验验证了该模型的有效性。 这一研究的意义在于,它首次将图基础模型的能力扩展到多标签场景,为处理现实世界中复杂的多语义图数据(如社交网络中的多兴趣用户、知识图谱中的多类型实体)提供了新思路。尽管目前仍处于早期阶段,但MSB-GFM为未来的多标签图基础模型研究奠定了基础。 **背景与挑战** 传统的多标签节点分类方法(如基于图神经网络的方法)通常需要针对特定图域进行训练,当应用到新图域时性能大幅下降。而图基础模型旨在学习可迁移的图表示,但现有模型大多假设节点只有一个标签,无法处理多标签节点的语义复杂性。例如,在一篇论文引用网络中,一篇论文可能同时属于“人工智能”和“网络科学”两个领域,单向量表示难以清晰区分这两种语义。 **MSB-GFM的核心思想** MSB-GFM借鉴了多语义基的思想,类似于将每个节点表示为一组基向量的加权和,每个基向量对应一种语义。这种表示方式比单向量更具表达力,能够捕捉节点的多面性。同时,通过域对抗训练,模型能够消除不同图域之间的分布差异,从而提升跨域泛化能力。 **实验与展望** 论文在多个数据集上进行了实验,结果显示MSB-GFM在跨域多标签分类任务上优于现有方法。尽管该模型仍处于研究阶段,但其为多标签场景下的图基础模型提供了新的方向。未来,这一框架有望应用于推荐系统、生物信息学等领域,处理更加复杂的多标签图数据。

Anthropic21天前原文

最近,一项发表在 arXiv 上的研究提出了一种名为 **点火指数(Ignition Index, I)** 的新指标,旨在量化 Transformer 语言模型中的全局工作空间动态。该指标基于全局工作空间理论(Global Workspace Theory, GWT),通过拟合 sigmoid 函数来捕捉模型内部信息处理的突变性,为理解大模型的内部机制提供了新的视角。 ## 研究背景与核心方法 全局工作空间理论认为,意识相关过程涉及一种“全有或全无”的点燃机制,即信息在某个处理阶段会突然变得全局可用。此前,这一理论主要在神经科学领域探讨,而此次研究将其引入人工智能领域,尝试在 Transformer 模型中寻找类似的动态特征。 研究者定义的点火指数通过以下步骤计算: - 对模型每一层的线性探针(linear probe)准确率进行测量,这些探针用于检测模型内部表示中是否包含特定输入信号的信息。 - 将准确率作为输入信号强度的函数,拟合一个四参数 sigmoid 曲线,并提取其陡峭参数 β-hat。 - 高 β-hat 值表示信息处理是突变的(类似点燃),低值则表示渐进的构建过程。 ## 主要发现与实验验证 研究团队在 **11 个模型**、涵盖 **五种架构家族** 上进行了验证,并通过打乱标签的对照实验确认了该指标的可靠性,其选择性高达 **9.6 倍**(p < 0.001),表明它确实捕捉到了真实语言结构而非虚假的探针能力。 关键发现包括: - **前馈 Transformer 与 SSM 的对比**:前馈 Transformer 的聚合 β-hat 比状态空间模型(SSM)高 **89%**(p < 1e-13,Cohen's d = 0.52),其中 Mamba 模型表现出接近线性的特征,暗示其缺乏全局广播机制。 - **循环架构的维度差异**:Huginn-3.5B 模型在迭代轴上的点火指数比深度轴高 **2.12 倍**,表明循环架构在时间维度上更易表现出类似工作空间的转变。 - **训练阶段的相变**:Pythia-410M 模型在训练步骤 **256** 时出现一个由 PELT 检测到的相变(β-hat 增加 67%),这一时间点早于归纳头的形成。 ## 理论意义与未来方向 值得注意的是,研究未能证实点火指数与模型规模或信号强度之间的假设关系,这可能意味着当前 Transformer 架构已经饱和了可用的点火机制。这一发现对缩放定律(scaling laws)提出了新的思考:仅仅增大模型规模可能不会带来额外的动态优势。 该研究首次在 **机制可解释性** 与 GWT 的动态预测之间建立了定量桥梁,为理解大模型的信息处理方式提供了新工具。未来,点火指数有望用于指导模型设计,例如选择更具“全局广播”能力的架构,或监控训练过程中的动态变化。 尽管这是一项初步研究,但其方法具有通用性,可以应用于更多模型和任务。随着 AI 系统日益复杂,这类理论驱动的度量指标将帮助我们更深入地揭示其内部运作机制。

Anthropic24天前原文

机器学习模型在急性缺血性卒中90天预后预测中展现出强大的准确性,但其临床应用却受限于模型解释与临床医生推理方式的不一致。一项针对临床医生的用户研究呼吁采用与临床指南对齐的阈值,受此启发,一项新研究探讨了是否可以用临床信息分类编码替代连续预测变量而不牺牲性能。 该研究基于一个多中心欧洲注册数据库,将患者分为三个治疗队列,比较了标准梯度提升模型与完全分类模型的性能,后者使用卒中指南对齐的、治疗特异性阈值。结果显示,在两个治疗队列中,完全分类模型的预测性能与连续模型在统计上无显著差异,但在一个队列中出现显著下降。然而,全局特征重要性排名保持一致,表明将连续预测变量离散化为指南分类保留了各治疗组预后因素的核心层级。 因此,指南分类是卒中预后模型的一个可行设计选择。这项研究为弥合机器学习模型与临床实践之间的鸿沟提供了早期证据,提示在保持预测性能的同时,采用临床可解释的分类方式可能促进模型在临床中的采纳。 ## 研究背景与动机 尽管机器学习在医学预测中表现优异,但临床医生常因模型输出缺乏可解释性而犹豫使用。该研究团队通过临床医生用户研究,发现医生更倾向于基于指南的明确阈值,而非连续的预测分数。因此,他们提出假设:将连续变量(如年龄、血压、血糖等)按临床指南转化为分类变量,可能在不显著降低性能的前提下提高模型的可解释性。 ## 方法概览 研究使用了多中心欧洲卒中注册数据,涵盖三个治疗队列(如静脉溶栓、机械取栓等)。他们构建了两种梯度提升模型:一个使用原始连续变量,另一个将所有连续预测变量替换为基于指南的分类编码(如血压分段、血糖范围等)。通过比较两者的预测准确性和特征重要性,评估分类编码的影响。 ## 主要发现 - **性能权衡**:在两个队列中,分类模型的AUC与连续模型无显著差异,但在第三个队列中,分类模型性能显著下降,表明分类可能丢失部分信息,但在多数情况下是可接受的。 - **特征重要性稳定**:尽管编码方式改变,全球特征重要性排序保持一致,说明分类并未扭曲核心预后因素的相对贡献。 - **临床可解释性**:分类编码直接对应临床指南,使模型输出更易被医生理解和应用,有望提升临床采纳率。 ## 意义与展望 该研究为AI在医疗领域的落地提供了新思路:不必一味追求复杂连续模型,有时简单的、临床对齐的分类模型更具实用价值。未来研究可进一步优化分类阈值,并探索在不同疾病领域中的适用性。

Anthropic24天前原文

随着大语言模型(LLM)智能体生态的蓬勃发展,可复用技能(Skill)正成为市场中的核心资产。这些技能包往往包含元数据、自然语言指令、代码、工具、参考资料和操作流程等多模态内容。然而,随着技能商品化,如何审计其复用情况已远超传统代码克隆检测的范畴。现有检测器主要针对单一模态的源代码或整个包的相似性,但技能复用证据分散在文本、实现片段和操作结构中,导致仅保留部分技能特征的复用行为难以被识别。为此,研究团队提出了 **SkillTrace**,一个多迹溯源审计框架,专门用于LLM智能体技能复用检测。 ## 核心机制:三条迹线并行 SkillTrace从技能中提取三类溯源迹线:**表达迹线(Expression)**、**实现迹线(Implementation)** 和 **操作迹线(Operational)**。其中,操作迹线被构建为**技能操作图(SOG)**,捕捉技能的激活条件、执行流程和资源流动结构。LLM仅在技能摄入时辅助一次操作迹线的提取,而在审计阶段,系统以确定性方式比较缓存的迹线,并针对相同功能的严格负样本进行校准,最终报告哪条迹线支持复用判定。这种设计既保证了审计的高效性,又减少了LLM在关键路径上的依赖。 ## 性能表现与基准测试 研究团队构建了 **SKILLTRACE-BENCH** 基准,包含100个市场锚点技能、820个经过变换的复用正样本和751个负样本。在该基准上,SkillTrace取得了 **AUROC 0.938** 和 **F1 0.898** 的优异成绩。此外,在包含 **36,446个技能** 的大规模真实审计中,SkillTrace通过迹线归因的证据,成功暴露了比仓库级基线更有效的复用审查队列,显示了其在实际场景中的实用价值。 ## 行业意义与未来展望 这一研究的价值在于,它首次将技能复用审计从代码克隆检测的单一视角,提升到多模态、多迹线的系统化层面。对于AI安全与合规而言,这意味着能够更精准地追踪技能的来源和演变,防止未经授权的复用或知识泄漏。随着技能市场的成熟,这种审计能力将成为平台治理的关键工具。未来,如何将SkillTrace扩展到更多模态(如图像或音频)以及如何优化SOG的构建效率,将是值得关注的方向。 不过,值得注意的是,该论文目前以预印本形式发布(arXiv:2608.05204),尚未经过同行评审,其方法的实际效果仍需进一步验证。

Anthropic24天前原文

事件驱动的智能分析系统,如风险预警、决策支持与叙事理解,高度依赖显式的因果事件知识。然而,传统的实例级因果对在低频长尾和未见事件组合上存在严重的泛化缺陷。为此,研究者提出了一种全新的关系级因果抽象范式——**抽象事件因果规则(AECR)**,将具体的因果对转化为通用的抽象因果逻辑,同时保留其内在的因果语义。 ## 从具体到抽象:多智能体因果归纳 论文设计了一个**多智能体具体到抽象因果归纳(CACI)系统**,配合相似度约束聚类,从嘈杂的原始因果数据中提炼出可信的AECR,并构建了两个完整的AECR知识库。这一过程类似于人类专家从大量案例中总结规律,使得因果知识更具泛化能力。 ## 注入规则:提升事件预测性能 为了验证抽象因果知识的实用价值,研究团队提出了**抽象规则引导的因果注意力编码器(AR-GCAE)**,通过规则引导的注意力层和门控表示融合,将检索到的AECR注入到因果图事件预测(CGEP)基准任务中。定量实验表明,应用AECR显著增强了事件因果推理的泛化能力,并在事件预测上带来一致的性能提升,尤其是在稀有和未见事件样本上效果最为显著。 ## 意义与展望 这项工作为事件因果推理提供了一种新的思路:不再局限于实例层面的匹配,而是通过抽象规则捕捉事件间的深层因果结构。这对于处理现实世界中数据稀疏、事件组合多样的问题具有重要价值。未来,这种抽象因果规则有望在更广泛的应用场景中发挥作用,如智能决策、舆情分析等。 论文由Ziwei Zheng、Peiqiong Chen和Bang Wang共同完成,发表于arXiv(编号:2608.05205)。

Anthropic24天前原文

在人工智能与棋类游戏的交汇处,一项新研究带来了值得关注的突破。来自arXiv的最新论文提出了一款名为 **Otter** 的15.3M参数人类象棋AI,它通过将下棋建模为**时间感知的序列过程**,而非孤立地看待每个棋局,从而更准确地预测人类棋手的走子选择。 ## 核心设计:双信号条件化 Otter 的核心创新在于引入两种条件信号: - **历史编码器**:基于最近20步棋进行条件预测,捕捉开局偏好、位置漂移以及棋局内的行为趋势。 - **时间控制模块**:根据时钟压力(即剩余时间)来调节预测,模拟人类在时间紧迫时的决策变化。 这种设计让模型能够理解棋局的动态演变,而不是仅仅依赖静态的盘面评估。 ## 训练与性能:效率与精度的双重胜利 Otter 在 **6.1亿个局面** 上训练,数据来自 **1.17亿局Lichess快速对局**,仅用**单张T4 GPU**耗时30天完成。尽管如此,它在走子预测上达到了 **55.23%的Top-1准确率** 和 **90.95%的Top-5准确率**,超越了此前的最先进人类象棋模型 **Maia 2**,且参数更少、训练数据更少。 值得注意的是,在 **11个Elo区间**(从<1100到>=2000)中,Otter 在 **1900-1999区间** 达到了 **57.38%** 的峰值准确率。这显示出模型在不同水平棋手中的适应性。 ## 行业意义:从“最优”到“像人” 传统象棋AI如AlphaZero追求绝对最优走法,而人类象棋AI的目标是模拟人类行为,这在训练AI与人类协作、开发教学工具或提升游戏体验方面具有独特价值。Otter 的成功表明,**时间感知和序列建模**是提升人类行为预测的关键,这为未来AI在更多需要“像人”决策的领域(如游戏、谈判、驾驶)提供了新的思路。 ## 开放与可复现 作者公开了代码、训练模型和完整训练日志,为社区复现和进一步研究提供了便利。这体现了学术界开放合作的精神,也加速了该领域的迭代。 ## 结语 Otter 以较小的模型规模实现了更高的预测精度,验证了“时间感知序列建模”在人类行为预测中的潜力。随着AI在棋类游戏中的角色从“对手”转向“伙伴”,这类研究将越来越重要。

Anthropic24天前原文

深度搜索代理(deep search agents)在处理复杂问题时,需要经历长时间的网络交互,这一过程既复杂又脆弱:微小的推理错误可能在冗长且嘈杂的轨迹中不断放大,最终导致看似流畅却错误的答案。然而,诊断这类故障极其困难,因为人工检查超长的执行轨迹几乎超出人类能力范围。为此,研究者提出了 **SearchAuditBench** 基准,用于评估大语言模型(LLM)审计器能否定位、归因并修复这些故障,从而减轻人工负担。 SearchAuditBench 包含 **1,243 条失败轨迹**,平均每条包含 **73.1 条消息**和 **65.1K tokens**,这些轨迹来自五个深度搜索基准上的八个开源模型,每条轨迹都经过专家标注,标出关键错误步骤、搜索特定的根因以及带评分标准的参考修复方案。 在此基础上,研究者进一步提出了 **SearchAuditor**,一个多视角审计框架,通过基于证据的裁决机制,有效定位、归因并修复搜索代理的故障。实验结果显示,即使是最强的基线(如 GPT-5.5 等前沿模型),其端到端通过率也仅为 **26.6%**。而 SearchAuditor 在不同前沿模型上均优于所有基线,实现了 **32.3%** 的端到端通过率,并且通过修复失败运行,代理能更好地从错误中恢复。 这一研究为提升深度搜索代理的可靠性提供了新的思路,也凸显了审计和归因在复杂 AI 系统中的重要性。随着 AI 代理在现实场景中的广泛应用,这类审计工具将成为保障其安全性和可信度的关键一环。

Anthropic24天前原文

大语言模型(LLM)在推理任务中常常失败,尽管它们具备解决问题的能力。一项新研究指出,这些失败往往源于中间步骤的局部推理错误,而非整体能力不足。更重要的是,这些错误通常是可修复的:在强模型的推理前缀后插入一段由弱模型生成的简短补丁,就能将推理轨迹引向正确答案。然而,直接对弱模型补丁或修复后的轨迹进行微调,并不能可靠地将这种纠正效果内化到强模型中。这表明,有用的信号不在于干预文本本身,而在于它如何重塑模型未来的推理分布。为此,研究者提出了**啄木鸟蒸馏(Woodpecker Distillation)**,一种从对比性局部干预中学习的弱到强训练框架。该方法在相同前缀下对比成功与失败的弱模型补丁,构建一个纠正性的教师分布,并将其蒸馏到强模型中。在数学推理基准上的实验表明,啄木鸟蒸馏能持续提升强模型性能,并优于直接模仿基线。该研究为提升大模型推理能力提供了新思路,即利用弱模型的诊断能力来修复强模型的局部缺陷。

Anthropic24天前原文

大型企业的日常运营往往依赖于众多异构的业务系统和信息应用,这些系统在带来效率的同时,也造成了严重的数据孤岛和流程碎片化。企业投入了大量资源构建这些应用,但如何有效利用和编排它们,始终是个难题。传统集成方案,如企业服务总线(ESB)、API网关和机器人流程自动化(RPA),存在高耦合、运维成本高、智能化程度低等固有问题。 针对这一痛点,一篇新近发布的论文提出了 **Agentic Nesting** 框架,这是一种多智能体协作方法,将现有企业应用封装为自主AI代理,并按层级嵌套结构组织。与平铺直叙的互联不同,这些代理被组织成层级式的管理模式,以反映企业生态的复杂构成。该框架从每个遗留应用中提取数字代理,支持自然语言交互和自主操作,并通过中心编排器协调多个代理,实现任务分解和动态调度,最终以统一对话界面提供跨应用查询和流程编排。 论文的核心贡献在于提出了 **“应用即代理”** 的集成范式和 **“对话即集成”** 的交互理念,并探索了该方法在异构系统协调和大规模数据应用等场景中的泛化潜力。 这一思路的转变值得关注:传统集成关注系统间的连接,而Agentic Nesting则关注如何让应用以智能体的方式参与协作,从而降低集成复杂度,提升系统灵活性。尤其对于拥有大量遗留系统的企业,这种方法可能提供一条渐进式升级路径,无需彻底替换现有系统。 当然,该研究目前仍处于学术探索阶段,其实际效果和落地可行性尚待验证。但无疑,它为企业应用集成领域提供了新的思考方向,也为AI在企业级场景中的应用开辟了新的可能性。随着相关技术的成熟,我们或许能看到更多企业采用类似方法,逐步实现智能化转型。

Anthropic24天前原文