SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:Anthropic清除筛选 ×

在人工智能领域,长时程智能体(Long-Horizon Agent)在执行复杂任务时,往往需要经历数百个交织的推理、行动和观察步骤。当用户提出一个查询时,答案可能依赖于历史轨迹中早已被淹没的关键证据。为了应对这一挑战,研究者们提出了多种外部记忆机制,将轨迹存储为结构化表示。然而,每种结构都只提供了不完整且侧重点不同的视角,如何高效地组合这些互补信息,成为提升智能体性能的关键问题。 现有系统通常采用两种策略:一是对每个查询都读取固定的一组结构,这会导致上下文膨胀并引入噪声;二是将每个查询路由到单一结构,这又无法整合来自不同结构的互补证据。这种非此即彼的做法,显然无法满足复杂任务的动态需求。 针对这一局限,来自多所机构的研究团队在最新论文中提出了一种名为 **MESA(Multi-structure Evidence Selection framework)** 的创新框架,旨在通过任务自适应的多结构证据选择,优化长时程智能体的记忆利用效率。 ## 核心发现:最优配置并非“全都要”或“选一个” 研究团队首先在 **AMA-Bench** 基准上进行了受控分析,结果发现:对于不同查询和任务,最优的记忆配置通常既不是单一结构,也不是所有结构的简单并集,而是一个根据当前需求动态组合的**多结构子集**。这一发现直接挑战了现有方法的固定模式,为动态选择机制提供了理论依据。 ## MESA 框架:五个视角与强化学习 基于上述洞察,MESA 框架设计了五个互补的结构化视角来刻画每条轨迹,每个视角都捕捉了轨迹的不同侧面。在推理阶段,MESA 会从这五个结构中,针对当前查询,选择并融合一个特定的子集,以生成最终答案。 为了在缺乏细粒度监督的情况下学习这种选择策略,MESA 采用了**端到端的答案级反馈**,并引入了**先验引导搜索**和 **UCB(Upper Confidence Bound)引导调度** 的强化学习优化方法,从而在探索与利用之间取得平衡,有效提升学习效率。 ## 显著成效:性能提升与成本降低 在 AMA-Bench 基准上的实验结果显示,MESA 相较于最强基线模型,在性能上提升了 **8.5%**,同时相较于使用全部结构的方案,证据 token 消耗减少了 **41%**。这表明 MESA 不仅能够更精准地定位关键证据,还能显著降低计算成本,提升推理效率。 这项研究为长时程智能体记忆管理提供了新的思路,其动态选择机制有望在复杂的多步推理任务中发挥重要作用,推动智能体在真实世界场景中的落地应用。

Anthropic20天前原文

深度强化学习(DRL)在复杂环境中表现出色,但其决策过程往往被视为“黑箱”,难以解释。近日,研究人员提出了一种名为SPOT(Sampling Policy Observation Tree)的新型模型无关框架,旨在通过采样和模拟,为DRL策略提供直观的、前瞻性的解释。该研究已提交至arXiv(编号2608.09967),并在交通信号控制领域进行了案例验证。 ## 从“事后归因”到“前瞻模拟” 传统的可解释性方法,如特征归因,通常只关注单个时间步的决策依据,无法揭示策略的长期行为模式。SPOT则另辟蹊径,它通过访问策略和环境模拟器,构建一棵有限时域的“策略观察树”。具体而言,SPOT从当前状态出发,对策略的动作分布进行采样,并递归模拟每个动作产生的后续状态,从而形成一棵树状结构。这棵树不仅展示了策略在当前状态下的动作偏好,还呈现了这些偏好可能导致的未来演化路径。 ## 理论保证与实验验证 SPOT并非一个简单的可视化工具,其背后有严谨的理论支撑。研究团队证明了SPOT能够渐近地恢复策略的最可能动作,并刻画了在高熵策略下其分歧行为。这意味着,即使在策略高度不确定的情况下,SPOT也能提供可靠的解释。 为了验证SPOT的实用性,研究人员在SUMO-RL交通信号控制环境中进行了案例研究。结果表明,SPOT能够有效用于检查策略偏好、比较不同未来轨迹,并揭示那些通过单时间步特征归因方法无法看到的潜在下游行为。例如,它可能发现某个看似合理的信号灯控制策略,在几个时间步后会导致严重的交通拥堵,而传统方法则难以捕捉到这种长期影响。 ## 推动DRL落地应用 SPOT框架的出现,为DRL的可解释性研究提供了新的思路。它不依赖于特定模型结构,适用于任何可访问策略和环境模拟器的场景。这种前瞻性的解释能力,对于在自动驾驶、医疗诊断、智能交通等高风险领域部署DRL系统至关重要。它不仅能帮助开发者调试和优化策略,还能增强用户对AI系统的信任。 尽管SPOT目前仍处于研究阶段,但其潜力不容小觑。未来,该框架有望与更多应用场景结合,成为DRL走向实际应用的重要工具。

Anthropic20天前原文

在芯片设计流程中,硬件验证占据着举足轻重的地位,而测试激励生成(Testbench Stimulus Generation)则是验证环节的核心任务之一。传统的验证方法依赖人工编写测试用例,不仅耗时费力,而且难以保证覆盖率。近年来,大型语言模型(LLMs)在代码生成领域展现出巨大潜力,但如何将其有效应用于硬件验证,仍面临挑战。来自英伟达和加州大学圣迭戈分校的研究团队提出了一种名为 CHORUS 的后训练框架,通过融合多个互补的专家模型,在测试激励生成任务上取得了显著突破。 CHORUS 的核心思想源于两个关键观察:首先,分阶段的监督微调(SFT)能够产生行为多样化的模型检查点,而密集奖励的强化学习(RL)则能将这些检查点转化为性能强劲但任务侧重各异的专家模型。其次,这些专家模型的能力具有互补性,通过模型合并或进一步后训练,可以整合它们的优势,从而超越任何单一专家的表现。 研究团队将多个专家模型整合为一个 4B 参数的模型,在 CVDP-ECov 基准测试上取得了 **88.0% 的 Pass@1 成绩**,大幅超越了 **DeepSeek-R1(671B)** 的 74.5%,提升了 **13.5 个百分点**。这一结果令人瞩目,表明通过精心设计的后训练流程,小规模模型也能在特定任务上超越大规模模型。 CHORUS 的成功不仅验证了模型合并与专家互补策略的有效性,也为硬件验证领域带来了新的思路。传统的 LLM 应用通常采用“预训练-微调-推理”的固定范式,而 CHORUS 则展示了通过构建和整合多个专家模型,可以更高效地利用模型能力,提升任务表现。这一方法有望在芯片设计自动化(EDA)领域得到广泛应用,加速验证流程,降低设计成本。 尽管 CHORUS 目前专注于测试激励生成,但其框架具有通用性,未来可扩展至其他代码生成任务,如 RTL 设计、验证环境搭建等。随着硬件设计复杂度的不断提升,类似 CHORUS 的智能辅助工具将成为芯片工程师不可或缺的伙伴。这项研究也为 LLM 在专业领域的落地提供了宝贵经验:通过针对性的后训练与模型融合,小模型也能发挥大作用。

Anthropic20天前原文

人工智能(AI)和机器学习(ML)已成为支持和自动化复杂人类任务的强大工具。然而,随着大型深度学习(DL)模型的广泛部署,其高能耗和碳排放问题日益受到关注。近期,一篇发表于《Applied Intelligence》的论文对绿色AI、绿色DL及减排优化技术进行了系统性回顾,并比较了多种碳排放测量工具。研究还通过CPU实验评估了六个DL模型在多标签分类任务中的碳排放,结果显示训练阶段是排放的主要来源,且模型复杂度的增加并不总能带来相应的精度提升,强调了平衡性能与环境成本的重要性。

Anthropic20天前原文

随着AI系统在医疗、金融、法律等高损失领域中的应用日益广泛,人类监督的局限性逐渐凸显。一篇来自arXiv的最新论文(编号2608.07474)提出了一个名为“Flow-by-Flow”的治理框架,旨在不评估内容本身的情况下,对AI输出进行有效管控。该研究指出,传统的人类监督模式在高输出速度下会遭遇认知瓶颈,而新框架通过控制“认知负荷”而非内容正确性,为AI治理提供了新思路。 ## 核心问题:认知负荷的瓶颈 论文指出,AI输出的速度(V)与人类认知容量(C_max)之间的差距,并非唯一制约因素。真正的瓶颈在于“认知负荷”(L),即每项输出所需的人工审查成本。L由三部分构成:**分类成本**(triage)、**判断成本**(judgment)和**响应成本**(response)。随着AI能力提升,这三部分的变化并不对称: - **分类成本**:不降反升,因为通用AI的语义不确定性是固有特性,分类难度不会随模型能力增强而减少。 - **响应成本**:与准确性无关,保持不变。 - **判断成本**:虽有下降趋势,但往往是通过“省略”而非真正减少判断实现,即审查者可能跳过某些判断以应对压力。 因此,AI能力的提升并未降低总体认知负荷,反而可能使其结构失衡,导致监督质量下降。 ## 现有治理手段的困境 论文批评了两种常见的治理方式:一是将内容评估交给AI,但这会引入“幻觉风险”(即AI可能产生虚构或错误信息);二是依赖人工审查,但会撞上V×L的天花板,即输出速度与认知负荷的乘积超过人类处理极限。这两种方式都无法在高损失领域实现可靠治理。 ## Flow-by-Flow:绕过内容判断的新范式 为此,论文提出“Flow-by-Flow”治理框架,其核心思想是**不评估内容本身,而是控制监督负荷**。具体通过两个机制实现: - **认知成本评分**:基于正式、可计数的特征(如输出长度、生成速度、复杂度指标)对高产量生产施加非线性成本,使高输出量在成本上变得不可行。 - **机构容量上限**:确保处理量始终在人类认知容量C_max之内,避免超负荷运行。 该框架还定义了四条设计不变量,任何“内容判断绕过”的超出路径都必须满足: 1. **无内容判断**:不依赖对输出内容的正确性评估。 2. **不可扩展的审查员能力消耗**:防止通过增加审查员数量来突破容量上限。 3. **基于身份的每应用摩擦**:每个应用场景都有独立的摩擦机制,避免跨场景的批量处理。 4. **无批量清关**:不允许一次性通过大量输出,必须逐流处理。 ## 实验与可行性 论文还讨论了一个参考实现,证明这些不变量可以同时满足,但也坦承其在实际应用中的困难。此外,作者通过蒙特卡洛模拟(1000次参数抽样)比较了复合多指标流量控制与单纯监督强化的效果,结果显示前者在**90.8%**的试验中表现更优,表明该框架具有一定的优越性。 ## 意义与展望 这项研究为AI治理提供了新的视角:与其试图让AI输出“正确”,不如从流程上控制审查负荷,从而在高风险场景中保持人类监督的可持续性。尽管“Flow-by-Flow”仍处于理论阶段,但其设计原则可能对未来AI监管政策和技术实现产生启发。随着AI能力的持续提升,如何在效率与安全之间取得平衡,将是一个长期挑战,而这项研究无疑为应对这一挑战提供了有价值的思考。

Anthropic21天前原文

近日,一篇发表于arXiv的论文(编号2608.07480)提出了一种将情感状态纳入主动推理驾驶模型的新方法,旨在更全面地模拟人类驾驶员在复杂交通环境中的决策行为。该研究由Julian F. Schumann等多位学者合作完成,涉及人工智能、人机交互、机器学习与机器人学等多个领域。 主动推理(Active Inference)是一种基于自由能原理的认知框架,强调智能体通过行动来最小化预测误差与不确定性,同时追求目标导向的行为。近年来,该框架已被成功应用于生物系统与人工系统,包括对人类驾驶行为的建模。然而,现有的主动推理驾驶模型大多忽略了情感因素,而情感状态(如愤怒、焦虑)在真实驾驶中显著影响决策,例如路怒症可能导致激进驾驶。 此前,已有研究在简化环境中将情感表示为环状模型(Circumplex Model)中的效价(Valence)与唤醒度(Arousal)两个维度,但这些研究局限于离散状态空间。本研究的创新之处在于:在连续状态空间的复杂驾驶模型中,扩展了效价与唤醒度的定义,不仅基于当前状态,还结合了对未来结果的预测来估计情感信号。 研究团队在两个交互式驾驶场景中评估了该方法,结果显示模型产生的情感信号与人类在类似情境下的情感反应模式相符。例如,在面临突发风险时,模型会表现出较高的唤醒度和负效价,模拟出紧张与不安的情绪。 这一成果对于自动驾驶与人机共驾系统具有潜在价值。通过将情感模型整合到驾驶决策中,未来的自动驾驶系统或许能更好地理解人类驾驶员的状态,从而做出更安全、更自然的交互行为。此外,该研究也为主动推理框架在情感计算领域的应用提供了新思路,有望推动更贴近人类认知的智能体设计。 尽管该研究仍处于模拟阶段,距离实际应用尚有距离,但它为情感与认知建模的交叉研究提供了重要参考。随着相关技术的成熟,我们或许能看到更具“人性化”的自动驾驶系统问世。

Anthropic21天前原文

训练深度学习模型时,处理长度可变的序列数据往往面临巨大的计算挑战。近日,来自新加坡国立大学的研究团队提出了一种名为 **Data-Centric Parallel(DCP)** 的新方法,旨在打破效率与易用性之间的两难困境。相关论文已提交至 arXiv(编号:2608.07524),并展示了在 32 块 H200 GPU 上最高 **2.88 倍** 的加速效果。 ## 现有方法的困境 对于变长序列的训练,传统策略通常分为两类: - **简单方法**:采用静态配置,如固定并行度或梯度累积步数,这会导致不同批次间的工作负载严重不均衡,计算资源利用率低下,训练效率不高。 - **复杂方法**:通过动态调整运行时配置来适配序列长度变化,但往往需要引入大量代码改动,对于新模型的适配成本极高,难以推广。 ## DCP 的核心思想 DCP 的核心原则是 **让数据本身驱动运行时决策**。具体而言,它会根据每个批次的实际序列长度,动态调整直接运行时设置,包括: - 并行大小(parallel size) - 梯度累积步数(gradient accumulation) - 重计算策略(recomputation) 这种动态调整机制使得计算资源能够更贴合当前批次的需求,从而在保持高效率的同时,无需复杂的人工干预。 ## 显著加速与易用性 实验结果显示,在 32 块 H200 GPU 上,DCP 能够实现最高 **2.88 倍** 的训练加速。更值得关注的是,该方法设计上注重通用性,**仅需约 10 行代码**即可集成到任意模型中,极大降低了部署门槛。 ## 意义与展望 DCP 的提出为变长序列分布式训练提供了一个简单而有效的基线方案。它有望成为该领域后续研究的参考基准,推动分布式训练技术在处理变长序列时的进一步发展。对于研究者而言,这一方法意味着可以更轻松地应对自然语言处理、视频理解等任务中常见的长度不均问题,而无需牺牲效率或编写大量定制代码。

Anthropic21天前原文

大语言模型(LLM)的部署监控正面临一个令人困惑的现象:线性探针(linear probes)几乎能完美检测到模型输入中的“上下文污染”,但这种高精度却无法转化为可靠的失败预测。来自 arXiv 的一项最新研究(编号 2608.07528)揭示了这一“知而不言”的鸿沟:模型内部状态“知道”错误发生,但口头表达的置信度却无法反映这一点。 该研究聚焦于多跳算术推理链,通过精心设计的实验,测试了线性探针在检测上下文污染、预测最终答案正确性方面的表现。结果令人意外:探针虽然能高精度地识别输入是否被污染,但这种检测能力与最终答案是否正确几乎无关。换句话说,探针“看到了”错误信号,但这些信号并不能帮助预测模型是否会给出错误答案。 更耐人寻味的是,当研究者强迫模型采用结构化的置信度格式时,模型的置信度输出会坍缩为两个值,且这两个值对应的错误率没有显著差异。这意味着,模型看似给出高置信度,但其背后隐藏的错误风险可能被完全掩盖。此外,探针在推理链各步骤上的持续性表现,也未能区分正确与错误的结果,这直接否定了研究者预先注册的“持续性优于峰值”假设。 这一“知而不言”的模式在包括推理模型在内的多个模型家族中普遍存在,表明它并非个别模型的特性,而是大模型监控中的普遍挑战。 那么,这是否意味着探针监控毫无价值?并非如此。研究表明,探针监控是口头置信度的必要补充,但没有任何一种单一的干预策略能够全面主导。在实时监控场景中,探针干预的效果高度依赖于模型类型和错误类型。例如,一种名为“分支选择”(branch-and-pick)的策略在多个模型上净收益为正,且在 Llama-3.1-8B 上表现独特,能够修复 4 个错误而不会破坏任何正确轨迹;而“重新提示”(reprompt)和“替换先前”(replace-prior)策略在修复错误的同时,也会以大致相同的比例破坏原本正确的轨迹。 因此,可部署的监控方案必须是模型感知、错误类型感知的路由机制,而非一刀切的干预手段。这项研究为 AI 安全与可靠性领域提供了新的视角:我们不仅要关注模型“说”了什么,更要关注它“知道”什么,以及如何将内部知识转化为可靠的行动。

Anthropic21天前原文

随着大型语言模型(LLM)智能体的广泛应用,多智能体协作系统成为AI领域的热点。然而,现有架构要么预先固定通信模式,要么采用全广播方式,导致令牌成本、延迟、冗余和错误传播等问题。最新研究提出一种基于合作博弈的动态联盟形成与通信定价框架,旨在优化智能体选择与通信过程。 ## 研究背景与核心思想 在多智能体系统中,每个智能体具备不同的技能,但传统的固定通信或全广播方式效率低下。研究者将智能体选择与通信建模为合作博弈,定义任务条件下的净效用函数,区分联盟级成本与智能体激活成本。通过边际价值激活规则和贪婪路由器,系统能够动态决定哪些智能体应参与任务,以及哪些通信链路值得建立。 ## 关键技术与理论贡献 研究利用Shapley值预测智能体的价值,在任务执行前和执行中动态调整联盟。同时,将问题与子模最大化联系起来,并证明了两个有限保证:对于单调、基数受限的特例,给出了曲率精化界;对于无约束的非单调情况,通过双重贪婪算法实现了紧的1/2近似。此外,还提出了Shapley-子模夹逼界,将边际价值路由的误差与每智能体递减收益量联系起来。 ## 实验效果与鲁棒性分析 在合成实验中,贪婪路由达到了暴力搜索最优效用的**99.5%**,平均仅激活8个智能体中的1.96个,而全广播只能达到38.8%的效用。性能对激活成本和冗余权重具有鲁棒性,但在子模性严重违反或价值估计有噪声时,性能降至66%。这表明该框架在理想条件下高效,但在实际复杂环境中仍需改进。 ## 与现有方法的区别及未来方向 该框架与Shapley定价、享乐联盟形成和通信图剪枝等方法有明确区别,强调动态性和成本效益。未来工作将评估在真实多智能体LLM基准上的表现,以验证其实际应用价值。 总之,这项研究为多智能体协作提供了一种成本感知的动态决策思路,有望在复杂任务中降低通信开销并提升整体效率。

Anthropic21天前原文

## 背景:知识图谱校验的痛点 在知识图谱(KG)领域,**SHACL**(Shapes Constraint Language)是确保数据符合特定规则的核心技术。然而,编写SHACL形状(shapes)需要较高的技术门槛,大多数领域专家并不具备这种能力。如果能将自然语言需求直接翻译成SHACL(即NL2SHACL),将大大降低使用门槛,让更多人参与到知识图谱的构建与维护中。 ## 现有评估方法的局限 目前,**NL2SHACL领域缺乏专门的评估基准**,且评估生成的SHACL形状不能简单依赖字符串比较——因为语义等价的形状可能在序列化形式或结构上存在差异。这意味着,即使两个形状在文本上不同,它们可能表达相同的约束逻辑,反之亦然。因此,需要一种更智能的评估方式。 ## NL2SHACL-Bench:填补空白 针对上述挑战,来自慕尼黑工业大学(TUM)等机构的研究团队(Yuchen Zhou、Niels Bobet、Maribel Acosta)提出了 **NL2SHACL-Bench**,这是一个专门用于自然语言到SHACL翻译的基准测试套件。该套件旨在系统性地衡量模型在将自然语言描述转化为SHACL形状时的性能。 ## 主要发现:语法易,语义难 研究团队利用NL2SHACL-Bench对**四个最先进的大语言模型(LLMs)**进行了评估。结果显示,当前LLM在生成语法合法的SHACL方面表现出色,但在处理复杂逻辑和结构模式时,**难以生成语义等价的约束**。这意味着,模型可能生成“看起来正确”的SHACL,但实际约束与原始需求不符。 ## 意义与展望 NL2SHACL-Bench的发布为NL2SHACL领域提供了一个标准化的评估平台,有助于推动该方向的研究进展。随着LLM能力的提升,未来有望通过自然语言直接生成可靠的SHACL形状,进一步降低知识图谱的应用门槛。不过,当前模型在语义理解上的短板也提醒我们,**自然语言到形式语言的转换仍有很长的路要走**。 该研究论文《NL2SHACL-Bench: A Benchmark Suite for Natural Language to SHACL Translation》已发布于arXiv(编号:2608.07530),共18页,包含8张图和2张表格。

Anthropic21天前原文

近年来,人工智能系统在辅助人类决策时,往往倾向于给出一个“最优”建议,但这种方式在复杂、高风险场景下可能掩盖了决策背后的不确定性。为此,研究者提出了**评价型AI(Evaluative AI, EAI)**的新范式:它不直接给出唯一推荐,而是同时呈现多个竞争性假设,并附上支持与反对的证据,让决策者在充分权衡后自行判断。 然而,EAI要想真正落地,还需要一个坚实的理论基础。在近期发表于arXiv的一篇立场论文中,来自伦敦帝国理工学院等机构的研究者(Xiang Yin、Tim Miller、Nico Potyka、Antonio Rago与Francesca Toni)主张,**计算论证(computational argumentation)**是构建EAI形式化基础的理想范式。论文题为《Towards an Argumentative Foundation for Evaluative AI》,于2026年4月25日提交。 ## 为什么是论证? 论证框架天然适合EAI的需求。在论证系统中,一个观点由多个论据支持,同时存在反驳与攻击关系,这与EAI呈现“正反证据”的目标高度契合。通过形式化的论证语义,系统可以自动评估哪些假设在证据冲突中胜出,并为每个假设生成可解释的论证链。更重要的是,论证过程支持**争议性(contestability)**:如果人类决策者不认同某个结论,可以提出新的论据进行反驳,系统则能动态更新评估结果。这种交互性正是EAI区别于传统黑箱AI的关键。 ## 迈向分布式与人本化EAI 论文作者指出,当前AI系统往往集中于中心化的推荐引擎,而EAI的未来应走向**分布式**与**人本化**。分布式意味着多个AI智能体可以各自提出假设与证据,通过论证协议进行交互;人本化则强调系统必须能向人类解释其推理过程,并接受人类的质疑与干预。计算论证为此提供了现成的工具:抽象论证、结构化论证、假设性论证等理论均可用于建模多智能体间的辩论。 ## 长期研究议程 这篇立场论文并非提出具体算法,而是勾勒了一个长期研究蓝图。作者呼吁学界关注以下几个方向: - **形式化EAI语义**:如何将EAI的“假设-证据”结构映射到论证框架中? - **可解释性与透明度**:如何让论证链对人类用户清晰可见? - **交互式争议机制**:如何设计支持人类反驳的协议,确保系统能吸收反馈? - **分布式论证**:如何在多智能体环境中高效协调论证过程? 尽管目前EAI仍处于早期阶段,但这一方向的提出,反映了AI研究从“预测准确”向“决策透明”的转变。在医疗、司法、金融等高风险领域,EAI或许能成为人机协作的更好桥梁。 值得注意的是,本文仅代表作者观点,尚未经过同行评审。但作为一篇立场论文,它无疑为后续研究提供了有价值的起点。

Anthropic21天前原文

近日,一篇题为《结构理论中的确定性化:通过闭包、可比性与联合可接受性的统一框架》的论文在 arXiv 上发布,提出了一种从多元结构理论中构建规范解释的形式化框架。该研究由 Hai Hai Fu 完成,涉及人工智能与逻辑计算领域,为处理多源理论中的不确定性和不一致性提供了新的数学工具。 ## 核心概念 论文将**结构理论**定义为一个三元组 \( T = (\Sigma, A, I) \),其中 \( \Sigma \) 是签名(signature),\( A \) 是公理(axioms),\( I \) 是推理策略(inference policy)。每个结构理论都对应一个**可接受解释族**(admissible interpretation family),即所有全局一致的结构结论赋值集合。这一形式化使得不同理论之间的比较和整合成为可能。 ## 三个层次的规范化 作者区分了三个层次的规范化(canonicalization): - **闭包稳定化**(closure stabilization):针对每个种子(seed)的收敛,即从不同初始条件出发最终趋于一致。 - **全局完成**(global completion):与种子无关的收敛,即所有路径都导向同一个结果。 - **确定性化**(determinization):存在唯一的可接受解释,这是最强的规范化形式。 ## 不确定性的分类 非确定性被分为两类:**认知多元性**(Type E)和**结构多元性**(Type S)。其中,Type S 又细分为强子类(Type S-strong),其特点是缺乏共同上界(common upper bounds)。这一分类有助于针对不同性质的非确定性采取相应的处理策略。 ## 两种规范化机制 论文提出了两种主要的规范化机制: 1. **基于算子的完成**(operator-based completion):通过定义闭包算子来逐步消除不确定性。 2. **基于选择器的构造**(selector-based construction):通过选择规则从多个候选解释中确定唯一结果。 作者证明了在纯推理完成中,若规则满足**正性、非反驱性**(positive, non-retractive)且具有**健全性条件**,则完成可归结为饱和闭包算子(saturated closure operator)。 ## 主要结果 - 对于 **Type E 理论**,闭包稳定化总是成立的,但完全确定性化依赖于一个全局合流性质(global confluence property),该性质目前仍是一个开放问题。 - 对于 **Type S-strong 理论**,可以通过规范选择实现确定性化。 - 多层级规范化系统通过**分层算子**(staged operators)构成一个结构上非交换的系统,这意味着操作顺序会影响最终结果。 - 作者还提供了一个**条件分类定理**,将理论内在机制归结为闭包或选择两类。 ## 对 AI 推理的启示 值得注意的是,该框架可应用于 **LLM 辅助推理**。论文提出,**幻觉(hallucination)**可以被视为**无支持的规范化**(unsupported canonicalization),即模型在没有充分依据的情况下强行生成唯一解释。这一视角为理解大语言模型的不确定性提供了新的理论视角,也可能为改进推理可靠性提供指导。 总的来说,这项研究为结构理论中的规范化和确定性化提供了一个统一的数学框架,不仅深化了逻辑学的基础理论,也为 AI 系统中的多源信息融合与一致性维护提供了潜在的工具。未来,随着全局合流性质等开放问题的解决,该框架有望在更多实际场景中发挥作用。

Anthropic21天前原文

在人工智能的版图中,**创意能力**始终是一块难以精确测量的高地。与那些有明确对错、可以量化评分的任务不同,创意往往缺乏显式的目标和奖励信号,这让评估变得异常棘手。然而,创意在**设计、沟通、教育以及人机协作**中又扮演着至关重要的角色。近日,一篇发表于arXiv的论文提出了一个名为 **C4** 的新评估框架,旨在填补这一空白,专门用于测试多模态大语言模型(MLLMs)的**跨概念理解**能力。 ## 从“理解”到“解码”:创意的认知基础 论文作者指出,**跨概念理解**是支撑“接受性创意”(receptive creativity)的核心认知能力。它指的是,一个观察者能够从看似不相关、但存在意义关联的概念组合中,解读出创作者的意图。例如,当我们看到一幅将“时间”具象化为“流水”的画作时,能立刻领会其中的隐喻。 为了将这一抽象概念操作化,研究团队提出了一种新颖的视角:将**项目构建视为“跨概念编码”**,而将**模型推理视为“跨概念解码”**。这就好比,创作者在编码一个只有“懂行”的人才能解开的谜题,而模型的任务就是解开这个谜题。 ## C4框架:以成语为载体的创意测试 基于这一思路,团队构建了 **C4(Chengyu-based Cross-Concept Creativity)** 评估框架,其载体是**中文成语**。成语本身就是高度凝练的跨概念表达,一个四字短语往往浓缩了一个故事、一种哲理或一幅画面,非常适合用来测试模型对“言外之意”的把握。 C4框架的巧妙之处在于其**显式的结构**和**可量化的难度**。它通过一个人工标注并经过第三方审查的**跨概念网络**,将目标概念与可具象化的替代概念连接起来,形成“桥梁路径”。每个测试项的难度由路径中的**桥梁数量**和**深度**决定,这使得评估具备了清晰的难度梯度。 ## C4-Eval:数据与结果 基于该框架,研究团队发布了 **C4-Eval** 评估集,包含**184个合成项目**和**37个人类创作的成语谜题**。每个项目被实例化为**五种任务设置**,最终产生了**884个主要答案恢复案例**。 在对**十个主流MLLM**的测试中,结果显示: - 最强的**闭源模型**在主要任务上的准确率分别达到**50.7%** 和**48.0%**; - **开源模型**的表现则明显逊色,准确率低得多。 有趣的是,当提供**候选约束**时,模型的准确率大幅提升;但提供**桥梁提示**或要求**解释推理过程**,对性能的提升却相当有限。这表明,当前MLLMs在解码通过跨概念关系编码的创意意义时,存在明显的短板。 ## 小结:创意的“最后一公里” 这项研究不仅提供了一个全新的评估工具,更揭示了当前MLLMs在**高级认知能力**上的真实边界。理解成语背后的隐喻,看似简单,却需要模型具备**联想、抽象和背景知识**的综合能力。C4框架的推出,为未来模型在创意维度的改进提供了清晰的标尺。或许,让机器真正“读懂”人类的创意表达,仍是通往通用人工智能道路上需要跨越的一道重要关卡。

Anthropic22天前原文

**WebGrader** 是一种新型的自演进程序化评分器,旨在解决大语言模型(LLM)在网页开发训练中的奖励设计瓶颈。通过自动生成可执行的交互流程(Flow Contract),并在真实浏览器环境中收集多维度证据,WebGrader 能够提供更准确的强化学习信号,显著提升模型的功能成功率。实验表明,在 WebGen-Bench 基准上,8B 参数模型的功能成功率达到了 **52.01%**,超越了多个更大规模的模型。 ### 背景:网页生成中的奖励困境 当前,LLM 已能根据自然语言描述生成完整网站,但功能正确性仍是一大挑战。强化学习(RL)是缩小这一差距的核心方法,而奖励设计则是关键瓶颈。传统的奖励方式包括手工编写的浏览器脚本和基于视觉语言模型(VLM)或 GUI 代理的评分器。前者虽然可执行,但难以覆盖开放式需求;后者虽然可扩展,但可能在观察到关键状态前就作出判断,导致奖励不准确。 ### WebGrader 的解决方案 WebGrader 提出了一种全新的思路:**自动从每个网站请求中推导出所需的交互流程**,并将其表示为可执行的“Flow Contract”。在训练过程中,WebGrader 会在真实浏览器中运行生成的网站,将目标操作与源代码和实时 DOM 对齐,并沿着浏览器轨迹收集视觉、DOM、响应和持久状态等证据。通过分离测试规划、操作定位、证据收集和语义判断,WebGrader 只有在观察到请求的状态转换后才会给出通过(Pass)判定,从而保证了奖励的可靠性。 此外,WebGrader 还引入了一个**残差驱动的离线循环**,用于发现可复用的验证器技能,并在不相交的验证页面上进行筛选,最终在策略训练前冻结这些技能图。这种机制使得评分器能够不断自我演进,适应更多样的任务。 ### 实验结果 在 WebGen-Bench 基准上,WebGrader 训练的 8B 参数策略模型达到了 **52.01%** 的功能成功率,比匹配的外观加脚本奖励高出 **7.88 个百分点**,并超过了 o4-mini 和 DeepSeek-v4-flash 等模型。在 WG-core-250 数据集上,该策略的满分(Full Score)达到 **44.953**,超过了 Qwen3-Coder-480B。这些结果表明,WebGrader 不仅提升了奖励的准确性,还显著增强了模型的网页开发能力。 ### 意义与展望 WebGrader 为 LLM 在网页开发领域的训练提供了一种可扩展且可靠的奖励机制,有望推动更复杂的交互式网页生成应用。未来,这种自演进评分器或许也能应用于其他需要多步骤交互的任务,如自动化测试和机器人控制。不过,该研究仍处于 arXiv 预印本阶段,其实际应用效果还有待进一步验证。

Anthropic22天前原文

**EntropyMoE:熵感知稀疏专家路由,推动无分词器大语言模型新突破** 近年来,字节级大语言模型(LLM)通过将字节分组为动态大小的补丁(patch),逐渐展现出无需分词器的建模潜力。然而,现有字节补丁架构对所有补丁仍采用相同的稠密前馈计算,这导致模型容量无法根据补丁语义和粒度的变化进行自适应调整。针对这一局限,研究团队提出了 EntropyMoE,一种专为动态字节补丁设计的混合专家(MoE)架构。 EntropyMoE 的核心创新在于,将全局补丁 Transformer 中的稠密前馈模块替换为 Top-K 专家层,每个动态补丁作为专家路由的基本单元,其字节覆盖范围决定了工作量统计中的贡献。路由器直接根据补丁熵选择专家,利用与动态补丁构建相同的粒度信号来组织稀疏计算。补丁熵和长度共同定义了调节专家专业化的特征空间。 实验结果表明,EntropyMoE 在匹配的稠密和稀疏基线中取得了最低的保留字节困惑度(bits-per-byte),同时保持可比较的下游任务准确率。这些结果确立了补丁熵作为稀疏条件计算的有效路由坐标,并将 MoE 建模扩展到基于分词器的表示之外。 该研究由 Bo Liu、Muxuab Yu、Yu Zhang、Pengfei Gao 和 Yongping Zhang 共同完成,论文已提交至 arXiv(编号:2608.06398),并于 2026 年 7 月 31 日发布。 这一进展对于 AI 行业具有重要意义。一方面,无分词器模型有望消除传统分词器带来的词汇表限制和语言覆盖不均问题,提升多语言和低资源语言的处理能力;另一方面,MoE 架构的引入使得模型能够更高效地分配计算资源,为构建更大规模、更高效的 LLM 提供了新思路。不过,该研究仍处于预印本阶段,其在实际应用中的表现和扩展性尚需进一步验证。未来,我们期待看到 EntropyMoE 在更多场景中的测试,以及它如何与现有的模型压缩和加速技术相结合。

Anthropic22天前原文

奖励模型是从人类反馈中学习的关键,但理解其预测依据一直是个难题。近期,稀疏混合专家(MoE)奖励模型通过将提示路由到专门专家,并利用高路由权重的示例来刻画专家行为,试图提升可解释性。然而,路由权重仅能揭示专家"接收"了哪些提示,却无法说明它如何"评判"响应,因此只能提供部分行为解释。为此,研究者提出了**贡献对比(CoCo)**方法,一种响应级解释技术,通过选择具有最大贡献差异的"选中-拒绝"响应对来忠实刻画专家角色,同时捕捉路由和偏好行为。自动与人工评估显示,CoCo相比基于路由、基于分数和基于稀疏自编码器的替代方法,能产生更连贯、更忠实且更专门化的解释,同时保持有竞争力的奖励建模精度。据作者所知,这是首个针对MoE奖励模型解释方法的系统性研究。 该研究由Yifan Wang、Jinyi Mu、Mayank Jobanputra、Yu Wang、Soyoung Oh、Isabel Valera和Vera Demberg共同完成,论文以arXiv:2608.06400发布。 ## 背景:MoE奖励模型的解释挑战 奖励模型在强化学习与人类反馈(RLHF)中扮演核心角色,但它们的内部决策过程往往如同"黑箱"。稀疏MoE架构通过将输入路由到不同的专家网络,旨在提升效率与专业性,但同时也引入了新的解释维度:我们不仅要理解每个专家擅长什么,还要知道它们如何影响最终的奖励分数。传统方法依赖路由权重,即通过统计哪些提示被分配给哪个专家,来推断专家的功能。但这种方法存在明显局限——它只能告诉我们专家"看到了什么",却无法揭示专家"如何评价"。 ## CoCo方法:响应级解释的新思路 CoCo的核心创新在于,它不再仅仅关注路由分配,而是将注意力放在**响应对的贡献差异**上。具体来说,CoCo会寻找那些让某个专家产生最大贡献差异的"选中-拒绝"响应对,即该专家对选中响应的贡献远高于对拒绝响应的贡献。这样的响应对最能体现该专家的偏好特征,从而更准确地刻画其在奖励评估中的角色。 这种方法同时考虑了路由行为和偏好行为,弥补了路由权重解释的不足。实验表明,CoCo生成的解释在连贯性、忠实性和专门化程度上都优于现有的替代方案,包括基于路由权重、基于得分和基于稀疏自编码器的方法。同时,使用CoCo解释的模型在奖励建模精度上并未妥协,保持了与原始模型相当的性能。 ## 意义与展望 这项研究首次系统地探讨了MoE奖励模型的解释方法,为理解这类复杂模型提供了新的工具。CoCo不仅有助于研究人员验证模型是否按照预期工作,还能帮助识别潜在偏见或错误,从而改进模型设计。未来,该框架可能扩展到其他类型的MoE模型,甚至用于解释多模态或更大型的模型。 尽管CoCo展示了令人鼓舞的结果,但作者也指出,解释的忠实性仍依赖于响应对的选取质量,且不同任务可能需要调整对比策略。这一领域仍处于早期阶段,更多探索值得期待。

Anthropic22天前原文

社区检测是图分析中的基础任务,旨在识别具有相似行为或兴趣的实体群组。传统方法在复杂图结构上表现不佳,深度学习方法虽提升了性能,却牺牲了可解释性,且依赖标注数据和训练过程。大语言模型(LLM)凭借强大的推理能力和世界知识,为可解释、无标签的社区检测带来了新可能。 近期,一项发表于 arXiv 的研究提出了 **LUCID**,一种由 LLM 引导的可解释、无需训练、无监督的社区检测方法。该方法受自然系统中相变动力学的启发,将社区检测设计为四个阶段的流程,让 LLM 将隐式知识转化为显式、可解释的逻辑规则。 ## 四阶段流程 LUCID 的流程包括: - **局部视图社区初始化**:利用 k-ego 上下文和无监督节点角色编码局部图结构。 - **多因素社区合并**:使用 LLM 诱导的规则迭代合并局部社区。 - **多粒度社区细化**:并行应用 LLM 诱导的从粗到细的规则,减少边界噪声。 - **全局视图社区选择**:基于拓扑紧凑性和边界清晰度识别高质量社区。 这一设计完全摆脱了对标注数据的依赖,同时保持了过程的可解释性。 ## 性能与意义 在真实数据集上的大量实验表明,LUCID 作为无监督方法,取得了当前最优的性能,并持续优于领先的无监督和半监督基线。这验证了 LLM 在无监督图分析任务中的巨大潜力。 LUCID 的意义不仅在于性能提升,更在于其可解释性。传统深度学习方法常被视为“黑箱”,而 LUCID 通过 LLM 生成的规则,让用户能理解社区形成的原因。这对于需要审计和信任的应用(如社交网络分析、生物网络研究)尤为重要。 ## 局限与展望 尽管 LUCID 表现出色,但论文未提及计算成本与可扩展性等细节。未来工作可能包括优化 LLM 推理效率、扩展到更大规模图,以及探索在动态图上的应用。 总体而言,LUCID 为社区检测提供了一种新颖的范式,展示了 LLM 在无监督、可解释图分析中的潜力。随着 LLM 能力的提升,这类方法有望在更多领域落地。

Anthropic22天前原文

**ADIAS 框架提出“问题中心”优化范式,显著提升智能体自动化设计效率** 近日,一篇题为《ADIAS: Automated Design of Interactive Agentic Systems》的论文在 arXiv 上发布,提出了一种全新的自动化智能体设计框架。该研究由 Lekang Jiang、Bohan Tang、Stephan Goetz 和 Yiwen Guo 共同完成,旨在解决现有自动化智能体设计方法中的核心痛点。 ### 现有方法的局限 传统的自动化智能体设计(如基于候选智能体的迭代优化)通常以“候选中心”的方式组织跨轮次经验。每一轮迭代中,系统会生成多个候选智能体方案,对其进行评估,并将反馈汇总用于下一轮改进。然而,这种模式存在三个明显问题: - **修复目标不精准**:跨轮次的改进经验围绕候选方案展开,导致系统难以精准定位真正需要修复的环节。 - **部分进展整合缓慢**:有价值的局部改进难以在后续轮次中快速累积和复用。 - **无效干预传播**:某些无效的调整可能被错误地延续到后续迭代中,降低整体优化效率。 ### ADIAS 的创新:问题中心优化 针对上述问题,研究团队提出了一种全新的范式——“**问题中心智能体优化**”(Issue-Centric Agent Optimization)。与候选中心方法不同,该范式将修复进展显式地建模为持久的“问题状态”(Persistent Issue State),并以此指导后续优化,而非每轮从零开始重新推导。 ADIAS 框架包含两个核心机制: 1. **持久问题状态**:维护稳定的问题标识、生命周期状态、支持证据以及干预-结果历史。这使得系统能够持续追踪每个问题从发现到解决的完整过程。 2. **问题引导优化**:基于持久问题状态,联合提出下一轮的修复目标和修订方向,实现全代码级别的智能体设计修改。 ### 实验结果与性能提升 研究团队在五个交互式基准测试上对 ADIAS 进行了评估,结果显示: - 与最强基线相比,ADIAS 平均性能提升 **25.2%**。 - 在四种不同的骨干模型上均取得了一致的性能增益。 - 消融实验表明,移除持久问题状态或用候选中心策略替代问题中心修订,会导致性能下降高达 **40.7%**。 这些数据充分证明了问题中心优化范式的有效性。 ### 行业意义与展望 ADIAS 的提出为自动化智能体设计领域提供了新的思路。在人工智能日益复杂的今天,智能体系统的自动化设计能够大幅降低人工干预成本,提升开发效率。ADIAS 通过显式建模问题状态,使得优化过程更加透明、可控,有望在复杂任务求解、多智能体协作等场景中发挥重要作用。 未来,研究团队计划进一步探索 ADIAS 在更多实际应用中的潜力,并优化其计算效率。该论文的详细内容可在 arXiv 上获取(arXiv:2608.06410)。

Anthropic22天前原文

多模态大语言模型(MLLMs)在各类视觉-语言任务中表现出色,但其推理效率受制于大量视觉标记的处理开销。视觉标记剪枝能有效降低计算成本,但前提是准确评估每个标记的重要性。近期研究显示,语言模型中层的文本到视觉注意力可作为剪枝的有效指导,通常的做法是选取一个固定的中间层,利用其注意力分数筛选需要保留的视觉标记。然而,这种方法存在两个关键问题:**其一,不同样本所对应的最优注意力层差异显著**,固定层难以适应所有情况;**其二,获取中间层注意力需要先处理大量视觉标记,计算开销已经产生**,削弱了剪枝带来的收益。 针对上述挑战,来自北京航空航天大学等机构的研究团队提出了一种名为 **Middle-layer Attention Prediction(MAP)** 的方法。MAP 的核心创新在于**引入“问题对比教师选择”机制**:通过对比原始问题和参考问题下的注意力差异,为每个样本动态挑选最合适的教师层,再将该层的注意力知识蒸馏到一个轻量级预测器中。该预测器能够直接从多模态输入特征中估算视觉标记的重要性,无需实际计算注意力图。在推理阶段,MAP 结合预测的重要性分数与多样性准则,在进入语言模型第一层之前就完成视觉标记的剪枝,从而与现有的推理加速技术无缝兼容。 在 LLaVA-NeXT-7B 模型上的十项基准测试中,MAP 仅保留 **5.56%** 的视觉标记,便维持了未剪枝模型 **97.5%** 的性能,同时实现了 **3.09 倍** 的端到端加速。这一结果表明,MAP 在保持模型性能的同时显著提升了推理效率,为多模态大模型在实际场景中的部署提供了新的可能性。 ## 深度解析:为什么固定层不可靠? 传统方法依赖固定的中间层注意力,但研究团队通过分析发现,**不同样本对注意力层的敏感性差异极大**。例如,在回答“图中有什么颜色?”这类简单问题时,浅层注意力可能已足够;而面对“图中的物体在做什么?”这类复杂推理时,深层注意力才更有效。因此,固定层往往只能覆盖部分样本,导致剪枝效果不稳定。 ## MAP 的解决之道:动态教师 + 轻量预测 MAP 通过对比原始问题与参考问题(如“描述这张图片”)的注意力差异,识别出对当前问题最敏感的层,将其作为教师。随后,通过知识蒸馏,将教师层的注意力模式压缩进一个轻量预测器,该预测器直接由多模态输入特征生成重要性分数。这样一来,推理时无需计算任何注意力图,极大减少了计算负担。 ## 实际应用与前景 MAP 的设计使其易于集成到现有 MLLMs 中,且不干扰其他加速技术(如 KV 缓存压缩)。未来,该方法有望成为多模态模型高效推理的标准组件,尤其适用于图像密集、需要实时响应的应用场景,如自动驾驶、智能助手等。不过,研究者也指出,当前方法在极端剪枝率下的性能保持仍有待提升,未来将探索更精细的多样性控制策略。 总之,MAP 通过动态选择教师层和轻量预测,有效解决了视觉标记剪枝中的关键痛点,为多模态大模型的效率优化提供了新思路。

Anthropic22天前原文

**多标签节点分类**是图学习中的一个重要且具有挑战性的任务,因为节点往往同时具有多种语义。现有方法虽然能有效建模多标签,但大多局限于同域场景,即模型在同一图域内训练和测试,导致跨域泛化能力有限。近年来,**图基础模型(GFMs)** 作为跨域学习的新范式崭露头角,但现有GFMs基于单标签假设,将所有节点视为仅含单一语义并嵌入为单个向量。对于多标签节点,这种表示本质上是用一个点近似多种语义,不可避免地导致语义纠缠,难以同时区分多个标签。 针对这一局限,研究者提出了**多语义基图基础模型(MSB-GFM)**,这是一个面向跨域多标签节点分类的框架。其核心创新在于引入**多语义基表示学习范式**,将每个多标签节点建模为多个语义基的自适应组合,从而灵活地表达多种语义。此外,模型还设计了**语义-结构双通道架构**,并结合**域对抗训练**,以实现有效的跨域知识迁移。大量实验验证了该模型的有效性。 这一研究的意义在于,它首次将图基础模型的能力扩展到多标签场景,为处理现实世界中复杂的多语义图数据(如社交网络中的多兴趣用户、知识图谱中的多类型实体)提供了新思路。尽管目前仍处于早期阶段,但MSB-GFM为未来的多标签图基础模型研究奠定了基础。 **背景与挑战** 传统的多标签节点分类方法(如基于图神经网络的方法)通常需要针对特定图域进行训练,当应用到新图域时性能大幅下降。而图基础模型旨在学习可迁移的图表示,但现有模型大多假设节点只有一个标签,无法处理多标签节点的语义复杂性。例如,在一篇论文引用网络中,一篇论文可能同时属于“人工智能”和“网络科学”两个领域,单向量表示难以清晰区分这两种语义。 **MSB-GFM的核心思想** MSB-GFM借鉴了多语义基的思想,类似于将每个节点表示为一组基向量的加权和,每个基向量对应一种语义。这种表示方式比单向量更具表达力,能够捕捉节点的多面性。同时,通过域对抗训练,模型能够消除不同图域之间的分布差异,从而提升跨域泛化能力。 **实验与展望** 论文在多个数据集上进行了实验,结果显示MSB-GFM在跨域多标签分类任务上优于现有方法。尽管该模型仍处于研究阶段,但其为多标签场景下的图基础模型提供了新的方向。未来,这一框架有望应用于推荐系统、生物信息学等领域,处理更加复杂的多标签图数据。

Anthropic22天前原文