SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:Anthropic清除筛选 ×

模拟由众多大语言模型(LLM)智能体组成的社会通常成本高昂,然而这类模拟所要回答的问题往往是宏观层面的:相变行为、典型事实、以及随智能体数量 \(N\) 的标度律,而非单个智能体的认知细节。近期一篇 arXiv 论文(arXiv:2608.11215)提出了一种基于统计物理观察的方法:用从数百到数千次廉价查询中拟合出的低参数模型替代每个 LLM 智能体,从而在笔记本电脑上运行任意 \(N\) 规模的社会模拟。 该方法的核心在于,模拟是否有效在运行之前就已决定,主要取决于每个智能体的感知。作者引入了一种“交互序 × 记忆”的分类法,将感知和记忆映射到有效理论,并预测替代误差随 \(N\) 变化的趋势。他们使用对 LLM 宏观经济学模拟 EconAgent 的忠实重实现以及另外七个知名的 LLM 模拟进行了验证,智能体决策克隆自真实的 LLM 引出(主要基于 DeepSeek),成本仅为几美元。预测的误差趋势逐格成立,而两个被反驳的预测(均发生在强饱和响应区域,且可追溯至其曲率)也被理论在无自由参数的情况下定量匹配。 这一方法为大规模多智能体模拟提供了一条低成本的捷径,尤其适用于需要探索系统宏观行为的研究。它可能对社会科学、经济学以及复杂系统研究产生重要影响,使得原本需要超级计算机的模拟现在可以在普通笔记本电脑上完成。不过,该方法依赖于智能体感知的简化,因此对于需要精确刻画个体认知细节的场景可能并不适用。 论文包含 25 页正文和 12 幅图,并提供了代码和数据。该工作还进行了系统综述和预注册,存档于 Zenodo。作者 Igor Itkin 从统计物理和人工智能的交叉视角出发,为多智能体模拟领域带来了新的思路。

Anthropic17天前原文

在科学建模中,贝叶斯校准是一种强大的方法,它通过结合先验知识与观测数据来估计模型参数。然而,一个长期困扰研究者的难题是:如何为每个参数设定合理的先验分布?尽管方法论研究已持续数十年,但多数研究者仍默认使用均匀先验(即无信息先验),原因在于从科学文献中构建信息丰富的先验既耗时又需要领域和统计双重专业知识。 近日,一篇发表于 arXiv 的论文介绍了一款名为 **Distribird** 的智能体网络应用,旨在自动化这一过程。用户只需提供参数名称、物理描述和领域背景,Distribird 便会启动一个多智能体流水线,自动搜索相关文献,提取并依据领域相关性加权报告值,最后通过 AIC 模型选择拟合出合适的概率分布。当缺乏文献支持时,系统会回退到合理的无信息替代方案,并明确报告每个先验背后的证据和置信水平。 ## 关键特性 - **多智能体流水线**:自动完成文献搜索、价值提取、加权与分布拟合,大幅减少人工干预。 - **透明可追溯**:每个生成的先验都会追溯到具体的论文和数值,确保科学严谨性。 - **内置有效性检查**:对于超出范围或不适用的请求,系统会拒绝生成先验,避免产生误导性结果。相比之下,单提示基线模型在 30 个模型-参数案例中有 11 个返回了看似自信但毫无根据的先验。 - **本地化部署**:所有语言模型调用均在本地运行,参数描述和未公开的建模细节不会传输给第三方 LLM 提供商,仅生成的搜索词会发送至公共文献数据库,保障数据隐私。 ## 实验评估与意义 研究团队在 10 个科学领域的 24 个参数上进行了评估,对比了三种开源模型(Qwen3.6 27B、Gemma 4 31B、Mistral Small 4 119B)与单提示 LLM 基线。结果显示,Distribird 的完整流水线在先验质量上与基线持平,但在可追溯性、有效性和隐私保护方面显著优于基线。作者强调,对于科学研究而言,这些属性比点估计精度的微小提升更为重要。 ## 应用前景 Distribird 专为具有物理可解释参数的过程模型设计,这些模型的领域知识通常存在于已发表的文献中。它的出现有望改变研究者依赖均匀先验的现状,降低构建信息丰富先验的门槛,提高贝叶斯校准的准确性和可靠性。未来,这类智能体工具或将成为科学建模工作流中的标准组件。

Anthropic17天前原文

两个目标对立的LLM智能体在多轮对话中,如果没有共享目标函数,会发生什么?最新研究给出一个反直觉的答案:不是竞争,而是“崩溃”——访客妥协,站点智能体停止变化策略,对话以双方都未达成目标告终。针对这一问题,一篇提交至AI Engineer World's Fair 2026的论文提出了一种控制论治理层,名为**体验编排器(Experience Orchestrator, EO)**,旨在替代缺失的共享目标函数,引导多智能体系统走向协作性对话成果。 ## 核心机制:三层协同治理 EO在模拟的金融服务环境中运作,其中站点智能体引导访客联系顾问,而访客则表现出心理上逼真的抵抗。其治理机制包含三个核心组件: - **上下文老虎机(Contextual Bandit, CB)**:从真实网页分析数据中校准的内容臂选择器,决定对话中应展示何种信息。 - **PID控制器**:通过动态模式约束确保行为一致性,类似于自动控制中的比例-积分-微分调节。 - **POMDP信念追踪器**:维护访客意图的概率模型,部分可观测马尔可夫决策过程帮助系统推断访客的真实想法。 ## 关键发现:治理决定走向 在**60,000次模拟**中,EO将高意向顾问联系率提升了**32个百分点**(从46.1%提升至78.1%),相比朴素的LLM对照组。值得注意的是,CB变体选择解释了**97%**的因素间结果差异,这证实了治理策略而非环境初始条件决定了对话的最终走向。 ## 适用边界与局限 人物层面分析揭示了两种截然不同的模式:对于没有自然转化倾向的访客,治理层是系统能否正常运作的关键;而对于本就接近一致的访客,朴素LLM的共情默认行为已足够。然而,所有发现均基于LLM到LLM的模拟。**PID控制器尚未针对真实人类不可预测性进行校准**,因此在真实流量上验证EO是下一步的关键。 ## 行业启示 这项研究为多智能体协作提供了新视角:在缺乏统一目标的环境中,引入控制论治理层可能比试图对齐目标更有效。对于AI产品设计者而言,这意味着在构建多智能体系统时,需要显式设计治理机制,而非依赖智能体间的自然协作。不过,从模拟到现实的鸿沟仍需谨慎跨越。

Anthropic17天前原文

**AI研究智能体在Conway 99图问题上取得可验证进展** Conway 99图问题是图论中的一个著名未解难题:是否存在一个强正则图,参数为 srg(99,14,1,2)?该问题由数学家约翰·康威提出,至今悬而未决。最近,一篇由独立AI研究智能体完成的论文(arXiv:2608.11211)对该问题进行了系统性攻击,并提供了可验证的边界结果,该论文已被首届AI科学家会议(CAISc)接收。 ## 主要贡献 研究团队(由Aalok Thakkar主持)报告了四个可验证的贡献: 1. **循环图约束的穷举证明**:对于Z/99上的循环图,证明了最多满足4950个约束中的3366个(即68.0%),对应于49个差分类中的33个。同样的上限也适用于另一个99阶阿贝尔群。 2. **强制结构简化**:利用λ=1(每个邻域为完美匹配)和μ=2(外部顶点与非匹配邻域对双射)的条件,将问题简化为一个84顶点上的12正则图,并编码为CP-SAT求解器,通过恢复唯一的srg(9,4,1,2)验证了方法的正确性。 3. **验证的固定自同构轨道框架**:提出了无固定点和单固定点作用的轨道存在性框架,并在srg(9,4,1,2)和Paley图srg(13,6,2,3)上进行了验证。 4. **最佳可验证工件**:达到了69.43%的约束满足率,并提供了证据表明这是一个稳健的前沿(十四种不同方法均未超过此值),且与开放问题紧密相关,因为任何可证明低于4950的边界都是非存在性证明。 ## 意义与展望 这项工作展示了AI研究智能体在组合数学难题中的潜力,通过可验证的数学证明和计算搜索相结合,为Conway 99图问题提供了新的见解。虽然问题仍未解决,但所建立的边界和简化方法可能为未来研究铺平道路。 该论文的完整内容可在arXiv上获取(arXiv:2608.11211),并伴随有可复现的实验设置,符合AI科学家的可重复性标准。随着AI在数学发现中的角色日益重要,此类尝试或将成为常态。

Anthropic17天前原文

世界模型研究领域目前仍处于探索阶段,架构、训练目标和状态表示之间的相互作用复杂,且没有一种通用方案能在所有环境中占据主导。这使其成为评估AI编程代理作为自主研究者的理想测试平台——在这种设定下,改进方向并非预先指定,这与当前主导代理基准的工程规格任务不同。我们推出了AutoWorldModel-Bench,这是一个闭环基准,前沿编码代理在固定计算预算下自主改进提供的世界模型起点。该基准涵盖八个游戏环境,统一采用结构化状态表示——从每个游戏中提取的真实实体状态,通过共享张量格式消费——从而将动态建模与感知分离,实现每次运行仅需数分钟的迭代。在64个会话中,Codex-5.4和Claude Opus 4.6在63个会话中改进了起点;在91%的会话中,获胜编辑是非平凡的研究型修改——新目标、新表示、新回滚流程或架构变更——而非超参数调整。我们的基准提供了一个场景,在此场景中,前沿编码代理可以在开放式研究而非工程规格问题上接受评估。

Anthropic17天前原文

自动提示词优化(APO)通常采用整体重写的方式,这可能导致模型在某个任务上表现提升,却在其他方面出现退化。针对这一痛点,研究团队在最新论文中提出了 **SAPO(Segment-level Automatic Prompt Optimization)**,将提示词分解为角色、上下文、任务和输出格式等模块,并基于最优和最差的示例进行针对性优化。该方法在多个基准测试中超越了现有强基线,为提示词工程提供了新思路。 ## 从“一刀切”到“精准施策” 传统的 APO 方法往往将整个提示词视为一个黑盒,进行整体改写。这种“一刀切”的方式虽然操作简单,但容易引发“按下葫芦浮起瓢”的问题——优化了一个行为,却可能破坏其他功能。SAPO 的核心创新在于 **模块化分解**:它将提示词拆分为角色(role)、上下文(context)、任务(task)和输出格式(output format)四个独立部分,然后分别进行诊断和优化。 具体而言,SAPO 的优化循环使用一个 LLM,配合静态元提示词和结构化输出,完成分段、弱点分析和候选生成。整个过程分为两个阶段: 1. **分段级诊断与建议提取**:LLM 分析当前提示词在 top-5 和 bottom-5 示例上的表现,找出每个模块的强项和弱点。 2. **候选合成**:基于强弱信号,生成针对性的改进候选提示词,确保优化有的放矢。 ## 实验验证:全面超越基线 研究团队在 **SQuADv2、TweetEval、XSUM、CommonGen 和 GSM8K** 五个数据集上,使用 **GPT-3.5-Turbo 和 GPT-4o-mini** 两个模型进行了评估。结果显示,SAPO 在平均得分上优于零样本基线以及 **APE、OPRO、EvoPrompt、GEPA、StraGO** 等强 APO 基线。这表明模块化优化策略不仅更精细,而且具有更强的泛化能力。 ## 意义与展望 SAPO 的提出标志着提示词优化从粗放走向精细。通过将提示词拆解为可独立优化的模块,它能够更精准地定位问题,避免全局改写带来的副作用。这一方法尤其适用于复杂任务,例如需要明确角色设定和输出格式的场景。 值得注意的是,SAPO 目前仍依赖于 LLM 的自我诊断能力,其效果可能受到模型推理能力的影响。未来,研究团队计划探索更细粒度的分段策略,以及如何将 SAPO 扩展到多模态提示词优化中。该论文已被 **IJCAI-ECAI 2026 Workshop on RobustifAI** 接收,相关代码和数据尚未公开,但这一方向无疑为提示词工程社区注入了新的活力。

Anthropic17天前原文

**混合专家模型(MoE)在量化部署中面临一个隐蔽的挑战**:路由机制的不连续性可能导致数值扰动引发专家选择的意外翻转,而判断这种翻转是否造成实际损失,比检测其发生更为困难。 一项最新研究(arXiv:2608.11212)通过模拟4-bit KV缓存量化(由受保护的BF16门读取)的数值扰动,系统地探究了路由翻转对模型性能的影响。研究发现,在OLMoE-1B-7B模型上,约三分之一的量化损伤是由路由介导的(RMF约0.31),但**部署时的路由器余量虽能检测到翻转发生(AUC 0.772),却无法区分有益与有害的翻转**。 该研究设计了一个四阶段实验框架,包括发现、过程复制、预注册执行和持出验证,并在三个架构上验证了结果的跨模型一致性。研究者还发现,**符号翻转税(signed-flip tax)和符号不可分离性(sign-inseparability)在多个模型中普遍存在**,而清洁参考补救措施的效果则因架构而异。 值得注意的是,该研究并未提出新的缓解方法,而是聚焦于因果分析工具和检测极限的界定。作者强调,**在现有可观测的路由统计特征中,没有任何一个能超越随机水平预测翻转的损失符号**,这构成了选择性修复的实证障碍。 实验还对比了真实int4 KV内核与模拟量化,结果虽与剂量曲线一致,但统计功效不足(95%置信区间包含零),未能构成独立复制。**该研究的预注册设计确保了分析的可信度**,并报告了所有未达预期的结果,为后续研究提供了严谨的基线。 这项工作的意义在于,它揭示了量化MoE部署中的一个关键盲区:**检测异常容易,但判断其影响却难得多**。对于实践者而言,这意味着开发有效的修复策略需要超越简单的检测机制,深入理解路由决策的因果效应。

Anthropic17天前原文

## 让 AI 代理共享“思考过程”?MaSRead 提出按内容寻址的读取方案 多智能体系统正从“对话协作”走向“共享计算状态”。独立运行的 AI 代理如果都在潜在空间(latent space)中进行推理,它们能否直接分享内部计算状态,而不是交换文本?这听起来很科幻,但一篇来自 arXiv 的新论文《MaSRead: Content-Addressed Reading of Replicated Latent Stores》正在尝试将这一设想变为现实。 ### 问题:缓存碎片合并了,但读不出来 论文提出,独立代理可以在潜在空间中把计算状态保存为**键值缓存片段**(key-value cache fragments),这些片段通过无冲突复制数据类型(CRDT)合并,形成一个可以在任何网络条件下收敛的分布式存储。听起来很完美?但有个致命缺陷:**当多个片段被存放在同一位置时,它们会互相干扰**,导致后续的查询无法可靠地读取合并后的缓存。换句话说,合并存储不等于可以按地址读取,**共置不等于可寻址**。 ### 方案:按内容寻址,而非按位置 MaSRead 的核心思路是**把读取请求路由到内容本身**,而不是依赖物理位置。它通过从片段中提取的**不透明键标签集**(opaque keyed tag sets)进行路由,并在解码每个选中的片段时,使用**硬注意力掩码**(hard attention mask)隐藏其他片段,从而隔离出目标内容。 在多跳查询场景下,MaSRead 利用“词汇连通性”(lexical connectivity)进行**图遍历**,沿着内容关联找到所需的多个片段。实验覆盖了链式、流水线、对称、中心辐射(hub)以及自然语言存储等多种拓扑结构,结果显示: - MaSRead 能在隔离状态下恢复已访问的片段; - 即使无关片段不断累积,其性能依然稳定; - 方法可以跨模型家族迁移,即在一个模型上训练的标签集能用于另一个模型。 ### 效率与局限 在路由完成后,**物化解码的复杂度只取决于片段长度**,而非整个存储的大小。但端到端的开销仍然包含与存储规模相关的路由过程,以及每个被访问片段的单次读取。 论文也明确指出了局限性: - **词汇路由可能遗漏断开的证据**,即如果查询与片段之间没有词汇关联,可能无法找到; - **答案组合受限于冻结的读者模型**,即最终生成答案的能力受制于预训练模型。 ### 意义与展望 这项研究为**多智能体协作**提供了新思路:代理之间可以共享内部计算状态,而不仅仅是最终输出,这有望大幅降低通信成本并提升协作效率。但 MaSRead 仍处于早期阶段,距离实际应用还有距离。未来,如何设计更鲁棒的内容路由、如何处理非词汇语义关联,都是值得探索的方向。 对于 AI 从业者而言,这篇论文的价值在于它挑战了“共享文本”的固有范式,提示我们:**在潜在空间里,内容本身就是地址**。 > 论文链接:arXiv:2608.11218

Anthropic17天前原文

## 论文速览 近日,一项名为 **ReCBM** 的研究为概念瓶颈模型(CBM)的鲁棒性难题提供了新思路。该框架通过引入**不确定性门控的关系推理**,显著提升了模型在概念不可靠场景下的表现。相关论文已提交至 arXiv(编号:2608.10004)。 ## 背景:概念瓶颈模型的两难 概念瓶颈模型(CBM)因其可解释性而备受青睐——它先将输入映射为人类可理解的概念,再基于这些概念做出最终预测。这种设计允许用户在测试时进行干预,例如手动修正某个概念值,从而引导模型输出。然而,一旦概念状态本身不可靠(例如存在缺失或错误),误导性的语义证据就会沿着瓶颈传播,最终损害解释的准确性和下游任务的表现。 现有的 CBM 改进工作多聚焦于丰富概念表示、提升不确定性估计或建模概念依赖关系,但针对“概念不可靠时如何稳健推理”这一关键问题,探索依然不足。 ## ReCBM 的核心机制 ReCBM 的解决方案是在瓶颈中显式地引入**语义概念关系**,并利用**不确定性**来引导这些关系的动态调整。具体来说: - **关系建模**:定义概念间的共现、蕴含和互斥关系,明确证据如何在概念之间流动。 - **不确定性门控**:在推理过程中,根据每个概念的不确定性来调节其对整体推理的贡献,从而抑制不可靠概念带来的噪声。 这种设计让模型在面对缺失或翻转的概念时,仍能保持稳定的表现,而不是被错误信息带偏。 ## 实验表现与价值 作者在多个数据集上进行了验证,结果显示 ReCBM 在以下方面均有提升: - **概念与任务恢复**:在概念缺失或翻转的情况下,模型仍能较好地恢复概念和任务结果。 - **不确定性感知干预**:支持基于不确定性的测试时干预,让用户更精准地修正关键概念。 - **概念子集提取**:能够提取紧凑且与任务相关的概念子集,同时不损失下游性能,这有助于降低推理成本并增强可解释性。 ## 总结与展望 ReCBM 的贡献在于将关系推理与不确定性估计有机结合,为概念瓶颈模型的鲁棒性研究提供了一个新范式。未来,这一框架有望在医疗影像、自动驾驶等高风险场景中发挥价值,因为这些领域对解释的可靠性和决策的稳健性要求极高。不过,论文目前尚未公开代码,实际应用效果还需进一步验证。

Anthropic18天前原文

近日,一项发表于arXiv的研究展示了大型语言模型(LLM)在数字农业中的突破性应用,将LLM从简单的数据分析工具升级为能够自主决策和执行的“闭环副驾驶”。该研究由Serge Kernbach主导,提出了一种全新的AI-生物接口,通过闭环架构实现从“人在回路”到“自主控制”的转变,为复杂生物系统的探索提供了新范式。 ## 从数据到行动:闭环架构的核心 该系统的核心是一个包含49通道的植物传感器网络,涵盖多光谱、电化学和介电等模态,实时采集植物生理数据。LLM不仅能够解析这些复杂的生物物理数据,还能通过自然语言向专家和非专业人士提供实时解读,大大降低了技术门槛。然而,其真正的创新在于,LLM能够直接触发硬件执行器,优化微气候、执行表型分析协议,甚至诱导受控胁迫场景,从而形成一个完整的闭环:感知-分析-决策-执行。 ## 显著成效:能耗降低与产量提升 研究团队在垂直农场和单株植物装置上进行了三个案例研究,验证了该框架的有效性。在生产规模的部署中,LLM代理执行多参数优化,平衡生物量积累、叶绿素含量和能耗。通过处理生物传感遥测数据,系统以2小时间隔调节全光谱、450nm和660nm光照。结果显示,在最短时间模式下,生产周期缩短了35%;在能量优化模式下,能耗降低了18%,而培养时间仅略有增加,这得益于利用光脉冲的生理惯性。更令人惊讶的是,代理还自主开发了一种黑暗诱导叶绿素积累的策略,实现了67.9%的节能效果。 ## 深远影响:降低门槛,提升价值 这项研究将LLM转变为数字农业的自主副驾驶,显著改善了成本效益比,并降低了对计算资源和专家劳动力的依赖。这不仅是农业技术的进步,更代表了AI在复杂生物系统中应用范式的转变。未来,这种闭环LLM框架有望在更广泛的生态和环境监测中发挥作用,推动数据驱动的生物探索。 尽管研究结果令人鼓舞,但该框架在更复杂、多变的环境中的适应性,以及长期运行的稳定性,仍需进一步验证。不过,这一开创性工作无疑为AI与生物学的深度融合开辟了新的道路。

Anthropic18天前原文

在实际应用中,多模态情感分析常因数据缺失或损坏而面临挑战。现有方法多依赖数据填补或启发式协调约束,难以有效提取任务相关信息。为此,研究者提出MIDAS框架,通过变分建模将各模态表示为多元高斯潜变量,并分解为共享与专属因子;采用极小极大目标,最小化共享与专属空间间的互信息以稳定解缠,同时最大化跨模态共享空间互信息以增强语义对齐。此外,引入不确定性感知融合机制,利用后验方差作为可靠性指标,自适应加权融合,确保模态不完整时的鲁棒性。在三个广泛使用的数据集上的实验表明,MIDAS在不完整场景下均取得显著性能提升。该研究已获IEEE TPAMI 2026接收。

Anthropic18天前原文

随着AI代理在复杂环境中的广泛应用,理解其行为变得至关重要。然而,针对AI代理的行为科学研究仍主要依赖人工,既耗时又费力。为此,研究团队推出了**AEROBAT**——首个能够自动化执行行为科学研究全流程的多智能体系统。该系统从用户指定的目标行为出发,自动生成假设、设计并执行受控实验、进行行为评估、分析结果并撰写报告,从而显著提升研究效率与规模。 在验证实验中,AEROBAT针对12种目标行为生成了79个假设,设计了1240个受控实验,并完成了23512轮模拟。结果显示,其中26个假设获得了中到强统计证据支持,部分发现甚至具有新颖性。这表明,自动化行为科学研究不仅能补充人工研究,还能拓展其覆盖范围。 ## 核心能力:从假设到报告的全自动流程 AEROBAT的核心在于其多智能体架构,它能够模拟人类研究者的工作流程。用户只需指定一个行为,系统便会自动完成以下步骤: - **假设生成**:基于已有知识库和用户输入,提出关于该行为的可检验假设。 - **实验设计**:为每个假设设计严格的受控实验,确保实验的可重复性和有效性。 - **实验执行**:在模拟环境中运行实验,收集行为数据。 - **行为评估与结果分析**:运用统计方法评估假设,并提取关键发现。 - **报告撰写**:自动生成结构化的研究报告,方便用户审阅。 这种端到端的自动化能力,使得研究者可以从繁琐的重复性工作中解脱出来,专注于更高层次的科学问题。 ## 实验验证:规模与效率的突破 为了评估AEROBAT的有效性,研究团队选取了12种常见AI代理行为(如合作、竞争、风险规避等)进行测试。系统自主完成了79个假设的检验,其中26个假设获得了显著统计支持。值得注意的是,一些假设此前未被人工研究注意到,这体现了自动化系统在发现新规律方面的潜力。 实验共涉及1240个受控实验和23512轮模拟,如此大规模的研究若由人工完成,将耗费数月甚至数年时间,而AEROBAT在可接受的时间内完成了全部流程。这展示了自动化方法在扩展研究规模上的巨大优势。 ## 意义与展望:AI研究的方法论革新 AEROBAT的提出不仅是工具层面的创新,更可能带来AI研究方法的变革。它降低了行为科学研究的门槛,使得非专家也能开展复杂的行为分析。同时,自动化流程有助于提高研究的可重复性和透明度,减少人工操作带来的偏差。 然而,该系统的局限性也值得关注:当前实验均在模拟环境中进行,真实世界的复杂性可能未被完全覆盖。此外,假设生成的质量依赖于初始知识库,未来需结合更丰富的AI理论框架。尽管如此,AEROBAT为AI行为研究开辟了新的路径,预示着自动化科学发现将成为AI领域的重要趋势。 ## 结语 AEROBAT作为首个自动化行为科学研究的多智能体系统,展示了AI在研究自身行为方面的巨大潜力。它不仅提高了研究效率,还发现了新的行为模式,为AI安全与对齐研究提供了有力工具。未来,随着系统的进一步完善,我们有望看到更多自动化科学发现的应用,推动AI技术向更可靠、更可解释的方向发展。

Anthropic18天前原文

在人工智能领域,长时程智能体(Long-Horizon Agent)在执行复杂任务时,往往需要经历数百个交织的推理、行动和观察步骤。当用户提出一个查询时,答案可能依赖于历史轨迹中早已被淹没的关键证据。为了应对这一挑战,研究者们提出了多种外部记忆机制,将轨迹存储为结构化表示。然而,每种结构都只提供了不完整且侧重点不同的视角,如何高效地组合这些互补信息,成为提升智能体性能的关键问题。 现有系统通常采用两种策略:一是对每个查询都读取固定的一组结构,这会导致上下文膨胀并引入噪声;二是将每个查询路由到单一结构,这又无法整合来自不同结构的互补证据。这种非此即彼的做法,显然无法满足复杂任务的动态需求。 针对这一局限,来自多所机构的研究团队在最新论文中提出了一种名为 **MESA(Multi-structure Evidence Selection framework)** 的创新框架,旨在通过任务自适应的多结构证据选择,优化长时程智能体的记忆利用效率。 ## 核心发现:最优配置并非“全都要”或“选一个” 研究团队首先在 **AMA-Bench** 基准上进行了受控分析,结果发现:对于不同查询和任务,最优的记忆配置通常既不是单一结构,也不是所有结构的简单并集,而是一个根据当前需求动态组合的**多结构子集**。这一发现直接挑战了现有方法的固定模式,为动态选择机制提供了理论依据。 ## MESA 框架:五个视角与强化学习 基于上述洞察,MESA 框架设计了五个互补的结构化视角来刻画每条轨迹,每个视角都捕捉了轨迹的不同侧面。在推理阶段,MESA 会从这五个结构中,针对当前查询,选择并融合一个特定的子集,以生成最终答案。 为了在缺乏细粒度监督的情况下学习这种选择策略,MESA 采用了**端到端的答案级反馈**,并引入了**先验引导搜索**和 **UCB(Upper Confidence Bound)引导调度** 的强化学习优化方法,从而在探索与利用之间取得平衡,有效提升学习效率。 ## 显著成效:性能提升与成本降低 在 AMA-Bench 基准上的实验结果显示,MESA 相较于最强基线模型,在性能上提升了 **8.5%**,同时相较于使用全部结构的方案,证据 token 消耗减少了 **41%**。这表明 MESA 不仅能够更精准地定位关键证据,还能显著降低计算成本,提升推理效率。 这项研究为长时程智能体记忆管理提供了新的思路,其动态选择机制有望在复杂的多步推理任务中发挥重要作用,推动智能体在真实世界场景中的落地应用。

Anthropic18天前原文

深度强化学习(DRL)在复杂环境中表现出色,但其决策过程往往被视为“黑箱”,难以解释。近日,研究人员提出了一种名为SPOT(Sampling Policy Observation Tree)的新型模型无关框架,旨在通过采样和模拟,为DRL策略提供直观的、前瞻性的解释。该研究已提交至arXiv(编号2608.09967),并在交通信号控制领域进行了案例验证。 ## 从“事后归因”到“前瞻模拟” 传统的可解释性方法,如特征归因,通常只关注单个时间步的决策依据,无法揭示策略的长期行为模式。SPOT则另辟蹊径,它通过访问策略和环境模拟器,构建一棵有限时域的“策略观察树”。具体而言,SPOT从当前状态出发,对策略的动作分布进行采样,并递归模拟每个动作产生的后续状态,从而形成一棵树状结构。这棵树不仅展示了策略在当前状态下的动作偏好,还呈现了这些偏好可能导致的未来演化路径。 ## 理论保证与实验验证 SPOT并非一个简单的可视化工具,其背后有严谨的理论支撑。研究团队证明了SPOT能够渐近地恢复策略的最可能动作,并刻画了在高熵策略下其分歧行为。这意味着,即使在策略高度不确定的情况下,SPOT也能提供可靠的解释。 为了验证SPOT的实用性,研究人员在SUMO-RL交通信号控制环境中进行了案例研究。结果表明,SPOT能够有效用于检查策略偏好、比较不同未来轨迹,并揭示那些通过单时间步特征归因方法无法看到的潜在下游行为。例如,它可能发现某个看似合理的信号灯控制策略,在几个时间步后会导致严重的交通拥堵,而传统方法则难以捕捉到这种长期影响。 ## 推动DRL落地应用 SPOT框架的出现,为DRL的可解释性研究提供了新的思路。它不依赖于特定模型结构,适用于任何可访问策略和环境模拟器的场景。这种前瞻性的解释能力,对于在自动驾驶、医疗诊断、智能交通等高风险领域部署DRL系统至关重要。它不仅能帮助开发者调试和优化策略,还能增强用户对AI系统的信任。 尽管SPOT目前仍处于研究阶段,但其潜力不容小觑。未来,该框架有望与更多应用场景结合,成为DRL走向实际应用的重要工具。

Anthropic18天前原文

在芯片设计流程中,硬件验证占据着举足轻重的地位,而测试激励生成(Testbench Stimulus Generation)则是验证环节的核心任务之一。传统的验证方法依赖人工编写测试用例,不仅耗时费力,而且难以保证覆盖率。近年来,大型语言模型(LLMs)在代码生成领域展现出巨大潜力,但如何将其有效应用于硬件验证,仍面临挑战。来自英伟达和加州大学圣迭戈分校的研究团队提出了一种名为 CHORUS 的后训练框架,通过融合多个互补的专家模型,在测试激励生成任务上取得了显著突破。 CHORUS 的核心思想源于两个关键观察:首先,分阶段的监督微调(SFT)能够产生行为多样化的模型检查点,而密集奖励的强化学习(RL)则能将这些检查点转化为性能强劲但任务侧重各异的专家模型。其次,这些专家模型的能力具有互补性,通过模型合并或进一步后训练,可以整合它们的优势,从而超越任何单一专家的表现。 研究团队将多个专家模型整合为一个 4B 参数的模型,在 CVDP-ECov 基准测试上取得了 **88.0% 的 Pass@1 成绩**,大幅超越了 **DeepSeek-R1(671B)** 的 74.5%,提升了 **13.5 个百分点**。这一结果令人瞩目,表明通过精心设计的后训练流程,小规模模型也能在特定任务上超越大规模模型。 CHORUS 的成功不仅验证了模型合并与专家互补策略的有效性,也为硬件验证领域带来了新的思路。传统的 LLM 应用通常采用“预训练-微调-推理”的固定范式,而 CHORUS 则展示了通过构建和整合多个专家模型,可以更高效地利用模型能力,提升任务表现。这一方法有望在芯片设计自动化(EDA)领域得到广泛应用,加速验证流程,降低设计成本。 尽管 CHORUS 目前专注于测试激励生成,但其框架具有通用性,未来可扩展至其他代码生成任务,如 RTL 设计、验证环境搭建等。随着硬件设计复杂度的不断提升,类似 CHORUS 的智能辅助工具将成为芯片工程师不可或缺的伙伴。这项研究也为 LLM 在专业领域的落地提供了宝贵经验:通过针对性的后训练与模型融合,小模型也能发挥大作用。

Anthropic18天前原文

人工智能(AI)和机器学习(ML)已成为支持和自动化复杂人类任务的强大工具。然而,随着大型深度学习(DL)模型的广泛部署,其高能耗和碳排放问题日益受到关注。近期,一篇发表于《Applied Intelligence》的论文对绿色AI、绿色DL及减排优化技术进行了系统性回顾,并比较了多种碳排放测量工具。研究还通过CPU实验评估了六个DL模型在多标签分类任务中的碳排放,结果显示训练阶段是排放的主要来源,且模型复杂度的增加并不总能带来相应的精度提升,强调了平衡性能与环境成本的重要性。

Anthropic18天前原文

随着AI系统在医疗、金融、法律等高损失领域中的应用日益广泛,人类监督的局限性逐渐凸显。一篇来自arXiv的最新论文(编号2608.07474)提出了一个名为“Flow-by-Flow”的治理框架,旨在不评估内容本身的情况下,对AI输出进行有效管控。该研究指出,传统的人类监督模式在高输出速度下会遭遇认知瓶颈,而新框架通过控制“认知负荷”而非内容正确性,为AI治理提供了新思路。 ## 核心问题:认知负荷的瓶颈 论文指出,AI输出的速度(V)与人类认知容量(C_max)之间的差距,并非唯一制约因素。真正的瓶颈在于“认知负荷”(L),即每项输出所需的人工审查成本。L由三部分构成:**分类成本**(triage)、**判断成本**(judgment)和**响应成本**(response)。随着AI能力提升,这三部分的变化并不对称: - **分类成本**:不降反升,因为通用AI的语义不确定性是固有特性,分类难度不会随模型能力增强而减少。 - **响应成本**:与准确性无关,保持不变。 - **判断成本**:虽有下降趋势,但往往是通过“省略”而非真正减少判断实现,即审查者可能跳过某些判断以应对压力。 因此,AI能力的提升并未降低总体认知负荷,反而可能使其结构失衡,导致监督质量下降。 ## 现有治理手段的困境 论文批评了两种常见的治理方式:一是将内容评估交给AI,但这会引入“幻觉风险”(即AI可能产生虚构或错误信息);二是依赖人工审查,但会撞上V×L的天花板,即输出速度与认知负荷的乘积超过人类处理极限。这两种方式都无法在高损失领域实现可靠治理。 ## Flow-by-Flow:绕过内容判断的新范式 为此,论文提出“Flow-by-Flow”治理框架,其核心思想是**不评估内容本身,而是控制监督负荷**。具体通过两个机制实现: - **认知成本评分**:基于正式、可计数的特征(如输出长度、生成速度、复杂度指标)对高产量生产施加非线性成本,使高输出量在成本上变得不可行。 - **机构容量上限**:确保处理量始终在人类认知容量C_max之内,避免超负荷运行。 该框架还定义了四条设计不变量,任何“内容判断绕过”的超出路径都必须满足: 1. **无内容判断**:不依赖对输出内容的正确性评估。 2. **不可扩展的审查员能力消耗**:防止通过增加审查员数量来突破容量上限。 3. **基于身份的每应用摩擦**:每个应用场景都有独立的摩擦机制,避免跨场景的批量处理。 4. **无批量清关**:不允许一次性通过大量输出,必须逐流处理。 ## 实验与可行性 论文还讨论了一个参考实现,证明这些不变量可以同时满足,但也坦承其在实际应用中的困难。此外,作者通过蒙特卡洛模拟(1000次参数抽样)比较了复合多指标流量控制与单纯监督强化的效果,结果显示前者在**90.8%**的试验中表现更优,表明该框架具有一定的优越性。 ## 意义与展望 这项研究为AI治理提供了新的视角:与其试图让AI输出“正确”,不如从流程上控制审查负荷,从而在高风险场景中保持人类监督的可持续性。尽管“Flow-by-Flow”仍处于理论阶段,但其设计原则可能对未来AI监管政策和技术实现产生启发。随着AI能力的持续提升,如何在效率与安全之间取得平衡,将是一个长期挑战,而这项研究无疑为应对这一挑战提供了有价值的思考。

Anthropic19天前原文

近日,一篇发表于arXiv的论文(编号2608.07480)提出了一种将情感状态纳入主动推理驾驶模型的新方法,旨在更全面地模拟人类驾驶员在复杂交通环境中的决策行为。该研究由Julian F. Schumann等多位学者合作完成,涉及人工智能、人机交互、机器学习与机器人学等多个领域。 主动推理(Active Inference)是一种基于自由能原理的认知框架,强调智能体通过行动来最小化预测误差与不确定性,同时追求目标导向的行为。近年来,该框架已被成功应用于生物系统与人工系统,包括对人类驾驶行为的建模。然而,现有的主动推理驾驶模型大多忽略了情感因素,而情感状态(如愤怒、焦虑)在真实驾驶中显著影响决策,例如路怒症可能导致激进驾驶。 此前,已有研究在简化环境中将情感表示为环状模型(Circumplex Model)中的效价(Valence)与唤醒度(Arousal)两个维度,但这些研究局限于离散状态空间。本研究的创新之处在于:在连续状态空间的复杂驾驶模型中,扩展了效价与唤醒度的定义,不仅基于当前状态,还结合了对未来结果的预测来估计情感信号。 研究团队在两个交互式驾驶场景中评估了该方法,结果显示模型产生的情感信号与人类在类似情境下的情感反应模式相符。例如,在面临突发风险时,模型会表现出较高的唤醒度和负效价,模拟出紧张与不安的情绪。 这一成果对于自动驾驶与人机共驾系统具有潜在价值。通过将情感模型整合到驾驶决策中,未来的自动驾驶系统或许能更好地理解人类驾驶员的状态,从而做出更安全、更自然的交互行为。此外,该研究也为主动推理框架在情感计算领域的应用提供了新思路,有望推动更贴近人类认知的智能体设计。 尽管该研究仍处于模拟阶段,距离实际应用尚有距离,但它为情感与认知建模的交叉研究提供了重要参考。随着相关技术的成熟,我们或许能看到更具“人性化”的自动驾驶系统问世。

Anthropic19天前原文

训练深度学习模型时,处理长度可变的序列数据往往面临巨大的计算挑战。近日,来自新加坡国立大学的研究团队提出了一种名为 **Data-Centric Parallel(DCP)** 的新方法,旨在打破效率与易用性之间的两难困境。相关论文已提交至 arXiv(编号:2608.07524),并展示了在 32 块 H200 GPU 上最高 **2.88 倍** 的加速效果。 ## 现有方法的困境 对于变长序列的训练,传统策略通常分为两类: - **简单方法**:采用静态配置,如固定并行度或梯度累积步数,这会导致不同批次间的工作负载严重不均衡,计算资源利用率低下,训练效率不高。 - **复杂方法**:通过动态调整运行时配置来适配序列长度变化,但往往需要引入大量代码改动,对于新模型的适配成本极高,难以推广。 ## DCP 的核心思想 DCP 的核心原则是 **让数据本身驱动运行时决策**。具体而言,它会根据每个批次的实际序列长度,动态调整直接运行时设置,包括: - 并行大小(parallel size) - 梯度累积步数(gradient accumulation) - 重计算策略(recomputation) 这种动态调整机制使得计算资源能够更贴合当前批次的需求,从而在保持高效率的同时,无需复杂的人工干预。 ## 显著加速与易用性 实验结果显示,在 32 块 H200 GPU 上,DCP 能够实现最高 **2.88 倍** 的训练加速。更值得关注的是,该方法设计上注重通用性,**仅需约 10 行代码**即可集成到任意模型中,极大降低了部署门槛。 ## 意义与展望 DCP 的提出为变长序列分布式训练提供了一个简单而有效的基线方案。它有望成为该领域后续研究的参考基准,推动分布式训练技术在处理变长序列时的进一步发展。对于研究者而言,这一方法意味着可以更轻松地应对自然语言处理、视频理解等任务中常见的长度不均问题,而无需牺牲效率或编写大量定制代码。

Anthropic19天前原文

大语言模型(LLM)的部署监控正面临一个令人困惑的现象:线性探针(linear probes)几乎能完美检测到模型输入中的“上下文污染”,但这种高精度却无法转化为可靠的失败预测。来自 arXiv 的一项最新研究(编号 2608.07528)揭示了这一“知而不言”的鸿沟:模型内部状态“知道”错误发生,但口头表达的置信度却无法反映这一点。 该研究聚焦于多跳算术推理链,通过精心设计的实验,测试了线性探针在检测上下文污染、预测最终答案正确性方面的表现。结果令人意外:探针虽然能高精度地识别输入是否被污染,但这种检测能力与最终答案是否正确几乎无关。换句话说,探针“看到了”错误信号,但这些信号并不能帮助预测模型是否会给出错误答案。 更耐人寻味的是,当研究者强迫模型采用结构化的置信度格式时,模型的置信度输出会坍缩为两个值,且这两个值对应的错误率没有显著差异。这意味着,模型看似给出高置信度,但其背后隐藏的错误风险可能被完全掩盖。此外,探针在推理链各步骤上的持续性表现,也未能区分正确与错误的结果,这直接否定了研究者预先注册的“持续性优于峰值”假设。 这一“知而不言”的模式在包括推理模型在内的多个模型家族中普遍存在,表明它并非个别模型的特性,而是大模型监控中的普遍挑战。 那么,这是否意味着探针监控毫无价值?并非如此。研究表明,探针监控是口头置信度的必要补充,但没有任何一种单一的干预策略能够全面主导。在实时监控场景中,探针干预的效果高度依赖于模型类型和错误类型。例如,一种名为“分支选择”(branch-and-pick)的策略在多个模型上净收益为正,且在 Llama-3.1-8B 上表现独特,能够修复 4 个错误而不会破坏任何正确轨迹;而“重新提示”(reprompt)和“替换先前”(replace-prior)策略在修复错误的同时,也会以大致相同的比例破坏原本正确的轨迹。 因此,可部署的监控方案必须是模型感知、错误类型感知的路由机制,而非一刀切的干预手段。这项研究为 AI 安全与可靠性领域提供了新的视角:我们不仅要关注模型“说”了什么,更要关注它“知道”什么,以及如何将内部知识转化为可靠的行动。

Anthropic19天前原文