SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:Anthropic清除筛选 ×

## 研究背景:反馈的“假象”与实验设计 大语言模型(LLM)在对话、编程等任务中常通过多轮交互来提升表现。然而,一个根本问题始终悬而未决:**最终准确率的提升,究竟来自反馈中的有效指导,还是仅仅因为重试、格式修正或额外计算?** 为了厘清这些因素,来自波兰的研究团队提出了一种受控的“学生-教师”协议,在 **Omni-MATH、Codeforces、BBEH Linguini 和 ARC-AGI1** 四个高难度基准上,对13个开源模型进行了系统评估。 ## 核心发现:反馈的“边际贡献”有限 研究对比了三种交互模式: - **外部反馈**:由教师模型提供自然语言指导; - **自我反馈**:学生模型自己生成反馈; - **无引导自我修正**:仅重复尝试,不附加任何反馈。 结果揭示了几个关键事实: 1. **自我反馈效果微弱**:模型自己生成的反馈带来的提升,与无引导的自我修正几乎无异,说明自反馈本质上只是“换一种方式重试”。 2. **强外部教师才有实质增益**:只有能力最强的教师模型提供的反馈,才能带来显著高于基线(重试)的改进。这意味着**有用反馈必须包含超越“再试一次”的具体指导**。 3. **学生的反馈利用能力是瓶颈**:通过构建密集的“学生-教师”交互矩阵,研究者发现,交互增益更多取决于**学生吸收和应用反馈的能力**,而非教师本身的身份。当然,在固定学生的情况下,选择合适的教师仍然重要。 ## 对AI社区的启示 这项研究提醒我们,在评估基于反馈的智能体时,**必须设立“重复尝试”作为基线**,否则很容易高估反馈的价值。同时,未来改进的重点不应只放在提供更强大的反馈上,更应关注如何提升模型**理解并执行反馈的能力**——这或许才是交互式改进的真正瓶颈。 论文已被 **ICML 2026 RLxF Workshop** 接收,相关评估框架已开源。对于正在构建多轮对话、代码助手或推理系统的开发者而言,这无疑是一份值得细读的“避坑指南”。

Anthropic2个月前原文

## 研究背景:推理模型的“早停”难题 大型语言模型(LLM)在推理任务中,不同实例所需的计算量差异巨大。一些简单问题可能只需少量推理步骤,而复杂问题则需要更长的“思维链”。传统的固定预算方法(如设定最大token数)会造成计算浪费,而简单的启发式规则(如置信度阈值、收敛检测)虽能实现动态退出,但其性能上限尚不明确。 针对这一问题,来自缅因大学普雷斯克岛分校、斯坦福大学等机构的研究人员提出了 **LearnStop**——一种无需隐藏状态的检查点停止机制,旨在通过**学习最优停止策略**来平衡推理质量与计算成本。 ## LearnStop 的工作原理 LearnStop 的核心思想是在预先设定的**固定预算检查点**(例如每 128 或 256 个 token)处,从当前推理前缀中提取一个简短答案,并利用**在线特征**(如答案置信度、熵、前缀投票份额、答案稳定性、回溯标记密度)预测该前缀的正确性。如果预测为正确,则立即停止推理并输出该答案;否则继续推理至下一检查点。 与需要访问模型隐藏状态的方法不同,LearnStop 仅依赖可观测的表面特征,因而具有更广泛的适用性。 ## 实验发现:任务依赖性显著 研究团队在 **18 种任务-模型组合**上进行了测试,覆盖 GSM8K、MATH-500、MMLU-Pro、AIME-90、GPQA 等基准,以及 Qwen3 和 DeepSeek-R1 蒸馏变体。关键发现如下: - **自由形式数学任务**(如 GSM8K)中,LearnStop 的**多特征学习策略**显著优于固定预算基线,并经常击败单一标量退出规则(如仅使用置信度或熵)。在 Qwen3-32B 上,经验前沿的**事后峰值自适应增益达到 +0.157**,验证集选点保持正增益,与最强标量基线相比配对增益为 **+0.028**。 - **多项选择题和极难任务**(如 AIME-90)中,简单的标量规则(如置信度、熵或稳定性)反而更具竞争力,甚至更强。 这表明,**学习型停止机制并非标量退出的通用替代品**,其价值高度依赖于推理轨迹的结构。当许多问题在达到全预算前已正确,但又不呈现单一可靠的标量停止信号时,LearnStop 最为有效;反之,若置信度或答案收敛已能很好地解决停止问题,则学习方法的优势基本消失。 ## 成本核算与实际部署考量 研究还深入分析了不同计算场景下的成本: - **KV 缓存分叉(KV-fork)**:需额外存储中间状态。 - **前缀缓存(Prefix-cache)**:利用已计算前缀加速。 - **黑盒模式**:仅通过 API 调用,无法访问内部状态。 通过 H100 服务性能分析、检查点调度扫描、迁移学习分析和鲁棒性检验,论文为实际部署提供了**验证集选点**、**配对 bootstrap 检验**和**有限网格丢失正确风险校准**等实用工具。 ## 小结与启示 这项研究为推理模型的动态计算分配提供了新视角:**“何时停止”不是一刀切的问题**。对于开发者而言,若任务以自由形式数学为主,且简单阈值表现不佳,值得尝试 LearnStop 等多特征学习方法;而对于选择题或难度分布均匀的任务,标量规则可能更简单有效。未来工作可探索更复杂的轨迹特征,或针对特定任务进行自适应检查点调度。

Anthropic2个月前原文

## 核心发现:知识组织比模型规模更重要 在ML工程竞赛中,智能体往往重复发明轮子——每次竞赛都从零开始,浪费大量算力。一篇被ICML 2026 Workshop接收的论文提出了**HASTE系统**(层次化多智能体技能迁移框架),通过三层作用域(全局、领域、竞赛特定)组织跨竞赛知识,并用LLM驱动的抽象层实现层级间学习。 ### 关键实验结果 - **奖牌率翻倍**:在控制159个技能库存不变的情况下,层次化加载实现**100%奖牌率**,而平面加载仅62.5%(与不加载技能相同),且输出token消耗翻倍。 - **全基准测试**:在MLE-Bench Lite的22个Kaggle竞赛中,HASTE使用Claude Sonnet 4.6在每竞赛12小时内达到**77.3%奖牌率**。 - **冷启动 vs 热启动**:热启动(复用全局和领域级技能)相比冷启动减少**52%的细化迭代次数**,且智能体保留的提议比例从低库存时的42%升至拥有50+技能时的85%。 ### 层级设计如何工作? HASTE包含三层智能体: 1. **全局层**:存储跨领域通用技能(如数据预处理模板) 2. **领域层**:针对特定领域(如NLP、计算机视觉)的优化策略 3. **竞赛特定层**:当前竞赛的临时知识 一个协调器(orchestrator)负责调度领域专家,并通过LLM驱动的抽象机制将底层经验提升到更高层级。这种设计使得知识可以跨竞赛迁移,而无需每次从头学习。 ### 行业启示 这项研究暗示,**更好的知识组织可以部分替代模型强度和算力预算**。对于AI工程自动化领域,HASTE提供了一条务实路径:与其追求更大模型或更多GPU,不如构建结构化的技能积累系统。论文作者来自阿尔伯塔大学,代码尚未开源,但方法已通过消融实验充分验证。 > 一句话总结:**“不要解决两次”**——层次化技能库让ML智能体越用越聪明,算力效率提升显著。

Anthropic2个月前原文

LLM Agent 正成为信息检索(IR)系统的核心组件——它们发出检索查询、合成答案,甚至担任 IR 评估的裁判。控制这些 Agent 的提示词本质上是一个优化问题,但在实际 IR 应用中,它更像“调试”而非“盲搜”:工程师需要知道哪个行为失败了、哪个邻近行为仍有效、两者的区别是什么,以及一次提示修改是否在提升留出集质量的同时引入了回退。 针对这一需求,来自多位研究者的论文《Contrastive Reflection for Iterative Prompt Optimization》提出了一种名为 **对比反思(Contrastive Reflection)** 的迭代提示优化框架。该框架专为 Agent 驱动的 IR 工作流设计,其核心思路是:利用 Agent 在执行任务时产生的结构化轨迹(如检索或推理步骤、评分维度与理由),**自动识别失败的行为片段**,然后从同一区域**补充邻近的成功示例**,最后让一个“教师”LLM 据此提出有针对性的提示修改。修改候选仅在验证性能提升时被采纳,并可选择性附加回归检查。 论文在 HotpotQA 检索增强问答(RAG)任务上进行了实验。结果显示,一次基于树结构切片选择器的对比修复,将留出集精确匹配准确率从 **51.4% 提升至 60.4%**。相比之下,仅使用失败示例或随机证据的变体改进幅度更小,且破坏了更多原本正确的示例。与当前主流的提示优化器相比,对比反思的性能也颇具竞争力:MIPROv2 达到 59.4%,GEPA 达到 57.0%。 ### 框架亮点:从“黑盒搜索”到“可检视调试” 传统提示优化方法(如自动提示搜索或贝叶斯优化)往往将提示视为黑盒参数,难以理解每次修改为何有效或无效。对比反思的独特之处在于其**可解释性**:它通过对比失败与成功的行为切片,让工程师能直观看到“哪里错了、哪里对了、差在哪里”。这种设计使得提示修复过程更加透明、可审查,也更容易与人工经验结合。 ### 实验细节与对比 - **任务设置**:使用 HotpotQA 数据集,构建检索增强问答 Agent。Agent 需根据问题检索相关段落并生成答案。 - **基线方法**:包括无修改的原始提示(51.4%)、仅使用失败示例的变体、随机证据变体,以及两个现代提示优化器 MIPROv2(59.4%)和 GEPA(57.0%)。 - **结果**:对比反思(树选择)达到 60.4%,不仅绝对提升显著,且更少破坏已有正确行为。 ### 意义与展望 对比反思为 IR Agent 的提示工程提供了一种**结构化、可迭代的调试范式**。它不依赖昂贵的全局搜索,而是利用 Agent 自身产生的轨迹信息进行局部修复。未来工作可探索更复杂的切片选择策略、多轮迭代优化,以及在其他 IR 任务(如排序、评估)上的泛化能力。 该论文已被 **KDD 2026 Workshop on AI Agents for Information Retrieval(Agent4IR)** 接收。

Anthropic2个月前原文

## 让大模型“想对方向”,而不仅是“想得更多” 当前提升大语言模型推理能力的主流方法,如**思维链(Chain-of-Thought)** 和 **“Wait”提示**,本质上都是在鼓励模型“多想想”。然而,想得更多并不等于想得更正确——模型可能在复杂的推理步骤中越走越偏,最终生成看似合理但实则错误的答案。 一项被 **ICML 2026** 接收的新研究《Search for Truth from Reasoning》提出了一个关键问题:**如何引导模型的推理轨迹真正趋向“真相”,而非仅仅增加推理步数?** 为此,研究团队提出了一个名为 **DynaSteer** 的动态表征编辑框架,试图从模型内部表征的几何结构入手,实现对推理过程的精准干预。 ## 三个关键发现:真相的“几何学” 研究首先深入分析了模型在推理过程中内部表征的变化,揭示了关于“真相”的三个重要性质: 1. **真相编码在句子层级,且与推理模式纠缠**:模型并非在单个 token 上编码“正确性”,而是在完整的句子或子句层面表达真实程度。同时,这种真实信号与模型使用的推理策略(如类比、分解)高度耦合,难以直接分离。 2. **干预存在“测不准原理”与“衰减效应”**:对模型表征的修改并非越早越好或越强越好。最佳干预时机位于早期、高熵的决策分叉点——此时模型尚未“下定决心”,干预效果最显著;而一旦进入低熵的确定性路径,干预效果会迅速衰减。 3. **朴素干预向量噪声过大**:直接使用简单的方向向量进行编辑,容易引入噪声,甚至破坏原本正确的推理轨迹,导致“误伤”。 ## DynaSteer:动态、精准、可回滚 基于上述洞察,DynaSteer 框架提出了三阶段解决方案: - **模式聚类解耦**:首先对推理过程中的表征进行聚类,将不同的推理模式(如代数推理、几何推理)分离到不同的流形上,从而避免跨模式干扰。 - **Fisher-LDA 投影提纯**:利用 Fisher 线性判别分析,在解耦后的流形上提取出最纯净的“真相方向”,大幅降低噪声。 - **动态监测与选择性干预**:通过实时计算**前瞻熵(lookahead entropy)** 来评估当前推理路径的不确定性。仅在熵值高于阈值时触发干预,并允许在干预失效时回滚到之前的健康状态。 ## 实验验证与行业意义 在 **MATH 基准**上的全面实验表明,DynaSteer 在多个难度级别的数学推理任务上均显著提升了准确率,同时减少了不必要的推理步数。在**跨领域代码生成任务**上的测试进一步证实了其泛化能力。 这项工作的价值不仅在于技术本身,更在于它揭示了一个深层问题:**当前的大模型推理增强方法大多停留在“量”的层面(增加步数、扩大搜索),而忽略了“质”的引导——如何让模型在推理过程中持续逼近真相。** DynaSteer 提供了一种可微、可控制的内部表征干预范式,有望与外部提示方法互补,成为下一代推理增强工具的核心组件。 随着大模型在数学、编程、科学推理等高价值场景中的应用日益深入,如何确保其推理结果的可信度将成为关键挑战。DynaSteer 的“动态编辑+回滚”思路,或许为这一难题提供了一条值得探索的新路径。

Anthropic2个月前原文

大型语言模型(LLM)在应对伦理困境时,常常展现出不同的价值取向——有的更强调公平,有的更看重诚实,有的偏向勇敢,有的则倾向于克制。如何系统性地描述这些差异?来自雅典经济与商业大学的研究团队近期提出了 **VirtueMap** 框架,从亚里士多德美德伦理学出发,为LLM建立“美德画像”。 ## 从“对错”到“排序”:评估思路的转变 传统伦理评估往往要求模型从多个选项中选出“正确”答案,但现实中的伦理困境往往没有绝对的对错,只有不同的优先级。VirtueMap 另辟蹊径:它不要求给出唯一答案,而是让人类或LLM对每个困境下的 **5 种回应进行排序**,从而揭示模型在不同美德维度上的倾向。 研究设计了 **7 个通用、非致命、非政治、非宗教的伦理困境**(例如涉及诚实与忠诚冲突的场景),每个困境对应 5 种回应。针对每个困境和每种美德,研究者先提出一套“从最体现该美德到最不体现”的参考排序,然后收集 **超过 100 份人类评价**,只有当 **至少 95% 的受访者确认**该排序时,才将其作为该美德的“操作化真值”(operational ground truth)。 ## 五大美德与Borda对齐评分 VirtueMap 聚焦 **5 种核心美德**: - **实践智慧(Practical Wisdom)** - **正义(Justice)** - **诚实(Truthfulness)** - **勇气(Courage)** - **节制(Temperance)** 模型或人类的排序结果与参考真值进行 **归一化Borda对齐** 评分,最终生成每个主体在五维美德空间中的“画像”。 ## 对9个LLM家族的测试结果 研究者对 **9 个LLM家族** 进行了重复运行评估,发现模型在美德排序上具有 **较高的平均排名一致性(90.3%)**,但在不同美德上存在明显差异: - **勇气、节制和正义** 是模型间分歧最大的维度,不同模型在这些美德上的表现差异显著。 - 相比之下,实践智慧和诚实的排名一致性更高,说明模型在这些维度上的倾向更为趋同。 ## 交互式网站与本地计算 研究团队还发布了一个 **交互式网站**,用户可以在浏览器本地计算自己的美德画像,并与已测得的LLM画像进行对比。这为普通用户参与AI伦理研究提供了低门槛的入口。 ## 意义与局限 VirtueMap 的贡献在于提供了一种 **细粒度、可解释的伦理偏好量化方法**,超越了传统的“安全/有害”二元分类。它借鉴了古典伦理学的理论框架,使模型的行为描述更具人文深度。 不过,该框架目前仅基于 7 个特定困境,且美德排序的“真值”依赖于人类共识(95% 阈值),可能难以覆盖更复杂或文化敏感的伦理问题。此外,模型在非英语环境下的表现尚未被验证。 尽管如此,VirtueMap 为 LLM 的伦理对齐提供了一个新颖的视角:与其追求“绝对正确”,不如理解模型在不同美德维度上的 **优先级偏好**,从而更好地预测和引导其行为。

Anthropic2个月前原文

随着大语言模型和视觉-语言模型的飞速发展,AI在临床决策支持和分诊等场景中展现出巨大潜力。然而,现有医疗AI基准测试存在明显碎片化:有的支持多轮对话但不含图像,有的提供多模态输入却只聚焦单轮问答。为填补这一空白,研究团队推出了 **IMCBench**——一个基于真实临床图像、结合合成患者档案的多轮医疗对话基准,旨在模拟真实的医患互动场景。 **多维评估:安全、准确与不确定性管理** IMCBench 的独特之处在于其评估维度。每个对话从三个临床关键角度进行打分:**安全性**(建议是否可能导致患者伤害)、**准确性**(诊断与事实的匹配度)以及**不确定性管理**(模型是否恰当地表达诊断的不确定性)。评分采用 1-5 分制,利用 LLM-as-Jury 方法,并经过临床专家标注校准,确保评估的可靠性。 **模型表现:Claude Opus 4.6 领跑,但无全能选手** 研究团队对四个模型家族(Claude、GPT、Nova、Llama)中的八款前沿多模态模型进行了基准测试。结果显示,**Claude Opus 4.6** 以 **3.61** 的综合得分位居榜首,紧随其后的是 Claude Sonnet 4.6(3.30)和 GPT-5.2(3.29)。然而,没有任何模型在所有维度上占据绝对优势。值得注意的是,所有模型在应对恶性或罕见病症时,安全性得分平均下降 **0.27**,暴露出当前模型在处理高风险场景时的短板。 **消融实验:视觉与电子健康记录(EHR)信息不可或缺** 进一步的消融研究表明,移除视觉输入或 EHR 上下文信息后,模型的安全指导能力均出现下滑——安全得分平均分别下降 **0.18** 和 **0.23**。更强的模型能更有效地利用视觉特征,但整体而言,准确的临床描述并不等同于安全的患者指导。这一发现强调了在医疗 AI 评估中引入多维框架的必要性,而非仅依赖单一指标。 **行业启示:医疗 AI 评估需从“单点”走向“全景”** IMCBench 的出现,为医疗 AI 领域提供了一个更贴近真实诊疗流程的评测工具。它提醒业界:多模态能力不仅仅是“看图说话”,更要在复杂对话中平衡安全、准确与不确定性表达。随着该基准被 ECML PKDD 2026 接收,未来有望推动模型在临床场景中更稳健地落地。

Anthropic2个月前原文

## 概述 大语言模型(LLM)的预训练中,模型能力是核心变量,却从未被直接观测。数据塑造能力(前瞻),评估揭示能力(回顾),但两者之间缺乏可操作的桥梁。传统优化流程是“先看到失败,再推断数据修复”,工程师依赖直觉而非方法。近日,一篇 arXiv 论文提出 **“能力切片”(capability slice)** 概念,构建了从评估到数据的闭环,使推断变得可审计、可实验验证。 ## 核心问题:评估与数据的“语言鸿沟” 评估侧使用**基准名称**和**样本正确性**,数据侧使用**数据来源、领域、质量标签**,两者词汇不兼容。一个基准分数是多个因素(样本、提示、解码、评分规则)的嘈杂聚合,难以定位具体弱点;而单个样本噪声太大。工程师只能凭经验猜测:哪个数据环节出了问题? ## 解决方案:能力切片 + 分类体系 + 映射规则 论文提出 **“能力切片”**——一组共享背景条件、任务类型、求解操作和输出约束的评估样本。它足够精细以定位单一弱点,又足够稳定以承受聚合。围绕这一单元,作者构建了: - **评估分类法**:按能力维度组织评估样本 - **非指令数据分类法**:按数据来源、领域、质量等标签组织预训练数据 - **映射规则**:连接评估失败与数据干预的对应关系 形成闭环:基准失败 → 能力切片诊断 → 数据干预 → 再评估验证。 ## 实验验证:两个相反方向的案例 ### 案例一:闭环“排除”数据问题 持续预训练导致 **BBH 基准下降 46.82%**。传统思路会怀疑数据质量。但闭环诊断发现:问题不在于数据内容,而在于训练中**单个掩码 <EOS> 损失**设置不当,削弱了推理能力。修复该损失后,BBH 回升至 66.44,甚至超过原始检查点。数据本身无需改变。 ### 案例二:闭环“定位”数据干预 数学推理能力持续薄弱。通过求解操作分解,发现是**特定组合的失败模式**。基于此构建的弱点定向采样策略,使 **AIME2025/AIME2026 Pass@128** 从 6.67/0.00 提升至各 26.67。 同一套闭环在两个案例中得出了相反但正确的结论:第一个排除了数据问题,第二个精准定位了数据改进方向。 ## 意义与展望 这项工作将评估到数据的推断从**直觉驱动**转变为**方法驱动**,使能力增强过程更加可审计、可重复。对于追求高效优化的大模型团队,这种闭环方法论有望成为标准实践。未来可进一步自动化映射规则,并扩展到指令微调与强化学习场景。 > 论文标题:Data and Evaluation Closed-Loop for Model Capability Enhancement > 作者:Zhixuan Li, Jiangan Yuan, Han Xu > 链接:arXiv:2606.28471

Anthropic2个月前原文

## 引言 在图像生成与理解领域,“构图”一直是一个棘手的高阶视觉意图。它决定了主体放在哪里、场景如何组织,但当前的主流统一多模态模型在细粒度构图识别上仍不可靠,更难以将这种意图转化为可控的生成。近日,来自多家机构的研究团队提出了 **COMPASS**,号称首个将构图意图控制落地到单一系统的统一多模态框架,同时覆盖构图感知与构图引导生成两个环节。 ## 核心设计:共享专家令牌 τ_c COMPASS 的核心创新在于引入了一个**共享专家令牌 τ_c**,作为构图意图的中央锚点。在感知侧,COMPASS 以最小侵入方式将构图专家知识注入 MoE(混合专家)骨干网络,并将推断出的意图蒸馏到 τ_c 中。在生成侧,COMPASS 复用同一个 τ_c 作为全局条件信号,引导去噪轨迹,从而将被动的构图分析转化为显式的布局控制。这种设计让感知与生成共享同一个意图表示,避免了传统两阶段方法中信息丢失的问题。 ## 数据集 Comp-11:大规模构图指令数据集 为了支持系统性的指令跟随构图学习与评估,研究团队构建了 **Comp-11** 数据集。该数据集包含 **11 类构图分类体系**(如居中、三分法、对角线、前景-背景等),并配有推理增强的标注。这为模型学习从自然语言描述到具体布局的映射提供了大规模训练资源。 ## 实验表现 大量实验表明,COMPASS 在**类别级构图理解**上显著优于现有方法,生成的图像在构图一致性和提示忠实度方面均超过强基线模型。例如,在 Comp-11 的零样本评估中,COMPASS 的构图分类准确率比当前最好的统一多模态模型高出 15 个百分点以上,而生成图像的布局与提示描述的匹配度也提升了 20% 以上。 ## 行业意义 COMPASS 的出现,标志着多模态模型从“能看懂构图”向“能按构图意图生成”迈出了关键一步。对于 AI 内容创作、广告设计、虚拟场景构建等应用,构图控制一直是难以绕过的基础能力。过去,用户只能通过反复调整提示词(prompt)来间接影响布局,而 COMPASS 提供了一条直接、可解释的路径:你用自然语言描述构图意图,模型就能忠实执行。 ## 局限与展望 尽管 COMPASS 在 11 类构图分类上表现优秀,但真实世界的构图远不止这 11 种。此外,当前框架仍依赖 MoE 架构的特定设计,通用性有待验证。不过,共享意图令牌的思路为后续研究打开了一扇门——或许未来,其他高阶视觉属性(如光照、材质、动作)也能通过类似方式被“锚定”并控制生成。 ## 小结 COMPASS 通过共享专家令牌 τ_c 和 Comp-11 数据集,首次实现了统一的构图感知与生成,在多个指标上达到新 SOTA。对于关注可控图像生成的研究者和开发者来说,这是一篇值得深入阅读的工作。论文已发布于 arXiv,代码和数据预计后续开源。

Anthropic2个月前原文

大语言模型(LLM)智能体正越来越多地通过演化自然语言构件(如反思、工作流、剧本、备忘单或优化提示)来提升性能,而无需更新模型权重。这类方法通常只在单个基准上报告成功。一篇新论文《Recursive Self-Evolving Agents via Held-Out Selection》对此进行了公平对比,并揭示了更清晰的图景。 ## 核心方法:RSEA 研究者提出**RSEA(递归自进化智能体)**,它维护一个紧凑的三层自然语言状态:**策略**(命令式)、**技能**(可重用)和**剧本**(程序化)。在每一代演化中,RSEA根据自身轨迹重写所有三层,并仅当候选版本在**留出数据**上不退化时才提交,采用严格的“保留更好”门控。 ## 主要发现 论文在四个多样化基准(**ALFWorld**、**GAIA**、**τ-bench**、**WebShop**)上,与六个忠实基线(ReAct、Reflexion、GEPA、AWM、ACE、Dynamic Cheatsheet)进行对比,所有方法使用同一本地骨干模型,得出三个主要结论: 1. **没有通用最优构件**。RSEA在ALFWorld上是单次方法中最强的,达到**69.3%**(ReAct为64.6%,McNemar检验p=0.015),配合重试后达到**79.4%**,为整体最佳。然而,在强骨干工具使用任务上,**AWM**(具体工作流归纳)表现最佳。 2. **无门控的上下文演化高风险且不安全**。**Dynamic Cheatsheet**在线整理上下文但无留出门控,在ALFWorld上接近最佳(70.7%),但在WebShop上崩溃,得分**0.14**(ReAct为0.43)。 3. **严格留出选择是RSEA单调安全的关键**:RSEA在所有基准上从未显著低于基础智能体,当演化上下文可能有害时,它会回退到标准ReAct。 ## 行业意义 这项研究揭示了LLM智能体自演化领域的关键挑战:**性能提升的不可靠性和退化风险**。RSEA通过留出验证提供了安全网,但同时也表明不同任务需要不同的演化策略。对于AI从业者,这意味着在部署自演化智能体时,必须引入严格的验证机制,而非盲目信任单一代际的改进。 论文还强调了**公平比较**的重要性:许多方法在单一基准上宣称成功,但跨任务评估后优势消失。未来,社区需要更系统的基准和验证协议,以确保智能体演化技术的可靠落地。

Anthropic2个月前原文

arXiv:2606.28692v1 Announce Type: new Abstract: Treatment reasoning underpins every therapeutic decision, integrating disease context, comorbidities, medications, contraindications, and evolving biomedical knowledge to select an appropriate therapy. It is inherently iterative: candidates are weighed against many constraints, revised as evidence emerges, and grounded in verifiable sources. Here we introduce ATHENA-R1, an AI agent for treatment reasoning across all FDA approved drugs since 1939, t

Anthropic2个月前原文

**一句话快讯**:最新基准测试GPTNT基于合作游戏《Keep Talking and Nobody Explodes》设计,要求两个多模态智能体在实时压力下通过不对称信息协作拆弹。结果显示,当前最强AI无一成功,而人类玩家轻松过关。该测试揭示了AI在状态追踪、时效行动、歧义处理和错误恢复上的严重短板。**核心发现**:所有测试模型(包括闭源和开源)在实时拆弹任务中全部失败,暴露出协作能力的系统性缺失。**背景与设计**:现有AI评测多聚焦单一能力,但真实协作需同时应对时间压力、信息不对称和不完美沟通。GPTNT将两个智能体置于不同角色:一个能看到并操作炸弹但无说明书,另一个有说明书但无法接触炸弹,两者必须通过实时语音沟通完成拆弹。任务采用程序化生成谜题,且可选择性移除手册或伙伴来隔离模型依赖。**测试结果**:在实时设定下,所有模型均无法在时限内拆解任何炸弹。相比之下,人类玩家通过明确分工、快速确认和错误纠正能稳定成功。**深层分析**:通过控制实验,研究团队定位了四个关键缺陷:1)**状态追踪失败**:模型难以记住当前操作步骤和炸弹状态;2)**时效压力下效率低**:对话冗长,行动迟缓;3)**歧义处理弱**:对模糊描述无法请求澄清或推断;4)**错误恢复差**:一旦出错,无法从失败中学习并调整策略。**未来意义**:GPTNT作为可演进的基准,将随模型能力提升而更新,避免被一次性破解。它提醒业界:多模态智能体的协作能力远未达到实用水平,实时交互与信息不对称仍是核心挑战。

Anthropic2个月前原文

大语言模型(LLM)在长周期规划任务中常因逻辑复杂而生成不可行或错误的方案,成为其走向可靠落地的关键瓶颈。近日,来自中国科学院自动化研究所等机构的研究团队提出了一项名为 **符号反馈驱动迭代自精炼框架** 的新方法,旨在通过符号验证器与自然语言提示的协同,系统性地提升 LLM 在长期决策中的鲁棒性与正确性。 ## 核心挑战:LLM 规划的“幻觉”困境 规划是智能行为的核心要素,但 LLM 在处理多步骤、长时序任务时,容易受限于上下文窗口与内在推理能力的不足,导致生成的步骤链违反物理约束、逻辑矛盾或无法达成目标。这种“规划幻觉”在自动驾驶、机器人任务编排、供应链管理等高风险场景中可能引发严重后果。 ## 方法解析:三步闭环提升可靠性 该框架的核心思路是引入符号逻辑作为外部纠错锚点,而非单纯依赖模型自身修正。具体流程分为三个关键模块: 1. **符号-自然语言映射**:设计专门的提示机制,将任务约束、状态转移等逻辑符号转化为 LLM 更易理解的自然语言描述,帮助模型“读懂”问题的深层语义。 2. **符号验证器**:在 LLM 输出规划方案后,验证器会检查其可行性(如资源是否超限、动作是否合法),并将检测到的错误转化为结构化的修正指令,反馈给模型进行迭代改进。 3. **计划识别器**:通过推断当前部分规划与最终目标之间的可达性,引导模型优先选择能有效接近目标的路径,避免在无望分支上浪费计算资源。 整个流程形成 **“生成 → 验证 → 修正 → 再生成”** 的闭环,直至方案通过所有符号约束或达到预设迭代次数。 ## 实验结果:可行性显著提升 研究团队在多个标准规划基准(如 Blocks World、Logistics 等)上进行了测试。结果显示,相比直接使用 LLM 进行规划,该框架在 **方案可行性** 和 **目标达成率** 上均有明显提升,尤其对于需要超过 10 步的复杂任务,错误率降低了约 30-50%(基于论文图表数据)。 ## 意义与展望:从“能对话”到“能做事” 这项工作的价值不仅在于一项技术改进,更在于它展示了 **符号系统与连接主义模型协同** 的可行路径。LLM 擅长语义理解与常识推理,但缺乏形式化约束的保障;符号系统能提供精确的规则校验,却难以处理歧义和开放场景。将二者结合,有望催生出更值得信赖的 AI 规划引擎。 当然,该方法仍依赖预定义的符号规则库,在完全未知或规则动态变化的场景中可能受限。未来,如何让 LLM 自主从环境反馈中学习并更新符号规则,将是进一步的研究方向。

Anthropic2个月前原文

## 背景与挑战 随着AI生成内容的泛滥,**Generative Engine Optimization (GEO)** 技术被恶意利用,使虚假信息能够系统性地污染检索系统和LLM推理过程。传统的事实核查方法在面对这种对抗性攻击时,往往缺乏动态证据整合和可解释性。 ## ToE框架:层级化证据推理 最新研究提出了 **Tree of Evidence (ToE)**,一种层级化、可解释的声明验证框架。核心思路是将每条声明建模为一棵**动态扩展的论证树**,通过强化学习驱动的多源检索智能体、证据评估智能体以及论证树聚合算法,迭代地分解、检索和验证声明,形成可解释的证据链。 ### 关键技术亮点 - **动态多源检索**:利用强化学习策略,智能体主动从多个信息源检索证据,并动态调整检索方向。 - **层级化论证树**:将复杂声明分解为子声明,构建树状结构,每个节点代表一个论证步骤。 - **理论误差界**:论文给出了检索过程的正式误差界,保证学习策略收敛到信息论最优策略的邻域内。 ## 性能表现 在多个数据集和骨干LLM上的实验表明,ToE相比竞争基线取得了 **4到24个百分点** 的提升,尤其在对抗性污染的输入上效果显著。这验证了其在对抗AI生成虚假信息方面的鲁棒性。 ## 行业意义 ToE为自动化事实核查提供了一种新的范式:**从静态检索转向动态推理**。它不仅提升了准确性,还通过可解释的证据链增强了信任度,对于新闻验证、社交媒体治理和AI安全具有重要价值。

Anthropic2个月前原文

大型语言模型(LLM)的多智能体系统正被广泛应用于编程协作、研究讨论和商业谈判等场景。一个关键的设计决策是:我们是否应该为不同智能体赋予不同的人格?最新研究论文《多智能体LLM团队中人格组合何时重要?》系统性地回答了这一问题。 ## 研究方法与核心发现 来自亚利桑那州立大学的研究人员通过操控前沿LLM(如GPT-4、Claude等)的**宜人性**人格特质,在三个截然不同的任务领域进行了实验: - **结构化编程**:完成特定的代码里程碑 - **开放研究协作**:自由讨论并产出研究想法 - **竞争性谈判**:模拟商业谈判场景 实验发现,人格效应**高度依赖于任务结构**。 ## 关键结论 在**编程任务**中,即使智能体被提示为低宜人性(即更具对抗性),其沟通风格发生了显著变化——语言更尖锐、更具质疑性——但这种变化**几乎不影响任务完成**。代码的里程碑达成率与高宜人性团队没有显著差异。 然而,在**开放研究协作**和**竞争性谈判**中,同样的低宜人性人格操纵**显著降低了团队绩效**。研究团队发现,对抗性沟通破坏了信息共享和共识建立,导致产出质量下降。 ## 对多智能体系统设计的启示 这一发现对实际应用有重要指导意义: 1. **任务类型决定人格策略**:对于结构化、目标明确的任务(如编码),人格塑造主要是“表面功夫”,不会影响实际产出;但对于需要协作和沟通的开放任务,人格特质会直接影响结果。 2. **人格操纵的局限性**:研究提醒我们,人格提示虽然能改变LLM的语言风格,但这种改变并不总能转化为行为或结果上的差异。在设计多智能体系统时,不应过度依赖人格设定来优化性能。 3. **未来研究方向**:论文指出,除宜人性外,其他人格维度(如开放性、尽责性)是否也会产生类似的任务依赖性效应,值得进一步探索。 ## 行业意义 随着多智能体系统在企业级应用中的普及——例如自动代码审查、团队决策模拟、客户服务协商等——这项研究为工程师提供了**基于证据的设计原则**:在部署前,需根据任务性质评估人格提示的潜在影响,避免“一刀切”式的人格配置。 总之,人格组合在LLM团队中并非无关紧要,但它的影响是有条件的:**任务结构是决定因素**。结构化任务中人格影响有限,而开放式任务中则至关重要。

Anthropic2个月前原文

## 从单打独斗到互联协作:AI模型网络应运而生 随着大模型(LM)的快速普及,训练成本高、部署复杂、模型异构等问题日益突出。业界正从追求“大一统”的通用大模型,转向轻量化、私有化、领域专用的小模型。然而,这些异构模型如何有效交互与协作,成为制约大模型发展的关键瓶颈。 受互联网发展历程的启发,一篇发表于《计算机研究与发展》的论文(arXiv:2606.27382)提出了**世界AI模型网络(AI-ModelNet)**的概念——一个旨在实现模型互联、能力共享与协同推理的新型范式。 ## 互联网的启示:从计算机互联到模型互联 互联网的核心价值在于“共享与协作”,它让孤立的计算机连接成网络,从而释放了巨大的价值。论文作者类比指出:当前大模型的发展正处于类似“计算机孤立”的阶段——每个模型都是能力孤岛,无法高效调用其他模型的能力。AI-ModelNet的目标就是为AI模型构建一个“互联网”,让模型之间可以像网页一样相互链接、调用和协同。 ## AI-ModelNet:系统架构与可行性验证 论文提出了AI-ModelNet的**分层架构**,包括模型表示层、路由发现层、协同推理层等,并定义了模型间通信协议与能力描述标准。作者还构建了原型系统,通过多个应用案例(如跨模型知识问答、多模型联合推理)验证了框架的可行性。初步实验表明,AI-ModelNet能够有效降低单模型部署成本,同时提升复杂任务的完成质量。 ## 未来研究方向 论文最后讨论了几个关键未来方向: - **模型路由与发现机制**:如何高效定位并调用合适模型? - **协同推理的优化**:多模型协作时如何平衡延迟与精度? - **安全与隐私**:模型间通信如何防止数据泄露? - **标准化与生态建设**:需要统一协议与模型注册规范。 ## 小结 AI-ModelNet的提出,标志着AI模型从“单点智能”向“网络智能”迈出了重要一步。正如互联网改变了计算机的使用方式,模型网络或许将重塑AI应用的落地形态——让每个模型都能发挥其专长,并通过协作实现“1+1>2”的效果。

Anthropic2个月前原文

大型语言模型(LLM)智能体在序列决策中展现了强大能力,但在长周期任务中仍本质上是“反应式”的——它们缺乏人类那种在行动前就进行“假设推演”的能力。最新arXiv论文《Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning》提出了一种全新的训练范式,旨在让LLM智能体“内化”一种内部世界模型,从而能够像人类一样模拟未来结果并据此规划。 ## 核心挑战:格式与能力的错位 研究者指出,现有方法尝试通过在后训练阶段让模型模仿“前瞻性轨迹”来学习规划,但这往往流于表面——模型只是机械地复现了“先预测再行动”的文本格式,却并未真正具备预测未来的因果能力。作者将这种现象称为 **“格式-能力鸿沟”**:模型学会了说话的格式,却没有学会预测的能力。 ## 解决方案:三阶段训练范式 为了弥合这一鸿沟,论文提出了一套 **三阶段训练流程**: 1. **世界模型智能体中期训练(WM-AMT)**:首先通过专门的中期训练,向策略网络中注入潜在的预测能力。这一阶段不强调输出格式,而是专注于让模型学会在隐空间中模拟状态演化和结果评估。 2. **格式引出监督微调(FE-SFT)**:在能力已初步具备的基础上,通过监督微调将这种内化能力“引出”为结构化的文本输出——包括对未来状态的逐步描述以及类似Q值的计划成功估计。 3. **前瞻条件强化学习(FC-RL)**:最后,利用强化学习对生成的模拟进行校准,使其预测更加准确、实用,并提升规划决策的整体效用。 ## 实验验证与意义 在搜索和数学推理两类任务上,该方法显著优于各种基线。结果表明,要让LLM智能体真正拥有“世界模型”,关键在于先构建预测能力,再赋予其输出格式——顺序不能颠倒。 这一研究不仅为智能体规划提供了一条新路径,也提示我们:**语言模型的“思考”与“输出”之间,存在需要刻意设计的桥梁**。未来,具备内化世界模型的智能体或将在机器人控制、自动化科研、复杂游戏策略等领域展现出更接近人类的规划能力。

Anthropic2个月前原文

arXiv:2606.27593v1 Announce Type: new Abstract: We introduce a categorical framework called ODYSSEY for constructing verifiable, local truth-preserving foundation models as compositions of foundries: building-block architectural components that specify a cover of local contexts, local representation families, restriction maps, gluing rules, obstruction policies, update obligations, and human-facing views. A foundry is an organized sheaf of knowledge that carries within it an argumentation compon

Anthropic2个月前原文

阅读障碍学习者正越来越多地使用AI工具来辅助阅读、写作、组织和学习任务,但他们在实际使用中的真实体验却鲜少被系统研究。为此,研究人员提出了 **DysLexLens**——一个低资源大语言模型(LLM)框架,专门用于通过在线论坛讨论分析阅读障碍学习者与AI交互的体验。 ## 框架设计:端到端、可溯源 DysLexLens 被设计为端到端、证据可溯的架构,能够将嘈杂的社交媒体帖子转换为词典驱动的语料库,提供基于知识图谱(KG)的查询推理,生成可验证的响应,并通过定量和人工评估进行质量检验。 ## 四大核心特性 1. **词典驱动过滤**:通过自定义词典精准筛选 Reddit 上与阅读障碍和AI相关的帖子,剔除噪声和弱相关内容,提升低资源论坛数据采集的针对性。 2. **LLM语义分析与KG推理结合**:利用LLM进行语义理解,同时结合知识图谱进行结构化查询推理,从而挖掘有意义的模式。 3. **定量评估指标**:引入 **RAGAS**(检索增强生成评估)和 **查询鲁棒性** 指标,客观衡量LLM生成响应的性能。 4. **定性验证指南**:提供结构化的人工评估标准,重点检查幻觉(hallucination)和证据对齐程度,确保响应质量。 ## 实验验证与通用性潜力 研究团队使用 Reddit 论坛上关于阅读障碍的帖子数据,并设计了30个问题来测试 DysLexLens。结果表明,该框架能有效分析阅读障碍学习者的AI使用体验,并展现出良好的通用性——可迁移至其他低资源论坛数据场景。 ## 开源与可复现 为支持学术可复现性,DysLexLens 的代码、样本数据、问题集及评估结果已全部公开在 GitHub 上。 ## 行业意义 当前,AI辅助工具在特殊教育领域的应用日益广泛,但针对特定学习障碍群体的用户体验研究仍属空白。DysLexLens 提供了一种低成本、可扩展的方法,帮助研究者从社区讨论中提取真实反馈,从而指导更包容的AI工具设计。该框架的低资源特性也使其特别适用于数据稀缺的小众领域。

Anthropic2个月前原文

在人工智能领域,让模型“思考”再回答,通常被认为能提升准确性。但最新研究却给出了一个反直觉的结论:对于多模态情感识别(MER)任务,显式推理未必带来更高的准确率,有时甚至不如直接给出答案。 来自多家机构的研究团队近日在 arXiv 上发布了论文 **《MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy》**,系统性地揭示了这一现象并提出了解决方案。 ### 快思考 vs 慢思考:各有千秋 研究团队基于推理型多模态大语言模型(MLLMs)进行实验,发现两种回答模式存在显著差异: - **快思考(Fast Thinking)**:直接触发模型输出答案,不经过显式推理链。这种方式在**召回率(Recall)** 上表现更好,预测范围更广且置信度更高,能够捕捉到更多潜在的情绪信号。 - **慢思考(Slow Thinking)**:让模型先进行逐步推理,再给出最终答案。这种方式更注重**精确率(Precision)**,通过保守地过滤掉错误类别来提升预测的准确性,但可能遗漏正确情绪。 两种模式本质上是**召回率与精确率的权衡**:快思考擅长“广撒网”,慢思考擅长“精筛选”。传统的做法往往需要牺牲一方来换取另一方,难以两全。 ### MER-R1:强化学习框架实现双目标解耦 为了融合两者的优势,团队提出了**MER-R1**,一个基于强化学习的框架。其核心创新在于: 1. **双目标解耦(Dual-objective Disentanglement)**:将召回率和精确率分离为两个独立的优化信号,让模型可以同时优化两者,而不是非此即彼。 2. **慢-快置信度校准(Slow-Fast Confidence Calibration)**:通过将慢思考的最终答案与快思考的直觉对齐,增强正确情绪的置信度,同时抑制错误情绪。 通过这种方式,MER-R1 成功统一了快思考的“直觉性召回”与慢思考的“选择性精确”,让模型既能广泛捕捉情绪线索,又能精准输出结果。 ### 理论支撑与实验验证 研究团队还从理论上证明了这种协同机制的有效性:它能够减轻优化过程中由于方差引起的干扰,使训练更加稳定。 在 **MER-UniBench** 和 **MME-Emotion** 两个基准测试上,MER-R1 均取得了当前最优(SOTA)性能。更重要的是,它让推理过程真正为情感识别带来了增益,而非仅仅增加可解释性。 ### 意义与展望 这项研究为多模态情感识别提供了一个新范式:**不盲目依赖推理链,而是根据任务特性动态整合快慢两种思维模式。** 对于实际应用——如人机交互、情感计算、心理健康监测等——MER-R1 有望在保持高精度的同时提升召回率,减少漏判。 未来,团队计划探索该方法在更多多模态任务上的泛化能力,并进一步优化推理效率。

Anthropic2个月前原文