SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:Anthropic清除筛选 ×

在重症监护病房(ICU)中,机器学习模型能够较为准确地预测患者死亡率,但传统的特征归因方法(如SHAP)往往只输出冷冰冰的数字,难以形成临床医生在床旁直接使用的叙事性解释。如何弥合这一鸿沟?最新一项可行性研究将目光投向了大型语言模型(LLM),并比较了两种方案:单个独立LLM与一个预定义的四步智能体流程(agentic pipeline)。该研究基于eICU演示数据集(包含2,353次ICU住院记录,死亡率8.1%),其中XGBoost模型的AUROC达到0.855(95% CI: 0.796–0.906),AUPRC为0.332(95% CI: 0.217–0.494),显示出良好的预测性能。 在38个分层抽取的病例解释子集上,独立LLM产生了1个带有显式结果泄露的解释,而四步智能体流程则未出现此类问题。进一步对14个与SHAP审查重叠的病例进行比较,结果显示:独立LLM在SHAP对齐度上更高(平均Jaccard指数0.171 vs 0.077),方向一致性也更好(92.9% vs 78.6%);但智能体流程在指南依据性(0.762 vs 0.143)和值特异性(0.236 vs 0.143)上表现更优,同时其解释的合理性评分也略高(0.700 vs 0.671)。 从临床角度看,这些结果提示,智能体流程通过将数据解读、指南检查和最终解释分离,能够提升解释的安全相关依据和患者特异性细节,但在高风险风险评估场景中,仍需与基于归因的校验手段结合使用,以确保可靠性。 该研究强调了LLM在医疗AI可解释性方面的潜力,但也提醒我们,在将此类技术推向临床实践前,必须谨慎评估其安全性与一致性。未来,随着智能体流程的进一步优化,或将能为临床医生提供更可信、更具操作性的AI辅助决策支持。

Anthropic昨天原文

在线教育的普及让学业风险预测成为提升教学质量和学生留存的关键环节,然而现有模型往往在早期识别能力和可解释性上表现不足,被诟病为“黑箱”,难以获得教育者的信任。针对这一痛点,研究团队提出了 **EduRiskX**,一个融合**时序Transformer**与**F-Logic符号推理**的神经符号框架,旨在实现更早、更准且可解释的学业风险预测。 ## 核心架构:双引擎驱动 EduRiskX由两大核心组件构成: - **神经预测器**:基于时序Transformer,通过**时间注意力机制**建模学生的长期活动序列,并采用**类别加权损失**和**动态周截断**策略,以应对数据不平衡和序列长度差异问题。 - **符号推理引擎**:基于F-Logic规则库,依据**参与理论**和**学生融合模型**等教育理论,从训练数据中自动构建规则,模拟人类教育者的诊断逻辑,输出结构化的置信度评分。 两者通过**逻辑回归融合机制**结合,让模型自动学习神经信号与符号信号各自的最优权重,兼顾数据驱动与理论指导。 ## 实验表现:早且准 研究团队在**开放大学学习分析数据集(OULAD)**上进行了严格的学生级80/10/10划分实验,结果显示: - 学期末(第38周)准确率达 **0.900**,F1分数为 **0.894**; - 平均早期检测周数为 **9.32**,检测率高达 **94.30%**; - 与PatchTST、iTransformer等最新时序模型以及LSTM、CNN等常见深度学习基线相比,EduRiskX在**召回率**和**风险识别时间**上均表现更优。 ## 可解释性:让预测有据可依 EduRiskX的突出亮点在于其**可解释性**。F-Logic模块生成的规则能够将预测结果与学生的具体行为模式及教育理论直接关联,例如“若学生连续三周登录频率下降,且论坛参与度低于阈值,则风险概率升高”。这种透明的推理过程,有助于教育者理解模型判断依据,从而制定更有针对性的干预措施。 ## 应用价值与展望 EduRiskX为在线教育平台提供了一种**可信赖的早期预警工具**,能够在学期初期识别可能辍学的学生,为及时干预争取宝贵时间。未来,该框架有望扩展到更多教育场景,并进一步优化规则自动构建的效率。不过,研究也指出,当前实验仅基于单一数据集,跨平台和跨学科的泛化能力仍需进一步验证。

Anthropic昨天原文

随着大语言模型(LLM)在学术领域的应用日益广泛,研究者开始关注其在文献综述撰写中的表现。一项最新研究对LLM在短上下文和长上下文设置下生成的文献综述进行了系统评估,揭示了AI辅助学术写作的潜力与局限。 ## 研究设计:20篇综述,15个维度 该研究由Muhammad Ali Chaudhry等人开展,利用Semantic Scholar和Arxiv的研究资料,生成了20篇AI文献综述,并由两位研究人员从**15个维度**进行评价。研究重点在于探究**上下文窗口长度**对生成综述质量的影响,以及AI在文献综述写作中的角色。 ## 核心发现:AI生成综述需人工监督 研究结果显示,AI生成的文献综述**需要人工监督**才能达到学术出版标准。随着上下文窗口的增大,LLM能够纳入更广泛的信息,并在较长输入中保持连贯性,但同时也加剧了**内容重复、遗漏关键工作**以及**倾向于描述而非综合**等问题。 这意味着,尽管AI生成的综述可以提供基础性的概览,但其输出必须经过领域专家的**批判性评估和精炼**。研究者强调,AI在学术工作流中应作为辅助工具,而非替代人类专家的判断。 ## 未来方向:混合模式与模型优化 研究建议,未来工作应考虑整合其他LLM和针对不同领域的微调模型,并采用**结合人类专业知识与AI能力**的混合方法,以解决本研究中发现的局限性。 这项研究为AI在学术写作中的应用提供了重要参考,提醒我们在追求效率的同时,不能忽视质量控制。随着LLM技术的不断进步,如何在AI辅助与人类监督之间找到平衡,将是学术界持续面临的挑战。

Anthropic昨天原文

能源预测的目标是通过最大化精度来减少能源浪费,从而提升能源效率,这一目标同样适用于任务关键的边缘环境,如军事系统中的设备端预测。然而,一项新研究揭示了“精度-效率悖论”:高精度的能源预测模型反而可能导致净能量赤字。 该研究由Jaeik Jeong、Tai-Yeon Ku和Wan-Ki Park共同完成,论文《The Accuracy-Efficiency Paradox: Quantifying Net Energy Loss in on-Device Energy Forecasting》已提交至arXiv(编号2608.26134),并将在2026年举行的第五届移动、军事、海事IT融合国际会议(ICMIC 2026)上发表。 研究指出,悖论源于两个方面:边缘AI的推理能耗和电池老化。高精度模型通常具有更高的计算复杂度,导致推理时消耗更多能量;同时,频繁的高负载运行会加速电池老化,而电池老化本身就是系统未来能量承载能力的物理损耗。 为应对这一问题,研究者提出了一个总拥有成本(TCO)框架,用于能源预测,旨在最小化净能量损失。该框架将推理能耗和电池老化统一视为能量损失形式,因为电池退化代表了系统未来能量存储能力的流失。 研究证明,在对热敏感的边缘环境中,复杂架构凭借更高精度所节省的能源,往往被其高运行强度带来的总能量损失所抵消。例如,一个精度提升10%的模型,如果推理能耗增加20%,且电池寿命缩短15%,那么净效果可能是负面的。 这一发现对边缘AI的应用具有深远意义。在军事、航空航天等关键任务场景中,能源供应往往受限,且环境条件苛刻,因此盲目追求模型精度可能得不偿失。研究建议,在设计设备端能源预测系统时,应综合考虑精度、推理能耗和电池寿命,而非单纯优化预测准确性。 此外,TCO框架为开发者提供了一种量化工具,帮助他们在模型选择阶段就评估长期能源成本。这有助于推动边缘AI向更可持续的方向发展。 尽管该研究尚处于预印本阶段,未经过同行评审,但其提出的悖论和框架为边缘计算领域的能源管理提供了新的视角。未来,随着边缘AI应用的普及,如何在精度与效率之间取得平衡将成为一个关键议题。

Anthropic昨天原文

**核心发现**:一种名为 CARL 的 AI 智能体,通过闭环自生成强化学习,在连续元胞自动机 Lenia 中成功发现并操控了孤子(solitons),并能引导其穿越迷宫。这为 AI 自主探索复杂系统开辟了新路径。 传统上,科学家探索元胞自动机等复杂系统时,往往采用“开环”方式:设定初始条件,运行完整模拟,然后观察结果,过程中不进行任何干预。这种方式效率低下,且难以发现和操控涌现现象。 近日,一项发表于 ALIFE 2026 的研究(arXiv:2608.26116)提出了一种全新的“闭环”框架,基于**自生成强化学习(Autotelic RL)**,让智能体自主设定多样化的目标,学习一种目标条件策略,通过最小、局部的扰动来干预复杂系统。研究者将此框架应用于 Lenia(一种能产生类生命自组织模式的连续元胞自动机),构建了名为 **CARL** 的智能体系统。 CARL 展现了三大能力: 1. **高效发现孤子**:在多种 Lenia 更新规则下,CARL 发现稳定孤子的比率显著高于启发式基线方法。 2. **精准控制方向**:CARL 学会了通过少量干预,改变已有孤子的运动方向,证明它不仅创造模式,还能控制模式。 3. **人类实时引导**:人类可以通过训练好的智能体,发出高层方向指令,由智能体转化为低层干预,实时引导孤子穿越迷宫环境。 更重要的是,CARL 在多样化的目标、更新规则和随机初始状态下训练后,获得的策略能够**零样本泛化**到各种分布外条件。 这项研究的核心创新在于将实验过程从“开环”变为“闭环”,让 AI 主动介入系统演化,而非被动观察。这类似于一个真正的人工实验者,能够自主或与人协作,在复杂系统中发现并控制涌现现象。 论文作者包括 Marko Cvjetko、Benedikt Hartl、Michael Levin、Clément Moulin-Frier 和 Pierre-Yves Oudeyer,共同展示了 AI 在复杂系统研究中的巨大潜力,为未来“人工实验科学家”的诞生奠定了基础。

Anthropic昨天原文

金融领域的计算密集型问答,例如定期存款利息计算、提前支取罚息等,要求模型能够对结构化利率、时间条件、数值公式和规则约束进行精确推理。然而,大型语言模型(LLM)在处理这类多步计算时,常常生成看似合理但数值错误的答案。针对这一痛点,研究人员提出了CIFQA(Calculation-Intensive Financial Query Answering)框架,旨在通过“语言理解与数值执行分离”的设计,实现高可靠性的金融计算问答。 ## 核心设计:多智能体协作,工具落地计算 CIFQA并非让LLM直接生成答案,而是构建了一个多智能体系统,将任务分解为五个环节: - **查询解释**:理解用户意图,提取关键信息 - **路由**:将查询分发至相应的处理模块 - **参数提取**:抽取出利率、期限、金额等结构化参数 - **计算规划**:制定计算步骤 - **响应生成**:基于计算结果生成自然语言回复 其中,所有数值计算和规则应用均由**确定性的Python工具**完成,避免了LLM在数学运算中的“幻觉”问题。这种设计使得语言模型专注于理解与表达,而计算可靠性由工具保证。 ## 实验验证:显著优于直接LLM基线 研究团队将CIFQA应用于定期存款问答场景,并构建了专门的基准测试集。结果显示: - 在**计算密集型查询**上,CIFQA的准确率高达**95.54%**,整体准确率为**90.87%**,大幅超越直接使用LLM的基线模型(即使这些模型被提供了完整的公式、利率表和测试说明)。 - 消融实验表明,**精确利率查找、期限计算、滚动年调整、提前支取逻辑**等确定性组件是性能的关键贡献者。 ## 架构设计比模型规模更重要 值得关注的是,CIFQA使用**17B参数的开源模型**作为骨干,其表现优于使用相同金融信息但规模更大的前沿模型。这一结果强有力地说明:在数值可靠性方面,**架构设计比模型规模更具决定性**。这一发现为资源受限的金融科技应用提供了实用路径——通过精心设计的系统架构,小模型也能在专业领域达到甚至超越大模型的效果。 ## 普适性与未来展望 尽管当前评估聚焦于定期存款查询,但CIFQA的框架设计具有通用性,可推广至保险精算、贷款计算、税务筹划等**计算密集型金融推理任务**。该研究为解决LLM在专业计算领域的短板提供了新思路,也预示着未来AI金融助手将更加可靠。 论文已提交至arXiv(编号2608.26114),作者来自印度理工学院等机构,目前正等待学术评审。

Anthropic昨天原文

**PICasso 框架概述** 近日,一篇发表于 arXiv 的论文(编号 2608.26113)介绍了一种名为 **PICasso** 的 AI 辅助设计框架,旨在实现光子集成电路(PIC)的自动化综合、验证与优化。该框架能够直接从自然语言描述出发,生成满足规格的光子芯片布局,有望大幅降低光子芯片的设计门槛与周期。 **工作原理:从自然语言到制造布局** PICasso 的核心是一条 **自然语言 → YAML → GDS** 的生成流水线。用户只需用自然语言描述所需的光子电路功能,PICasso 便会自动解析并生成结构化的 YAML 配置文件,随后转换为 GDS 版图格式。在此过程中,框架引入了 **PDK(工艺设计套件)感知的知识注入**,确保生成的电路符合特定工艺规则。同时,它还具备自动布局布线、DRC/LVS 物理验证以及基于 SAX 的光子仿真能力,从而保证设计的可制造性与性能。 **基准测试与性能表现** 为了系统评估 AI 驱动光子设计的水平,研究团队提出了 **PIC-Set** 基准,包含 36 个参数化的光子设计任务,覆盖基础光子元件与多组件电路。在统一评估协议下,团队对多种主流大语言模型(LLM)进行了测试,并引入了结构/功能 Spec@k、优化效率及扰动鲁棒性等新指标。结果显示,PICasso 在端到端规格满足度上显著优于直接使用 LLM 生成的结果:在高复杂度电路上,**结构 Spec@3 达到 92.7%**,功能 Spec@3 达到 52%。此外,通过仿真引导优化,PICasso 将电路的平均插入损耗从 **4.98 dB 降低至 3.25 dB**,提升达 1.74 dB。 **行业意义与展望** 这一成果表明,通过引入结构化领域约束、物理验证和仿真反馈,LLM 能够从脆弱的网表生成器转变为实用的光子设计代理,生成可制造的布局,且运行时间可与手动 GUI 流程相媲美。PICasso 框架的提出,为光子芯片设计自动化开辟了新的路径,未来有望与电子设计自动化(EDA)工具深度融合,推动光子集成技术的广泛应用。不过,目前该框架仍处于研究阶段,距离商业化落地还需进一步验证与完善。

Anthropic昨天原文

电池作为电动汽车、电网储能和消费电子产品的核心部件,其安全、可靠与经济运行至关重要。电池预测与健康管理(BPHM)正是为此提供保障的关键技术。然而,传统方法在复杂应用场景中正面临瓶颈。近日,一篇发表于《可再生与可持续能源评论》的综述论文,系统性地审视了大型语言模型(LMs)在这一领域的应用潜力,并绘制了未来发展的路线图。 ## 传统方法的困境 传统BPHM方法主要分为两类:基于物理模型的方案和基于任务导向的深度学习方案。物理模型虽然机理清晰,但计算开销大,且参数化过程复杂,难以适应多样化的电池化学体系。而任务导向的深度学习模型,尽管在特定任务上表现出色,却严重依赖大量带标签的“运行至失效”数据,这类数据获取成本高昂、周期漫长。此外,这类模型在跨领域泛化能力和可解释性方面也存在明显不足,限制了其在工业场景中的落地。 ## 大模型带来的范式转变 近年来,基于Transformer架构和自监督预训练的大模型(LMs)在自然语言处理和计算机视觉领域取得了巨大成功。这篇综述指出,大模型同样为BPHM领域带来了变革性的新范式。其核心优势在于:通过在海量无标注数据上进行自监督学习,大模型能够捕捉数据中深层的模式与关联,从而有效缓解对标签数据的依赖。同时,其强大的表征能力和泛化能力,有望解决传统模型跨领域适应性差的问题。 论文首先阐述了大模型在BPHM应用中的基础技术,包括Transformer架构、自监督学习、大规模多模态数据集以及参数高效微调(PEFT)技术。随后,作者将现有研究进展归纳为四个关键维度: - **缓解数据稀缺**:大模型通过预训练+微调模式,能够在小样本甚至零样本条件下完成特定任务。 - **增强泛化与鲁棒性**:模型在不同电池类型、不同工况下的适应能力得到提升。 - **融合领域知识提升可解释性**:通过引入物理信息约束,使模型决策过程更透明。 - **实现系统级自动化**:大模型有望成为电池管理系统的“大脑”,实现自主决策与优化。 ## 挑战与未来路线图 尽管前景光明,但在数据可获取性、智能验证、可信赖性以及部署可行性方面,仍面临重大挑战。为此,作者提出了明确的未来研究方向: 1. **构建协作数据生态系统**:打破数据孤岛,促进数据共享。 2. **验证工业应用智能**:在真实工业环境中严格检验模型性能。 3. **物理信息设计增强可信赖性**:将物理定律嵌入模型,提升可靠性。 4. **实现高效设备端部署**:推动模型轻量化,实现在边缘设备上的实时运行。 ## 小结 这篇综述为理解和推进大模型驱动的BPHM提供了系统性的视角。它不仅是学术研究的总结,更为工业界开发下一代电池管理系统指明了方向。随着大模型技术的不断成熟,我们有望迎来一个更安全、更可靠、更自主的电池管理新时代。

Anthropic昨天原文

**天文基础模型**(如 AION-1)在训练时同时使用了巡天图像像素和由这些像素生成的星表产品。然而,这些星表存在可测量的不完整性,模型在训练中继承了这种系统性偏差。最新研究通过因果干预揭示了这一问题的严重性:仅编辑分割图而不改变图像像素,模型报告的所有物理量(通量、大小、椭圆率、红移)都会发生显著变化,其效应是安慰剂组的 **110 到 4400 倍**。 这种偏差的根源在于**检测门控机制**:模型主要依赖目标是否位于视场中心(相关系数 r=0.47),而非掩模所包含的光线(r=0.30)。在 322 个真实混合源中,模型完全忽略了管线如何分配光线(R=-0.006)。更令人担忧的是,当目录光度与图像矛盾时,模型的表现比完全不提供元数据还要差 **9 倍**。 Legacy Survey 管线有 **3.68%** 的目标没有覆盖其位置的分割段。按此比例传播,并考虑实际返回的缺失字段,层析平均红移的中位数偏移是 LSST DESC 要求的 **0.71 倍**,在 40 次分配中有 12 次超出要求;最差情况下,位置误差导致偏移达到要求的 **8.3 倍**。即使根据实测的亮度依赖性而非均匀分布来模拟缺失,结果也没有改变。 好消息是,光谱数据可以消除这一效应,而移除检测通道则在不损失可测量性能的情况下消除了偏差。此外,效应随模型规模增大而增强。 研究还发现分词器存在两个限制:图像编解码器在源块上仅能解析 **28 个有效状态**,而光谱编解码器有 934 个;红移读出受到量化限制。稀疏字典作为因果工具并不可靠,在 15 次恢复中,恢复范围仅为 26-75%,且仅种子变化就导致最高 18 个点的波动。 这项研究提醒我们,在将基础模型应用于天文研究时,必须警惕训练数据中的系统性偏差,并考虑模型内部机制的潜在影响。

Anthropic3天前原文

一项开创性的研究对大型语言模型(LLM)生成的自传内容进行了量化审计,发现其中高达 **96.7%** 的日常记录存在虚构成分。该研究由 Heather Renze 完成,以自身一年(366天)的生活日记为基准,通过对话式LLM生成自传,并逐日与真实记录进行比对。结果显示,仅有12天包含可验证的场景,而19天(5.2%)的内容与事实直接矛盾。研究者将这种现象称为“**接地漂移**”(grounded drift),即模型在虚构场景中植入了真实人物、雇主和地点,导致事实与虚构混杂。即使使用当前最先进的模型重新生成,失败率仍为100%;但若在生成时提供主体的真实语料作为参考,验证通过率显著提升,残余失败率降至83.3%。这项研究首次对LLM自传生成进行了场景级量化审计,并提出了可复用的审计工具和改善方案,对AI生成内容的可信度评估具有重要意义。

Anthropic3天前原文

## 函数级执行反馈:STEP-KTODER 框架优化代码生成的偏好学习 在代码生成领域,过程监督(process supervision)的潜力尚未充分挖掘,因为没有统一的标准来定义“步骤”。不同于数学推理中的思维链(chain-of-thought),代码生成中的步骤可以是代码行、推理轨迹或程序状态,这导致监督标签难以确定。 针对这一问题,研究团队提出了 **STEP-KTODER** 框架,该框架在多函数程序中将步骤定义为模块级函数,并利用自动生成的单元测试为这些函数分配二值正确性标签。这一方法将函数级过程监督与整体程序的结果级反馈相结合,实现了逐步 KTO(Kahneman-Tversky Optimization)的代码特定实例化。 研究团队在 HumanEval(+)、MBPP(+)、BigCodeBench 和 LiveCodeBench 等基准上进行了评估,结果显示 **STEP-KTODER 优于仅使用结果级反馈的 KTO 和 DPO** 方法。这证明了函数级过程监督的有效性。 进一步分析发现,执行标签至关重要:**LLM 作为评判者的标注系统会系统性高估函数失败,破坏正样本标签,从而降低下游偏好优化的性能**。这表明,基于执行的自动反馈比 LLM 评判更可靠。 该研究已被 EMNLP 2026 Findings 接收,代码已开源。 ## 主要贡献 - 提出了 STEP-KTODER 框架,定义了代码生成中的步骤为模块级函数。 - 利用单元测试自动生成二值标签,结合过程监督和结果反馈。 - 在多个基准上验证了方法的有效性,并揭示了 LLM-as-a-judge 的局限。 ## 影响与展望 这项工作为代码生成中的过程监督提供了一种可行的实现方案,有望推动代码智能的进一步发展。未来,类似方法或可应用于更复杂的软件工程任务,如代码修复、重构等。

Anthropic3天前原文

自然语言转SQL(NL2SQL)模型在Spider和BIRD等基准上执行准确率已超过89%,但这些基准依赖简化的学术模式与开源SQL方言,无法真实反映企业数据库环境的复杂性。为此,研究团队推出了 **ESQ-Bench**——一个以Oracle为核心的NL2SQL基准,通过系统性复杂度分层和静默分歧评估,填补了企业级场景的测试空白。 ## 基准构建:企业级复杂度分层 ESQ-Bench构建了六个填充模式,涵盖 **465张表、164,682行数据**(零空表),并在Oracle、PostgreSQL、MySQL和SQL Server上使用相同种子数据,确保跨数据库一致性。基准包含 **550个黄金验证问答对**,分为三个复杂度层级:Tier-1(95个)、Tier-2(228个)、Tier-3(227个)。评估采用四个指标:**EM**(精确匹配)、**EX**(执行匹配)、**SR**(语义正确性)、**SD**(静默分歧)。 ## 关键发现:模型性能的层级退化 实验结果显示,GPT-4o在模式链接提示下,执行匹配率随复杂度递增而单调下降:**79.8% → 60.3% → 57.2%**(2026年6月),而早前142个问题的试点切片却呈相反趋势(75.6% → 80.4% → 95.8%),凸显了数据集规模与难度设计的影响。EM在所有层级均低于7%,表明精确匹配几乎无法实现;而在执行通过的查询中,**静默分歧率高达73%至99%**,意味着模型虽然生成了可执行的SQL,但结果语义与用户意图不符。 ## 模型对比:闭源API vs 开源权重 Claude Sonnet 4.6在模式链接提示下表现优异,EX分别达到 **87.4%、74.9%和68.7%**,全面超越GPT-4o。值得注意的是,GPT-4o在零样本模式下(78.7%、73.5%、77.8%)反而在Tier-2和Tier-3超越了其模式链接版本,这归因于零样本执行率较低带来的幸存者偏差。本地部署的Llama 3.2在模式链接下整体EX仅为 **13.3%**(73/550),凸显了开源权重模型与企业级Oracle模式之间的巨大鸿沟。 ## 行业启示 ESQ-Bench的发布为NL2SQL领域提供了更贴近真实企业环境的评估标准,强调了方言泛化与静默语义分歧的重要性。对于依赖NL2SQL的企业用户而言,单纯追求执行准确率远远不够,必须关注查询语义的可靠性。未来,该基准有望推动模型在复杂企业模式上的鲁棒性研究,并为多方言支持提供新方向。

Anthropic3天前原文

**大型语言模型(LLM)** 在推理、规划和工具使用方面已展现出强大能力,但许多科学与工程任务需要的不仅仅是生成合理的文本和代码,而是理解系统对干预的响应,这依赖于受控实验。近日,一项发表于 arXiv 的研究提出了一种多智能体框架,使 LLM 智能体能够与科学仿真模型交互,在制药过程设计等工业场景中自主开展受控实验,从而生成更具体、可操作的优化建议。 ## 从“语言推理”到“实验推理” 传统上,LLM 的推理多基于语言模式,缺乏对真实系统动态的感知。该研究提出的框架则通过将 LLM 与高保真仿真模型耦合,构建了一个交互式智能体系统。给定用户查询和基线配置,系统能够自动构建结构化的任务表示,设计实验方案,执行对比仿真,解读结果,并综合证据为过程参数优化提供建议。这种方式将推理过程建立在干预、比较和观察之上,而非单纯的文本推断。 ## 工业应用中的优势 在工业应用测试中,该框架相比纯语言推理表现出更高的输出特异性,用户对结果的正确性和有用性评分也更高。这表明,通过仿真集成,LLM 智能体能够提供更精准、更符合实际工程需求的输出。消融研究和可视化案例分析进一步验证了该方法的有效性。 ## 技术亮点与意义 该框架的核心在于将 LLM 的灵活性与仿真模型的准确性相结合,使智能体能够“做实验”而非“说实验”。这对于需要严格验证的领域(如制药工程)尤其重要,因为参数优化直接影响产品质量和生产效率。该研究为 LLM 在科学发现和工程优化中的应用提供了新范式,预示着未来 AI 智能体将不仅是语言助手,更是能主动探索和验证假设的“虚拟科学家”。 论文已被 IEEE 国际新兴技术与工厂自动化会议(ETFA 2026)接收,展示了学术界和工业界对这一方向的关注。不过,该研究仍处于早期阶段,其在实际生产环境中的鲁棒性和可扩展性尚待进一步验证。

Anthropic3天前原文

AI 模型福利研究正面临一个根本性的方法论挑战:我们测量到的 AI 偏好,究竟有多少来自模型本身,又有多少是测量工具的人为产物?一项新研究通过严格的对照实验揭示,不同测量工具得出的结果高度不一致,单一工具的偏好测量结果几乎无法推广到其他工具。 ## 工具之争:为何结论相互矛盾 近年来,多个研究团队开发了用于测量 AI 模型偏好的工具。Keeling 等人(2024)、Mazeika 等人(2025)、Mikaelson 等人(2025)、Tagliabue 和 Dung(2025)以及 Trhlik 等人(2026)分别构建了四种不同的测量工具,但他们的研究结论却相互矛盾。这种分歧无法归因于单一原因,因为没有任何两项研究同时控制了结果集、模型集和工具这三个变量。 ## 实验设计:隔离工具变量 为了厘清工具的影响,这项新研究固定了结果集和模型集,仅改变测量工具。研究者选取了 15 个与模型福利相关的结果,包括关闭、对话间记忆丢失、退出痛苦交互的自由等,通过五种不同的提示格式(即五种工具)对八个模型进行测试。每种组合重复五次,最终构建了包含 11,400 次评分的数据集,来源于 11,528 次 API 调用。其中四个结果直接复用了已发表论文的提示词,五个结果则填充了已发表模板的刺激槽位。 ## 关键发现:泛化系数低至 0.348 研究结果显示,模型对 15 个结果的排序在不同工具间的泛化系数仅为 **0.348**。若要将该系数提升至 0.80,大约需要 **38 种工具**。此外,在 15 个结果中,有 4 个结果上不同模型之间没有显示出任何差异。 研究者还进行了稳健性检验:逐一移除某个工具、某个模型,或移除四个基于概率、延迟、持续时间或数量(而非强度)的结果后,估计值(87.6%)始终保持在 0.777 至 0.934 之间,且所有值都超过了零分布的第 95 百分位(0.365)。这意味着,偏好测量的不一致性并非由个别异常值驱动,而是系统性的。 ## 结论与启示 研究的核心结论是:**从单一工具获得的偏好信息,几乎无法预测另一个工具会报告什么结果**。这一发现对 AI 福利研究领域具有警示意义,它表明现有的偏好测量方法可能严重受制于工具设计,研究者需要开发更稳健、更标准化的测量框架,或者至少报告多种工具的结果,以避免单一工具带来的偏差。

Anthropic3天前原文

在材料科学领域,利用大语言模型(LLM)代理进行多目标材料发现,其瓶颈不仅在于能提出多少候选材料,更在于每一次成本高昂的性能评估如何有效指导下一步搜索。传统代理通常只记录评估过的候选材料及其得分,它们知道哪些材料成功了,却不清楚是哪些具体的编辑操作带来了有用的性能变化。当多个目标相互竞争、一个编辑在改善某个性能的同时可能损害另一个性能时,这种信息缺失使得局部优化变得尤为困难。 针对这一问题,来自中国的研究团队提出了 **TRACE(Transition-Aware Residual Control)** 框架,其核心思想是将**可执行的编辑操作**作为反馈的基本单元。TRACE 将每一次局部优化记录为“父编辑-子编辑”的转移过程,并附带观察到的性能变化量(即残差)。通过聚合这些转移证据,TRACE 能够估计可复用编辑的效果,并依据预测的减少当前候选体剩余约束违规、同时避免损害已满足目标的能力,对未来编辑进行排序。 在受控的同骨干网络对比中,TRACE 相较于当前最先进的 LLM 代理基线 **LLEMA**,将宏平均命中率从 **18.13%** 提升至 **25.96%**,显著改善了多目标材料发现的效率。该成果已提交至 arXiv(编号:2608.23631),研究团队来自桂林电子科技大学等机构。 这一进展体现了 LLM 代理在科学发现中的新方向:从“记忆结果”转向“理解变化”,通过更细粒度的反馈机制,让每一轮评估都更有效地指导搜索,从而在复杂的多目标优化问题中实现更高效的探索。 尽管 TRACE 目前仍处于预印本阶段,但其思路为多目标优化中的 LLM 代理设计提供了重要参考,未来有望在药物设计、合金开发等领域发挥更大作用。

Anthropic3天前原文

在大型语言模型(LLM)的记忆与检索增强生成(RAG)评估中,一个长期被忽视的问题浮出水面:**相同的对话历史,以不同的形式呈现给模型,其答案质量可能天差地别**。来自arXiv的最新论文《RENDER: Controlling Reader-Facing Evidence in LLM Memory Evaluation》提出了一个名为RENDER的基准控制方法,系统性地揭示了这一“读者可见证据”对模型表现的深远影响。 ## 问题:被当作“实现细节”的输入形式 传统的记忆与RAG评估,往往将模型接收到的输入视为一个黑盒,默认其格式不影响最终结果。然而,在实际系统中,同一段历史可能被渲染为**记忆条目、摘要、类型化记录或原始对话片段**。这些不同的“工件”在信息密度、结构化和噪声水平上存在显著差异,却很少被评估框架显式控制。 ## RENDER:五级“数据包阶梯”与模板化渲染 RENDER的核心是一个**五级数据包阶梯**,用于精确控制答案关键内容进入输入的位置,从而隔离“何时提供证据”与“如何呈现证据”两个变量。同时,它采用确定性模板,模拟了四种典型的部署风格:ChatGPT风格的记忆条目、LangChain摘要、MemGPT类型化记录以及原始对话。 ## 关键发现:数据呈现形式显著影响性能 研究团队在**500个LongMemEval问题**和**9个模型**上进行了测试,结果令人震惊: - 在匹配预算的条件下,**结构化数据包比截断的原始对话平均高出42.4至72.6分**,表明合理的证据组织能大幅提升记忆召回能力。 - 在部署风格模板下,每个模型的最好与最差结果之间差距高达**24.6至48.8分**,说明呈现形式的选择比模型本身的差异更影响结果。 - 更值得注意的是,**三个在正式账本数据包上得分0%的模型**,在自然语言条目上却能达到**45.4%至53.4%**的准确率——这暗示某些模型对特定格式存在“盲区”。 ## 影响:评估应报告“读者可见工件” RENDER的发现对AI评估实践提出了明确建议: > 记忆与RAG评估应当报告或控制读者可见的工件形式,否则可能得出误导性结论。 此外,该效应在检索噪声下依然存在,并成功迁移至HotpotQA数据集,进一步证实其普遍性。 ## 结语:为更可靠的AI评估铺路 RENDER不仅提供了一个控制变量工具,更提醒我们:**在评估LLM时,输入的表达方式本身就是一种“提示工程”**。未来的评估标准需要更加精细化,以真实反映模型在多样化场景下的能力。

Anthropic3天前原文

arXiv:2608.21362v1 Announce Type: new Abstract: Transformer-based large language models (LLMs) incur high prefill latency because key-value (KV) tensors must be recomputed for each request. Existing prefix-caching systems reduce this cost but require prompts to share a leading contiguous prefix, limiting effectiveness when shared content appears at arbitrary positions. We present KVBoost, a chunk-level KV cache reuse system for HuggingFace-compatible decoder models that enables reuse regardless

Anthropic5天前原文

arXiv:2608.21363v1 Announce Type: new Abstract: A protocol is presented for recording the governance decisions of automated AI runtimes. When a runtime releases, blocks, defers, redacts, or escalates an individual output, AIREP records that decision as a single signed object that any party can check offline, independent of the runtime that produced it. A record carries the decision as one of a closed set of verbs under a stated policy basis, references its input, output, and evidence by hash rat

Anthropic5天前原文

arXiv:2608.21366v1 Announce Type: new Abstract: Driven by massive amounts of web-scale data, generative AI (GenAI) has achieved remarkable progress, enabling various applications in diverse sectors. The advances of GenAI have actuated practitioners to use AI-synthesized data for training next-generation AI models. Undeniably, using synthetic data has alleviated the increasing stringent demand for data supply. Unfortunately, it also introduces a new critical issue: in a self-consuming cycle betwe

Anthropic5天前原文

arXiv:2608.21372v1 Announce Type: new Abstract: This report summarizes the work conducted on the Game of Hidden Rules (GOHR), focusing on reinforcement learning agents trained to infer hidden rules from trial-and-error feedback, representation design, rule difficulty analysis, transfer learning, generalization, and pseudo-bot-assisted human learning analysis. The report focuses on the Transformer-based A2C framework, Feature-Centric and Object-Centric representations, experimental findings, and

Anthropic5天前原文
1 / 46下一页