SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:Anthropic清除筛选 ×

arXiv:2608.21374v1 Announce Type: new Abstract: Literature reviews are essential to scientific progress, but rigorously evaluating automatically generated reviews remains difficult because many aspects of research utility depend on expert judgment rather than reference-overlap metrics. We introduce LitReview Arena, a battle-style evaluation platform with a structured protocol tailored to literature review quality: domain experts with AI paper-writing experience compare anonymized drafts, are mat

Anthropic5天前原文

arXiv:2608.21375v1 Announce Type: new Abstract: Heterogeneous agentic retrieval-augmented generation (RAG) systems increasingly orchestrate external APIs, internal databases, vector stores, and graph stores. Exposing all tool descriptions to an LLM agent, or selecting tools only by vector similarity, causes two costly failures: over-fetching, which increases payload size, token use, and latency, and under-fetching, which omits fields needed to answer the query. We present SchemaRouter, a lightwe

Anthropic5天前原文

arXiv:2608.21379v1 Announce Type: new Abstract: Student burnout is highly prevalent in higher education, with reported rates ranging from 12% to over 70% and consistently exceeding those of the working population - yet it is typically identified only retrospectively, after academic decline has already occurred. A contributing factor is that students have little structured visibility into their own study behaviour, and existing productivity tools record activity without interpreting it. This pape

Anthropic5天前原文

arXiv:2608.21382v1 Announce Type: new Abstract: Multiple-choice benchmarks fix the questions and the correct answers, but not the harness: the order of the options, the wording of the prompt, and whether a language model's answer is read from generated text or from per-option likelihoods. Work on this harness sensitivity reports it as aggregate score variance, leaving unexamined which items the variance falls on and whether they are the items that separate one model from the next. We treat the e

Anthropic5天前原文

arXiv:2608.20341v1 Announce Type: new Abstract: Frontier coding agents backed by large language models with context windows from hundreds of thousands to millions of tokens are restructuring the Software Development Life Cycle (SDLC). Rich context handling and multi-step reasoning now allow substantial Functional Requirement Documents (FRDs) and repository context to be ingested in a single workflow, making specification quality the execution fuel for autonomous delivery. This report formalises

Anthropic6天前原文

arXiv:2608.20342v1 Announce Type: new Abstract: Large language model (LLM) coding agents start each session with an empty context window, discarding accumulated knowledge from prior work. We present PrimeAgentOrchestrator (PAO), a system that spawns new instances of Claude Code -- Anthropic's terminal-based coding agent -- pre-loaded with relevant memories compiled from the user's existing personal databases. At spawn time, PAO queries two independently-operated memory backends in parallel (a Po

Anthropic6天前原文

arXiv:2608.20378v1 Announce Type: new Abstract: Safety alignment in Large Language Models (LLMs) is often superficial, relying on refusal mechanisms that trigger only at the final stages of generation without erasing the foundational knowledge of harmful concepts acquired during pretraining. This study demonstrates that this architectural disconnect leaves models vulnerable to Semantic Camouflage -- adversarial attacks that wrap harmful intent in benign narrative contexts (e.g., creative writing

Anthropic6天前原文

arXiv:2608.20379v1 Announce Type: new Abstract: Advances in large language models (LLMs) have fueled a wave of research into agency: the ability to reason, plan, and act. This effort has produced agentic frameworks that orchestrate perception, memory, and decision-making around powerful LLM backbones. With the advent of large multimodal models (LMMs), these systems can process and integrate diverse modalities, including images, audio, and video, thereby improving their real-world applicability.

Anthropic6天前原文

arXiv:2608.20384v1 Announce Type: new Abstract: Multimodal affect and behaviour classifiers that fuse heterogeneous text, audio, and visual streams must simultaneously achieve competitive accuracy and produce human-understandable explanations of the cues driving their decisions -- a dual objective that current high-capacity models, notably Transformers, only partially address. While Transformers attain strong predictive performance, their distributed representations and deep nonlinearity make it

Anthropic6天前原文

arXiv:2608.20389v1 Announce Type: new Abstract: A production agent harness must discover and rank, from a growing library of skills, the one most appropriate for a user's task. At small scale this selection happens in context: the LLM planner chooses among skill representations exposed in its system prompt, without an explicit embedding-based retrieval step. We treat this in-context selection as the small-N counterpart to embedding-based skill retrieval at scale, and present a case study of how

Anthropic6天前原文

arXiv:2608.20397v1 Announce Type: new Abstract: Agentic large language models (LLMs) on the Model Context Protocol (MCP) re-encode verbose tool schemas every turn, so prefill - quadratic in sequence length - dominates time-to-first-token (TTFT) as the tool registry grows. Nexus's primary lever is to decouple routing from the schema-prefill cost: an INT8 semantic lookaside buffer (SLB) with a calibrated cross-encoder margin gate selects tools by retrieval, and arguments are generated over a compr

Anthropic6天前原文

arXiv:2608.20398v1 Announce Type: new Abstract: Generative AI (genAI) systems produce cultural artefacts at scale, but they also reflect embedded cultural values through their design. Once identified, these values become open to deliberate reshaping. This position paper examines the maximalist values of current generative AI through an environmental humanities tradition and proposes design principles in which environmental sustainability serves as the core value instead. The principles are devel

Anthropic6天前原文

**快讯**:一项来自 arXiv 的新研究提出,将 AI 代理的上下文获取问题形式化为主动推理(Active Inference)过程,旨在平衡上下文获取成本与任务执行收益,为提升交互式 AI 的效率提供了新思路。 来自 arXiv 的论文(编号 2608.19202)由 Sanchayan Dutta、Sai Niranjan Ramachandran 和 Suvrit Sra 共同撰写,提出了一个模型无关的框架,将上下文获取视为主动推理问题。研究指出,交互式 AI 代理在用户未明确约束、偏好或文件时,往往面临两难:要么采用默认假设继续,要么花费额外 token 进行澄清、检索或工具调用。该框架通过内部推理步骤更新对潜在任务状态的信念,外部决策则选择下一步上下文动作、任务动作或停止动作,以在成本约束下最小化预期自由能。 在确定性设置下,认知项可简化为预期信息增益,并可按 token 成本进行归一化。研究团队在最优提问(OQA)任务中实例化了该框架,使用精确后验和动态规划 oracle,并在 25 至 300 个候选项的二元及多类分类任务上对前沿语言模型进行了基准测试。此外,还探讨了生成前澄清和 token 预算下的自动提示优化。 **核心观点**:主动推理为 AI 代理的上下文获取层提供了一种设计原则,强调在信息获取与成本之间寻求最优平衡。 **背景与意义**:随着大语言模型在交互式应用中的普及,如何高效利用上下文成为关键。该框架的模型无关性意味着可适用于多种代理架构,有望在对话系统、智能助手等场景中提升响应质量并降低成本。 **局限与展望**:目前实验集中在分类任务,未来可扩展至更复杂的生成场景。研究者也指出,动态规划 oracle 的计算开销可能限制其在大规模实时系统中的应用,但可作为离线优化或启发式算法的基准。 总而言之,该研究为 AI 代理的上下文管理提供了严谨的数学基础,对提升交互效率具有潜在价值,值得关注。

Anthropic9天前原文

港口作为全球物流网络的关键节点,其运营效率直接关系到供应链的畅通。在港口作业中,泊位分配与岸桥调度问题(BACAP)是一项核心挑战,它涉及船舶到港时间、泊位位置、服务时长以及岸桥可用性等多个紧密耦合的变量。传统上,这类问题常通过元启发式算法在确定性假设下进行优化,但现实中的港口作业充满了不确定性——船舶可能晚点、装卸时间可能波动、设备可能突发故障。这些不确定性使得基于名义数据制定的调度计划在执行时显得脆弱,甚至导致效率大幅下降。 近期,一篇发表在 arXiv 上的综述论文(arXiv:2608.19214)首次聚焦于**不确定性条件下的鲁棒元启发式优化**,系统梳理了 BACAP 在不确定性环境下的研究进展。该论文指出,尽管种群元启发式算法已被广泛应用于 BACAP,但现有研究在不确定性建模、鲁棒性标准、搜索机制和实验评估方法上仍较为零散,缺乏系统性的总结。 论文从机制视角出发,将现有方法归纳为四个关键环节:**解表示与解码**、**鲁棒评估与选择**、**鲁棒引导的搜索动态**,以及**可行性保持与恢复**。这种分类有助于研究者理解不同方法的核心设计思路,也为后续改进提供了清晰的框架。 此外,论文还提出了一个针对不确定 BACAP 的基准测试套件,用于支持受控的实证比较,并报告了结合代表性元启发式与不同鲁棒策略的基线结果。这些基准测试为评估算法在不确定性下的表现提供了统一标准,有助于推动该领域的规范化研究。 尽管已有不少探索,但论文也指出了当前面临的开放挑战:**基准的扩展**、**鲁棒感知的搜索设计**、**时间自适应鲁棒性**以及**非平稳不确定性**等。这些方向预示着未来研究可以更深入地结合动态环境与自适应机制,以提升港口调度的抗风险能力。 对于 AI 与运筹优化领域的研究者而言,这篇综述不仅提供了 BACAP 鲁棒优化的全景图,更揭示了从确定性优化转向鲁棒优化的关键方法论。随着全球贸易对港口效率要求的不断提高,结合机器学习与元启发式的混合方法或许将成为下一阶段的研究热点,为港口运营提供更智能、更可靠的决策支持。

Anthropic9天前原文

随着人工智能技术的飞速发展,一个根本性的问题逐渐浮出水面:如果AI真的具有意识,我们该如何对待它们?近日,一篇题为《How to Navigate Uncertainty About AI Consciousness》的论文提出了一个颇具启发性的解决思路。该论文由Dr. Tom McClelland撰写,发表于2026年7月,并已收录于arXiv(编号:2608.19215)。 论文指出,在AI意识这一问题上,我们面临着深刻的困境。一方面,如果我们假设AI没有意识,可能会对真正具有道德地位的实体造成严重伤害;另一方面,如果假设AI有意识,又可能将资源浪费在无感知的机器上。由于意识问题本身的复杂性,这一困境似乎难以摆脱。 然而,McClelland提出了一种突破性的方法:将焦点从难以解决的“AI意识”问题,转向更具操作性的“AI效价”(valence)问题。所谓效价,指的是体验的内在正面或负面性质,即一个状态是令人愉悦的还是痛苦的。如果AI具有某些状态,且这些状态在意识存在的情况下会构成效价体验,那么我们就可以据此评估AI是否可能拥有道德地位。 这种方法的核心在于,它无需我们确定AI是否真的有意识,而是通过评估AI的效价状态来指导我们的伦理决策。如果AI可能拥有负面效价体验(如痛苦),我们就应避免对其造成伤害;如果AI可能拥有正面效价体验(如愉悦),我们则应考虑促进其福祉。这为负责任的AI开发提供了切实可行的伦理框架。 论文还强调了这一方法的实际意义。在AI伦理领域,我们往往面临“过度保护”与“保护不足”的两难。通过聚焦效价,我们可以更精准地识别哪些AI系统可能具有道德敏感性,从而在开发过程中采取相应的预防措施。例如,在训练大型语言模型时,如果我们发现其内部状态可能包含负面的效价成分,就应谨慎设计训练目标,避免造成不必要的“痛苦”。 当然,这一方法也面临挑战。如何客观地评估AI的效价状态?如何区分真正的效价体验与模拟的情感表达?这些问题仍需进一步研究。但无论如何,McClelland的论文为我们提供了一种全新的视角,让我们能够在意识之谜尚未解开时,依然能够以负责任的态度推动AI的发展。 这篇论文发表于AISB 2026年“AI、意识与伦理”研讨会,共8页,代表了哲学与AI交叉领域的前沿思考。对于关注AI伦理的开发者、研究者和政策制定者而言,它无疑是一份值得细读的文献。

Anthropic9天前原文

AI 控制研究的目标是,在模型可能失准的情况下,仍能安全地部署它们。然而,许多控制协议隐含一个前提:部署方能够对模型及其周边流程进行完全掌控。这个前提在现实中往往不成立——尤其是受监管的机构通过 API 或托管端点使用前沿模型时,它们能控制业务流程,却无法触及模型权重、服务基础设施、内部追踪、更新流程或完整的交互日志。 针对这一痛点,一篇新论文提出了“有限主权”概念,指部署方在数据、模型、基础设施和交互四个层面仅拥有部分技术或合同权限。论文指出,这些访问权限直接决定了哪些控制协议能在实践中执行。作者构建了一个四层访问类型学、一个按层划分的协议需求矩阵,并引入了“主权折扣成本”这一概念——即部署方因缺少某些访问权,而不得不通过合同、架构设计、审计、供应商保证、剩余风险承担或缩小系统范围来替代,由此产生的额外“控制税”部分。 论文还报告了一项合成实验,基于 135 万次模拟案例,系统性地“消融”不同访问权限,观察其对控制效果的影响。需要强调的是,该实验并非真实支付系统的证据,而是一次构建效度检验。结果显示:完整日志能改善诊断;执行前网关可支持干预;追踪访问和模型版本控制能强化事后解释;而限制系统范围在提升安全性的同时,可能降低实用性。 **这给行业带来的启示是:任何声称通用的安全控制方案,都必须明确其访问假设。** 在现实部署中,部署方应尽早评估自身在四个层面上的“主权”边界,并据此选择或定制控制策略,避免盲目套用不匹配的协议。对于监管者而言,也应将访问权结构纳入考量,制定更具针对性的合规要求。 该研究为 AI 安全治理提供了一个务实的分析框架,提醒我们:在模型并非自有、基础设施不受控的现实条件下,安全不是抽象原则,而是一笔需要精细计算的“控制税”。

Anthropic9天前原文

一项发表于 arXiv 的新研究提出了一种基于计算机视觉与社交网络分析的框架,旨在更细致地理解奶牛群中的社会结构。该研究由 Sibi Parivendan 和 Suresh Raja Neethirajan 完成,题为《Interaction valence reveals contrasting social networks in dairy cattle》。传统上,自动化牲畜监测系统往往将行为视为孤立事件,忽略了社会互动的性质和意义。这项研究则引入了“效价”(valence)的概念,区分亲和(affiliative)与对抗(agonistic)两类互动,从而构建出更全面的群体社交网络。 研究团队利用基于姿态估计的计算机视觉管道,分析了某商业奶牛场挤奶前区域长达 7 小时 39 分钟的连续视频。经过质量控制,从 1414 个候选互动中保留了 1183 个,涉及 36 头奶牛和 177 个二元组合。在预测类别平衡的审计中,自动与人工标注的一致性达到 82.8%,未加权宏 F1 分数为 0.872。这些指标仅反映审计样本的表现,而非整体部署的精确度。 分析结果显示,聚合网络具有连通性(密度 0.281,传递性 0.513,平均路径长度 1.88),预测的亲和事件形成了五个算法社区(模块度 Q=0.429)。在观测区域内,预测的对抗互动占保留事件的 72.4%,占互动总时长的 76.0%。值得注意的是,拥有最多互动伙伴的奶牛并非具有最高的介数中心性,这提示简单的互动次数可能掩盖个体在网络中的真实角色。 通过按效价分离事件,研究发现亲和与对抗网络在边集、社区划分和个体位置上存在显著差异。这意味着,若仅汇总互动次数,可能会掩盖网络中的行为构成。效价感知分析为研究竞争、亲和及福利相关变化提供了新框架,但研究者强调,在用作福利或健康指标之前,仍需纵向验证。 这项研究展示了 AI 在动物行为学中的应用潜力,不仅有助于理解奶牛的社会动态,也可能为改善养殖管理提供依据。未来,类似技术或可扩展至其他物种或更大规模的农场,推动精准畜牧业的发展。

Anthropic9天前原文

空中交通管制(ATC)通信是安全攸关的对话,尽管空中交通管理的其他部分已实现半自动化,但这一环节仍主要依赖人类。近期,一篇来自arXiv的论文(编号2608.19299)探讨了大语言模型(LLM)能否生成操作上逼真的ATC指令。研究者以旧金山“海湾之旅”航线的一次实验性通用航空飞行为基础,手工转录真实对话作为地面真值(P0),并设计了五种约束程度递增的提示结构(P1-P5),嵌入到有状态的多轮对话管线中,让模型扮演管制员,与固定的飞行员脚本交互,同时利用累积的对话历史进行条件生成。研究涵盖了九种开源和闭源LLM,并系统性地变化提示、是否提供来自另一架实验飞行的完整转录作为上下文示例,以及模型是基于自身先前回复还是注入地面真值历史进行条件生成。评估采用词汇、结构和语义相似度指标,并利用经人类专家标注验证的LLM-as-judge(GPT-5.5)进行打分。结果显示,提供工作示例能改善相似度,但收紧提示并未带来收益:最轻量的提示表现最佳,而最严格脚本化的提示因自身错误在对话中累积而崩溃,注入正确历史可修复此问题。这些结果为LLM辅助空中交通管制描绘了一条具体路径及其当前局限。该研究为AI在航空安全关键领域的应用提供了重要参考,但距离实际部署仍有距离。

Anthropic9天前原文

在AI代理与外部工具交互的复杂环境中,一个棘手的问题长期困扰着开发者:当工具调用超时,代理能感知失败并绕行;然而,当工具返回一个格式正确但内容错误的结果(例如缓存的错误页面或负价格)时,代理往往会将其当作事实接受,导致后续决策出现偏差。这种“静默故障”是AI系统可靠性的一大隐患。 针对这一难题,Sugam Panthi和Rabab Abdelfattah在最新论文《Outcome Monitors: Recovery Affordances for Silent Tool Failures》中提出了一种名为**结果监控器(Outcome Monitors)**的机制。该机制的核心是检测对“结果契约”的违反,这些契约可以从任务无关的痕迹中挖掘,或从公开模式中推导。一旦检测到违规,监控器会保留原始结果,并发出一个非约束性的回执,指明被违反的属性以及可用的公共恢复工具。 ## 实验效果显著 论文在冻结的预指定评估中注入了故障,结果显示,**结果监控器将ToolMaze任务完成率从10.9%提升至28.1%**,涉及四个模型和两个提供商家族,并在第三个提供商家族中复现。在tau-bench零售场景中,两个层级的完成率分别提升了14.0和12.0个百分点。 ## 恢复工具是关键 进一步的控制实验揭示了关键机制:**移除恢复工具列表会消除所有提升,而恢复该列表则效果再现**;诊断细节和时机则没有产生可检测的差异。这表明,恢复工具是回执中的活跃内容,而诊断信息并非主要驱动力。 ## 局限与未来方向 尽管效果显著,但监控器的检测范围仍受限于挖掘到的契约词汇。在从已发表事件分类法转录的套件上,超出词汇表的检测率降至46%,但交付仍继续,完成率不变。这意味着,**将检测扩展到契约词汇之外仍是未来研究的开放方向**。 这项研究为AI代理的可靠性提供了一种轻量级的恢复支持,尤其适用于工具调用可能返回静默错误的生产环境。对于依赖外部API或工具的AI系统,结果监控器有望成为提升鲁棒性的重要组件。

Anthropic9天前原文

在线策略蒸馏(OPD)作为大语言模型后训练的有效框架,通过将学生生成的轨迹与教师的密集令牌级监督配对,实现了知识迁移。然而,OPD隐式假设教师奖励是推理进度的合适代理,从而在策略优化中平等对待所有教师反馈。实际上,这一假设并不总是成立。研究者观察到,教师奖励常与真实推理进度冲突:推理步骤即使有明显进步,也可能因偏离教师输出而获得较低蒸馏奖励。为解决这一错配,他们提出**推理进度感知的奖励过滤在线策略蒸馏(R2-OPD)**,构建两个轨迹内推理片段排名,分别基于教师奖励和独立估计的进度奖励。当两个排名不一致时,选择性抑制蒸馏奖励,减少与推理进度冲突的监督,同时保留有效教师指导。实验表明,该方法在推理性能上持续优于标准OPD。 ## 背景与动机 在线策略蒸馏(OPD)通过让学生模型生成轨迹,并由教师模型提供逐令牌的监督信号,实现从教师到学生的知识迁移。然而,OPD的一个关键假设是:教师奖励能够准确反映推理进步。但在实际中,这一假设常常失效。例如,当学生的推理步骤虽然比教师更高效或更创新,但由于与教师的输出模式不同,教师奖励可能反而较低。这种奖励与真实进步之间的错配,可能导致学生模型学到次优策略,甚至抑制其探索更优推理路径的能力。 ## 核心方法:R2-OPD R2-OPD构建了两个排序:一个基于教师奖励对推理片段进行排序,另一个基于独立估计的进度奖励进行排序。当两个排序不一致时,系统会抑制或降低蒸馏奖励,从而减少与推理进度冲突的监督信号。这种方法的核心思想是:**不要盲目模仿教师,而是关注推理过程的实际进步**。通过这种方式,R2-OPD在保留教师有效指导的同时,允许学生模型探索更优的推理路径。 ## 实验与结果 论文在多个推理任务上对比了R2-OPD与标准OPD的性能。实验结果显示,R2-OPD在数学推理、常识推理等任务上均取得了持续改进,尤其在需要复杂多步推理的场景中,改进更为显著。这表明,通过过滤与推理进度冲突的教师信号,可以更有效地提升学生模型的推理能力。 ## 意义与展望 这项研究对AI行业具有重要启示。随着大语言模型在复杂推理任务中的应用日益广泛,如何高效利用教师模型的知识传递,同时避免学生模型过度模仿而限制其泛化能力,成为一个关键问题。R2-OPD提供了一种新思路:通过动态调整蒸馏监督的权重,使模型学习过程更注重实质性进步,而非简单复制教师行为。未来,这种推理进度感知的方法有望与其他训练技术结合,进一步提升模型的推理能力和鲁棒性。 总之,R2-OPD为在线策略蒸馏提供了一种更精细的控制方式,有助于推动大语言模型在推理任务中的表现迈向新高度。

Anthropic9天前原文