SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:HuggingFace清除筛选 ×

在物理场模拟与机器学习交叉领域,如何让神经网络既尊重物理定律又灵活适应复杂几何,一直是核心挑战。来自普林斯顿大学的研究者 Dongzhe Zheng 与 Christine Allen-Blanchette 近期提出了一种名为 **Riemannian Hodge Message Passing (RHMP)** 的新架构,为这一难题提供了优雅的解决方案。相关论文已提交至 arXiv(编号:2608.14556)。 传统方法中,物理场在网格上的离散化常面临拓扑与几何的纠缠:守恒律要求精确的拓扑结构,而材料属性、几何形变等则需从数据中学习。现有神经代理模型往往通过无约束的消息传递混合这两类信息,导致物理一致性受损。RHMP 的核心创新在于**将这一分离上升为架构设计原则**——固定由定向关联决定的细胞上边界算子($d_k$),同时学习对称正定的上链度量($H_k$),用于几何相关的信息传播。 这一设计带来了多重理论优势:通过度量加权的 Hodge 模块($d_k^\top H_{k+1}d_k$),RHMP 保证了**精确的复形恒等式**($d_{k+1}d_k=0$)、非负的 Hodge 能量、半正定算子,以及严格的阿贝尔曲率不变性。更重要的是,将 $H_k$ 视为学习度量,自然引出了**上链框架等变性**:物理传播应不依赖于隐藏特征基的旋转选择,这增强了模型的泛化能力。 实验部分,研究者在涵盖流体、电磁学、规范场及变网格 CFD 的**七个物理基准**上评估了 RHMP。结果显示,RHMP 在整体性能上取得最优,尤其是在拓扑、学习几何与场结构相互作用的复杂场景中,性能提升最为显著。这表明,显式区分拓扑与几何不仅提升了物理一致性,也带来了实际精度收益。 该工作为物理信息机器学习提供了新思路:与其让网络隐式学习一切,不如将物理先验(如守恒律)作为刚性骨架,而将数据驱动的部分限制在几何度量上。这一范式有望在计算力学、电磁仿真、以及更广泛的科学计算领域产生深远影响。未来,团队计划探索 RHMP 在更复杂物理系统中的应用,并进一步优化其计算效率。

HuggingFace12天前原文

城市是人类活动最密集的场所,理解人的移动规律对交通管理、疫情防控、城市规划等至关重要。然而,大规模轨迹数据因隐私问题难以公开,这限制了相关研究。现有合成轨迹生成方法多聚焦全局分布相似性,却忽略了不同时空分辨率下的移动模式。近日,一篇被 KDD 2026 接收的论文提出 **MR-Traj** 框架,通过粗到细的多分辨率扩散模型,在保持全局分布的同时,显著提升细粒度移动模式建模能力,并增强轨迹多样性以降低隐私泄露风险。 ## 核心挑战:隐私与效用的两难 轨迹数据包含个人时空足迹,直接公开会带来严重隐私风险。因此,研究人员常采用合成数据生成技术,模拟真实轨迹分布,供下游任务使用。但现有方法,如基于 GAN 或 VAE 的模型,往往只追求整体统计特征相似,导致生成的轨迹在局部时段、特定区域的行为模式失真。例如,在早高峰的 CBD 区域,真实轨迹表现出高度聚集和规律性,而合成数据可能过于平滑,无法反映这种细粒度动态。 ## MR-Traj:多分辨率建模新思路 该研究提出 **MR-Traj**,将轨迹视为**粗粒度里程碑**(如主要停留点、换乘站)和**细粒度路段**(如具体路径、速度变化)的组合。通过扩散模型在不同分辨率级别逐步生成,从整体到局部,捕捉多尺度时空依赖。 实验表明,MR-Traj 在全局分布相似性上与最先进方法相当,但在细粒度移动模式(如小时级流量变化、区域间转移概率)上**持续领先**。下游任务如流量预测、疫情传播模拟中,MR-Traj 生成的数据也带来更优性能。 ## 隐私与多样性的双赢 值得关注的是,MR-Traj 在多个分辨率级别引入随机性,生成轨迹的多样性显著提升。在种子引导的数据发布场景下,这种多样性有效降低了轨迹链接攻击的风险,即攻击者难以将合成轨迹与真实个体关联。这为隐私保护数据发布提供了新思路,平衡了数据效用与隐私安全。 ## 展望 MR-Traj 为城市轨迹生成提供了新范式,但仍有挑战。论文未提及计算效率,多分辨率扩散模型可能带来更高开销。未来可探索更高效的采样策略,或将其扩展到更多城市场景。总体而言,这项研究为隐私约束下的城市计算提供了有力工具,值得关注。

HuggingFace12天前原文

在对抗性机器学习领域,投影梯度下降(PGD)攻击是评估模型鲁棒性的标准方法。然而,传统上仅依赖最终对抗精度来评判模型,忽略了攻击过程中模型行为的动态变化。近期研究提出轨迹级诊断指标,如损失演化、梯度对齐和失败步数,旨在提供更深入的优化动力学洞察。但这些指标是否可靠地反映鲁棒性强度,尚不明确。 一篇新论文对Fashion-MNIST上的卷积神经网络进行了PGD攻击的轨迹级研究,比较了干净训练和对抗训练模型在不同鲁棒性水平下的表现。研究发现,尽管不同模型的鲁棒性层级清晰,但轨迹指标并未同等贡献于这一识别。平均损失轨迹和梯度对齐模式在对抗训练模型中表现相似,即使它们的鲁棒精度差异显著。相比之下,失败步数分布能更清晰地区分鲁棒性级别,直接反映模型对对抗扰动的功能性抵抗。 这一结果表明,轨迹级诊断更多描述了优化几何特性,而非独立衡量鲁棒性。其可解释性依赖于鲁棒性级别、攻击强度和多种指标的综合评估。因此,轨迹级分析应作为补充诊断工具,结合上下文解读,而非替代标准鲁棒性测量。

HuggingFace12天前原文

近期,一项来自 arXiv 的新研究提出了一种名为 **前向传播仅 MLP 训练(Forward-Pass-Only MLP training, FPO)** 的方法,旨在在不通过模型主体进行反向传播的情况下适配大型语言模型(LLM)。该方法宣称能实现 **2.7 至 3.2 倍**的标准微调吞吐量,同时峰值训练内存减少约 **40%**,并在领域外基准测试中保持与基线相当的种子噪声水平,这一特性是完整网络微调所无法可靠复现的。 ## 核心观察:输出层误差近似真实梯度 FPO 方法建立在一个经验观察之上:在 Transformer 的后期层中,输出层的预测误差与真实梯度的余弦相似度在 0.47 至 0.59 之间(基于六个公开模型的调查)。这意味着,模型后期层的梯度可以通过输出层的误差信号来近似,而无需进行完整的反向传播。 为了利用这一特性,研究者引入了一个 **两分钟的诊断工具**,可以量化每一层的这种近似程度,从而确定哪些层适合进行后期层适配。基于该诊断,FPO 仅计算一次输出误差信号,并将其应用于每个目标层,不进行层间信号传播,也不构建任何自动微分图。 ## 实验评估:性能与效率的平衡 研究者在三个模型家族上评估了 FPO:**OLMo-2-7B、Qwen3-8B 和 Falcon3-7B**。实验结果显示,FPO 在领域内困惑度上均有改善,同时在 **MMLU、ARC-Challenge、HellaSwag 和 Winogrande** 等基准测试中保持与基线相当的种子噪声水平。此外,将标准监督微调(SFT)定位到 FPO 的目标层也能达到类似效果,但墙钟时间成本是 FPO 的 **2.2 倍**。 ## 意义与展望 这项研究为大模型的高效适配提供了新的思路。传统的全网络微调计算成本高昂,而 FPO 通过避免反向传播,显著降低了计算和内存开销,同时保持模型性能。这对于资源受限的场景尤为重要,例如在边缘设备上部署或快速迭代模型。 然而,该方法的适用性可能局限于后期层,对于需要深层特征调整的任务,其效果仍需进一步验证。此外,诊断工具的实用性也依赖于模型架构的多样性。未来,研究者可以探索将 FPO 与其他参数高效微调技术(如 LoRA)相结合,以进一步提升效率。 总体而言,FPO 展示了在保持模型性能的同时大幅提升训练效率的可能性,为大模型的应用开辟了新的路径。

HuggingFace12天前原文

随机向量功能链接(RVFL)网络以其轻量级和快速训练的特性,在机器学习领域占有一席之地。然而,传统RVFL模型在面对噪声标签、异常值和不平衡数据时表现脆弱,这限制了其在真实世界应用中的性能。为了应对这些挑战,研究人员提出了一种新的模型——基于核风险敏感均值p次幂的RVFL(KRPRVFL),该模型将RVFL的计算效率与核风险敏感均值p次幂(KRP)准则的鲁棒性相结合,通过用KRP损失替代标准的最小二乘目标,自适应地降低训练过程中受损或不可靠样本的影响,从而提升模型的稳定性和泛化能力。此外,该框架还引入了协作学习机制,使模型组件之间能够自适应交互,进一步增强在复杂和噪声环境中的鲁棒性。借助核诱导的特征映射,KRPRVFL无需显式选择隐藏层即可捕获非线性关系,保持了高效性和可扩展性。在UCI和KEEL基准数据集上的大量实验表明,KRPRVFL在准确性、鲁棒性和统计显著性方面均优于基线模型,为具有挑战性的分类任务提供了一种快速、可扩展且可靠的解决方案。

HuggingFace13天前原文

主动学习(Active Learning)通过挑选最具信息量的样本,能有效降低标注成本。但一个直觉上的矛盾是:模型最不确定的样本,往往也是最难被正确标注的。那么,不确定性采样(Uncertainty Sampling)的失败,究竟是因为它选到了更多错误标签,还是因为错误集中在困难区域而格外有害? 近期一篇来自 arXiv 的论文(编号 2608.13601)针对这一问题展开了系统测试。研究者 John Myron Uy 在三个公开的二分类表格数据集上,对比了基于边际(margin)的不确定性采样与随机采样,在三种标签噪声条件下的表现:干净标签、随机分类噪声(RCN)以及有界难度依赖噪声(难度越高的样本,噪声越大)。 实验设计相当严谨:使用 100 对配对随机种子、9 个期望噪声率(从 0 到 0.30)、标注预算从 20 到 120(干净标签延伸至 400),并采用逻辑回归作为基学习器,在每个预算下通过交叉验证重新选择正则化参数。 **核心结果**显示:在干净标签下,不确定性采样在所有数据集上均提升了归一化平衡准确率曲线下面积(AUC),提升幅度在 1.09 到 1.77 个百分点之间。然而,当引入难度依赖噪声后,情况变得复杂:在 Breast Cancer Wisconsin 数据集上,难度依赖噪声在 8 个噪声率中的 6 个上比 RCN 更削弱不确定性采样的优势;但在 Banknote Authentication 和 MAGIC Gamma Telescope 数据集上,这一现象并未出现。 进一步的“暴露匹配”(exposure-matched)分析发现,没有证据表明结构化错误位置会带来额外的普遍惩罚。换句话说,不确定性采样获取更多错误标签这一点,并不能完全解释其性能下降;错误的具体位置(是否集中在困难区域)的影响因数据集而异。 有趣的是,在干净的 MAGIC 数据上,不确定性采样在提升平衡准确率的同时,却降低了平均精度(average precision)和固定假阳性率下的真正例率。这说明,评估指标的选择会显著影响对采样策略优劣的判断。 **结论**:不确定性采样在标签效率上确实有优势,但其鲁棒性高度依赖数据集、预算、噪声结构以及评估指标。该研究提醒我们,在实际应用中,不能盲目信任不确定性采样,尤其是在标签质量参差不齐的场景下。 该论文共 14 页,包含 5 张图和 4 张表,并提供了代码和可复现材料。对于从事主动学习研究和应用的开发者而言,这项研究提供了一个重要的视角:在考虑标注成本的同时,必须将标签噪声的分布特性纳入考量。

HuggingFace13天前原文

XGBoost 作为机器学习领域的热门算法,凭借其高效、可扩展的特性,在各类预测任务中表现出色。然而,一项最新研究揭示了其在面对数据异常时的脆弱性,并提出了一种名为 **MM-XGBoost** 的改进方案,在保持预测精度的同时显著增强了模型的稳健性。该研究由 Iris Aragón Mladosich 与 Christophe Croux 合作完成,相关论文已提交至 arXiv(编号:2608.13590)。 ## 从残差拟合到稳健性挑战 XGBoost 的核心机制是迭代地拟合决策树,以捕捉前一步预测的残差。其默认的损失函数为二次损失(即均方误差),虽然计算简便,但对异常值极为敏感。即便引入了 Huber 损失作为替代,研究指出,**垂直异常值(vertical outliers)** 和 **高杠杆点(leverage points)** 依然能显著影响模型性能。垂直异常值指目标变量中的极端值,而高杠杆点则指特征空间中偏离主体分布的样本点,两者都可能导致模型过拟合或偏差。 ## 探索替代损失函数:M、S 与 τ 估计 为了应对这一挑战,研究者将目光投向了稳健回归领域的经典方法。他们系统评估了基于 **M 估计器**、**S 估计器** 以及 **τ 估计器** 的替代损失函数在 XGBoost 框架中的表现。这些估计器通过不同的方式降低异常值对模型拟合的影响,例如 M 估计器通过迭代加权最小二乘,S 估计器则基于残差尺度的高断点估计。 实验结果显示,单一的稳健损失函数虽然提升了抗异常能力,但往往以牺牲预测精度为代价。而将两种估计器结合的两步法——**MM-XGBoost**——在两者之间达到了最佳平衡。MM 估计器通常先使用高断点的 S 估计器获得初始稳健拟合,再通过 M 估计步骤优化效率,这一策略在 XGBoost 中同样奏效。 ## 稳健与精度的权衡之道 MM-XGBoost 的提出,为在真实世界数据中应用 XGBoost 提供了更可靠的选项。在金融、医疗、工业等常含噪声和异常值的领域,该方法的实用价值尤为突出。研究团队通过大量实验验证了其有效性,并提供了详尽的补充材料(30 页正文加 15 页附录),为后续研究提供了坚实基础。 尽管 MM-XGBoost 展现出显著优势,研究者也提醒,其计算成本可能略高于标准 XGBoost,且参数调优需要更多考量。未来,如何进一步降低计算开销,并将该方法扩展到分类任务,将是值得探索的方向。 这项研究不仅深化了我们对 XGBoost 鲁棒性的理解,也为稳健机器学习提供了新的工具。对于数据科学家而言,当面对可能包含异常值的数据集时,MM-XGBoost 无疑是一个值得尝试的选项。

HuggingFace13天前原文

在AI领域,模型规模的差异往往成为知识迁移的障碍。通常,将大型模型的能力迁移到小型模型需要复杂的对齐或训练过程。然而,一项新研究提出了一种无需训练的跨规模融合方法,通过激活引导的剪枝技术,在保持性能的同时实现知识的高效转移。 ## 创新方法:Activation-Prune-Merge (APM) 来自研究者的一项新工作提出了 **Activation-Prune-Merge (APM)** 框架,旨在解决异构模型融合中的跨规模问题。传统方法通常需要神经元级别的语义对齐,而APM则另辟蹊径。它通过构建任务条件下的激活图,识别大型模型(供体)中与任务相关的关键部分,然后进行剪枝以匹配小型模型(受体)的架构。具体来说,APM会剪枝供体的层、隐藏维度、注意力头和MLP神经元,使其与受体的结构对齐,最后通过微小的插值系数将剪枝后的供体部分注入受体。 这种方法的核心思想是,将供体视为功能组件的集中来源,而非要求精确的结构移植。这种设计使得跨规模融合无需显式的语义对齐,就能实现知识转移。 ## 显著性能提升 研究者在16个基准测试上进行了评估,涵盖推理、数学、代码生成、指令遵循和分类等任务。结果显示,APM将3B规模受体的平均准确率从 **55.5%** 提升至 **60.6%**。在具体任务上,RTE准确率从64.3%大幅提升至82.3%,QNLI从52.3%提升至65.7%,BoolQ从70.8%提升至79.2%。这些数据表明,激活引导的剪枝能够有效提取供体中的可迁移能力。 ## 分析与未来方向 研究还分析了注入比例的影响,并探索了多阶段顺序融合的可能性。结果表明,激活引导的提取能够提高可迁移供体切片的质量,同时保持小比例融合的机制。这为跨规模模型融合提供了新的思路,尤其是在无需额外训练的情况下,为资源受限场景下的模型增强提供了可能。 尽管结果令人鼓舞,但研究者也指出,当前方法依赖于任务条件激活图,可能需要对每个任务进行适配。未来的工作可以探索更通用的激活引导策略,以及在不同模型家族上的适用性。 这项研究为模型融合领域带来了新的视角,证明了在无需语义对齐的情况下,跨规模知识迁移是可行的,且效果显著。随着进一步的研究,这种方法有望在模型压缩和高效部署中发挥重要作用。

HuggingFace13天前原文

现代运营系统即使在常规条件下也面临不确定性,其中罕见、突发且自激的事件既源于外生协变量,也源于内生事件动力学。标准的神经算子通常被训练为回归式的函数到函数模型,而非条件强度估计器,这限制了它们在稀疏事件场景中的适用性。为此,我们引入了洛伦兹傅里叶神经算子(L-FNO),这是一种随机神经算子,它结合了FNO风格的协变量路径、用于历史依赖激发的洛伦兹谱核以及基于似然的训练目标。我们在八个合成点过程基准和三个真实世界数据集(涵盖疾病暴发预测和半导体故障或缺陷检测)上评估了L-FNO。与回归和基于似然的神经算子基线相比,L-FNO在事件似然、校准诊断和罕见事件检测方面均有提升。这些结果表明,结构化的谱记忆和基于似然的学习为随机事件动力学的神经算子模型提供了有效的归纳偏置。 ## 背景与挑战 在金融、医疗、制造等许多领域,系统面临的核心挑战之一是如何准确预测罕见但关键的事件,例如疾病暴发或半导体制造中的故障。这些事件往往表现出突发性和自激性,即一个事件的发生可能增加后续事件发生的概率。传统的神经算子模型通常以回归方式训练,直接学习输入到输出的映射,忽略了事件时间序列的随机性质,导致在稀疏事件场景下性能不佳。 ## L-FNO的核心设计 L-FNO的设计旨在克服上述局限。它结合了三个关键要素: - **FNO风格的协变量路径**:利用傅里叶神经算子高效处理函数型协变量,捕捉输入与事件之间的复杂关系。 - **洛伦兹谱核**:借鉴洛伦兹函数(即柯西分布)的谱形式,用于建模历史事件的激发效应。这种核函数能够有效捕捉事件的自激和互激特性,尤其适合描述突发和衰减过程。 - **基于似然的训练目标**:通过最大化事件序列的似然函数来训练模型,使其直接优化条件强度估计,而非简单的回归误差。 这种设计使得L-FNO能够更好地处理事件数据的随机性,并提高对罕见事件的预测能力。 ## 实验与性能 研究团队在八个合成点过程基准和三个真实数据集上进行了广泛实验。结果显示,L-FNO在事件似然、校准诊断和罕见事件检测方面均优于现有的回归和基于似然的神经算子基线。这表明,结构化的谱记忆和似然学习为神经算子模型提供了有效的归纳偏置,使其更适合于随机事件动力学建模。 ## 意义与展望 L-FNO的提出为神经算子家族增添了新的工具,特别是在处理随机事件序列时。其成功表明,将领域知识(如自激过程的谱特性)融入模型架构,并结合适当的训练目标,可以显著提升模型的实用价值。未来,该模型有望在更多需要实时预测和风险管理的领域中得到应用,例如金融风险管理、流行病学监控和工业质量控制等。 尽管L-FNO表现出色,但仍有改进空间。例如,如何扩展到更高维的事件类型、如何处理非平稳的协变量,以及如何进一步提高计算效率,都是值得探索的方向。

HuggingFace13天前原文

高能物理对撞机实验中,寻找超出标准模型的新物理信号是核心目标之一。然而,传统的事件级异常检测方法长期面临两大痛点:异常分数难以解释,以及异常分数与能量尺度、粒子多重性等变量强相关,导致误报率偏高。近期,一篇发表在arXiv上的论文提出了名为**ORCA**(Organized Representation via Contrastive learning for Anomaly detection)的两阶段框架,旨在解决上述问题,为对撞机物理中的异常检测提供更可靠且可解释的工具。 ORCA的核心思路是:首先,利用**监督对比学习**在涵盖多种已知物理过程的模拟数据上训练一个嵌入空间,使得不同物理过程在该空间中被清晰地分离;随后,在该嵌入空间上运行一个标准自编码器,生成事件级的异常分数。这种设计不仅提升了异常检测的灵敏度,更重要的是,嵌入空间的几何结构携带了高维的物理信息,使得异常样本的**可解释性**成为可能。 在模拟数据上(与高亮度大型强子对撞机(HL-LHC)条件一致),ORCA相比基线自编码器架构,在**灵敏度的广度和深度**上均取得了显著提升。更值得关注的是,研究团队开发了一种基于最大似然估计的模板拟合方法,能够将异常样本中的事件归因到已知的物理过程模板,并给出量化的不确定性。实验表明,该拟合方法能准确恢复注入的信号产额,即使这些信号在训练嵌入时未被包含;对于模板库中缺失的信号,也能通过其最相似的已知过程进行特征描述。 这一成果为对撞机实验中的异常检测搜索开辟了新的路径。传统方法通常输出一维的分数,而ORCA利用嵌入空间的几何结构,保留了更丰富的物理信息,有助于下游的统计分析。尽管该研究仍处于模拟验证阶段,但其提出的可解释异常检测框架,对于未来高能物理实验的数据分析具有重要的潜在应用价值。 值得注意的是,论文作者来自上海交通大学、印度科学研究院等机构,研究聚焦于机器学习与高能物理的交叉领域。随着HL-LHC等高精度实验的推进,这种结合对比学习与自编码器的方法,或将成为物理学家探索新物理的有力助手。

HuggingFace13天前原文

在 AI 领域,**SWE-bench** 和 **LiveCodeBench** 等编码基准已成为衡量大模型编程能力的重要标尺。然而,一项最新研究指出,过度依赖这些基准进行优化,可能会误导我们对模型通用编码能力的判断。该研究已收录于 **ICLR 2026** 的 DL4Code 研讨会,并提出了更全面的评估框架。 ## 基准分数的“意义鸿沟” 研究团队认为,当前许多论文、模型卡和博客将模型在少数基准上的高分,直接等同于其具备广泛的编码能力。但实际上,**针对特定基准的优化往往只能提升任务特定性能**,而非通用能力。这种“意义鸿沟”导致开发者难以依据现有指标做出可靠的决策。 ## 案例研究:Django 基准套件 为了验证这一观点,研究者构建了一个基于 **Django 框架**的基准套件,并评估了多个基础模型及经过 SWE-bench 轨迹后训练的检查点。结果显示: - **基准排名普遍无法泛化**:在 SWE-bench 上表现优异的模型,在 Django 任务上并未展现同等优势。 - **跨任务迁移有限**:后训练模型在不同任务间的能力迁移微乎其微,SWE-bench 优化对 Django 任务及 LiveCodeBench 的增益几乎为零。 - **模态微调不通用**:针对 Django 单个模态的微调,同样无法迁移到其他模态。 ## 评估策略建议 面对这一挑战,研究者提出分层评估策略: - **前沿模型**:采用整体性评估,全面考察各项能力。 - **研究模型**:使用多任务套件,覆盖更广泛的应用场景。 - **特定任务应用**:引入人工评估,确保实际场景中的有效性。 此外,他们呼吁社区**构建能力分类体系**,并持续维护基准,而非一次性发布。唯有如此,才能为 LLM 和智能体的开发与部署提供可靠依据。 ## 结语 这项研究提醒我们,**基准分数的提升并不等于通用能力的增强**。在 AI 技术快速迭代的今天,多样化的评估体系是确保技术健康发展的基石。

HuggingFace13天前原文

线性注意力模型因其固定大小的状态表示,在长上下文场景下面临着信息干扰的挑战。近日,Dhruman Gupta等人提出了一种名为QED的新方法,通过引入查询衍生的擦除方向,显著提升了模型的检索能力,甚至将有效上下文长度翻倍。 ## 背景:线性注意力的困境 传统的Softmax注意力机制虽然效果出众,但其计算复杂度随序列长度呈二次方增长,难以应对超长上下文。线性注意力通过固定大小的状态来近似全局信息,将复杂度降至线性。然而,这种压缩也带来了问题:当上下文极长时,大量信息被挤压在有限的状态中,相互干扰,导致检索准确率急剧下降。 ## QED:从查询中寻找擦除方向 现有方法(如Gated DeltaNet-2)在进行状态更新时,擦除向量仅由当前token的键(key)决定。但研究者发现,读取时干扰的度量依赖于查询(query),而键导向的擦除无法触及查询方向上的干扰。QED的灵感正是来源于此:既然查询能感知干扰,那么它也应该指导擦除。 QED在原有键导向擦除的基础上,增加了一个与键正交的、由查询衍生的第二擦除方向。在快速权重视角下,这种设计使得模型能够利用可编辑的部分,沿查询方向抵消旧状态中的干扰内容,从而更精准地更新记忆。 ## 性能提升:不止一点 实验表明,QED在多种长度超出训练窗口的测试中均提升了检索性能,尤其在S-NIAH-1任务上,有效上下文长度几乎翻倍。这意味着,在不改变模型架构的前提下,仅通过修改擦除机制,就能显著扩展线性注意力的可用范围。 ## 未来展望 QED为线性注意力模型的优化提供了新思路:擦除不应仅依赖键,查询中的信息同样重要。这一发现或许能启发更多关于注意力机制内部信息流的研究,推动高效长上下文模型的进一步发展。

HuggingFace13天前原文

**LoKiFormer 架构发布:预训练提速 1.33 倍,兼顾局部与全局知识** 近日,一项名为 LoKiFormer 的新研究在 arXiv 上公开,并被 ICML 2026 接收。该研究针对当前大语言模型(LLM)预训练效率低下的问题,提出了一种全新的架构设计,通过引入局部融合注意力(LFA)与知识记忆模块(KMM),在信息整合效率上实现了显著提升。实验显示,LoKiFormer 在预训练阶段的收敛速度比基线模型快 1.33 倍,为 LLM 的高效训练提供了新思路。 ## 现有 LLM 架构的两大瓶颈 尽管 LLM 在众多应用中表现卓越,但其预训练过程仍存在结构性缺陷。研究团队指出,两大问题尤为突出: - **自注意力缺乏局部归纳偏置**:自注意力机制在处理序列内部信息时,没有显式地偏向局部模式,导致对局部信息的冗余建模,浪费计算资源。 - **混合专家(MoE)中知识与计算耦合**:MoE 隐式地将知识存储与计算路径绑定,使得模型难以灵活访问序列外部的全局知识,限制了知识利用的灵活性。 ## LoKiFormer 的解决方案:双模块协同 针对上述问题,LoKiFormer 在标准解码器上增加了两个专用模块: - **局部融合注意力(LFA)**:该模块将卷积融合引入注意力机制,显式捕捉局部模式,使注意力能够作用于更具信息量的表示,从而减少对序列内部局部信息的冗余建模。 - **知识记忆模块(KMM)**:这是一个参数化的键值记忆系统,将全局知识显式存储在可寻址的槽位中,实现存储与计算解耦,支持直接的知识检索,增强了模型对全局知识的访问能力。 两个模块协同工作,使 LoKiFormer 能在局部与全局两个层面高效整合信息,兼顾效率与效果。 ## 实验验证与行业意义 研究团队在预训练任务上对 LoKiFormer 进行了评估,结果显示其收敛速度比基线模型快 1.33 倍,证实了架构设计的优越性。这一成果不仅为 LLM 预训练效率的提升提供了可行路径,也对当前追求更大规模模型与更低训练成本的行业趋势具有重要意义。随着模型规模持续扩大,训练效率成为关键瓶颈,LoKiFormer 的局部感知与知识解耦思路,或将为下一代高效 LLM 架构的设计提供重要参考。 不过,该研究目前仍处于论文阶段,其实际应用效果与扩展性尚待进一步验证。未来,团队或许会开源代码并公布更多实验细节,以推动该架构在业界的落地。

HuggingFace16天前原文

## 免费卫星数据如何预测喜马拉雅冰川湖溃决风险? 一项新研究利用免费卫星数据,尝试预测喜马拉雅冰川湖溃决、滑坡和冰川洪水等灾害风险。该研究已提交至 arXiv(编号:2608.12422),由 Matthew Kahn 等人完成。研究团队发现,雷达干涉测量技术能够捕捉到冰碛坝的缓慢变形,而卫星气象数据则能揭示湖泊处于压力的时期。这两类信号分别回答了“哪个地点有风险”和“何时有风险”的问题。 ### 核心发现 研究聚焦于三种相关灾害:大型冰碛坝和冰坝溃决、降雨引发的滑坡,以及冰川上或周边的池塘洪水。每种灾害都对应两个问题:地点和时间。利用 HMAGLOFDB 数据库中的 **589 起冰湖溃决事件** 和数千起滑坡记录,研究者将每个事件与相似但未发生灾害的地点进行匹配,并采用严格的空间交叉验证方法,确保模型不会因识别训练过的邻近区域而“作弊”。 结果显示,**前期天气状况** 在预测触发时间方面表现出色:大型溃决的 ROC 值为 **0.73**,滑坡为 **0.83**,小型洪水为 **0.82**。然而,地形在预测地点方面的能力有限:虽然简单评分看似接近 0.9,但考虑到已记录灾害多集中在湿润地区,与邻近相似地点对比后,真实值仅为 **0.76**(大型溃决)、**0.71**(滑坡)和 **0.54**(小型洪水,与随机猜测无异)。不过,在尼泊尔境内,大型溃决的预测准确率提升至 **0.89**。 ### 模型对比与局限 研究还比较了五种深度学习模型与简单梯度提升基线模型的表现。结果发现,深度学习模型并未显著优于基线,仅在滑坡预测上略有优势,但差异不足以确认。对于湖泊灾害,基线模型完全胜出,其决策规则可简化为基于地形粗糙度和季风降雨的三条规则。 研究团队强调,他们提供的是 **尼泊尔排名观察清单**,作为优先级排序的辅助工具,而非精确预测。同时,他们也指出了免费数据在预测中的局限性。 ### 意义与展望 这项研究展示了免费卫星数据在灾害预警中的潜力,尤其是在数据稀缺的喜马拉雅地区。尽管模型精度仍有提升空间,但该方法为资源有限地区的灾害风险管理提供了新思路。未来,结合更高分辨率的数据或更先进的模型,可能进一步提高预测能力。

HuggingFace16天前原文

Transformer 凭借随上下文长度增长的 token 级记忆,在长上下文检索任务中表现卓越,但代价是训练时的二次计算复杂度和推理时线性增长的 KV 缓存。循环神经网络(RNN)类模型通过将全部历史压缩为固定大小的状态来实现高效解码,却常在需要精确回忆的任务中败下阵来——早期信息往往被后续更新覆盖,模型只记得最近的内容。 针对这一矛盾,来自清华大学、上海交通大学等机构的研究者提出了 **MARCH(Memory-Anchor Routing across Context History)** 架构,在保持循环模型高效推理的同时,让记忆容量能随上下文长度灵活扩展。其核心思想是:**周期性将累积的循环状态检查点保存为“状态锚点”,并为每个锚点生成一个紧凑的内容相关键(anchor key)**。这样,模型就拥有一个可增长的内存库,用户可以在历史分辨率和内存开销之间进行可控的权衡。 具体而言,在每个时间步,MARCH 会生成一个锚点查询(anchor query),对所有因果可用的状态锚点进行注意力聚合,输出则是对所有历史锚点沿当前状态进行注意力式加权求和的结果。这种设计让模型在保留循环计算路径的同时,能够直接“回看”较早的状态锚点,从而缓解信息覆盖问题。 实验结果显示,在标准预训练后,MARCH 在常识推理、LongBench 和上下文检索等多个基准上**一致优于多种线性注意力变体**。这表明,内容路由的状态缓存能显著增强循环模型的长程记忆能力,同时不破坏其固有的高效计算路径。 这项研究的价值在于,它提供了一种新的思路来平衡效率与性能:既不像 Transformer 那样完全依赖随长度增长的显式记忆,也不像传统 RNN 那样将记忆压缩到固定大小,而是通过锚点机制实现一种“可扩展的循环记忆”。这对于长文本处理、多轮对话、代码生成等需要长程依赖的应用场景,可能带来更实用的解决方案。 当然,该工作目前仍处于 arXiv 预印本阶段,其实际效果和可扩展性尚需进一步验证。但 MARCH 所展示的方向——在循环架构中引入内容寻址的记忆缓存——无疑为高效长上下文建模提供了新的可能。

HuggingFace16天前原文

生成式AI领域近日出现一项颇具理论深度的新研究。来自意大利米兰大学的研究者Ramon Winterhalder在arXiv上发布论文,提出用**路径积分**(Path Integral)统一描述流模型、扩散模型、变分模型和对抗生成网络(GAN)等主流生成范式。这一框架不仅为理解现有模型提供了新视角,还带来了可操作的性能改进:在特定测试中,将确定性采样器的误差从53%大幅降至1.6%。 ## 核心思想:一个主作用量,多种评估原则 论文的核心在于,将生成建模视为一个路径积分问题,而流模型、扩散模型、变分模型和对抗模型,不过是同一个主作用量(master action)的不同评估方式。这一灵感源自物理学中的**马丁-西格亚-罗斯-詹森-德多米尼西斯(MSRJD)形式**,它原本用于描述随机系统的动力学。 借助MSRJD形式,研究者将概率流分解为“自由”与“相互作用”两部分,从而可以借用**费曼图**和微扰理论进行分析。这种处理方式在生成模型理论中相当新颖,它让原本看似不同的模型家族在数学上被统一起来。 ## 实际收益:无额外采样成本的一圈修正 论文最亮眼的成果之一,是推导出对确定性采样器的**一圈(one-loop)修正**,且不增加任何随机采样的计算开销。在可解漂移和非线性漂移的测试中,该修正将树级误差从53%降至1.6%,效果显著。这意味着,在现有采样器的基础上,只需添加一个解析修正项,就能大幅提升生成样本的准确性,而无需引入额外的随机性。 此外,论文还处理了**不完美学习分数**(imperfect learned scores)的情形。在真实场景中,模型学到的分数函数往往有误差,论文将这种误差视为“插入项”,并由此推导出一个**响应加权的分数匹配目标**,有望改进训练过程。 ## 理论延伸:对称性与EFT幂次计数 论文还探讨了对称性等变的漂移设计,将其表述为算符展开,并引入**有效场论(EFT)幂次计数**。这为设计具有特定对称性的生成模型提供了系统化方法,可能对物理、化学等领域中需要保持对称性的数据建模有重要价值。 ## 意义与展望 这项研究尚处于理论阶段,但为生成模型领域提供了一个统一的数学语言,有望促进不同子领域之间的交叉借鉴。例如,扩散模型的去噪技巧能否直接应用于流模型?GAN的对抗训练能否用路径积分重新解释?这些问题现在有了更清晰的思考框架。 当然,该框架的实际应用仍需进一步验证。论文中展示的数值实验相对简单,未来能否在图像、文本等高维复杂数据上复现类似收益,还有待探索。但无论如何,这一理论尝试为生成式AI的底层逻辑带来了新的洞见,值得关注。

HuggingFace16天前原文

动态图上的深度学习异常检测器已达到较高准确率,但当一条边被标记为异常时,分析人员只得到一个分数,却不知其所以然。这种“黑箱”在强调协作与合规的信息系统中难以被接受,因为自动化决策必须可审计、可信赖。针对这一痛点,一项新研究为经典的 GCN+GRU 框架 AddGraph 提出了首个严格的事后(post-hoc)可解释性方案——X-AddGraph,其核心是一种双时空归因(DSTA)机制,能够在不改动检测器的情况下,揭示异常评分背后的空间与时间线索。 ## 架构对齐的归因设计 X-AddGraph 的巧妙之处在于,其三个归因组件分别对应 AddGraph 的架构模块: - **空间归因**:基于梯度的相关性归因,作用于当前邻接结构,指出哪些节点连接对异常判定贡献最大; - **短期时间归因**:直接读取推理过程中已计算的上下文注意力权重,不增加任何额外计算成本; - **长期时间归因**:通过循环隐藏状态的梯度回滚,追溯历史快照的影响。 由于检测器被冻结,其检测性能完全保留,实验验证 ΔAUC 精确到小数点后十位均为 0。在 UCI Message 基准上,训练后的 AddGraph 基线平均每快照 AUC 达到 0.8705,优于原论文结果;X-AddGraph 在复现每个分数的基础上,补充了此前缺失的解释信息。 ## 长期归因的价值:反事实信号 研究在四类边样本(高置信度真阳性、低置信度真阳性、假阳性、随机样本)上评估了归因效果。结果显示,长期归因能够识别出携带显著更多反事实信号的历史快照(0.127 vs. 0.074),这一能力是任何仅关注空间结构的解释器都无法提供的。这意味着,当系统标记一条异常边时,X-AddGraph 不仅能告诉你“哪里异常”,还能告诉你“何时开始异常”,为分析人员提供了更完整的因果链条。 ## 应用前景与开源 该框架为动态图异常检测的落地提供了重要支撑,尤其是在金融反欺诈、网络安全监控、社交网络风险预警等对可解释性要求极高的场景中。研究人员已公开实现代码,以促进可复现性与后续研究。目前该论文正在投稿至 CoopIS 会议,其方法有望成为图异常检测可解释性研究的新基准。 对于 AI 从业者而言,X-AddGraph 展示了一条“架构对齐”的可解释性路径:不牺牲性能,不增加推理负担,却能显著提升模型透明度。这种思路或许也能迁移至其他循环图神经网络,值得关注。

HuggingFace16天前原文

**睡眠阶段自动分类**是睡眠障碍诊断与管理的核心环节,但长期以来,大多数自动分期研究都依赖单一参考睡眠图(hypnogram)作为金标准,忽略了不同评分者之间的主观差异。这种“单专家”评估模式可能掩盖模型在真实世界中的表现波动。 针对这一问题,一项来自伊朗研究团队的最新研究提出了一种**基于学习的个性化评分建模框架(LBH)**,旨在从多位专家的评分中聚合出更稳健的参考标签。该研究已在 arXiv 上发布(编号:2608.12446),并采用公开数据集 **DOD-H** 和 **DOD-O** 进行验证。 ### 核心方法:从“投票”到“概率聚合” 传统做法通常采用多数投票或选择“最佳评分者”作为参考,但这会丢失个体专家的独有信息。LBH 的思路截然不同:它为每位评分者建立**个性化混淆矩阵**,利用机器学习模型(随机森林、支持向量机、多层感知机)学习每位评分者对不同睡眠阶段的误判模式。 具体而言,研究团队从 EEG(C3-M2)和下颌肌电(chin EMG)信号中提取特征,每 30 秒为一个 epoch,共提取 60 个特征(EEG 与 EMG 各 30 个)。随后,通过列归一化后的混淆矩阵,估计“在评分者给出某标签时,真实睡眠阶段为各阶段的概率”。最后,将所有评分者的概率进行聚合,为每个 epoch 分配最终标签。 ### 结果:全面优于传统基线 实验在 EEG-only 和 EEG+EMG 两种设置下进行,并与数据集原始睡眠图(DH)及最佳评分者睡眠图(BSH)进行对比。结果显示,LBH 在所有分类器和特征组合下均取得了一致性提升。 最佳表现出现在**随机森林 + EEG+EMG** 组合:在 DOD-H 数据集上,准确率达到 **86.07%**,精确率 **85.46%**,F1 分数 **85.29%**;在 DOD-O 数据集上,准确率为 **86.04%**,精确率 **85.21%**,F1 分数 **84.70%**。 ### 意义与展望 这项研究的价值在于,它没有简单地将多专家评分压缩为单一“正确答案”,而是**保留了每位专家的判断特征**,通过概率建模实现了更可靠的参考标签生成。这种方法不仅适用于睡眠分期,也可能推广到其他依赖主观标注的医学影像、病理分析等领域。 当然,该框架仍处于验证阶段,其泛化性需在更多样化的数据集和临床环境中进一步检验。但至少,它为“如何从多个专家中学习”提供了一个值得借鉴的范式。

HuggingFace16天前原文

一项新研究揭示了Transformer模型内部的一种隐藏结构:预测方向(即模型当前预测token的反嵌入方向)在残差流中扮演着“特权锚点”的角色。该发现或有助于理解大语言模型如何在高维空间中组织信息并实现线性读取。 ## 研究发现 研究者Nelson Guda在论文《Geometric and Behavioral Stratification in Transformer Residual Streams》中,对18种不同规模(7B至120B)和架构(稠密及混合专家)的Transformer模型进行了系统性分析。结果发现,残差流中的变化可以依据与预测方向的接近程度进行几何和行为上的分层:靠近预测方向的区域高度结构化,能有效聚类相关提示;而远离预测方向的区域则相对平坦,对提示组的区分能力较弱。 ## 关键结论 - **预测方向作为特权锚点**:预测方向与主方差轴近乎正交,因此传统的方差分析方法只能部分捕捉这种组织,且随着提示异质性增加而失效。 - **窄而关键的预测接口**:靠近预测方向的区域虽然狭窄,但功能上至关重要。干扰这些方向会导致模型立即出现发散和任务框架转换;干扰次近方向则会延迟发散但保持框架。 - **方向而非幅度驱动行为**:研究指出,行为主要由方向而非幅度驱动,且远离预测方向的区域虽然与读取对齐较弱,但在因果和时间上承载着重要功能。 ## 意义与展望 这项研究首次将预测方向确立为一种独特的特权锚点,区别于先前描述的坐标轴,为高维计算与线性读取的共存提供了几何解释。该成果可能对模型可解释性、压缩和微调策略产生深远影响。不过,目前该研究尚未经过同行评审,其结论仍需进一步验证。

HuggingFace16天前原文

多自主水下机器人(AUV)自组网协同目标跟踪,是海洋探测与防御领域的关键技术。然而,在水下声学通信受限、网络拓扑动态变化以及海洋扰动不确定的环境下,实现高效协同面临巨大挑战。尽管多智能体强化学习(MARL)通过集中训练与分散执行展现潜力,但现有方法在高维联合状态-动作建模和策略生成方面存在噪声敏感、训练不稳定等问题。为此,研究者提出了一种名为**VGG-MADiffRL**的值梯度引导多智能体扩散强化学习算法,并配套设计了**MDCA**扩散分层控制架构,为动态水下环境中的协同跟踪提供了新思路。相关论文已提交至arXiv(编号2608.12436)。 ## 方法核心:扩散模型与值梯度结合 VGG-MADiffRL将扩散模型引入多智能体策略学习。扩散模型通过逐步去噪生成动作,天然具备处理高维连续动作空间的能力。但标准扩散策略可能生成低回报动作,为此,算法在逆向去噪过程中引入**值梯度**,引导动作生成朝向更高期望回报的方向。同时,采用**孪生价值网络**与软目标更新,抑制过估计与训练振荡,提升收敛稳定性。 ## 架构设计:三层闭环控制 MDCA架构分为**全局智能控制层**、**本地在线训练层**和**物理动作执行层**,形成三层闭环。全局层负责任务分配与全局优化,本地层基于VGG-MADiffRL进行策略学习,执行层将决策转化为物理动作。这种分层设计实现了任务、决策与执行的协同优化,尤其适应水下通信延迟与拓扑变化。 ## 实验验证与工程价值 实验表明,VGG-MADiffRL在协同跟踪场景中**收敛更快、跟踪精度更高、训练过程更平滑**。研究者还建模了声呐探测机制与海流扰动,使仿真更贴近实际。该方法不仅提升了算法性能,也为多AUV系统在动态水下环境中的实际部署提供了工程参考。 ## 局限与展望 尽管成果显著,但研究仍处于仿真阶段,真实海试尚待开展。未来,如何将算法迁移至真实AUV平台,并应对更复杂的水声信道与能耗约束,是后续研究的重要方向。

HuggingFace16天前原文