深度均衡模型(Deep Equilibrium Models, DEQs)通过隐式微分训练,其梯度计算依赖于求解残差雅可比矩阵的伴随系统。当该矩阵在损失敏感方向上接近奇异时,微小扰动会被强烈放大,导致梯度爆炸,使优化过程不稳定。近期,研究者提出一种名为**响应重整化**(Response Renormalization)的框架,旨在无需全局抑制条件良好的灵敏度即可控制临界伴随放大,从而提升训练的可靠性。 ### 背景与挑战 DEQs 的核心在于寻找一个固定点,使得隐藏表示在模型更新后保持不变。训练时,通过隐式微分计算梯度,需要求解一个基于残差雅可比矩阵的伴随系统。如果该雅可比矩阵在损失敏感方向上接近奇异(即临界状态),伴随响应会对扰动异常敏感,产生巨大且高度不稳定的梯度,导致优化过程不可靠。 ### 响应重整化框架 论文引入**响应重整化**,这是一种后向传播框架,它选择性地提升(lift)接近极点的分母,同时保持未提升的响应通道不变。具体包括两种变体: - **集体模式响应重整化(CMR)**:在低维临界子空间中应用校正,只修正关键方向的响应。 - **Phi-自适应 CMR(Phi-CMR)**:基于正磁化率规则计算有界的响应质量,进一步自适应调整校正程度。 研究者推导了密集和矩阵自由的集体公式,区分了修改后的冻结锚残差的精确梯度与后向响应替代项,并将该构造扩展到结构化隐式层和矢量吸引子(SILVA)。 ### 实验验证 在涵盖偏微分方程、三维场、算子映射、复杂几何和粒子系统的 23 个多物理场族中,CMR 和 Phi-CMR 在超过 **98% 的静态** 和 **95% 的瞬态** 族-种子比较中,测试误差比使用精确隐式微分训练的模型高出不超过 **5%**。求解器索引实验显示其收敛于静态伴随,而物理时间滚动在评估条件下保持了预测保真度。 ### 意义与展望 选择性响应重整化能够在不大幅损失有效梯度信息的前提下,控制临界伴随放大,使参数更新更加可靠。这一方法为训练深度均衡模型提供了一种实用且稳健的替代方案,尤其适用于涉及复杂物理系统的任务。尽管实验效果显著,但该方法在更广泛模型(如大规模语言模型)上的适用性仍有待探索。
在机器学习模型部署中,模型压缩与可靠性往往被视为一对矛盾。近日,一篇题为《Calibration-Preserving Pruning: Compression as a Reliability Contract》的论文提出了一种名为“保校准剪枝”(CPP)的新方法,旨在通过剪枝技术同时实现模型压缩和维持预测可靠性。该研究来自Ibne Farabi Shihab等人,已在arXiv上预印发布(arXiv:2608.23744)。 **核心思想:剪枝不影响覆盖率保证** 论文指出,分割共形预测(Split Conformal Prediction)提供了有限样本下的边际覆盖率保证,只要剪枝后的模型独立于共形校准分割固定下来,覆盖率就不受剪枝规则影响。因此,研究的重点转向了效率问题:剪枝能否保留足够的分数几何结构,从而在保证覆盖率的同时,得到更小的有效预测集? 为此,CPP方法在基础剪枝分数上增加了非一致性梯度显著性(nonconformity-gradient saliency),并采用分离的数据分割策略:剪枝、验证选择、共形校准和测试集各自独立。理论上,有界的分数扰动意味着有界的共形分位数偏移和受控的集合膨胀,但这一性质并不依赖于具体的剪枝规则。 **实验结果:在多个数据集上取得增益** 实验基于Qwen2.5-1.5B模型,在50%稀疏度下进行了五次运行。结果显示,CPP在标签数量多的任务上增益最大。例如,在DBpedia-14数据集上,CPP-SparseGPT将平均预测集大小从10.1降至8.6,同时准确率从0.347提升至0.366;CPP-Wanda则将集合大小从11.2降至9.0,但准确率略有下降(从0.310降至0.295)。在15个数据集-稀疏度组合中,CPP-SparseGPT在13个组合中实现了更小的预测集,在11个组合中获得了更高的准确率。 **对比分析:监督梯度贡献显著** 进一步分析显示,通用的监督梯度解释了许多增益:在匹配的对照实验中,真正的标签CPP与Wanda+SNIP的差异在统计上并不显著,而阈值感知的候选标签CPP在显式准确率和离线计算成本下,实现了7.8的平均集合大小。此外,RoBERTa-base和Llama-3-8B的诊断实验支持了方法的可迁移性,但作者强调,研究结论仅限于对可靠性敏感的分类任务。 **总结与展望** 这项研究为模型压缩提供了一个新视角:剪枝不仅是为了减少计算量,更可以作为一种“可靠性契约”,在压缩过程中保持预测的可靠性。尽管仍存在一些未解决的问题,如统计显著性等,但CPP展示了在保持覆盖率的同时提高效率的潜力。未来,该方法有望在更多模型和任务上得到验证和推广。
在低秩恢复问题中,核范数最小化是一种常用的凸松弛技术,而迭代重加权最小二乘(IRLS)方法因其简洁和高效而广受关注。然而,IRLS算法的收敛速率以及权重算子的作用此前并未得到充分理解。一篇新近发布的论文(arXiv:2608.23765)对此进行了深入分析,为核范数最小化的IRLS方法建立了精确的收敛速率理论,并揭示了调和均值权重算子的最优性。 ### 核心贡献:调和均值权重的理论证明 该研究的关键创新在于对平滑核范数提出了一种新的主导分析(majorization analysis)。作者证明了调和均值权重算子能够定义有效的全局二次主导函数,并且在该权重算子族(power-mean权重)中,调和均值权重是最优的。这一结果解释了为何调和均值权重优于仅利用行空间或列空间信息的经典单侧重加权方案。 ### 收敛速率的突破性结论 在Schatten-1零空间性质下,作者证明了使用多种权重算子的IRLS算法具有全局线性收敛性。特别地,对于调和均值权重的IRLS,他们进一步证明了**维度无关的局部线性收敛速率**。这一结论具有重要意义,因为作者同时构造了一个反例,表明使用单侧权重算子的IRLS算法(在文献中占主导地位)通常无法获得这种维度无关的局部速率。换句话说,调和均值权重在理论上提供了更优的收敛保证。 ### 实验验证与实际意义 论文通过数值实验验证了理论结果,并展示了调和均值重加权在方形、矩形以及对抗性初始化恢复问题中的实际优势。这些发现不仅弥补了IRLS方法理论分析的空白,也为实际应用中选择权重算子提供了明确的指导。对于从事低秩矩阵恢复、压缩感知或机器学习优化研究的学者和工程师而言,该研究提供了一种更可靠且高效的算法选择。 ### 总结与展望 这项研究深化了我们对IRLS方法内在机制的理解,特别是权重算子在收敛性中的核心作用。未来,基于调和均值权重的IRLS有望在更多实际问题中得到应用,并可能启发新的算法设计。不过,该研究主要聚焦于理论收敛速率的刻画,其在实际大规模问题中的计算效率仍有待进一步探索。
在人工智能与人类协作日益紧密的今天,如何让AI准确理解人类的技能水平,成为提升协作效率的关键。传统方法往往依赖单次观察来估计潜在变量,但技能并非如此——它是一种持久、组合且基于行为的构建,需要从时间模式中推断。为此,研究人员提出了**SAIL**(Skill Abstraction with Interpretable Latents),一种将人类技能建模为可解释多维结构的新方法。 ## 技能:从单点观测到时间模式 技能与情绪、疲劳等瞬时状态不同,它是个体长期稳定的属性,且由多个子技能组合而成。例如,赛车手的技能不仅包括过弯技巧,还涵盖刹车控制、路线选择等。SAIL的核心在于,通过观察个体在一段时间内的自然行为,提取出稳健的技能嵌入,从而抵御瞬时波动的影响。 ## SAIL的工作原理 SAIL为每个个体分配一个持久的技能嵌入向量,该向量控制着专家与新手基线的混合比例。训练过程中,模型采用**反事实子技能交换**(counterfactual subskill swaps)来促进解耦,即通过交换不同个体的子技能特征,迫使模型学习到独立、可解释的表征。这种设计既保证了表征对性能波动的鲁棒性,又增强了其可解释性。 ## 实验验证:赛车与棒球 研究团队在赛车和棒球两个领域进行了验证。结果表明,SAIL在行为预测上表现出色,且相较于基线方法,在基于行为的解耦指标上持续提升。更重要的是,SAIL还改进了下游AI教练系统的性能,这意味着它不仅能理解技能,还能为个性化指导提供支持。 ## 应用前景 SAIL的提出为AI系统在协作、辅导和辅助场景中的应用开辟了新路径。例如,在体育训练中,AI教练可根据运动员的技能嵌入提供针对性建议;在人机协作中,机器人可调整自身行为以适应用户的技能水平。尽管SAIL目前仅在特定领域测试,但其框架具有通用性,未来有望扩展到更多复杂场景。 不过,SAIL仍面临挑战,如如何定义和获取专家与新手基线,以及如何在不同任务间迁移技能表征。这些问题将是未来研究的方向。 总体而言,SAIL通过解耦技能表征,让AI对人类的认知迈出了一步,也为更自然的人机交互奠定了基础。
作为一名硕士工程学生,我对 LaTeX 情有独钟,毕业论文和研究论文都离不开它。Overleaf 用起来不错,但 git 同步功能需要付费,这让我很不满。我不愿意为那些本应免费的功能付费,于是决定自己动手,开发了 TeXbrain——一个完全在浏览器中运行的开源 LaTeX 编辑器。 TeXbrain 的核心亮点在于,它利用 WebAssembly 将 pdfTeX 编译为 WASM 并在浏览器端运行,实现了真正的本地编译。无需安装、无需注册、无需服务器,打开浏览器即可写作并生成 PDF。所有操作,包括编辑、编译、git 操作,都在客户端完成,文件不会离开你的设备。 它支持按需加载 CTAN 包,首次编译时仅下载所需宏包,之后缓存本地,离线也能用。实时预览基于 pdf.js,支持多页缩放和文本选择。git 集成由 isomorphic-git 驱动,可直接克隆仓库、分支、提交、推送,无需命令行。本地文件系统访问则依赖 File System Access API,支持 Chrome/Edge 浏览器。 编辑器基于 CodeMirror 6,提供语法高亮、自动补全、代码折叠、片段等功能。命令面板和片段选择器让操作更高效。整体设计强调离线可用,一旦加载完成,无需网络即可正常使用。 TeXbrain 的出现,为 LaTeX 用户提供了一个免费、开源且尊重隐私的替代方案,尤其适合那些希望完全掌控工作流、又不想被订阅费用束缚的人。它展示了 WebAssembly 在复杂应用中的巨大潜力,让专业工具平民化。
上周,世界人形机器人运动会在中国举行,展示了人形机器人领域的最新进展。比赛中,机器人竞速项目打破了纪录,但也有机器人在演示过程中起火,场面一度惊险。然而,业内人士指出,这些破纪录的机器人竞赛虽然吸引眼球,但实际价值远不如日常家务挑战。 ## 机器人运动会:速度与激情的背后 本次运动会最引人注目的项目是机器人竞速。参赛的人形机器人以惊人的速度奔跑,突破了以往的速度极限。然而,速度并非一切。在另一个演示环节,一台机器人在运行时突然起火,虽然火势很快被扑灭,但这一幕提醒我们,人形机器人在稳定性和安全性方面仍有很长的路要走。 ## 家务挑战:更贴近实际应用的考验 与竞速项目相比,家务挑战赛看似平淡,却更贴近机器人的实际应用场景。家务挑战要求机器人完成叠衣服、整理物品、清洁桌面等任务,这些看似简单的动作,实则对机器人的感知、决策和精细操作能力提出了极高要求。专家认为,能够稳定完成家务任务的机器人,才更有可能进入家庭和办公环境,成为人类的得力助手。 ## 行业趋势:从炫技到实用 近年来,人形机器人领域的热度持续攀升,各大科技公司纷纷布局。但运动会的对比也反映出行业的一个趋势:**从追求炫技到注重实用**。竞速表演固然能吸引公众目光,但真正决定机器人能否落地的,是其能否在复杂环境中可靠地完成日常任务。 业内分析指出,家务挑战中的表现更能体现机器人的综合能力,包括视觉识别、路径规划、力控制等。这些能力正是机器人从实验室走向现实世界的关键。 ## 结语 世界人形机器人运动会不仅是一场技术的较量,更是一次行业风向的展示。破纪录的竞速令人兴奋,而起火事件则敲响了安全的警钟。或许,下一次运动会,我们更应关注那些看似平凡的家务挑战,因为它们更可能预示着机器人技术的未来方向。
The company's new fundraising total now stands at $232 million.
Amazon OpenSearch Service now supports MCP Apps, which return interactive visualizations alongside your AI agent's text responses. Learn how a single, locally run MCP server lets your agent move from alert to trace to logs to root cause in one conversation, and how you can verify every step inline without leaving your IDE.
Will moving dots cure your car nausea? History says yes.
The offer is open to subscribers on any tier, but it is location-based.
Anthropic is giving Claude a shared memory across chat and Cowork, so users no longer have to repeatedly brief the AI on projects, preferences, and other context.
Anthropic is merging Claude chat and Cowork memory, raising privacy questions about what AI remembers and if it's worth the tradeoff.
Build a governed weekly reporting workflow with Amazon Quick Desktop and Amazon FSx for NetApp ONTAP. An Amazon S3 access point exposes an approved folder to a Quick knowledge base, and a custom skill drafts cited weekly reports and Slack summaries with human review before anything is shared.
Labor Day is still a couple of weeks away, but some of the best laptop deals are already live. Here are a dozen we recommend.
I had seven years' worth of points I didn't know about, and now I have a Starbucks card to show for them.
I ditched T-Mobile for Mint and found 3 major drawbacks of smaller carriers - and their workarounds
新上线Downsizing from a 'big three' carrier can save you big money, but it has its downsides. Here's how I'm adapting to them.
FydeOS aims to bring a Google Chromebook-like experience to standard PCs, and it succeeds - with a caveat or two.
在汽车智能化浪潮中,一位开发者展示了如何用一台树莓派(Raspberry Pi)运行35B参数的大语言模型,打造一个完全离线的车载AI助手。这个名为CarWatch的项目,将树莓派5嵌入车内,通过Qwen模型实现与车主的自然语言交互,不仅能够读取车辆内部数据,还能调用制造商云服务控制空调、门锁等,甚至能回答车主手册中的问题。 ## 核心亮点:35B模型跑在树莓派上 最令人惊讶的是,CarWatch在树莓派5(16GB内存,约300欧元)上运行了**Qwen3.6-35B-A3B**模型,采用Unsloth的UD-Q3_K_S动态量化,模型大小14.3GB。生成速度达到**3.5 token/s**,提示处理速度超过**25 token/s**,持续运行温度65°C。这意味着,即使没有云端连接,车辆也能拥有一个智能的“大脑”。 ## 深度集成:从车辆数据到云端控制 CarWatch通过OBD接口读取车辆内部信息,并连接到制造商的云服务,实现远程控制空调、开关门锁等功能。此外,它还集成了Home Assistant,通过Tailscale建立私有加密网络,确保在行驶中也能安全地访问家庭网络中的设备。 ## 知识库与自我认知:严谨的AI CarWatch内置了车辆的用户手册(745页),通过词法RAG技术,能够引用手册中的具体页码来回答问题。更重要的是,它明确区分自己感知到的信息(如温度、风扇、内存、网络状态)和无法感知的信息,避免产生幻觉。系统提示词设计确保未知内容不会被当作事实陈述。 ## 语音交互与自治能力 项目支持免提语音交互,通过能量检测和whisper.cpp实现本地语音识别,无需唤醒词,所有处理都在树莓派上完成。同时,CarWatch通过systemd服务实现开机自启,并能自动更新、建立隧道连接,即使在手机热点NAT之后也能远程访问。 ## 零依赖与开源精神 CarWatch的所有代码仅使用Python标准库,无需pip安装任何依赖,克隆即可运行。开发者通过AST扫描验证了这一点。项目已在GitHub上开源,吸引了大量关注。 这个项目展示了边缘AI的巨大潜力,将大模型部署到低功耗设备上,为汽车智能化提供了新的思路。尽管速度有限,但完全离线的特性保障了隐私,同时也为未来更强大的边缘AI应用奠定了基础。
A pioneering AI scientist once predicted computers would replace human radiologists. They haven't.
Lica co-founders are going to work on Gamma's new research team.