SheepNav

AI 资讯

每日聚合最新人工智能动态

## 资本涌入:加拿大养老金加入印度数据中心竞赛 印度AI驱动的数据中心建设热潮正吸引全球资本的目光。最新入局者是加拿大的一家大型养老基金,它将以 **8.2%** 的股权入股 **CtrlS**——这家印度本土科技巨头运营着超过15座数据中心,是该国最大的数据中心运营商之一。 ### 为何印度数据中心成为“香饽饽”? 随着AI模型训练和推理对算力的需求呈指数级增长,数据中心成为AI基础设施的关键一环。印度拥有庞大的人口基数、快速数字化的经济以及政府推动的“数字印度”计划,使得其对数据中心的需求格外旺盛。无论是本土科技公司还是跨国云服务商(如AWS、微软Azure、谷歌云),都在加速在印布局。 CtrlS作为印度领先的数据中心提供商,其业务覆盖从托管到云服务的全链条。此次加拿大养老基金的注资,不仅是对CtrlS运营能力的认可,更是对印度AI基础设施长期增长潜力的押注。 ### 全球资本竞逐AI基础设施 近年来,养老基金、主权财富基金等长期资本纷纷涌入数据中心赛道。这类资产具有稳定的现金流和长期增值潜力,与养老基金的负债匹配需求高度契合。此前,加拿大养老金计划投资委员会(CPPIB)已投资于全球多家数据中心运营商,而此次对CtrlS的投资进一步扩展了其在新兴市场的布局。 印度的数据中心市场预计在未来几年将保持 **20% 以上的年增长率**,这无疑吸引了大量寻求高回报的资本。但竞争同样激烈:本土企业如 **Nxtra Data**(Bharti Airtel旗下)、**Yotta Infrastructure**,以及国际巨头 **Equinix**、**Digital Realty** 等均已在此深耕。 ### 小结 加拿大养老基金入股CtrlS,是国际资本对印度AI基础设施信心增强的一个缩影。随着AI应用落地加速,数据中心作为“算力底座”的战略价值将持续凸显。对于投资者而言,如何在快速增长的市场中筛选出技术过硬、运营稳健的合作伙伴,将是决定成败的关键。而对于印度,这波资本热潮有望推动其数据中心产业迈向更高水平,为AI创新提供更坚实的支撑。

TechCrunch1个月前原文
人形机器人跑马拉松的秘密:电机与齿轮比

人形机器人跑马拉松?这听起来像是科幻小说的情节,但如今已成为现实。最近,一则关于人形机器人冲刺完成半程马拉松的新闻引发热议。许多人惊叹于其运动能力,却不知这背后并非魔法,而是扎实的工程学——**电机与齿轮比的精妙配合**。 ## 从实验室到赛道:机器人运动能力的跃升 长期以来,人形机器人以笨拙、缓慢的形象示人,尤其在动态平衡和高效运动方面存在巨大挑战。然而,随着电机技术和传动系统的进步,机器人逐渐具备了更接近人类的运动能力。**马拉松**这一极端耐力测试,不仅要求机器人持续运行数小时,还需要应对复杂地形和能量管理问题。 ## 关键核心:电机与齿轮比 文章指出,人形机器人实现长距离奔跑的核心在于**电机**和**齿轮比**的优化。电机提供动力,而齿轮比则决定了力与速度的平衡。高扭矩电机配合适当的减速比,能让机器人在起步和爬坡时获得足够力量,同时在平路保持高速。这种设计借鉴了生物力学原理——人类肌肉和骨骼的杠杆系统,本质上也是一种“生物齿轮”。 此外,高效的能量回收与散热系统也至关重要。机器人需要像人类一样管理“步频”和“步幅”,通过控制算法实时调整姿态,避免能量浪费。例如,**Ghost Robotics** 等公司的研究显示,通过优化关节驱动器的阻抗和弹性,机器人奔跑效率可提升 30% 以上。 ## 行业意义与未来展望 这一突破不仅是工程胜利,更预示着人形机器人在**救灾、物流、探索**等领域的应用潜力。能够长距离自主移动的机器人,将能替代人类进入危险环境执行任务。然而,当前技术仍面临续航、成本和可靠性等挑战。随着电机、电池和材料科学的进步,**马拉松机器人**或许只是开始——未来,我们可能看到机器人参与更复杂的户外作业。 ## 小结 人形机器人的马拉松成绩,是电机、齿轮比与控制算法协同优化的结果。它提醒我们:看似神奇的进步,往往源于基础工程的扎实积累。

IEEE AI1个月前原文

德国翻译初创公司 DeepL 近日宣布收购实时音频公司 Mixhalo,后者专注于为音乐会、体育赛事和会议等现场活动提供高质量音频传输。此次收购将帮助 DeepL 在旧金山设立办公室,拓展美国业务,并强化其语音翻译能力,尤其是在实时场景下的应用。 ## 收购背景与细节 Mixhalo 成立于 2016 年,由 Incubus 吉他手 Mike Einziger、小提琴家 Ann Marie Simpson-Einziger 和现任 CEO Vik Singh 共同创立。公司最初旨在改善演唱会观众的音频体验,后来逐步发展为体育赛事和现场活动提供实时音频服务。截至目前,Mixhalo 已累计融资超过 **3900 万美元**,投资方包括 Fortress Investment、Founders Fund 和 Cowboy Ventures 等。 Mixhalo 的 CEO Vik Singh 透露,公司此前已将 DeepL 作为主要翻译供应商,双方的合作关系自然而然地促成了收购。在 DeepL 的客户晚宴上,Singh 与 DeepL 的 CTO Sebastian 相邻而坐,深入交流后发现两家公司在事件空间、API 和应用层(如会议语音、文档翻译、现场活动)上存在高度重叠。 ## 战略意义与行业影响 DeepL 长期专注于文本翻译,但近年来开始加大语音产品的投入。2024 年,DeepL 推出了覆盖 **33 种以上语言** 的语音到文本翻译功能;今年 4 月,又发布了语音到语音翻译套件,支持多语言会议等场景。收购 Mixhalo 将使 DeepL 能够将这一套件直接应用于现场活动领域,同时 Mixhalo 本身也将作为一个 **营销案例**,展示 DeepL 技术在实时、高要求环境下的表现。 Singh 指出,虽然语音 AI 模型的爆发为 Mixhalo 提供了更多集成选择,但大型模型公司逐渐侵入其市场,导致价格竞争加剧。与 DeepL 的合并有助于 Mixhalo 在定价上获得优势,并借助 DeepL 的资源和品牌扩大影响力。 ## 未来展望 此次收购后,DeepL 将在旧金山设立办公室,进一步扩大美国业务。对于用户而言,这意味着未来在大型会议或演唱会上,可能不再需要掏出手机打开翻译应用,而是直接通过现场音频流获得 **实时翻译**。DeepL 的语音翻译技术与 Mixhalo 的音频传输能力结合,有望重塑现场活动的多语言体验。 随着 AI 翻译市场竞争日益激烈,DeepL 通过收购快速补足实时场景短板,展现了其从文本向全场景翻译服务商转型的决心。

TechCrunch1个月前原文
通用汽车将开发周期缩短一半:前特斯拉工程师领航AI战略,追赶中国车企

为应对中国车企的快速迭代压力,通用汽车(GM)正借助人工智能大幅缩短车辆开发周期,目标是从传统的四年缩短至两年。这一变革由一位前特斯拉工程师主导,通过AI驱动的仿真模拟、自动化设计和制造流程优化,GM试图在速度与质量间找到平衡。 ## 背景:中国车企的“快鱼”效应 近年来,中国车企如比亚迪、蔚来等凭借快速的产品迭代和智能化优势,在全球市场迅速崛起。传统车企通常需要4-5年才能完成一款新车从设计到量产的全过程,而中国竞争对手已能将周期压缩至18-24个月。这种速度差距迫使GM重新审视其开发流程。 ## AI赋能:从仿真到制造 GM的核心策略是全面应用AI技术。在**设计阶段**,AI驱动的计算流体动力学(CFD)仿真可快速模拟车辆空气动力学性能,替代部分物理风洞测试,将设计验证时间从数月缩短至数周。**制造环节**中,AI算法优化生产线排程和机器人路径,减少停工和调试时间。此外,生成式AI被用于自动生成零部件设计方案,工程师只需输入性能参数,系统即可输出数百种候选方案供筛选。 ## 关键人物:前特斯拉工程师的“速度哲学” GM此次AI转型的领军人物是一位曾参与特斯拉Model 3和Model Y开发的工程师。他引入的“快速失败”理念强调:让AI在虚拟环境中快速测试大量方案,即使失败也能低成本获取经验,而非依赖物理原型反复修改。这种思路与GM传统的“瀑布式开发”形成鲜明对比。 ## 挑战与隐忧 尽管AI加速开发前景诱人,但GM面临多重挑战。首先,**数据质量**是关键——AI模型需要海量高质量训练数据,而GM的历史数据分散在不同部门和系统中。其次,**安全与可靠性**不容妥协:缩短测试周期可能增加未充分验证的风险,尤其是涉及自动驾驶功能时。此外,**组织文化阻力**也不可忽视:工程师习惯了传统流程,转向AI驱动需要大量培训和思维转变。 ## 行业影响与未来展望 GM的激进举措可能引发传统车企的连锁反应。福特、大众等已宣布类似AI加速计划,但能否真正落地尚待观察。若GM成功,将重新定义汽车行业的开发效率标准;若失败,则可能因急于求成而陷入质量危机。无论如何,这场由AI引发的速度竞赛已拉开帷幕,中国车企的先发优势正倒逼全球玩家做出改变。

IEEE AI1个月前原文
更智能的充电方式,能让电池寿命延长数年

电池老化是电动汽车和消费电子领域长期面临的痛点。传统充电策略通常采用固定参数,忽略了电池随使用时间发生的化学变化。瑞典查尔姆斯理工大学(Chalmers University of Technology)的研究人员开发了一种基于人工智能的控制系统,能够根据电池的实际老化状态动态调整充电参数,有望将电池寿命延长数年。 该研究的核心在于利用AI模型实时分析电池的健康状态(State of Health, SoH),并据此优化充电电流和电压曲线。研究团队使用恒电位仪(potentiostat)精确控制电极间电压并测量电流,生成了大量电池老化数据,用于训练AI模型。相比传统“一刀切”的充电策略,AI控制器能够识别电池内部阻抗增加、容量衰减等细微变化,并采取更温和的充电方式,减少锂枝晶形成和电极材料应力,从而延缓退化。 这项技术对电动汽车行业意义尤为重大。电池组是电动汽车最昂贵的部件,延长其寿命可直接降低用户的使用成本,并减少电池更换带来的环境负担。同时,对于智能手机、笔记本电脑等消费电子产品,智能充电也有望缓解用户对电池衰减的焦虑。 然而,该技术目前仍处于实验室阶段。要将AI控制器集成到实际充电器中,还需要解决计算资源、实时性以及不同电池化学体系的适配问题。研究人员表示,未来随着边缘计算能力提升和电池管理系统的智能化,这种自适应充电策略有望成为主流。 总体而言,这项研究展示了AI在电池管理领域的巨大潜力。通过让充电过程“因材施教”,我们或许能更充分地利用每一块电池的生命周期,推动能源存储技术的可持续发展。

IEEE AI1个月前原文

Pinterest 于周三宣布推出一款名为“Ask Pinterest”的实验性应用,旨在通过对话式界面为用户提供购物推荐与灵感。该应用目前仅限有限访问,利用 Pinterest 的“品味图谱”(Taste Graph)——即用户兴趣与审美的内部数据映射——来提供个性化建议。与传统的 Pinterest 搜索不同,Ask Pinterest 能处理更复杂的多步骤查询,例如“策划一场晚宴”或“逐步布置房间”,并支持跨会话保留用户上下文。此外,它还能结合用户保存的 Pin 图和画板来定制答案。Pinterest 表示,这些测试结果将用于改进主应用中的 AI 体验。该消息发布之际,正值广告技术行业年度盛会戛纳国际创意节前夕,今年大会重点聚焦 AI 如何服务广告主与营销人员。同期,Pinterest 还推出了面向广告商的 Pinterest 模型上下文协议(MCP)及其他 AI 广告工具。 随着 AI 聊天机器人日益与传统搜索引擎争夺用户注意力,Google、ChatGPT、Meta、Shopify 等巨头纷纷涉足 AI 购物领域。Pinterest 并未选择通过授权协议将自身产品推荐数据提供给其他 AI 服务,而是坚持利用自有数据训练模型、驱动 AI 产品。通过将 Ask Pinterest 做成独立应用,Pinterest 得以在不干扰主应用体验的前提下进行技术试验。 ## 核心功能与行业背景 Ask Pinterest 的推出反映了 AI 购物领域的几个关键趋势: - **对话式发现**:用户可以用自然语言提问,获得类似聊天机器人的互动体验,这比传统关键词搜索更直观。 - **复杂任务支持**:传统搜索难以处理“为朋友准备素食晚餐”这类多步骤需求,而 Ask Pinterest 能分解任务并提供连贯建议。 - **数据壁垒**:Pinterest 选择闭源策略,不对外授权数据,而是构建自有 AI 生态,这与其他平台开放 API 的做法形成对比。 ## 对行业的影响 Pinterest 的这一步棋可能加剧 AI 购物领域的竞争。一方面,其独特的“品味图谱”数据可能成为差异化优势——相比通用搜索引擎,Pinterest 更懂用户的审美偏好。另一方面,独立应用的形式降低了用户迁移成本:如果体验优秀,用户可能从主应用分流;反之,则不会影响核心产品。 值得注意的是,Pinterest 强调 Ask Pinterest 目前仅为“实验性”产品,尚未公布正式上线时间表。这暗示公司仍在谨慎探索 AI 与购物的结合点,避免重蹈其他平台因仓促推出 AI 功能而引发隐私或准确性质疑的覆辙。 ## 小结 Ask Pinterest 是 Pinterest 在 AI 购物领域的一次重要尝试,其对话式、个性化、跨会话的特点有望重塑产品发现方式。然而,在巨头环伺的赛道中,它能否凭借数据优势突围,仍有待市场检验。

TechCrunch1个月前原文

法国初创公司 Genesis AI 近日发布了一款名为 Eno 的机器人,其外观与传统人形机器人截然不同:没有头部,没有双腿,甚至采用轮式底座,可以像折叠椅一样收折。该公司由前 Google CEO 埃里克·施密特投资,明确提出“人形机器人不需要看起来像人”,Eno 的设计理念是“围绕人类能力”而非人类外形。 然而,Eno 在一点上保留了强烈的人类特征:它的双手。Genesis 表示,Eno 的双手“精确匹配人类手部的形态和功能”,使其能够直接使用为人类设计的工具和物品,从而在真实世界中完成多种任务。公司宣称 Eno 是“通用型”机器人,而非仅擅长折叠衣物等单一功能的机器。 Genesis 计划在 2026 年底前启动生产并面向特定客户部署,初期瞄准制造业、实验室和物流领域,随后扩展至医院、酒店和消费市场。公司还透露正在开发“其他形态版本”。 这一设计思路折射出当前人形机器人领域的分歧:一部分企业追求外观与人类高度相似,以提升社会接受度;另一部分则强调功能优先,认为外形应完全服从于任务需求。Eno 的发布标志着后一种路线获得了重量级资本的支持。随着施密特的背书,以及通用机器人市场的持续升温,Eno 能否在实用性上超越传统仿人机器人,将成为行业关注焦点。

The Verge1个月前原文

多模态大语言模型(MLLMs)的知识编辑技术虽能高效更新模型知识,但最新研究揭示了一个关键漏洞:当输入为图文配对时,实体知识可被成功更新;然而一旦将配对输入拆分为单模态(仅文本或仅图像),模型往往会“遗忘”更新内容,回退至编辑前的旧知识。这一现象被称为**编辑解耦失败(editing decoupling failure)**,其根源在于MLLMs中的实体知识并非以统一表征存储,而是分散在解耦的模态特定通路中。 来自多所机构的研究团队(Tingchao Fu等)在论文《Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs》中,通过深入实证分析揭示了这一机制:多模态查询(图文对)引发的更新偏向于多模态通路,但无法有效传播至单模态回路,导致模型在单模态输入下“失忆”。 为解决该问题,团队提出**DECODE**方法,核心思路是显式解耦并定位不同模态对应的神经元群组,然后针对性地实施知识编辑。具体而言,DECODE首先通过激活模式分析识别出与文本、图像及多模态关联紧密的神经元子集,随后在编辑过程中对这些模态特定神经元分别施加约束,确保更新能同时作用于多模态和单模态推理路径。 实验在多个基准数据集上验证了DECODE的有效性: - 在多模态触发(图文对)下,DECODE的知识更新准确率与现有方法持平或更优; - 在单模态触发(仅文本或仅图像)下,DECODE显著优于基线,编辑后模型能保持更新知识,而基线方法则出现大幅衰退; - 消融实验进一步证实,模态解耦与局部编辑是缓解解耦失败的关键组件。 这项工作的启示在于:**MLLMs的知识编辑不能仅关注多模态表现,必须兼顾单模态泛化能力**。DECODE通过模态特定神经元定位提供了一种轻量级解决方案,不依赖额外训练数据或模型结构修改。未来,该方向可延伸至更多模态(如视频、音频)以及动态知识更新场景。 论文已发布于arXiv(2606.17057),并提供了实验代码与可视化分析工具。对于从事模型编辑、多模态对齐及AI安全的研究者而言,该工作揭示了当前编辑范式的盲区,并为构建更鲁棒的知识更新机制奠定了基础。

HuggingFace1个月前原文

电子健康记录中的实验室检测数据往往采集不规律,而检测的缺失本身可能蕴含着与测量值同等重要的信息。近日,一项发表在 arXiv 上的研究提出了一种基于扩散模型的新方法,能够联合建模实验室检测值及其观察模式,从而生成更真实的临床时间序列数据。 ## 研究背景与核心问题 在临床实践中,医生决定何时进行某项实验室检测——例如,病情稳定的患者可能检测频率较低,而危重患者则可能接受更密集的监测。这种检测的“缺失”并非随机,而是反映了临床决策和患者生理状态。传统方法通常将缺失值视为预处理中的噪声或插补对象,但这样做会丢失缺失模式本身所携带的信息。该研究试图将缺失模式作为模型的一部分,直接捕捉其与生理指标之间的关联。 ## 方法:扩散模型联合建模 研究团队基于 **TimeDiff** 框架进行扩展,设计了一个能够同时处理连续实验室值和离散缺失模式的扩散模型。模型使用 **MIMIC-III** 数据库中的 **DACMI** 基准数据集,将检测时间对齐到 4 小时间隔,并将每次住院分割为 7 天窗口。每个时间点的数据包含一个实验室值和对应的观察指示器(0/1,表示是否在该时间点进行了检测)。通过互补的扩散目标函数,模型学习值分布和缺失模式的联合分布。 ## 实验结果与意义 实验结果显示,生成的数据在单个实验室值分布以及“值-缺失”联合嵌入空间上,均与真实患者轨迹高度吻合。这表明扩散模型能够捕捉临床实践中 **非随机缺失** 条件下的生理-检测行为依赖关系。研究者指出,这项工作可作为开发临床基础模型的初始组件——通过生成保留关键生理-缺失关系的合成先验,为后续训练 **先验数据拟合网络** 提供基础,从而充分利用信息性缺失模式。 ## 行业背景与展望 在医疗 AI 领域,如何处理不规则时间序列中的缺失数据一直是个难题。传统插补方法可能引入偏差,而忽略缺失模式则损失临床洞察。该研究将缺失视为“信号”而非“噪声”,为电子健康记录的数据生成、模型预训练和下游任务(如预后预测)提供了新思路。未来工作在更大规模数据上的验证,有望推动临床决策支持系统更准确地模拟真实医疗场景。

HuggingFace1个月前原文

## 核心观点:KV缓存不只是缓存,更是可编辑的“笔记” 大型语言模型(LLM)推理中的前缀缓存(Prefix Caching)通常假设:只有完全匹配的前缀才能复用预填充结果。一旦前缀中某个字段发生变化,整个下游缓存就会失效,必须重新计算。然而,一篇来自 arXiv 的新论文提出了颠覆性观点:**KV 缓存本质上是模型在预填充阶段写下的“笔记”**,它不仅可复用,还**可编辑**和**可组合**。 ## 发现:字段自身KV对决策贡献不足1% 研究者在四个模型家族上进行因果分析后发现,当模型在预填充阶段处理一个字段(例如用户输入中的某个参数)时,它实际上已经将该字段的条件结论写入了后续位置的“笔记”(即 KV 缓存中的 value 向量)中。**字段自身的 key/value 向量对最终决策的贡献不足 1%**,真正起作用的是那些“笔记”内容。因此,直接覆盖字段的 key/value 向量并复用其余缓存,模型仍然会基于旧值行动——因为笔记没有被修改。 ## 能力一:可编辑的KV缓存 既然 KV 缓存是笔记,那么就可以像修改文档一样编辑它。论文提出了一种“勘误”(erratum)机制:只需在缓存末尾追加一个修正标记,就能修改笔记中的结论。实验表明,**结合思维链(Chain-of-Thought)时,仅编辑字段本身即可完全恢复正确决策**(在 8B 模型上准确率 1.00,仅需约 1% 的计算量);而不使用思维链时,编辑则被忽略。这意味着编辑效果依赖于模型内部的推理结构。 ## 能力二:可组合的KV缓存 笔记还有一个关键特性:**位置可移植**。由于笔记内容与绝对位置解耦(通过旋转位置编码 RoPE 调整),一个预编译好的“技能”(例如一段推理步骤的 KV 缓存)可以被重新定位并拼接到任意上下文中,效果与完全重新计算**不可区分**(logit 余弦相似度 0.90-0.999,涵盖 12 个模型)。而拼接的时间复杂度仅为 O(L),远低于完全重算的 O(L²),大幅降低首 token 延迟。 ## 统一框架:编辑+组合,延迟降低14.9倍 论文将编辑和组合能力统一到一个智能体框架中,在保持决策与完全重算一致的前提下,**延迟最高降低 14.9 倍**。该方法适用于任何逐 token 注意力 KV 缓存,并在不同规模、量化、混合专家模型(MoE)以及多模态缓存上得到验证。对于部分注意力变体,只需通过小型适配器即可扩展。 ## 兼容现有生产系统:vLLM缓存命中率98.5% 由于勘误仅追加在缓存末尾,它天然兼容生产级前缀缓存系统。在在线 vLLM 基准测试中,该方法**保持了 98.5% 的缓存命中率**,并将 p90 首 token 延迟降低了 **53-398 倍**——这意味着用户几乎感觉不到延迟。 ## 意义与展望 这项工作从根本上重新定义了 KV 缓存的角色:它不再是被动的高速缓存,而是模型推理过程中主动生成的、可修改、可迁移的“笔记”。这为 LLM 推理优化开辟了新方向——例如在线持续学习、个性化模型调整、多轮对话中的动态上下文编辑等。未来,我们或许能看到模型在推理过程中实时“涂改”自己的笔记,而非每次都从头计算。

HuggingFace1个月前原文

在药物警戒领域,区分真实的药物不良反应(ADE)与虚假关联一直是个核心难题。InferBERT框架将Transformer模型与Do-calculus相结合,但其成功高度依赖于底层分类模型的选择。最新研究对InferBERT框架下的四种分类模型进行了系统性比较,揭示了领域预训练的重要性远超模型规模。 ## 研究背景与实验设计 药物不良反应的因果推断面临两大挑战:一是混杂因素导致的虚假关联,二是传统信号检测方法(如PRR、ROR、EBGM)无法区分因果与非因果关联。InferBERT通过整合Transformer的上下文理解能力与因果推断的Do-calculus,为这一问题提供了新思路。但框架中的分类模型选择是否影响最终效果?研究者选取了**XGBoost**(基线模型)、**ALBERT**(原始InferBERT模型)、**BioBERT**(生物医学领域预训练Transformer)和**Med-LLaMA**(医学大语言模型)四种代表性模型,在两个基准数据集——**镇痛药诱导的急性肝衰竭(AILF)**和**曲马多相关死亡率(TRAM)**上进行了严格比较。 实验采用**5折交叉验证重复20次**,评估指标包括准确率、校准误差(ECE,含等渗回归前后)以及因果术语与PRR、ROR、EBGM的一致性(Jaccard系数),并辅以配对t检验验证显著性。 ## 关键发现:领域预训练胜过规模扩展 结果明确显示,**BioBERT在两个数据集上均取得了最高准确率**,而**Med-LLaMA尽管参数规模庞大且采用参数高效微调,表现却不尽如人意**。这一反直觉结果说明,对于药物警戒这一专业领域,**领域特定的预训练(如BioBERT在生物医学语料上的预训练)比单纯扩大模型规模更具优势**。校准技术虽能改善ECE,但对准确率和因果发现的影响参差不齐。在因果术语一致性方面,BioBERT同样表现最佳,与传统信号检测方法高度吻合。 ## 行业启示:小模型大智慧 该研究为AI制药和药物安全监测提供了重要参考:在资源有限的实际部署场景中,**投资于可管理、领域感知的模型(如BioBERT)比追求大语言模型更高效**。这并非否定LLM的价值,而是强调在特定任务上,**领域适配性比通用能力更重要**。未来,研究者可进一步探索如何将领域预训练与因果推断框架更深度融合,或开发混合模型以兼顾规模与专业性。

HuggingFace1个月前原文

基模型(Foundation Models,FMs)在医学数据表征提取方面展现了强大潜力,但其在分布偏移数据集上的泛化能力尚未得到充分探索。近日,一篇发表于 arXiv 的研究论文系统评估了基于 FM 的表征在计算病理学任务中的表现,涉及两个真实世界商业队列——IH-BC 和 IH-NSCLC(来自授权内部肿瘤数据集)。该研究聚焦全切片图像与转录组图谱两种模态,首先在五个 FM 上对八项下游分类任务进行单模态探针性能基准测试,发现图像与组学表征携带互补的预测信号。随后,通过比较三种基于配对表征的图像-组学融合策略,探讨多模态融合能否带来额外增益。最后,利用共形预测评估所选单模态与多模态管线的可信度。 结果显示,FM 表征在分布外数据上取得了具有竞争力的性能,且多模态融合仅在单一模态信号不占主导时发挥主要作用。共形预测揭示,在大多数点预测失败的案例中,真实诊断仍能在预测集中被找回,这强化了不确定性感知推理在临床支持中的价值。该研究为多模态癌症分析中基模型的表征质量、融合策略与可信度评估提供了系统性参考。

HuggingFace1个月前原文

混合专家多模态大语言模型(MoE-MLLMs)在性能上表现出色,但巨大的GPU显存开销成为部署瓶颈。模型压缩因此变得至关重要。在已有的后训练量化(PTQ)方案中,专家级混合精度量化已被证明对MoE-LLMs有效,然而直接应用于MoE-MLLMs时却出现明显的性能退化。研究者发现,根本原因在于专家重要性估计中存在两种被忽视的偏差:**跨模态偏差**和**视觉内偏差**。 **偏差来源** - **跨模态偏差**:在MoE-MLLMs中,视觉token在数量上占据绝对优势,导致专家选择频率统计被视觉token主导,从而掩盖了对文本模态至关重要的专家。 - **视觉内偏差**:大量冗余的视觉token进一步扭曲了频率统计,使得对信息性视觉内容关键的专家被淹没。 **MODE框架** 为弥补上述偏差,来自中国科学院等机构的研究团队提出了**MODE(Modality-Decomposed Expert-Level Mixed-Precision Quantization)**,一个专门针对MoE-MLLMs的模态分解专家级混合精度量化框架。核心思路包括: 1. **按模态分解专家选择频率**:分别统计各模态(文本、视觉)下的频率,避免视觉token的数值优势掩盖文本专家的重要性。 2. **过滤冗余视觉token**:通过去噪处理得到更纯净的视觉频率,突出对有效视觉内容贡献大的专家。 3. **引入模态级量化敏感度**:将每个模态下的量化敏感度作为频率估计的补充信号,更全面地评估专家重要性。 4. **整数线性规划(ILP)**:将上述多维度信号整合到ILP优化问题中,在给定比特预算下为每个专家分配最优位宽。 **实验效果** 大量实验表明,MODE特别适配MoE-MLLMs。在**W3A16**(权重3比特,激活16比特)设置下,平均性能损失控制在**2.9%以内**;在极端的**2比特**设置下,性能提升更为显著。该方法有效解决了传统混合精度量化在多模态场景下的失效问题,为部署高容量MoE多模态模型提供了切实可行的压缩方案。

HuggingFace1个月前原文

## 研究背景 基于学习的单次条纹投影轮廓测量术(FPP)在近距离场景下已取得显著进展,但远程(>1米)应用仍面临挑战:强度随距离平方衰减导致信噪比下降,单次拍摄缺乏条纹阶次信息,且现有网络架构的机制尚未被深入理解。 ## 诊断:模型走“捷径”而非真正解码相位 研究团队通过**机械可解释性(MI)**和**共形不确定性量化(UQ)**两种方法,对UNet基线模型进行诊断。在包含15,600张条纹图像、50个物体、距离1.5-2.1米的光照真实合成基准上,最佳UNet基线达到**14.54毫米**物体平均绝对误差(MAE)。 三项探针实验(线性探针、Grad-CAM、平面外分布测试)一致表明:基线模型并非通过解码条纹相位来求解深度,而是依赖**物体边界的形状先验**——即通过物体轮廓直接猜测深度,这相当于“作弊”式的捷径学习。 ## 修复:从架构层面消除捷径 研究者提出 **PhiCalNet**,其核心创新在于**不直接回归深度**,而是输出包裹相位,再通过一个固定的可微分标定层将相位映射为深度。这一架构设计从根本上移除了形状先验解存在的假设空间,而非通过损失函数惩罚来抑制。 实验显示,物理信息损失函数(将相同物理约束作为软惩罚施加给深度回归网络)并未带来可测量的提升,证明**架构本身是决定性因素**。PhiCalNet将物体MAE降低了**3.3倍**,达到**4.46毫米**;残余误差主要来自±π包裹不连续处的**0.103%**像素。 ## 验证:不确定性量化确认诊断 像素级共形UQ进一步验证了诊断结论:若按快照差异拒绝前5%的物体像素,PhiCalNet的均方根误差(RMSE)降低**64%**(从20.6毫米降至7.4毫米),而基线仅降低**3.5%**。MI与UQ两种方法共同指向同一失效模式。 ## 意义与展望 本研究首次系统性地将MI和UQ应用于光学测量网络诊断,证明**架构设计比单纯添加物理损失更能引导模型学习正确物理规律**。PhiCalNet为远程单次FPP提供了一种有效方案,其“先输出中间物理量、再用固定变换层”的思路,或可推广至其他依赖物理先验的视觉任务。

HuggingFace1个月前原文

深度神经网络(DNN)在训练中常出现一种令人困惑的现象:模型在长时间过拟合后突然泛化,仿佛“顿悟”。最新研究从统计物理视角揭示了这一机制——噪声驱动的亚稳态逃逸。 ## 核心发现 来自波茨坦大学的研究者在论文中证明,DNN中的**泛化延迟(grokking)**本质上是**L2正则化强度变化**引发的一级相变中的**滞后效应**。当正则化强度低于临界值时,所有特征原则上都可学习,但网络会陷入由能量势垒分隔的**亚稳态**,导致收敛停滞。 关键在于,**随机梯度下降(SGD)中的噪声**提供了逃离亚稳态所需的能量。研究者在线性DNN中观察到,模型从低精度亚稳态逃离的时间符合**阿伦尼乌斯标度**——即逃逸时间随势垒高度指数增长。通过刻意将模型困在亚稳态,他们成功复现了跨越两个数量级的延迟收敛现象,且测试误差最终逼近训练误差的经典曲线。 ## 亚稳态数量与特征维度 论文进一步指出,亚稳态的数量恰好等于**可学习特征的数量**——每个数据协方差矩阵的奇异值对应一个特征。这意味着,任务越复杂(奇异值越多),潜在的滞后效应越强,模型越容易陷入局部最优。 ## 对深度学习实践的意义 这一发现为加速训练提供了新思路: - **动态正则化**:通过调整L2强度或噪声水平,主动控制模型在相空间中的迁移路径。 - **初始化策略**:避免模型落入与目标任务无关的亚稳态。 - **理解泛化边界**:将泛化能力与相变理论中的阶参数(如奇异值分布)关联,可能量化模型的“学习容量”。 尽管实验主要在线性模型上验证,作者提供了证据表明**非线性DNN**中同样存在类似机制。该工作不仅统一了“顿悟”现象的解释,更将深度学习与统计物理中的**成核理论**紧密联系起来。

HuggingFace1个月前原文

KDE Plasma 6.7 作为 6.x 系列的一个小版本更新,却带来了不少值得关注的新功能和改进。本文为你梳理其中的亮点。 ## 全局麦克风静音快捷键 新版本加入了**全局麦克风静音快捷键**,让你能一键快速关闭麦克风。无论是担心某个应用偷偷使用麦克风,还是在视频会议中需要紧急静音,这个功能都非常实用。你无需再打开设置或系统托盘,只需按下预配置的热键即可。 ## Plasma Bigscreen 模式全面落地 **Plasma Bigscreen 模式** 在本版本中正式全面推出。该模式允许你将桌面内容镜像到大屏电视上,且画面不会出现拉伸、模糊或变形,提供更佳的视觉体验。 ## 按屏幕设置虚拟桌面 KDE Plasma 6.7 还实现了**按屏幕设置虚拟桌面**的功能。如果你使用多显示器,现在可以为每个显示器独立配置不同的虚拟桌面,从而更高效地管理任务和工作区。 ## 其他改进 除了上述亮点,6.7 版本还包含许多细节优化和 Bug 修复,整体稳定性和性能进一步提升。虽然是一个点版本,但 KDE 团队注入的“额外功能与打磨”使其体验更上一层楼。 ## 如何获取 你可以等待 Plasma 6.7 进入你所用发行版的软件源,或者直接尝试 **KDE Neon** 来抢先体验。 总的来说,KDE Plasma 6.7 延续了该桌面环境一贯的高品质,并通过这些新功能进一步提升了用户友好度和灵活性。对于已经使用 Plasma 的用户,这次更新值得升级。

ZDNet AI1个月前原文

不可变 Linux 被认为是操作系统安全的未来,但现有发行版普遍存在一个限制:用户很难在系统之外安装和更新软件。RakuOS 通过一种创新的“分层”机制,巧妙解决了这一痛点。 ## 不可变系统的困境 传统的 Linux 发行版(如 Ubuntu、Fedora)允许用户自由修改系统文件,这带来了灵活性,但也增加了被恶意软件破坏的风险。不可变操作系统(如 Fedora Silverblue、openSUSE MicroOS)通过将根文件系统设为只读来提升安全性,但代价是用户安装非官方软件包变得困难——通常需要依赖容器或 Flatpak,而这并非所有用户都习惯。 ## RakuOS 的突破:分层叠加 RakuOS 的核心创新在于“分层”概念。它允许用户在只读系统之上叠加一个可写层,用于安装软件、修改配置,而不会影响底层系统。当系统更新时,RakuOS 会智能合并这些变更,避免冲突。这意味着: - **轻松安装任意软件**:无需容器,直接通过包管理器安装,系统自动处理分层。 - **原子更新**:更新失败可回滚,因为底层镜像未被修改。 - **兼容性**:支持 Debian 软件包,降低迁移门槛。 ## 行业意义与未来 RakuOS 的出现填补了不可变系统在“用户自由度”上的短板。对于开发者、运维人员以及追求稳定性的普通用户而言,它可能成为不可变 Linux 的理想选择。随着容器化和云原生趋势的推进,类似 RakuOS 的分层设计有望被更多发行版采纳,推动 Linux 生态向更安全、更灵活的方向演进。

ZDNet AI1个月前原文

亚马逊的早期Prime Day促销将55英寸Fire TV Omni QLED系列电视价格降至**280美元**,相比原价500美元节省了**220美元**,折扣幅度达44%。这款电视以其出色的画质和智能功能受到好评,是家庭娱乐升级的绝佳选择。 ## 促销详情 - **产品**:Amazon Fire TV Omni QLED Series 55英寸 - **价格**:$280(原价$500) - **折扣**:$220(44% off) - **活动**:早期Prime Day促销 ## 为何推荐 这款电视采用**QLED技术**,能够呈现更鲜艳的色彩和更高的对比度。它内置**Fire TV智能平台**,支持语音控制,并整合了流媒体服务。对于预算有限但追求画质的用户来说,280美元的价格极具竞争力。 ## 购买建议 如果你正在寻找一款性价比高的55英寸电视,这款折扣产品值得考虑。促销可能限时,建议尽早下单。 **注意**:本文为编辑推荐,不含广告内容。

ZDNet AI1个月前原文

你的安卓手机键盘可能正在收集比你想象中更多的信息。以下是两种夺回隐私的方法,但我只信任其中一种。 ## 键盘追踪:隐形的数据收集器 当你使用安卓手机打字时,键盘应用可能正在记录你的每一次按键——从日常聊天到密码输入。这些数据通常用于改进预测输入、个性化建议,但不少键盘应用(尤其是第三方键盘)会将数据发送到远程服务器,用于广告定向或用户画像分析。默认情况下,谷歌的 Gboard 和许多第三方键盘都具备“学习”功能,这意味着你的打字习惯、常用短语甚至敏感信息都可能被收集。 ## 两种保护隐私的方法 ### 方法一:关闭联网权限(我信任的方案) 最直接且有效的方式是**限制键盘应用的网络访问权限**。在安卓系统中,你可以通过“设置 > 应用 > 键盘应用 > 移动数据”页面,关闭“后台数据”和“漫游时使用数据”选项。对于部分机型,还可以在“应用信息”中直接禁用“互联网”权限。 - **优点**:彻底切断数据外传路径,键盘仅在本机运行,隐私无忧。 - **缺点**:部分键盘的云同步功能(如词库同步)将无法使用。 ### 方法二:使用隐私保护键盘 另一种选择是**更换为注重隐私的键盘应用**,例如 **OpenBoard**(开源)、**AnySoftKeyboard** 或 **FlorisBoard**。这些键盘默认不收集数据,且代码公开可审计。 - **优点**:无需手动配置,开箱即隐私友好。 - **缺点**:功能可能不如 Gboard 丰富,例如缺少滑动输入或表情搜索。 ## 为什么我只信任第一种 尽管存在隐私键盘,但**绝大多数用户仍在使用 Gboard 或百度输入法等主流键盘**。这些应用的功能依赖云端数据,即便你关闭了“个性化建议”,它们仍可能通过统计收集基础使用数据。而切断联网权限是**零信任模型**——无论应用宣称什么,物理上阻止它联网就是最可靠的保障。 ## 操作步骤(以 Gboard 为例) 1. 打开“设置” > “应用” > “查看所有应用” > 找到 **Gboard**。 2. 点击“移动数据”或“网络访问”(不同安卓版本名称略有差异)。 3. 关闭“允许使用移动数据”和“允许使用 WLAN”。 4. 重启键盘应用(或直接开始使用)。 ## 小结 键盘是隐私泄露的隐形入口。**关闭联网权限**是当前最彻底的控制手段,而选择开源键盘则是长期主义的解决方案。在隐私与便利的权衡中,根据你的需求选择即可。

ZDNet AI1个月前原文

亚马逊云科技近日宣布推出 **Amazon Bedrock Guardrails** 的 **InvokeGuardrailChecks API**,为智能体 AI 应用提供更灵活的安全防护能力。该 API 允许开发者在不创建完整防护栏资源的前提下,在智能体应用的任意环节独立调用单项安全检查,从而实现对多轮对话、工具调用等复杂场景的精细化管控。 ## 核心能力:按需调用,灵活防护 传统防护栏通常以整体资源形式部署,覆盖输入输出过滤、敏感信息屏蔽等多项规则。但智能体 AI 应用往往涉及多步推理、工具调用和上下文切换,不同环节的安全风险差异显著。InvokeGuardrailChecks API 的推出正是为了解决这一痛点——开发者可以**按需选择仅执行特定检查**,例如在用户输入阶段仅启用内容过滤,在工具返回结果阶段启用敏感信息检测,而无需为每个环节重复配置完整规则。 ## 典型应用场景 - **多轮对话中的阶段性防护**:在对话的不同节点,应用可能面临不同类型的风险。例如,在用户提交个人信息时,可单独调用“个人身份信息(PII)检测”检查;在模型生成回复后,再调用“有害内容过滤”检查。这种粒度控制避免了过度过滤或防护不足。 - **工具调用安全**:当智能体调用外部 API 或数据库时,可对工具返回的数据进行专项检查,确保不泄露敏感信息或包含恶意内容,而无需修改全局防护策略。 - **降低资源开销**:对于仅需部分防护能力的场景,InvokeGuardrailChecks API 无需创建完整的 guardrail 资源,减少了配置和维护成本。 ## 如何工作? API 调用流程简洁:开发者通过 SDK 或 REST API 指定需要执行的检查类型(如内容过滤、主题阻断、敏感信息屏蔽等),并传入待检查的文本或上下文。Amazon Bedrock 实时返回检查结果,包括是否通过以及违规详情。结果可被用于触发后续逻辑,如重试、拦截或修改输出。 ## 行业意义 随着智能体 AI(Agentic AI)从实验走向生产,安全可控成为落地关键。Gartner 预测,到 2026 年,**超过 80% 的企业 AI 应用将采用某种形式的护栏机制**。Amazon Bedrock Guardrails 的这次更新,降低了安全防护的集成门槛,让开发者能够以更细粒度、更低成本的方式构建可信 AI 系统。 ## 小结 InvokeGuardrailChecks API 是 Amazon Bedrock 在 AI 安全领域的重要补充。它打破了传统防护栏“一刀切”的模式,赋予开发者按需组合安全策略的能力。对于正在构建复杂智能体应用的团队来说,这无疑是一个值得关注的新工具。

AWS ML1个月前原文