SheepNav

AI 资讯

每日聚合最新人工智能动态

智能手表的续航一直是用户关注的焦点,多数产品在开启全部功能后仅能维持两天左右,而Suunto Core 2却给出了一个令人意外的答案:**长达15个月的电池寿命**。在智能手表普遍需要每日或隔日充电的当下,这无疑是一股清流。 ## 为户外而生,回归核心功能 Suunto Core 2并非一款追求全能体验的智能手表,它更像是一位专注的户外伙伴。它内置了**高度计、气压计和指南针**,这些都是户外运动爱好者不可或缺的工具。此外,它还提供**天气趋势和风暴警报**功能,帮助用户在野外提前感知天气变化,提升安全性。 与许多主打健康监测的智能手表不同,Suunto Core 2**没有配备心率传感器**。这或许会让部分用户感到遗憾,但这也正是其超长续航的关键所在。它专注于户外核心场景,将有限的电量投入到最实用的功能上。 ## 续航优势显著,精准计步 在评测中,Suunto Core 2的续航表现确实令人印象深刻。官方宣称的15个月续航并非虚言,这得益于其低功耗的屏幕和精简的功能设计。对于经常进行多日徒步或长途探险的用户来说,这无疑解决了户外用电的痛点。 此外,它的**计步功能也相当准确**,能够真实反映用户的日常活动量。在价格方面,Suunto Core 2的定价相对合理,结合其强大的续航和户外功能,性价比颇高。 ## 取舍之间,定位清晰 当然,没有心率传感器意味着它无法提供心率监测、血氧检测等现代智能手表常见的健康数据。如果你更关注日常健康追踪和智能通知,那么Suunto Core 2可能并不适合你。 但如果你是一位户外爱好者,或者对频繁充电感到厌倦,那么Suunto Core 2的独特价值便凸显出来。它用极简的功能换来了惊人的续航,这种取舍在智能手表领域显得尤为务实。 ## 小结 Suunto Core 2是一款定位精准的户外手表,它以**15个月的超长续航**为核心卖点,辅以必要的户外工具,为特定用户群体提供了极具吸引力的选择。虽然缺少心率监测等现代功能,但在续航和核心户外性能上,它确实达到了一个新的高度。

ZDNet AI12天前原文

Google 的 Pixel 系列一直是 Android 阵营的标杆,而 Pixel Pro 型号更是硬件与软件结合的巅峰之作。近期发布的 **Pixel 11 Pro XL** 凭借其精美的设计和一系列 AI 功能吸引了大量关注,但经过实际体验后,我们发现它在相机方面的表现并未达到预期,尤其是在夜间拍摄时。 ## 设计:颜值在线,手感一流 Pixel 11 Pro XL 的外观设计堪称艺术品。机身采用磨砂玻璃背板,搭配金属边框,整体质感非常高级。屏幕尺寸较大,但得益于窄边框设计,握持感依然舒适。对于追求极致外观的用户来说,这款手机绝对能让你眼前一亮。 ## AI 功能:亮点与槽点并存 作为 Pixel 系列的招牌,AI 功能自然是重头戏。本次新增的 **Rambler** 和 **Live Translate** 功能在测试中表现出色。Rambler 能够智能整理通知和消息,帮助用户高效管理信息流;而 Live Translate 则支持实时翻译多语言对话,对于经常跨国沟通的用户来说非常实用。 然而,并非所有 AI 功能都完美运行。部分功能在测试过程中出现失灵的情况,例如某些场景下的智能助手响应不够灵敏,这可能是软件优化尚未完善所致。 ## 相机:白天尚可,夜间拉胯 相机是本次评测中最大的失望点。在光线充足的环境下,Pixel 11 Pro XL 的拍照表现中规中矩,色彩还原准确,细节保留良好。但一旦切换到夜间模式,照片的噪点明显增多,画面清晰度大幅下降,甚至不如上一代产品。对于喜欢夜拍的用户来说,这可能是一个不小的痛点。 ## 电池续航:表现稳定 电池续航方面,Pixel 11 Pro XL 的表现令人满意。在重度使用下,坚持一整天没有问题,中度使用甚至可以撑到两天。支持快速充电和无线充电,日常补电非常方便。 ## 总结 Pixel 11 Pro XL 是一款优缺点都非常明显的产品。它的设计、AI 功能和续航都达到了旗舰水准,但相机性能的短板可能会让部分用户犹豫。如果你对拍照要求不高,更看重日常使用体验和 AI 功能,那么这款手机值得考虑;但如果你是摄影爱好者,可能需要再观望一下。 *注:本次评测基于短期体验,部分功能可能因软件版本不同而有所差异。*

ZDNet AI12天前原文

Fairphone 6+ 终于在美国上市,售价 649 美元,配备 12 个可更换部件,电池更换仅需 40 美元。这款手机在性能、价格和可持续性之间找到了平衡,堪称安卓手机中的“金发姑娘”。 ## 可持续理念的践行者 随着消费者升级换机频率降低,可持续性在手机行业逐渐获得重视。Fairphone 6+ 正是这一趋势的代表,其模块化设计允许用户自行更换 **12 个关键部件**,包括电池、屏幕、摄像头等,大大延长了设备使用寿命。 ## 价格与性能的平衡 Fairphone 6+ 售价 649 美元,定位中端市场,但实际性能超出同价位平均水平。虽然不及旗舰机型,但对于大多数日常使用场景,其表现已绰绰有余。考虑到近期 RAM 价格飙升对手机价格的影响,Fairphone 6+ 的定价显得更为合理。 ## 手感与体验 握持感舒适,机身设计简洁实用。可维修性不仅降低了长期使用成本,也减少了电子垃圾,对环保用户极具吸引力。 ## 小结 Fairphone 6+ 并非追求极致性能的旗舰杀手,而是注重实用与可持续性的务实之选。如果你希望减少电子浪费,同时不想牺牲太多性能,这款手机值得考虑。

ZDNet AI12天前原文
Meta 广告平台惊现“脱衣”应用广告,目标直指女性政客

Meta 的广告平台近期被发现出现了一款名为“Nudify”的应用广告,该应用宣称可以利用 AI 技术“脱去”女性政客照片中的衣物,生成深度伪造的色情内容。其中一则广告甚至包含了一段与某位美国政客高度相似的色情视频。这一事件再次引发了公众对 AI 深度伪造技术滥用问题的担忧,以及对社交媒体平台内容审核能力的质疑。 ## 事件始末 据 Ars Technica 报道,Meta 在其 Facebook 和 Instagram 平台上投放了这款应用的广告。广告中展示了一段色情视频,视频中的女性形象与一位著名的美国政客极为相似,显然是利用深度伪造技术生成的。该广告不仅公然宣传这种侵权行为,还提供了应用的下载链接,引导用户使用该服务。 ## 深度伪造的伦理与法律问题 深度伪造技术(Deepfake)利用人工智能算法,可以生成逼真的虚假图像和视频。当这种技术被用于制作非自愿的色情内容时,不仅严重侵犯了当事人的肖像权和名誉权,还可能对其造成巨大的心理伤害。近年来,针对女性政客、记者和公众人物的深度伪造色情内容屡见不鲜,已成为一个严重的社会问题。 尽管许多国家和地区已经出台相关法律,禁止未经同意制作和传播深度伪造色情内容,但在实际执行中仍面临诸多挑战。平台方在内容审核上的疏漏,往往让这些违法内容得以在网络上传播。 ## Meta 的回应与责任 截至目前,Meta 尚未对此事做出公开回应。但这一事件暴露了 Meta 在广告审核机制上的漏洞。尽管 Meta 声称使用人工智能和人工审核相结合的方式审查广告,但显然未能有效拦截此类恶意内容。 有分析人士指出,Meta 作为全球最大的社交媒体平台,有责任加强对广告内容的审核,特别是对涉及深度伪造和色情内容的广告。否则,不仅会助长这种违法行为,还可能损害平台的公信力。 ## 行业影响与未来展望 这一事件再次提醒我们,AI 技术在带来便利的同时,也可能被滥用于非法目的。对于深度伪造技术,除了法律层面的约束,技术手段的防范同样重要。例如,开发能够检测深度伪造内容的工具,并在各大平台部署,以阻止此类内容的传播。 同时,公众也需要提高警惕,增强对虚假信息的辨别能力。对于平台而言,建立更严格的广告审核机制,及时处理违规内容,是维护用户安全和网络环境的必要之举。 我们也将持续关注此事,看 Meta 是否会采取进一步措施,以及相关法律和监管是否会因此得到加强。

Ars Technica12天前原文

核能初创公司一直将自己标榜为AI数据中心电力短缺的解药,而比尔·盖茨创立的TerraPower正是其中最新的一员。据彭博社报道,TerraPower计划在今年宣布其首个数据中心项目,尽管未透露客户身份,但今年1月已与Meta达成协议,后者同意购买其八座Natrium核电站。该项目预计于2027年动工,将成为公司的第二座核电站,首座已在怀俄明州建设中。 并非所有核反应堆都适合数据中心的需求,但TerraPower拥有一个关键优势——**储能**——这有望使其在竞争中脱颖而出,而这一切得益于风能和太阳能等可再生能源的启发。 核反应堆(包括TerraPower的)在满负荷运行时效率最高。在美国,核反应堆的容量因子高达**92.5%**,即92.5%的时间以最大功率发电。然而,现有反应堆的功率调整速度较慢,每分钟只能增减额定输出的大约5%。新型小模块化反应堆(SMR)响应更快,可达每分钟10%,但降低负荷运行并不理想,因为核能是所有发电技术中资本支出最高的,不发电就很难盈利。初创公司希望通过大规模制造SMR来降低资本支出,但这尚未得到验证,且可能需要十年以上才能见效。 对于依赖表后电力的数据中心而言,负荷波动剧烈,尤其在AI训练或推理时,GPU负载快速变化,甚至导致天然气涡轮机因压力而损坏。为平滑曲线,需要大量电池组,进一步推高成本。TerraPower设计的**345兆瓦熔盐冷却反应堆**,其内置储能系统能够有效缓冲负荷波动,从而避免对电网或发电设备造成过大压力。这一设计使其在数据中心供电市场中具备独特竞争力。 TerraPower的储能能力不仅提升了灵活性,还可能降低对额外电池的需求,从而节省成本。随着AI数据中心对电力需求日益增长,TerraPower的技术路线或将为核能复兴开辟新路径。然而,其首个商业项目的实际表现仍需时间验证,行业对其能否兑现承诺持观望态度。

TechCrunch12天前原文

亚马逊于本周三宣布,将其人工智能助手Alexa+免费推广至美国所有兼容的Fire TV设备,无论用户是否为Prime会员,都将自动获得升级。此前,Alexa+对非Prime用户每月收费19.99美元,仅限去年秋季发布的新款Fire TV设备。现在,所有当前一代的Fire TV Stick、Fire TV Cube、Ember智能电视以及海信、松下等内置Alexa+的智能电视用户都将自动升级,无需额外操作。 此举是科技行业将AI服务普及到更多消费电子设备的趋势之一。谷歌今年早些时候将Gemini引入Google TV,用AI对话式搜索取代简单搜索;Roku去年也升级了语音助手为AI。亚马逊表示,Alexa+在Fire TV上的对话次数几乎是原版Alexa的两倍,表明用户不再仅仅将电视视为被动娱乐设备,而是更积极地与AI互动。 Alexa+支持基于主题、年龄、人气等条件的自然语言搜索,例如“一部高分惊悚片”或“一部有强大女主角的历史剧”。此外,它还能帮助用户管理智能家居设备,如直接在电视上查看Ring摄像头画面。 这一免费策略可能旨在扩大Alexa+的用户基础,并推动AI助手在家庭娱乐场景中的采用。然而,用户是否愿意接受这种强制升级仍有待观察,行业分析师也质疑其长期价值。

TechCrunch12天前原文

## 2026年安卓手机市场格局:折叠屏与主流机型的双重进化 2026年尚未过半,但安卓手机市场已迎来关键转折点。ZDNET专家团队通过持续测试三星、谷歌等品牌的最新旗舰机型,结合严格的产品评估流程,为消费者筛选出当前最值得购买的安卓手机。 ### 测试方法与标准 ZDNET的推荐基于**数小时的实测、研究与对比购物**。评估过程包括: - 从供应商、零售商列表及其他独立评测网站收集数据 - 仔细分析用户评论,了解真实使用者的反馈 - 确保编辑内容不受广告商影响,保持客观独立 团队遵循严格的指南,确保每篇文章都经过彻底审查和事实核查,以提供最准确的信息和最专业的购买建议。 ### 市场趋势:折叠屏与主流机型的并行发展 2026年的安卓市场呈现出两条清晰的发展路径: **折叠屏手机的创新突破** - **三星 Galaxy Z Fold 7** 和 **摩托罗拉 Razr Ultra** 等机型正在重新定义手机设计范式 - 这些设备代表了高端市场的技术前沿,推动着交互方式的变革 **主流市场的持续优化** - 像 **谷歌 Pixel 10a** 这样的预算机型证明,中端市场依然有巨大价值 - 这些手机在性能、相机和用户体验方面不断进步,满足大多数消费者的日常需求 ### 如何选择最适合你的安卓手机 ZDNET的评测旨在帮助消费者做出更明智的购买决策。专家建议考虑以下因素: - **使用场景**:是追求极致多媒体体验,还是注重日常实用性与性价比 - **预算范围**:高端折叠屏与主流机型之间存在显著价格差异 - **品牌偏好**:三星、谷歌等品牌在软件生态和硬件整合上各有特色 ### 行业背景与AI技术的潜在影响 虽然当前评测主要关注硬件设计,但值得注意的是,2026年的安卓手机很可能深度整合了AI能力。从相机优化到语音助手,再到个性化推荐,AI已成为现代智能手机的核心组成部分。未来评测可能会更关注设备在**本地AI处理、隐私保护算法和智能交互**方面的表现。 ### 小结 2026年的安卓手机市场不再是单一的技术竞赛,而是多元化的用户体验探索。无论是追求折叠屏带来的生产力革新,还是青睐主流机型提供的可靠性能,消费者都有丰富选择。ZDNET的专家评测为这一决策过程提供了基于实测的可靠参考。

ZDNet AI12天前原文
VentureBeat任命Rob Strechay为首位首席分析师,深化企业AI研究布局

**VentureBeat近日宣布,任命Rob Strechay为其首位首席分析师(Lead Analyst),并成为VentureBeat Research的创始分析师之一。** Strechay此前担任theCUBE Research的董事总经理兼首席分析师,拥有近三十年的行业经验,涵盖技术实践、产品管理及分析研究等多个领域。 这一任命标志着VentureBeat在企业AI领域向更深层次专业化迈进的战略举措。VentureBeat主编Matt Marshall表示,随着企业从生成式AI的实验阶段转向生产部署,技术决策者们——包括总监、副总裁、CIO和CTO——正面临一系列新问题:如何协调多供应商环境?智能体管道的安全漏洞在哪里?如何解决基础设施预算中的利用率问题?这些问题的答案需要超越新闻覆盖的深度分析,而Strechay的加入正是为了填补这一空白。 Strechay的职业生涯跨越多个关键角色:他曾是Zerto等多家初创公司的高管,加入亚马逊云服务(AWS)帮助构建新的分析服务,并在企业基础设施领域担任高管。在成为分析师之前,他还在Enterprise Strategy Group担任高级分析师。在theCUBE Research和SiliconANGLE任职期间,他主持高管访谈,分析云、数据和AI基础设施的演变。 在VentureBeat,Strechay将重点关注云基础设施、先进数据基础设施、平台工程与DevOps编排及可观测性,以及AI与企业安全的交叉领域。实际上,他已经开始为VentureBeat的研究做出贡献——5月,他发布了一份关于企业GPU利用率的分析,探讨企业AI基础设施中的计算浪费问题,并对VentureBeat的AI基础设施与计算调查提供了深入评审。 随着Strechay的加入,VentureBeat Research旨在为技术决策者提供客观、可辩护的数据支持,帮助他们在快速变化的企业AI环境中做出明智的采购和部署决策。这一举措也反映了行业对专业、深度分析内容日益增长的需求。

VentureBeat12天前原文

随着AI技术的普及,会议记录已成为生产力工具领域的热门赛道。Calendly,这家以日程安排和会议预订软件闻名的公司,近日宣布推出自己的会议记录工具,并计划发布AI助手Callie,旨在自动化会议后的工作流程。 ## 产品功能 Calendly的会议记录工具与市面上其他产品类似,能够加入会议、录制音视频、生成转录文本,并自动生成摘要和行动项,甚至起草后续邮件。此外,该公司还在测试一项类似Granola的功能,利用系统音频进行转录。 ## Callie助手 Calendly计划推出的AI助手Callie,将利用公司现有的日程和会议堆栈,帮助用户安排会议、检查他人可用性,并提供过往会议的上下文信息。这一功能与Read AI年初推出的邮件助手类似。 ## 市场定位 Calendly CEO Tope Awotona表示,公司希望为面向外部角色的用户(如销售和市场营销人员)自动化工作流程,这些人的工作日通常充斥着会议。尽管竞争激烈,Awotona认为在会议转录后的自动化任务方面仍有巨大机会。他指出:“有大量的记录工具,它们都能很好地记录和转录,但会议后的大量工作才是效率提升的关键。” ## 隐私保护 鉴于Otter和Granola等公司面临隐私侵犯指控,Calendly强调其记录工具会告知用户会议正在被录制。该工具会在聊天中发送消息通知所有人,并允许用户随时要求其离开对话。借助Calendly日程系统的集成,它甚至可以在会议开始前就告知参会者将被录制。 ## 行业背景 会议记录领域竞争激烈,既有Granola、Fireflies、Read AI、Otter和Fathom等专业应用,也有Notion、ClickUp和Wispr等生产力公司添加的笔记助手。Calendly的加入进一步加剧了竞争,但差异化可能在于其日程系统的深度集成和会后自动化能力。

TechCrunch12天前原文

英伟达联合多家金融巨头,计划融资5000亿美元将算力变成可投资资产。但CEO黄仁勋此前曾贬低上一代芯片,如今却称其为长期收益资产,转变之快令人咋舌。本文将分析这一战略背后的逻辑与潜在风险。 ## 算力资产化的宏大叙事 英伟达正与Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs和KKR等金融巨头合作,计划筹集**5000亿美元**,将算力打造为一种全新的资产类别。英伟达CEO黄仁勋在CNBC采访中宣称:“这是技术芯片首次成为可投资资产类别。这些资产现在能产生收入,它们高效、长寿、可互换且灵活。”他甚至将这一时刻比作1970年代抵押贷款支持证券市场的开端。 ## 前后矛盾的言论 然而,就在一年前,黄仁勋对上一代Hopper芯片的评价截然相反。在英伟达AI大会上,他曾说:“当Blackwell开始大规模出货时,Hopper白送都没人要。”如今,他却称芯片是“长期收益资产”,这种180度大转弯令人瞠目。 ## 市场现实与潜在泡沫 目前,黄仁勋的说法并非毫无根据。旧芯片的租赁价格正在上涨,Silicon Data预测这一趋势将持续到2028年。甚至有云服务商在续约时,将英伟达Blackwell B200芯片的租赁价格近乎翻倍。 但这一策略让人联想到2008年金融危机前的次贷市场。BlackRock CEO Larry Fink同样表示:“这是金融工程的下一个未来。”然而,当芯片技术快速迭代,所谓的“长期资产”可能迅速贬值。如果算力需求不及预期,这些GPU-backed贷款可能成为新的“次贷”。 ## 小结 英伟达的算力资产化战略,既是对AI算力需求的豪赌,也是金融创新的尝试。但历史告诉我们,当金融工程遇上快速变化的技术,泡沫与风险往往并存。投资者需警惕,切勿被“资产类别”的华丽辞藻所迷惑。

The Verge12天前原文

生物技术初创公司Vivodyne指出,AI药物发现行业面临数据问题,并声称已构建了解决该问题的机器。其模块化机器人实验室HIVE能够培育20种人体组织,并自主给药和监测,生成当前AI模型缺失的因果生物数据——这些数据目前主要来自动物测试或单细胞/蛋白质研究,而非活体组织。Vivodyne CEO Andrei Georgescu质疑:“没有人体测试,这些AI模型能做什么?它们会在老鼠身上治愈癌症。” Anthropic CEO Dario Amodei也指出,AI治愈癌症的说法已变得陈词滥调,而真正有效的是实际治愈癌症。尽管业界领袖如Sam Altman和Demis Hassabis曾宣扬AI治愈癌症的愿景,但实际进展有限:少数AI设计的药物进入人体试验,但AlphaFold等突破尚未产生新药。Vivodyne的差异化在于,其组织与真实人体器官行为高度匹配,肝脏细胞对毒性测试的预测准确率达94%,旨在提供更接近人体反应的数据,以解决AI模型的数据瓶颈。

TechCrunch12天前原文
Flock 为警方打造强大新 AI 工具,我们获得了其代码

**Flock Safety** 的监控摄像头早已引发争议,现在,这家车辆监控巨头又向前迈进了一步。据 WIRED 报道,该公司已构建出一套名为 **OS Investigate** 的新一代 AI 系统,能够识别驾驶员身份,并仅凭车辆行驶模式追踪其行踪。该系统已在美国 **6000 多个社区** 的摄像头网络中运行,通过分析车辆经过频率、同行车辆等数据,可筛选出潜在证人,甚至挖掘驾驶员的“关联人”。更令人担忧的是,该系统还接入警方案件档案、911 调度日志和商业身份记录,能将车牌号转化为姓名、住址和亲属信息。 WIRED 通过分析 Flock 官网上的代码文件发现,该系统内置 **69 个预设提示词**,供警官选择、修改或提交,同时支持自定义输入。代码还揭示了 **45 种工具**,可访问车牌扫描、摄像头元数据、逮捕记录、案件文件、调度日志、弹道结果,以及包含社会安全号码、出生日期、电话号码等信息的商业数据库。 Flock 表示,该产品仍处于开发阶段,仅与少数执法伙伴合作测试。然而,隐私和法律专家指出,这套系统在未经搜查令的情况下,赋予警方对民众行踪的广泛访问权,已引发严重的宪法担忧。该工具将“寻找已知车辆”升级为“根据驾驶频率和地点对司机产生怀疑”,即便他们并未涉案。 Flock 面临两党政治压力、官员滥用平台的记录以及全国范围内的摄像头破坏浪潮。此次曝光的 AI 工具,无疑将加剧公众对监控技术的担忧,并引发关于隐私权与公共安全边界的激烈讨论。

WIRED AI12天前原文

道路安全管理长期以来处于被动状态,通常依赖事故记录,在伤亡发生后才进行分析。然而,在事故发生前主动识别高风险路段和危险驾驶行为,是亟待解决的关键挑战。近期,一篇提交至ATRF 2026会议的论文,探讨了如何利用澳大利亚悉尼大都会区的联网车辆遥测数据,检测并预测接近事故的危险驾驶事件,为主动干预提供了新思路。 ## 研究核心:量化危险驾驶与构建热点图 研究团队通过**g力阈值**来量化危险驾驶行为,包括急刹车(>0.6g)、急转弯(>0.47g)和急加速(>0.5g)。他们基于这些事件构建了**时空热力图**,以识别高风险区域。研究以地方政府区域(LGA)为粒度,聚焦于悉尼内城区和西部的CBD、Parramatta、Bankstown等地区,这些区域被持续标记为高风险区,需要针对性的政策干预。 ## 模型对比:简单时间序列模型胜出 为了预测高风险驾驶事件,研究者比较了八个预测模型,涵盖三大类:集成学习(随机森林、XGBoost、LightGBM)、深度学习(LSTM、N-BEATS)和经典时间序列方法(ARIMA、指数平滑、Prophet)。结果显示,**ARIMA模型表现最佳,平均绝对误差(MAE)为162.21**,与LSTM(MAE 163.92)接近,且优于所有集成方法。N-BEATS的MAE为180.75。这表明,在训练数据量有限的情况下,**简约的时间序列模型能够与深度学习模型相抗衡**,甚至更优。 ## 意义与展望:物联网数据驱动的主动安全 该研究凸显了基于物联网的联网车辆数据在支持**主动道路安全干预**方面的潜力。通过实时监测和预测高风险驾驶事件,交通管理部门可以提前部署资源,如加强巡逻或调整信号灯配时,从而减少事故发生率。未来,随着联网车辆数据的普及和模型的优化,这种主动安全策略有望在更广泛的区域推广,真正实现从“事后应对”到“事前预防”的转变。 尽管研究尚处于初步阶段,但它为道路安全监测提供了新的视角,证明了数据驱动方法在公共安全领域的应用价值。

HuggingFace13天前原文

在物理信息机器学习(PIML)领域,一个长期困扰研究者的问题是:当混合偏微分方程(PDE)参数估计器假设的算子不正确时,我们能否仅从一次拟合中检测出来,并进一步将其与参数不可识别性区分开?最新研究提出了一种无需参考(reference-free)的检测工具,仅凭单次拟合即可实现这一目标,为模型验证提供了新思路。 该工具的核心是一个基于信息矩阵的统计量,它利用插件尺度和每种子参数,在正确设定的情况下,其中位数仅为0.19,拒绝率为0.033,远低于预注册的0.10阈值。然而,在两种误设情形下,该统计量分别飙升至224和85,并在所有重复试验中触发警报。更关键的是,在正确设定但参数不可识别的设计中,该统计量保持沉默(n=200时为0.050,Clopper-Pearson置信区间[0.024, 0.090]),而秩统计量则在预注册边界c5*=2.15×10^-3处崩溃为零。因此,通过一次拟合的两种读数,研究者能够在三种设计中区分误设与不可识别性,这正是该工作的核心贡献。 作者强调,检测本身并非新鲜事物,但区分两种失败模式才是关键。在样本内,该工具提供的是界限;在样本外,则指示方向。研究指出,常用的精度检查往往对误设视而不见:误设估计器的域内均方根误差(RMSE)为2.7×10^-2,低于σ≥0.05时的观测噪声,而系数在零噪声时误差达29.7%,在最大噪声时达31.2%。这表明,仅凭预测精度无法捕捉模型错误。 此外,研究排除了架构因素:单参数曲线拟合、裸参数以及49和241参数的多层感知机均收敛到相同的伪真值(闭合形式匹配度达0.07%),而物理信息网络因其复合目标函数,收敛到不同的解。这进一步说明误设是本质性的,而非网络容量不足。 作者还报告了工具的盲区,包括一个预注册的负面结果:在恢复任务中,神经网络估计器败给了Tikhonov正则化反演。同时,他们给出了保证成立但训练网络违反该保证的假设条件。 这项研究为混合PDE参数学习提供了实用的诊断工具,有助于提高模型的可信度,并可能推动PIML在科学计算中的更广泛应用。

HuggingFace13天前原文

在大语言模型(LLM)的后训练阶段,监督微调(SFT)是提升模型任务能力的关键环节。然而,面对海量的候选数据,如何筛选出少量高质量样本,在降低训练成本的同时保持甚至提升模型性能,一直是业界关注的焦点。传统的做法往往将数据价值视为静态属性,忽略了数据与目标模型能力分布之间的兼容性。针对这一痛点,来自多所高校和科研机构的研究团队提出了一种名为 **Data-DPO** 的新方法,旨在实现面向目标模型的数据选择,相关论文已提交至 arXiv(编号:2608.16926)。 ## 核心思路:从静态评估到动态适配 Data-DPO 的核心理念是:**数据价值并非一成不变,而是相对于特定模型而存在**。同一份数据,对于能力较强的模型可能价值有限,但对于能力较弱的模型则可能是宝贵的训练素材。因此,数据选择应当充分考虑目标模型的当前能力状态。 具体而言,Data-DPO 通过**一步探针**(one-step probing)机制,观察目标模型在不同样本上的局部训练反馈,将样本间的激活差异转化为成对的数据偏好(pairwise data preferences)。随后,训练一个轻量级的奖励模型,来学习这种“目标模型感知”的数据偏好。在最终选择阶段,Data-DPO 综合了目标模型偏好、外部质量评分以及边际多样性(marginal diversity),构建出更为稳定且有效的训练子集。 ## 实验验证:超越现有基线 研究团队在 **Vision-Flan** 和 **LLaVA-CoT** 两个数据集上进行了实验,结果显示 Data-DPO 在多种数据预算下均一致优于现有的数据选择基线,并且能够稳定超越使用全部数据进行训练的性能。这意味着 Data-DPO 不仅能够降低训练成本,还能带来性能上的提升,为 LLM 后训练的数据工程提供了新的思路。 ## 行业意义:从“数据越多越好”到“精准匹配” 这一研究的价值在于,它打破了传统“数据越多越好”的直觉,强调了数据与模型之间的动态匹配关系。在实际应用中,不同厂商的模型架构、预训练数据分布各不相同,对微调数据的需求也存在差异。Data-DPO 提供了一种可定制的数据选择方案,有望帮助企业更高效地利用数据资源,加速模型迭代。 ## 局限与展望 尽管实验结果令人鼓舞,但该研究仍处于预印本阶段,尚未经过同行评审。此外,方法的计算开销(如探针训练和奖励模型训练)以及在不同规模模型上的泛化能力,仍需进一步验证。未来,团队计划探索如何将 Data-DPO 扩展到更大规模的模型和更多样的任务场景,并尝试与数据合成技术结合,进一步提升数据利用效率。 总之,Data-DPO 为 LLM 后训练中的数据选择问题提供了一个新颖的视角,其“目标模型导向”的设计理念值得关注。随着大模型应用日益普及,数据工程的精细化将成为决定模型性能的关键因素之一。

HuggingFace13天前原文

随着监督微调数据规模的不断扩大,如何从庞大的候选池中筛选出高价值子集,已成为降低训练成本、提升模型性能的关键挑战。现有的数据选择方法通常直接在原始嵌入空间中度量数据多样性,但这种方式容易将主导语义方向、细粒度监督差异和局部噪声纠缠在一起,导致选择结果不够精准。 针对这一问题,来自上海交通大学等机构的研究团队提出了一种名为 **MASS** 的新方法,将数据选择形式化为**从粗到细的分层覆盖问题**。MASS 首先利用密集自编码器学习低维主流形坐标,实现粗粒度的语义分组;随后在每个组内,借助 TopK 稀疏自编码器进行质量感知的稀疏特征覆盖。这种设计既保留了全局语义结构,又兼顾了局部细节特征,从而更有效地挑选出代表性数据。 在 **Vision Flan** 和 **LLaVA-CoT** 两个基准上的实验表明,MASS 在多种数据预算下均稳定优于现有的强基线方法,并且在某些设置下,仅使用少量数据子集就能达到甚至超越全量数据训练的效果。这一结果意味着,MASS 有望显著降低 LLM 后训练的数据需求,为高效微调提供新的思路。 ## 方法核心 MASS 的流程分为两个阶段: 1. **粗粒度语义分组**:通过密集自编码器将高维嵌入压缩到低维主流形空间,利用几何结构进行语义聚类,避免原始空间中噪声的干扰。 2. **细粒度稀疏覆盖**:在每个语义组内,使用 TopK 稀疏自编码器提取稀疏特征,并基于质量感知的覆盖策略选择数据点,确保所选子集能充分代表组内的多样性。 这种分层设计使得 MASS 既能把握全局语义,又能捕捉局部关键特征,从而在数据选择上实现更好的平衡。 ## 实验亮点 在 Vision Flan 数据集上,MASS 在 10%、25%、50% 等不同数据预算下,均取得了比随机选择、核心集选择等基线更高的下游任务准确率。在 LLaVA-CoT 上,MASS 同样表现出色,甚至在 25% 数据预算下就超过了全量微调的效果。这些结果凸显了 MASS 在数据效率上的巨大潜力。 ## 意义与展望 这项研究为 LLM 后训练的数据选择提供了新的视角。通过引入分层覆盖和稀疏特征,MASS 有效解决了传统方法在嵌入空间中度量多样性的局限。未来,该方法有望扩展到更多模态和更大规模的数据集,进一步推动高效训练的发展。

HuggingFace13天前原文

在组织文档管理中,自动敏感度分类是一项关键但常被忽视的任务。分类错误可能导致监管违规或安全漏洞。尽管基于AI的方法为人工审查提供了可扩展的替代方案,但其可靠性高度依赖于训练数据的完整性。然而,该领域普遍存在一个被低估的问题——标签泄漏:文档中残留的分类标记使得模型能够利用表面捷径而非学习真正的内容信号,从而产生虚高且不可靠的性能评估。 针对这一问题,研究人员提出了**Strategic 16K**,一个精心构建的、控制泄漏的语料库,包含来自维基解密美国外交电文库(PlusD)的**16,000份外交电文**。他们系统性地评估了六种模型架构,涵盖经典机器学习和基于Transformer的方法。通过扩展的泄漏移除协议,他们识别并消除了三类残留分类标记。在干净的基准测试上,**BERT表现最佳**(准确率89.14%,F1分数89.33%),其次是**ELECTRA**(准确率88.57%,F1分数88.90%)。在经典模型中,**TF-IDF结合逻辑回归**以显著更低的计算成本取得了最强性能。 这些结果构成了首个在明确泄漏控制条件下从WikiLeaks PlusD构建的可完全复现的敏感度分类基准。 ## 背景与挑战 组织文档的敏感度分类是信息安全的重要防线,但传统人工审查成本高昂且效率低下。AI模型的应用虽能提供规模化解决方案,却面临一个隐蔽的陷阱:训练数据中的标签泄漏。如果文档中残留了分类标记(如“机密”字样),模型可能会依赖这些表面线索,而非学习文档内容的语义特征,导致在真实场景中性能大幅下降。 ## 研究方法 研究团队从WikiLeaks PlusD中选取了16,000份外交电文,构建了Strategic 16K语料库。他们设计了一套严格的泄漏移除协议,系统性地识别并清除了三类标记:格式标记、元数据标记和内容中的分类词汇。随后,他们对比了六种模型:经典方法包括TF-IDF与逻辑回归、朴素贝叶斯和支持向量机;深度学习方法包括BERT、ELECTRA和RoBERTa。 ## 主要发现 在清理后的基准上,BERT和ELECTRA展现了优越性,但经典模型也表现出色。TF-IDF与逻辑回归的组合在准确率和F1分数上接近最佳深度模型,却无需GPU训练,推理速度更快,资源消耗更低。这提示我们,在资源受限的场景下,经典模型仍具竞争力。 ## 意义与展望 这项研究不仅提供了首个可复现的泄漏控制基准,还强调了数据质量在AI系统中的重要性。它提醒我们,模型性能的评估必须建立在干净的数据之上,否则可能会误导实际部署决策。未来,如何将泄漏检测自动化,以及如何在更广泛的文档类型上验证这些发现,将是值得探索的方向。

HuggingFace13天前原文

## 日级建模:从静态快照到动态轨迹 医院再入院率是衡量医疗质量与资源调配效率的关键指标。传统预测模型通常将住院期间的复杂病史压缩为固定表征,忽视了反映患者生理状态演变的日级临床信号。针对这一局限,来自韩国的研究团队在 MICCAI 2026 MultiTab Workshop 上提出了 **Mr.Dec**(Multimodal Readmission-risk prediction Decoder),一种以日为单位、融合多模态数据的再入院风险预测模型。 ## 核心设计:时间对齐的多模态事件流 Mr.Dec 的核心创新在于将每次住院视为一个**按时间顺序排列的日级多模态事件序列**。模型通过 Transformer 解码器架构,将电子健康记录(EHR)的每日更新与间歇性胸部 X 光片(CXR)发现整合到同一时间对齐的数据流中,模拟真实临床工作流程。这种设计避免了传统方法中因固定时间窗口压缩而丢失的细节,使模型能够捕捉患者每日的病情变化轨迹。 ## 技术亮点:对比学习增强稳健性 为了提升模型的鲁棒性,Mr.Dec 引入了**疾病特异性监督对比学习**作为辅助正则化手段。该机制在潜在空间中诱导出诊断感知的结构,帮助模型更好地区分不同疾病类型的再入院风险模式,从而增强泛化能力。 ## 实验结果与临床价值 在 MIMIC-IV 和 MIMIC-CXR 数据集上的评估显示,Mr.Dec 达到了**最先进的性能**,验证了保留临床序列完整性的有效性。此外,模型还能识别住院期间的“**关键日**”,为实时风险分层提供可操作的临床解释。这一功能有望帮助医护人员在患者住院过程中及时干预,降低再入院风险。 ## 展望 Mr.Dec 为医疗 AI 提供了一个新思路:**从静态快照转向动态轨迹建模**。未来,该框架或可扩展至其他时间敏感型临床预测任务,如脓毒症早期预警或术后并发症监测。不过,当前研究仍基于公开数据集,实际临床部署还需考虑多中心验证与模型可解释性等挑战。

HuggingFace13天前原文

多任务学习(MTL)旨在通过共享表示同时解决多个相关任务,以提升效率和泛化能力。然而,现有方法在模型容量调整上存在局限:要么依赖硬共享或固定结构,要么需要预设多个路径或专家,要么根据任务边界或冲突信号进行动态扩展。这些方法往往受限于预定义结构,或需要人工干预,无法真正实现按需生长。 针对这一痛点,来自北京农业信息技术研究中心、西北工业大学等机构的研究者提出了**EMAN**(Emergent Modular Atomic Network,涌现模块化原子网络)框架,探索一个根本性问题:**网络能否从单路径计算出发,仅在出现持续优化证据时,才生长出新的独立路径?** EMAN 的核心创新在于,它通过潜在相对相位(latent relative phases)暴露了一个反对称生长方向(antisymmetric growth direction),从而在不实例化第二条路径的情况下,持续监测多个决策信号,将局部的优化证据转化为结构决策。只有当证据充分(即通过认证)后,EMAN 才会实际物化出两条等容量的独立路径,并自适应地分配共享与任务专属的表示容量。 实验方面,研究团队在受控秩设置、**PASCAL-Context** 和 **NYUv2** 数据集上进行了广泛验证。结果显示,EMAN 能以具有竞争力的计算成本取得更优性能,证明了其有效性。 这项工作的意义不仅在于提出了一种新的 MTL 架构,更在于提供了一种**优化驱动的容量增长范式**:容量变化不再依赖人工预设,而是由训练过程中的优化信号自然触发。这为多任务学习乃至更广泛的动态神经网络设计提供了新思路。 当然,EMAN 仍面临一些挑战,例如如何准确判断“持续优化证据”,以及如何避免过早或过晚地生长路径。未来,这一框架有望与神经架构搜索、持续学习等方向结合,推动模型向更自主、更高效的方向演进。

HuggingFace13天前原文

脑电图(EEG)基础模型通过在大规模异质神经记录上学习可复用表示,已成为EEG解码的一种有前景的范式。然而,公开释放EEG基础编码器虽促进了下游开发,却也引入了此前未被探索的安全风险:公开可用的表示可能使私有下游模型变得脆弱。本文研究在公共编码器和私有下游设置下的对抗迁移攻击,其中攻击者可白盒访问已发布的编码器和小型任务匹配的标记参考集,但无法访问或查询受害者的参数、输出或梯度。 我们提出了收缩-白化代理交叉熵(SW-ProxyCE),一种免查询的任务感知攻击框架,通过收缩-白化的类原型从小型标记参考集中恢复任务级决策几何,从而无需训练额外代理分类器即可生成可迁移的对抗样本。我们在三个EEG任务上评估了SW-ProxyCE,使用三个通用基础编码器和一个范式特定预训练编码器,覆盖了跨受试者和受试者内场景下的线性探测和全微调下游模型。结果表明,从公共编码器和有限标记参考生成的对抗样本能有效迁移至不可访问的下游模型。SW-ProxyCE始终优于任务无关的表示偏移攻击,揭示EEG基础模型的强迁移性并不必然带来对抗鲁棒性。代码将在GitHub上提供。 ## 背景与动机 EEG基础模型的开放发布促进了社区发展,但也引入了新的攻击面。攻击者可能利用公开编码器生成对抗样本,攻击下游私有模型,而无需任何查询。这种攻击方式在现实场景中具有可行性,因为许多部署模型基于公开编码器进行微调。 ## 方法:SW-ProxyCE SW-ProxyCE的核心创新在于利用收缩-白化类原型来近似任务决策边界,从而在无查询条件下生成可迁移的对抗扰动。该方法无需训练额外的代理分类器,降低了攻击成本,同时保持了攻击有效性。 ## 实验与结果 实验覆盖多个EEG任务和多种编码器架构,结果一致表明SW-ProxyCE生成的对抗样本能有效攻击私有下游模型,且性能优于现有方法。这提示基础模型的迁移性可能被恶意利用,需引起重视。 ## 总结与展望 本研究首次系统探讨了EEG基础模型的安全风险,提出了高效的攻击方法,并呼吁社区关注模型的鲁棒性。未来工作可探索防御策略,如对抗训练或模型净化,以增强EEG基础模型部署的安全性。

HuggingFace13天前原文