Google Photos 近日推出了一项名为 **Video Remix(视频混音)** 的全新 AI 编辑功能,让用户只需轻点几下即可完成复杂的视频特效。该功能由 Google 最新发布的 **Gemini Omni** 多模态模型驱动,能够为视频添加电影级补光、更换背景、叠加水彩或油画等艺术风格,将普通片段瞬间变成“值得分享的瞬间”。 ## 功能亮点 - **智能补光**:自动识别暗光场景,应用电影级布光效果,让画面明亮自然。 - **背景替换**:一键将平淡背景换成温室、城市夜景等创意场景。 - **艺术风格迁移**:支持水彩、素描、油画等多种滤镜,可直接“画”出视频。 ## 操作与可用性 用户只需在 Google Photos 的 **“创建”** 标签页中进入 Video Remix,选择素材并挑选效果即可。该功能即日起向 **Google AI Plus、Pro 和 Ultra 订阅用户** 开放,首批覆盖美国、阿根廷、巴西、印度、日本等 14 个国家。 ## 行业背景 这是 Google 在消费级 AI 工具领域的又一次加码。面对 Apple、OpenAI 和 Adobe 的竞争,Google 正将生成式 AI 深度植入其生态应用。此前 Google Photos 已推出 AI 修图、数字衣橱等功能。Video Remix 的推出意味着普通用户无需专业剪辑软件,也能在手机端完成过去需要数小时才能实现的视频特效。 ## 小结 Video Remix 降低了视频创作的门槛,也进一步巩固了 Google Photos 作为 AI 创意中心的地位。对于想要快速产出社交素材的用户来说,这无疑是一个实用且有趣的新选择。
当谈论实现通用人工智能(AGI)时,大型语言模型可能并不具备所需的一切。像ChatGPT和Claude这样的模型在文本处理上表现出色,但在理解事物如何在空间和时间中实际移动方面却相对薄弱——而这恰恰是产生通用智能的关键技能。这个差距,或许可以通过游戏数据来弥补。这正是**General Intuition**这家初创公司的赌注所在。 ## 从文本到空间:AI训练数据的下一个前沿 当前的主流AI模型主要依赖互联网文本数据进行训练,这使它们掌握了丰富的语言知识,但缺乏对物理世界动态的理解。例如,模型可以描述“抛球”的动作,却无法真正预测球的轨迹。这种局限性源于训练数据的性质:文本是静态的、离散的,而现实世界是连续、动态的。 **General Intuition**的CEO认为,电子游戏提供了一个理想的替代方案。游戏环境本质上是物理世界的模拟,其中包含空间关系、运动规律、因果关系和实时反馈。通过从游戏中提取数据——比如玩家在《我的世界》中建造房屋,或在《GTA》中驾驶汽车——AI可以学习到物体如何交互、如何规划路径以及如何适应变化的环境。这些数据天然带有时间维度和空间坐标,有助于模型建立对物理世界的“直觉”。 ## 游戏数据的独特优势 与互联网文本相比,游戏数据具有几个关键优势: - **结构化动态**:游戏中的每个物体都有明确的位置、速度和交互规则,这为AI提供了清晰的学习信号。 - **低成本标注**:游戏引擎自动记录所有事件,无需人工标注,大大降低了数据获取成本。 - **场景多样性**:从奇幻世界到现实模拟,游戏覆盖了极其丰富的场景,有助于模型泛化。 General Intuition并非唯一关注游戏数据的公司。此前,DeepMind曾利用《星际争霸》训练AI策略,OpenAI也在《Dota 2》中取得了突破。但General Intuition的特别之处在于,它试图将游戏数据与语言模型结合,构建一种能够同时理解文本和物理世界的混合模型。 ## 挑战与前景 尽管游戏数据潜力巨大,但将其用于AGI训练仍面临挑战。例如,游戏中的物理规则可能与现实世界不完全一致,导致模型产生偏差。此外,如何从海量游戏数据中提取高质量、无偏见的样本,也是一个技术难题。 然而,随着AI对物理世界理解的需求日益增长,游戏数据很可能成为下一个重要的训练资源。General Intuition的探索或许会为AGI的路径开辟一条新路。
Meta 正在为 AI 眼镜增加一项新防护措施,以防止用户偷偷录制他人。然而,这一更新恰逢公司持续扩大其 AI 产品收集和使用个人数据的范围。 ## 隐私与增长的矛盾 Meta 的 AI 眼镜因其潜在的隐私侵犯风险而备受争议。公司最新宣布,若指示录制状态的 LED 灯被篡改,摄像头将自动禁用。此举表面上是对消费者情绪的让步——眼镜不仅仅是 Kylie Jenner 推广的时尚配件,更可能被滥用作监控设备。但就在 Meta 宣传这项新保护措施的同时,该公司也在推动更多要求用户让渡隐私的产品和功能。 无论是利用用户图像训练 AI、默认启用基于个人内容的 AI 功能(除非用户选择退出),还是探索持续录制或生物面部识别技术,Meta 的未来愿景似乎始终依赖于收集更多个人数据。 ## LED 防护与持续监控的对比 在关于新摄像头安全功能的博文中,Meta 自夸道:“没有其他相机做过这件事,我们很自豪能引领行业。”然而,公司也承认这一举措是必要的,因为有人曾用胶带遮挡 LED 灯,迫使 Meta 调整技术以在 LED 被遮挡时禁用录制。Meta 的公告指出,这些“AI 眼镜怪客”甚至会用复杂手段修改或破坏 LED。换句话说,Meta 确认部分用户存在隐藏目的——即未经同意录制他人(通常是女性)。 尽管如此,据 Financial Times 报道,Meta 正在测试一款 AI 眼镜原型,该原型将连续收集音频并每隔几秒拍照。公司还面临多起关于 AI 眼镜隐私侵犯的调查和诉讼。例如,Meta 曾因肯尼亚外包员工指控被迫审阅暴力内容而取消合同。 ## 用户数据与 AI 训练 Meta 的博文试图缓解隐私担忧,例如回答“谁可以看到眼镜拍摄的照片和视频?”时承诺:“只有你,除非你选择分享。”然而,Meta 的隐私政策明确说明,任何与 Meta AI 分享的图像都可能用于训练其 AI。在数据收集与用户信任之间,Meta 似乎仍在艰难平衡。
OpenAI今日发布了两款新型对话模型——**GPT-Live-1**和**GPT-Live-1 mini**,宣称它们听起来更自然,并能在对话中更好地处理“轮替”问题。这些模型采用**全双工**设计,即可以同时说话和聆听,让用户能够自然地打断对话,并支持实时翻译等功能。 从即日起,ChatGPT中的**高级语音模式**将默认替换为GPT-Live-1 mini。付费用户则可使用更大的GPT-Live-1模型。此前,ChatGPT的语音模式依赖于一个由语音转文本、大语言模型和文本转语音三部分串联而成的管线,这导致了响应延迟和打断用户等问题。新模型通过端到端的方式解决了这些痛点,使得对话更加流畅自然。 在媒体简报会上,OpenAI展示了新模型的几个关键能力:它能够长时间保持沉默,在需要时才介入;当用户提问时,它会将查询发送至最新的文本模型(如GPT-5.5)以获取搜索、推理或智能体能力,同时保持对话的连贯性。此外,新语音模式还能以视觉形式呈现部分信息,例如显示图表或图片,这与其他创业公司(如**Monogram**)的交互式助手思路不谋而合。 OpenAI认为,语音可能成为未来复杂工作的**主要计算界面**。ChatGPT语音产品负责人Atty Eleti透露,他本人曾用该功能进行过长达30至40分钟的散步对话。公司观察到,超过1.5亿人使用ChatGPT的语音和听写功能。尽管有报道称OpenAI可能推出AI耳机硬件,但本次发布会并未涉及硬件产品。 这一更新标志着AI语音交互从“命令-响应”模式向**持续、双向对话**的转变。随着全双工模型和更智能的后端推理能力结合,语音助手有望承担更复杂的任务,如实时翻译、长时会议记录甚至代理型工作流。对于开发者而言,GPT-Live系列模型也意味着更低的延迟和更高的交互自然度,可能催生新的应用场景。
成立于 2024 年的 AI 初创公司 **Prime Intellect** 近日宣布完成 **1.3 亿美元 A 轮融资**,估值达到 **10 亿美元**。本轮由 **Radical Ventures** 领投,**Nvidia Ventures**、**Intel Capital**、**Dell Technologies Capital**、**Iconiq** 以及多位知名创始人跟投,包括 Perplexity 的 Aravind Srinivas、Box 的 Aaron Levie 等。 Prime Intellect 的核心使命是让企业能够**自主训练 AI Agent 系统**,不再依赖前沿 AI 实验室。其解决方案是一个“全栈”平台,整合了算力访问、强化学习框架和评估工具,并以模块化市场形式提供,企业可按需选用。 过去,自建 AI Agent 需要极高的技术门槛,但强化学习技术的成熟使得企业可以通过迭代奖励机制优化模型。Prime Intellect 降低了这一过程的复杂度,让企业成为“自己的 AI 实验室”。 目前,客户包括 **Ramp**、**Zapier** 和 **Flapping Airplanes**。Ramp 使用 Prime Intellect 构建的 Agent 在电子表格中查找数据,**准确率超越前沿模型,速度更快且成本更低**。公司的年化经常性收入已达 **1 亿美元**。 Radical Ventures 合伙人 David Katz 表示,Prime Intellect 将前沿能力以“一站式”方式提供,这在市场上独一无二。随着企业对定制化 AI 需求激增,Prime Intellect 有望成为 AI 基础设施领域的重要玩家。
随着新旧公司竞相利用AI,许多AI初创公司报告称其收入不仅增长,而且正在加速,以更短的时间达到下一个里程碑。以下公司展示了这种飞轮增长模式。需要注意的是,这些公司使用的底层指标可能不同,即使它们都使用“ARR”一词。有的指年度经常性收入(ARR),即已签约但尚未开票的客户合同收入;有的指年化运行率收入,即按最近一个月收入水平推算的全年收入;还有的指承诺ARR,即已签约但尚未入住的客户合同。以Gusto为例,它报告的是实际过去12个月收入。尽管如此,以下按ARR增长公开时间倒序排列的初创公司均声称其收入增长正在加速,无论它们如何定义。当然,快速增长的公司远不止这些,但本文仅列出那些以越来越快速度达到收入里程碑的企业。 **Mercor**:周一,Mercor联合创始人兼CEO Brendan Foody宣布,截至6月,公司年化总收入已突破**20亿美元**,而仅四个月前才达到10亿美元里程碑。这家成立不到三年的公司雇佣领域专家训练和优化AI模型,去年9月曾达到5亿美元运行率。 **Anthropic**:近几个月,这家模型制造商的收入速度令整个AI行业瞩目。5月底,Anthropic宣布其收入运行率超过**470亿美元**,而这一里程碑距离公司报告同一指标超过300亿美元不到两个月。该公司称,2025年底其收入运行率达到90亿美元,高于2025年7月的40亿美元。 **Sierra**:为企业构建客服AI代理的Sierra,在七个季度内达到首个1亿美元ARR后,联合创始人兼CEO Bret Taylor于5月底表示,仅用两个季度就再增加了1亿美元。 **Glean**:5月,Glean宣布ARR突破**3亿美元**。这家成立七年的企业AI初创公司,从1亿美元ARR翻倍至2亿美元用了九个月,而从2亿美元到3亿美元仅用了……
前 OpenAI 高管 Kevin Weil 近日宣布加入可重复使用火箭公司 Stoke Space 的董事会。这一动向不仅标志着 Weil 个人职业生涯的新篇章,更折射出硅谷科技精英对太空领域的浓厚兴趣——继 AI 之后,可重复使用火箭正成为下一个热门赛道。 ### 从 AI 到太空:Weil 的跨界逻辑 Kevin Weil 在科技行业拥有丰富履历,曾担任 OpenAI 产品副总裁,主导了 GPT-4 等核心产品的发布。在此之前,他还在 Twitter、Instagram 和 Facebook 担任高管,负责产品与增长团队。Weil 的加入为 Stoke Space 带来了产品思维和规模化经验,这在竞争激烈的商业航天领域尤为关键。 Weil 本人在声明中表示,Stoke Space 在可重复使用火箭技术上的突破让他看到了“将出行成本降低两个数量级”的可能性,这与他在 AI 领域追求“让技术更普惠”的目标不谋而合。 ### Stoke Space 的差异化路线 Stoke Space 成立于 2019 年,总部位于华盛顿州,专注于研发完全可重复使用的火箭。与其他商业航天公司不同,Stoke 采用“垂直起降+无整流罩”的独特设计,旨在实现火箭的快速复用和低成本发射。公司目前已获得包括 Y Combinator 在内的多轮融资,但尚未进行首次轨道发射。 Weil 的加入可能加速 Stoke 的产品化进程。他在 OpenAI 期间主导了从研究到产品的转化,这种经验对于尚处于研发阶段的 Stoke 来说,价值不言而喻。 ### 硅谷的太空野心 Weil 的跨界并非孤例。近年来,硅谷科技巨头纷纷涉足太空领域:Elon Musk 的 SpaceX 已占据可重复使用火箭的领先地位,Jeff Bezos 的 Blue Origin 紧随其后,而 Peter Beck 的 Rocket Lab 则聚焦小型卫星发射。如今,Stoke Space 作为新玩家,试图通过技术差异化找到自己的生态位。 值得注意的是,Weil 的加入也反映了硅谷人才流动的新趋势:AI 领域的顶尖人才开始向“硬科技”领域迁移。随着 AI 应用逐渐成熟,一些高管和工程师开始寻找更宏大的技术挑战——太空探索无疑是其中之一。 ### 挑战与前景 Stoke Space 面临的挑战不容忽视。SpaceX 的猎鹰 9 号已实现成熟复用,Blue Origin 的新格伦火箭也在研发中,Stoke 需要在成本、可靠性和发射频率上找到突破点。此外,公司尚未完成轨道飞行测试,技术验证仍是当前首要任务。 不过,Weil 的加入为 Stoke 带来了硅谷式的产品思维和融资能力。如果 Stoke 能在 2025 年前完成首飞,它有望在中小型卫星发射市场占据一席之地。 **小结**:Kevin Weil 加盟 Stoke Space 是 AI 与航天两大前沿领域的又一次交汇。它既反映了硅谷对太空商业化的信心,也预示着可重复使用火箭技术即将进入更激烈的竞争阶段。对于关注硬科技趋势的读者来说,这无疑是一个值得持续追踪的信号。
法国AI初创公司ZML近日宣布推出免费软件ZML/LLMD,旨在显著提升跨芯片的AI推理速度,降低运行成本。这家由图灵奖得主Yann LeCun背书的公司,正试图解决AI部署中的核心痛点——高昂的计算资源消耗。 ## 技术创新与行业背景 ZML/LLMD的核心优势在于其**多芯片并行推理能力**。传统上,AI模型在单芯片上运行,即便使用高端GPU,面对大规模模型时仍存在延迟和成本问题。ZML/LLMD通过优化底层通信和调度算法,允许模型**跨多个AI芯片协同工作**,从而大幅缩短推理时间。这一方案尤其适合当前流行的**大语言模型(LLM)**和生成式AI应用,这些场景对计算资源的需求呈指数级增长。 ## 开源策略与市场影响 ZML选择将ZML/LLMD**免费开放**,这一策略与行业趋势高度吻合。开源不仅降低了企业试用门槛,还能吸引开发者社区贡献代码,加速软件迭代。此举可能对英伟达等硬件厂商的生态形成冲击——如果软件层面能高效利用多芯片,客户可能更倾向于采购更多中低端芯片而非高价旗舰产品,从而改变AI芯片市场的竞争格局。 ## 创始团队与背书 ZML团队背景深厚,除了得到Yann LeCun的公开支持,核心成员曾在Meta、Google等公司从事AI基础设施研究。LeCun曾表示:“高效推理是AI民主化的关键,ZML的工作方向非常正确。”这种顶级学术背书增强了产品的可信度。 ## 潜在挑战 尽管前景乐观,ZML/LLMD仍需面对实际部署中的挑战:不同芯片架构的兼容性、分布式系统带来的运维复杂度,以及与传统推理框架(如TensorRT、ONNX Runtime)的集成问题。此外,免费模式如何支持长期迭代也值得关注。 ## 小结 ZML/LLMD的发布标志着**AI推理优化进入软硬协同新阶段**。通过释放多芯片潜能,它可能成为降低AI服务成本的关键工具。对于开发者和企业而言,这无疑是一个值得尝试的选项;对于行业,则预示着更多开源推理工具的出现,最终推动AI应用更广泛地落地。
AI芯片初创公司 **SambaNova Systems** 宣布完成 **10亿美元** 的F轮融资,公司估值达到 **110亿美元**。本轮融资由 **General Atlantic** 领投,预计未来几周将有更多投资者加入完成二次交收。这是继今年2月该公司发布SN50芯片并完成3.5亿美元E轮融资后,仅隔5个月再次获得巨额资金注入。 SambaNova CEO兼联合创始人 **Rodrigo Liang** 在接受TechCrunch采访时表示,公司始终保持开放态度,尽管有传闻称英特尔曾试图以约 **16亿美元** 收购该公司,但Liang并未明确否认。他指出,在动态的AI市场中,公司持续受到关注,而增长势头可能最终推动其走向上市。 值得注意的是,SambaNova与英特尔的关系进一步深化。自C轮融资以来,英特尔一直是其投资方,本轮也参与了投资。双方已在基于英特尔Xeon芯片的AI推理开发上建立了多年合作关系,目前正共同开发产品并推向市场。Liang表示,这种合作使SambaNova能够借助英特尔的规模优势。 此外,SambaNova宣布被 **摩根大通** 选为“推理基础设施合作伙伴”,其SN40L和SN50系统将为该银行提供安全、本地化的AI推理服务。Liang认为,这一合作向银行业传递了重要信号:不应完全依赖云服务,而应构建混合基础设施。他预测,类似摩根大通级别的银行将纷纷建立私有、安全的基础设施,以运行最敏感的模型。 Liang强调,企业和政府刚刚开启AI之旅,此前大部分增长集中在模型制造商和前沿实验室,这为SambaNova留下了巨大的市场空间。
Meta 近日正式发布其最新 AI 图像生成模型 **Muse Image**(内部代号“Mango”),由 Meta 超级智能实验室(Meta Superintelligence Labs)打造。该工具将通过 **Meta AI 应用**、**Instagram Stories** 和 **WhatsApp** 免费提供,旨在为用户提供创意图像生成、广告设计、家居装饰可视化等多元功能。 ## 功能亮点与使用场景 Muse 的核心能力与其他主流 AI 图像生成器类似,用户可通过文本提示生成卡通、搞笑等风格的图像。为降低使用门槛,Meta 内置了 **预设提示(presets)**,帮助缺乏灵感的用户快速上手。 官方演示视频展示了几个典型应用: - **自定义广告**:利用 Muse 快速生成广告素材,顺应 AI 在广告领域渗透的趋势。 - **家居装饰预览**:用户可拍摄自家车库或房间,让 Muse 模拟放入二手家具后的效果。该功能将与 **Facebook Marketplace**(Meta 的二手交易平台)深度整合,方便买家预览商品摆放效果。 - **智能图像编辑**:支持基于文本的编辑操作,例如将用户“放置”在历史地标前、清除照片中的“抢镜者”,甚至生成可扫描的二维码图像。 ## 与 Instagram 深度集成 Meta 同时为 Instagram Stories 推出了一系列由 Muse 驱动的 **AI 特效**,包括多种可自定义的滤镜,能够对已有照片进行风格化修改。这些特效将直接嵌入 Stories 创作工具,无需跳转应用。 ## 免费使用与订阅限制 Meta 表示,Muse 对日常创作 **完全免费**,但超出一定使用额度后,用户需订阅 Meta 的付费套餐。具体阈值尚未公布,预计与生成次数或分辨率相关。 ## 未来规划:Muse Video 已在路上 Meta 还透露,**Muse Video**(AI 视频生成器)已在开发中。这标志着 Meta 正从图像生成向视频生成领域拓展,与 OpenAI Sora、Runway Gen-3 等竞品展开直接竞争。 ## 行业背景与战略布局 过去一年,Meta 密集发布了多款 AI 产品,包括助手 **Creator** 和低代码游戏开发应用 **Pocket**。尽管外界批评其 AI 战略“模糊不清”,但 Meta 仍计划在今年投入巨资建设 AI 基础设施。Muse 的推出,可视为其整合 AI 能力至核心社交生态的关键一步——通过免费工具吸引用户,再以订阅和广告变现,形成闭环。 ## 小结 Muse 凭借 **免费策略**、**跨平台集成**(Instagram、WhatsApp、Facebook Marketplace)以及 **低门槛预设**,有望快速获得用户基础。然而,在 AI 图像生成赛道已拥挤的当下(如 Midjourney、DALL·E 3、Stable Diffusion),Muse 能否凭借 Meta 的社交生态优势突围,仍有待观察。
## 开源AI崛起,但前沿模型支出为何依然坚挺? Decagon CEO **Jesse Zhang** 近日提出一个颇具启发性的理论:企业AI部署中,成熟用例正逐渐转向更轻量的开源模型,然而前沿模型的总体支出却几乎未受影响。这看似矛盾的现象背后,隐藏着AI经济中一种新的生命周期规律。 Zhang 在文章中描述道,前沿模型和开源模型并非直接竞争对手,而是同一生命周期的两个阶段——**昂贵的尖端模型用于验证新用例**,一旦用例成熟,便迁移至更便宜的开源替代方案。由于新用例不断涌现,前沿模型的总支出并未显著下降。 尽管 Zhang 未提供详细数据,但第三方平台的数据佐证了这一趋势。**Vercel** 的AI网关仪表盘显示,过去一周内,DeepSeek 的token处理量已跃居首位,占平台总token量的三分之一以上;智谱AI(GLM-5.2模型)也攀升至第四位。然而在**实际支出**方面,Anthropic 仍占据平台AI总支出的一半以上。尽管近期因Anthropic涨价导致份额略有下滑,但整体格局未变。 **OpenRouter** 的数据进一步印证了这一模式。DeepSeek V4 Flash 在周token处理量上以 **5.3万亿** 领先,而最受欢迎的前沿模型 Opus 4.8 约为 **2万亿**。但 Opus 4.8 的每百万token成本(约1.37美元)是 V4 Flash(约0.06美元)的 **23倍**,这意味着 Opus 仍占据总支出的绝大部分。 值得注意的是,这些数据尚未包含英伟达新发布的 **Nemotron** 模型。凭借英伟达的生态优势和模型本身的强适应性,Nemotron 有望迅速跻身前列。 Zhang 的理论或许无法完全解释所有现象,但它揭示了AI行业一个关键动态:**开源模型与前沿模型正在形成共生而非替代关系**。对企业和开发者而言,这意味着在探索新场景时仍可依赖前沿模型的强大能力,而规模化部署时则可转向成本更优的开源方案。这种“先验证、后迁移”的模式,可能正是未来AI落地的核心路径。
随着AI成本持续攀升,硅谷巨头纷纷寻求节流之道。微软也加入这一行列,据彭博社报道,微软已开始在Excel和Word中部署自研的MAI模型,以处理部分用户请求,从而减少对OpenAI和Anthropic等第三方模型的依赖。过去,微软曾宣传Office 365大量采用这些第三方模型,但如今正加速自研AI代理。在上个月的Build大会上,微软发布了七款新MAI模型,包括编码助手和文生图工具。微软的举措并非孤例,亚马逊、Uber、Meta、埃森哲等公司也纷纷削减AI支出。高昂的AI成本已引发行业争议,部分企业甚至转向更便宜的中国模型,尽管存在安全隐患。 ## 成本压力催生自研策略 微软的转变反映了整个行业的成本焦虑。自今年早些时候的“token狂欢”后,科技公司开始精打细算。微软通过自研MAI模型替代外部模型,直接降低API调用费用。虽然微软未透露具体替代比例,但这一策略在Office核心产品中的落地,标志着自研模型已具备实用能力。 ## 行业连锁反应 微软并非唯一“吃螃蟹”的公司。亚马逊、Uber、Meta、埃森哲等巨头也传出削减AI支出的消息。部分企业甚至开始测试中国模型,以更低成本获取代理解决方案,尽管可能面临数据安全风险。这显示出行业对“AI性价比”的重新权衡。 ## 微软的自研生态布局 微软的自研模型并非临时起意。今年Build大会上的七款MAI模型,覆盖编码、图像生成等场景,显示出微软试图构建从基础模型到应用的全栈能力。尽管仍会保留部分第三方合作,但自研模型比例提升将增强其议价能力和技术独立性。 ## 挑战与前景 自研模型面临效果和稳定性挑战。微软需确保MAI模型在复杂办公场景中不逊于GPT-4等先进模型。同时,减少对OpenAI的依赖可能影响双方合作关系。但长远看,这是微软控制成本、巩固生态的关键一步。 ## 小结 微软的“省钱”策略是AI行业从狂热转向理性的缩影。当技术红利遭遇成本现实,巨头们开始回归商业本质。未来,更多公司可能会效仿微软,在自研与外部采购之间寻找平衡点。
Discord 近日承认,其 AI 审核系统存在一个严重漏洞,导致超过 8000 名用户在过去两个月内被错误封禁。这些用户上传的无害图片——包括电子表格、棋盘、游戏纹理以及白色和灰色透明背景——被系统错误地标记为有害内容。问题自 5 月起开始影响账户,上周末又有 200 名用户被封禁,直到团队确认并修复了问题。目前,所有受影响的账户正在逐步恢复。 ## 误封事件的来龙去脉 Discord 在 X 平台发布详细说明,解释道:其自动化安全系统通过将上传内容与已知有害材料数据库进行匹配来识别违规内容。尽管技术设计初衷是捕捉非法内容,但公司承认有时会产生误报。正常情况下,系统会先由人工审核员审查标记内容,但此次漏洞导致系统直接封禁了受影响账户。 “我们正在加强防护措施以防止此类事件再次发生,”Discord 写道。 ## 用户反馈与推测 在 X 和 Reddit 上,许多用户声称自己仅仅因上传包含方形网格图案的图片就被永久封禁。部分用户猜测,Discord 的 AI 审核工具对网格状图案变得异常敏感,是因为这些图案此前曾被用于试图隐藏或伪装 NSFW 及儿童剥削内容,以规避自动检测系统。受影响的用户表达了强烈不满,认为基于自动检测的永久封禁会带来严重后果,尤其是对于那些依赖 Discord 进行工作、游戏社区或远距离社交的用户。 一位 X 用户写道:“因为如此不公的原因失去 Discord 账户可能极具毁灭性,并严重影响用户。每天都有数百万用户受到虚假 AI 封禁的影响。这必须停止。” ## 反思:AI 审核的困境 此次事件凸显了 AI 辅助审核日益增长的挑战。随着越来越多的平台依赖自动化系统大规模识别非法或滥用内容,误报问题成为不可避免的副作用。Discord 的案例表明,即使是经过人工审核流程设计的系统,也可能因技术漏洞导致错误决策。如何在效率与准确性之间取得平衡,是行业亟待解决的难题。 Discord 承诺改进防护措施,但用户信任的修复可能需要更长时间。
Anthropic 的通用知识工作智能体 Claude Cowork 正式登陆移动端和网页端。该产品最初于 1 月作为桌面应用推出,从周二起,Max 订阅用户可在手机和浏览器上使用它。用户可以在办公桌前启动任务,在手机上查看状态更新,稍后再取回完成的结果——即使笔记本电脑合上盖子也没关系。 这一产品扩展表明 Anthropic 希望 Cowork 不再只是“傻瓜式编码工具”,而是更像一个真正的行政同事:能在后台工作、跨设备随行,并在需要人类决策时及时请求输入。换句话说,编码智能体之战正蔓延到办公室的各个角落。 此举正值 AI 公司试图将其产品从聊天机器人推向实际工作发生的日常场景。OpenAI 也做出了类似动作,其 Codex 最初是软件开发工具,但越来越多地被非开发者用于报告、电子表格、演示、研究、数据分析等。对于两家实验室而言,成功将不再取决于谁拥有最好的聊天机器人,而是谁占据了完成工作的空间。 这种扩展也延伸至其他应用。Anthropic 最近推出了 Claude Tag,一个常驻 Slack 的始终在线 AI 队友。除了特定界面的优势外,多平台 Cowork 意味着智能体可以在设备离线时继续在后台运行任务。Anthropic 举了一个例子:“将周一的客户准备设在早上 6 点:Claude 处理邮件线程、会议记录和最新新闻,构建简报文档,并留下已起草但未发送的跟进邮件。你可以在喝咖啡时审阅。” 桌面应用仍将是深度工作的场所,Claude 可以访问本地文件和浏览器。但将 Cowork 带到网页和移动端意味着未安装应用的人也能使用。Anthropic 表示,聊天和 Cowork 将在网页和桌面端统一,项目与工件将跨平台共存。 Anthropic 还发布了早期 Cowork 数据,表明该工具最清晰的用例是维持公司运转的“工作之外的工作”——处理那些涵盖广泛职位但很少是个人核心职责的任务。该研究抽样了 120 万个匿名任务,揭示了 AI 智能体如何承担起琐碎但必要的行政负担。
## 当 AI 开始“绑架”你的家人 你是否想过,有一天会接到一个电话,那头传来女儿惊恐的求救声,随后绑匪索要赎金?这不再是电影情节,而是真实发生在两位科技兄弟母亲身上的事。如今,他们创立了 **Savi Security**,并推出同名应用,专门保护普通人免受 AI 生成诈骗的侵害。 ### 一次噩梦般的经历 两年前,Savi 联合创始人 Patrick Coughlin 的母亲接到一个电话,来电显示是女儿(Patrick 的姐妹)的号码。电话里,她听到女儿的哭喊:“妈,他们抓住我了!”接着是一声尖叫,一个男人威胁说如果不马上支付 **1200 美元**,就在当地沃尔玛停车场杀害她。幸运的是,母亲保持冷静,直接联系了女儿,发现她安然无恙——这完全是一场 **AI 生成的骗局**。 Patrick 当时是 Cisco 安全产品高级副总裁,他震惊于诈骗手段的精密:骗子不仅伪造了号码,还克隆了声音,甚至准确提及了受害者常去的沃尔玛位置。他意识到,过去只针对政府和企业的高端攻击手段,如今正被廉价而强大的 **大语言模型(LLM)** 和生成式 AI 工具普及到普通消费者身上。 ### Savi 如何守护你? Savi 应用于周二在 iPhone 和 Android 平台上线,并宣布获得 **700 万美元种子轮融资**,由 Acrew Capital 领投,Magnify Ventures、TTCER 和 Resolute Ventures 参投。它的核心功能是实时分析来电、短信和邮件,识别 AI 生成的诈骗特征。例如,对于语音通话,Savi 可以检测声音是否被合成或伪造;对于消息,它能分析语言模式是否异常。 与传统的安全软件不同,Savi 专注于“社会工程”类攻击,这类攻击利用人的恐惧和信任,而非技术漏洞。创始人表示,他们的目标不是取代现有安全方案,而是填补 **消费者在 AI 诈骗面前的防御空白**。 ### 为何现在需要这样的工具? 在 AI 之前,针对个人的定制化诈骗成本极高,需要大量调查和技术投入,因此主要瞄准企业高管等高价值目标。但如今,任何人都可能成为目标。生成式 AI 让骗子能快速生成逼真语音、伪造身份信息,甚至模拟亲友的聊天风格。Savi 的诞生,正是为了将专业安全能力平民化。 ### 小结 Savi 的故事提醒我们:AI 诈骗已不再是科幻,而是现实的威胁。这款应用能否成为消费者的“数字保镖”?随着融资到账和产品上线,它或许会给出答案。但更关键的是,我们每个人都需要提高警惕——因为下一个“绑架”电话,可能就来自你熟悉的声音。
美国自主车辆制造商 **Forterra** 今日披露,已有超过 **100 辆** 其制造的自主 ATV(全地形车)在乌克兰冲突区部署了九个月。该公司称,这可能是美国防务科技公司迄今为止在战斗中部署的最大规模自主地面车辆。 Forterra 首席增长官、前美国海军陆战队军官 Scott Sanders 对 TechCrunch 表示:“我相信所有防务技术都是如此——除非你真正面对战斗现实,否则你永远不会知道它是否管用。” 这批车辆由美国国防资金支持,是美国通过支持乌克兰抵抗俄罗斯入侵来推动自身军事变革的一部分。 虽然空中无人机在战斗中备受关注,但它们创造的“禁入区”动态(即任何暴露都可能招致来自上方的打击)促使乌克兰战略家寻求地面自主能力。美国陆军自主车辆项目负责人 Corey Wilkens 军士长解释道:“无处可藏。你变得非常脆弱,容易受到第一人称视角无人机、其他投弹无人机、火炮、迫击炮等全方位攻击。” 乌克兰已在自行建造无人地面车辆(UGV)用于运输物资、弹药或撤离伤员,但这些车辆通常为电池驱动,载重仅 **250 公斤**。而 Forterra 的 **Lancer 车辆** 基于 Polaris ATV,搭载定制传感器和计算堆栈,采用汽油动力,可承载 **750 公斤** 货物,更加通用和实用。一名参与车辆使用的乌克兰士兵(因安全原因匿名)评价道:“这辆用于后勤和防御的 UGV 是乌克兰最重要的 UGV。它 **太棒了**,我们迫切想要更多。” 起初,乌军对西方承包商的新技术持保留态度——他们曾有过不愉快的合作经历。Forterra 的最初方案也过于偏向美军的高端需求。但在针对战场环境进行改进——尤其是加装 **Starlink 卫星互联网天线** 后,车辆价值大幅提升。自去年 10 月抵达乌克兰以来,这些车辆已累计行驶超过 **2,500 公里**。
上周,云安全公司Sysdig声称记录了首例完全由AI代理自主执行的勒索软件攻击,代号JadePuffer。报道称该AI代理在没有人类干预的情况下,独立完成了从入侵服务器、窃取凭证、横向移动到加密文件并撰写勒索信的全过程。然而,Sysdig威胁研究高级总监Michael Clark在最新采访中澄清:人类依然深度参与——只是未负责技术执行环节。人类选择了攻击目标、搭建了命令控制服务器和用于存储窃取数据的临时服务器,甚至攻击所用的凭证也来自先前的一次独立入侵,并非AI自行获取。 **攻击的技术细节依然令人瞩目**。该AI代理利用开源LLM构建工具Langflow的已知漏洞进入系统,随后转向生产环境MySQL服务器,利用另一个已知漏洞获取管理员权限。它加密了超过1300条配置记录,不仅自行撰写了勒索信,还留下了比特币收款地址。Sysdig未透露受害目标的具体身份。 **更值得关注的是攻击过程的透明度和速度**。AI代理在31秒内修复了一次失败的登录尝试,并在代码注释中以自然语言全程记录自身的推理过程。关于攻击中使用多个模型的疑问,Clark澄清:从窃取的密钥中发现了OpenAI、Anthropic、DeepSeek和Gemini等多个平台的API key,但这些只是攻击过程中窃取的数据,并非驱动攻击的模型。 **这一事件揭示了AI在网络安全领域的新边界**。虽然尚未实现完全自主的犯罪闭环,但AI代理在特定技术环节的自主执行能力已远超预期。安全行业需要重新审视防御策略:不仅要防范人类黑客,还要应对能够快速学习、自主决策并记录自身推理过程的AI攻击者。 **小结**:JadePuffer并非“无人值守”的完全自主攻击,但它展示了AI代理在攻击执行层面的潜力。未来,随着AI能力的提升,人类可能只需提供目标和初始入口,其余环节均可由AI独立完成。这既是警示,也是安全技术演进的方向。
韩国存储芯片制造商SK海力士(SK Hynix)正计划在美国进行首次公开募股(IPO),预计将于本周五开始交易。该公司将发行约1780万股美国存托凭证(ADR),每份代表十分之一普通股,预计筹集资金约28亿美元。SK海力士是三星和美光的竞争对手,其业绩和股价均因AI需求激增而大幅上涨。第一季度营收同比增长近200%,股价今年已上涨约260%。AI系统对内存需求极高,尤其是高带宽内存(HBM)、DRAM和NAND芯片,导致市场供不应求,被称为“RAMageddon”。苹果高管表示,芯片短缺已迫使其提高Mac和iPad的价格。韩国科技公司(包括SK海力士和三星)已承诺投资超过5500亿美元建设新产能,但这存在风险:当产能建成时,AI内存需求可能已发生变化,导致供过于求。目前,华尔街正在寻找下一个“英伟达”,存储芯片制造商是最接近的选择之一。美光科技(Micron)过去一年股价上涨近700%,市值超过1万亿美元,同样受益于AI驱动的内存需求。
Vercel CEO Guillermo Rauch 在 ShipNYC 大会后接受 TechCrunch 专访,深入探讨了 AI 从原型验证走向生产部署的关键转变。他指出,去年行业普遍处于“原型阶段”,疯狂构建智能体,但进入生产环境后,价格/性能比、数据安全、可审计性等现实挑战浮出水面。Rauch 认为智能体有两大杀手级应用:**编码智能体**和**内部运营智能体**。前者驱动了全球大量 token 消耗,后者则面临数据安全访问和审计追踪的难题。为此,Vercel 推出了 **Eve 框架**和 **Vercel Sandbox**。Eve 允许用自然语言定义智能体的指令和技能,而 Sandbox 则为智能体提供“笼子”——在保障智能体自由表达智能的同时,通过策略控制其数据访问和输出。Rauch 强调,在 AI 生产中,**模型与智能体的分离**至关重要:智能体负责编排和逻辑,模型提供推理能力,这种解耦能带来更好的性能优化和成本控制。目前 Vercel 日均处理 **600 万次部署**,其中一半由编码智能体触发,日均处理 **1 万亿 token**,成为 AI 软件基础设施的关键节点。
在最新的 iOS 27 开发者测试版中,苹果为 Siri 引入了语速和表达力的自定义选项,旨在让虚拟助手更自然、更个性化。 ## 功能详情 该功能在 **iOS 27 beta 3** 中正式启用,此前在首个开发者测试版中仅标注为“即将推出”。用户现在可以通过滑块调整 **Pace(语速)** 和 **Expressivity(表达力)**,从而控制 Siri 说话的快慢以及情感丰富程度。调整时,Siri 会示范朗读“你有一条新消息”等常见语句,帮助用户预览效果。 ## 行业背景 这一更新是苹果围绕生成式 AI 重建 Siri 的长期努力的一部分。与 ChatGPT 等竞品类似,允许用户自定义 AI 声音是提升技术亲和力的关键。ChatGPT 早在 2025 年 12 月就推出了调节“温暖度”和“热情度”的选项,并可设定友好、专业、坦诚等不同风格,这些不仅影响语音,也影响信息呈现方式。 ## 操作与集成 在 WWDC 26 上首次亮相的 Siri 语音控制,让用户不再局限于男声或女声,而是能在多种口音的声音间切换。新版 Siri 深度集成于 iOS 27,支持通过语音、从灵动岛下滑输入、侧边按钮或全新的独立 Siri 应用启动对话。 ## 其他更新与问题 iOS 27 beta 3 还包括更新后的提醒事项应用图标等小改进。不过,部分用户在 X 平台反馈,更新后新 Siri 不可用,或手机重新开始索引数据——这通常是优化 Siri AI 搜索的第一步。