亚马逊云科技今日宣布,Amazon SageMaker AI 实时推理端点正式支持 OpenAI 兼容 API。这意味着使用 OpenAI SDK、LangChain 或 Strands Agents 等框架的开发者,只需修改端点 URL,即可直接调用 SageMaker AI 上托管的模型,无需编写自定义客户端、SigV4 签名包装器或重写代码。 ## 核心变化:一条 /openai/v1 路径打通壁垒 SageMaker AI 端点现在暴露一个 **/openai/v1** 路径,原生接受 Chat Completions 格式的请求,并返回包含流式响应在内的标准回复。该功能对所有使用标准 SageMaker AI API 创建的端点和推理组件自动生效。SageMaker AI 会根据 URL 中的端点名称进行路由,因此任何 OpenAI 兼容的客户端都能即插即用。此外,用户现在可以为端点创建**限时 bearer 令牌**,直接用于 OpenAI 客户端,进一步简化了认证流程。 ## 三大典型应用场景 ### 1. 自有基础设施上的智能体工作流 如果你使用 Strands Agents 或 LangChain 构建多步骤 AI 智能体,现在可以将这些工作流完全运行在自己的 SageMaker AI 端点上。智能体调用模型时沿用同一套 OpenAI 兼容接口,但推理实际运行在用户账户内的专用 GPU 实例上,兼顾性能与数据安全。 ### 2. 多模型统一托管,单一接口调用 如果需要运行多个模型——例如 Llama 处理通用任务、微调版 Mistral 处理领域问题、小模型做分类——可以将它们全部托管在单个 SageMaker AI 端点上,通过推理组件分配独立资源。每个模型都可通过同一个 OpenAI SDK 调用,应用代码中无需维护多套 API 客户端或路由逻辑。 ### 3. 微调模型零代码改造上线 针对特定场景微调的开源模型,可直接部署到 SageMaker AI 并通过 OpenAI 兼容接口调用。应用程序只需修改端点 URL,无需任何代码改动,即可享受微调模型的定制能力。 ## 行业视角:降低云上推理的迁移成本 长期以来,AWS 用户若想将 OpenAI 生态中开发的应用迁移到自托管模型,往往需要额外开发 SigV4 签名层或适配自定义 SDK。此次更新直接消除了这一障碍,使得 **SageMaker AI 成为 OpenAI 生态系统的“一等公民”**。对于已投资 Agent 框架和 LLM 网关的企业,这意味着可以在不改变架构的前提下,灵活切换底层推理供应商,或将部分工作负载迁入自有账户以控制成本与延迟。 Caffeine.AI 的 AI/ML 工程师 Giorgio Piatti 在公告中表示:“我们运行 AI 编码智能体,通过一个兼容 OpenAI 聊天补全协议的 LLM 网关使用多个提供商。bearer 令牌功能让我们能将 SageMaker 作为即插即用的 OpenAI 兼容推理端点加入,无需自定义 SigV4 签名,原生适配我们的网关、Vercel AI SDK 和标准 OpenAI 客户端。” ## 快速上手 AWS 官方提供了配套 Jupyter Notebook([GitHub 仓库](https://github.com/aws-samples/)),演示从部署到调用的完整流程。用户可以通过标准 SageMaker API 创建端点,获取 bearer 令牌后,在 OpenAI 客户端中将 `base_url` 设置为 `https://<endpoint-url>/openai/v1` 即可开始使用。 此次更新标志着 AWS 在**模型服务兼容性**上的重要一步——不强迫用户锁定在特定 SDK,而是主动适配业界最广泛使用的接口标准。对于正在构建多模型、多提供商 AI 系统的团队来说,这无疑降低了架构复杂度与运维成本。
马斯克的 SpaceX 正斥巨资为旗下 AI 部门 xAI 的数据中心采购燃气轮机,以应对电力短缺对算力扩张的制约。这一举动不仅揭示了 AI 基础设施对能源的巨大需求,也引发了关于碳排放和环保合规的争议。 ## 巨额投资背后的电力焦虑 根据 SpaceX 近期向监管机构提交的文件,该公司在短短几个月内承诺投入超过 **28 亿美元** 购买燃气轮机,专门用于为其 AI 数据中心供电。这笔投资发生在 SpaceX 准备于纳斯达克上市的前夕,是其 IPO 招股书中的关键披露之一。 具体来看,2025 年 3 月,SpaceX 与某未具名公司签署了一项 **8.05 亿美元** 的涡轮机采购协议,合同期至 2029 年。随后在 4 月底,马斯克的公司又敲定了一笔 **20 亿美元** 的移动燃气轮机及相关设备交易,该交易目前尚待最终完成。 ## 为何选择燃气轮机? 当前美国正经历数据中心建设热潮,但 **电力短缺** 已成为制约扩张的首要瓶颈。便携式燃气轮机可以脱离电网独立运行,被视为快速、临时的解决方案,能在更稳定的能源供应(如可再生能源或核电)上线前提供过渡支持。 SpaceX 的 AI 部门 xAI 运营着两个大型数据中心——位于田纳西州孟菲斯的 **Colossus 1** 和密西西比州南aven的 **Colossus 2**,用于支撑其 Grok 聊天机器人及其他 AI 项目。据 WIRED 上周报道,Colossus 2 在过去两个月内新增了 19 台便携式涡轮机,总数达到 **46 台**。 ## 环保争议与监管风险 然而,燃气轮机的使用并非没有代价。SpaceX 此前已因使用这类设备而遭到公众投诉、诉讼以及监管调查,焦点在于其是否因大量排放 **二氧化碳** 而污染空气,以及是否规避了环境许可要求。根据现行法规,便携式涡轮机可在无清洁空气许可证的情况下运行一年,这一“窗口期”可能被企业利用,但长期来看环保压力不容忽视。 ## 跨界布局:从火箭到云计算 值得注意的是,SpaceX 不仅自用这些算力,还以 **150 亿美元** 的年租金将 Colossus 数据中心的服务器容量租给 AI 初创公司 Anthropic(Claude 聊天机器人的开发商)。马斯克周三表示,SpaceX 计划签署更多此类租赁协议。这标志着 SpaceX 正从火箭发射和卫星互联网服务商,向 **云计算基础设施提供商** 的角色延伸。 ## 行业启示 SpaceX 的激进能源投资折射出 AI 行业的深层矛盾:算力需求爆发式增长,而电网基础设施升级滞后。短期内,燃气轮机成为“救火队员”;但长期看,AI 巨头们必须寻找更清洁、可持续的能源方案,否则可能面临环保合规与公众舆论的双重压力。
短视频无处不在,从播客片段到电影高光时刻,品牌们发现这种格式是极具性价比的营销利器。然而,从冗长视频中精准截取最吸引人的 30 到 90 秒(即“剪辑”),并决定投放哪些平台,往往让营销团队头疼不已。创业公司 **Clouted** 正试图用一套结合 AI 与众包创作者的基础设施,将这一过程自动化。 ### 从 DJ 爱好到商业洞察 Clouted 的诞生源于创始人 Justin Banusing 的个人热情。他是一名长期活跃的 DJ,最初将公司技术用于推广自己创办的马尼拉电子音乐节 &Friends,该音乐节如今已能吸引超过 **2 万人** 参与。这段经历让他意识到,优质内容的传播不应依赖运气,而需要系统化的策略。 ### 700 万美元种子轮,资本看好“算法渗透测试” Clouted 刚刚宣布完成 **700 万美元** 种子轮融资,由 **Slow Ventures** 领投,Gold House Ventures、Weekend Fund、Peak XV 的 Surge 等跟投。公司曾参与 a16z 的 Speedrun 加速器(2024 年批次)。 与单纯追求剪辑数量的工具不同,Clouted 的 AI 更像一个 **持续测试循环**:它会尝试不同格式和渠道策略,不断积累数据,找出真正有效的爆款配方。创始人 Banusing 将这一过程类比为网络安全领域的 **渗透测试**——不是寻找漏洞,而是通过成千上万种剪辑和分发方案,试探哪些内容能触发社交平台的推荐机制。“每执行一次营销活动,系统就会变得更聪明、更高效,”他表示,“平台会学习哪些格式能赢、哪些受众会转化、哪些分发渠道能持续放大效果。” ### 如何运作:AI + 10 万创作者网络 Clouted 平台连接了超过 **10 万名** 自由职业创作者,负责实际剪辑工作;AI 则负责分析内容,并自动决策最佳分发平台和目标受众。这种“人机协作”模式既保留了创作者的创意判断,又通过算法优化了投放效率。 ### 行业背景与竞争 当前,短视频营销工具赛道已相当拥挤,既有传统的剪辑外包平台,也有纯 AI 驱动的自动剪辑工具。Clouted 的差异化在于:它不追求剪辑数量,而是强调 **策略优化**——通过持续测试和反馈循环,让每个后续活动都更精准。其直接竞争对手包括类似服务,但 Clouted 更聚焦于“算法友好型”内容生产,而非简单批量产出。 ### 小结 Clouted 的崛起反映了短视频营销从“经验驱动”向“数据驱动”的转变。对于品牌和营销机构而言,这套系统有望显著降低试错成本,让爆款不再是偶然。随着融资到位,Clouted 计划进一步扩大创作者网络并优化 AI 模型,或许很快我们就会看到更多“算法定制”的病毒视频。
SpaceX的IPO文件首次披露了埃隆·马斯克旗下AI公司xAI的财务细节,显示该公司在2025年亏损高达**64亿美元**,同时计划大规模扩展其AI模型**Grok**。这份文件为外界提供了难得的机会,一窥马斯克AI帝国的真实财务状况及其雄心勃勃的扩张计划。 ## 巨额亏损与扩张计划 根据SpaceX提交的IPO文件,xAI在2025年的运营支出远超收入,净亏损达到64亿美元。这一数字凸显了AI领域高昂的研发和基础设施成本。然而,xAI并未因此放缓脚步,反而计划进一步扩大Grok的部署规模,包括增加计算资源、招聘顶尖人才以及拓展应用场景。文件指出,xAI的支出“远未结束”,暗示未来仍需大量资金投入。 ## 与SpaceX的关联 xAI与SpaceX之间存在紧密联系。马斯克曾表示,xAI将利用SpaceX的技术和经验,特别是在计算和数据处理方面。此外,xAI的AI模型可能被用于优化SpaceX的火箭设计和任务规划。此次IPO文件披露xAI的财务状况,也反映了SpaceX作为母公司的战略布局——通过公开市场融资支持旗下AI业务的发展。 ## 行业背景 xAI的巨额亏损并非个例。当前,AI行业正处于“烧钱换增长”的阶段,OpenAI、Anthropic等公司同样面临高昂的运营成本。例如,OpenAI在2024年的亏损预计超过50亿美元。xAI的64亿美元亏损进一步印证了AI领域的资本密集型特征。然而,马斯克的野心不止于此:Grok的目标是成为通用人工智能(AGI),这需要持续的大规模投入。 ## 未来展望 尽管亏损巨大,但xAI的扩张计划表明马斯克对AI前景的坚定信心。随着Grok在更多场景中的应用,xAI有望通过商业化实现盈利。然而,短期内,xAI仍需依赖外部融资,包括可能通过SpaceX的IPO获得资金支持。这份文件无疑为投资者提供了重要参考,但也揭示了AI行业的高风险与高回报并存。
英伟达在周三美股盘后公布了截至4月26日的季度财报,再次刷新营收纪录。该季度公司实现 **816亿美元** 营收(环比增长20%),其中数据中心收入达到创纪录的 **752亿美元**。公司同时宣布授权 **800亿美元** 的股票回购计划。 CFO Colette Kress 表示:“我们的 Blackwell 架构无处不在,被所有主要超大规模云服务商、云提供商和主流模型厂商采用。”不过,英伟达预计下一季度营收为 **910亿美元**,增速放缓至12%。在中国出口方面,Kress 指出 H200 芯片虽已获美国出口许可,但尚未产生任何收入,且不确定是否允许进入中国市场。 财报中最引人注目的数字是英伟达对 **非上市公司的持股** 规模。从1月到4月,这一数字从 **220亿美元** 飙升至 **430亿美元**,几乎翻倍。其中 **185亿美元** 为当季新增购买,而上一季度同类购买仅 **6.49亿美元**。该数据不包括英伟达近期对康宁、IREN 等上市公司的投资,也未反映尚未完成的未来承诺。今年2月,英伟达承诺向 OpenAI 投资 **300亿美元**,但交易结构未披露。 在财报电话会上,CEO 黄仁勋强调了英伟达广泛的影响力,包括与 Anthropic 的扩建计划。“我们今年和明年将为 Anthropic 带来相当可观的算力容量,”黄仁勋表示,“此前我们对 Anthropic 的覆盖几乎为零。”
Elon Musk 的 AI 公司 xAI 正因使用污染性发电机而陷入法律纠纷,但最新披露的文件显示,它计划在未来三年内再购买价值 **28 亿美元** 的燃气轮机用于 AI 基础设施。这一消息来自 SpaceX 的 IPO 文件,其中提到 xAI 将采购包括 **20 亿美元移动燃气轮机** 在内的设备——正是当前被起诉的那类发电机。 上个月,NAACP(全国有色人种协进会)对 xAI 提起诉讼,指控其在田纳西州孟菲斯附近的数据中心未经许可运行数十台燃气轮机,加剧了当地空气污染。该地区已是全美污染最严重的区域之一。NAACP 已申请禁令,要求停止使用这些设备。目前 xAI 仅获批 **15 台** 涡轮机的许可,但实际运行数量已达 **46 台**。每台涡轮机每年可排放超过 **2000 吨** 氮氧化物(NOx),这种化学物质会形成诱发哮喘的烟雾。 xAI 辩称,这些发电机属于“移动式”(仍安装在运输拖车上),因此可在 **一年内** 无需许可运行。这一说法利用了州与联邦法规之间的差异:密西西比州不要求为移动发电机发放许可,但联邦法规明确,此类大型涡轮机即使装在拖车上,也须遵守空气污染规定。美国环保署(EPA)今年早些已裁定 xAI 的运营违反联邦法律。 SpaceX 在 IPO 文件中承认了相关风险:“我们目前严重依赖天然气和燃气轮机技术为数据中心供电。” 若禁令生效或许可被撤销,“将对我们的 AI 业务产生不利影响”。 这一事件凸显了 AI 基础设施扩张与环保法规之间的尖锐矛盾。随着大模型训练对算力的需求激增,数据中心能耗和排放问题日益突出。xAI 的做法并非孤例——许多科技公司都在寻求快速部署计算资源,但往往以牺牲环境合规为代价。此次诉讼和后续采购计划表明,xAI 似乎选择优先保障算力供给,而非立即解决污染争议,但法律风险可能迫使其调整策略。
Elon Musk's xAI surprised the AI world when it made a deal to sell compute to Anthropic. Now we know how much it's worth.
在今年的Google I/O主题演讲尾声,Google DeepMind CEO Demis Hassabis面无表情地宣称,公司希望“重新构想药物发现过程,目标是有一天解决所有疾病”。这句话听起来像是“如果属实,那意义重大”的典型例子。Hassabis实际描述的是**Gemini for Science**,一套旨在鼓励研究人员探索和做出新发现的实验性AI工具集。 我经常在《Optimizer》中对AI健康持批评态度,但Hassabis的声明需要更多背景解读。好的科学传播——既让外行人容易理解,又不无意中助长错误信息——已经变得越来越困难。I/O现场的科研人员想必明白,这句话意味着AI的进步大幅缩短了医学发现所需的时间。但对于普通人(甚至科学传播者)来说,它听起来更像是“Gemini将凭借AI的力量治愈所有疾病”。 现实世界中的医学突破并非如此运作。数十年来,AI一直是医学研究和发现不可或缺的一部分。可穿戴设备使用的算法?那是AI。基因组学中的发现?那也是AI。但“解决所有疾病”是一个极其宏大的目标,远非单一技术或工具所能实现。疾病机制复杂,涉及遗传、环境、生活方式等多重因素。即使AI能加速药物筛选、优化临床试验设计,从实验室发现到真正应用于临床,仍需要数年甚至数十年的验证和监管审批。 Hassabis的言论更像是一个**愿景声明**,而非近期可实现的目标。它反映了DeepMind在AI for Science领域的雄心,但也容易引发过度期待。在AI健康领域,我们见过太多类似的“革命性”承诺,最终却未能兑现。例如,从AI诊断工具到个性化健康建议,许多技术仍处于早期阶段,面临数据隐私、算法偏见和临床验证等挑战。 对于消费者而言,重要的是保持理性:AI确实正在改变医疗研究,但它不是万能药。**Gemini for Science**可能帮助科学家更快地发现新靶点、设计新分子,但“解决所有疾病”需要整个科学界的长期努力。Google I/O上的这句豪言,更像是为AI描绘一个美好未来,而非一个具体的路线图。
OpenAI 宣称其新型推理模型成功证明了一个自 1946 年以来悬而未决的几何猜想。与七个月前 GPT-5 声称解决 10 个 Erdős 问题却遭数学家驳斥的尴尬不同,这次有多位知名数学家为结果背书。 ## 背景:从“翻车”到“翻盘” 去年,OpenAI 前 VP Kevin Weil 曾高调宣布 GPT-5 解决了 10 个 Erdős 问题并取得 11 个进展,随后被数学家指出这些“解决”只是复现了已有文献中的结果,并非原创证明。Yann LeCun 和 Demis Hassabis 等业界领袖纷纷嘲讽,Weil 不得不删除帖子。 ## 这次有何不同? 本次成果针对的是 Paul Erdős 于 1946 年提出的一个几何猜想。OpenAI 表示,其新推出的通用推理模型(非专门为数学设计)独立发现了一类全新的构造,证明“近似正方形网格是最优解”这一近 80 年的信念是错误的。数学家 Noga Alon、Melanie Wood 以及维护 Erdős 问题网站的 Thomas Bloom 均发表了支持性评论。Bloom 曾批评 OpenAI 之前的说法是“严重的误述”,但这次他评价道:“AI 正在帮助我们更全面地探索几个世纪以来建造的数学大教堂。” ## 意义与行业影响 OpenAI 强调,这是 AI 首次自主解决一个领域内的核心开放问题。该模型并非专攻数学,而是通用推理模型,这意味着 AI 已具备**维持长链推理**和**跨领域连接思想**的能力。这种能力可应用于生物学、物理学、工程学和医学等领域。 然而,业界仍需保持审慎:一次成功的验证并不能完全消除对 AI 数学推理可靠性的疑虑。但至少,这次有权威数学家的公开背书,让 OpenAI 的声明有了更坚实的依据。
Linux 创始人 Linus Torvalds 在 Linux 基金会北美开源峰会上坦言,自己对 AI 持有一种“爱恨交织”的态度。他指出,AI 工具在过去六个月显著提升了内核开发提交量(增幅约 20%),降低了新贡献者的入门门槛,但他坚持认为 AI 是“工具而非替代品”,程序员的工作机会不会消失。同时,AI 在安全漏洞的发现与修复方面也带来了新的挑战。
三星The Frame Pro 85英寸电视今日在三星官网限时特价,直降**1500美元**,仅售**2800美元**。这款画廊风格电视采用哑光显示屏、支持One Connect和艺术模式,适合打造家庭艺术画廊。优惠仅限今天,从三星官网直接购买。
在构建视觉购物、图像或文档理解、图表分析等应用时,如何验证模型输出是否真正基于源图像是一大挑战。纯文本评估器无法判断描述是否忠实反映图像、提取的发票金额是否与文档一致,或屏幕摘要是否虚构了不存在的按钮。Gartner 预测,到 2030 年,80% 的企业软件将具备多模态能力,而 2024 年这一比例还不足 10%。缺乏自动化多模态评估,企业只能在昂贵的人工审核和不可靠的纯文本代理之间左右为难。 如今,AWS 在 Strands Evals SDK 中推出了四种新的多模态大语言模型(MLLM)作为裁判的评估器,专门用于图像到文本任务:**Overall Quality**(整体质量)、**Correctness**(正确性)、**Faithfulness**(忠实性)和 **Instruction Following**(指令遵循)。每个评估器都会根据源图像对模型输出进行评分。评估器将图像直接发送给多模态裁判模型,同时附上查询、响应以及可选的参考答案。裁判模型返回基于图像的分数以及推理过程字符串,便于调试。 这些评估器可以无缝替换现有 Strands Evals 工作流中的纯文本评估器,并集成到持续集成(CI)中,自动捕捉视觉幻觉、事实错误和指令违规。本文将介绍如何设置这四种多模态评估器并运行图像到文本任务;如何在有参考和无参考评估之间切换;如何为特定领域标准编写自定义多模态评估标准;如何在 Amazon Bedrock 上选择平衡准确性、成本和延迟的裁判模型;以及如何应用提示设计选择来提升评估器与人类判断的一致性。 ## 设置与使用 首先,确保已安装 Python 3.10 或更高版本。通过 Strands Evals SDK 可以快速调用这些评估器。示例代码如下: ```python from strands_evals import MultimodalEvaluator evaluator = MultimodalEvaluator( judge_model="anthropic.claude-3-sonnet-20240229-v1:0", evaluator_type="faithfulness" ) result = evaluator.evaluate( image_path="invoice.jpg", query="提取发票总金额", response="总金额为 $123.45", reference="$123.45" # 可选 ) print(result.score, result.reasoning) ``` ## 自定义多模态评估标准 若需针对特定领域制定标准,可编写自定义评估标准。例如,在医疗影像报告中,可以定义“报告必须描述病变位置和大小”等规则,评估器将据此打分。 ## 选择裁判模型 Amazon Bedrock 提供了多种多模态模型,如 Claude 3 Sonnet、Claude 3 Haiku 等。**Claude 3 Sonnet** 在准确性和延迟之间取得了良好平衡,适合大多数场景;而 **Claude 3 Haiku** 则更注重成本效益。用户可根据任务需求灵活选择。 ## 提示设计技巧 实验表明,在提示中加入“逐步推理”指令(如“请先描述图像内容,再评估回答”)可以显著提升评估器与人类判断的一致性。此外,明确要求模型输出评分理由,有助于调试和审计。 通过引入多模态评估器,开发者可以更可靠地自动化评估图像到文本任务的输出质量,减少人工干预,加速 AI 应用的落地。
The coding skills of AI models are about to make it much easier to build and deploy robots.
Visa 最新研究指出,AI 加速的欺诈已成为“消费者伤害增长最快的来源”。随着网络犯罪从窃取凭证转向利用 AI 的社会工程攻击,传统的防御手段逐渐失效。本文梳理了 Visa 报告中揭示的五大警示信号,帮助消费者和企业识别并防范这类新型支付欺诈。 ## AI 正在重塑欺诈模式 AI 不仅被用于提升安全防御,也被网络犯罪分子广泛武器化。Visa 的报告强调,AI 正在压缩欺诈周期,使犯罪分子更容易诱骗消费者授权恶意交易。与过去依赖窃取密码或劫持账户不同,现在的攻击更多利用人性弱点,通过精心设计的心理战术让受害者自己完成有害操作。 ## 警惕 ClickFix 式欺诈 一种名为 **ClickFix** 的社会工程手法正在兴起。它绕过了传统钓鱼防御,通过制造“问题-解决”场景诱骗用户执行恶意命令。例如,用户可能看到虚假的恶意软件警报,被引导打开命令提示符并粘贴代码“修复问题”,结果却是在自己的设备上部署了恶意软件。这种攻击让用户主动参与犯罪过程,使得标准数字防御难以拦截。 ## Visa 列出的五大警示信号 1. **异常紧迫感**:骗子利用 AI 生成逼真的紧急通知,声称账户异常或支付失败,要求立即操作。 2. **语音克隆**:AI 可模仿亲友或银行客服的声音,通过电话或语音消息诱导转账。 3. **深度伪造视频**:视频通话中伪造熟悉面孔,要求验证信息或紧急付款。 4. **个性化钓鱼邮件**:AI 分析公开数据后生成高度定制化的邮件,内容与用户近期活动相关。 5. **虚假客服渠道**:在搜索引擎或社交媒体上投放广告,伪装成官方客服,引导用户进入假支付页面。 ## 如何自我保护 Visa 建议消费者保持警惕,对任何要求即时付款或提供敏感信息的行为进行二次验证。企业则应加强员工培训,并部署 AI 驱动的反欺诈系统来检测异常行为模式。 ## 小结 AI 的双刃剑效应在支付安全领域尤为突出。了解这些新型欺诈手段,是保护个人资产的第一步。当心那些看似“合理”的付款请求——它们可能正是 AI 精心设计的陷阱。
还记得“这个应用有它的专属App”这句口号吗?如今,随着AI编程工具日益强大和普及,非开发者也能轻松创建满足个人需求的应用程序。在2026年的Google I/O大会上,Google宣布其AI Studio的“氛围编程”工具迎来更新,允许用户在几分钟内创建原生Android应用并导出到手机上。虽然初期仅限于“个人实用工具”,且上架Play Store的规则不变,但这意味着你或许可以自己动手,打造一款完美契合自己习惯的追踪应用。此外,Google还在Android Show上预告了一项新功能:通过提示词即可创建自定义小部件,例如突出显示特定天气指标或推荐新食谱的小工具。这些工具依托Gemini的知识库,可能性相当广阔。不过,这一切都依赖于AI的理解和生成能力,用户需要清晰地表达需求,才能获得满意的结果。移动端的“氛围编程”时代正在到来,个人科技将变得更加个性化。
在2025年I/O大会上,谷歌正式将AI搜索从测试推向主流,而到了2026年,这一变革将加速到新的高度。谷歌搜索副总裁Liz Reid在主题演讲中明确表示:“谷歌搜索就是AI搜索。”这一转变正在全面展开,尽管外界存在诸多合理质疑,但谷歌显然不会因此止步——所有对谷歌至关重要的指标都表明,这是一条正确的道路。 自一年多前谷歌开始测试AI Mode(AI搜索模式)以来,该功能的使用量每季度翻倍。Reid在2026年I/O大会上透露,AI Mode的月活跃用户已超过10亿。这一数字并不令人意外:AI Mode通过对话式交互引导用户不断追问,每一次追问都算作一次搜索。谷歌也在大力推广AI Mode,包括在搜索页面中嵌入显眼的链接和提示,鼓励用户从传统搜索转向AI聊天机器人。与许多付费AI体验不同,谷歌的AI搜索完全免费,所有用户都能获得完整的AI功能。 **AI Overviews(AI概览)** 曾是谷歌AI搜索转型最显眼的元素,但如今它越来越像是通向AI Mode的过渡产品。谷歌推出了全新的“无缝搜索”体验,将AI Mode与AI Overviews深度整合。现在,大多数谷歌搜索都会生成一个AI概览。谷歌还扩展了一项移动端功能——用户可以从AI概览直接进入AI Mode,该功能现已覆盖桌面端。AI Mode的提示按钮悬浮在概览底部,实际上遮挡了顶部自然搜索结果,这无疑会进一步推高AI Mode的使用量,同时也可能降低用户滚动查看传统“十条蓝色链接”的意愿,使自然结果更像脚注而非搜索核心。 Reid还提到,谷歌全新的搜索框是公司25年历史上最大的变化。虽然具体细节尚未完全披露,但可以预见,这一变化将彻底颠覆我们对搜索引擎的认知。从“信息检索”到“任务完成”,谷歌正在将搜索重塑为一个主动的、智能的Agent平台。 **行业影响与隐忧** 对于内容创作者和SEO从业者而言,这一趋势令人担忧。AI Mode直接生成答案,用户点击外部链接的意愿下降,可能导致网站流量进一步下滑。谷歌的“零点击搜索”现象将更加普遍。同时,AI Mode的对话特性可能加剧信息茧房效应——用户只会看到AI筛选后的答案,而非多元化的信息来源。 另一方面,对于普通用户来说,AI搜索确实提升了效率。但谷歌在AI领域的绝对主导地位也引发了反垄断担忧。当一家公司同时控制搜索入口和AI生成内容时,如何确保公平竞争和信息的多样性,将是一个长期挑战。 **展望2026** 2026年,谷歌的AI搜索将不再只是“升级”,而是一次彻底的“重塑”。从AI Mode的深度整合到搜索框的彻底变革,谷歌正在构建一个以Agent为核心的搜索生态。用户将不再“搜索”信息,而是“委托”AI完成任务。但这场变革的代价——传统搜索流量的消失、信息获取方式的集中化——才刚刚开始显现。
实时语音转写是语音助手、直播字幕、联络中心分析和无障碍工具等应用的核心能力。传统请求-响应推理需要等待完整音频上传后才能开始转写,这引入的延迟破坏了实时体验。从 2025 年 11 月起,Amazon SageMaker AI 支持双向流式推理,允许客户端与模型容器之间持续双向传输数据。同时,vLLM 通过其 Realtime API(基于 WebSocket 的双向流)支持实时音频转写。本文将两者结合,展示如何使用 SageMaker AI 的 vLLM 容器部署 Mistral AI 的 Voxtral-Mini-4B-Realtime-2602 模型,构建一个完全托管的实时语音转文本服务。 ## 关键特性 构建生产级语音 AI 应用需要多个基础设施组件紧密配合,并满足严格的延迟要求。SageMaker AI 和 vLLM 各自解决了不同部分的问题: - **实时语音模型与高效 GPU 服务**:核心是能够增量处理音频的 ASR 模型,vLLM 通过其 Realtime API(原生 WebSocket 端点 `/v1/realtime`)提供支持,并采用分段 CUDA 图执行减少 GPU 内核启动开销,从而降低流式转写中的每 token 延迟。 - **双向流式推理**:SageMaker AI 支持双向流,客户端可同时发送音频并接收转写结果,无需等待完整音频。 - **完全托管与可扩展**:SageMaker AI 负责基础设施管理,包括自动缩放、监控和安全性。 ## 部署步骤 1. **准备模型**:从 Hugging Face 获取 Voxtral-Mini-4B-Realtime-2602 模型,并将其打包为适用于 vLLM 的格式。 2. **创建 SageMaker 端点**:使用 SageMaker SDK 创建一个启用了双向流的端点,指定 vLLM 容器镜像。 3. **配置 WebSocket 客户端**:客户端通过 WebSocket 连接到端点,持续发送音频数据并接收实时转写结果。 完整示例代码可在 [GitHub 仓库](https://github.com/aws-samples/amazon-sagemaker-ai-vllm-realtime) 中找到。 ## 性能与优势 相比传统方法,该方案显著降低了端到端延迟。例如,在语音助手场景中,用户说话后几乎立即看到转写文本,交互更加自然。此外,SageMaker AI 的托管特性减少了运维负担,而 vLLM 的开源特性允许用户灵活调整模型配置、量化和编译设置。 ## 应用场景 - **语音助手**:实时理解用户指令并快速响应。 - **直播字幕**:为直播视频生成实时字幕。 - **联络中心分析**:实时转写客户通话,进行情感分析或合规检查。 - **无障碍工具**:帮助听障人士实时获取语音信息。 这一组合为开发者提供了构建实时语音应用的高性能、低成本方案,推动了 AI 语音技术的普及。
Google 在 2026 年 Google I/O 大会上宣布了一项 YouTube Shorts 的全新 Remix 功能,借助 Gemini Omni 模型,用户现在可以对他人发布的短视频进行 AI 风格的“再想象”。 ## 功能亮点:从风格迁移到内容植入 该功能入口位于 YouTube Shorts 底部“Remix”按钮中,新增的“Reimagine”选项允许用户通过自然语言提示让 Gemini 对原视频进行改造。例如,你可以将一段普通视频转换为**像素艺术、动漫风格或伪纪录片恐怖片**。 更进阶的是,用户还能**修改视频内容本身**——比如给人物“大头特效”、添加背景演员、为角色穿上海盗服装,甚至将自己“插入”到原始视频中。这背后的技术由 **Gemini Omni** 多模态模型驱动,能够理解视频场景并生成符合语义的编辑结果。 ## 创作者控制与版权保护 为了防止滥用,**创作者可以主动关闭“Reimagine”功能**。如果你上传的是家庭或儿童视频,不希望被他人随意修改,只需在设置中关闭该选项即可。 所有通过 Omni 生成的 Remix 视频都会带有**数字水印**,并链接回原始视频,确保原创者的归属权和流量引导。这在一定程度上平衡了创意表达与版权保护的关系。 ## 行业背景与意义 这一功能是 Google 在 **AI 视频编辑领域**的最新布局。过去一年,Runway、Pika 等初创公司已推出类似的内容重绘工具,但大多局限于独立创作。YouTube 借助自身庞大的短视频生态,将 AI 编辑直接嵌入社交消费场景,**降低了创意门槛**,让普通用户也能轻松“玩转”视频。 同时,这也反映了 AI 从“生成”向“社交化编辑”的演进。未来,短视频平台可能不再是单向的内容消费,而是**基于 AI 的协作式创作社区**。当然,潜在的深度伪造和内容伦理风险仍需关注,Google 的水印与开关机制算是第一步。 ## 小结 YouTube Shorts 的 AI Remix 功能为短视频二创提供了前所未有的自由度,同时也保留了创作者的控制权。随着 Gemini Omni 能力的持续迭代,我们或许很快能看到更多类似“AI 视频混音”的玩法出现在主流平台。
据多方消息,人工智能领域的领军企业 OpenAI 正在积极推进首次公开募股(IPO),最快可能在未来数月内提交相关文件。这一动作标志着这家以非营利起步、后转型为“有限盈利(capped-profit)”架构的公司,正在向资本市场迈出关键一步。 ## 从实验室到华尔街:OpenAI 的资本化之路 OpenAI 的 IPO 计划并非空穴来风。自 2023 年以来,公司已通过多轮融资累计获得超过 **130 亿美元** 的资金支持,其中最大的一笔来自微软的 **100 亿美元** 投资。然而,随着 AI 模型训练成本飙升(GPT-4 训练成本据估算超过 **1 亿美元**),以及商业化产品如 ChatGPT Plus(月费 20 美元)、企业版 API 服务的收入增长,OpenAI 需要更稳定的长期资本来源。 ## 关键看点:估值、架构与市场影响 - **估值预期**:若成功上市,OpenAI 的估值可能冲击 **800 亿至 1000 亿美元**,使其成为仅次于 SpaceX 的美国第二大独角兽。部分分析师认为,考虑到其技术护城河和用户规模(ChatGPT 月活超 2 亿),溢价空间仍存。 - **架构挑战**:OpenAI 独特的“有限盈利”结构可能成为监管焦点。其利润上限机制(投资者回报上限为投资额的 100 倍)与普通上市公司治理规则存在张力,需向 SEC 提供特殊说明。 - **行业连锁反应**:OpenAI 上市将直接挑战 Google、Meta 等巨头在 AI 领域的地位,同时加速 Anthropic、Cohere 等竞争对手的资本化进程。 ## 风险与不确定性 尽管前景诱人,但 OpenAI 仍面临多重风险: 1. **监管压力**:全球 AI 监管浪潮(如欧盟 AI 法案、美国 AI 行政令)可能影响其模型部署与数据使用。 2. **盈利模式验证**:目前公司仍处于亏损状态(2023 年亏损约 54 亿美元),需向投资者证明其订阅和 API 业务能持续增长。 3. **人才竞争**:高盛报告指出,AI 领域顶尖人才年薪已突破 **200 万美元**,上市后股权激励的稀释效应可能削弱吸引力。 ## 小结 OpenAI 的 IPO 不仅是公司自身的里程碑,更是 AI 行业从技术探索迈向商业成熟的重要信号。若进展顺利,这将成为 2024-2025 年全球资本市场最受瞩目的科技事件之一。然而,在监管与技术快速迭代的双重挑战下,其最终定价与上市时间仍充满变数。
谷歌搜索的AI化浪潮正在全面席卷其广告系统。继昨日宣布推出更大、更对话化的搜索框以及AI生成结果后,谷歌今日宣布,其Gemini AI模型将直接参与广告的呈现与推荐。当用户在搜索中寻找产品时,Gemini会筛选出相关商品,并生成一段“定制化说明”,解释为什么你应该购买这一款。 在一则示例中,搜索“紧凑型意式浓缩咖啡机”的用户,可能会看到一个标有“赞助产品”标签的Nespresso Vertuo Up。其下方并非传统的广告文案,而是一段由AI生成的描述:“要寻找一台优质机器,需关注胶囊兼容性和风味多样性、产生丰富油脂的能力、快速加热、以及针对不同杯型和冰咖啡的一键定制选项。这款纤薄、快速启动的机器使用Vertuo胶囊,具有丰富的风味萃取和定制冲泡浓度(例如冰咖啡),3秒加热,支持6种杯型。” 这并非谷歌在本轮广告升级中的唯一动作。部分广告还将内置聊天机器人。这些广告会显示一个“提问”按钮,点击即可与Gemini开启对话。AI聊天机器人将利用产品或服务网站的信息回答用户问题,并可能引导用户填写表单,以便与商家取得联系。 与此同时,谷歌正在其聊天机器人风格的搜索体验“AI模式”中测试新型广告。该公司去年首次在AI模式中为部分查询引入了“赞助”结果,但新的广告格式显得更具侵入性。其中一种选项会在AI回复下方呈现一个赞助产品,直接回答诸如“有哪些低维护成本的方法能让家里香气宜人?”这类具体问题——例如,在AI回答下方出现一个空气清新剂的“赞助”结果,附带产品描述和图片。在谷歌的示例中,一旦用户滚动到该广告,它似乎会占据整个屏幕。 谷歌还在试点一种广告格式,在搜索结果列表中突出显示赞助产品或服务。 这一系列举措标志着谷歌搜索广告从“关键词匹配”向“AI智能推荐+对话式导购”的深刻转型。对于用户而言,这意味着搜索结果中的广告将更加“善解人意”,甚至主动推销;对于广告主和内容生态而言,AI生成的推销语可能削弱传统营销文案的价值,而聊天机器人广告则可能改变用户与品牌的互动方式。谷歌显然希望借助Gemini的能力,在提升广告点击率的同时,不破坏用户对AI搜索的体验——但广告与自然结果的边界是否会因此变得更加模糊,值得持续关注。