SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:AWS ML清除筛选 ×

随着AI代理在各类环境中的广泛应用,如何有效监控其性能成为开发者关注的重点。亚马逊云科技近日发布了Amazon Bedrock AgentCore Observability的扩展功能,支持对运行在AWS之外的AI代理进行监控,包括本地环境、GCP、Azure以及开发者机器。这一更新解决了此前AgentCore Observability仅支持AWS云端运行代理的局限。 **核心解决方案:ADOT与IAM结合** 该方案利用AWS Distro for OpenTelemetry(ADOT)在代理应用中自动插桩,捕获生成式AI语义约定跨度,并通过IAM凭证认证,将遥测数据直接发送至Amazon CloudWatch的OTLP端点。整个流程无需额外代理,即可将追踪、指标和日志统一路由至AgentCore Observability仪表板。 **三大核心组件** 实现这一功能需要三个关键部分: - **ADOT自动插桩**:简化非AWS环境下的遥测导出。 - **IAM凭证**:用于认证并转发遥测数据。 - **环境变量**:配置OpenTelemetry路由和认证相关设置。 **多框架支持** 该方案支持包括Strands Agents、LangGraph和CrewAI在内的多种代理框架,适用于Amazon EKS、ECS、Lambda、本地数据中心或其他云平台。这意味着无论代理部署在何处,开发者都能获得统一的监控体验。 **行业意义** 在多云和混合云成为常态的今天,这一功能填补了AI代理监控的空白。此前,在非AWS环境运行的代理缺乏原生可观测性,开发者不得不依赖各自平台的零散工具。AgentCore Observability的扩展使得跨环境监控成为可能,有助于提升AI应用的稳定性和性能优化效率。 **部署与验证** 文章提供了详细的配置指南,包括设置ADOT、配置IAM权限以及验证端到端数据流。开发者可以按照步骤快速上手,确保代理在任意环境下的可见性。 这一更新标志着AWS在AI代理可观测性领域的进一步布局,为多环境部署的企业提供了更完善的解决方案。

AWS ML17天前原文

许多企业仍依赖老旧 Web 应用处理关键业务,但这些系统往往缺乏 API,只能通过人工点击操作,效率低下且容易出错。现在,**Amazon Bedrock AgentCore 浏览器工具**与 **Strands Agents** 提供了一种新思路:让 AI 数字员工像人类一样操作浏览器,自动完成这些繁琐任务,同时保留人工监督和完整审计追踪。 ## 核心架构:安全、可控的 AI 浏览器代理 这一方案的关键在于**参考架构**,它通过以下组件实现安全自动化: - **隔离浏览器会话**:AI 在独立的浏览器环境中运行,避免影响生产环境或用户会话,降低安全风险。 - **人工监督机制**:关键操作(如提交订单、修改数据)可设置审批节点,确保 AI 不会越权。 - **完整审计日志**:所有 AI 操作均被记录,满足合规要求,便于事后追溯。 ## 适用场景:从数据录入到跨系统操作 该工具尤其适合以下场景: - **数据迁移**:将旧系统数据批量录入新平台,无需人工重复劳动。 - **跨系统流程**:当业务涉及多个无 API 的 Web 应用时,AI 可自动切换并完成操作。 - **日常维护**:如定期更新库存、处理表单审批等重复性任务。 ## 技术亮点:AgentCore 与 Strands 的协同 **Amazon Bedrock AgentCore** 提供了构建 AI 代理的基础设施,而 **Strands Agents** 则专注于浏览器自动化。两者结合,使得 AI 能够理解页面结构、识别输入字段,并模拟人类点击、输入等行为。与传统的 RPA(机器人流程自动化)不同,这种方案基于大语言模型,能适应页面变化,无需频繁维护脚本。 ## 行业意义:释放人力资源,降低运营成本 通过将 AI 数字员工部署到老旧系统,企业可以: - 将员工从重复性劳动中解放,专注于更高价值的决策。 - 减少因人工操作导致的错误率,提升数据准确性。 - 无需改造现有系统,即可实现流程自动化,降低 IT 投入。 ## 结语 Amazon Bedrock AgentCore 浏览器工具为老旧 Web 应用自动化提供了新路径,但企业在采用时仍需评估具体场景的复杂度和安全要求。随着 AI 代理技术的成熟,这类数字员工有望成为企业数字化转型的重要推手。

AWS ML17天前原文

在并购交易中,尽职调查是决定成败的关键环节,但传统流程往往耗时数周,涉及大量文档审查、财务分析和合规检查。如今,生成式AI正在改变这一局面。AWS近日发布了一套基于**Amazon Bedrock AgentCore**的多代理尽职调查系统参考架构,帮助企业将这一流程从数周缩短至数天。 ## 多代理协作:从“单兵作战”到“团队作战” 传统AI助手通常只能处理单一任务,而并购尽职调查涉及法律、财务、运营、合规等多个专业领域。这套新架构的核心思路是**将复杂任务拆解为多个子任务,由不同的AI代理并行处理,再由一个主代理统一协调**。 具体来说,系统包含三类代理: - **协调代理**:负责理解用户意图,将任务分解并分发给专业代理,整合各代理的结果。 - **专业代理**:如财务分析代理、法律审查代理、运营评估代理等,每个代理专注于特定领域,调用相应的知识库和工具。 - **检索代理**:基于**知识检索**能力,从海量文档(如合同、财务报表、监管文件)中提取相关信息,为专业代理提供数据支持。 这种设计不仅提升了处理效率,还保证了专业性——每个代理都可以针对特定数据源进行优化训练。 ## Bedrock AgentCore:降低构建门槛 AgentCore是Amazon Bedrock的一项新能力,旨在简化代理的构建、部署和管理。它提供**代理编排**、**知识库集成**和**治理控制**三大核心功能。 - **编排**:AgentCore内置了任务分解和决策逻辑,开发者只需定义代理的角色和工具,即可实现复杂的多代理协作。 - **知识检索**:无缝对接Amazon Bedrock Knowledge Bases,支持RAG(检索增强生成),让代理能基于私有数据回答问题。 - **治理**:提供细粒度的权限控制、审计日志和监控,确保AI操作符合企业合规要求。 对于企业而言,这意味着无需从零开始搭建底层架构,而是可以**基于AgentCore快速构建定制化的AI代理系统**,并集成到现有工作流中。 ## 参考架构与可运行示例 AWS在官方博客中提供了完整的参考架构图,并发布了**可在用户自己的AWS账户中运行的示例代码**。该示例展示了如何结合代理编排、知识检索和治理控制,构建一个端到端的尽职调查系统。 尽管示例代码主要面向AWS环境,但其设计思路具有通用性。企业可以借鉴其多代理模式,结合自身的业务需求进行调整。例如,在财务领域,可以添加专门的代理来识别财务异常;在法律领域,可以集成合同审查工具。 ## 行业影响与未来展望 并购交易中的信息不对称是风险的主要来源,而AI代理能够快速筛选、汇总和关联信息,**显著降低人为疏漏的可能性**。虽然目前该系统仍需要人工监督,但随着代理能力的提升,未来有望实现更高级别的自动化。 对于企业而言,拥抱这类技术不仅是效率的提升,更是竞争力的重塑。在数据驱动的商业环境中,**能更快、更准地完成尽职调查的企业,将在并购博弈中占据先机**。

AWS ML17天前原文

Amazon Quick 现已直接集成到 Microsoft Word、Excel、PowerPoint 和 Outlook 中,让用户无需切换应用即可访问企业数据并享受智能体式文档编辑。本文介绍安装流程、核心功能及典型工作流,并探讨其作为“智能层”的价值。

AWS ML17天前原文

**Amazon Bedrock** 的成本归属功能现已支持通过 **IAM principal** 追踪每一次推理请求,为团队、项目或应用提供精细的成本视图。本文是系列的第二部分,重点介绍如何利用 **Amazon Athena** 和 **CUDOS** 仪表盘,对 Bedrock 成本进行可视化与分析。 ## 设置 CUR 2.0 数据导出 首先,需要配置 **Cost and Usage Report (CUR) 2.0** 数据导出,并启用 **IAM principal 数据**。这要求用户拥有 AWS 账单控制台访问权限、CUR、S3 和 Athena 的 IAM 权限,并准备一个用于存储 CUR 数据的 S3 存储桶。在创建标准数据导出时,务必在“其他导出内容”中勾选 **调用方身份(IAM principal)分配数据**,这样 `line_item_iam_principal` 列和相关标签才会被填充。 ## 使用 Athena 查询分析成本 配置完成后,可以通过 Athena 对 CUR 数据执行 SQL 查询,按 IAM principal、使用类型、项目或团队等维度聚合 Bedrock 成本。例如,可以查询每个 IAM principal 的 Bedrock 花费,或结合成本分配标签按团队筛选。Athena 的灵活性使其能够与各种 BI 工具集成,并支持自定义的 chargeback 流程。 ## CUDOS 仪表盘新能力 CUDOS(Cost and Usage Dashboard Operational System)提供了预构建的可视化视图,能够针对组织的特定结构展示 Bedrock 成本和使用情况。新版本增强了粒度,可展示按 IAM principal、项目或团队细分的成本数据,帮助用户快速识别成本热点。 ## 总结 通过 Athena 的查询灵活性和 CUDOS 的预构建仪表盘,企业可以轻松实现 Bedrock 成本的归属分析,优化 AI 支出,并为内部计费或预算控制提供数据支持。

AWS ML18天前原文

**OneAdvanced**,一家服务超过 10,000 家客户的英国企业软件提供商,近期成功构建了一个英国主权 AI 平台。该平台通过自托管 **Llama 4 Maverick** 和 **Llama Guard 4** 模型于 **Amazon SageMaker AI**,结合基于 **pgvector** 的 RAG 管道,以及由 **Strands Agents SDK** 构建的超过 50 个代理,运行在 **Amazon ECS** 上,确保了所有数据都留在英国境内。 ## 数据主权与模型托管的挑战 OneAdvanced 服务于医疗、法律等高度监管行业,客户处理敏感数据,如患者记录和法律文件。严格的英国数据驻留要求使得使用托管服务变得困难,因为当时 Llama 4 Maverick 和 Llama Guard 4 尚未在英国区域提供。因此,他们选择完全掌控基础设施,自托管开源权重模型。 ## 架构与关键决策 该解决方案的核心是使用 **Amazon SageMaker AI** 托管模型,确保模型运行在客户自己的 AWS 账户中。RAG 管道采用 **Amazon Aurora PostgreSQL** 与 **pgvector** 扩展,实现高效的向量检索。代理层由 **Strands Agents SDK** 构建,超过 50 个专用代理分别处理不同任务,并通过 **Amazon ECS** 上的工具层与外部系统交互。 ## 结果与启示 OneAdvanced 的 CTO Andrew Henderson 强调,数据主权是客户的核心要求。通过自托管,他们不仅满足了合规需求,还实现了快速原型验证:最初使用 Amazon Bedrock 在两周内完成了聊天、法律查询等功能的原型,随后迁移到自托管方案。这一案例展示了在 AWS 上构建主权 AI 的可行路径,为其他受监管行业提供了参考。 **要点总结**: - 自托管开源模型是满足数据主权需求的有效方式。 - 结合 RAG 与多代理架构,可构建灵活且安全的 AI 服务。 - AWS 基础设施提供了完全控制权,符合严格合规要求。 对于面临类似数据驻留挑战的企业,OneAdvanced 的实践提供了宝贵经验。

AWS ML18天前原文

当自主代理首次代表企业转移真实资金时,问题不再是“它是否成功?”而是“我们能否证明刚刚发生了什么?”。Solv Labs 与 ICME Labs 合作,在 Amazon Bedrock AgentCore payments 上构建了一套受治理的代理支付工作流,确保每笔交易在 AWS Nitro Enclave 中经过授权、证明、风险定价,并在结算前锚定到公共区块链。 ## 三层治理架构 该方案的核心由三个组件协同:**ORACLE**(Solv 的策略引擎)负责交易前的授权决策;**ICME PreFlight** 将 AWS Automated Reasoning Checks 扩展为隐私保护、可移植且独立可验证的合规验证层;**风险引擎**则为每笔交易单独定价。所有组件运行在 AWS Nitro Enclave 中,确保交易完整性。 ## 性能与可审计性 每笔交易在 **4 秒内**完成,涵盖预授权、治理和通过 Coinbase 进行的链上结算。对于代理工作负载的延迟预算而言,这绰绰有余。同时,每笔交易都会生成完整的审计轨迹,满足监管环境下的合规要求。 ## 行业背景 2026 年 5 月,亚马逊推出了与 Coinbase 和 Stripe 合作开发的 Amazon Bedrock AgentCore payments,使 AI 代理能够即时访问并支付网络内容、API、MCP 服务器及其他代理。该功能与开发者现有的代理控制机制无缝集成。 ## 企业价值 这一模式为在受监管环境中运行代理的企业解锁了关键能力:**可验证性**(每笔交易可独立验证)、**可审计性**(完整轨迹)、**风险定价**(按交易动态评估风险)。随着代理支付基础设施的成熟,企业可以更有信心地部署自主代理,同时满足审计、法律和合规要求。

AWS ML18天前原文

大规模运行大型语言模型(LLM)推理时,KV 缓存常常面临两难选择:要么为不断增长的 KV 缓存支付昂贵的 GPU 实例费用,要么忍受缓慢的首次令牌生成时间(TTFT),因为相同的提示词在每个请求中都会被重新计算。对于在多个业务线端点、RAG 管道或多轮对话应用中部署 Qwen、Llama、DeepSeek 等众多公开基础模型的团队而言,这一权衡直接转化为更高的基础设施成本和更差的用户体验。 问题的根源在于,vLLM 在生成过程中会将已处理过的每个令牌的注意力键值存储在 KV 缓存中,以避免重复计算。前缀缓存通过跨请求复用共享的起始令牌(如通用系统提示词)进一步优化。然而,在像 ml.g6e.4xlarge(每 GPU 48 GB)这样具有成本效益的实例上,扣除模型权重和运行时分配后,可用于前缀缓存的内存非常有限,且随着模型规模或并发度的增加而进一步收紧。长提示词的缓存命中率下降,相同的系统提示词在每个请求中都被重新预填充,水平扩展的 vLLM 副本各自维护独立的缓存,路由到不同副本时实际上相当于冷启动。 本文介绍了一种在 Amazon SageMaker HyperPod 上构建的分层 KV 缓存架构,将缓存层次从 GPU 和 CPU 内存扩展到共享的分布式 NVMe 存储池。该架构基于 HyperPod 的托管分层 KV 缓存和智能路由两项能力,并引入轻量级分布式缓存文件系统 Curvine 作为共享的 L2 层(GPU 到 CPU 到共享 NVMe)。通过这种设置,您可以在副本之间以接近本地磁盘的速度复用 KV 缓存。 在测试部署中,该架构实现了高达 100% 的跨 Pod 缓存命中率,TTFT 提升最高 2.7 倍,跨节点 L2 读取延迟约为 56 毫秒(针对约 1,900 个令牌的提示词)。这意味着,以前需要 P5 实例的工作负载现在可以在更经济的实例上运行。

AWS ML18天前原文

**OpenAI 与 AWS 合作推出 Daybreak Red 和 Daybreak Blue 两款专用网络防御模型,现已通过 Amazon Bedrock 向合格客户开放。** 这两款模型旨在帮助企业更高效地应对网络安全挑战,从漏洞发现到事件响应,提供更智能的解决方案。 ## 模型亮点 - **Daybreak Red**:专注于攻击性安全测试,能够模拟攻击行为,帮助组织在真实攻击发生前发现系统弱点。 - **Daybreak Blue**:侧重于防御性安全操作,协助安全团队分析威胁情报、快速响应安全事件,并优化防护策略。 两款模型均基于 OpenAI 的先进 AI 技术,并针对网络安全场景进行了专门优化。 ## 安全与隐私保障 **一个关键特性是零操作员访问(zero-operator access)**,该机制在芯片层面强制执行,确保运行过程中 AWS 和 OpenAI 的员工都无法访问客户代码和漏洞数据。这种设计充分保护了数据隐私与安全,尤其适合处理高度敏感的安全信息。 ## 行业意义与落地场景 随着网络攻击日益复杂,传统防御手段往往力不从心。Daybreak 系列模型的推出,为安全团队提供了 AI 驱动的辅助工具,有望显著提升威胁检测与响应效率。 在实际应用中,企业可以利用 Daybreak Red 定期进行渗透测试,而 Daybreak Blue 则可以集成到安全运营中心(SOC)中,辅助分析师处理告警、关联威胁情报,甚至自动生成初步响应建议。 ## 可用性与展望 目前,这两款模型已通过 Amazon Bedrock 向符合条件的客户开放。AWS 与 OpenAI 的此次合作,不仅扩展了生成式 AI 在安全领域的应用边界,也为未来更智能的网络安全防御体系奠定了基础。 对于希望提升安全能力的企业而言,现在可以开始评估 Daybreak 模型在自身环境中的表现,探索其如何与现有安全工具链协同工作。 (注:本文基于 AWS 官方公告,具体功能与适用性建议直接咨询 AWS 或 OpenAI 获取最新信息。)

AWS ML19天前原文

在数据稀缺的垂直领域构建专业基础模型,一直是机器学习领域的难题。日本建筑科技初创公司ONESTRUCTION与AWS生成式AI创新中心(GenAIIC)合作,成功开发出专为建筑行业BIM工作流设计的基础模型Ishigaki-IDS。该模型通过合成数据、三阶段训练流程和可验证奖励机制,显著降低了BIM信息交付规范(IDS)的编写门槛,为非专业BIM人员提供了便捷的属性信息管理工具。 ## 建筑行业的数字化转型痛点 日本建筑业面临持续的劳动力短缺,BIM技术因其能够整合设计、施工和维护信息,受到国家层面的推广。然而,BIM的采用需要专业知识,特别是编写基于XML的IDS(信息交付规范)文件,要求使用者精通其语法和IFC模型规则,这成为行业数字化转型的瓶颈。Ishigaki-IDS的目标正是消除这一障碍,让非BIM专家也能轻松审核和管理属性信息。 ## 技术架构:三阶段训练流程 在GenAIIC的技术指导下,ONESTRUCTION构建了一个三阶段的训练流程: 1. **继续预训练(CPT)**:利用大量建筑行业文本数据,让模型掌握领域知识。 2. **监督微调(SFT)**:使用高质量标注数据,使模型学会生成符合IDS规范的输出。 3. **基于可验证奖励的强化学习(RLVR)**:通过可验证的奖励信号,优化模型的结构化输出能力。 其中,**合成数据生成**是解决数据稀缺的关键。团队通过自动化和规则化的方式生成大量合成IDS示例,弥补了真实数据的不足。模型训练在**Amazon EC2 P5en实例**上完成,并借助**AWS ParallelCluster**进行分布式训练,保证了训练效率和可扩展性。 ## 行业价值与应用前景 Ishigaki-IDS的推出,不仅为建筑行业提供了AI赋能的工具,也为其他数据稀缺领域提供了可复用的技术模式。该案例表明,即使在没有海量数据的情况下,通过合成数据、领域专业知识和创新的训练策略,也能构建出高效的专业模型。这不仅有助于缓解建筑行业的人才短缺问题,也为AI在更多垂直行业的落地提供了参考。 未来,ONESTRUCTION计划继续优化模型性能,并探索更多BIM工作流场景,推动建筑行业的智能化转型。

AWS ML19天前原文

摄影师可能是对生成式AI最持怀疑态度的群体之一。然而,Pixieset通过Amazon Bedrock在四个月内向数百万用户推出了AI生成的替代文本功能,通过自动化摄影师们避之不及的繁琐图像SEO工作,同时不触及他们引以为傲的创意工艺,实现了35%的采用率。本文将深入探讨Pixieset如何从客户问题出发,找到AI的真正价值所在。

AWS ML19天前原文

First Orion 是一家品牌通信公司,其解决方案覆盖美国、加拿大、英国和德国的数亿通电话。随着公司从单体门户转向去中心化的模块化架构,QA 团队面临测试负担激增的挑战。为了应对这一挑战,First Orion 采用了 Amazon Nova Act,将基于脚本的 UI 测试转变为由 AI 驱动的代理,这些代理能够像人类一样理解网页界面。通过用自然语言描述测试,而非维护基于选择器的代码,First Orion 显著缩短了 QA 周期,释放了工程资源,并更早地捕获了回归问题。本文介绍了 First Orion 如何采用 Amazon Nova Act、围绕它构建的架构以及取得的成果。

AWS ML19天前原文

**企业级Claude应用网关部署指南** 随着Claude Code和Claude Desktop在企业中的广泛应用,IT管理员面临新的挑战:如何集中管理认证、模型访问、成本归属和支出限制?Anthropic推出的Claude应用网关(Claude apps gateway)正是为此设计。本文将深入探讨其在AWS上的生产级参考部署,涵盖端到端架构、企业部署模式、成本及实施资源。 ## 架构概览 Claude应用网关作为自托管的治理层,位于Claude Code/Desktop与Amazon Bedrock或Claude Platform on AWS之间。它随Claude Code CLI二进制文件一同分发,通过`claude gateway --config gateway.yaml`命令启动,在服务器模式下加载YAML配置。参考部署中,容器运行在AWS Fargate上,位于您的VPC内,也可选择Amazon EKS或EC2以适配现有环境。 ### 关键组件 - **计算与状态**:每个Fargate任务运行一个无状态网关容器。Amazon RDS for PostgreSQL存储短期登录状态(如设备码、会话),并在启用支出限制时存储用户支出计数和审计记录。认证状态存储在数据库中,而非任务内,因此任何任务均可处理任何请求,负载均衡器无需粘性会话。 - **入口与私有DNS**:内部应用负载均衡器使用AWS Certificate Manager证书终止TLS。Amazon Route 53私有托管区域将网关解析为通过VPN、Direct Connect或等效私有连接可达的私有IP地址。 - **服务连接**:VPC端点保持支持的AWS服务流量私有,NAT网关提供其他所需出口。 - **上游凭证**:网关通过分配给网关任务的IAM角色认证Amazon Bedrock。Claude Platform on AWS的API密钥和其他静态凭证存储在AWS Secrets Manager中,不向开发人员分发任何上游凭证。 ## 企业部署模式 参考架构支持两种主流模式:一是集中式网关,所有Claude Code/Desktop流量经由此网关,便于统一策略执行;二是分布式部署,在多个VPC或区域部署网关,实现高可用和低延迟。企业可根据自身组织架构和合规要求选择。 ## 成本考量 部署涉及Fargate计算、RDS数据库、负载均衡器、NAT网关等费用,具体成本取决于流量和配置。建议使用AWS成本管理工具进行监控,并设置预算警报。启用支出限制功能可有效控制成本,防止意外超支。 ## 实施资源 官方提供了详细的部署指南和CloudFormation模板,可快速在AWS上启动参考架构。团队还可参考GitHub上的示例配置和最佳实践文档。 **总结**:Claude应用网关为企业提供了统一的治理层,简化了Claude Code/Desktop的部署与管理,同时增强了安全性和成本控制。通过参考架构,企业可在AWS上快速实现生产级部署,满足企业级工作负载的严格要求。

AWS ML19天前原文

**Amazon SageMaker AI Spaces** 插件现已支持在 **Amazon EKS** 集群上运行托管的 JupyterLab 和 Code Editor 环境,让机器学习团队可以在熟悉的 Kubernetes 基础设施上获得无缝的交互式开发体验。 ## 插件亮点 该插件将 SageMaker AI 的托管环境直接集成到现有的 EKS 集群中,无需额外管理底层资源。团队可以在浏览器中直接使用 JupyterLab 或 Code Editor,也可以通过 VS Code 通过 SSH-over-SSM 连接,实现本地与云端开发的无缝切换。 ## 安装与配置 安装过程相对简单,但需要确保集群满足以下条件: - 已安装 AWS Load Balancer Controller 和 EBS CSI Driver - 具备足够的节点资源以运行环境 配置完成后,用户可以通过浏览器访问环境,或通过本地 VS Code 进行远程开发。 ## 身份认证升级 文章特别强调了如何将团队迁移到 **OpenID Connect (OIDC)** 认证,使用 **Amazon Cognito** 作为身份提供商。这一步骤不仅提升了安全性,还实现了单点登录(SSO),简化了多用户管理。 ## 行业影响 这一更新对 AI 工作流的意义在于: 1. **降低运维复杂度**:无需单独管理 SageMaker Studio 或自建 JupyterHub,直接复用 EKS 基础设施 2. **统一开发环境**:标准化 JupyterLab 和 Code Editor,减少环境不一致问题 3. **增强安全性**:通过 OIDC 和 Cognito 实现细粒度访问控制 ## 小结 对于已经在 EKS 上运行生产级 ML 工作负载的团队,SageMaker AI Spaces 插件提供了一条低摩擦的路径,将交互式开发环境整合到现有架构中。虽然目前该功能可能仍处于预览或有限可用阶段,但其潜力显而易见——它让 Kubernetes 成为 AI 开发的统一控制平面。 未来,随着更多企业采用 Kubernetes 作为云原生基础,这类集成预计将成为标配,进一步推动 AI 工程化的标准化和自动化。

AWS ML20天前原文

**nOps** 是一家专注于云成本优化的初创公司,其核心产品 **Clara** 是一款基于AI的FinOps代理,旨在帮助企业自动发现并削减云浪费。近期,nOps宣布将Clara的底层架构从自管理的 **Amazon EKS** 集群(运行LangChain和LangGraph)迁移至 **Amazon Bedrock AgentCore**,这一转变将新功能的交付时间从 **10-12个月** 缩短至 **4个月**,效率提升 **75%**,同时显著改善了响应质量并降低了运维负担。 ## 从自建到托管:为何迁移? 此前,Clara依赖一套复杂的自管理基础设施,包括EKS集群、LangChain和LangGraph框架,以及多个微服务。这种架构虽然灵活,但带来了沉重的运维负担:团队需要手动处理扩展、监控和故障恢复,且每次模型更新或功能迭代都需要跨团队协调,导致交付周期漫长。 **Amazon Bedrock AgentCore** 提供了一种托管的代理编排能力,允许开发者快速构建、部署和扩展AI代理,而无需管理底层基础设施。它原生支持多种基础模型(包括Claude、Llama等),并内置了任务分解、工具调用和记忆管理等关键功能,使nOps能够将精力集中在业务逻辑上,而非基础设施细节。 ## 显著成效:速度、质量与成本 迁移后,nOps收获了三大核心收益: - **交付速度提升75%**:从需求到上线仅需4个月,相比之前的10-12个月大幅缩短。这使得团队能够更频繁地推出新功能,快速响应客户需求。 - **响应质量改善**:AgentCore的托管编排机制减少了上下文丢失和工具调用错误,Clara在处理复杂查询时的准确性和连贯性均有提升。 - **运维成本降低**:无需再管理EKS集群和自建框架,运维团队得以释放,将更多时间投入到产品创新上。 此外,nOps依然通过 **Databricks Lakehouse Metric Views** 来治理分析数据,确保所有成本数据的安全性和合规性,这一架构使得数据治理与AI代理的集成更加顺畅。 ## 行业启示:托管代理平台的兴起 nOps的案例反映了AI应用开发的一个趋势:**从自建编排转向托管平台**。随着生成式AI进入生产阶段,企业越来越倾向于使用像AgentCore这样的托管服务,以降低技术复杂性并加速上市。对于中小团队而言,这尤其重要——他们无需具备深厚的ML运维经验,也能构建出企业级的AI代理。 不过,这也引发了关于**供应商锁定**和**定制化限制**的讨论。自建方案虽然灵活,但代价高昂;托管方案虽便捷,却可能导致对特定云厂商的依赖。nOps的选择表明,在速度优先的FinOps领域,托管平台的收益大于风险。 ## 结语 nOps的转型证明了Amazon Bedrock AgentCore在加速AI代理开发方面的潜力。随着更多企业效仿,我们可能会看到云厂商在托管AI服务上的竞争进一步加剧,而受益的将是最终用户——他们能以更低的成本获得更智能的FinOps工具。

AWS ML20天前原文

在医疗保健领域,预授权是健康计划在覆盖某些医疗服务或药物前所需的审批流程,它依然是行业中最依赖人工的环节之一。这并非因为要求审批的医学理由存在缺陷,而是因为管理这些审批的政策被困在静态、非结构化的格式中,难以实现自动化。这些内容正是日常临床运营的核心,每年影响数亿患者。然而,政策内容因临床领域、地理位置、业务线和健康计划而异,并随着医学和技术的发展而不断演变。 传统上,健康计划缺乏系统化的方式来管理、分析和优化这些政策。将这些临床政策数字化为使用标准术语的结构化、机器可读数据,可以减少关键运营瓶颈,支持更一致、可计算的工作流程,帮助健康计划在保持适当临床监督的同时,大规模实现预授权流程现代化。 **Cohere Health** 是一家为健康计划运营提供支持的临床智能公司,他们利用 **Amazon Bedrock AgentCore** 构建了 **Cohere Policy Studio**。该平台利用 AgentCore 提供的多租户隔离能力,满足健康计划客户的安全需求,并通过托管代理运行时加速部署,无需重建基础设施。其应用采用灵活的多租户智能体架构,通过广泛的工作流管理和自动版本跟踪,加速政策数字化进程。 ## 多租户架构与安全隔离 AgentCore Runtime 的 **MicroVM 隔离** 技术为每个租户提供安全的计算环境,确保不同健康计划的数据和操作互不干扰。这种设计不仅满足了医疗行业对数据隐私和合规性的严格要求,还使得 Cohere Health 能够快速为多个客户部署和扩展服务,而无需担心资源冲突或安全漏洞。 ## 统一工具访问与智能体技能 通过 **AgentCore Gateway**,Cohere Policy Studio 实现了对内部和外部工具的**统一访问**,使得智能体能够无缝调用各种 API 和服务,例如电子健康记录系统、药物数据库和临床指南。同时,采用 **Agent Skills 开放标准**,开发团队可以像搭积木一样组合和复用预构建的技能模块,从而大幅缩短新功能的开发周期。 ## 记忆与版本控制 **AgentCore Memory** 功能让智能体能够记住历史交互和用户偏好,从而在多次会话中提供更个性化的响应。此外,系统自动跟踪每次政策数字化的版本,确保所有变更都可追溯,并支持回滚操作,这对于医疗合规至关重要。 ## 人工监督与透明度 尽管实现了高度自动化,Cohere Health 仍强调**临床医生的最终审查**。系统提供透明的工作流,让临床医生能够审核和批准智能体生成的数字化政策,确保临床判断始终处于决策核心。这种人机协作模式既提高了效率,又保留了必要的医学监督。 ## 行业影响与未来展望 Cohere Health 的案例展示了生成式 AI 在医疗后台流程中的巨大潜力。通过将静态政策转化为可计算的智能数据,不仅加速了预授权流程,还为更精准的临床决策支持铺平了道路。随着 AgentCore 等平台的成熟,预计更多医疗组织将采用类似架构,推动整个行业向智能化、自动化方向转型。

AWS ML23天前原文

**TReNDS**(佐治亚州立大学转化神经影像与数据科学研究中心)在AWS上构建了一套基于Amazon Bedrock的智能体AI流水线,用于自动化生产环境中的错误根因分析。该中心与佐治亚理工学院、埃默里大学合作,自2019年起将基础设施运行在AWS上,应用包括研究工具和API,均部署在Amazon EKS上,日志通过FluentBit发送至Amazon CloudWatch。随着应用增长,错误调查成为耗时瓶颈,工程师通常需要15–30分钟甚至更长时间来手动排查。TReNDS利用Amazon Bedrock和开源的Strands Agents SDK,结合CloudWatch订阅过滤器、Lambda和GitHub源码,构建了实时错误检测与根因分析系统,将平均排查时间降至60秒以内。该系统不仅总结错误信息,还能拉取日志上下文、读取源代码并生成结构化分析。文章详细介绍了架构设计、实现原理和实际效果,展示了生成式AI在运维自动化中的巨大潜力。

AWS ML23天前原文

随着NHL常规赛进入尾声,球迷最关心的问题莫过于:我的主队锁定季后赛席位了吗?答案往往出人意料地复杂。面对32支球队、繁琐的排名规则以及数百场剩余比赛,判断一支球队是否在数学上锁定季后赛名额,是一项严峻的组合挑战。AWS生成式AI创新中心开发了一套自动化系统,利用约束编程(CP)和自定义树搜索技术,以数学确定性解答这一难题。该系统已通过四个完整NHL赛季的官方结果验证,确保其准确性。 ## 什么是“锁定季后赛”? 在NHL中,“锁定”意味着无论剩余比赛结果如何,球队都保证进入季后赛。随着赛季推进,联盟通常从三月开始发布每日晋级场景,例如:“明尼苏达狂野队将在以下任一条件下锁定季后赛:对阵阿纳海姆鸭队至少获得一分,或圣路易斯蓝调队以任何方式输给犹他冰球俱乐部,或卡尔加里火焰队以任何方式输给维加斯金骑士队。”手动生成此类场景既耗时又易出错,而AWS的系统提供了一种高效、数学严谨的替代方案。 ## NHL季后赛结构 NHL的32支球队分为东西部两个联盟,每个联盟再分为两个赛区。季后赛共有16个名额:每个联盟中,各赛区前三名直接晋级,另有外卡球队填补剩余席位。每场比赛必须分出胜负,若常规时间打平则进入加时,必要时进行点球大战。从球队角度看,比赛有六种可能结果:常规时间胜、加时胜、点球胜、点球负、加时负和常规时间负。胜者得2分,加时/点球负得1分,常规时间负得0分。 ## 技术核心:约束编程与树搜索 AWS团队将问题建模为约束满足问题,通过自定义树搜索算法枚举所有可能的比赛结果组合,以确定球队是否在所有情况下都能进入季后赛。这种方法不仅保证了数学上的精确性,还显著提升了计算效率,使其能适应每日更新的需求。研究论文中详细阐述了算法设计,并验证了其与NHL官方发布结果的高度一致性。 ## 应用价值与展望 这套系统不仅为球迷和媒体提供了即时的晋级分析,也为体育数据分析开辟了新思路。未来,类似方法可应用于其他联赛或更复杂的赛程预测。AWS的这项创新展示了生成式AI与运筹学结合的巨大潜力,让复杂决策变得透明且可靠。

AWS ML23天前原文

随着 AI 智能体(Agent)在业务中的广泛应用,如何确保其行为安全可控成为企业关注的焦点。传统的访问控制基于无状态规则,无法应对智能体动态决策带来的风险。为此,亚马逊云科技在 Amazon Bedrock AgentCore 中引入了**时间策略(Temporal Policies)**,通过基于会话历史的授权检查,为智能体提供更全面的安全保障。 ## 为什么需要时间策略? 传统应用中的安全控制通常将每个操作视为独立事件,依赖确定性业务逻辑来保证操作顺序和数据有效性。然而,AI 智能体在运行时自行决定调用哪些工具、传入什么参数以及调用顺序。这种灵活性带来了安全挑战:单个工具调用在孤立时可能安全,但在特定上下文(如读取不可信数据源后)可能产生危害。 ## 时间策略的工作原理 时间策略在 AgentCore Gateway 边界执行,**评估当前请求与智能体轨迹中先前事件的关联**,从而决定是否授权。由于策略运行在网关层,智能体自身无法拦截或篡改,确保了规则的强制力。 ## 典型应用场景 - **工作流顺序强制**:确保智能体必须按预定顺序执行操作,例如先验证身份再转账。 - **防止数据捏造**:避免智能体在工具调用间伪造数据,如将查询到的客户账号替换为错误账号。 - **控制累计风险**:限制单次会话中金融交易的累计金额,防止失控循环。 - **要求人工审批**:对高价值操作强制人工确认,降低自动化风险。 - **自动收紧权限**:当智能体在无人参与模式下运行时,自动降低其权限级别。 ## 实际案例演示 文章通过一个具体示例展示了时间策略的配置与效果,包括如何定义规则来检测会话历史中的异常行为,并触发相应阻断或审批流程。 ## 行业意义 时间策略的引入标志着 AI 安全从静态规则向动态、上下文感知的演进。它使得企业能够更精细地控制智能体行为,平衡自动化效率与安全合规需求。对于金融、医疗等高风险行业,这一功能将显著提升 AI 应用的可信度。 随着 AI 智能体在企业中的普及,类似的时间感知安全机制或将成为标配。亚马逊云科技此次更新,无疑为行业树立了新的安全标杆。

AWS ML24天前原文

Amazon Bedrock AgentCore 网关现已支持速率限制,提供对 AI 流量的精细控制。该功能允许管理员基于用户或目标设置请求、令牌和连接限制,以保护下游模型、工具和代理免受流量高峰的影响。 ## 速率限制的核心能力 AgentCore 网关作为完全托管的无服务器 AI 网关,统一管理对多种工具的访问,包括托管网络搜索、知识库、MCP 服务器、推理模型(LLM)、代理(A2A、工具代理等)以及 HTTP 端点。新增的速率限制功能支持三种目标类型:MCP 目标、推理目标和 HTTP 透传目标,并提供以下指标: - **请求速率限制**(RPS/RPM):适用于所有目标类型,限制在给定时间窗口内的最大请求数。每个请求,无论执行时间长短,都计为一次单位。 - **令牌速率限制**(TPM):仅适用于推理目标,同时计入输入和输出令牌。网关使用通用分词器预估输入令牌,并在请求前从限额中扣除,响应返回后根据实际令牌消耗进行校准。 - **连接速率限制**(CPS):适用于所有目标类型,跟踪请求持有开放连接的时间,有效管理长连接场景。 ## 基于身份的限流策略 速率限制规则可通过 OAuth 或 IAM 身份进行定义,支持按 JWT 声明或 IAM 身份进行作用域划分。这意味着管理员可以为每个用户或用户组设置独立的限制,确保公平使用资源,防止个别用户过度占用导致服务不可用。 ## 行业意义与落地价值 随着生成式 AI 应用的普及,企业面临流量管理的新挑战。AgentCore 网关的速率限制功能为 AI 基础设施提供了类似传统 API 网关的流量控制能力,但专为 AI 负载设计,考虑了令牌消耗和流式连接等特性。这有助于: - **保障服务质量**:防止流量高峰导致下游模型或工具过载,维持响应速度。 - **成本控制**:通过限制令牌消耗,避免因突发请求产生高额推理费用。 - **安全合规**:基于身份的限制增强了访问控制,满足企业安全策略。 目前,该功能已正式可用,开发者可以在 AWS 管理控制台或通过 API 配置限流规则。对于依赖多个 AI 服务的企业,AgentCore 网关的集中式管理简化了运维,提升了整体稳定性。

AWS ML24天前原文