SheepNav
新上线今天0 投票

OpenAI GPT-5.6 Sol、Terra、Luna 登陆 Amazon Bedrock,一文教你快速上手

OpenAI 最新一代 GPT-5.6 系列模型——SolTerraLuna——现已正式在 Amazon Bedrock 上提供。这三个模型分别面向自主编码与长链条推理、日常生产负载以及高吞吐低延迟推理场景,通过统一的 Responses API 在 bedrock-mantle 端点访问,支持文本和图像输入、272K token 上下文窗口,并可调节推理强度。定价与 OpenAI 官方一致,且使用量计入 AWS 承诺消费。本文从模型选择、首次推理、提示缓存、Codex 集成到配额规划,提供完整入门指南。

模型概览:Sol、Terra、Luna 各司其职

GPT-5.6 系列采用新的命名体系:数字代表代际,名称(Sol、Terra、Luna)代表能力等级。三款模型在 Amazon Bedrock 上的关键规格如下:

模型 模型 ID 最佳适用场景 支持区域
Sol openai.gpt-5.6-sol 自主编码、安全研究、科学分析、深度多步推理 美东(弗吉尼亚、俄亥俄)
Terra openai.gpt-5.6-terra 平衡推理能力与成本的通用生产负载 美东(弗吉尼亚、俄亥俄)、美西(俄勒冈)
Luna openai.gpt-5.6-luna 分类、摘要、路由等高吞吐、低延迟场景 美东(弗吉尼亚、俄亥俄)、美西(俄勒冈)

三者均支持 文本和图像输入文本输出,上下文窗口达 272K token,并可通过 nonelowmediumhighxhighmax 参数调节推理努力程度。这意味着你可以在不修改 API 集成的前提下,根据任务复杂度切换模型。

快速开始:通过 Responses API 运行推理

所有模型通过 OpenAI 的 Responses APIbedrock-mantle 端点访问。以下是一个调用 Sol 模型进行代码生成的 Python 示例(使用 boto3 和 Amazon Bedrock 的 Converse API):

import boto3

client = boto3.client("bedrock-runtime")

response = client.converse(
    modelId="openai.gpt-5.6-sol",
    messages=[
        {"role": "user", "content": [{"text": "Write a Python function to merge two sorted lists"}]}
    ],
    inferenceConfig={
        "maxTokens": 4096,
        "temperature": 0.7
    }
)
print(response["output"]["message"]["content"][0]["text"])

与标准 Bedrock Converse API 一致,但需注意模型 ID 前缀为 openai.gpt-5.6-

降本技巧:提示缓存与缓存命中度量

提示缓存可显著降低重复请求的成本。当请求的提示前缀与缓存内容匹配时,系统自动返回缓存的中间状态,并只对未缓存部分计费。启用方式:在 API 请求中设置 cache_config 参数(如 {"type": "prompt"}),并确保提示内容可复用。

可通过响应中的 usage.cached_tokens 字段查看缓存命中情况。例如:

{
  "usage": {
    "input_tokens": 5000,
    "cached_tokens": 3000,
    "output_tokens": 200
  }
}

表示 5000 个输入 token 中有 3000 个命中缓存,仅对剩余的 2000 个和输出 token 计费。

集成 OpenAI Codex 编码代理

OpenAI Codex 编码代理可与 Sol 模型结合,实现自主代码编写与调试。集成步骤:

  1. 在 Bedrock 中创建一个 代理,选择 Sol 作为基础模型。
  2. 为代理配置 代码解释器 工具(需开启沙箱执行环境)。
  3. 通过 API 或控制台向代理下达编码任务,如“编写一个 REST API 端点,使用 FastAPI”。

代理会自动调用 Sol 生成代码、执行并返回结果。注意:Codex 代理需要 AWS 账户具备 Bedrock 代理和 Lambda 执行权限。

配额与扩展规划

每个 AWS 区域对 GPT-5.6 模型有初始配额限制,可通过 Service Quotas 控制台申请提升。关键配额包括:

  • 每分钟请求数(RPM):默认 100
  • 每分钟 token 数(TPM):默认 100,000
  • 并发推理数:默认 5

建议根据生产负载预估,提前申请配额提升。对于高吞吐场景,可考虑使用 Luna 模型并结合 提示缓存批处理 来优化。

安全与隐私

你的提示和输出不会用于训练任何模型,也不会与模型提供商共享。所有数据在 AWS 区域内部处理,符合企业级安全与合规要求。

现在,你就可以在 Amazon Bedrock 控制台中启用 GPT-5.6 模型,开始探索自主编码、高效推理和生产级 AI 应用的新可能。

延伸阅读

  1. 美国权衡对华AI对策,业界呼吁避免对开源模型“一刀切”限制
  2. 在 AWS 上构建可解释的银行“下一最佳产品”推荐系统
  3. 视频星期五:意大利人形机器人苏醒
查看原文