问题
在 Amazon Bedrock 上构建 AI agent 的开发团队,面对密集上线的新模型无所适从:几天之内 GPT-6.1 Sol、Claude Sonnet 5.5、Grok 4.7 相继进入模型目录,各家成本与能力差异巨大——Sol 在 DeepSWE v1.1 上匹配 Astra 但“成本仅为其五分之一”,Sonnet 5.5 “以更低单任务成本、更快速度完成 bug 修复等范围明确的工作”,Grok 4.7 则提供 500K 上下文。长时编程 Agent 会“频繁运行”,任务量一大,模型选错一个档位,费用就失控。信号中厂商自己都把“IDE coding agents with fixed spend caps(固定支出上限)”列为场景,说明任务级预算控制目前要靠团队自己拼装。
目标用户
在 Amazon Bedrock 上构建 AI agent 的开发团队与 ISV(信号 2 特别提到金融服务团队),即需要长时间、高频运行编程 agent 且对成本敏感的中小组。这是云 AI 开发者工具市场中的一个细分层。
解决方案
- 模型路由:按任务类型(bug 修复、代码生成、长上下文阅读、专业文档工作)自动匹配 Bedrock 上最合适的模型,默认用 Sol/Sonnet 这类“单任务成本更低”的档位跑高频工作
- 任务级预算上限:每个 agent 任务设置费用 cap,超支前自动降级或中止,直接回应信号中“fixed spend caps”的场景
- 成本对比报表:展示同一批任务在不同模型下的成本与完成质量,让团队知道换模型省了多少钱
- 可配置推理开销:对 Grok 4.7 这类支持 configurable reasoning effort 的模型,按任务难度自动调低推理档位省钱
AI 的角色是元层决策:用一个小模型为每个任务做分类与档位选择,主工作仍交给被路由的前沿模型。
为什么是现在
两天之内三个前沿模型同时登陆 Bedrock:GPT-6.1 Sol 以约五分之一的单任务成本达到 Astra 级别的 DeepSWE v1.1 表现;Claude Sonnet 5.5 单任务成本更低且更快,适合“持续/规模化工作负载”;Grok 4.7 带来 500K 上下文与可配置推理开销。模型之间的成本-能力档位第一次拉开到值得做精细路由的程度,而平台没有提供现成的任务级预算控制。
MVP 范围
第一版只做一件事:对 Bedrock 上的 GPT-6.1 Sol、Claude Sonnet 5.5、Grok 4.7 三个模型,按任务类型(bug 修复、代码生成、长上下文分析)做自动路由,并对每次 agent 任务强制执行任务级费用上限,超限自动降级到更便宜的模型。
明确不做:不支持 Bedrock 之外的云;不做模型微调或自研模型;不做通用 LLM 网关的全部功能(如缓存、密钥管理);先不做实时监控大盘。
风险
平台依赖(最大风险):产品完全建立在 Bedrock 的模型目录与计费 API 之上,AWS 一旦调整接口或原生内置智能路由,价值立刻归零。
竞争风险:Bedrock 自身已提供 Guardrails、Cost Explorer、CloudWatch 等配套,补上路由层对 AWS 而言边际成本很低。
模型同质化风险:信号显示三家厂商在价格与能力上快速互相逼近,若单模型已足够便宜,路由的节省空间会被压缩。
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| Amazon Bedrock | 平台本身已提供多模型选择、Guardrails 与 Cost Explorer,是最大的平台依赖与潜在内置竞争者 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
AWS Machine Learning Blog9月29日新能力隐含付费意愿
“GPT-6.1 Sol is now generally available on Amazon Bedrock, bringing stronger reasoning to coding, computer use, and professional workloads that run frequently.”
GPT-6.1 Sol is now generally available on Amazon Bedrock, bringing stronger reasoning to coding, computer use, and professional workloads at lower cost per task.原文
AWS Machine Learning Blog9月28日新能力
“xAI’s Grok 4.7 is now available on Amazon Bedrock, adding a frontier model built for coding, long-running agents, and knowledge work to the Bedrock model catalog.”
xAI's Grok 4.7, its most capable model for coding and long-running agents, is now available on Amazon Bedrock with a 500K token context window and configurable reasoning effort.原文
AWS Machine Learning Blog9月28日新能力隐含付费意愿
“Claude Sonnet 5.5 is a smarter, more efficient Sonnet model suited for focused coding and knowledge work with lower cost per task for most work at faster speed.”
AWS announces the availability of Claude Sonnet 5.5 on Amazon Bedrock, a model suited for focused coding and knowledge work with lower cost per task and faster speed.原文