问题
多渠道 UGC 平台(网页、平板、移动端)的运营团队需要按自家的行为+主题双轴审核政策做内容审核。通用模型没微调时效果差:基线 Per Behavior Macro F1 只有 0.5852,没法直接用;接 Guardrails 或通用审核 API 又对不上自家政策分类体系。团队要么大量人工标注+人审兜底,要么自建微调管线(SageMaker、数据、评测、上线一整套),门槛高。
目标用户
中小电商/社区/会员平台的信任与安全、运营团队;有 UGC 多渠道审核需求但没有专职 ML 团队的公司。AWS 博客里出现的是大型零售会员平台,说明头部有这个需求,中小平台更多但付费能力要验证。
解决方案
- 政策结构化:把客户散落的审核政策文档转成两轴(行为/主题)标签体系
- 数据飞轮:人审纠错回流成训练集,内置质量验收
- 一键微调:托管 Nova 2 Lite 或同级开源模型的 SFT + prompt 级输出优化
- 硬/软门评测:上线前自动跑 F1 等指标,达标才晋级
- 按渠道接入:web/移动/平板 API 统一调用,带兜底人审队列 AI 扮演核心:分类靠微调后的模型,政策理解靠 LLM 辅助做标签体系对齐。
为什么是现在
AWS 官方博客(2026-10)披露零售平台用 Nova 2 Lite 做业务政策微调的完整方案,说明新模型+成熟 SFT 工具链已把这个需求跑通;通用模型基线只有 0.5852 的 F1,证明"不微调直接上"这条路确实不行。
MVP 范围
做:政策→标签体系解析、标注回流、托管 SFT(Nova 2 Lite 或开源同级)、F1 评测报告、审核 API。 不做:不做实时视频/语音审核、不做自己训练基座模型、不做审核执行动作(封号等)本身。
变现方式
null(博客属于厂商能力展示,无付费意愿数据,无法给出定价依据)
风险
- 依赖底层模型和云厂商(Nova/SageMaker),AWS 自己可能把这套流程产品化
- 政策差异大导致交付偏服务而非纯 SaaS,毛利和规模化受限
- 客户审核数据敏感,合规成本高
- 大客户(如 AWS 案例中的零售平台)已有内部 ML 团队,自己能做
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| Amazon SageMaker AI | AWS 官方微调平台,博客里的参考实现基础,DIY 路线核心组件,是所有客户的自建替代品,也是本产品的底层依赖风险来源。建议策略:只做上游的政策解析+数据飞轮+评测层,跟 SageMaker 而不是硬刚。 | — |
| Amazon Bedrock Guardrails | AWS 的政策化审核护栏,是"免训练对齐政策"最直接替代方案,虽然通用政策对不上私有双轴体系,但 AWS 未来把 Fine tuning 与 Guardrails 打包是最大的平台级威胁。 | — |
| Amazon Nova 2 Lite | 案例中被微调的模型,说明该模型 SFT 已被 AWS 官方流程跑通。对创业公司:既是威胁(客户可照抄官方博客自建)也是机会(微调源模型供应链单一,绑定风险高)。 | — |
| Amazon Bedrock | AWS 托管模型推理平台,Nova 2 系列所在之处,代表"直接调用通用/托管模型"这条替代路线,也承载 Guardrails。威胁:客户若接受通用效果+Guardrails 拼凑,可能不付费买微调。 | — |
| Amazon Nova 2 Pro | AWS 高阶旗舰模型,代表更强基线路线:直接用大模型+长提示,可能部分场景跳过微调,是轻量微调需求的潜在分流。 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
AWS Machine Learning Blog10月1日新能力隐含付费意愿
“Without fine-tuning, Amazon Nova 2 Lite achieved a Per Behavior Macro F1 of 0.5852 and a S”
General-purpose models without fine-tuning performed poorly on business-specific moderation taxonomies (Per Behavior Macro F1 of 0.5852 at baseline).原文
AWS Machine Learning Blog10月1日新能力隐含付费意愿
“In this post, we show how the team adapted Amazon Nova 2 Lite to these business-specific moderation policies through supervised fine-tuning in Amazon SageMaker AI and a final prompt-level output optimization.”
A retail membership platform needed a general-purpose model customized to business-specific content moderation policies across two classification axes (behavior and subject type).原文