AWS发布生成式AI定制八步框架:从提示工程到Amazon Nova Forge自建模型
AWS Machine Learning博客提出一条按投入递增的定制“阶梯”:先用现成模型,再改提示、加RAG、做缓存和蒸馏,最后才动权重做微调、继续预训练或从零训练。多数工作负载不需要超过第 3 步。
AWS Machine Learning博客发布一篇选型指南,把生成式AI的定制方式排列成从简单到复杂的八步“定制阶梯”,目标是帮团队避免过度设计或投入不足。文章由Bhavya Sruthi Sode撰写。
框架把步骤分成三类:USE(不改模型,只改与模型对话的方式)、ENHANCE(在模型外围加东西,权重保持冻结)、TRAIN(更新权重或重建模型)。核心原则是“从最简单的方法开始,只在必须时才深入”。
文章称,多数工作负载永远不需要超过第 3 步;并给出各步骤的升级信号、数据需求、成本取舍和AWS服务映射。文中所有效果数字均来自AWS引述的客户案例和产品公告。
USE:第 1–2 步,不改模型
第 1 步是直接通过Amazon Bedrock调用基础模型,零定制,可选Claude、Amazon Nova、Llama、Mistral等,适合摘要、翻译、头脑风暴和代码生成等通用任务,无需训练数据,只需一次API调用。文章提到Dovetail在无模型定制的情况下一天内做出原型、两周内发布新的生成式AI功能。
第 2 步是提示工程和上下文学习,用系统提示、少样本示例和思维链推理来引导模型,仍不改动权重。文章称这适用于大多数用例。升级信号是:提示超过约 2000 token、仍对领域事实产生幻觉,或需要模型不具备的知识。DoorDash用Amazon Bedrock和Anthropic Claude搭建全语音自助客服方案,两个月内进入实测。
- 第 1 步的升级信号:输出过于通用、格式错误或不遵循领域惯例
- 文章建议提示包含五个构件:清晰指令、充分上下文、具体要求、输出格式、质量指标
- 文中提醒常见错误是堆砌指令或没有具体性地倾倒上下文
ENHANCE:第 3–5 步,权重冻结的外围增强
第 3 步是检索增强生成(RAG),用Amazon Bedrock Knowledge Bases在推理时提供外部知识,让回答基于自有数据,减少幻觉且无需重新训练。适用私有、频繁更新或领域特定的数据。升级信号是检索延迟超出要求、上下文窗口溢出,或模型仍无法对检索内容正确推理。Fractal Analytics用RAG为客服搭建统一知识库,文章称其通话处理时间减少 10–15%、呼叫转移率 30%、每月查询超过 20 万次;EXL用基于RAG的虚拟助手把保险核保成本降低 80%。
第 4 步是提示缓存和上下文优化,预先处理和缓存高频使用的提示前缀,让重复查询跳过冗余计算,在不改变输出质量的前提下降低延迟和成本。适用高并发、重复、共享上下文的查询,例如客服机器人、文档问答、命中同一系统提示的代码助手。升级信号是需要更小更便宜的模型达到同样质量。文章提到inGenious.ai在Amazon Nova上把聊天机器人理解度提升 80%,响应时间低于 1 秒。
第 5 步是模型蒸馏,把大“教师”模型的知识迁移到小“学生”模型,针对特定用例复刻输出。文章引用Amazon Bedrock模型蒸馏 2025 年 5 月正式可用公告称,学生模型速度最高提升 500%、成本最高降低 75%,准确率损失低于 2%。升级信号是蒸馏模型无法匹配所需的语气、格式或推理风格。Goodnotes从Amazon EKS自托管模型迁到Bedrock上的Anthropic Claude,以改善可扩展性和成本效益。
- RAG的适用条件:模型需要访问私有、频繁更新或领域特定数据
- 提示缓存的适用条件:高并发重复查询且共享系统指令等上下文
- 蒸馏的适用条件:已用大模型验证质量,但需要更便宜、更快或可部署到边缘
- 文章用厨师比喻蒸馏:让帮厨学会三道畅销菜,10 分钟上桌、成本为三分之一
TRAIN:第 6–8 步,动模型本身
第 6 步是微调,用标注的输入输出对更新模型权重,永久改变行为、风格或领域准确率。可选用参数高效微调(PEFT/LoRA)处理较小数据集,或用全量微调做全面更新。适用场景是提示工程和RAG之后语气、格式或任务推理仍不匹配,且拥有数千条标注示例。升级信号是模型不理解领域术语或概念,需要基础知识而非仅行为调整。文章称Trellix把生成式AI安全工具微调用于网络安全集成,每次集省下超过 40 小时开发时间,新安全集成的上市时间减少 90%。
文章还介绍了强化微调(RFT):标准微调需要为每种想学习的行为提供黄金标注样本,而验证正确性比演示正确性便宜得多,RFT让用户定义奖励函数打分,模型据此优化。Amazon Bedrock将其做成全托管服务,每次作业最多提供 2 万条提示和一个评分函数。文章称RFT于 2025 年 12 月面向Amazon Nova模型开放,2026 年 2 月扩展到OpenAI GPT OSS 20B和Qwen 3 32B等开放权重模型。PEFT需要几千条标注样本,全量微调需要数万条,DPO需要成对的首选/非首选回复。
第 7 步是继续预训练(CPT),用大量无标注领域数据(文档、转录、代码、论文)做自监督学习,扩展模型的基础知识。适用条件包括微调后仍不理解领域术语、拥有 10 亿以上token的专有语料。文章点出历史上的难题是灾难性遗忘:领域性能提升的同时,通用推理、指令遵循和安全对齐会退化;Amazon Nova Forge用数据混合,把专有语料与Amazon策划的训练数据在每个训练阶段混合,以保留通用性能。文章称中期训练需要 10 亿以上token无标注领域内容,完整继续预训练需要 1 万亿以上token。Sonrai用领域定制做单细胞RNA测序分析,文章称其精准医学研究加速 50%、错误减少 5 倍、每次实验最多省下 2 万美元。
- 微调的升级信号:模型不理解领域术语或概念,需要基础知识而不只是行为调整
- RFT适用代码生成、结构化输出准确率、多步推理等验证比演示更便宜的任务
- CPT的三种典型失败:检索到正确段落但合成不出连贯回答、对领域结构推理失败、持续误读领域术语
第 8 步:用Amazon Nova Forge自建模型
第 8 步是用Amazon Nova架构、中间检查点和Amazon策划数据加上专有数据,从早期检查点开始训练一个自己的前沿基础模型。文章称之为“开放训练”范式。适用条件是现成模型和此前所有定制步骤都无法满足准确率要求,团队具备机器学习专业能力、大型专有数据集,并需要持久的竞争差异化,通常是把模型作为核心产品或服务来变现的情景。文章明确写道,对大多数客户而言第 1–7 步已经足够,Nova Forge面向制药、机器人、金融、制造等需要深度领域专长的行业。
文章称Nova Forge的差异在于:可访问预训练、中训、后训的中间模型检查点;与Amazon策划数据集做数据混合以防止灾难性遗忘;以及可在客户自有环境中做多轮RFT,例如机器人模拟器和代码验证器。它还支持把自有环境作为奖励信号做强化学习,比如为分子设计打分的化学模拟、惩罚碰撞的机器人物理引擎、检查编译是否成功的代码验证器。文章提到Nimbus Therapeutics用Amazon SageMaker在专有分子数据上定制训练模型,加速候选药物设计。
- Nova Forge明确不适用的情况:大多数客户的第 1–7 步已经足够
- 文章给出每一步对应的AWS服务映射:Bedrock、SageMaker、Nova Forge