AWS发布Bedrock AgentCore评估方案,为多智能体系统加入可解释性检查
AWS Machine Learning博客介绍如何用Amazon Bedrock AgentCore Evaluations评估多智能体系统,提出内置、自定义、可解释性三层评估框架,并以Strands Agents搭建的供应链多智能体参考架构演示。
AI解读:该能力被描述为完全托管的评估服务,覆盖开发和上线后的质量维度。
文章提出三层评估框架:第一层用无需配置的内置评估器评估通用质量,第二层用自定义评估器验证业务规则,第三层把可解释性作为独立维度单独衡量。
作者认为只评估模型回答质量不足以覆盖智能体系统,这类系统的正确性取决于工具选择、工作流执行和对业务约束的遵守。
演示用Amazon Strands Agents SDK搭建虚构零售商AnyCompany Retail的供应链决策系统,包含一个编排智能体和优化、分销、路由、分析四个子智能体。
评估支持按需和在线两种模式:按需用于开发基准、回归测试和CI/CD门槛;在线用于生产持续监控与告警,按采样率读取追踪记录并推送到CloudWatch。
文章给出六项可解释性评估器,分别检查决策理由质量、证据归因、约束推理、权衡解释、工具使用解释和假设披露,独立于准确性衡量。
AWS Machine Learning博客发布由Kanishk Mahajan撰写的文章,介绍如何用Amazon Bedrock AgentCore Evaluations评估多智能体系统的可解释性和有用性。
文章称该评估能力为完全托管服务,覆盖开发和生产阶段,用来衡量智能体的准确性、任务成功率和多维行为表现。
三层评估框架
文章提出三层评估方法。第一层使用内置评估器,无需额外配置,包括Helpfulness作为通用基线,并按各智能体的主要失效模式追加第二项内置评估器。
第二层添加编码领域业务规则的自定义评估器,用于验证业务有效性;第三层把可解释性作为跨智能体的独立检查层,与准确性分开衡量。
作者写道,这样分层后可以区分“正确但无法解释”和“解释清楚但结论错误”两类情况,团队据此判断是推理表达需要改进,还是决策逻辑本身需要修正。
- 编排智能体:内置Helpfulness与Tool Selection Accuracy;自定义计划一致性、工具轨迹评估器
- 优化智能体:内置Helpfulness与Response Relevance;自定义约束满足、KPI达成评估器
- 分销智能体:内置Helpfulness与Response Relevance;自定义推荐依据、风险影响评估器
- 路由智能体:内置Helpfulness与Instruction Following;自定义路线可行性、SLA评估器
- 分析智能体:内置Helpfulness与Faithfulness;自定义SQL正确性、数据依据、无无依据断言评估器
六项可解释性检查
文章列出六个独立可解释性评估器,跨智能体应用,与准确性分开测量。它们检查智能体是否说明推荐理由、是否引用数据字段或API与SQL结果、是否解释哪些约束影响了结果、是否说明成本与服务水平和库存风险之间的权衡、是否解释为什么调用某个子智能体或MCP工具、以及数据不完整时是否披露假设。
供应链参考架构与运行流程
演示使用虚构的跨国零售商AnyCompany Retail,其场景是库存失衡:部分地区促销期间缺货,另一些地区库存过剩,运输团队还要在配送速度、承运商运力和成本之间平衡。
方案用Amazon Strands Agents SDK构建,包含一个编排智能体和四个子智能体,运行在Amazon Bedrock AgentCore runtime上,并启用AgentCore memory和AgentCore Observability。子智能体作为工具暴露给编排智能体,底层使用Amazon Bedrock上的基础模型。
测试客户端提供 20 条示例查询,每个子智能体 5 条,按多轮会话运行;评估脚本异步执行,结果以markdown文件保存到S3,运行后需等 3 至 5 分钟让追踪记录传到CloudWatch。
文章演示了优化智能体的端到端评估:先跑 5 条优化查询生成会话,再用约束满足评估器检查预算、库存覆盖和仓库容量三项约束,最后用决策理由质量和约束推理两项可解释性评估器检查透明度。
- 按需模式用于开发基准、回归测试和CI/CD门槛
- 在线模式用于生产持续监控和告警,通过OnlineEvaluationConfig对象引用评估器ARN,指定采样率(例如生产追踪的 1% 至 10%)和可选的会话过滤条件
- 评估结果流式写入Amazon CloudWatch仪表盘和告警
- 文章称Amazon Bedrock Guardrails提供内容过滤、拒绝话题检测和依据验证,在执行期间施加安全约束;评估则在执行后检查质量
隐私与前提条件
文章列出部署前提:安装AWS CLI、AWS SAM CLI v1.100.0及以上、Docker v20.x及以上、Node.js v18.x及以上、Python v3.11及以上。解决方案代码可从其GitHub仓库下载,用terraform部署。