产品AWS Machine Learning·原文 2026年9月22日

AWS与Salesforce打通:用MCP把非结构化证据接入Agentforce

AWS发布方案,将Amazon Bedrock Data Automation与Model Context Protocol结合,把体感摄像头视频、监控录像、扫描文件等非结构化证据转为结构化洞察,并在Salesforce Agentforce控制台内以自然语言查询呈现。

AI解读:公共部门手里堆着大量体感摄像头视频、监控录像和扫描文件,但谁都没法直接靠这些原始素材办案。AWS这次给出的方案是先用Amazon S3存下来,再用Amazon Bedrock Data Automation按文件类型自动抽取文本、关键字段、场景摘要和转录,把非结构化数据变成可检索的结构化结果。

真正的看点是查询入口。Salesforce用户不用切到AWS控制台,在Agentforce聊天框里提问就能触发一次通过Amazon Bedrock AgentCore Gateway认证的MCP调用,去查DynamoDB里的结果再从S3取回内容,最后以自然语言答出来。对已经在用Agentforce的公共部门机构来说,这意味着底层存储和AI处理可以留在AWS,前端交互留在Salesforce。

但这不是开箱即用的产品。AWS明确说示例代码不是生产就绪,需要自行加固;MCP服务器注册目前只在Developer、Enterprise、Performance和Unlimited版本可用;而且因为证据内容可能藏有间接提示注入指令,AWS建议把所有抽取内容当作不可信数据处理,并用Amazon Bedrock Guardrails过滤。

这一架构是可替换的。处理引擎可以换成GenAI Intelligent Document Processing Accelerator,而S3接入和MCP查询路径保持不变;MCP服务器基于开放标准,其他兼容MCP的agent或系统也能连同一个端点。换句话说,被复用的不是某个具体产品,而是那条查询通道。

AWS在机器学习博客发布技术方案,将Amazon Bedrock Data Automation与Model Context Protocol(MCP)结合,把公共部门的非结构化证据——体感摄像头视频、监控录像、照片、音频和扫描文件——转为结构化洞察,并通过Salesforce Agentforce以自然语言查询呈现。

方案分两条流:第一条用Agentforce Public Sector的External Storage of Files with Amazon S3连接器把媒体文件存入Amazon S3;第二条由S3事件通知触发AWS Lambda,生成document ID并写入DynamoDB,同时启动Amazon Bedrock Data Automation任务。任务完成后,Amazon EventBridge规则触发第二个Lambda把结果写入S3输出桶。

用户在Agentforce中的提问会触发一个已配置动作,通过MCP调用AWS;请求经Amazon Bedrock AgentCore Gateway认证后调用运行在AWS Lambda上的MCP服务器。该Lambda先查DynamoDB定位结果,再从S3取回,经AgentCore Gateway返回Agentforce,装入上下文后生成自然语言回答。

按媒体类型抽取的内容与配置

Amazon Bedrock Data Automation根据媒体类型分别处理:文档抽取文本、识别关键字段并生成结构化摘要;图像生成描述并识别画面中的对象或文字;视频和音频生成转录和场景级摘要。抽取能力由Bedrock Data Automation项目配置决定,部署后可在控制台自定义。

整个处理对Salesforce用户透明:上传文件、提问、收到AI洞察都在Salesforce控制台内完成,不需要切换系统或直接管理AWS资源。

部署前提与版本限制

该方案建立在同一作者此前一篇《Modernizing evidence management in Salesforce Public Sector Solutions with Amazon S3》的基础上,AWS要求先完成前文的步骤。此外,Salesforce org必须支持通过Agentforce Registry注册和调用外部MCP服务器,可在Setup > API Catalog > MCP Server检查。

注册外部MCP服务器目前支持Developer、Enterprise、Performance和Unlimited四个版本。

注册MCP服务器与配置子代理

部署AWS CDK栈后,CloudFormation的McpGatewayStack输出中需要CognitoClientId、CognitoTokenEndpoint和GatewayMcpEndpoint,Cognito应用客户端的client secret则从Amazon Cognito控制台获取。Agentforce通过MCP Streamable HTTP传输连接AgentCore Gateway,从而发现并调用网关暴露的证据检索工具。可选地用MCP Inspector验证网关端点。

在Salesforce Setup的API Catalog > MCP Server中新建并注册MCP服务器,命名AwsBdaResultsMcp,描述为访问Amazon Bedrock Data Automation结果的MCP服务器,填入上述AWS值后创建。在MCP Server Allowlist中选择要使用的工具,AWS建议生产环境中将allowlist限制为agent实际需要的工具。

在Agentforce Builder中可用Employee Agent模板创建子代理,命名Media Processor,描述为处理当前案例附带的文件、文档、照片、图像、视频或音频相关问题并从处理后的媒体中检索AI生成洞察;在Actions Available for Reasoning中从Asset Library添加已注册的MCP工具;推理指令要求对未处理的附件明确告知用户尚未处理,不得编造内容。

测试、清理与安全

在Agentforce Builder的Preview中,将currentRecordId上下文变量设为待测试案例的唯一 18 位Record ID,应用并重启会话后输入如“Summarize the files for this case”的提示;成功时agent返回案例关联的每项摘要,Summary outputs提供agent处理步骤的自然语言追踪。

AWS说明该示例代码用于演示模式,并非生产就绪,需审查和加固。清理时按GitHub仓库步骤删除已部署资源,并手动删除Salesforce中的Agentforce MCP连接;由于是事件驱动无服务器架构,只在证据上传和分析时产生处理费用,S3和DynamoDB按存储量计费,无最低承诺或预付费用。

安全方面,AWS共享责任模型下用户负责自身实现:应考虑哪些用户能访问agent、它能调用哪些工具和动作;证据中抽取的文本可能包含诱导agent执行非预期操作的隐藏指令,即间接提示注入。缓解措施包括把抽取内容当作不可信数据而非指令、在内容进入agent上下文前做输入验证、通过MCP allowlist最小化可用动作、用Amazon Bedrock Guardrails过滤或拒绝试图覆盖agent行为的内容。后者还能过滤有害内容、脱敏PII,并运行接地检查确认回答基于检索到的证据而非编造。

可替换的处理引擎与复用路径

AWS称该架构有意设计为模块化和可扩展,不限于证据管理,也可用于许可、福利申请或合规审查等涉及非结构化数据的流程。关键组件为Amazon S3存储、Amazon Bedrock Data Automation处理、Amazon Bedrock AgentCore Gateway暴露MCP工具、Salesforce Agentforce自然语言交互,各组件独立运行。

对以文档为主的工作流,如许可、福利申请或税务表格,可以换用GenAI Intelligent Document Processing (IDP) Accelerator作为替代处理引擎,而S3接入和MCP查询路径保持不变。因为MCP服务器基于开放标准,只需构建一次,兼容MCP的agent或系统可连接同一端点,在Agentforce之外复用查询层。

信息来源