产品AWS Machine Learning·原文 2026年9月24日

AWS发布基于智能体的对话式视频智能方案,可秒级回答视频内容问题

该方案用单个Strands Agents SDK智能体在运行时决定调用Amazon Bedrock、Rekognition还是Transcribe,上传视频后即可用自然语言提问;已有分析缓存的问题可在 1 秒内返回,新视频首次分析需 5–10 分钟。

AWS机器学习博客发布了一套基于智能体架构的对话式视频智能方案:用户上传视频后用自然语言提问,几秒内得到答案。方案使用Strands Agents SDK构建单个AI智能体,在运行时根据问题决定调用Amazon Bedrock、Amazon Rekognition还是Amazon Transcribe。

博客称,对于已经分析过的内容,回答可在 1 秒内返回;新视频的首次分析需要 5–10 分钟,具体取决于视频长度和所需服务。完整实现已放在配套GitHub仓库中。

方案面向媒体、安防、保险和专业服务等视频产出超出团队审阅能力的组织。会议录像、监控素材、现场检查视频里常有设计决策、某人到达门口的时刻或碰撞前的事件顺序,但传统上要么人工观看数小时,要么为每类问题单独搭建转录、计算机视觉或人脸匹配流水线。

智能体在运行时决定调用哪个服务,而不是预先写死流水线

架构由一个智能体编排器连接多个AWS AI服务,Amazon S3存储上传视频和缓存的分析输出。编排器用Strands Agents SDK构建、由Amazon Bedrock驱动,使用Claude Sonnet或其他支持工具调用的大语言模型。它接收自然语言查询,判断该调哪些工具,必要时按顺序串联多次调用,再把结果合成为对话式回答。智能体保留对话历史,追问可基于之前的分析,无需重新处理。

Amazon Rekognition提供视觉分析,检测视频帧中的物体、场景、活动和人脸,用于问题涉及画面内容时。Amazon Transcribe把语音转成文本,支持 100 多种语言的自动语言检测和说话人分离,用于问题涉及spoken内容时。Amazon Bedrock Data Automation提供另一条分析路径,一次API调用完成视频摘要、章节检测和全文转录,适合用户想要一步完成全面分析,或Rekognition、Transcribe不可用时。

所有上传视频和分析输出存放在Amazon S3,按用户前缀实现多租户隔离。这三个服务只是起始集合,不是固定集合;智能体根据工具描述而非硬编码工作流逻辑选择工具,同一架构可以接受更多服务作为工具。

缓存让追问低于 1 秒,首次分析仍需 5–10 分钟

传统视频分析应用由开发者定义固定流水线:上传视频、运行转录、执行视觉分析、展示结果,所有视频都走同样步骤,用户要等整条流水线跑完才能提问。智能体方式把模型反过来:只做上传到S3的最少预处理,智能体对每个问题独立推理,只调用回答问题所需的服务。

用户提交查询后,智能体先解析意图——是要转录摘要、视觉搜索还是人脸匹配——再检查相关分析是否已缓存。如果没有,它选择合适工具并执行,某个工具的输出可以喂给下一个工具,最后合成自然语言答案。

博客称在其对 60 分钟视频的测试中,关于视频的第一个问题通常耗时 5–10 分钟(转录或视觉分析运行时),同一内容的后续问题因复用缓存结果可在 1 秒内返回。实际时间随视频长度、分辨率和调用的AWS服务而变化。

人脸匹配示例展示多步推理,不确定时明确说明置信度

博客用一个安全监控场景说明智能体如何串联多个工具调用:用户上传一张参考照片并问“这个人出现在我的监控录像里了吗?”智能体必须先把参考人脸索引,再在视频中搜索,两步存在依赖关系。

博客给出的内部推理轨迹显示,智能体先调用analyze_reference_image检测到 1 张人脸、置信度 99.8,再调用search_faces_in_video,返回两个匹配时间戳:00:14:32 置信度 97.2,00:47:15 置信度 94.8,最后用对话方式回答“这个人出现了两次”。博客强调没有应用代码定义这个顺序,是模型根据工具描述和用户问题推理出来的。

当结果模棱两可时,智能体会明确表达不确定性。博客举例说,置信度处于边界值(例如 62%)时,回答会带限定:“我在 14:32 找到一个可能匹配,但置信度低,你可能需要人工确认。”如果音频质量太差导致转录失败,智能体会建议替代方案:“音频质量太低,无法可靠转录。要我改试对演示幻灯片做视觉分析吗?”

对于全面分析,例如用户说“分析这个视频”或“总结这段录像”,智能体可以调用Bedrock Data Automation,一次异步API调用生成视频摘要、带时间戳的逐章分解和全文转录,而不是分别调用Rekognition和Transcribe。

客户自述 200 多段录像人工审阅时间减少约 80%,未经独立验证

博客称一家大型媒体和娱乐公司在AWS Professional Services合作项目中采用了这套方案。该公司的顾问可以查询已录制的发现会议内容,提取设计决策、行动项和利益相关者立场。

博客给出的结果是:在一批 200 多段、每段数小时的录像积压中,人工审阅时间减少约 80%。该数字基于客户内部对每段录像分析师小时数的前后对比,博客明确标注未获独立验证。

工具契约可扩展到视频之外,成本按调用的服务计

博客称这套架构并非视频专用:智能体根据docstring选择工具,因此增加新能力(甚至新模态)只需把另一个服务包装成 @tool函数并描述何时使用,无需改动工作流逻辑,同一个编排器、缓存和按用户隔离保持不变。

博客列举的扩展方向包括:用Amazon Textract工具从PDF架构图和工作文档中提取文本、表格和表单字段,与录像中说的话交叉引用;用AWS HealthScribe处理医患音频,返回结构化临床笔记(逐轮转录加主诉、治疗计划等提取章节),让用户能对录音问“建议了什么随访”;用Amazon Comprehend从转录中提取实体、关键短语和个人身份信息,或把Amazon Bedrock上的第三方模型以同样方式包装用于特定领域推理。

每次查询的成本取决于智能体调用了哪些AWS服务。初始分析(转录或视觉处理)之后,同一视频的后续问题只产生Amazon Bedrock推理费用,因为结果已缓存。博客给出的 60 分钟视频大致成本为:Amazon Transcribe 60分钟音频转录约 1.44 美元;Amazon Rekognition人脸搜索(60 分钟视频)约 6.00 美元;Amazon Rekognition标签检测(60 分钟视频)约 6.00 美元。

部署前提包括:拥有可访问Amazon Bedrock(需启用Anthropic Claude Sonnet)和Amazon S3的AWS账户;文档处理需要Amazon Bedrock Data Automation或Amazon Rekognition加Amazon Transcribe;Python 3.11或更高版本并安装Strands Agents SDK;配置好相应IAM权限的AWS CLI;以及对工具调用、推理循环等AI智能体概念的基本熟悉。

信息来源