亚马逊AWS提出图中心智能体AI方法,可将网络故障根因定位缩短至分钟级
亚马逊科学博客介绍了一种结合级联图算法与智能体编排的网络根因分析方法,并与NTT DOCOMO在MWC上演示了在商用网络上分钟级完成根因分析。
AI解读:AWS的科学家和解决方案架构师在亚马逊科学博客上发文,介绍了如何用智能体AI增强网络图,从而构建网络“数字孪生”来辅助隔离网络故障。文章的核心主张是:网络本身就是图结构,问题不是要不要用图表示网络,而是如何让AI智能体自主、自适应且快速地在这个结构上推理。
他们提出的方法把图算法和智能体AI结合起来:图算法提供拓扑分析的数学精确性,智能体层负责在不同故障场景下自适应地选择和组合算法。文章明确说明,传统网络运维中心处理复杂多层故障的平均修复时间是四到五个小时,有时延长到数天,瓶颈不是工程师的专业知识,而是认知过载。
这套流程分三步逐级缩小排查范围:先根据连接数量和强度做分解,把候选节点从数千个缩到数百个;再用社区发现算法聚类,缩到数十个;最后用中心性算法排序。关键创新在于所有中心性度量都是“相对于告警集”计算的,而非静态的全局度量。
智能体层会先查询事件知识库,如果告警模式匹配已知事件就直接套用补救措施;没有匹配时,先做复杂度分诊,再启动完整的图级联流程。级联产生排序列表后,智能体围绕候选节点构建故障子图,结合告警时间线、知识库和操作手册给出带置信度评分的根因判断,并自动开票或追加到已有工单,信息反馈给NOC用于持续学习。
文章还描述了未来的两个研究方向:渐进式自主权,即自主性需要通过预定义评估标准和影子模式结果来逐步获得,性能漂移时应降低允许的自主级别;以及自学习智能体,智能体从重复交互中识别可重复的解决模式,提议为候选技能,但必须经用户显式批准才能激活。
对真正相关的读者——网络运维团队——来说,这套方案把根因定位从数小时压缩到分钟级的演示结果值得跟踪,但文章没有提供误报率、大规模部署成本或与现有NOC流程集成的具体数据。是否需要立即行动取决于所在网络的多层复杂度和当前平均修复时间。
亚马逊科学博客发布文章,介绍了亚马逊云服务(AWS)研究人员提出的一种“图中心智能体智能”方法,用于让AI智能体在网络图结构上自主推理,并以网络根因分析作为验证场景。
文章称,该方法结合级联图算法与智能体编排,已与日本运营商NTT DOCOMO在今年的世界移动通信大会(MWC)上演示,在商用网络上实现了分钟级的根因分析。
文章同时指出,传统网络运维中心处理复杂多层故障的平均修复时间为四到五个小时,有时会延长到数天;瓶颈不在工程师的专业知识,而在认知过载——人无法比客户影响累积的速度更快地关联数千个节点上的数百条告警、配置文件和遥测数据。
图用于网络:从拓扑表示到智能体推理基板
文章梳理了图智能在网络研究中的演进路线。最早用图表示网络拓扑,是为了让运维人员能在数秒而非数小时内计算路径和隔离故障。知识图谱和本体增加了语义,定义了“小区”“SLA违约”“升级流程”等概念及其跨厂商、跨代际的关系,从而支持机器可读的运维和多厂商互操作。
随后,告警关联图编码了因果关系,通过沿图上溯把数万条原始告警压缩成一条因果链,但需要预定义的告警层级。依赖图消除了这一要求:从SDN和NFV控制器实时自动生成,可在30秒内以95%的准确率完成贝叶斯故障定位,无需手工规则。
因果子图进一步回答“为什么”:把实时告警转换为有向无环图,揭示关键性能指标的传播路径,给运维人员提供证据而非预测。图神经网络则能学到拓扑和因果结构无法显示的内容,包括隐藏的小区间依赖、失败节点停止上报时本应出现的数据模式,以及时空动态。
文章将上述进展描述为顺序性的科学进步,每一步解决前一步的局限,而今天它们正在融合:同一个网络可以同时表示为拓扑图、用本体语义增强、标注时序KPI,并由图神经网络推理,再通过一个智能体层协调,为每种故障模式选择正确的图工具。
根因分析:三级级联图算法如何缩小搜索空间
文章把根因分析作为图智能的天然验证场,指出传统方法依赖时间关联——如果告警A先于告警B,就推断A导致B。但在复杂拓扑中,故障会通过多条并行路径传播,轮询间隔让时序不清晰,真正的根因甚至可能不产生任何告警,这种启发式方法会失效。
为此,研究团队设计了三支柱方案:图建模、图中心分析和智能体编排。图建模把网络表示为持续同步的图,顶点是带属性的设备,边是连接,这个“数字孪生”从跨网段、跨层的多个数据源摄取网络依赖、实时告警和KPI。
图中心分析是一个三级级联,每级为下一级缩小搜索空间:第一级分解,根据连接数量和强度识别拓扑中连接最密集的部分,当故障切断链路导致网络分裂为不连通的子图时,立即将分析定位到边界节点,把候选集从数千个节点缩到数百个;第二级聚类,在受影响组件内用Louvain或标签传播等社区发现算法对频繁交互或共享依赖的节点分组,区分影响单个集群的故障和跨集群传播的故障,把候选从数百个缩到数十个;第三级中心性排序,用一套中心性算法对候选节点按根因可能性排序。
相对于告警集的中心性:三个算法的具体计算方式
文章强调,标准中心性算法衡量的是结构重要性,比如PageRank确定子图中最中心的节点,度中心性确定连接最多的节点,接近中心性确定离所有节点最近的节点,但这些答案是静态的,故障发生时不会改变。根因分析要回答的问题不同:相对于这次特定故障,哪个节点最重要?告警节点定义了参照系,每个中心性度量都必须相对于故障集重新计算,而不是针对全图。
个性化PageRank从发出告警的节点开始随机游走,排序结果集中在告警节点的共同祖先上,在层次化拓扑中向上追踪故障。
度中心性只计算到告警节点的边:一个有50条总连接但到告警节点为零的网关得分为零;一个有5条告警连接的交换机得分为5。这能识别星型拓扑或单中心节点子图的枢纽。
告警相对接近度只测量到告警节点的平均距离,几何中心变得无关紧要,最接近故障簇的节点排第一,适用于网状拓扑或每个节点都与其他节点相连的去中心化子图。
拓扑感知选择决定每次事件侧重哪个算法变体:智能体层根据度分布、直径和层次深度等图指标,把受影响的子图分类为层次化、星型或网状,然后选择相应的算法组合。文章也指出,真实网络很少只符合一种拓扑类型。
智能体编排与未来方向
智能体根据故障特征自适应地选择和组合图算法。第一步总是查询事件知识库:如果传入的告警模式以高置信度匹配已存储的事件,智能体直接采用规定的补救措施;没有匹配时,才调用完整的图驱动级联。调用级联前,智能体会做复杂度分诊,评估三个属性:受影响节点数量、这些节点在连通组件中的拓扑分布、故障签名的语义清晰度。
级联产生排序候选列表后,智能体从排名靠前的候选节点向外扩展二到三跳,构建故障子图。对每个候选,智能体查阅告警时间线、事件知识库和操作手册。最终的根因判定带有置信度评分,权重包括时序证据、拓扑模式匹配、中心性得分和关联告警数量。系统会自动开新工单或追加到已有工单,并把NOC反馈用于持续学习。管道还包含一个按需可用的AI助手,让网络工程师交互式查询数字孪生、探索替代假设或请求更深入的分析。
文章提出两个未来研究方向。一是渐进式自主权:自主性应当通过预定义评估标准和影子模式结果来获得,而不是默认授予;智能体可以从咨询建议进展到监督执行、在批准的护栏内做有界操作,最终对可逆、影响范围小的已知事件做端到端修复;性能漂移时应降低允许的自主级别。二是自学习智能体:智能体从跨会话的重复交互中学习,当解决模式被证明可重复时,识别底层流程并提议为候选技能;用户保留完整治理权,技能必须显式批准才能激活。
文章附带的鸣谢名单包括Dheeraj Oruganty、Pooja Chikkala、Yuki Miyazaki、Dai Kurosawa、Kazuma Iwamoto和Vijay Veggalam。作者Imen Grida Ben Yahya是AWS网络服务的首席应用科学家,拥有巴黎综合理工学院的博士学位,研究方向是应用于网络的认知技术;Nameet Dutia是AWS行业部门的高级解决方案架构师,在软件工程和机器学习交叉领域有超过18年经验。