开源onnxruntime Releases·原文 2026年9月10日

ONNX Runtime发布v1.29.1补丁版,新增双向GroupQueryAttention支持

该补丁版在v1.29.0基础上改进GroupQueryAttention能力与KV-cache布局,更新插件Execution Provider性能工具,并修复图谱与优化器问题。

AI解读:这是一次小版本修补,主要围绕注意力机制和KV缓存布局做改动,同时带上几个针对性修复。

受影响最大的是用ONNX Runtime跑大模型推理、尤其是自定义注意力实现和插件式加速器的开发者:CPU和CUDA现在可以通过一个向后兼容的causal属性走双向GroupQueryAttention,缓存布局也多了一条BNHS选项。

这些改动不承诺具体性能数字,需要在自己的模型和图谱上验证;普通用户不必立即行动。

ONNX Runtime发布v1.29.1,这是基于v1.29.0的补丁版本,包含GroupQueryAttention能力与KV-cache布局改进、插件Execution Provider性能工具更新,以及针对性的图谱与优化器修复。

在GroupQueryAttention方面,该版本通过向后兼容的causal属性,为CPU和CUDA增加了双向GroupQueryAttention支持,并对不支持的执行路径做显式处理(#31704)。

KV-cache布局与attention_bias支持

该版本新增了一项session选项和Execution Provider元数据约定,用于使用BNHS Value KV-cache布局,并通过图变换保持与现有BNSH算子schema的兼容(#32139)。

CPU侧新增对attention_bias配合滑动窗口KV cache的支持,包括显式position IDs和逐出后的bias索引(#32302)。

性能工具与修复

运行时与性能工具方面,修复了Compile API在同时使用输出模型回调和自定义initializer位置回调时的模型序列化问题,避免生成的模型出现重复图字段(#32303)。

onnxruntime_perf_test更新为使用插件Execution Provider的设备分配器处理生成的输入、加载的测试数据和预分配输出,避免每次运行产生不必要的host/device拷贝(#32244)。

缺陷修复与文档

该版本加固FastGelu融合,跳过格式错误的Mul和Pow模式(#32016);为内存内外置initializer引用增加校验,在图变换前拒绝未注册或不匹配的数据(#32042);并通过将固定版本的Doxygen下载切换为官方GitHub release资产,恢复C API文档工作流(#32210)。

该版本共有 7 位贡献者。发布说明注明,发布要点由AI辅助起草,并经过发布团队审核。

信息来源