研究NVIDIA Technical Blog·原文 2026年9月17日

NVIDIA TensorRT Edge-LLM在Jetson AGX Thor上跑完MLPerf边缘智能体基准,比llama.cpp快 6.4 倍

NVIDIA提交的Qwen3.6-27B在单台Jetson AGX Thor开发者套件上以 52.33 tokens/s完成 1007 轮性能负载,用时 24 分 36 秒,官方llama.cpp参考运行耗时 2 小时 37 分。

AI解读:NVIDIA用TensorRT Edge-LLM把Qwen3.6-27B塞进一台 128GB统一内存的Jetson AGX Thor,跑完MLPerf Edge Agentic性能负载只用了 24 分 36 秒,比同一平台上的llama.cpp参考运行快 6.4 倍。这项基准测的不是单轮问答,而是智能体连续调用工具、看结果、接着推理的多轮流程,输入长度会一路涨到约 23.5K tokens。

速度上来靠三件事凑在一起:NVFP4量化把权重和激活压到 4 位,KV缓存复用让约 96% 的prompt token直接命中缓存,树状多token预测在生成阶段一次验证多条候选路径。NVIDIA说相比 3 步线性MTP,树状MTP在这个负载上还能再快约 40%。

对在车、机器人、边缘盒子上部署智能体的人来说,这条结果的直接意义是:同样一台设备,原本要跑两个半小时的工程智能体轨迹,现在能在一杯咖啡的时间里跑完。但它是SingleStream、并发 1、温度 0 的受控配置,实际多用户并发能保留多少速度,得自己压测。

准确率没有给速度让路太多:BFCL v4整体准确率 87.94%,首token中位延迟 247.12ms,每输出token中位耗时 14.68ms。基准同时用IoU内联准确率确保性能阶段没有跑偏。

代码在TensorRT Edge-LLM的release/0.9.1-mlpinf分支上,NVIDIA还给了已校准的NVFP4 checkpoint和完整命令行步骤。想在Jetson AGX Thor上复现的人可以直接从这条分支开始,不用自己先做量化。

NVIDIA在MLPerf Inference v6.1的Edge Agentic基准中,用TensorRT Edge-LLM在单台Jetson AGX Thor开发者套件上运行Qwen3.6-27B,输出吞吐达到 52.33 tokens/s,完成全部 1007 轮性能负载用时 24 分 36 秒。

同一基准的llama.cpp参考提交在同一平台上用Qwen3.6-27B加Q4_K_M量化,用时 2 小时 37 分钟。NVIDIA提交的端到端时间比它少 6.4 倍。

测试配置为SingleStream模式、单台 128GB统一内存的Jetson AGX Thor开发者套件、MAXN功耗模式。首token中位延迟 247.12ms,每输出token中位耗时 14.68ms,BFCL整体准确率 87.94%。

MLPerf Edge Agentic怎么测

MLPerf Edge Agentic针对OpenAI兼容的模型端点测两个阶段:性能和准确率。性能阶段回放已录制的软件工程智能体轨迹——模型收到用户请求、生成工具调用、观察工具返回结果,并在同一段对话里继续推理。

性能负载包含 20 段对话、1007 个生成轮次,输入长度随轮次增长,最高约 23.5K tokens,因此长上下文处理是这项测量的重要部分。基准还测量基于IoU的内联准确率,确保性能阶段是在正确运行智能体。

准确率阶段使用Berkeley Function Calling Leaderboard(BFCL)v4的prompt,仅单轮、关闭推理,以在边缘设备上平衡准确率和评估耗时。它检查模型是否选中正确函数、生成合法参数,以及在没有工具需求时是否避免调用工具。

NVFP4量化与KV缓存复用

边缘平台上的低批量LLM解码已知严重受DRAM带宽限制。缩小权重和激活的尺寸会减少内核的内存占用,从而提升解码性能。提交的Qwen3.6-27B对权重和激活(包括语言模型头)使用NVFP4,KV缓存使用FP8。NVFP4是Jetson AGX Thor中NVIDIA Blackwell GPU支持的 4 位浮点格式。

更小的模型表示也把 128GB统一内存里更多的空间留给长上下文、推测解码状态和应用负载。开发者可以从已发布、已校准的Qwen3.6-27B NVFP4 checkpoint开始,或先在任何开发系统上做一次训练后量化再部署。

智能体轨迹中的每个新请求都包含此前对话的大部分内容外加一次新的模型回复或工具结果。不做复用的话,模型每轮都要重新预填充共享历史。TensorRT Edge-LLM会识别可复用的prompt前缀并恢复其缓存的注意力KV页;由于Qwen3.6采用混合模型架构,运行时还会恢复继续正确执行所需的循环状态和部分KV页状态,然后只预填充对话的新后缀。

在这个负载上,约 96% 的prompt token由热缓存提供,运行时在全部 13.6M prompt tokens中只预填充了约 0.5M。

树状多token预测带来额外约 40% 解码增益

标准自回归解码每次模型调用只生成一个token。多token预测用草稿模型预测未来若干token,再由目标模型一并验证。TensorRT Edge-LLM除传统线性MTP外还实现了树状MTP:运行时把高概率候选组织成一棵树,目标模型在一次前向传播中验证这些候选,运行时接受匹配路径;如果多个候选被接受,生成就会一次前进多个token。

MLPerf服务器配置使用 8 个草稿步、每个草稿深度取前 2 个候选、16 节点验证树。NVIDIA称,相比 3 个草稿步的线性MTP,树状MTP在这个负载上可额外获得约 40% 的解码性能提升。

树状验证对函数调用有用,因为工具名、JSON语法和常见参数结构往往可预测,而多个分支能为单个参数值保留可能的备选。

复现路径

本次提交所用的实现位于TensorRT Edge-LLM的release/0.9.1-mlpinf分支,包含模型导出设置、TensorRT引擎构建命令、服务器配置和MLPerf客户端配置。

步骤包括:克隆TensorRT Edge-LLM并初始化子模块;用huggingface-cli下载centml/Qwen3.6-27B-NVFP4-W4A4-mlpinf校准checkpoint;按mlperf/README.md构建TensorRT Edge-LLM、用tree-MTP接口导出checkpoint并构建基础与草稿TensorRT引擎;启动OpenAI兼容的TensorRT Edge-LLM服务器;克隆MLCommons endpoint harness、安装BFCL依赖、在mlperf/config.yaml中更新模型和tokenizer路径后运行基准。

提供的配置以温度 0、seed 42、关闭推理、并发 1 运行性能和准确率两个阶段;使用 --accuracy-only选项可只运行BFCL准确率阶段。

信息来源