产品NVIDIA Technical Blog·原文 2026年10月2日

NVIDIA发布TensorRT RTX C++本地AI示例集DIN Deploy

Do Inference Now Deploy用ONNX Runtime加TensorRT RTX执行提供程序,把Hugging Face模型检查点导出为ONNX,再跑进Windows、Linux和Arm64原生C++应用,覆盖语音识别、SAM 2.1分割和FLUX.2图像生成。

AI解读:NVIDIA技术博客介绍了开源C++示例集Do Inference Now (DIN) Deploy,它想解决的是把AI模型塞进本地应用时模型格式、运行时和跨平台加速这三件事各自为政的问题。做法是让Python导出器负责从Hugging Face下载检查点并转ONNX,C++侧只用ONNX Runtime的会话和张量API,厂商相关代码(CUDA API和kernel)只出现在可选的加速路径里。

对写原生应用的人来说,实际收益是模型转换和部署逻辑被拆开,导出的模型不用再依赖某个模型专属的运行时;只要执行提供程序支持所需的ONNX Runtime张量API,同一份共享代码就能跑。不过这不是一个开箱即用的产品,而是需要自己配置和编译的示例仓库。

示例覆盖的任务不算少:离线与流式语音识别用了OpenAI Whisper、NVIDIA Parakeet TDT和Nemotron ASR Streaming,Meta SAM 2.1负责图像和视频的交互式掩码,FLUX.2-klein-4B做提示词驱动的图像生成,后者还演示了用NVIDIA Model Optimizer做训练后量化,量化后的ONNX模型可以直接替换、不用改应用代码。

仓库提供Windows和Linux的CMake预设,包括Arm64变体,DirectX只在Windows可用。NVIDIA给出DGX Spark上的对比数据:whisper-large-v3-turbo为 58.5 倍实时对 3.8 倍,parakeet-tdt-0.6b-v3为 206.41 倍对 14.44 倍,sam2.1-hiera-base-plus为 38.3 FPS对 0.5 FPS。这些是官方在单一平台测出的数字,不能直接外推到其他硬件。

NVIDIA技术博客发布开源C++示例集Do Inference Now (DIN) Deploy,用ONNX Runtime搭配NVIDIA TensorRT RTX执行提供程序,帮助开发者把模型检查点变成Windows和Linux上原生、硬件加速的应用,原文作者为Luca Spindler。

每个DIN Deploy示例都从一个Python导出器开始:它从Hugging Face下载模型检查点并转成ONNX产物;应用侧是构建在ONNX Runtime之上的原生C++ CLI。这种拆分把模型转换与部署逻辑分开,导出的模型进入本地应用时不需要模型专属运行时。

大部分示例代码使用C++的ONNX Runtime会话和张量API,CUDA API和kernel等厂商相关代码只出现在可选的加速路径中。支持所需ONNX Runtime张量API的执行提供程序都能运行这套共享代码;ORT的copy tensor API让数据局部性可管理,共享代码中不必使用厂商专属API。

DIN Deploy支持的任务与加速数据

语音识别方面,DIN Deploy支持离线和流式流水线:OpenAI Whisper覆盖多种模型尺寸的离线转写,NVIDIA Parakeet TDT和NVIDIA Nemotron ASR Streaming提供流式流水线,示例演示音频如何流经原生应用并在可用时使用GPU加速返回转写结果。

Meta SAM 2.1示例支持图像和视频的交互式掩码,把模型输出转成原生应用可用于选择、跟踪等计算机视觉工作流的掩码。

FLUX.2-klein-4B示例提供提示词驱动的图像生成,集成了Vulkan和DirectX的图形API互操作,让应用能把GPU驻留资源与跨厂商着色器接口结合;它还用NVIDIA Model Optimizer做训练后量化(PTQ)生成量化ONNX模型。量化依赖硬件,但由于ONNX接口保持不变,量化模型是可直接替换的,不需要修改应用代码。

  • DGX Spark上whisper-large-v3-turbo的GPU为 58.5 倍实时,CPU为 3.8 倍实时
  • nemotron-3.5-asr-streaming-0.6b的GPU为 39.01 倍实时,CPU为 3.24 倍实时
  • parakeet-tdt-0.6b-v3的GPU为 206.41 倍实时,CPU为 14.44 倍实时
  • sam2.1-hiera-base-plus的GPU为 38.3 FPS,CPU为 0.5 FPS(NVIDIA表格数据,音频数值越高越快)

从CMake预设到运行CLI

仓库提供Windows、Linux以及x86-64、Arm64的CMake预设。配置并构建项目后,可把模型导出为ONNX,用TensorRT RTX运行CLI,或把代码复制进自己的应用使用流水线实现。CMake默认会下载ONNX Runtime和TensorRT RTX。

FLUX.2示例在预处理和后处理环节使用ONNX Runtime 1.25引入的图形互操作能力,采样时走Vulkan和DirectX;DirectX仅在Windows可用。

  • 支持平台:Windows、Linux,含Arm64变体
  • DirectX图形互操作仅限Windows
  • 默认自动下载ONNX Runtime和TensorRT RTX
  • 图形互操作能力需要ONNX Runtime 1.25

信息来源