llama.cpp b11400支持批处理中同时使用嵌入向量与原始token
该版本合并PR #29622,在batch中同时支持embd和raw tokens,并新增对llm_arch_supports_mixed_batch=false情况的检查,同时提供多平台预编译包。
AI解读:变更清单包括:为test-llama-archs增加相关测试、检查llm_arch_supports_mixed_batch = false的情况、采用固定图拓扑、为混合情况设置专用输入、移除set_tensor_backend、将is_embd改为type,并把m-rope位置处理合并到一处。
该Release按平台列出预编译产物,覆盖macOS/iOS、Linux、Android、Windows和openEuler;其中macOS Apple Silicon的KleidiAI版本和openEuler项标注为DISABLED。
Linux构建覆盖Ubuntu x64/arm64/s390x的CPU版本,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16等后端;Android和Windows也提供多种后端变体。
llama.cpp发布b11400版本,合并PR #29622,使batch中可以同时使用嵌入向量(embd)与原始token。
发布说明同时列出了该PR的配套改动,包括新增测试、架构能力检查以及多项内部重构。
PR #29622 的改动内容
Release说明显示,PR #29622 的主干改动是让llama在同一个batch中同时支持embd和raw tokens。
同一批改动还包括:将相关用例加入test-llama-archs;检查llm_arch_supports_mixed_batch = false的情况;采用constant graph topology;为混合情况设置专用输入;移除set_tensor_backend;将is_embd改为type;把m-rope位置处理合并到一处,以及若干细节修正。
随版本提供的构建产物
b11400按平台提供预编译包。macOS/iOS方向包含macOS Apple Silicon (arm64)、macOS Intel (x64) 和iOS XCFramework;其中macOS Apple Silicon的KleidiAI enabled版本标注为DISABLED。
Linux方向包含Ubuntu x64、arm64、s390x的CPU构建,以及Ubuntu x64/arm64的Vulkan、Ubuntu x64的CUDA 12.8与CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32与SYCL FP16构建,另有Linux arm64的Snapdragon构建(CPU、Adreno GPU、Hexagon NPU)。
Android方向提供arm64 CPU与arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)构建。Windows方向提供x64/arm64 CPU、arm64 OpenCL Adreno,以及Windows x64的CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0和Windows arm64的CUDA 13.4、Vulkan构建。openEuler方向列出x86 310p、x86 910b (ACL Graph)、aarch64 310p、aarch64 910b (ACL Graph),均标注为DISABLED。此外还提供UI包。