开源llama.cpp Releases·原文 2026年9月22日本站收录 2026年9月23日

llama.cpp b11104让llama-server支持绑定多个地址

该版本由Xuan Son Nguyen等人提交,#28690 合并后llama-server可同时监听多个地址;多TCP地址时以 --port 0启动会被拒绝。

AI解读:llama.cpp发布b11104版本,核心变化是给llama-server加上绑定多个地址的能力,对应PR #28690。这对需要让同一台llama-server同时对外网、内网或不同网卡提供服务的部署场景很直接:以前通常要起多个进程或靠反向代理转发,现在一个进程就能监听多个地址。

改动里带了几个边界规则:提交记录明确写了“拒绝 --port 0与多个TCP地址组合”,并强调要弄清楚地址重叠的情况。也就是说多地址不是无脑叠加,端口分配和地址冲突需要自己确认。

提交记录里还提到Assisted-by: Codex,说明这次改动有AI编码助手参与。配合b11104照例放出macOS、Linux、Windows、Android等多平台预编译包,普通用户升级即用;真正受影响的主要是自建推理服务的运维和开发者。

llama.cpp发布b11104版本,此版本合并PR #28690,为llama-server增加绑定多个地址(binding to multiple addresses)的能力。

根据发布说明与提交记录,该改动会明确处理地址重叠(overlapping addr)的情况,并拒绝 --port 0与多个TCP地址同时使用(reject --port 0 with multiple tcp addr)。

提交记录署名Assisted-by: Codex,Co-authored-by: Xuan Son Nguyen;同时该版本照例提供各平台预编译产物。

改动包含的具体细节

PR描述中列出的提交要点包括:添加llama-server绑定多个地址的支持、移除多余的线程处理器(remove redundant thread handler)、明确重叠地址的处理、改进参数处理器(arg handler),以及修复测试。

对于绑定多地址时端口号的使用,提交记录给出的限制是:当使用多个TCP地址时,--port 0会被拒绝。

  • 支持llama-server绑定多个地址(#28690)
  • 移除冗余线程处理器
  • 对重叠地址给出明确说明
  • 多TCP地址时拒绝 --port 0
  • 改进参数处理器并修复测试
  • 提交署名Assisted-by: Codex,Co-authored-by: Xuan Son Nguyen

b11104提供的预编译包

该版本发布提供macOS/iOS、Linux、Android、Windows以及UI的预编译产物,涵盖CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL FP32/FP16、OpenCL Adreno、Snapdragon(CPU、Adreno GPU、Hexagon NPU)等构建。

发布页还标注了若干当前被禁用的平台支持:macOS Apple Silicon的KleidiAI构建显示为DISABLED,对应PR #23780;openEuler的x86/aarch64相关构建同样显示为DISABLED,对应PR #23705。

  • macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework
  • Ubuntu x64/arm64/s390x CPU、Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL
  • Linux arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)与Android arm64对应版本
  • Windows x64/arm64 CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm 10.0
  • UI包
  • KleidiAI版macOS构建与openEuler构建当前为DISABLED

信息来源

llama.cpp Releases原始来源