新版本通过权重解包复用与双子组激活复用,提升SYCL上Q4_K量化模型的推理效率,并提供大量平台的预编译二进制。
阅读全文开源项目
关注开放的模型、工具与代码,找到值得动手的项目。
llama.cpp b10776发布:新增NVIDIA Nemotron-3-Puzzle-75B-A9B模型支持
该版本通过按层存储专家FFN大小和top-k值,支持具有 5 种不同FFN扩展和 7 种top-k的混合专家模型,并适配官方BF16检查点。
阅读全文llama.cpp发布b10775,修复Idefics3图像预处理问题
新版本为macOS、Linux、Windows和Android提供二进制包,并包含一处mtmd模块中的idefics3预处理修复。
阅读全文llama.cpp发布b10774:修复训练无KV缓存问题
新版本主要修复微调(finetune)在没有KV缓存时的训练错误,并更新了各平台的二进制包。
OpenAI Codex 0.153.0发布:Vim模式支持撤销与重做,新增远程插件市场管理
Codex 0.153.0为TUI增加Vim撤销/重做、自动重述开关和更完整的历史视图,并允许通过CLI管理远程市场插件。
llama.cpp b10773:服务器端支持通过data: URL传入视频和音频
llama.cpp发布b10773,修复input_video和input_audio无法使用data: URL的问题,错误返回码从 500 修正为 400。
ONNX Runtime发布v1.28.2补丁,修复Compile API模型序列化重复节点问题
微软发布ONNX Runtime v1.28.2补丁版本,针对Compile API回调序列化进行修复,避免优化模型中出现重复图节点、输入、输出及值信息。
llama.cpp b10772发布:Hexagon HTP后端新增F16精度ABS支持
ggml-hexagon的HTP后端扩展F16一元运算覆盖范围,新增ABS运算,并在设备端通过 8/8 项测试。
OpenAI Codex发布 0.153.0-alpha.5.1版本
该版本为Rust实现的Codex CLI的预发布版本,仅提供版本号信息,未附带更新说明。
llama.cpp b10771发布:为mtmd新增mtmd_tokenize_from_parts() 函数
新版本通过拆分tokenize调用位置和剥离特殊token添加逻辑,重构了mtmd处理流程,并同步提供各平台安装包。
llama.cpp发布b10770:为Apple M3芯片加入Metal fa-vec调优
新版本主要面向macOS/iOS,在Metal后端为M3芯片添加fa-vec优化,并同步提供各平台二进制包。
开源复现“水彩代码模型”:用TRL与OpenEnv训练绘画智能体,全部产物公开
Hugging Face工程师在开源博客中发布了一份完整复现指南,用TRL与OpenEnv训练语言模型生成p5.brush水彩画代码,包含数据集、环境、脚本与模型。
350M参数模型经 100 步GRPO微调,结构化输出准确率提升 7 个百分点
Hugging Face发布公开低成本微调方案:用约 500 样本和 100 训练步,将LFM2.5-350M在IFStruct基准上的通过率从 22.6% 提升至 29.7%。
llama.cpp b10769发布:修复Apple Metal后端低内存条件下的内存查询
该版本主要包含一个针对Metal后端的修复,改进低内存环境下的内存查询逻辑,并同步更新各平台预编译二进制。
llama.cpp发布b10767:ROCm升级至 10.0.0,新增Windows ROCm与CUDA 13支持
此次更新将ROCm支持升级至 10.0.0,并为Windows用户新增ROCm 10.0二进制,同时提供CUDA 13.3/13.4版本。
Claude Code v2.1.259:新增托管MCP服务器设置与无人值守权限控制
Claude Code发布v2.1.259,新增 `managedMcpServers` 组织级配置和 `--permission-prompts none` 选项,并修复了并发会话状态覆盖、Bash读写规则绕过等多项问题。
GitHub Podcast解读AI新术语:循环工程、小队、马具、爬山算法等
GitHub开发者倡导高级总监Cassidy Williams在最新一期播客中,与嘉宾一起梳理了开发者圈涌现的AI新词汇,并解释了它们背后的工程实践。

llama.cpp b10766发布:修复DeepSeek4视觉输入支持
该版本主要修复了DeepSeek4模型对图像输入的处理问题,并更新了各平台的预编译二进制文件。
llama.cpp发布b10764:清理CUDA未用变量,同步更新各平台预编译包
新版本主要包含一项ggml-cuda代码清理改动,同时为macOS、Linux、Windows、Android等平台提供预编译产物。
llama.cpp b10763默认启用preserve_reasoning,弃用 --chat-template-kwargs设置方式
新版本将推理内容保留开关改为默认开启,并增加日志提示,同时弃用通过 --chat-template-kwargs传递该参数的旧方法。
llama.cpp b10762发布:新增DeepSeek-V4-Flash-Vision-Exp多模态支持
该版本通过mtmd架构支持DeepSeek-V4-Flash-Vision-Exp模型,附带多项后台优化,并更新了全平台预编译包。
GitHub详解Copilot成本优化:缩短单个输出可能让整个任务更贵
GitHub官方博客介绍四项降低Copilot编码成本的具体改动,并指出单次工具调用token数不是衡量效率的合适指标。
python-genai 2.22.0发布:新增Gemini 3.8 Flash模型支持
Google的python-genai SDK更新至 2.22.0,添加Gemini 3.8 Flash模型并更新相关描述。
PyTorch 2.14.0发布:新增NVGEMM、torch.switch,多处API破坏性变更
PyTorch 2.14.0带来NVGEMM、torch.switch和动态形状声明等新特性,同时移除torch.cholesky等旧API,并调整clamp梯度边界行为。
llm-gemini 0.34发布:支持Gemini 3.8 Flash,提供低/中/高三档思考级别
新插件版加入gemini-3.8-flash模型,并修复异步响应未记录解析模型版本的问题。
OpenAI Codex发布 0.153.0-alpha.6版本
该版本为代号rust-v0.153.0-alpha.6的预发布版,未提供具体更新说明。
llama.cpp b10760发布:修复Qwen3-TTS-0.6B代码预测器在F16下的精度崩溃
新版本将Qwen3-TTS-0.6B的code predictor FFN中间层权重保持在F32,避免激活峰值超过F16上限导致输出变为无穷或NaN,并修正了权重加载逻辑。
llama.cpp发布b10759:修复KleidiAI调度时的缓冲区类型初始化问题
新版本默认提供macOS Apple Silicon (arm64) 构建,但启用KleidiAI的构建因相关PR被禁用;同时为Ubuntu s390x、Windows ARM64 CUDA预览版等提供实验性支持。
llama.cpp b10758发布:Hexagon后端融合QKV/FFN矩阵乘法并修复
新版聚焦Qualcomm Hexagon后端:将落在HMX上的QKV与FFN matmul融合,并移除硬编码的ne[1];同步提供多平台二进制。
llama.cpp b10757发布:Vulkan后端优化IQ3_S量化大batch矩阵-向量乘法
新版本在NUM_COLS > 4 时启用更高效的IQ3_S矩阵-向量kernel,n=8 批大小下性能提升达 5 倍。