该补丁修复了引入Inkling模型后出现的几个问题,包括辅助生成与预填充阶段的缓存和位置偏置相关缺陷。
阅读全文开源项目
关注开放的模型、工具与代码,找到值得动手的项目。
Transformers v5.14发布,加入Inkling模型适配
新版本新增Thinking Machines的Inkling模型支持,并合并多项社区贡献。
阅读全文vLLM发布v0.25.1补丁:修复FFmpeg缺失导致的启动阻塞及混合精度RMSNorm量化融合错误
vLLM v0.25.1作为v0.25.0的补丁版本,包含两项针对性bug修复:系统缺少FFmpeg时TorchCodec不再阻塞模型启动;混合精度(如BF16激活与FP32权重)的allreduce+RMSNorm+量化融合路径被引导至安全路径,避免输出乱码。
阅读全文SGLang发布v0.5.15.post1补丁版本,主要修复GLM 5.2相关功能
该补丁版本主要修复GLM 5.2在PD分离和上下文并行设置下的IndexShare问题,以及若干非CUDA/HIP设备启动和FP4 MoE内核NaN输出问题。
vLLM v0.25.0发布:MRv2成为所有稠密模型默认执行路径,删除PagedAttention
新版本包含 558 个提交,新增LLaVA-OneVision-2、Unlimited OCR等模型,Transformers后端性能追平原生vLLM,并强化流式解析引擎。
Hugging Face发布Transformers v5.13.1补丁,兼容最新版vLLM
该补丁修复了自定义模型代码与新线性层类型命名不兼容等问题,以确保transformers能配合最新版vLLM运行。
Transformers v5.13发布,扩展Kimi K2.5、K2.6与K2.7
新版本增加多代Kimi K系列模型支持,并完善相应配置与推理代码。
LlamaIndex发布v0.14.23:新增多模态查询引擎与文档块支持
核心库llama-index-core 0.14.23引入多模态合成与多模态查询引擎,并修复多项分割器递归错误及元数据过滤问题。
Hugging Face Transformers v5.12.0发布:新增MiniMax-M3-VL、PP-OCRv6与Parakeet-RNNT模型支持
该版本由社区贡献者推动,主要扩充了多模态视觉语言模型、轻量级OCR系统和语音识别模型,并包含多项bug修复与CI改进。
Transformers v5.11发布,新增DiffusionGemma支持
新版本加入DiffusionGemma等模型架构,并更新生成与推理相关实现。
Transformers v5.10.1修复发布分支问题
v5.10.0因发布分支损坏被撤回,维护团队随后发布v5.10.1修复版本。
Transformers v5.9发布,加入Cohere2MoE Command A+
新版本新增Cohere2MoE Command A+等模型架构支持,并继续完善推理兼容性。
LlamaIndex发布v0.14.22:核心库新增多模态合成功能
此次更新为llama-index-core引入实验性多模态合成能力,并修复多项与缓存、内存及事件处理相关的问题。
Transformers v5.8发布,新增DeepSeek-V4支持
新版本加入DeepSeek-V4等模型适配,并更新多项模型加载与推理能力。
Transformers v5.7发布,新增Laguna等模型支持
新版本扩展了模型架构支持,并补充相关加载、推理与兼容性实现。
NVIDIA NeMo发布 2.7.3 补丁版:修复安全问题并移除实验性组件
NVIDIA于 2 月 5 日发布NeMo 2.7.3,主要修复已知安全漏洞,同时移除实验性sclite文件和import_hf.py中废弃参数;该版本基于r2.7.0分支。
LlamaIndex v0.14.21:核心库修复文档删除与结构化输出错误,NVIDIA嵌入新增HTTP客户端
2026 年 4 月 21 日发布,修复DocumentSummaryIndex删除节点KeyError、结构化输出异常及UTF-8编码问题。
NVIDIA NeMo语音工具包发布 2.7.2,修复numba-cuda与cuda-python安装问题
NVIDIA于 2025 年发布NeMo Speech 2.7.2补丁版本,修复numba-cuda和cuda-python的安装及使用问题。
NVIDIA NeMo发布 2.7.1,修复CUDA图中cuda-python用法
修复由 @ko3n1g提出的ASR组件问题,对应PR #15471
NVIDIA NeMo 2.7.0发布:新增流式语音翻译与逐流短语增强,未来版本将专注语音任务
NVIDIA发布NeMo 2.7.0,新增逐流短语增强(Per-Stream Phrase Boosting)和流式语音翻译支持,并发布了两款新模型;同时宣布 2.8.0 起移除LLM、NLP等集合,仓库将只保留语音相关任务。
NVIDIA发布NeMo 2.6.2,修复已知安全问题并收紧PyTorch权重加载配置
该版本移除了weights_only=False并明确要求torch>=2.6.0,同时更新了音频Notebook中的SDE教程与导入。
百度开源ERNIE-4.5-VL-28B-A3B-Thinking多模态模型,3B激活参数支持图像思考与工具调用
模型采用MoE架构,仅激活30亿参数,在视觉推理、STEM推理等任务上接近旗舰模型表现,并新增Think with Image模式,可自主调用图像放大与搜索工具。

DeepSeek-V3发布v1.0.0存档版本,用于DOI生成
该版本仅为存档和DOI生成而创建,不包含新的代码或功能更新。
Meta发布llama-models v0.2.0,新增Llama 4支持
该版本在模型工具包中增加了对Llama 4系列的支持,面向开发者和研究人员。
Mistral推理库v1.6.0发布:新增Mistral Small 3.1视觉模型支持
mistral-inference发布v1.6.0版本,核心变化是加入对Mistral Small 3.1的支持,该模型具备视觉能力。
Meta发布llama-models v0.1.4:修复工具调用编码问题
新版本修复了非代码解释器工具调用的编码问题,以及工具调用未被正确编码的缺陷。
Meta Llama模型库发布v0.1.3:Llama Stack类型定义迁移至llama-stack仓库
新版本主要将代码库中所有Llama Stack类型定义移至独立的llama-stack仓库,具体变更内容尚未完全公布。
Meta发布llama-models v0.1.0,配套llama-stack首个版本
Meta在GitHub上发布了llama-models的v0.1.0版本,该版本紧随llama-stack v0.1.0的发布。
Mistral Inference发布v1.4.0,Pixtral 12B模型新增图像输入支持
该版本允许开发者通过CLI或Python API向Mistral模型传入零个或多个图像,并结合文本prompt进行多模态对话。
Mistral与NVIDIA联合模型Mistral-Nemo登陆mistral-inference v1.3.0,Apache 2.0许可开放下载
mistral-inference v1.3.0发布,新增对12B参数Mistral-Nemo-Instruct-2407的支持,支持聊天与函数调用,模型以Apache 2.0许可发布。