Ollama发布v0.34.1-rc1:MLX显存调度收紧,重复token上限提至 100
候选版本更新集中在mlxrunner的内存与缓存管理、llm的重复token报错行为、gemma3n投影层去CPU化,以及应用层的小幅UI调整,并同步了MLX与llama.cpp上游。
Ollama发布v0.34.1-rc1,作为v0.34.0之后的候选补丁版本,改动列表由GitHub Releases页面给出。
mlxrunner部分有两项内存相关调整:把前缀缓存快照从当前对话中淘汰;在加载下一个MLX模型前检查系统空闲内存,并等待已被淘汰的runner退出。
llm部分把重复token上限提高到 100,并在触发时返回错误,而不是返回不完整结果;同时让gemma3n的投影层不跑在CPU上。
应用层修复了ChatGPT模型选择器的间距,刷新了Apps布局与命令复制反馈;发布说明还提到MLX和llama.cpp的更新。
完整改动对比由发布说明指向v0.34.0与v0.34.1-rc1之间的changelog链接。