网易首页 > 网易号 > 正文 申请入驻

ollama v0.32.3发布:模型下载卡顿修复、Windows ARM64 CUDA支持、Laguna工具调用全面升级

0
分享至




2026年7月24日,ollama 发布 v0.32.3 版本。本次更新覆盖模型下载、模型集成、GPU 支持、推理引擎、工具调用、聊天能力、命令行与终端交互等多个方面。

从更新内容来看,v0.32.3 的核心方向非常明确:一方面修复影响实际使用体验的问题,例如模型下载在尚未接收数据前发生停滞、GLM 工具调用在生成结尾被静默丢弃等;另一方面持续扩大硬件与模型兼容范围,包括 Windows ARM64 平台 CUDA 支持、通过 CUDA 12 支持 B200、Linux CUDA 与 ROCm 集成显卡降低内存使用,以及 Laguna 2.1 模型的聊天、思考和工具调用能力支持。

此外,Claude Code Channels、Anthropic thinking 流、Hermes Desktop、MLX、llama.cpp 等相关集成与引擎也都迎来调整。对于本地模型部署、终端 AI 助手、模型工具调用以及多平台 GPU 推理场景而言,这是一次兼顾稳定性、兼容性与体验的版本更新。

版本信息

  • • 版本号:v0.32.3

  • • 发布时间:2026年7月24日

  • • 提交数量:29

  • • 参与贡献者:6

  • • 变更文件数量:107

本次版本的更新并非单一功能的增加,而是围绕模型运行链路进行了一系列优化。无论是下载模型、选择推理硬件、调用工具,还是使用聊天和思考能力,多个关键环节都获得了修复或增强。

一、模型下载卡在开始阶段的问题得到修复

v0.32.3 修复了模型下载在尚未发送任何数据之前发生停滞的问题。

模型下载是使用 ollama 的基础流程之一。用户在拉取模型时,如果下载任务长时间没有开始传输数据,往往很难判断是网络问题、服务端问题还是客户端任务已经卡住。此次更新针对“首字节到来之前”的下载停滞场景进行了处理。

对应的改动包括对下载停滞的检测优化,重点是识别模型下载在第一段数据到达之前的异常等待状态。

这一修复的重要性在于,模型下载通常是后续运行、测试、部署的前提。下载任务在开始阶段停滞,会直接阻断模型使用流程。v0.32.3 对这一问题的修复,提升了模型拉取环节的稳定性与可用性。

二、Claude Code Channels 恢复可用,集成能力进一步完善

本次更新恢复了 Claude Code Channels 的可用性。

更新记录中包含“保持 Claude Code channels 可用”的调整,意味着此前相关 Channels 在启动或使用过程中可能存在不可用、无法保留或被移除的情况。v0.32.3 对这一能力进行了恢复,使其重新能够正常使用。

对于依赖 Claude Code 相关工作流的用户而言,这项修复能够避免因 Channels 状态异常造成的功能中断。

与此同时,版本中还移除了无效的 agent 提示词包装逻辑,并对 agent 相关指令、流程代码、用户体验与开发体验进行了整理。这些调整虽然更多体现在内部结构和交互流程上,但也表明 v0.32.3 持续在简化不再需要的逻辑,减少冗余结构,并优化终端与 agent 使用过程中的行为一致性。

三、Anthropic thinking 流修复,思考内容与文本输出顺序更准确

v0.32.3 修复了 Anthropic thinking 流相关问题。

更新内容显示,本次调整包括在启动 thinking 块之前先关闭文本块。这个变化看似是输出结构层面的细节,但对于流式响应而言非常关键。

当模型同时输出普通文本与思考内容时,输出块之间需要具备清晰、正确的边界。如果文本块没有结束就开始思考块,可能导致流解析、前端渲染或下游调用处理出现异常。通过在开始 thinking 块前关闭文本块,v0.32.3 改善了文本内容与思考内容之间的切换过程。

这项修复能够让 Anthropic thinking 流在输出时具备更正确的块结构,避免不同类型内容在流式过程中发生边界混乱。

四、Hermes Desktop 现在能够正确遵守 force-build 参数

本次版本更新了 Hermes 集成,并修复 Hermes Desktop 对 force-build 参数的支持问题。

此前,Hermes Desktop 对 force-build 的处理可能无法按预期生效。v0.32.3 明确让 Hermes Desktop 尊重这一参数。

对于需要强制执行构建流程的场景而言,这项改动能够确保命令传入的构建意图被正确执行,而不是被忽略或采用非预期行为。

Hermes 集成的更新与 force-build 支持修复,体现出本次版本不仅关注模型推理本身,也同步完善了与外部桌面工具、构建流程相关的连接能力。

五、Windows ARM64 平台正式支持 CUDA

硬件支持方面,v0.32.3 增加了 Windows ARM64 平台的 CUDA 支持。

这是本次更新中非常值得关注的一项内容。此前,Windows ARM64 环境下的 CUDA 使用支持可能受到限制,而本版本通过相关改动为该平台加入了 CUDA 能力。

随着不同架构设备的使用需求不断增加,Windows ARM64 的 GPU 推理支持具有实际意义。v0.32.3 将 CUDA 支持扩展到这一平台,进一步扩大了可运行 ollama GPU 推理环境的范围。

对于使用 Windows ARM64 设备并希望借助 CUDA 加速模型运行的用户而言,这次升级意味着硬件能力支持范围得到扩展。

六、通过 CUDA 12 支持 B200

v0.32.3 扩展了 CUDA 12 环境下的 GPU 支持,其中包括对 B200 的支持。

更新中涉及为 Linux 下 CUDA v12 增加计算能力 10.0 支持,这项调整与 B200 支持直接相关。通过 CUDA 12 的能力扩展,ollama 能够覆盖这一 GPU 相关支持需求。

GPU 支持的增加并不只是简单增加一个设备名称,更意味着推理环境在 CUDA 版本、计算能力与硬件适配方面持续演进。对于使用 CUDA 12 环境并部署相关 GPU 的场景,这次更新提供了更完整的支持基础。

另外,本版本还修复了持续集成环境中缺失 CUDA v13.4 子包的问题。虽然这属于构建与持续集成层面的调整,但同样与 CUDA 相关支持链路的完整性有关。

七、Linux CUDA 与 ROCm 集成显卡进一步降低内存使用

v0.32.3 针对 Linux 平台上的 CUDA 与 ROCm 集成显卡,优化了内存使用。

更新内容中提到启用 dio,以降低 Linux CUDA 与 ROCm iGPU 场景下的内存占用。这项改动面向集成显卡推理环境,重点改善资源使用表现。

集成显卡场景与独立显卡场景不同,其显存与系统内存使用关系往往更加紧密。因此,降低内存使用对于提升实际运行可行性具有重要意义。尤其是在内存资源有限、需要控制占用的环境中,这类优化能够减少模型推理对系统资源造成的压力。

本次更新没有只关注高端 GPU 支持,同时也对 Linux CUDA 与 ROCm 集成显卡场景进行优化,体现出硬件兼容策略覆盖了不同层级的设备环境。

八、Laguna 2.1 模型新增聊天、思考与工具调用支持

模型能力方面,v0.32.3 为 Laguna 2.1 模型增加了聊天、思考和工具调用支持。

这意味着 Laguna 2.1 不仅能够用于基础文本生成,也可以进入更完整的交互式使用链路,包括:

  • • 聊天能力

  • • 思考能力

  • • 工具调用能力

聊天支持使模型能够面向多轮交互场景进行工作;思考支持对应模型输出中的相关内容处理;工具调用支持则让模型具备与外部工具协作的能力。

对于需要在统一运行环境中使用不同模型能力的用户而言,Laguna 2.1 的这次适配非常关键。模型是否具备聊天、思考与工具调用支持,会直接影响其能否进入终端助手、自动化流程、交互式对话等使用场景。

本次更新还修复了 Laguna 的 Metal 推理问题。Metal 推理修复使该模型在相关环境中的运行支持更加完整。

在提交记录中,还包含将 Laguna 与上游 llama.cpp 对齐的改动,以及 Laguna v8 聊天支持与 Metal 推理修复相关调整。这些变化共同构成了 Laguna 模型支持的持续完善。

九、GLM 工具调用在生成结束时被静默丢弃的问题修复

v0.32.3 修复了 GLM 工具调用在生成末尾可能被静默丢弃的问题。

工具调用是模型接入外部能力的重要机制。如果模型已经生成了工具调用内容,但因为生成过程接近结束而没有被正确解析或最终输出,那么用户会看到模型似乎没有执行工具调用,且可能没有明显报错提示。

此次改动对不完整的 GLM 工具调用进行了最终处理,核心目标是避免工具调用在生成结束阶段被直接丢弃。

“静默丢弃”问题尤其影响排查体验。因为用户可能只发现模型没有调用预期工具,却无法直接判断是模型没有生成调用意图,还是调用内容在解析阶段丢失。v0.32.3 修复这一问题后,GLM 工具调用在生成结尾的处理更加可靠。

对于依赖工具调用执行操作的场景,这是一项直接影响功能正确性的修复。

十、MLX 与 llama.cpp 推理引擎完成更新

本次版本更新了 MLX 和 llama.cpp 引擎。

更新记录中包含 llama.cpp 更新,同时 MLX 也进行了两次更新。作为模型运行的重要引擎组件,MLX 与 llama.cpp 的版本变化关系到模型兼容性、推理行为和底层能力对齐。

llama.cpp 相关更新之外,Laguna 还进行了与上游 llama.cpp 的对齐调整。这说明本次版本不仅完成基础引擎升级,也针对模型支持进行了相应适配。

MLX 的多次更新也被纳入 v0.32.3 发布内容。对于使用 MLX 推理路径的场景而言,这意味着底层引擎获得同步更新。

引擎更新虽然不一定在表面交互中直接可见,但它通常影响模型支持、运行稳定性以及后续功能适配能力。v0.32.3 将 MLX 与 llama.cpp 的更新纳入版本范围,为整体模型运行能力提供了基础支撑。

十一、云模型默认允许无限工具调用轮次

agent 相关部分,v0.32.3 调整了云模型的默认工具调用轮次策略。

更新内容显示,云模型默认允许无限工具调用轮次。此前,工具调用轮数可能受到默认限制,而本次调整改变了默认行为。

对于需要多轮调用工具才能完成任务的场景,工具轮次限制会影响任务是否能完整执行。云模型默认允许无限工具调用轮次后,连续工具调用流程不再受默认轮数上限约束。

这项调整与工具调用能力的发展方向一致。随着模型承担的任务逐渐涉及多步骤操作、反复查询、持续执行工具链,工具调用轮次的默认限制可能成为流程中断点。v0.32.3 对默认策略进行调整,使云模型工具调用流程更加连续。

十二、agent 与终端交互流程持续精简

除了模型和硬件支持,本版本还对 agent、命令行和终端交互进行了多项整理。

主要变化包括:

  • • 移除无效的 agent 提示词包装

  • • 调整工作目录指令顺序

  • • 清理语义、用户体验、开发体验和过程代码

  • • 移除独立的 agent 命令

  • • 删除事件循环中冗余的上下文窗口刷新

  • • 在提交之前完成斜杠命令补全

  • • 统一 Markdown 粗体强调的渲染表现

  • • 将根命令的 server start 路由通过服务器心跳检查

这些改动覆盖了终端使用、命令处理、交互显示、服务启动和 agent 流程等多个细节。

例如,斜杠命令在提交前完成补全,可以改善命令输入过程中的交互体验;Markdown 粗体强调统一渲染,能够使聊天内容中的重点表达更一致;删除冗余上下文窗口刷新,则可以减少事件循环中不必要的处理。

移除独立 agent 命令与清理无效提示词包装,也说明 v0.32.3 在继续收敛命令与 agent 流程结构,减少重复或不再需要的入口与逻辑。

根命令的 server start 通过服务器心跳检查,则让服务启动流程与服务状态检查机制更紧密地结合。

十三、技能系统与从编码 agent 导入技能能力加入更新

v0.32.3 的提交记录中还包括 agent 技能系统,以及从编码 agent 导入技能的能力。

技能系统属于 agent 能力组织相关的更新。与此同时,从编码 agent 导入技能的改动,为技能复用和接入提供了相应支持。

这部分更新与前文提到的工具调用轮次、agent 流程整理共同构成了 v0.32.3 在 agent 方向上的变化。虽然本次发布说明的重点集中于下载、集成、GPU、模型支持与引擎更新,但提交记录表明 agent 技能相关能力同样被纳入这一版本。

十四、构建工具链与测试入口同步调整

在构建与测试方面,v0.32.3 包含以下调整:

  • • Linux 工具链升级至 GCC 13

  • • 修复持续集成中缺失的 CUDA v13.4 子包

  • • 重构集成测试入口

  • • 更新 API 文档中的 renderer 与 parser 字段

  • • 更新 retirements 文档

Linux 工具链升级至 GCC 13,属于构建环境层面的更新。持续集成中 CUDA v13.4 子包缺失问题的修复,则确保相关构建或测试链路具备所需组件。

集成测试入口的重构,表明测试体系本身也进行了整理。测试入口的组织方式会影响后续验证流程的维护与执行。

文档方面,API 文档增加 renderer 和 parser 字段说明,同时 retirements 文档也进行了更新。这些文档调整使接口字段与相关状态信息得到同步维护。

十五、v0.32.3 完整更新要点汇总

为了便于快速查看,以下是本次版本涉及的全部主要变化汇总。

模型下载与服务稳定性

  • • 修复模型下载在发送数据前发生停滞的问题

  • • 增加下载首字节到来前的停滞检测

  • • 根命令启动 server 时通过服务器心跳检查

集成与模型协议

  • • 恢复 Claude Code Channels

  • • 修复 Anthropic thinking 流

  • • 在开始 thinking 块前关闭文本块

  • • 更新 Hermes 集成

  • • Hermes Desktop 正确遵守 force-build 参数

  • • 修复 GLM 工具调用在生成结束时被静默丢弃的问题

  • • 对不完整 GLM 工具调用进行最终处理

GPU 与平台支持

  • • Windows ARM64 支持 CUDA

  • • 通过 CUDA 12 支持 B200

  • • Linux CUDA v12 增加计算能力 10.0

  • • Linux CUDA 与 ROCm 集成显卡降低内存使用

  • • 修复持续集成中缺失 CUDA v13.4 子包的问题

  • • Linux 工具链升级至 GCC 13

Laguna 模型支持

  • • Laguna 2.1 新增聊天支持

  • • Laguna 2.1 新增思考支持

  • • Laguna 2.1 新增工具调用支持

  • • 修复 Laguna Metal 推理问题

  • • Laguna 与上游 llama.cpp 对齐

  • • 包含 Laguna v8 聊天支持与 Metal 推理相关调整

推理引擎更新

  • • 更新 llama.cpp

  • • 更新 MLX

  • • MLX 在本次提交中进行了多次更新

agent、命令行与终端体验

  • • 云模型默认允许无限工具调用轮次

  • • 增加 agent 技能系统

  • • 支持从编码 agent 导入技能

  • • 移除无效 agent 提示词包装

  • • 调整工作目录指令顺序

  • • 清理语义、用户体验、开发体验和过程代码

  • • 移除独立 agent 命令

  • • 删除事件循环中冗余上下文窗口刷新

  • • 提交前完成斜杠命令补全

  • • 统一聊天中 Markdown 粗体强调渲染

测试与文档

  • • 重构集成测试入口

  • • API 文档增加 renderer 和 parser 字段

  • • 更新 retirements 文档

结语

代码地址:github.com/ollama/ollama

ollama v0.32.3 是一次覆盖范围较广的稳定性与兼容性更新。

在基础体验上,模型下载开始阶段停滞的问题得到修复;在模型与协议支持上,Claude Code Channels、Anthropic thinking 流、GLM 工具调用和 Laguna 模型能力均得到增强或修复;在硬件支持上,Windows ARM64 CUDA、CUDA 12 B200、Linux CUDA 与 ROCm 集成显卡内存优化成为重要亮点;在底层引擎上,MLX 和 llama.cpp 同步升级;在终端与 agent 使用链路中,工具调用轮次、技能系统、命令补全、渲染一致性和流程精简也都获得调整。

我们相信人工智能为普通人提供了一种“增强工具”,并致力于分享全方位的AI知识。在这里,您可以找到最新的AI科普文章、工具评测、提升效率的秘籍以及行业洞察。 欢迎关注“福大大架构师每日一题”,发消息可获得面试资料,让AI助力您的未来发展。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
养老金争议背后:不是愤怒,是几代人积压已久的养老公平焦虑

养老金争议背后:不是愤怒,是几代人积压已久的养老公平焦虑

笔墨V
2026-08-07 17:55:14
1987年NBA总决赛秘闻曝光:“微笑刺客”托马斯承认咬过“酋长”帕里什

1987年NBA总决赛秘闻曝光:“微笑刺客”托马斯承认咬过“酋长”帕里什

温柔且自由
2026-08-08 04:08:38
有性生活的人对比没性生活的人,竟有如此多不同,涨知识了

有性生活的人对比没性生活的人,竟有如此多不同,涨知识了

普陀动物世界
2026-08-08 05:54:10
南京女工程师因离座9分钟聊天4分钟开机迟8分钟被开除,一审获赔11万二审维持原判

南京女工程师因离座9分钟聊天4分钟开机迟8分钟被开除,一审获赔11万二审维持原判

小怪吃美食
2026-08-07 17:23:19
美的电饭煲因为造型过于抽象,火到韩国了!网友:坏了,这是真的

美的电饭煲因为造型过于抽象,火到韩国了!网友:坏了,这是真的

小柱解说游戏
2026-08-02 15:35:35
两性心理学:女人一旦喜欢你,便会这样对你

两性心理学:女人一旦喜欢你,便会这样对你

心理观察局
2026-08-08 06:56:11
太难伺候啊!水均益的女儿水亦诗哭诉,第6个保姆干又不干了,网友怒斥:从自身找一下原因吧

太难伺候啊!水均益的女儿水亦诗哭诉,第6个保姆干又不干了,网友怒斥:从自身找一下原因吧

火山詩话
2026-08-07 18:35:29
《功夫女足》票房冲到22亿突然急刹车,网友搞不懂摸不透,原来星爷早就另有打算

《功夫女足》票房冲到22亿突然急刹车,网友搞不懂摸不透,原来星爷早就另有打算

东方不败然多多
2026-08-08 01:05:55
外公是开国上将,自己是校花,本想给活佛说媒,结果却被活佛看上

外公是开国上将,自己是校花,本想给活佛说媒,结果却被活佛看上

莫地方
2026-08-05 16:16:10
0 时 0 分准时生效!中方 16 条新规落地,菲律宾船只再闯就不是警告了

0 时 0 分准时生效!中方 16 条新规落地,菲律宾船只再闯就不是警告了

谛听骨语本尊
2026-08-06 12:23:19
嫁错人太可怕!被前夫公开骂“性欲太强”的她,活成张柏芝对照组

嫁错人太可怕!被前夫公开骂“性欲太强”的她,活成张柏芝对照组

阿讯说天下
2026-08-02 04:31:47
1982 年,飞行员黄植诚和马红成婚,8 年后她借出国名义在美国失联。安保人员搜查住所,卧室内查获的物件让人震惊

1982 年,飞行员黄植诚和马红成婚,8 年后她借出国名义在美国失联。安保人员搜查住所,卧室内查获的物件让人震惊

磊子讲史
2026-07-15 12:02:40
韩杰判刑后,3名儿科医生走了2个!"关掉科室,全院都松了口气"

韩杰判刑后,3名儿科医生走了2个!"关掉科室,全院都松了口气"

医脉圈
2026-08-06 23:24:25
上海悄悄发钱,沪漂时代彻底变了

上海悄悄发钱,沪漂时代彻底变了

童童聊娱乐啊
2026-08-08 03:42:45
U17国足决赛战阿森纳!上海队吕孟洋4场造4球,向日本籍主帅证明

U17国足决赛战阿森纳!上海队吕孟洋4场造4球,向日本籍主帅证明

球场没跑道
2026-08-07 22:14:08
太强了!罗德里若加入巴萨,新赛季诺坎普首发11人堪称世界级

太强了!罗德里若加入巴萨,新赛季诺坎普首发11人堪称世界级

里芃芃体育
2026-08-08 03:00:07
38年前上映时无人问津,这部被严重低估的恐怖片翻拍,如今成了无数影迷心中的神作

38年前上映时无人问津,这部被严重低估的恐怖片翻拍,如今成了无数影迷心中的神作

时光慢旅人
2026-08-06 00:19:42
从12.9亿到3.73亿,大鹏被“摘桃子”?《年会不能停2》换角真相

从12.9亿到3.73亿,大鹏被“摘桃子”?《年会不能停2》换角真相

小椰的奶奶
2026-08-07 12:24:52
浙江应急管理最新提示:台风“白海豚”影响期间,将视情落实停课、停工、停业、停运、停止户外相关活动等防御举措

浙江应急管理最新提示:台风“白海豚”影响期间,将视情落实停课、停工、停业、停运、停止户外相关活动等防御举措

都市快报橙柿互动
2026-08-08 00:56:06
官方确认1亿欧新星加盟皇马,莱比锡玩梗打脸罗马诺:Here we ACTUALLY go

官方确认1亿欧新星加盟皇马,莱比锡玩梗打脸罗马诺:Here we ACTUALLY go

晚风知我意21
2026-08-07 02:12:23
2026-08-08 07:28:49
moonfdd incentive-icons
moonfdd
福大大架构师每日一题
1380文章数 78关注度
往期回顾 全部

科技要闻

突然涨价,"只收电费钱"的梁文锋,变了吗

头条要闻

2岁患儿就诊死亡首诊医生获刑 不少医生为其鸣不平

头条要闻

2岁患儿就诊死亡首诊医生获刑 不少医生为其鸣不平

体育要闻

去年信誓旦旦3000万 今年NBA查无此人

娱乐要闻

周也热恋结束,六个字暴露单身状态

财经要闻

腾讯WorkBuddy领跑AI办公 阿里字节急了?

汽车要闻

越7全球首秀 传祺开始进攻方盒子越野

态度原创

健康
时尚
旅游
教育
家居

打干细胞会不会诱发癌症?

从帆布袋到爱马仕,她们最爱的新包是这些

旅游要闻

太邑火把节,非有“玩常”

教育要闻

高校淘汰文科专业!对“青椒”的冲击严重…

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版