返回技术博客
Qwen 3.8 27B:本地 Agent 已经够聪明,问题变成别让它想太久

Qwen 3.8 27B:本地 Agent 已经够聪明,问题变成别让它想太久

Qwen 3.8 27B:本地 Agent 已经够聪明,问题变成别让它想太久

Simon Willison 8 月 16 日实测 Qwen 3.8 27B,给了一个很有意思的判断:这个 17GB 量化本地模型很强,但默认设置太爱思考。

Qwen 3.8 27B 的参数不算夸张,但配置很适合开发者关注:Apache 2.0、27B、视觉语言能力、工具调用、代码能力、262k 上下文,并可扩展到 1M。它不是只面向聊天,而是明显瞄准本地 coding agent 和多模态工具工作流。

Simon 的测试说明,本地模型已经进入“够用但要会调”的阶段。它可以在 LM Studio 里跑,可以处理视觉和代码任务,也能进入简单的 agent loop。但默认 reasoning_effort=xhigh 会让它在普通任务上消耗大量 reasoning tokens,甚至把简单问题想得过度复杂。

这个问题很新,也很现实。以前本地模型的主要问题是“不够聪明”。现在开始变成“聪明,但太慢、太贵、太啰嗦”。尤其在消费级硬件上,推理 token 不是免费的。模型想太久,用户等不起;Agent 每一步都想太久,整个任务就跑不动。

所以 Qwen 3.8 27B 最值得写的不是榜单分数,而是 reasoning control。Qwen3.8 支持 reasoning_effort 档位,可以在 xhigh、medium、low 之间切换,也可以通过 thinking 配置调整成本和延迟。对本地 Agent 来说,这比单纯提高能力更重要。

它还和 vLLM 的 Day-0 支持形成了一个有趣对照。Qwen3.8-2.4T-A95B 代表大集群部署,vLLM 需要同步支持 FP8、BF16、NVFP4、MXFP4、MTP speculative decoding、Qwen tool parser 和 reasoning parser。Qwen 3.8 27B 则代表开发者机器上的本地 Agent。一个是云端巨兽,一个是本地工作模型。

这说明开源模型生态已经进入新阶段:模型发布不再只是权重上传。它需要推理框架、量化格式、工具调用解析、reasoning 控制、上下文管理和本地 UI 同步跟上。否则模型再强,也很难进入真实工作流。

我的判断是,本地 Agent 的竞争会围绕三件事展开。第一,模型够不够聪明,能否写代码、看图、调工具。第二,推理够不够便宜和快,能否在本地硬件上连续运行。第三,是否能控制思考深度,让模型在简单任务上少想,在复杂任务上深想。

Qwen 3.8 27B 的价值就在这里:它让我们看到,本地 Agent 不是遥远的概念了。但真正好用的本地 Agent,不只需要一个强模型,还需要一套能把 reasoning effort 调到合适位置的运行系统。

参考来源:Simon Willison:Qwen 3.8 27B is excellent, but it defaults to wildly overthinking thingsQwen3.8-27B on Hugging FacevLLM:Day-0 Support for Qwen3.8