阿里开源Qwen 3.8-27 B本地实测:性能很强,但Agent适配仍待补课
从部署到实测:覆盖标准部署、量化部署、Agent场景三大维度。
作者丨 吴海明 何宇轩
编辑丨李娜 岑峰
8月14日,阿里 Qwen 团队开源了 Qwen3.8-27B 模型,紧接着社区里的声音从“能不能跑”变成了“是不是新的模型斩杀线”,有人把它叫作 本地 Opus ,也有人直接给出更刺激的判断:一个 27B 开源模型,已经能在部分代码和 Agent 任务上达到顶级闭源模型的水平。那么, 一个 27B 开源模型,体验到底怎么样呢 ?
根据官方数据,27B dense、Apache 2.0、262K 原生上下文、可扩展到 100 万 token、支持视觉理解、思考默认开启,低比特量化后还能压到十几 GB 级 GGUF 文件,这说明 Qwen3.8-27B 是一个试图把代码、长上下文、多模态和 Agent 工作流一起拉到本地的开源底座。
因此,我们从适配 Agent 出发,先后测试标准化部署、量化部署和接入 Agent 框架。其中,标准部署看 vLLM、SGLang 和 Llama.cpp 谁更能榨干 GPU,将推理速度提到最快;量化部署从 2bit 测到 16bit,看文件体积、速度和质量怎么取舍;Agent 测试则把本地 Qwen3.8-27B 接入 DeepSeek Harness,并用同样本地部署的 DeepSeek-V4-Flash-0731 做对照。测试任务从组合推理、事实校验、新闻写作,一直压到论文综述和 3D 网站生成。
实测结果有点像给这波热度泼了一杯很浓的咖啡:确实醒脑,但也很苦 。 在 Agent 质量评分里,Qwen3.8-27B 最终拿到任务完成度的满分,复杂任务完成度明显更稳;标准部署下,vLLM 和 SGLang 平均吞吐都超过 40 token/s;量化部署里,3bit 到 6bit 在本轮文本任务中保持了完成度满分的质量。
可另一面也同样扎眼:Qwen 最终跑通 9 个 Agent 任务消耗了 13,995,350 token、197 次请求和 22,564.37 秒,约 6 小时 17 分钟;其中,生成 3D 网站单题就烧掉 11,533,959 token,分析日志发现,核心问题出现在复杂任务拆分归于复杂、单步目标过重、上下文反复回灌,导致大量时间消耗在和空转上。 它确实能干活,而且能把复杂任务做得更完整,但是它烧的不仅是 token,更是用户的时间。
所以,这篇文章回答了:性能比肩 Claude Opus 4.6 Max 的开源 dense 模型,放到本地工作流里到底怎么用?在哪些部署框架下跑得快,量化到几 bit 还可靠,接入 Agent 后质量优势值不值得、等待时间和本地计算成本?简单说,Qwen3.8-27B 是一个 能做事、愿意深想、但必须被严格约束 token、步骤和输出边界 的开源 Agent 底座。它让社区开发者和科研院所有机会用本地设备获得接近顶级闭源模型的能力,也把一个新的问题摆到台前: 开源免费之后,我们还要不要为时间买单?
01
不看榜单,直接实践:
部署、量化、Agent 三组硬测
我们在一台搭载 A100 GPU 的服务器上对 Qwen3.8-27B 进行部署和测试,同时,我们设计了三类任务题目:第一类是模型能直接完成的推理题,第二类是指令跟随和事实校验题,第三类是接入 Agent 后才有意义的长上下文、文件读写和前端生成任务。
具体题目如下:
这三类题目被用来考验模型的多种能力,推理题考察模型能不能在没有工具辅助的情况下稳定完成多条件推导,尤其是能否区分不同统计口径、避免只给一个看似合理但不完整的答案。指令跟随和事实校验题更接近日常内容生产场景,重点考察模型是否能遵守字数、格式、禁词、语气和事实边界,避免在任务中把话说满、说偏或说过头。Agent 测试题则进一步把模型放进文件系统和代码生成流程里,观察模型能不能读材料、写文件、组织长上下文、生成可运行代码,并在复杂任务中持续推进到一个可交付结果。
评分上,我们采用 0 到 2 分制:完全满足题目要求记 2 分;主体方向正确但有明显瑕疵记 1 分;关键结论错误、任务失败或输出截断记 0 分。需要说明的是,质量分、吞吐、显存、耗时和 token 消耗是不同口径,本文会分开统计,同时评估模型在 跑得快 与 答得好 两方面的表现。
基于上述题目,我们同时构建了三组测试任务:标准部署、量化部署和 Agent 场景测试。标准部署组使用官方标准模型权重与题目,对比 vLLM、SGLang 和 Llama.cpp 三种部署框架,观察不同部署框架下的回答质量与吞吐差异;量化部署组采用 Llama.cpp 作为框架,横向测试 2bit 至 16bit 版本,考察模型权重文件大小、生成速度和回答质量之间的取舍;Agent 组则把部署好的模型接入热门的 DeepSeek Harness,在 A1~A7 之外加入论文综述(A8)和 3D 网站生成(A9),记录任务完成率、质量得分、token 消耗、请求次数和端到端耗时。
三组测试分别回答三个用户最关心的问题: 什么框架更合适本地部署、压缩到什么程度仍然可靠,以及接入 Agent 后能否以可控成本完成任务。
标准部署:vLLM / SGLang 跑满 A100,Llama.cpp 胜在门槛低
三款主流模型部署框架:vLLM, SGLang 和 Llama.cpp
在这组实验中,我们分别用 vLLM、SGLang 和 Llama.cpp 部署标准 Qwen3.8-27B,并使用 A1-A7 的 7 道题测试回答质量和平均吞吐量,题目覆盖组合推理、时间线校验、表格推理、中文精确指令跟随、闲聊、新闻写作和实验结果归因。一起看看结果:
主题:Qwen3.8-27B|量化部署|标准部署|复杂任务