AI DAILY / 2026-09-09
Qwen3.8 27B 量化评测:4-bit 仍可用,1-bit 明显失效
Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
全文中文翻译 · AI 生成,仅供学习交流
Qwen3.8 27B 量化版基准测试:4-bit 表现稳健,1-bit 全面崩塌
4-bit 量化版本在 Terminal-Bench 2.1 这个热门智能体编程基准(agentic coding benchmark)上和全精度模型打成平手。它能装进 24 GB 显存的显卡,比如 RTX 4090,还能再塞下大约 64k token 的上下文。
压缩这件事到了一定程度就会断崖式下跌。1-bit 时,模型在 GPQA Diamond 上几乎就是在瞎猜,更长的推理只会让结果更差。
背景

Qwen3.8 27B 的 GGUF 量化版本由 Unsloth 在 Hugging Face 上发布。可选的方案太多了。我打算测这几个:8-bit Q8_0(29 GB)、4-bit Q4_K_M(17 GB)、2-bit UD-Q2_K_XL(10.7 GB),以及最小的那档 1-bit UD-IQ1_S(6.2 GB)。
之前我研究过 Qwen3.6 27B 这个模型,它在 12GB 下也能较好地生成 SVG 鹈鹕(pelican)(译注:「画一只骑自行车的鹈鹕」是 AI 圈广泛流传的图像/代码生成测试 prompt),到 16GB 时还保留了大部分知识。
与此同时,Reddit 上不少帖子在抱怨,说所有量化版本包括 8-bit 在内效果都变差了,问为什么本地 LLM 感觉比实际更「笨」。这些抱怨站得住脚吗?
测 token 预测的差异(KL 散度(KL-divergence)、top-1 预测)很容易,但这并不能说明模型在解题时是否真的退步了。有些噪声可能跟完成任务无关,比如量化模型生成的答案质量一模一样,只是换了个说法。但在另一些情况下,一个 token 之差可能就是逻辑错误,甚至直接把输出截断了。
70% 80% 90% 100% 50 GB 模型磁盘体积 与 BF16 相同的 top-1 token UD-IQ1_S UD-IQ1_M UD-Q2_K_XL Q4_K_M Q8_0 BF16所以我换个思路,直接在主流基准上看结果,包括 GPQA Diamond、指令跟随 IFBench、编程 Terminal-Bench 2.1。
先复现官方公布的 BF16 全精度模型结果,再看量化对这些结果的影响。
我在 Modal 的 GPU 上烧了大概 $3,000,跑的是 llama.cpp 2026 年 8 月 16 日那版构建(更早的版本不支持这个模型)。理论上我也可以用自己的笔记本跑,但(和生成鹈鹕不一样)这些基准很花时间。
注意一下,不管模型量化成什么,我都用 F16 KV 缓存(KV-cache),每 32k token 大约占 2.3 GB。
Unsloth 的量化版本我用的是:2-bit、4-bit、8-bit 这三档对应 v2,1-bit 对应 v3。
Unsloth 在 2026 年 8 月 19 日替换掉了 v2 文件,所以大部分测试里用到的具体文件现在已经下不到了。
简单讲,你选 4-bit 的 Q4_K_M(17GB),在这些基准上几乎感觉不到差别。
但推理强度(effort)这一项的设置影响很大(默认是 xhigh),而且选起来挺纠结的,因为它会过度思考(overthink)。
单轮测试
最简单的就是单轮测试(one-shot tests),包括研究生级别的科学基准 GPQA Diamond 和指令跟随 IFBench。
每个我都跑了三种推理强度,low、medium,还有默认的 xhigh。
GPQA Diamond 70% 75% 80% 85% 90% 95% 100% 50 GB 模型磁盘体积 GPQA Diamond 得分 xhigh(默认)由 Qwen 报告 low medium UD-Q2_K_XL Q4_K_M Q8_0 BF16头一件事,我挺高兴官方结果被我复现出来了。跑基准这事本身就不容易,很多隐藏的设置或者假设就能让结果差出十万八千里。这次第一次跑就和 Qwen 自己公布的数据对上了。
第二件事,除了噪声之外(误差棒是 Wilson 95% 置信区间,对运行间噪声来说算非常保守了),从全精度到 4-bit 之间几乎没差别,只有 2-bit 分数稍微低一点。
但思考级别(thinking level)反而把分数拉得很开。最好的结果是 xhigh,大概需要 8k 个推理 token。
IFBench 60% 80% 50 GB 模型磁盘体积 IFBench 严格模式(strict) xhigh(默认)由 Qwen 报告 medium low UD-Q2_K_XL Q4_K_M Q8_0 BF16让我大吃一惊的是,IFBench 上从全精度一直到还不错的 2-bit 都看不出差别,而 2-bit 体积还不到 11 GB。
上下文也短,只有 4k token 左右。
智能体编程与 Terminal-Bench 2.1
编程方面表现怎么样?Terminal-Bench 2.1 是一个标准的智能体基准,共 89 个任务。
这里我用 3 小时超时、xhigh 推理强度,预留 98k 上下文。
由 Qwen 报告 55% 60% 65% 70% 75% 80% 50 GB 模型磁盘体积(对数刻度) Terminal-Bench 2.1 通过 UD-Q2_K_XL Q4_K_M BF16 BF16 我自己跑出来的结果能复现官方数据,这个不意外。意外的是 Q4_K_M 也能复现。
Q8_0 我不小心漏跑了。不过这种情况我可以在 4-bit 和全精度之间放心插值。专门补跑一次既贵又没必要(也会让这篇博客的预算爆炸)。
只有到 2-bit 的 UD-Q2_K_XL 才开始出问题,明显往下掉,但仍然还在 Opus 4.7 或者 Gemini 3.1 Pro 这个水平。离前沿(frontier)模型差得远,但也远远谈不上「毫无用处」。
结果是一方面,那过程呢?更小的模型需要更多轮次、token 或者时间才能得到答案吗?
与 BF16 相同 0.8x 1.0x 1.2x 1.4x 1.6x 1.8x 输出 token 相对 BF16,相同解决任务 UD-Q2_K_XL Terminal-Bench 2.1 轮次 GPQA Diamond IFBench Q4_K_M Terminal-Bench 2.1 轮次 GPQA Diamond IFBench Q8_0 GPQA Diamond IFBench在已经解决的任务上,UD-Q2_K_XL 用的轮次数和 BF16 一样,但写出来的 token 多出大概四分之一。
轮次数基本保持稳定。
1-bit 断崖
到了 1-bit,质量直接断崖式下跌。
和知识一样,量化带来的损伤是非线性的。先是一段没变化的平稳区,然后小幅下降,最后彻底崩盘。
2-bit 量化在某种程度上还能用,但即便是最好的 1-bit 模型在这些基准上也已经报废了。
0% 20% 40% 60% 80% 100% low medium xhigh 推理强度(xhigh 为模型默认) GPQA Diamond 得分 Q4_K_M 由 Qwen 报告 UD-Q2_K_XL UD-IQ1_M 随机猜测 UD-IQ1_S可以看到,分数都在瞎猜水平附近,最小的那个模型甚至还低于这条线。
更长的推理只会让情况更糟。xhigh 时分数掉得比 low 还低,因为模型经常一直推理到 token 预算花光,最后返回一个空答案。
Unsloth 当然要吹一波:
> 我们还做了一些更小的 UD-1bit 量化版本,其中 UD-IQ1_S 仅 6.2GB(不含 MTP),体积缩小 89% 的同时保留了约 72% 的 top-1 准确率。
但这剩下的 28% 其实要命。这跟另一位用户的经历对得上,可以看 Reddit 上 r/LocalLLaMA 里那篇 Qwen3.8 27b 1bit brain damage quant(译注:r/LocalLLaMA 是 Reddit 上讨论本地部署大模型的子版块;「brain damage quant」是网友调侃量化严重翻车时的说法)。
成本
跑这些基准不便宜。
走 API 跑基准很贵,这我之前吃过亏。租 GPU 跑更贵。
BF16 $80 4 task containers $759
Q4_K_M $50 2 task containers
UD-Q2_K_XL $24 3 task containers
UD-IQ1_S $16 7 task containers
UD-IQ1_M $14 3 task containers Terminal-Bench 2.1:Q4_K_M $120 UD-Q2_K_XL $80 BF16 $80 Q8_0 $73
Terminal-Bench 2.1 合计 $2,308
GPQA + IFBench 合计 $663我用 Modal,是因为它从命令行跑起来方便,包括从智能体里直接调。别的方案价格可能不一样。显然,如果你自己有机器,这个数字就不一样了。
要把模型跑得最舒服还是要折腾一下的。我一般不用多 token 预测(Multi-Token Prediction, MTP),它在单流场景下效果还行,而是用几条并行流。关键限制在于 GPU 显存能不能同时装下模型和需要的 KV 缓存。
我用的卡有 NVIDIA L40S(和 RTX 4090 一样是 Ada Lovelace 架构,但显存翻倍到 48 GB)、H100(80 GB)和 H200(141 GB)。如果你想自己跑跑看,我想把成本列出来,给你一个大致的数。
$3 $5 $10 80 tok/s 单流速度 每 1M 输出 token 价格 UD-Q2_K_XL Q4_K_M Q8_0 BF16 L40S H100 H200 8 路并行流 单流,MTP 草稿 OpenRouter做个对比,DeepSeek V4 Flash 0731 是一个 284B 模型,在 OpenRouter 上最便宜的供应商那输出价格大概是 $0.1/Mtok。我也不清楚这个差距有多少来自规模化运行的效率、多少来自定价策略、多少只是热门模型自带的溢价。