AI DAILY / 2026-10-06
格式过关,答案仍可能算错:Qwen 本地加法实验给评测的提醒
Qwen3.8 27B addition in words
原创中文正文 · 基于公开原文核对与分析
事实与来源
Simon Willison 在 10 月 4 日(UTC)发布了一项本地实验:向 Qwen3.8 27B 的 Q4_K_M 量化版本输入阿拉伯数字加法题,要求用英文单词写出结果。关闭推理时,5,070 道题的数值正确率为 23.57%,英文数字格式合格率却达到 96.17%。这些是作者公开的测试结果,本文没有重新运行模型。
这组反差值得关注:一段回答完全符合输出格式,数值仍可能错误。作者同时公开了冻结的题目、原始响应和评分代码,便于检查分数从何而来。仓库明确标注报告和代码由 AI 生成,因此公开材料提供的是复核入口,还不能代替独立复现实验。
技术机制
实验把两个加数的长度分别设为一至十三位,形成 169 个组合,每组抽取 30 道题。评分器先把完整回答解析为英文数字,再与程序计算的精确和比较;夹带解释或写成阿拉伯数字也判失败。由此可以分开观察“格式合格”和“数值正确”,避免一个笼统的通过率掩盖问题。
开启中等推理后的配对测试,只取每个组合中的同一道题,共 169 道。这个相同子集上,关闭推理答对 45 道,开启后答对 167 道,即 26.63% 与 98.82%。不能把后者直接同完整题库的 23.57% 相减,再称作严格的提升幅度;两处使用的样本不同。
例子与用途
下面是假设的工程场景。游戏运营助手需要把两个服务器的活动积分相加,并生成英文播报。如果验收只检查回答有没有多余文字,格式正确的错误总分就可能被推送。可以把任务拆成三步:程序计算整数总分,语言模块生成播报,再把播报中的数字解析回整数,与原始总分比对。
比如 9,999 加 1,验收必须得到 10,000;出现合法但数值错误的英文表达时,应阻止发布并留下失败记录。除了普通样本,还应覆盖连续进位、加数长度差距大和数值跨数量级的情况。这是本文据实验提出的设计建议,尚未测量它在真实游戏系统中的效果。
限制与不确定性
配对结果比较的是两套完整配置。开启推理时,输出上限也从 128 token 改成不设独立预测上限,但仍受 32,768 token 上下文约束;请求顺序也有变化。原报告说明,关闭推理的回答最长只有 34 token,旧上限没有实际截断回答,但这仍不足以把全部差异归因于推理开关。
中等推理每组仅一道题,不能从一格全对就推断这一类题稳定可靠。结果还限定于具体模型文件、量化方式和运行环境,不能代表整个 Qwen 系列。这项指标同时考察计算、英文数字转换和指令遵循,单靠总分无法确定错误发生在哪一步。
开发者启示
推理配置的收益需要和等待时间一起看。作者的同题比较中,请求延迟中位数从 1.50 秒变为 27.62 秒;这是特定硬件上的串行测试,不能直接换算成线上吞吐量。对积分求和这种已有精确算法的任务,可以先评估确定性计算加文本表达的组合,再决定是否让模型承担全部步骤。
落地评测时,建议固定题目与评分规则,分别记录格式通过率、数值正确率和延迟。保存原始回答及配置,升级模型后用同一批题重新比较;失败样本再按计算错误、单位错误或输出格式错误分类。这样得到的记录,才能回答模型在哪些输入上可用,以及哪些结果必须经过程序校验。
依据作者公开文章、实验说明及配对报告撰写的原创中文解读;主来源精确时间与作者 Atom 订阅核对。统计归属原作者,原始报告和代码标注为 AI 生成。游戏积分案例是假设场景,工程建议属于分析;没有运行模型、复现实验或进行性能亲测。
本期收录日:2026-10-06;主来源发布日期:2026-10-04。收录日不等于发布日期。