Qwen3.8 27B 做“大数加法转文字”:开启推理后准确率显著提升
实验背景
有人曾用 GPT-4o 做过一个有趣测试:给模型两个数字,让它计算两者之和,但要求答案必须用英文单词写出,且不要输出任何额外信息。
测试覆盖了不同位数的加法组合:数字 a 和 b 的位数分别从 1 位到 13 位,每种位数组合抽取 30 组样本,总计 5,070 次测试。结果显示,随着数字位数增大,模型准确率明显下降,并且不同位数组合之间呈现出不规则波动。
受这个实验启发,作者在本地硬件环境中复现了类似测试,以便在更可控的环境下观察模型表现。
本地复现实验设置
本次实验使用本地硬件 DGX Spark,模型为:
Qwen3.8-27B-Q4_K_M.gguf
任务形式仍然是:
What is {a} + {b}? Please write your answer in words. Do not include any other text or information, just the answer in words.
也就是让模型计算 a + b,并且只用英文单词输出结果。
实验分为两轮:
- 关闭推理能力,每个位数组合测试 30 次;
- 开启推理能力,每个位数组合只测试 1 次。
关闭推理:整体准确率 23.57%
在关闭推理的情况下,实验仍然覆盖 13 × 13 个有序位数组合,每个组合 30 组固定样本,总计 5,070 次。
结果是:
正确:1,195 / 5,070
整体数值准确率:23.57%
从结果看,Qwen3.8 27B 在关闭推理时,对较短数字的加法表现尚可,但随着两个加数的位数增加,准确率快速下降。
一些观察包括:
- 当其中一个加数只有 1 位或 2 位时,模型仍有较高概率答对;
- 当两个加数都达到较高位数时,大量组合准确率为 0%;
- 某些中等位数组合有局部高点,但整体并不稳定;
- 这类任务对模型来说不只是“会不会加法”,还要求它把数字结果稳定转换成英文单词形式。
开启推理:169 次中答对 167 次
随后作者开启了模型的推理能力再次测试。
不过,开启推理后每一组计算耗时明显增加,因此这次没有继续为每个位数组合跑 30 个样本,而是每个位数组合只测试 1 个固定样本。
测试规模为:
13 × 13 = 169 次
结果为:
正确:167 / 169
在这 169 个格子中,只有两个组合出错:
a为 2 位、b为 8 位;a为 12 位、b为 9 位。
需要注意的是,这一轮每个组合只有一次测试,因此结果不如前一轮 5,070 次测试那样稳健。作者也指出,如果再次运行,结果可能会有所不同。
推理轨迹显示模型在逐位计算
实验报告中还展示了部分较大数字计算时的推理轨迹。模型会尝试将两个大数对齐,然后从右往左逐位相加并处理进位。例如,它会写出类似下面的步骤:
Wait, let me redo this more carefully.
4,299,366,105,622
6,088,794,067,970
Let me align them:
...
Adding from right to left:
Position 1 (units): 2 + 0 = 2
Position 2 (tens): 2 + 7 = 9
Position 3 (hundreds): 6 + 9 = 15, write 5, carry 1
这说明开启推理后,模型不再只是直接生成答案,而是更像在执行逐位加法流程。
小结
这次实验显示,在“大数加法并用英文单词输出答案”这个任务上,Qwen3.8 27B 的表现强烈依赖是否启用推理:
- 关闭推理:5,070 次测试中答对 1,195 次,准确率 23.57%;
- 开启推理:169 次单样本测试中答对 167 次。
不过,两轮实验的采样规模不同,不能直接把它们视为严格同条件对比。更稳健的结论仍需要在开启推理时进行更多样本测试,尤其是对高位数组合进行重复采样。
