Qwen3.8 27B 做“大数加法转文字”:开启推理后准确率显著提升

Simon Willison3 天前

实验背景

有人曾用 GPT-4o 做过一个有趣测试:给模型两个数字,让它计算两者之和,但要求答案必须用英文单词写出,且不要输出任何额外信息。

测试覆盖了不同位数的加法组合:数字 a 和 b 的位数分别从 1 位到 13 位,每种位数组合抽取 30 组样本,总计 5,070 次测试。结果显示,随着数字位数增大,模型准确率明显下降,并且不同位数组合之间呈现出不规则波动。

受这个实验启发,作者在本地硬件环境中复现了类似测试,以便在更可控的环境下观察模型表现。

本地复现实验设置

本次实验使用本地硬件 DGX Spark,模型为:

Qwen3.8-27B-Q4_K_M.gguf

任务形式仍然是:

What is {a} + {b}? Please write your answer in words. Do not include any other text or information, just the answer in words.

也就是让模型计算 a + b,并且只用英文单词输出结果。

实验分为两轮:

  1. 关闭推理能力,每个位数组合测试 30 次;
  2. 开启推理能力,每个位数组合只测试 1 次。

关闭推理:整体准确率 23.57%

在关闭推理的情况下,实验仍然覆盖 13 × 13 个有序位数组合,每个组合 30 组固定样本,总计 5,070 次。

结果是:

正确:1,195 / 5,070
整体数值准确率:23.57%

从结果看,Qwen3.8 27B 在关闭推理时,对较短数字的加法表现尚可,但随着两个加数的位数增加,准确率快速下降。

一些观察包括:

  • 当其中一个加数只有 1 位或 2 位时,模型仍有较高概率答对;
  • 当两个加数都达到较高位数时,大量组合准确率为 0%;
  • 某些中等位数组合有局部高点,但整体并不稳定;
  • 这类任务对模型来说不只是“会不会加法”,还要求它把数字结果稳定转换成英文单词形式。

开启推理:169 次中答对 167 次

随后作者开启了模型的推理能力再次测试。

不过,开启推理后每一组计算耗时明显增加,因此这次没有继续为每个位数组合跑 30 个样本,而是每个位数组合只测试 1 个固定样本。

测试规模为:

13 × 13 = 169 次

结果为:

正确:167 / 169

在这 169 个格子中,只有两个组合出错:

  • a 为 2 位、b 为 8 位;
  • a 为 12 位、b 为 9 位。

需要注意的是,这一轮每个组合只有一次测试,因此结果不如前一轮 5,070 次测试那样稳健。作者也指出,如果再次运行,结果可能会有所不同。

推理轨迹显示模型在逐位计算

实验报告中还展示了部分较大数字计算时的推理轨迹。模型会尝试将两个大数对齐,然后从右往左逐位相加并处理进位。例如,它会写出类似下面的步骤:

Wait, let me redo this more carefully.

4,299,366,105,622
6,088,794,067,970

Let me align them:
...

Adding from right to left:
Position 1 (units): 2 + 0 = 2
Position 2 (tens): 2 + 7 = 9
Position 3 (hundreds): 6 + 9 = 15, write 5, carry 1

这说明开启推理后,模型不再只是直接生成答案,而是更像在执行逐位加法流程。

小结

这次实验显示,在“大数加法并用英文单词输出答案”这个任务上,Qwen3.8 27B 的表现强烈依赖是否启用推理:

  • 关闭推理:5,070 次测试中答对 1,195 次,准确率 23.57%;
  • 开启推理:169 次单样本测试中答对 167 次。

不过,两轮实验的采样规模不同,不能直接把它们视为严格同条件对比。更稳健的结论仍需要在开启推理时进行更多样本测试,尤其是对高位数组合进行重复采样。

评论

请登录后发表观点

暂无数据