推理模型的“思考”:答案为什么晚到,账单为什么变多

同一道鸡兔同笼题,用本地 Qwen3 1.7B 和 API 上的 Gemini 3.8 Flash 实测:推理模型先写草稿再答题,草稿怎样推迟答案的第一个字、让账单上的 token 变多,以及看不见草稿时,速度数字为什么不好算。

模型基础推理模型思考延迟计费5:24 · 2026-10-08

文字稿约 1700 字 · 按画面章节整理

同一道题,问同一个模型两次

同一道鸡兔同笼题,我们问同一个小模型两次。第一次,让它直接答:92 毫秒就开口了,3.7 秒答完。第二次,打开“思考”:第一个 token 只用了 57 毫秒,可答案的第一个字,等了 12.7 秒才出来。上一期说的“秒回”,在推理模型这里,有时候只是假象。

今天这期,就讲推理模型的“思考”:答案为什么晚到,账单为什么变多。上一期预告的 Agent,会单独做一期。

打个比方:先打草稿,再写答案

先打个比方。考数学的时候,很多人不会直接写答案,而是先在草稿纸上算一遍,再把答案写到答题卷上。推理模型也是这样:回答之前,它先写一段草稿,这段草稿,就叫“思考”。关键是,草稿也是一个 token 一个 token 写出来的:要花时间,也算 token。

复习:三个缩写,全称是什么

先复习上一期的三个数。TTFT,是 Time To First Token:第一个 token 出来要多久,也叫首字时间。TPOT,是 Time Per Output Token:每多输出一个 token 要多久,也叫生成间隔。E2E,是 End to End:从发出请求到最后一个 token 到达,叫端到端耗时。

两次回答,放在同一条时间轴上

现在把两次回答,放在同一条时间轴上,按原速重放,你也一起等一等。上面是直接答,92 毫秒出第一个字,3.7 秒答完。下面是先思考的,灰色这一段全是草稿,答案还没开始。到了第 12.7 秒,答案才开始。第 18.4 秒,才全部答完。

时间花在哪了?数一数 token

时间都花在哪了?数一数 token 就知道。直接答,一共输出 256 个 token:255 个是答案,最后 1 个是“结束”标记。先思考,一共输出 1232 个 token:草稿 859 个,答案 372 个,再加 1 个“结束”。草稿里有 4 个 token 你看不见:开始思考、结束思考的标记,和两个换行。刚才 57 毫秒到达的第一个 token,就是“开始思考”这个标记。

思考的时候,每个 token 写得更慢吗?

那思考的时候,模型是不是写得更慢?算一算生成间隔。直接答:3607 毫秒里有 255 个间隔,平均每个 14.1 毫秒。先思考:18350 毫秒里有 1231 个间隔,平均每个 14.9 毫秒。每个 token 慢了 0.8 毫秒。因为草稿越写越长,每个新 token 都要回看更多内容。真正拖慢它的,是字变多了:从 256 个,变成 1232 个。

对推理模型,“首字时间”要分成两个

所以对推理模型来说,“首字时间”要分成两个。一个还是 TTFT:第一个 token 到达,57 毫秒,可它只是草稿的开头。另一个叫 Time To First Answer Token,答案首字时间:答案的第一个 token 到达,要 12671 毫秒。想知道多久能等到答案,要看第二个。

API 上的推理模型:草稿藏起来了

本地模型的草稿,我们看得见。可很多推理模型,是在云端通过 API 调用的。API 是 Application Programming Interface,应用程序接口:你的程序发请求过去,它把结果发回来。这些 API 上的推理模型,常常会把草稿藏起来。比如 Gemini 3.8 Flash:默认先思考,但只返回答案。同一道题,关掉思考,第一个字在 2.34 秒到达;打开思考,要等到 4.85 秒。多出来的这一段,屏幕上一个字都没有,它在打草稿,你只能干等。这里的时间包含网络往返,所以只比较开和关,各测 5 次,取中位数。

草稿看不见,账单里有它

草稿藏起来了,可账单里有它。API 返回的用量里,答案是 334 个 token,思考是 315 个 token。按输出计费时,思考也算在内,一共 649 个。而且,草稿的长短不固定。同一道题测 5 次,思考最少 253 个 token,最多 707 个。

那它写得有多快?

那它写得有多快?常见的算法,是拿 token 数,除以出字的那段时间。这一次,出字的时间是 2.29 秒。用看得见的 334 个 token 算,每秒 146 个;用账单上的 649 个算,每秒 283 个。第二个明显偏高:那 315 个草稿 token,在出字之前就写完了。第一个,也只说明看得见的那一段;草稿写得多快,从外面看不到。

下次看到推理模型的速度数字,先问四件事

下次看到推理模型的速度数字,先问四件事:首字时间,是第一个 token,还是答案的第一个 token?token 数里,含不含看不见的思考?思考是开着的,还是关着的?草稿每次长短不一样,测了几次?

今天讲了推理模型的“思考”:它让答案晚到,让账单变多。拖慢它的,主要是多写的那些字。下一期,我们来讲:Token 到底是什么。