Kratoq
← 全部 Bench Notes
POST A / 4·REASONING EFFORT·2026

推理更多,答案没变

把推理档位拧到 max,代价是 3.8× 的 token 和差不多 3× 的等待。产出没变大。至于有没有变好,我们跑了四次才说得准——答案基本是没有。

modelclaude-opus-4-8
taskCh.1 Foundation synthesis
knobreasoning effort
replicatesn = 4

推理档位是最容易说服自己去调的旋钮。想得更多听起来就等于质量更高,而且调高它几乎不花你什么力气。于是我们调了——顺着梯子一路拧到 max,同一个综合步骤、其余全按住不动。(怎么按住,见旗舰篇。)然后盯两个数:花了多少,和真正拿回来什么。

1 · 账单在涨,产出没涨

effort ladder · opus-4-8

六次跑,从默认到 max,其余没碰。token 翻了两番。成本差不多三倍。等待从一分半拉到五分钟。而读者真正拿到的东西——卡片上那份简报——几乎没离开起点。

Fig.A1opus-4-8 · indexed to none = 100
100200300400nonelowmedhighxhighmax22,783 tok · 4.0×1,805 chars · 1.1×both start here
输出 token(你付的)最终简报(你拿到的)
同一起点,命运相反。none→max:token 5,629→22,783(4.0×)、成本 2.8×、耗时 87s→297s(3.4×)。而简报本身只从 1,602 到 1,805 字。你多付了四倍,换来 13% 的字数。

2 · "可长度是被 prompt 卡住的"

so we removed the cap

合理的质疑。我们的 prompt 要求每条 finding "~400–800 字",所以就算模型想写长也写不了。于是我们把长度限制整个拔掉,再跑一遍默认对 max。没有任何东西卡长度,max 还是烧了 3.8× 的 token——而且回来的更 ,短了 13%。effort 是真花了的,只是花进了你看不见的推理,而不是一份更长、更满的简报。

Fig.A2length unbounded · max ÷ default · n = 4
1.0× default3.81×tokens2.82×cost3.03×latency0.87×brief size
max 档的代价它交付的
旋钮动的是成本,不是产出。长度完全放开,四次跑的均值。三根琥珀柱是你付的;一根矮 indigo 柱是你拿回的。

3 · 更短,但更

the part that fooled us first

更短没关系,只要更密。而且就在第一次 max 跑里,它确实看着更尖——抓到两个默认档跳过的方法学点。我们差点信了。剩下的故事在旗舰篇里:又跑三次,那两个点再没出现,差距落进了普通的逐次波动,而分析里每一处载重的部分,默认档的输出里本来就有。运气好时,max 给你更利落的措辞。这东西没法拿来规划,也不值三倍的价。

什么时候值得拧

match effort to the step

当这一步真的是推理受限、而且下游没有什么把输出挤成固定形状时,就拧上去——事实核查、下判决、走证明,这些地方思考本身就是产品。而对要塞进审阅卡的综合步骤,默认就是答案,没得商量。不管你倾向哪边,都先把整条梯子跑一遍。几美元的事,跑完你是照着一条曲线选,而不是凭感觉。

Bench note · honest edges

单案例、单综合步骤、单模型、小 n。成本是 CLI 计的、偏高——稳的是相对倍数,绝对值只当方向参考。方向性的现场记录,不是研究。