推理更多,答案没变
把推理档位拧到 max,代价是 3.8× 的 token 和差不多 3× 的等待。产出没变大。至于有没有变好,我们跑了四次才说得准——答案基本是没有。
推理档位是最容易说服自己去调的旋钮。想得更多听起来就等于质量更高,而且调高它几乎不花你什么力气。于是我们调了——顺着梯子一路拧到 max,同一个综合步骤、其余全按住不动。(怎么按住,见旗舰篇。)然后盯两个数:花了多少,和真正拿回来什么。
1 · 账单在涨,产出没涨
effort ladder · opus-4-8
六次跑,从默认到 max,其余没碰。token 翻了两番。成本差不多三倍。等待从一分半拉到五分钟。而读者真正拿到的东西——卡片上那份简报——几乎没离开起点。
2 · "可长度是被 prompt 卡住的"
so we removed the cap
合理的质疑。我们的 prompt 要求每条 finding "~400–800 字",所以就算模型想写长也写不了。于是我们把长度限制整个拔掉,再跑一遍默认对 max。没有任何东西卡长度,max 还是烧了 3.8× 的 token——而且回来的更 短,短了 13%。effort 是真花了的,只是花进了你看不见的推理,而不是一份更长、更满的简报。
3 · 更短,但更尖?
the part that fooled us first
更短没关系,只要更密。而且就在第一次 max 跑里,它确实看着更尖——抓到两个默认档跳过的方法学点。我们差点信了。剩下的故事在旗舰篇里:又跑三次,那两个点再没出现,差距落进了普通的逐次波动,而分析里每一处载重的部分,默认档的输出里本来就有。运气好时,max 给你更利落的措辞。这东西没法拿来规划,也不值三倍的价。
什么时候值得拧
match effort to the step
当这一步真的是推理受限、而且下游没有什么把输出挤成固定形状时,就拧上去——事实核查、下判决、走证明,这些地方思考本身就是产品。而对要塞进审阅卡的综合步骤,默认就是答案,没得商量。不管你倾向哪边,都先把整条梯子跑一遍。几美元的事,跑完你是照着一条曲线选,而不是凭感觉。
Bench note · honest edges
单案例、单综合步骤、单模型、小 n。成本是 CLI 计的、偏高——稳的是相对倍数,绝对值只当方向参考。方向性的现场记录,不是研究。