Kratoq Research · Bench Notes
Bench Notes
做 AI 科研工具时的现场记录——对产品背后那个 LLM 步骤的小而诚实的评测。方向性的,不是研究。
POST A / 4
推理更多,答案没变
把推理档位拧到 max,代价是 3.8× 的 token、3× 的等待——换来一个既没变大、replicate 之后也没变好的产出。
读全文 →POST C / 4 · 旗舰
怎么验证一次 LLM 改动而不自欺
调了个旋钮、跑一次、看着更好。然后一 replicate,增益消失了。这是我们用来区分真改进和一次运气的那套便宜方法。
读全文 →POST B / 4
长度不是你定的,是你的措辞定的
同样的证据,只改了一条长度指令的措辞,输出从 340 摆到 644 字——而一个藏着的下限,一直在给单薄的 finding 注水。
读全文 →POST D / 4
那个读不懂判决的核查器
我们在一份报告里植入六个已知错误,把最便宜的模型换进事实核查。它抓到两个——而且一次都没抓到「结果被讲成了错的判决」这一类。
读全文 →