NVIDIA 发布了一篇关于终端代理测试时计算的精彩论文。研究发现,你应该生成几个候选的命令行指令,先验证它们,然后再运行一个。而且,你应该在验证器上投入更多资源,而不是额外生成更多的候选指令。使用 GPT-5.6 Sol 验证器在 8 个采样动作中进行选择,TerminalBench-Lite 的 Pass@1 从 50.0% 提高到了 68.0%。如果验证器较弱,额外生成的候选指令几乎没有什么帮助。Mid-Harness 保持生成器和框架不变,并在它们之间发挥作用。当一个小的 TMAX-9B 模型验证自己的候选指令时,两两比较效果最好,而且可以将强大的验证器进行提炼。
—— DAIR.AI (@dair_ai) X帖子|2026-10-04T11:00:11+00:00
原帖:https://x.com/dair_ai/status/2106700907106943107
DAIR.AI:NVIDIA 发布了一篇关于终端代理测试时计算的精彩论文。研…
NVIDIA 发布了一篇关于终端代理测试时计算的精彩论文。研究发现,你应该生成几个候选的命令行指令,先验证它们,然后再运行一个。而且,你应该在验证器上投入更多资源,而不是额外生成更多的候选指令。使用 GPT-5.6 Sol 验证器在 8 个
扫描二维码,在手机上阅读
