DAIR.AI:NVIDIA 的一篇关于终端代理测试时计算的论文真的很棒。研…


NVIDIA 的一篇关于终端代理测试时计算的论文真的很棒。研究发现,你应该抽取几个候选的 shell 命令,在运行之前先验证它们,并且在验证器上投入的资源应该比抽取额外样本更多。用 GPT-5.6 Sol 验证器在 8 个采样动作中选择,T

NVIDIA 的一篇关于终端代理测试时计算的论文真的很棒。研究发现,你应该抽取几个候选的 shell 命令,在运行之前先验证它们,并且在验证器上投入的资源应该比抽取额外样本更多。用 GPT-5.6 Sol 验证器在 8 个采样动作中选择,TerminalBench-Lite 的 Pass@1 从 50.0% 提升到了 68.0%。如果验证器很弱,额外的样本几乎没有什么帮助。Mid-Harness 不改变生成器和框架本身,而是工作在它们之间。当一个较小的 TMAX-9B 模型验证自己的候选时,成对比较效果最好,而将强大的模型知识蒸馏到弱模型中也有很好的效果。

—— DAIR.AI (@dair_ai) X帖子|2026-10-04T11:00:11+00:00
原帖:https://x.com/dair_ai/status/2106737427037688145



扫描二维码,在手机上阅读

X榜单(2026年10月04日 21:48 北京时间)

DAIR.AI:RT 一篇谷歌的论文。通常做法是跑多个智能体轨迹,相信它们一…

评 论
评论已关闭