DAIR.AI:来自Meta超智能实验室的重磅论文。他们发现了一些非常有趣且…


来自Meta超智能实验室的重磅论文。他们发现了一些非常有趣且出乎意料的结果。(记得收藏)基模型搭配轻量级辅助训练通常在解决更主动的任务时表现得比它们的RL后训练版本更好,前提是两者都有足够的样本。后训练模型在pass@1上表现更好。在较大的

来自Meta超智能实验室的重磅论文。他们发现了一些非常有趣且出乎意料的结果。(记得收藏)基模型搭配轻量级辅助训练通常在解决更主动的任务时表现得比它们的RL后训练版本更好,前提是两者都有足够的样本。后训练模型在pass@1上表现更好。在较大的K值下,基模型在BFCL v4多轮对话、ACEBench和WebShop等测试中经常解决一些后训练模型从未解决的任务。这是因为后训练会使每个任务倾向于要么总是能解决,要么永远无法解决。一致性提高了,但覆盖面降低了。作者将这种在测试时失去的可扩展性称为“硬化”效应。

—— DAIR.AI (@dair_ai) X帖子|2026-10-03T16:18:02+00:00
原帖:https://x.com/dair_ai/status/2106418508259377411



扫描二维码,在手机上阅读

X榜单(2026年10月04日 00:51 北京时间)

DAIR.AI:RT 尔维斯,先是AutoHarness,然后是AutoCo…

评 论
评论已关闭