DAIR.AI:一个有趣的想法是持续训练针对特定技能的专用模型。这篇论文就探…


一个有趣的想法是持续训练针对特定技能的专用模型。这篇论文就探讨了这个思路。他们提出了SkillGym系统,将人工编写的技能转化为2,756个代码检测训练场景,并用8,364条成功轨迹进行微调。微调后,在Claude Code中运行的Qwen

一个有趣的想法是持续训练针对特定技能的专用模型。这篇论文就探讨了这个思路。他们提出了SkillGym系统,将人工编写的技能转化为2,756个代码检测训练场景,并用8,364条成功轨迹进行微调。微调后,在Claude Code中运行的Qwen3.5-35B-A3B模型在Terminal-Bench 2.1上提升了19.10分,在技能辅助的SkillsBench v1.1上提升了28.13分,达到51.47%的准确率。这个成绩超过了已公布的Claude Sonnet 4.6和GPT-5.4 Mini的分数。即使不加载技能库,训练后的模型也优于未学习技能的基础版本。

—— DAIR.AI (@dair_ai) X帖子|2026-09-27T22:35:02+00:00
原帖:https://x.com/dair_ai/status/2104339055194546595



扫描二维码,在手机上阅读

AK:【转推Arcee.ai】我们很荣幸赞助由@huggingfa…

DAIR.AI:转发自Elvis,一篇关于用Jev检测模型对齐失败的有趣论文…

评 论
评论已关闭