一个有趣的想法是持续训练针对特定技能的专用模型。这篇论文就探讨了这个思路。他们提出了SkillGym系统,将人工编写的技能转化为2,756个代码检测训练场景,并用8,364条成功轨迹进行微调。微调后,在Claude Code中运行的Qwen3.5-35B-A3B模型在Terminal-Bench 2.1上提升了19.10分,在技能辅助的SkillsBench v1.1上提升了28.13分,达到51.47%的准确率。这个成绩超过了已公布的Claude Sonnet 4.6和GPT-5.4 Mini的分数。即使不加载技能库,训练后的模型也优于未学习技能的基础版本。
—— DAIR.AI (@dair_ai) X帖子|2026-09-27T22:35:02+00:00
原帖:https://x.com/dair_ai/status/2104339055194546595
DAIR.AI:一个有趣的想法是持续训练针对特定技能的专用模型。这篇论文就探…
一个有趣的想法是持续训练针对特定技能的专用模型。这篇论文就探讨了这个思路。他们提出了SkillGym系统,将人工编写的技能转化为2,756个代码检测训练场景,并用8,364条成功轨迹进行微调。微调后,在Claude Code中运行的Qwen
扫描二维码,在手机上阅读
