同一个模型,在一个代理框架下得分62%,而在另一个框架下只有33%。@adithya_s_k 和 @huggingface 团队刚刚发布了关于多框架RL的终极指南,这是今年最实用的RL教程之一,而且全部开源!诀窍很简单:不要改动代理框架,而是让它指向一个代理程序,而不是直接指向模型。这个代理程序能理解四种编码代理使用的API格式(OpenAI聊天回复、OpenAI响应、Anthropic消息、Gemini)。它会记录vLLM采样的确切token ID和logprobs,然后你用这些数据来训练。你不需要改动Claude的任何一行代码。
—— huggingface (@huggingface) X帖子|2026-10-02T14:51:01+00:00
原帖:https://x.com/huggingface/status/2106034221005312448
huggingface:同一个模型,在一个代理框架下得分62%,而在另一个框架下只有…
同一个模型,在一个代理框架下得分62%,而在另一个框架下只有33%。@adithya_s_k 和 @huggingface 团队刚刚发布了关于多框架RL的终极指南,这是今年最实用的RL教程之一,而且全部开源!诀窍很简单:不要改动代理框架,而
扫描二维码,在手机上阅读
