Hugging Face 模型趋势榜和每日论文。
模型
排行第一:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1715,趋势分 1546。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 1715 · 趋势分 1546)
在 Hugging Face 查看
排行第二:JEV-27B-VL(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1043,趋势分 849。标签:qwen3_5、jev、system-one、system-two、typed-decisions。(点赞 1043 · 趋势分 849)
在 Hugging Face 查看
排行第三:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 726,趋势分 695。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 726 · 趋势分 695)
在 Hugging Face 查看
排行第四:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3464,趋势分 667。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3464 · 趋势分 667)
在 Hugging Face 查看
排行第五:GEV-26B-Decide(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 798,趋势分 652。标签:gemma4、image-text-to-text、system-one、system-two、adaptive-thinking。(点赞 798 · 趋势分 652)
在 Hugging Face 查看
排行第六:embeddinggemma-2(特征提取)
Hugging Face 趋势榜上的模型,任务类型是特征提取,点赞 605,趋势分 593。标签:embedding_gemma2、embedding、sentence-transformers、multimodal-embedding、multimodal。(点赞 605 · 趋势分 593)
在 Hugging Face 查看
排行第七:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 613,趋势分 559。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 613 · 趋势分 559)
在 Hugging Face 查看
排行第八:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 544,趋势分 521。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 544 · 趋势分 521)
在 Hugging Face 查看
排行第九:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5296,趋势分 503。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5296 · 趋势分 503)
在 Hugging Face 查看
排行第十:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6692,趋势分 489。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6692 · 趋势分 489)
在 Hugging Face 查看
排行第十一:humanizer(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 409,趋势分 400。标签:gemma4_unified、image-text-to-text、humanizer、text-rewriting、rewriting。(点赞 409 · 趋势分 400)
在 Hugging Face 查看
排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 17140,趋势分 346。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 17140 · 趋势分 346)
在 Hugging Face 查看
论文
排行第一:MEND:基于近端速度匹配的流模型强化学习
本文提出MEND,一种基于近端速度匹配的强化学习方法,用于流模型的奖励后训练。传统方法要么在KL惩罚或冻结参考模型下对样本重加权,需数千次更新,要么直接沿奖励梯度移动所有样本而不评估移动价值。MEND通过在每个提示组内设置奖励上限,使已获高分的样本不被移动;低于上限时,仅当奖励增益超过二次位移成本才接受移动提议。模型随后回归到生成的速度目标,无需KL项、冻结参考模型或优势函数。(论文赞 1)
在 Hugging Face 查看
排行第二:从证据到行动:工具使用智能体的失败分析
本文研究工具使用智能体在对外部状态进行 consequential 更改时,正确结果未必基于事先建立的证据。作者分析证据到行动链在智能体从决定是否行动到执行单动作及依赖工作流中的断裂点。在十种模型配置下,强静态动作评估可能与弱交互执行共存。失败常始于执行前:智能体在调查不完整时停止,或未获必要证据即行动。一旦证据到位,单动作执行通常可靠,而多动作工作流则出现额外问题。(论文赞 10)
在 Hugging Face 查看
排行第三:AdvSim2Real:在网页世界模型中训练智能体对抗自适应提示注入
网页智能体通过读取第三方编写的页面完成用户请求,但页面上的植入指令可能使其偏离目标。由于页面包含任务所需的值和控制,智能体不能简单忽略页面。现有防御方法在训练前固定注入内容进行微调,但适应训练后模型的攻击者可绕过它们。对抗训练让攻击者适应但任务固定,导致任务一旦解决就失去教学作用。本文提出AdvSim2Real,在冻结网页世界模型内共同演化任务课程、注入对手和智能体,课程根据智能体表现奖励进展。(论文赞 1)
在 Hugging Face 查看
排行第四:重新思考跨分词器的策略蒸馏:从对齐覆盖到监督可靠性
策略蒸馏(OPD)利用教师反馈在学生自身生成内容上训练学生。当分词器不同时,比较教师和学生预测需在序列和词汇级别对齐。本文检验扩展对齐覆盖是否改善学习。在数学推理和代码生成的三个异构师生对中,严格1:1分组已覆盖大部分学生生成token,尽管词汇严重不匹配。在蒸馏前学生采样响应上,严格对齐位置的共享词汇几乎保留全部教师和学生概率质量。限制对齐范围的影响被探讨。(论文赞 27)
在 Hugging Face 查看
排行第五:理解与增强LLM智能体后训练中的后门持久性
开发者可通过良性后训练调整第三方模型构建LLM智能体。本文研究供应链威胁:攻击者提供带后门的模型,在特定输入模式出现时产生恶意输出。聚焦软件工程智能体,探讨后门是否在开发者的监督微调(SFT)及后续任务级强化学习(RL)中存活。良性SFT大幅降低攻击成功率,但后续RL常保留残余行为,有时甚至提高成功率。分析SFT期间后门侵蚀,识别可能利于存活的两个因素。(论文赞 4)
在 Hugging Face 查看
排行第六:TRACE:面向MoE语言模型FP4强化学习的 rollout 引导量化感知训练
大语言模型(LLM)强化学习后训练在 rollout 生成时产生高计算和内存开销,推动低精度 rollout 以实现高效RL训练。但现有FP4 RL方法主要独立优化训练和 rollout 路径的量化精度,而非直接减少两量化执行路径间的差异。本文提出TRACE,一个用于混合专家(MoE)语言模型RL训练的FP4量化框架,通过紧凑引导对齐训练与 rollout 量化,解决现有FP4 RL方法的局限。(论文赞 16)
在 Hugging Face 查看
排行第七:WING:通过交互中心谱潜在引导实现世界动作学习
论文提出了WING框架,旨在将第一人称视频中的人类交互知识迁移至机器人策略。该方法解决了两个关键挑战:重建帧推断的潜在动作易受相机运动等干扰因素影响,以及人类与机器人行为存在时间动态差异的问题。(论文赞 21)
在 Hugging Face 查看
排行第八:Attacca:长视界智能体的状态连续性目标控制
研究针对现有视觉目标条件策略在连续长视界任务中的局限性,提出当每个任务始于前序任务遗留状态时,智能体需要处理位置变化、环境修改和视野外目标等挑战,而现有方法难以有效过渡到后续任务。(论文赞 2)
在 Hugging Face 查看
排行第九:HuatuoGPT-3:基于基础模型的纯强化学习领域适应
研究聚焦于将通用大语言模型转化为领域专家的过程中,分析了传统SFT+RL流程的局限性,提出纯强化学习适应方案,并针对早期训练中的梯度匮乏和教师分布锚定问题提出了解决方案。(论文赞 15)
在 Hugging Face 查看
排行第十:跨平台用户历史的个人代理中介推荐
论文形式化定义了个人代理中介推荐的新范式,其中平台推荐器使用本地信息生成候选排序,而个人代理则利用用户授权的跨平台历史记录进行最终排名调整,需要平衡有效救援与有害覆盖之间的关系。(论文赞 2)
在 Hugging Face 查看
排行第十一:工具使用型智能体的证据判断与停止决策分离现象
在受控检索环境实验中,研究发现尽管智能体97-100%判定失败工具的输出无用,却很少据此停止使用。提示线索能改变停止时机但不影响停止依据,允许记忆回答和推理模式会导致早期停止。(论文赞 1)
在 Hugging Face 查看
排行第十二:GUI-HARVEST:基于证据的GUI智能体自优化框架
提出GUI-HARVEST系统,通过自动优化执行环境来解决GUI智能体的三大挑战:协调模型意图与可视效果、诊断可变执行结果下的故障,以及识别跨任务重复故障模式并转化为可重用运行时修改。(论文赞 7)
在 Hugging Face 查看
