HF榜单(2026年10月05日 18:45 北京时间)


clef(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1298,趋势分 1207。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 1298 · 趋势分 1207)
在 Hugging Face 查看

排行第二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5192,趋势分 739。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5192 · 趋势分 739)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3185,趋势分 697。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3185 · 趋势分 697)
在 Hugging Face 查看

排行第四:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 503,趋势分 490。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 503 · 趋势分 490)
在 Hugging Face 查看

排行第五:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6378,趋势分 457。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6378 · 趋势分 457)
在 Hugging Face 查看

排行第六:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 464,趋势分 443。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 464 · 趋势分 443)
在 Hugging Face 查看

排行第七:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16972,趋势分 342。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16972 · 趋势分 342)
在 Hugging Face 查看

排行第八:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 360,趋势分 339。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 360 · 趋势分 339)
在 Hugging Face 查看

排行第九:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 411,趋势分 290。标签:computer-vision、visionhope。(点赞 411 · 趋势分 290)
在 Hugging Face 查看

排行第十:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2960,趋势分 287。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2960 · 趋势分 287)
在 Hugging Face 查看

排行第十一:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 682,趋势分 213。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 682 · 趋势分 213)
在 Hugging Face 查看

排行第十二:Qwen3.8-Flash-Next-GSQ-RCO-GGUF(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 572,趋势分 213。标签:gsq、rco、quantization、mixed-precision、ist-daslab。(点赞 572 · 趋势分 213)
在 Hugging Face 查看

论文

排行第一:重新思考SFT中的令牌重加权
监督微调(SFT)倾向于过度学习模型认为最不可能的令牌,这有助于学习新行为,但也可能放大噪声和冲突的监督信号,并覆盖有用的预训练知识。通过统一的策略损失视角,重新审视现有令牌重加权方法,发现它们对演示令牌分配非负系数,只能抑制或放大监督更新,无法逆转已学习的有害特征。此外,更大的训练权重并不等同于特征外推,因为它们改变优化轨迹而非固定SFT方向。
在 Hugging Face 查看

排行第二:渐进视觉规划的世界动作建模
世界动作模型(WAMs)通过联合预测未来视觉动态和动作来实现机器人控制,但现有方法在长时程预测中效率低下。一些近期方法通过预测单帧而非完整视频来缓解此问题,但忽略了如何逐步接近目标。本文提出ProWAM,一种渐进式世界动作模型,联合预测动作和稀疏视觉子目标序列,为任务执行中的动作生成提供明确的视觉引导。(论文赞 14)
在 Hugging Face 查看

排行第三:LVMT:用于长期视频分割的视频掩码变换器
现有在线视频分割方法在长而复杂的视频中难以跟踪物体,尤其在长期遮挡情况下。我们提出两个改进:一是使用轻量级GRU-based时序传播模块,自适应选择传播的信息;二是引入截断查询传播(TQP)技术,使模型能在长视频上训练,解决内存需求和梯度消失问题。
在 Hugging Face 查看

排行第四:高效推理训练未必损害思维链忠实性
链式思维(CoT)推理允许人类检查大语言模型如何得出答案并监督其行为,但推理成本较高,促使研究高效训练方法以减少令牌使用。然而,常见担忧是此类训练可能导致模型跳过重要推理步骤,使CoT不再忠实反映模型决策。不同效率方法以不同方式对CoT施加长度压力,且某些任务需要更多令牌来忠实解释决策。(论文赞 5)
在 Hugging Face 查看

排行第五:Dream4ACT:多具身视频动作建模的共享视觉接口
视频生成模型(VGMs)为具身观察-动作建模提供了强大的时空先验,但联合空间动作向量缺乏显式图像空间结构且在不同具身间维度和语义各异,难以直接利用VGMs的丰富时空先验。末端执行器可视化提供替代方案但无法指定机器人执行所需的完整构型。本文提出Dream4ACT,一种用于跨具身联合视频动作建模的世界模型,引入共享视觉动作接口,即动作视图,渲染目标关节坐标。
在 Hugging Face 查看

排行第六:空间记忆智能:赋予世界模型理解驱动的长期记忆
长视频生成和世界模型在交互娱乐和具身模拟中展现出强大潜力,能根据用户动作和历史记忆预测未来观察。但随着记忆序列变长且结构复杂,管理长程空间上下文变得困难,需要更智能和系统化的记忆管理策略。基于多模态大语言模型(MLLMs)的空间推理能力,提出空间记忆智能(SMI),首个系统性地利用理解模型进行记忆管理的框架。(论文赞 6)
在 Hugging Face 查看

排行第七:VeriHarness:扩展代理验证能力
研究如何在不使用参考答案或评分标准的情况下,通过固定基础模型增强LLM代理的验证能力。通过重复采样获得多个轨迹,利用分歧暴露正确选项,共识可能隐藏错误,提出VeriHarness框架,将生成器的LLM转化为代理验证器。(论文赞 6)
在 Hugging Face 查看

排行第八:NAVA-WAM:从视频学习原生动作先验
世界动作模型整合视觉动态与机器人动作预测,但受限于动作标注数据。提出NAVA-WAM,直接从无动作标注的视频中预训练动作策略,避免间接表示到控制的转换或单独的隐动作模型,提升模型可扩展性。(论文赞 17)
在 Hugging Face 查看

排行第九:从检索到类型决策:生物医学句编码器
研究生物医学句编码器在类型决策模型中的应用,提出SBERT2S1框架,将句编码器转换为双编码器、交叉头和先验融合残差模型,并构建BIODECIDE套件和MEDLINE-S1数据集,提升零样本匹配性能。(论文赞 1)
在 Hugging Face 查看

排行第十:Pivot-SD:掩码扩散语言模型自蒸馏
掩码扩散语言模型面临信用分配挑战,Pivot-SD提出一种高效离线自蒸馏框架,仅监督去噪过程中影响响应的高影响力承诺,提升训练效率和模型性能。(论文赞 18)
在 Hugging Face 查看

排行第十一:局部支持学习:防止灾难性遗忘
将遗忘视为权重矩阵输入空间的几何问题,提出局部支持学习(LSL)框架,通过门控函数增强梯度训练,无需访问历史数据即可保留先前能力。(论文赞 2)
在 Hugging Face 查看

排行第十二:HelixWorld:实时音视频世界模型
提出HelixWorld,一个实时交互式音视频世界模型,视觉场景与空间立体声同步演化,基于高保真音视频数据集预训练双向教师模型,支持低延迟因果交互。(论文赞 3)
在 Hugging Face 查看



扫描二维码,在手机上阅读

X榜单(2026年10月05日 19:21 北京时间)

X榜单(2026年10月05日 18:48 北京时间)

评 论
评论已关闭