HF榜单(2026年10月07日 19:45 北京时间)


clef(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1749,趋势分 1572。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 1749 · 趋势分 1572)
在 Hugging Face 查看

排行第二:JEV-27B-VL(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1393,趋势分 1150。标签:qwen3_5、jev、system-one、system-two、typed-decisions。(点赞 1393 · 趋势分 1150)
在 Hugging Face 查看

排行第三:GEV-26B-Decide(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 954,趋势分 792。标签:gemma4、image-text-to-text、system-one、system-two、adaptive-thinking。(点赞 954 · 趋势分 792)
在 Hugging Face 查看

排行第四:embeddinggemma-2(特征提取)
Hugging Face 趋势榜上的模型,任务类型是特征提取,点赞 759,趋势分 741。标签:embedding_gemma2、embedding、sentence-transformers、multimodal-embedding、multimodal。(点赞 759 · 趋势分 741)
在 Hugging Face 查看

排行第五:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 750,趋势分 717。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 750 · 趋势分 717)
在 Hugging Face 查看

排行第六:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3501,趋势分 680。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3501 · 趋势分 680)
在 Hugging Face 查看

排行第七:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 611,趋势分 587。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 611 · 趋势分 587)
在 Hugging Face 查看

排行第八:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 626,趋势分 570。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 626 · 趋势分 570)
在 Hugging Face 查看

排行第九:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6724,趋势分 493。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6724 · 趋势分 493)
在 Hugging Face 查看

排行第十:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5308,趋势分 469。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5308 · 趋势分 469)
在 Hugging Face 查看

排行第十一:humanizer(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 425,趋势分 415。标签:gemma4_unified、image-text-to-text、humanizer、text-rewriting、rewriting。(点赞 425 · 趋势分 415)
在 Hugging Face 查看

排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 17161,趋势分 340。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 17161 · 趋势分 340)
在 Hugging Face 查看

论文

排行第一:DiffGate:基于难度门控的教师指导用于在线蒸馏
本文提出DiffGate方法,用于改进大型语言模型的在线蒸馏(OPD)。现有OPD方法主要在单个词元层面优化师生模型的一致性,而忽略了整个推理轨迹的质量。论文结合了具有可验证奖励的强化学习(RLVR),特别是组相对策略优化(GRPO),以提供结果层面的监督。该方法通过难度门控机制,让教师模型仅在学生模型遇到困难时提供指导,从而弥补了传统OPD和RLVR各自的不足,旨在实现更有效的知识蒸馏。(论文赞 2)
在 Hugging Face 查看

排行第二:条件轨迹峰值:动作块上的单次多模态策略
本文提出条件轨迹峰值(CTP),一个单次推理的策略框架,用于多模态模仿学习。该框架旨在同一观察下生成多样且可执行的未来动作,并确保跨重规划周期行为的一致性。CTP联合预测完整的动作块候选、概率质量和轨迹尺度。通过分布感知峰值专门化(DAPS)和证据门控轨迹信念传输(ETBT)技术,该方法对轨迹峰值进行专门化处理,并维持跨动作块的一致性,同时允许当前策略证据覆盖先前的候选集。
在 Hugging Face 查看

排行第三:执行对齐渐进噪声用于生成机器人策略的异步重规划
本文针对生成式机器人策略中的连续异步重规划问题,提出了执行对齐渐进噪声(EAPN)方法。该方法在动作块之间和动作块内部引入结构化的随机性,以解决独立随机初始化导致的模式切换和动作延续不一致问题。EAPN传播共享的噪声轨迹,并将其与实际执行位移对齐,建立执行对齐的块间相关性。在动作块内部,它模拟动作时间上的时序相关性,从而生成更一致和稳定的机器人行为。
在 Hugging Face 查看

排行第四:迈向实时VLA:阶段感知两步流去噪与系统级评估
本文研究视觉-语言-动作(VLA)模型中低推理速率与高机器人执行速率之间的时序差距。通过端到端延迟测量,论文分析了模型推理和机器人执行链的延迟来源,发现重复流匹配去噪是推理成本的主要贡献者。基于速度场在集成早期相对稳定、在终端步骤方向校正更强的阶段性异质性,论文提出了两阶段非均匀去噪方法,减少去噪步骤数量,以降低推理延迟,助力实现实时VLA系统。
在 Hugging Face 查看

排行第五:Magic-W0:面向物理智能的结构化世界-动作基础模型
本文介绍Magic-W0,一个世界-动作基础模型,旨在增强机器人策略与动作条件环境动态的联合建模。该模型摒弃了传统的未来观察重建或通用潜在预测方法,转而联合建模结构化的物理状态演化和连续动作。Magic-W0将交互表示为结构化世界转移,包含当前状态、转移和未来状态。当前状态结合视觉-语言上下文与当前3D几何;转移由3D运动表示,捕捉动作引起的三维变化,以构建与控制紧密耦合的世界表示。
在 Hugging Face 查看

排行第六:WildMatch:野生动物重识别的弱监督图像匹配器适配
本文研究从相机陷阱图像中进行个体动物重识别的问题,这是一个实例检索任务。现有方法要么学习全局嵌入作为分类问题,需要每个个体大量标注图像且忽略局部证据;要么使用现成的、领域无关的图像匹配器。论文提出WildMatch,一种弱监督适配方法,旨在将预训练的图像匹配器适配到野生动物图像领域。该方法利用野生动物图像的独特局部模式(如皮毛、皮肤标记),在弱监督设置下提升重识别性能。(论文赞 1)
在 Hugging Face 查看

排行第七:DAEDALUS:从自生成任务中构建代理记忆
该论文提出了一种名为DAEDALUS的方法,通过自生成的练习任务来构建可复用的代理记忆,无需预先存在的任务或验证器。该方法通过两个代理协同工作,探索者代理在新环境中自主尝试并记录经验,从而避免重复错误,提升任务执行效率。(论文赞 4)
在 Hugging Face 查看

排行第八:口音类比引导:跨语言语音克隆中的相似性提升
该研究提出了一种名为口音类比引导(AAG)的方法,用于在跨语言零样本语音合成中减少参考语音口音的泄露。通过从模型预测中提取口音方向并进行减法操作,实现更接近目标说话人身份的语音生成,提升语音相似性。(论文赞 4)
在 Hugging Face 查看

排行第九:源识别非适应性测试:合成数据归属的极限测量
该研究测试了在不同改写方式下,对生成文本来源的识别准确率,并评估其在选择优质训练数据中的有效性。结果表明,原始文本的来源识别准确率高,但经过改写后显著下降,说明来源识别在数据重用中的可靠性有限。
在 Hugging Face 查看

排行第十:CtrlCache:基于控制感知的缓存加速交互视频世界模型
该论文提出CtrlCache方法,通过利用用户控制信号指导缓存策略,优化交互式视频世界模型的生成效率。该方法在不增加额外计算成本的情况下,利用控制信息决定缓存复用策略,提升生成速度和响应准确性。
在 Hugging Face 查看

排行第十一:学习阅读扩散Transformer中的上下文标记
该研究提出一种框架,通过自然语言提问方式读取多模态扩散Transformer中的上下文标记。利用轻量级网络将中间上下文标记映射到冻结大语言模型的输入空间,使模型能够直接从隐藏表示中回答关于图像生成的问题。(论文赞 1)
在 Hugging Face 查看

排行第十二:UNREAL:统一检索与长上下文的单一模型
该论文提出UNREAL框架,通过单一模型内部机制实现从单个长提示到整个语料库的证据选择。该方法利用冻结语言模型的内部表示生成检索查询,并添加少量可训练参数,实现长上下文推理与检索的统一。(论文赞 16)
在 Hugging Face 查看



扫描二维码,在手机上阅读

热榜(2026年10月07日 19:45 北京时间)

GitHub榜单(2026年10月07日 19:45 北京时间)

评 论
评论已关闭