HF榜单(2026年10月08日 03:15 北京时间)


clef(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1791,趋势分 1609。标签:qwen3_5、clef、cloudflare、systemone、decision-model。(点赞 1791 · 趋势分 1609)
在 Hugging Face 查看

排行第二:JEV-27B-VL(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1748,趋势分 1456。标签:qwen3_5、jev、system-one、system-two、typed-decisions。(点赞 1748 · 趋势分 1456)
在 Hugging Face 查看

排行第三:GEV-26B-Decide(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 1146,趋势分 969。标签:gemma4、image-text-to-text、system-one、system-two、adaptive-thinking。(点赞 1146 · 趋势分 969)
在 Hugging Face 查看

排行第四:embeddinggemma-2(特征提取)
Hugging Face 趋势榜上的模型,任务类型是特征提取,点赞 890,趋势分 868。标签:embedding_gemma2、embedding、sentence-transformers、multimodal-embedding、multimodal。(点赞 890 · 趋势分 868)
在 Hugging Face 查看

排行第五:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 769,趋势分 734。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 769 · 趋势分 734)
在 Hugging Face 查看

排行第六:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3546,趋势分 682。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3546 · 趋势分 682)
在 Hugging Face 查看

排行第七:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 614,趋势分 589。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 614 · 趋势分 589)
在 Hugging Face 查看

排行第八:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 641,趋势分 584。标签:qwen3_5、clef、cloudflare、systemone、decision-model。(点赞 641 · 趋势分 584)
在 Hugging Face 查看

排行第九:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6769,趋势分 486。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6769 · 趋势分 486)
在 Hugging Face 查看

排行第十:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5324,趋势分 442。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5324 · 趋势分 442)
在 Hugging Face 查看

排行第十一:humanizer(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 445,趋势分 435。标签:gemma4_unified、image-text-to-text、humanizer、text-rewriting、rewriting。(点赞 445 · 趋势分 435)
在 Hugging Face 查看

排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 17189,趋势分 339。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 17189 · 趋势分 339)
在 Hugging Face 查看

论文

排行第一:DeCoPrune: 基于去噪一致性的KV缓存修剪
该论文提出了一种无需训练的KV缓存压缩方法DeCoPrune,用于自回归视频扩散模型。通过将缓存压缩视为去噪一致性问题,利用去噪难度作为token长期保留价值的代理指标,从而更有效地保留重要信息,避免传统方法因忽略上下文贡献而丢失关键视觉证据。(论文赞 1)
在 Hugging Face 查看

排行第二:传感器-语言-动作模型
该论文提出传感器-语言-动作(SLA)建模框架,将多模态传感器数据、自然语言和动作统一建模。通过语言作为感知与行动之间的语义接口,实现异构动作的表示、预测和解释,同时保持对底层传感器证据的 grounded 约束,突破了传统感知模型仅限于状态识别的局限。(论文赞 1)
在 Hugging Face 查看

排行第三:CheckerBench: 长时程智能体合成静态分析检查器
该论文引入CheckerBench,一个包含300个任务的可执行基准,用于评估智能体能否从缺陷说明出发,完成静态分析检查器的完整开发。任务基于297个CVE漏洞,涵盖167个仓库和5个语言生态,提供固定分析环境和检查器模板,旨在测试智能体在真实场景中合成有效检查器的能力。(论文赞 52)
在 Hugging Face 查看

排行第四:Sherpa: 教导LLM自适应教学
该论文提出Sherpa框架,通过多轮强化学习训练LLM作为教师模型,模拟不同学习偏好的学生原型。与依赖演示或预设教学标准的方法不同,Sherpa基于个体学生的学习结果动态调整教学策略,实现更个性化的教学过程,提升教学有效性。(论文赞 6)
在 Hugging Face 查看

排行第五:学习神经网络压缩的功能子空间
该论文提出可学习子空间投影(LSP)方法,用于神经网络压缩。与现有方法仅基于局部准则选择要移除的子空间不同,LSP端到端学习丢弃的子空间,考虑误差在网络中的传播,从而在高压缩率下避免性能崩溃,提升压缩效率。(论文赞 3)
在 Hugging Face 查看

排行第六:Stepped MoE: 可配置推理复杂度的分段路由
该论文提出Stepped MoE框架,将弹性结构与稀疏门控架构结合,使模型能同时适应部署约束和任务需求。通过分段级路由机制,实现计算复杂度的可配置推理,解决大语言模型训练资源密集和部署场景多样化的问题,提升模型的灵活性和适应性。(论文赞 2)
在 Hugging Face 查看

排行第七:Kinematic MeanFlow: 机器人基础模型的一步动作生成策略
本文研究如何在机器人基础模型中实现一步动作生成,以克服多步流匹配的高推理延迟。MeanFlow 提供了一个有前景的框架,但直接应用会导致性能崩溃。作者发现这是由于RFM速度场中的两种独特动态:早期局部加速度稳定,后期急剧上升;随着去噪进行,其幅度在样本间扩散变宽。为此,提出Kinematic MeanFlow(K-MF),一种针对机器人的新型一步动作策略。(论文赞 1)
在 Hugging Face 查看

排行第八:OPD Before RL: 基于策略蒸馏的评分强化学习
许多语言模型任务无法通过精确结果验证。基于评分的强化学习通过评分开放响应来解决此问题,但奖励在完整响应后分配,无法直接识别个体决策对最终得分的贡献。本文提出两阶段训练框架:第一阶段使用评分作为特权教师上下文进行密集的词级监督,第二阶段作为奖励进行进一步强化学习。第一阶段采用评分特权的在线策略蒸馏(RP-OPD),学生模型在无评分访问的情况下匹配教师模型的下一个词分布。(论文赞 3)
在 Hugging Face 查看

排行第九:理由引导的策略优化:自适应理由支架学习推理
在策略强化学习已成为提升大语言模型推理能力的核心范式。然而,其有效性常受限于奖励稀疏性:当模型未能发现困难问题的正确轨迹时,优化过程接收的有用信号很少,可能导致停滞。现有方法通过引入离策略演示、专家轨迹或模型生成的解决方案来缓解此问题,但通常要求辅助数据与强化学习任务格式匹配,常依赖更强模型的拒绝采样获取合适训练轨迹。本文提出一种新的理由引导策略优化方法。(论文赞 9)
在 Hugging Face 查看

排行第十:使用MoE路由器的解码器模型跨语言对齐
跨语言对比学习是多语言编码器训练的核心组件,但解码器-only大语言模型由于多语言分词差异,无法显式对齐表示。然而,越来越多的研究表明,即使在大语言模型中,更高的跨语言表示对齐也能提升跨语言迁移能力。本文提出一种新方法,在现代大语言模型的架构约束下重新构想跨语言对比学习。不直接在隐藏状态上应用辅助对齐损失,而是提出使用混合专家(MoE)路由器的输出作为对齐目标。(论文赞 1)
在 Hugging Face 查看

排行第十一:混合注意力大语言模型的多语言性
为应对代理和推理用例中对长序列日益增长的需求,许多最先进的大语言模型结合多种注意力变体以缓解传统softmax注意力的二次复杂性。这些混合注意力大语言模型旨在平衡全注意力和基于递归的替代方案的优缺点。本文首次研究混合注意力对大语言模型多语言性的影响。除了对低分词语言中长序列的影响外,研究还受到递归状态的归纳偏置可能改变语言处理的启发。我们的可解释性分析证实了这一点,显示跨语言表示在递归机制中存在差异。(论文赞 2)
在 Hugging Face 查看

排行第十二:S2PD: 串行到并行扩散实现物理逻辑一致视频生成
双向视频扩散模型并行去噪整个视频,但在从程序生成器获得的有效无限分布数据上训练时,仍会违反物理定律和简单符号规则。本文提出串行到并行扩散(S2PD),在高噪声阶段执行自回归扩散,然后在低噪声阶段切换到并行扩散。自回归阶段提供协调相互依赖事件和生成有效状态转换所需的串行计算,而并行阶段联合细化整个视频并相对于完全串行生成减少采样时间。我们实现了两种S2PD架构:像素空间扩散模型和基于Transformer的模型。(论文赞 1)
在 Hugging Face 查看



扫描二维码,在手机上阅读

热榜(2026年10月08日 03:15 北京时间)

Google DeepMind:推特用户Pushmeet Kohli说,构建预测性生物模型是…

评 论
评论已关闭