HF榜单(2026年09月30日 06:45 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4500,趋势分 1811。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4500 · 趋势分 1811)
在 Hugging Face 查看

排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1484,趋势分 1305。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1484 · 趋势分 1305)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2426,趋势分 1088。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2426 · 趋势分 1088)
在 Hugging Face 查看

排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 866,趋势分 732。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 866 · 趋势分 732)
在 Hugging Face 查看

排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2655,趋势分 716。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2655 · 趋势分 716)
在 Hugging Face 查看

排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 524,趋势分 515。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 524 · 趋势分 515)
在 Hugging Face 查看

排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 515,趋势分 496。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 515 · 趋势分 496)
在 Hugging Face 查看

排行第八:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1807,趋势分 422。标签:xing4_0、conversational、custom_code。(点赞 1807 · 趋势分 422)
在 Hugging Face 查看

排行第九:ZDTaichu5.0-9B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1947,趋势分 396。标签:zdtaichu5_0、multimodal、vision-language-model、spatial-reasoning、agent。(点赞 1947 · 趋势分 396)
在 Hugging Face 查看

排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 423,趋势分 389。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 423 · 趋势分 389)
在 Hugging Face 查看

排行第十一:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2265,趋势分 356。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2265 · 趋势分 356)
在 Hugging Face 查看

排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16564,趋势分 354。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16564 · 趋势分 354)
在 Hugging Face 查看

论文

排行第一:WhiteMatter:通过KV源混合实现全层连接
该研究提出WhiteMatter模型,允许Transformer每一层从任意深度获取历史token表示,通过学习混合器选择最有效的深度并组合其表示到共享的键值缓存通道中,从而提升信息复用效率并减少缓存大小。(论文赞 1)
在 Hugging Face 查看

排行第二:我们能相信教师吗?解耦信用方向与幅度的自蒸馏方法
本文针对强化学习中信用分配的耦合问题,提出解耦信用方向与幅度的自蒸馏方法DCSD,将信用方向和贡献幅度分离为两个可靠信号,以提高教师监督的鲁棒性和准确性。(论文赞 2)
在 Hugging Face 查看

排行第三:ExpVoyager:动态代理技能合成的直接经验导航
该研究提出ExpVoyager方法,通过直接经验导航实现动态代理技能合成,将积累的经验转化为可重用的程序知识,在运行时为代理提供支持,避免固定程序知识的局限性。(论文赞 8)
在 Hugging Face 查看

排行第四:Allspark:通过交替思维链实现弱到强迁移
该研究提出Allspark框架,通过交替思维链实现弱模型向强模型的迁移学习,无需在训练中使用强模型的回滚数据,从而降低训练成本并提升推理性能。(论文赞 2)
在 Hugging Face 查看

排行第五:SentZero:增强句子中心视觉语言预训练用于多任务零样本胸部X光分析
本文提出SentZero方法,通过句子级视觉语言预训练提升胸部X光图像的零样本分析能力,克服了传统方法在临床报告对齐方面的局限性,提高模型在多任务场景下的泛化能力。(论文赞 25)
在 Hugging Face 查看

排行第六:谁获得token,它承载什么?大语言模型中名称支持与概念访问的不平等
该研究探讨了大语言模型中名称处理的不平等现象,发现相同名称在不同模型中可能被表示为单token或多个子词,揭示了名称表面支持的不一致性及其对模型公平性的影响。(论文赞 1)
在 Hugging Face 查看

排行第七:VisionHOPE:视觉主干作为自修改学习系统
视觉主干从具有局部聚合的卷积神经网络(CNN)发展到具有全局交互的视觉变换器(ViTs)、具有输入依赖状态转移的状态空间模型(SSMs)以及在处理图像时适应内部学习器的测试时训练(TTT)层。在这一过程中,视觉计算对每个输入的适应性逐渐增强,但这种适应性的规则仍主要由训练好的主干所规定。本文引入了VisionHOPE,这是首个将视觉主干定义为自修改学习系统的通用框架,模型在处理图像时能够共同演化其记忆和学习方式。(论文赞 106)
在 Hugging Face 查看

排行第八:用Night Science强化科学构想中的智能体创造力
大型语言模型(LLMs)在结构化和可验证任务中表现出色,但其低熵偏差可能导致输出同质化和可预测性,限制了其在开放性科学构想中的应用。有效的科学发现需要更广泛的创造力,从结构化的日间科学到松散结构、偶然发现的夜间科学。本文提出AI Night-Scientist,一个基于强化学习的智能体框架,教会模型何时以及如何偏离可预测的推理。该框架基于认知科学,从行动、过程和结果三个维度建模创造力。(论文赞 2)
在 Hugging Face 查看

排行第九:几何作为地址:用于长时程相机控制视频生成的视觉记忆注意力路由
长时程相机控制视频生成需要从不断增长的视觉历史中恢复之前观察到的内容。现有方法要么隐式搜索历史上下文,要么将其重建为持久的3D记忆,面临记忆访问效率低或几何误差累积的问题。本文的关键见解是,几何不需要解释场景,只需要确定从哪里读取视觉记忆,而注意力机制决定恢复什么内容。基于这一见解,我们提出GEAR,一种基于几何的注意力路由框架,利用几何作为显式的标记级地址来访问视觉记忆。(论文赞 2)
在 Hugging Face 查看

排行第十:SCOPD:用于高效视觉语言模型的稀疏上下文策略梯度自蒸馏
视觉语言模型(VLMs)将图像和视频处理为长序列的视觉标记,导致推理成本高昂。无训练标记剪枝可以降低这一成本,但过度压缩可能导致性能显著下降,通常归因于任务相关视觉信息的不可逆丢失。我们发现这一解释并不完整。在固定上下文的Pass@K分析中,从相同的剪枝视觉表示中重复采样可以恢复许多贪心解码遗漏的示例,表明有用的视觉证据仍可被访问但可能被不可靠地使用。我们称这一现象为表示-利用差距。受此启发,我们提出SCOPD,一种稀疏上下文策略梯度自蒸馏方法,以提高视觉语言模型的效率。(论文赞 2)
在 Hugging Face 查看

排行第十一:Pruned CTC:用于大词汇量语音识别训练的记忆高效方法
连接主义时间分类(CTC)自然支持基于句子级别的监督的离线和流式语音识别,但传统实现方式在内存中显式化每帧与词汇的激活,使得使用原生大语言模型(LLM)词汇进行CTC训练时内存消耗过高。一个关键观察是,每个有效的CTC对齐只使用目标标记和空白标记,而它们在一批数据中的联合通常只构成完整词汇的一小部分。我们提出Pruned CTC,将对齐计算限制在该子集内,同时保留全词汇的归一化。我们证明这种词汇缩减在损失函数上与全词汇CTC完全等价。(论文赞 2)
在 Hugging Face 查看

排行第十二:AnswerMap:从答案后验构建视觉语言模型的忠实空间可解释性
当视觉语言模型(VLM)回答视觉问题时,当前的可解释性工具依赖于文本理由,这涉及模态不匹配,或依赖于模型内部的输出,这些输出过早生成,无法反映最终结果,且需要白盒访问权限。我们提出AnswerMap,一种无需训练、任务无关、黑盒的视觉理由方法,通过模型输出头构建。图像被分割为K行和K列的条带,每个条带单独输入冻结模型,并以是/否相关性问题的形式附带查询。行和列的“是”后验的外积生成查询条件下的空间图。通过在AnswerMap上定义固定的读取方式(如期望值、最大值),可以实现对(论文赞 2)
在 Hugging Face 查看



扫描二维码,在手机上阅读

中文科技热榜(2026年09月30日 06:45 北京时间)

X榜单(2026年09月30日 06:30 北京时间)

评 论
评论已关闭