HF榜单(2026年09月30日 03:45 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4489,趋势分 1873。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4489 · 趋势分 1873)
在 Hugging Face 查看

排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1479,趋势分 1300。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1479 · 趋势分 1300)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2405,趋势分 1109。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2405 · 趋势分 1109)
在 Hugging Face 查看

排行第四:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2649,趋势分 731。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2649 · 趋势分 731)
在 Hugging Face 查看

排行第五:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 863,趋势分 729。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 863 · 趋势分 729)
在 Hugging Face 查看

排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 519,趋势分 511。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 519 · 趋势分 511)
在 Hugging Face 查看

排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 508,趋势分 490。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 508 · 趋势分 490)
在 Hugging Face 查看

排行第八:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1807,趋势分 460。标签:xing4_0、conversational、custom_code。(点赞 1807 · 趋势分 460)
在 Hugging Face 查看

排行第九:ZDTaichu5.0-9B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1947,趋势分 397。标签:zdtaichu5_0、multimodal、vision-language-model、spatial-reasoning、agent。(点赞 1947 · 趋势分 397)
在 Hugging Face 查看

排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 417,趋势分 394。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 417 · 趋势分 394)
在 Hugging Face 查看

排行第十一:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2260,趋势分 368。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2260 · 趋势分 368)
在 Hugging Face 查看

排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16557,趋势分 355。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16557 · 趋势分 355)
在 Hugging Face 查看

论文

排行第一:ExpVoyager:基于直接经验的动态智能体技能合成
学习经验在大型语言模型智能体中已成为开发自我演进智能体的关键范式。在此范式下,合成智能体技能是一种有前景的解决方案,可将积累的经验转化为可重用的过程性知识,作为运行时为智能体提供支持的重要层级。尽管其潜力巨大,现有方法大多在下游需求明确前将过去经验抽象为固定过程性知识,这可能导致丢弃后续任务中关键的知识,同时保留对未来任务无关的具体细节。本文提出...(论文赞 7)
在 Hugging Face 查看

排行第二:Allspark:通过交替思维链实现弱到强的迁移
前沿模型的最新进展重新激发了对大规模强化学习(RL)的兴趣,但生成大型模型轨迹的成本使得即使测试RL方案也变得昂贵。我们提出一个问题:是否可以在不使用强模型轨迹进行训练的情况下,将弱模型学到的推理改进迁移到更强的模型中。我们引入Allspark,一个通过交替思维链实现弱到强迁移的训练与推理框架。弱教师模型与同一模型的冻结副本一同训练,两者交替进行推理段,冻结模型生成最终答案。在推理阶段,更强的学生模型取代冻结的训练模型...(论文赞 1)
在 Hugging Face 查看

排行第三:SentZero:增强的句子中心视觉-语言预训练用于多任务零样本胸部X光分析
使用配对的胸部X光(CXR)图像和放射学报告进行视觉-语言(VL)预训练,已显示出在医学图像理解方面的强大潜力。然而,现有方法通常仍依赖于特定任务的微调,因为放射学报告内容冗长、临床信息密集,难以与简单的零样本提示对齐。近期的句子级方法部分解决了这一限制,利用大型语言模型(LLMs)提取的临床短语,但大多忽略了放射学话语的内在特征。特别是,正样本对的多样性有限,限制了进一步提升,而临床等价句子在不同患者中频繁出现...(论文赞 25)
在 Hugging Face 查看

排行第四:谁获得了一个token,它又携带了什么?大语言模型中姓名支持与概念访问的不平等
姓名是个人标识符,但它们也承载着社会意义,并被广泛用于评估语言模型如何对待不同的人。此类评估通常假设匹配的姓名是可比较的模型输入。我们表明,这一假设在词汇接口上经常失效:匹配的姓名未必是匹配的输入。一些姓名可以直接通过单个token访问,而另一些则由多个子词组成,导致姓名表层支持的不平等。在近一半的百万个名字和12种与大语言模型相关的分词器中,直接词汇访问具有高度的选择性,依赖于模型本身,并在与种族和性别相关的姓名元数据中存在显著差异。我们引入NameTrace...(论文赞 1)
在 Hugging Face 查看

排行第五:VisionHOPE:视觉主干作为自我修改的学习系统
视觉主干已从具有局部聚合的卷积神经网络(CNN)发展为具有全局交互的视觉变换器(ViTs)、具有输入依赖状态转换的状态空间模型(SSMs)以及在处理图像时适应内部学习器的测试时训练(TTT)层。随着这一发展,视觉计算对每个输入的适应性不断增强,但这种适应性的规则主要由训练好的主干所规定。我们引入VisionHOPE,首个将视觉主干作为自我修改学习系统的通用框架,其中模型的记忆和学习方式在图像处理过程中共同演进。基于自修改的...(论文赞 106)
在 Hugging Face 查看

排行第六:Night Science:通过强化学习增强智能体在科学构想中的创造力
大型语言模型(LLMs)在结构化和可验证的任务中表现出色,但其低熵偏差可能导致输出同质化和可预测性,限制了其在开放性科学构想中的应用。然而,有效的科学发现涵盖了更广泛的创造性维度:从结构化的“日间科学”到松散结构、偶然发现的“夜间科学”,后者能够触及通常未被考虑的创意。我们提出AI Night-Scientist,一个基于强化学习的智能体框架,教会模型何时以及如何偏离可预测的推理。基于认知科学,我们从三个维度建模创造力:行动(做什么以及如何创造性地做)、过程(何时探索与何时解(论文赞 2)
在 Hugging Face 查看

排行第七:几何作为地址:为长时相机控制视频生成路由注意力的视觉记忆
长时相机控制视频生成需要从未见过的视觉历史中恢复先前观察的内容。现有方法要么隐式搜索历史上下文,要么将上下文重构为持久的3D内存,分别面临低效的内存访问或累积的几何误差。我们的关键洞察是,几何不需要解释场景,只需确定从哪里读取视觉记忆,而注意力决定应恢复什么。基于这一洞察,我们引入了GEAR,一个几何启发的注意力路由框架,使用几何作为视觉记忆的显式令牌级地址。(论文赞 2)
在 Hugging Face 查看

排行第八:SCOPD:稀疏上下文在线自蒸馏以提高视觉语言模型的效率
推理视觉语言模型(VLMs)处理图像和视频为长序列视觉标记,使推理变得昂贵。训练-free标记修剪可以减少这种成本,但过度压缩会显著降低性能,通常归因于不可逆地丢失任务相关的视觉信息。我们表明,这种解释是不完整的。在一个固定的上下文Pass@K分析中,重复采样相同的修剪视觉表示可以恢复许多贪心解码错过的示例,表明有用的视觉证据可以保持可用但使用不可靠。我们称此为表示利用差距。受此启发,我们引入了SCOPD,一个稀疏上下文在线自蒸馏框架。(论文赞 2)
在 Hugging Face 查看

排行第九:Pruned CTC:为高效大型词汇语音识别训练内存优化
连接时序分类(CTC)自然支持离线和时间流语音识别,具有语句级监督,但传统实现将帧-by-词汇激活材料化在内存中,使使用原生词汇表的大型语言模型(LLM)进行CTC训练变得极其内存密集。一个关键观察是,每个有效的CTC对齐仅使用目标标记和空白符,在一批次的联合通常形成全词汇表的一个小子集。我们引入了Pruned CTC,该方法限制对齐计算仅为此子集,同时保留全词汇表的规范化。我们证明,这种词汇缩减在损失方面与完整词汇表的CTC完全等价。(论文赞 2)
在 Hugging Face 查看

排行第十:AnswerMap:从答案后验中获得视觉语言模型的空间可解释性
当VLM回答视觉查询时,当前使用的解释工具依赖于文本理由,这使用了不匹配的模态,或者依赖于内部读取,这些读取起源于太早的阶段,无法反映最终输出,并且需要模型的白色盒访问。我们引入了AnswerMap,一个训练-free、任务无关、黑盒视觉理由,从输出头构造。图像被切割成K行和K列的条带,每个条带单独显示给冻结模型 along with the query in the format of a yes/no relevance question. The outer produ(论文赞 2)
在 Hugging Face 查看

排行第十一:强化学习后蒸馏防御易被攻破
蒸馏攻击复制封闭源代码大型语言模型(LLMs)的推理能力,允许攻击者在低成本下复制最先进性能。攻击者系统地收集前沿模型推理轨迹,然后在这些轨迹上训练(即“蒸馏”)自己的模型。现有防御蒸馏攻击的方法通常在蒸馏后立即评估,隐含假设攻击者不会进一步训练其模型。我们认为这种评估方式过于乐观。在现实威胁模型中,攻击者在蒸馏后使用强化学习进一步训练模型。如果威胁模型指定不当,可能会导致虚假的安全感——一些防御措施可能无法有效防止未来的强化学习攻击。(论文赞 1)
在 Hugging Face 查看

排行第十二:FactorEngram:为语言模型实现参数优化的分解N-gram记忆与基级门控
基于查找的记忆一直是扩展大型语言模型(LLMs)参数的一种有希望的方法。它检索已学习局部标记模式(如n-gram)的表示,而不是通过连续的层计算重构它们。然而,现有设计如Engram将每个检索嵌入视为一个整体。每个嵌入存储在各自的哈希槽中,并由单个标量门控调制。因此,多义词无法选择性读取其记忆的相关部分。此外,参数仅在哈希碰撞中共享,这与语义无关。我们提出了FactorEngram,一个分解记忆与基级门控框架,以提高语言模型的效率和灵活性。(论文赞 2)
在 Hugging Face 查看



扫描二维码,在手机上阅读

Trump Truth:最新消息:美国总统特朗普正在采取重大行动来保护你的钱包!尽管…

HN榜单(2026年09月30日 03:45 北京时间)

评 论
评论已关闭