HF榜单(2026年10月04日 17:15 北京时间)


clef(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1052,趋势分 1006。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 1052 · 趋势分 1006)
在 Hugging Face 查看

排行第二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5105,趋势分 886。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5105 · 趋势分 886)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2966,趋势分 673。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2966 · 趋势分 673)
在 Hugging Face 查看

排行第四:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6179,趋势分 407。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6179 · 趋势分 407)
在 Hugging Face 查看

排行第五:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 377,趋势分 366。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 377 · 趋势分 366)
在 Hugging Face 查看

排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2913,趋势分 348。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2913 · 趋势分 348)
在 Hugging Face 查看

排行第七:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16898,趋势分 347。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16898 · 趋势分 347)
在 Hugging Face 查看

排行第八:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 695,趋势分 296。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 695 · 趋势分 296)
在 Hugging Face 查看

排行第九:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 295,趋势分 290。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 295 · 趋势分 290)
在 Hugging Face 查看

排行第十:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 392,趋势分 277。标签:computer-vision、visionhope。(点赞 392 · 趋势分 277)
在 Hugging Face 查看

排行第十一:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 404,趋势分 274。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 404 · 趋势分 274)
在 Hugging Face 查看

排行第十二:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 654,趋势分 239。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 654 · 趋势分 239)
在 Hugging Face 查看

论文

排行第一:用Jev决策模型替代大语言模型实现低延迟边缘服务编排
自然语言服务请求在执行前可能需要语言模型进行决策,消耗部分延迟预算。本文将Jev的决策导向API集成到边缘服务编排中,以减少这一开销,同时确保服务完成。该集成提取四到八个有限意图字段,并应用共享验证器、准入策略和调度器,考虑请求时间线中决策等待的影响。论文在8280个验证请求和一个实时准入路径上,对Jev、两个自托管决策模型和三个托管大语言模型进行了比较。(论文赞 5)
在 Hugging Face 查看

排行第二:Ego2Act:评估以自我为中心视频生成中的目标导向操作
视频生成模型正被越来越多地用作具身规划和学习的世界模拟器。为此,这些模型不仅要生成视觉上吸引人的帧,还要预测执行目标导向操作时环境如何动态演变。尽管评估这些能力至关重要,但现有基准主要集中在单一短动作或逐步指令上,而对多步骤物理推理的探索较少,特别是在需要规划以模拟正确执行以完成高层目标的自我中心视频生成中。本文引入Ego2Act,一个目标导向的基准。(论文赞 21)
在 Hugging Face 查看

排行第三:MemFold:通过策略优化学习紧凑的软记忆用于长上下文个性化
一个长期为同一用户服务的助手需要根据用户透露的信息来回答问题:哪些偏好仍然有效,哪些已被修改,哪些约束现在适用。保留这些信息与根据这些信息行动是不同的,但通常被当作同一目标进行优化。将信息保存为文本会使用户的输入随历史记录增长,而将其压缩为固定数量的潜在向量虽然限制了接口,但通常训练时用于重建文本或模仿参考答案,这些文本或答案都是用户从未生成的序列。本文提出MemFold,通过其支持的行为来优化固定预算的软记忆。(论文赞 6)
在 Hugging Face 查看

排行第四:视频生成模型:后训练与对齐的综述
视频生成技术已从短而低质量的片段快速发展为具有复杂时空动态的高分辨率、长时序视频。尽管通过大规模预训练学习到了强大的生成先验知识,但预训练视频模型通常难以可靠地遵循人类意图、保持时间一致性或满足物理和安全约束。与图像和文本生成相比,视频生成中的对齐面临独特挑战,包括时间上的误差累积、运动与外观的耦合、多目标权衡以及对时间属性的监督有限。这些挑战促使系统性后训练策略来调整预训练模型。(论文赞 44)
在 Hugging Face 查看

排行第五:个性剂量:用于渐进特征控制的校准激活引导
激活引导系数设定干预强度,但请求特定程度的个性表达需要行为尺度。本文研究个性剂量:通过特征描述和请求的平均强度来控制语言模型。PersonaDose在个性响应上专门化了一个共享的、描述条件化的FLAS控制器,然后将其流动时间与测量的特征表达进行校准。训练响应未与请求的目标强度配对。在Llama-3.1-8B、Qwen3-8B和Gemma-3-4B上,PersonaDose在个性向量一致性基线75的情况下,分别将核心特征表达提高了33.2、18.3和17.8个百分点。(论文赞 40)
在 Hugging Face 查看

排行第六:Transformer太早停止思考,而一个微小的LoRA可以解决
预训练的Transformer模型在遵循上下文中的参考时使用了很少的深度。十三个基础模型只能可靠地遵循1.4到3.6行内容,额外的预训练循环增加不多。一个任务训练的秩8 LoRA在早期一层扩展了这一计算,且冻结了所有模型权重。Qwen3-8B在24行链上将精确准确率从15.5%提升至99%;一个更长训练的LoRA可达到50行。Ouro-1.4B经过四次循环后可达到60行,八次循环后至少160行。LoRA启动了一个中继:程序行通过中间层的短范围传递其链身份。冻结的头部可以逐步读(论文赞 62)
在 Hugging Face 查看

排行第七:Honeycomb:视频世界模型的固定大小场景记忆表示
视频世界模型需要持久的场景记忆,以在长时间视频生成过程中保持一致性。现有空间记忆积累RGB观察或潜在特征,随着生成的推进,存储需求不断增加。我们引入了Honeycomb,这是一种基于HexMemory的视频世界模型,我们在低秩表示上构建了固定大小的内存,总共有六个空间和时空平面。我们通过反馈前向写入器将每个生成的块映射到新的平面特征。随着空间覆盖或时间范围的扩展,我们将之前的平面进行变形,同时保持其维度,然后通过置信加权将它们与新的特征融合。(论文赞 5)
在 Hugging Face 查看

排行第八:X-Tree:通过令牌化可复用经验实现高效代理泛化
多步骤代理在平坦的动作流上进行训练:SFT和RLVR均匀地为每个令牌加权,并忽略跨任务的重复子程序,这些子程序使人类能够从上往下规划,从可复用的常规程序中受益。这种结构未被利用,平坦的训练方式使每个稀缺轨迹的使用不如其内容允许的那样充分。最近的一些代理确实利用了这种结构,但仅在由LLM编写的技能在上下文中使用时才如此,其权重中从未包含这些结构,因此它们的收益无法泛化到超出检索的范围。我们则从数据中自身恢复这种结构并进行训练,无需任何LLM调用。类似于文本令牌器,我们根据动作跨(论文赞 41)
在 Hugging Face 查看

排行第九:OpenTumorBoard:多学科肿瘤委员会讨论轨迹的真实世界基准
多学科肿瘤委员会通过专家讨论整合多模态临床观察和纵向患者病史,但基准很少捕捉这些真实世界轨迹。我们引入了OpenTumorBoard,该基准包含184名计算机科学论文作者,他们对207篇最近论文进行了标注,每篇论文都有详细的理由。我们构建了一个检索任务,提供作者标注的论文指针,以评估肿瘤委员会讨论的真实世界轨迹。(论文赞 11)
在 Hugging Face 查看

排行第十:关键词夹具失效:小型语言模型工具使用声明的廉价诊断方法
基于关键词匹配的基准可能会为小型模型从未执行过的工具使用赋予信用。我们记录了一个这样的虚假阳性案例,涉及一对西班牙安全语言模型。我们提出了一种严格的廉价诊断阶梯:一个661.6M参数的模型(约65%的代码/技术文本;没有专门的SFT)和一个1,109M参数的模型(网络丰富的多阶段课程;6B令牌工具SFT)共享解码器、令牌器和特殊标记,在宽松的工具使用指标(B4:0.660 vs. 0.650)上几乎相同。对训练示例的逐字再现检查将它们完全分开:600M模型在6/6示例中正确发(论文赞 5)
在 Hugging Face 查看

排行第十一:ScholarCatalyst:检索启发新研究的论文的基准
什么使伟大的科学家伟大?即使在AI系统开始解决开放问题时,科学家仍然远远领先于他们,能够感知哪篇先前的论文 buried 在不断增长的研究档案中,一个新问题需要。我们通过自动化管道来研究这种技能,该管道使作者注释可扩展,构建了ScholarCatalyst,该管道由184名计算机科学论文作者对207篇最近论文进行标注,每篇论文都有详细的理由。我们引入了一个检索任务,提供作者标注的论文指针,以评估肿瘤委员会讨论的真实世界轨迹。(论文赞 9)
在 Hugging Face 查看



扫描二维码,在手机上阅读

HN榜单(2026年10月04日 17:15 北京时间)

X榜单(2026年10月04日 17:21 北京时间)

评 论
评论已关闭