HF榜单(2026年10月03日 21:45 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5042,趋势分 981。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5042 · 趋势分 981)
在 Hugging Face 查看

排行第二:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 914,趋势分 878。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 914 · 趋势分 878)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2891,趋势分 709。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2891 · 趋势分 709)
在 Hugging Face 查看

排行第四:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 687,趋势分 403。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 687 · 趋势分 403)
在 Hugging Face 查看

排行第五:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6062,趋势分 392。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6062 · 趋势分 392)
在 Hugging Face 查看

排行第六:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 386,趋势分 370。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 386 · 趋势分 370)
在 Hugging Face 查看

排行第七:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2874,趋势分 366。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2874 · 趋势分 366)
在 Hugging Face 查看

排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16850,趋势分 363。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16850 · 趋势分 363)
在 Hugging Face 查看

排行第九:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 326,趋势分 317。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 326 · 趋势分 317)
在 Hugging Face 查看

排行第十:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 388,趋势分 273。标签:computer-vision、visionhope。(点赞 388 · 趋势分 273)
在 Hugging Face 查看

排行第十一:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 560,趋势分 261。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 560 · 趋势分 261)
在 Hugging Face 查看

排行第十二:OrcaSAQ-2-Cyber-27B-Uncensored-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 298,趋势分 253。标签:llama.cpp、qwen、qwen3.8、qwen3_5、orcasaq2。(点赞 298 · 趋势分 253)
在 Hugging Face 查看

论文

排行第一:用Jev决策模型替代大语言模型
该研究将Jev决策模型集成到边缘服务编排中,以减少自然语言服务请求的决策延迟。通过提取有限的意图字段并应用共享验证器和调度器,在请求时间线上考虑决策等待时间,相比大语言模型显著提升响应速度。(论文赞 5)
在 Hugging Face 查看

排行第二:Ego2Act:评估自述视频生成中的目标导向操作
提出Ego2Act基准,用于评估自述视频生成模型在多步骤物理推理和目标导向操作方面的表现。该基准关注高阶目标实现所需的真实世界操作序列,填补了现有评估方法在复杂任务上的空白。(论文赞 14)
在 Hugging Face 查看

排行第三:MemFold:通过在线策略优化学习紧凑软记忆
MemFold提出一种固定预算的软记忆机制,用于长期上下文个性化。通过优化记忆行为而非仅重建文本,实现高效信息压缩与用户偏好跟踪,避免传统方法中信息膨胀和表达偏差问题。(论文赞 6)
在 Hugging Face 查看

排行第四:视频生成模型:微调与对齐综述
本文综述了视频生成模型在后训练和对齐方面的进展,指出尽管预训练模型具备强大生成能力,但在遵循人类意图、保持时间一致性等方面仍存在挑战,需系统性策略进行改进。(论文赞 37)
在 Hugging Face 查看

排行第五:人格剂量:分级特质控制的校准激活引导
PersonaDose通过描述性特质和请求强度控制语言模型的人格表达。在多个模型上验证其效果,显著提升核心特质表达水平,同时实现更精确的个性化控制,优于传统激活添加方法。(论文赞 23)
在 Hugging Face 查看

排行第六:Transformer过早停止思考,Tiny LoRA修复它
研究发现预训练Transformer在上下文引用方面计算深度不足,通过在早期层添加秩8的LoRA微调,显著提升长链推理能力,使模型能处理更长的上下文线索,解决早期停止思考问题。(论文赞 61)
在 Hugging Face 查看

排行第七:Honeycomb:用于视频世界模型的恒定大小场景记忆表示
视频世界模型需要持久的场景记忆以在长时视频生成中保持一致性。现有空间记忆通过积累RGB观测或潜在特征,随着生成过程的进行存储需求增加。本文提出Honeycomb,一种基于HexMemory的视频世界模型,采用低秩表示在固定大小的记忆中存储场景特征,总共包含六个空间和时空平面。前馈写入器将每个生成的片段映射到新的平面特征中。当空间覆盖范围或时间范围扩大时,我们通过保持其维度来变形之前的平面,并通过置信度加权与新特征融合。(论文赞 5)
在 Hugging Face 查看

排行第八:X-Tree:用于高效智能体泛化的可重用经验分词方法
多步骤智能体通常在扁平的动作流上进行训练:SFT和RLVR对每个token的权重相同,忽略了跨任务重复出现的子程序以及人类通过可重用的例行程序自上而下规划的层次结构。这种结构未被充分利用,扁平化训练未能充分利用每条稀缺轨迹的内容。近期的智能体虽然使用了这种结构,但仅限于上下文中的LLM生成技能,从未体现在模型权重中,因此其优势无法泛化到检索之外。本文从数据本身恢复这种层次结构并进行训练,无需调用LLM。(论文赞 25)
在 Hugging Face 查看

排行第九:OpenTumorBoard:多学科肿瘤委员会讨论轨迹的真实世界基准
多学科肿瘤委员会通过专家讨论整合多模态临床观察和长期患者病史,但现有基准很少捕捉这些真实世界轨迹。本文引入OpenTumorBoard,一个包含611个患者案例和19,157次讨论回合的基准,涵盖十个专家角色,数据来自YouTube上12,534分钟的公开肿瘤委员会录音。该基准评估两种场景:SPECIALIST TURN,即LLM对真实讨论中提出的临床重要问题进行回应;BOARD SIMULATION,即LLM生成完整的讨论并达成治疗建议的共识。(论文赞 11)
在 Hugging Face 查看

排行第十:关键词触发器失效:用于小语言模型工具使用声明的廉价诊断方法
基于关键词匹配的基准可能错误地赋予小模型其从未执行过的工具使用能力。本文记录了一个匹配架构的西班牙语安全语言模型中的此类误判,并提出一套严格且廉价的诊断方法。一个661.6M参数模型(约65%为代码/技术文本;无专门的SFT)和一个1,109M参数模型(以网络为主的多阶段课程;6B标记的工具SFT)共享解码器、分词器和特殊标记,在宽松的工具使用指标上得分几乎相同(B4:0.660 vs. 0.650)。通过在训练示例上进行逐字再现检查,可以完全区分这两个模型。(论文赞 5)
在 Hugging Face 查看

排行第十一:ScholarCatalyst:用于检索启发新研究的论文的基准
什么使伟大的科学家变得伟大?尽管AI系统开始在开放问题上取得进展,科学家们仍远超AI,能够感知到新问题需要哪些被埋藏在不断增长的研究档案中的先前想法。为研究这一技能,我们收集了那些亲身经历过哪些早期工作推动其完成项目的研究人员的数据,论文作为其中思想的指针。通过我们的自动化流程,使作者标注可扩展,我们构建了ScholarCatalyst,由207篇近期计算机科学论文的184位主要作者标注哪些候选论文确实或可能推动其项目,并附有详细理由。我们引入了一个由作者提供的检索任务。(论文赞 9)
在 Hugging Face 查看

排行第十二:策略学习还是离线策略学习?对蒸馏动态的系统研究
策略学习被认为可以减少灾难性遗忘,产生更稀疏的参数更新,并提高泛化能力。然而,现有对监督微调和强化学习的比较同时改变了多个因素,使得滚动策略的贡献难以分离。本文在受控的强到弱蒸馏设置中研究滚动策略的影响,通过独立改变滚动策略、token级KL方向和学习率,覆盖Llama3和Qwen2.5模型家族以及涵盖科学、医学和算术领域的推理任务。我们的分析揭示了蒸馏动态的复杂图景,其中滚动策略在不同场景下表现出不同的效果。(论文赞 150)
在 Hugging Face 查看



扫描二维码,在手机上阅读

中文科技热榜(2026年10月03日 21:45 北京时间)

HN榜单(2026年10月03日 21:45 北京时间)

评 论
评论已关闭