HF榜单(2026年10月02日 18:45 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4895,趋势分 1147。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4895 · 趋势分 1147)
在 Hugging Face 查看

排行第二:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1243,趋势分 898。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1243 · 趋势分 898)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2751,趋势分 766。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2751 · 趋势分 766)
在 Hugging Face 查看

排行第四:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 511,趋势分 507。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 511 · 趋势分 507)
在 Hugging Face 查看

排行第五:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 633,趋势分 413。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 633 · 趋势分 413)
在 Hugging Face 查看

排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2808,趋势分 410。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2808 · 趋势分 410)
在 Hugging Face 查看

排行第七:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5896,趋势分 371。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5896 · 趋势分 371)
在 Hugging Face 查看

排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16748,趋势分 348。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16748 · 趋势分 348)
在 Hugging Face 查看

排行第九:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 349,趋势分 335。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 349 · 趋势分 335)
在 Hugging Face 查看

排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 514,趋势分 287。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 514 · 趋势分 287)
在 Hugging Face 查看

排行第十一:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 612,趋势分 279。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 612 · 趋势分 279)
在 Hugging Face 查看

排行第十二:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2341,趋势分 256。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2341 · 趋势分 256)
在 Hugging Face 查看

论文

排行第一:LOCI:用于流式世界模型的空间线性记忆
LOCI提出了一种混合空间记忆架构,旨在让视频世界模型在相机重访已观察区域时能重现先前内容。它结合了键值缓存和循环记忆的优势:一半Transformer块保留过去观察的键值缓存以维持视觉细节,另一半则限制在当前块内并辅以循环机制来压缩历史。这种方法解决了纯缓存方法随视频长度增长而膨胀,以及纯循环记忆因固定大小状态而无法直接访问单个过去观察的问题。(论文赞 3)
在 Hugging Face 查看

排行第二:PhysVista:通过感知-推理-评估循环评测VLMs物理智能
PhysVista是一个基准测试,旨在通过闭环认知框架评估视觉语言模型(VLMs)的物理智能。现有基准往往碎片化,只关注孤立认知阶段而忽视感知、推理和物理判断间的协同。该工作强调从整体视角诊断VLMs是否能可靠评估生成模型的物理真实性,弥补了当前评测范式的不足。(论文赞 7)
在 Hugging Face 查看

排行第三:Latent-Foresight:为潜在世界模型学习可预测表示
该研究致力于为世界模型学习可预测的潜在表示,以支持场景未来演化的预测。现有方法依赖两阶段流程:先使用PCA或自编码器压缩视觉基础模型特征,再在冻结潜在空间上训练预测器。这种表示学习与时间预测的解耦,或直接在原始特征上应用预测器的方法存在局限,本文探索端到端学习方案以提升表示的可预测性。
在 Hugging Face 查看

排行第四:泛化是稳定性而非准确率:LLMs的多轴评估
该工作重新定义大语言模型(LLMs)的泛化能力,强调其本质是输入表达方式变化时输出的一致性和语义稳定性。现有评估通常通过单一提示格式或任务集的聚合准确率进行,这混淆了鲁棒性与基准性能。本文提出在个体示例层面、跨输入变体和模型行为多轴评估泛化,聚焦变异性而非可被窄化训练掩盖的分数。(论文赞 4)
在 Hugging Face 查看

排行第五:移除干草堆中的针:通过权重正交化消除LLMs后门
NEEDLE是一种无需训练的后门移除方法,针对大语言模型(LLMs)中植入的触发式攻击。现有防御在去除后门时可能损害模型对良性提示的性能和安全性。该方法通过激活向量估计后门方向和拒绝子空间,应用序列权重正交化抑制后门,同时避免拒绝相关表示的改变,实现针对性清除。(论文赞 3)
在 Hugging Face 查看

排行第六:在消退之前:推理时强化VideoLLMs时序表示
该研究探讨视频大语言模型(VideoLLMs)时序推理的弱点,如反转视频帧序不应改变答案却常失效。通过定义层间时序差异向量τ_l,追踪其在各层的幅度变化,发现差异在中间层达到峰值后向输出层递减。这揭示了时序表示在推理过程中逐渐消退的机制,为强化时序推理提供了分析基础。
在 Hugging Face 查看

排行第七:CorrGRPO:多奖励学习的相关性归一化GRPO
提出CorrGRPO方法,用于多奖励学习中的策略优化。通过归一化奖励相关性,解决不同规模奖励对标准化过程的干扰问题,使更新幅度适应奖励之间的依赖关系,提升训练稳定性。(论文赞 10)
在 Hugging Face 查看

排行第八:GPT-6 Astra机器人代理:更少token更高成功率
提出PyRUA-Lean框架,通过反馈驱动的指令组合和选择性观察,减少视觉语言模型在机器人控制中的token消耗。在多个仿真任务中,以65%更少token实现14%更高成功率。(论文赞 7)
在 Hugging Face 查看

排行第九:OneStreamer:统一感知、记忆与主动响应
提出OneStreamer模型,通过共享的主动生成过程联合学习证据记录和任务响应。其分层标题记忆机制生成时间对齐的局部细节描述和事件摘要,支持实时感知与可复用记忆的平衡。(论文赞 29)
在 Hugging Face 查看

排行第十:VTR-Bench:视频生成中文本渲染评估基准
构建VTR-Bench基准,系统评估视频生成模型在视觉文本渲染方面的能力。现有评估侧重视觉质量,而该基准关注场景中文本的正确性,填补了对文本呈现准确性的评估空白。(论文赞 1)
在 Hugging Face 查看

排行第十一:E-MoE:非分解扩散语言模型的增强专家混合
提出E-MoE方法,通过离散共享潜在变量构建反向过程的混合分布,解决连续潜在变量易出现后验崩溃的问题,提升非分解扩散模型在少步生成中的样本质量。(论文赞 2)
在 Hugging Face 查看

排行第十二:EgoTools:面向真实视角视频的工具中心推理
针对真实世界具身任务中的工具使用问题,提出EgoTools框架,关注工具使用中的 affordance、几何关系和因果效应推理,弥补现有多模态视频模型在工具中心具身推理上的不足。(论文赞 16)
在 Hugging Face 查看



扫描二维码,在手机上阅读

X榜单(2026年10月02日 19:03 北京时间)

X榜单(2026年10月02日 18:30 北京时间)

评 论
评论已关闭