HF榜单(2026年10月01日 18:45 北京时间)


Audio8-ASR-Infinite(语音识别)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1987,趋势分 1485。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1987 · 趋势分 1485)
在 Hugging Face 查看

排行第二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4732,趋势分 1300。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4732 · 趋势分 1300)
在 Hugging Face 查看

排行第三:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1127,趋势分 849。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1127 · 趋势分 849)
在 Hugging Face 查看

排行第四:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2622,趋势分 829。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2622 · 趋势分 829)
在 Hugging Face 查看

排行第五:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 582,趋势分 502。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 582 · 趋势分 502)
在 Hugging Face 查看

排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2737,趋势分 498。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2737 · 趋势分 498)
在 Hugging Face 查看

排行第七:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5772,趋势分 367。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5772 · 趋势分 367)
在 Hugging Face 查看

排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16685,趋势分 360。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16685 · 趋势分 360)
在 Hugging Face 查看

排行第九:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 574,趋势分 347。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 574 · 趋势分 347)
在 Hugging Face 查看

排行第十:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 325,趋势分 315。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 325 · 趋势分 315)
在 Hugging Face 查看

排行第十一:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 474,趋势分 301。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 474 · 趋势分 301)
在 Hugging Face 查看

排行第十二:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2312,趋势分 294。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2312 · 趋势分 294)
在 Hugging Face 查看

论文

排行第一:诊断工具评估有界自主性:宪法奖励、升级标签和运行时治理
我们提出了RegLLM,一个用于有界自主性诊断的工具。它集成了六个可信度信号:引用有效性、来源锚定、模式符合、升级正确性、宪法符合和安全动作率。这些信号根据监督来源的不同而区分:由程序验证器、任务级升级标签或AI法官评分。我们引入了一个确定的运行时监督器,阻止未锚定的答案并强制升级,记录干预措施。相同的域宪法用于评估、训练奖励和服务防护栏。任务级应升级标签使决策成为可测量的训练信号。我们探讨了有界自主性的评估方法。
在 Hugging Face 查看

排行第二:无尽考试:从今天模型到超智能的数学构建
我们引入了无尽考试,这是一个基准,涵盖十四种参数化的数学构建问题家族,具有可验证的得分,区分今天模型和超智能之间的进展。每个提交的对象都会自动检查其有效性和相对质量得分,与已发布的数学前沿或构建基线进行比较,没有上限。通过调整参数生成更大的实例。紧凑的证书允许验证大型构造而不列出每个元素。在九种模型上评估了六个实例,发现持续改进超越现有数学前沿。(论文赞 1)
在 Hugging Face 查看

排行第三:图像不是关键:视觉语言模型法官因无关上下文而不稳定
视觉语言模型(VLMs)越来越多地用于代替人类标注者,确保子替代测试反映模型而非偶然评估条件至关重要。我们引入了MIST,即误导性图像压力测试:200个英文句子,每个句子围绕一个可读取为比喻或字面意思的短语构建,并显示与对齐图像相关,一个误导性图像描绘相反情况或无图像。指南要求仅从句子本身决定标签,因此不应有任何图像改变答案。我们预计每个图像都会将法官的标签拉向其描绘的感觉,但实际上两种情况都没有。对十三个VLM法官进行了跨学科测试。(论文赞 2)
在 Hugging Face 查看

排行第四:潜在通信在多代理系统中的安全性
潜在通信使多代理系统能够在内部表示空间中直接交换信息,减少了文本通信的令牌、计算和时间开销。为此,我们引入了轻量级可训练链接,将发送者的表示映射到接收者的输入空间。在这项工作中,我们展示即使在良性链接训练下,相对于文本通信也会增加有害合规性,而基础的安全对齐代理保持不变。攻击者可以通过优化链接或污染良性训练数据来放大这种效果。我们进一步开发了一个强化学习攻击。(论文赞 1)
在 Hugging Face 查看

排行第五:ATLAS:为可靠世界模型规划对齐传输的潜在结构
潜在世界模型依赖于表示几何进行规划,但仅正则化潜在边际不能确定用于动作选择的状态间关系。我们展示这可能导致规划相关的新颖结构在表示转换为规划使用的最终潜在时被削弱。我们引入了对齐传输潜在结构(ATLAS),一个训练目标,明确保留关系几何并校准全局潜在分布。ATLAS将规范化的成对结构从信息丰富的编码器表示传输到规划潜在,并使用Wasserstein嵌入匹配(WEMReg)进行校准其全局潜在分布。(论文赞 1)
在 Hugging Face 查看

排行第六:DyRAD:动态驾驶场景的雷达新颖视图合成
从记录传感器数据中重建动态驾驶场景支持封闭循环评估自动驾驶系统,通过合成超出原始轨迹的观察结果。与相机和LiDAR不同,雷达通过多普勒直接测量径向速度。然而,现有雷达新颖视图合成未能利用这一能力:解决动态场景的方法仅重建范围-方位张量,而假设静态场景的方法则渲染多普勒。此外,由于雷达处理将每个反射分散到多个bin中,现有表示将这种分散吸收到场景几何中,导致视角移动时渲染错误。我们提出了DyRAD,一种将雷达径向速度直接纳入新颖视图合成的框架。DyRAD利用多普勒信息直接渲染动(论文赞 6)
在 Hugging Face 查看

排行第七:合成预训练在规模下存活,但非语法先验
本文研究在合成非自然语言数据上进行预训练预训练(PPT)对语言模型预训练(PT)的令牌效率提升。先前工作将此归因于语法先验,即PPT期间学习的结构归纳偏置转移到自然语言语法。但PPT仅在最多10亿参数模型和低于20亿令牌的PT预算下测试,主要基于网络文本。论文通过涵盖五个PPT任务、四种PT数据混合、参数规模从5亿到70亿的全面实验,探究PPT在更大规模和更现实PT数据混合(如代码和数学)下的有效性。(论文赞 5)
在 Hugging Face 查看

排行第八:LoopVL:循环视觉智能模型
本文介绍LoopVL,研究循环变换器能否有效扩展到视觉-语言模型。LoopVL结合模块循环和模型循环计算,通过共享模块迭代更新统一视觉语言状态。模型从头开始训练,包括语言预训练、多模态训练和后训练。在多模态理解和视觉推理基准上,LoopVL优于一系列相似规模和更大的非循环模型。还观察到视觉顿悟时刻,表现为循环间视觉注意力的显著转变,为循环视觉语言建模提供实践证据。(论文赞 2)
在 Hugging Face 查看

排行第九:克服LLM推理中策略自蒸馏的扩展限制
策略自蒸馏(OPSD)训练学生模型匹配特权教师分布沿其采样轨迹。标准OPSD将监督应用于未验证的学生展开,而教师以特权上下文(如参考解)为条件。通过因子分析分离这些角色,发现支架正确性对下游准确性的影响强于上下文正确性。未验证支架造成模仿差距,因教师可使用学生无法获取的信息。该差距随模型规模缩小,但OPSD仍主要监督未验证轨迹,而验证支架保持有效。(论文赞 1)
在 Hugging Face 查看

排行第十:VLA强化学习的低秩结构分析
强化学习(RL)越来越多用于后训练视觉-语言-动作(VLA)模型,但RL如何重塑这些策略尚不清楚。研究发现,在广泛使用的基于流的VLA模型(如π_{0.5}和GR00T~N1.5/N1.6)上,于LIBERO、ManiSkill、MetaWorld和CALVIN数据集进行RL诱导出显著低秩参数更新,高度集中在动作专家的时间步模块中。通过系统模块替换实验,显示这些模块捕获RL性能增益的绝大部分,并表征时间步模块编码内容。(论文赞 2)
在 Hugging Face 查看

排行第十一:LANTERN:揭示语言模型中隐藏的数学知识
语言模型现已能证明定理,但人类仍决定研究哪些问题。本文探讨模型内部表示能否帮助识别有前景的数学联系。开发LANTERN管道,使用预训练模型激活的分类器对候选关系排序,经阶段过滤、假设生成、可执行验证和分析检查。应用于整数序列在线百科全书(OEIS),LANTERN在1万常用序列中排名5000万对,产生62个已验证无现有交叉引用的关系对,内容筛选保留13个关系。(论文赞 14)
在 Hugging Face 查看

排行第十二:我有流:让自监督学习在连续视频上工作
自监督学习受婴儿视觉发展启发,但标准训练流程与之相似度低:图像独立采样并在周期间全局洗牌。研究从连续视频流进行自监督学习,帧以时间顺序消耗,使用严格滑动窗口批次,无全局重洗牌或多周期回放。为此构建WT++数据集,95小时城市步行视频用于流式预训练。结合全面评估套件,发现对比和蒸馏方法在此设置下困难,而MAE更稳健但仍不及标准独立同分布训练。(论文赞 6)
在 Hugging Face 查看



扫描二维码,在手机上阅读

X榜单(2026年10月01日 19:24 北京时间)

X榜单(2026年10月01日 18:51 北京时间)

评 论
评论已关闭