Hugging Face 模型趋势榜和每日论文。
模型
排行第一:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1981,趋势分 1494。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1981 · 趋势分 1494)
在 Hugging Face 查看
排行第二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4723,趋势分 1305。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4723 · 趋势分 1305)
在 Hugging Face 查看
排行第三:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1124,趋势分 848。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1124 · 趋势分 848)
在 Hugging Face 查看
排行第四:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2613,趋势分 832。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2613 · 趋势分 832)
在 Hugging Face 查看
排行第五:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 582,趋势分 511。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 582 · 趋势分 511)
在 Hugging Face 查看
排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2732,趋势分 502。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2732 · 趋势分 502)
在 Hugging Face 查看
排行第七:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5758,趋势分 366。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5758 · 趋势分 366)
在 Hugging Face 查看
排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16682,趋势分 360。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16682 · 趋势分 360)
在 Hugging Face 查看
排行第九:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 572,趋势分 354。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 572 · 趋势分 354)
在 Hugging Face 查看
排行第十:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 324,趋势分 314。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 324 · 趋势分 314)
在 Hugging Face 查看
排行第十一:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2311,趋势分 302。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2311 · 趋势分 302)
在 Hugging Face 查看
排行第十二:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 468,趋势分 299。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 468 · 趋势分 299)
在 Hugging Face 查看
论文
排行第一:ATLAS:面向可靠世界模型规划的潜在结构对齐传输
潜在世界模型依赖表征几何进行规划,但仅正则化潜在边际无法确定动作选择所需的状态间关系,可能削弱规划相关的新颖性结构。ATLAS通过训练目标明确保留关系几何并校准全局潜在分布:将标准化的成对结构从信息编码表征传输到规划潜在空间,并用Wasserstein嵌入匹配(WEMReg)校准潜在分布。(论文赞 1)
在 Hugging Face 查看
排行第二:DyRAD:动态驾驶场景的雷达新视角合成
从传感器数据重建动态驾驶场景可支持自动驾驶系统的闭环评估,但现有雷达新视角合成方法未能利用多普勒效应——处理动态场景时仅重建距离-方位张量,渲染多普勒的方法则假设场景静态。此外,雷达反射扩散导致视角移动时渲染错误。DyRAD旨在解决这些问题,实现动态驾驶场景的雷达新视角合成。(论文赞 1)
在 Hugging Face 查看
排行第三:合成预预训练能应对规模扩展,但并非作为语法先验
合成预预训练(PPT)能提升语言模型预训练的令牌效率,此前研究认为这源于所学的语法先验。但PPT仅在≤1B参数模型和≤2B令牌(以网络文本为主)中测试过。本文综合研究了5种PPT任务、4种预训练数据混合、4种参数规模(500M至7B)等,探讨PPT在更大规模和更多样化数据下是否依然有效,及是否真为语法先验。(论文赞 4)
在 Hugging Face 查看
排行第四:LoopVL:循环视觉智能
LoopVL旨在研究循环变压器是否能有效扩展到视觉语言模型,结合模块循环和模型循环,通过共享模块迭代更新统一的视觉语言状态。从语言预训练、多模态训练到post-training从头训练,在多模态理解和视觉推理基准上优于同类或更大的非循环模型,并观察到视觉‘啊哈时刻’(循环中视觉注意力的显著变化),为循环视觉语言建模提供实践证据。(论文赞 2)
在 Hugging Face 查看
排行第五:克服大模型推理中在线自蒸馏的规模限制
在线自蒸馏(OPSD)训练学生匹配自身轨迹上的教师分布,但标准OPSD对未经验证的学生rollout进行监督,教师则使用特权上下文(如参考解答)。因子分析发现,支架正确性对下游准确率影响强于上下文正确性;未经验证的支架会因教师信息优势产生模仿gap,虽随模型规模缩小,但OPSD仍主要监督未经验证轨迹。而验证过的支架能持续有效。
在 Hugging Face 查看
排行第六:视觉语言动作强化学习的低秩结构
强化学习(RL)常用于视觉语言动作(VLA)模型的post-training,但RL如何重塑策略尚不清晰。研究发现,在LIBERO等数据集上,对π0.5、GR00T等流基VLA模型的RL会诱导高度集中于动作专家‘时间步模块’(小且此前被忽视的组件)的低秩参数更新。模块替换实验进一步表明,这些模块贡献了RL带来的大部分性能提升,研究还刻画了这些模块编码的内容。(论文赞 1)
在 Hugging Face 查看
排行第七:LANTERN:揭示语言模型中的数学知识
该论文提出LANTERN方法,利用预训练模型的激活值构建分类器,对数学关系进行排序和筛选,结合假设生成与验证,从OEIS中发现62条未被记录的序列关系,提升模型发现潜在数学联系的能力。(论文赞 9)
在 Hugging Face 查看
排行第八:I Have a Stream:连续视频的自监督学习
该研究探索在连续视频流上进行自监督学习,构建了WT++数据集,发现对比和蒸馏方法在此场景下表现不佳,而MAE虽更稳健但仍无法达到独立同分布训练的性能,揭示了视频流学习的挑战。(论文赞 6)
在 Hugging Face 查看
排行第九:自注意力的竞争检索能力
该论文研究语言模型在自注意力机制下实际使用多少上下文信息,通过保留高注意力权重的token,评估不同选择方式对负对数似然的影响,发现注意力选择优于随机选择,且小规模选择即可保持较低损失。
在 Hugging Face 查看
排行第十:Transformer残差流中的推理几何
该研究分析Transformer语言模型通过残差更新逐步构建预测的过程,比较中间状态与最终状态,发现模型在早期就倾向于选择自身终点,且不同终点的相似性随深度变化,揭示了表示演化的动态机制。(论文赞 1)
在 Hugging Face 查看
排行第十一:SlideDP:跨GPU的主机驻留微调
该论文提出SlideDP,一种用于共享主机多GPU系统的同步数据并行运行时,通过解耦通信路径与状态布局,实现参数传输、梯度聚合和CPU更新的流水线处理,提升全参数微调效率。(论文赞 1)
在 Hugging Face 查看
排行第十二:模型日期:系统提示中的隐藏日期影响评估
该研究发现系统提示中隐藏的当前日期会显著影响大语言模型的输出,导致在多个任务上的性能波动,甚至改变模型排名,揭示了评估中一个被忽视的非确定性因素。(论文赞 1)
在 Hugging Face 查看
