Hugging Face 模型趋势榜和每日论文。
模型
排行第一:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1989,趋势分 1479。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1989 · 趋势分 1479)
在 Hugging Face 查看
排行第二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4739,趋势分 1293。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4739 · 趋势分 1293)
在 Hugging Face 查看
排行第三:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1128,趋势分 850。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1128 · 趋势分 850)
在 Hugging Face 查看
排行第四:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2625,趋势分 814。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2625 · 趋势分 814)
在 Hugging Face 查看
排行第五:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 583,趋势分 498。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 583 · 趋势分 498)
在 Hugging Face 查看
排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2740,趋势分 487。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2740 · 趋势分 487)
在 Hugging Face 查看
排行第七:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5781,趋势分 368。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5781 · 趋势分 368)
在 Hugging Face 查看
排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16687,趋势分 359。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16687 · 趋势分 359)
在 Hugging Face 查看
排行第九:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 575,趋势分 341。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 575 · 趋势分 341)
在 Hugging Face 查看
排行第十:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 325,趋势分 315。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 325 · 趋势分 315)
在 Hugging Face 查看
排行第十一:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 477,趋势分 297。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 477 · 趋势分 297)
在 Hugging Face 查看
排行第十二:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2312,趋势分 292。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2312 · 趋势分 292)
在 Hugging Face 查看
论文
排行第一:CUA-SWE:计算机使用代理与视觉软件工程
本文提出CUA-SWE,一个用于研究计算机使用代理在软件工程中应用的基准、环境和评估流程。重点在于开发人员在调试和修改代码时,如何结合界面交互、视觉观察和代码修改的集成过程,强调代理需将视觉反馈与代码关联并验证修复效果。(论文赞 1)
在 Hugging Face 查看
排行第二:超越记忆世界:预测性4D信念用于动态导航
本文研究在环境持续变化的场景下,智能体如何利用有限的视觉观测和时间索引信念来预测目标位置并修正信念。提出EvolvingNav方法,通过构建时间化的3D对象信念,实现对移动目标的持续推理和导航决策,提升在不可见区域的导航能力。
在 Hugging Face 查看
排行第三:受监管代理AI中的有限自主性评估
本文提出RegLLM诊断框架,用于评估受监管工作流中代理的有限自主性。通过六种可信信号(如引用有效性、宪法对齐等)进行监控,并结合程序化验证、任务级标签和AI评分,实现运行时干预和安全控制,确保代理行为符合规范。
在 Hugging Face 查看
排行第四:无尽考试:从当前模型迈向超级智能的数学构造
本文引入“无尽考试”基准,涵盖14类参数化数学构造问题,通过自动验证和相对质量评分区分模型在数学前沿前后的表现。该基准基于开放数学问题生成更大规模实例,支持紧凑证书验证,评估多个模型在69个实例上的持续进展。(论文赞 1)
在 Hugging Face 查看
排行第五:图像无关上下文扰乱VLM评判者
本文提出MIST测试,研究视觉语言模型在图像误导情况下的判断稳定性。通过200个句子和不同图像条件,发现即使图像与句子无关,仍可能影响模型判断,揭示VLM在替代人类标注时对无关上下文的敏感性问题。(论文赞 13)
在 Hugging Face 查看
排行第六:多智能体系统中潜在通信的安全性
本文研究多智能体系统中潜在通信的安全风险。即使训练过程无恶意,轻量级可训练链接也可能增加有害行为的合规性。攻击者可通过优化有害查询对或污染训练数据,利用强化学习攻击放大此效应,揭示潜在通信的隐蔽安全威胁。(论文赞 1)
在 Hugging Face 查看
排行第七:ATLAS:潜在结构对齐传输的可靠世界模型规划
潜在世界模型依赖表示几何进行规划,但仅正则化潜在边缘分布无法确定用于动作选择的状态间关系。研究表明,这会导致规划相关的新颖结构在表示转换为规划器使用的最终潜在时被削弱。ATLAS通过显式保留关系几何并校准全局潜在分布的训练目标来解决这一问题。(论文赞 1)
在 Hugging Face 查看
排行第八:DyRAD:动态驾驶场景的雷达新视角合成
从记录的传感器数据重建动态驾驶场景,通过合成原始轨迹之外的观测,支持自动驾驶系统的闭环评估。与相机和激光雷达不同,雷达通过多普勒直接测量径向速度。DyRAD提出了一种新方法,有效利用这一能力,解决了现有方法在动态场景中仅重建距离-方位张量或假设静态场景的问题。(论文赞 8)
在 Hugging Face 查看
排行第九:合成预训练在规模下有效,但非语法先验
在合成非自然语言数据上的预训练(PPT)提高了语言模型预训练(PT)的标记效率。先前研究将此归因于语法先验,即PPT期间学习的结构归纳偏置转移到自然语言语法。然而,PPT仅在最多1B参数的模型和低于2B标记的PT预算下测试。本研究探讨了PPT在更大规模和更真实PT数据混合下的有效性。(论文赞 5)
在 Hugging Face 查看
排行第十:LoopVL:循环视觉语言智能
LoopVL研究循环变换器是否能有效扩展到视觉语言模型。通过结合模块循环和模型循环计算,迭代更新统一的视觉语言状态。实验表明,LoopVL在多模态理解和视觉推理基准上优于类似规模和非循环模型,为循环视觉语言建模提供了实用证据。(论文赞 5)
在 Hugging Face 查看
排行第十一:克服LLM推理中自蒸馏的规模限制
策略内自蒸馏(OPSD)训练学生模型匹配特权教师分布。标准OPSD将此监督应用于未验证的学生轨迹,而教师则基于特权上下文。研究发现,支架正确性对下游准确性的影响大于上下文正确性。未验证支架会因教师使用学生不可用信息而产生模仿差距。(论文赞 1)
在 Hugging Face 查看
排行第十二:VLA强化学习的低秩结构
强化学习(RL)越来越多地用于后训练视觉语言动作(VLA)模型,但RL如何重塑这些策略仍不清楚。研究发现,RL在广泛使用的基于流的VLA模型上诱导出显著低秩的参数更新,这些更新集中在动作专家的时间步模块中。模块替换实验表明,这些模块捕获了RL带来的大部分性能提升。(论文赞 2)
在 Hugging Face 查看
