HF榜单(2026年10月09日 13:45 北京时间)


JEV-27B-VL(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:JEV-27B-VL(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 3069,趋势分 2546。标签:qwen3_5、jev、system-one、system-two、typed-decisions。(点赞 3069 · 趋势分 2546)
在 Hugging Face 查看

排行第二:GEV-26B-Decide(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 1924,趋势分 1653。标签:gemma4、image-text-to-text、system-one、system-two、adaptive-thinking。(点赞 1924 · 趋势分 1653)
在 Hugging Face 查看

排行第三:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1899,趋势分 1303。标签:qwen3_5、clef、cloudflare、systemone、decision-model。(点赞 1899 · 趋势分 1303)
在 Hugging Face 查看

排行第四:embeddinggemma-2(特征提取)
Hugging Face 趋势榜上的模型,任务类型是特征提取,点赞 1223,趋势分 1186。标签:embedding_gemma2、embedding、sentence-transformers、multimodal-embedding、multimodal。(点赞 1223 · 趋势分 1186)
在 Hugging Face 查看

排行第五:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 817,趋势分 753。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 817 · 趋势分 753)
在 Hugging Face 查看

排行第六:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3694,趋势分 672。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3694 · 趋势分 672)
在 Hugging Face 查看

排行第七:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 669,趋势分 617。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 669 · 趋势分 617)
在 Hugging Face 查看

排行第八:humanizer(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 651,趋势分 610。标签:gemma4_unified、image-text-to-text、humanizer、text-rewriting、rewriting。(点赞 651 · 趋势分 610)
在 Hugging Face 查看

排行第九:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6965,趋势分 491。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6965 · 趋势分 491)
在 Hugging Face 查看

排行第十:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 698,趋势分 491。标签:qwen3_5、clef、cloudflare、systemone、decision-model。(点赞 698 · 趋势分 491)
在 Hugging Face 查看

排行第十一:GLM5.3-Flash-E224-DGX-Spark(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 481,趋势分 440。标签:vllm、glm5_next、autotrust、moe、nvfp4。(点赞 481 · 趋势分 440)
在 Hugging Face 查看

排行第十二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5399,趋势分 374。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5399 · 趋势分 374)
在 Hugging Face 查看

论文

排行第一:OuroWorld:将任何3D世界变为动态循环3D cinemagraphs
OuroWorld是一个无需口罩的框架,可以将任何静态3D高斯散点场景转换为动态循环3D cinemagraphs。它通过一个视语言模型推断出合理的动态,并指导视频模型合成一个参考视频,然后从任何视角 lifted 和完成多视图视频。(论文赞 8)
在 Hugging Face 查看

排行第二:On-Policy Distillation:教授新技能但不新知识
On-policy蒸馏(OPD)增强了语言模型的推理能力,但学生是否获得新的事实知识或复合推理技能仍未知。我们使用一个受控的合成框架将学生和教师的能力分离,测量学生的初始能力,并独立控制教师的额外事实、复合技能或两者兼有。在四个来自三个家庭的模型中,反向KL OPD能够在未见过的推理结构之间可靠地传输复合技能,但转移的事实知识很少。通过分离蒸馏配方揭示了这种不对称性的来源:用正向KL替换反向KL可以恢复事实转移。
在 Hugging Face 查看

排行第三:BrickBench:评估代理型积木设计
我们提出了BrickBench,这是一个评估代理型文本条件LEGO套装设计的基准。给定提示,一个代理被任务生产一个不仅满足语义和设计标准,而且可以物理建造的装配。它必须从离散库中选择零件,并联合推理局部和全局约束。我们在三个设置中评分有效性、对齐和设计,这些设置根据规模和零件可用性而变化。我们发布了BrickAgent,一个环境,用于编码代理构建、检查和验证其设计。我们发现领先的代理在满足可验证的物理和语义要求方面表现良好,但未能达到人类设计的水平。
在 Hugging Face 查看

排行第四:OmniCapBench:对细粒度音频-视觉字幕进行深度结构评估
多模态大型语言模型(MLLMs)正在迅速发展 toward 连续音频--视觉推理,急需评估其能力限制。音频--视觉字幕是一个理想的诊断任务,但当前基准面临耦合权衡:整个字幕分数提供覆盖而不定位,本地探针提供定位而不覆盖,无约束的LLM评委引入不稳定。我们引入了OmniCapBench(Omni-Video Caption Benchmark),将音频--视觉字幕评估重新构架为一个深度结构诊断框架。OmniCapBench将预测目标从自由文本更改为一组原子,可验证的音频--视觉(论文赞 1)
在 Hugging Face 查看

排行第五:Accurate but Not Humble:评估LLM代理在知识冲突下的认识
当检索的证据与代理的 prior 信念矛盾时,它是否会修订答案、承认不确定性或坚持错误的结论?现有对代理系统的评估主要关注任务成功,提供有限 insight 如何处理此类冲突。我们提出评估代理在执行任务时的认识谦逊(EH):代理愿意在执行任务时 recognize、act on 和 communicate uncertainty。通过知识冲突 situations,其中基础语言模型的参数知识与它遇到的证据相矛盾,或什么情况下,基础语言模型的参数知识与它遇到的证据相矛盾,我们设(论文赞 2)
在 Hugging Face 查看

排行第六:ReSPO:为离策略学习中的梯度饥饿重新塑造序列策略优化
从可验证奖励中强化学习(RLVR)经常重用rollouts多次更新多个策略,增加了当前策略与数据生成策略之间的不匹配。我们识别出在剪辑策略优化中存在符号依赖性梯度饥饿问题:剪辑抑制低重要性权重下的under-generated正响应 while permitting severely over-generated负响应 to dominate the high-weight tail。为了解决这个问题,我们提出了ReSPO(重新塑造序列策略优化),它用平滑的双分支序列级内核替(论文赞 5)
在 Hugging Face 查看

排行第七:具身图灵机:机器人递归自我改进的状态化代码
本文提出了一种新的机器人策略视角:将具身世界视为一个具身图灵机,其磁带是机器人和环境状态,规则是策略。如果状态能被准确表示,决策可以完全用代码编写。因此,作者提出了仅代码策略(COAP):代码从摄像头图像和本体感觉中测量并跟踪机器人、环境和任务状态,并据此做出所有决策。相同的代码适用于不同情景,不同任务共享状态表示。
在 Hugging Face 查看

排行第八:MC-Sparse:解构并弥合扩散变换器中稠密-稀疏注意力差距
稀疏注意力是降低扩散变换器在长序列生成任务(如视频和高分辨率3D资源生成)中延迟的主要方法。然而,现有方法在高稀疏度下会降低生成质量和保真度。通过受控对比实验,作者将这种退化归因于三个来源:令牌分组施加的约束、不准确的交互选择以及丢弃令牌时丢失的注意力贡献。基于此分析,提出了元缓存稀疏注意力(MC-Sparse),这是一个无需训练的框架,选择单个键值令牌,同时将相似查询组织到瓦片对齐的组中。(论文赞 15)
在 Hugging Face 查看

排行第九:通过组合偏好和标准奖励后训练前沿文生图模型
最近的文生图模型在视觉质量上取得了显著成就,但通过后训练改进它们仍然具有挑战性,因为没有单一的奖励信号能捕捉人类偏好的全部范围。本文开发了一种简单有效的开放域文生图后训练方法,基于互补奖励信号的组合。奖励系统包括两个主要部分:偏好奖励(使用Bradley-Terry目标在大规模人类偏好数据上训练以捕捉整体审美和感知偏好)和基于标准的奖励(明确评估提示忠实度和其他理想属性)。(论文赞 11)
在 Hugging Face 查看

排行第十:LLMs理解顺序结构吗?推理与生成的受控研究
大语言模型(LLMs)越来越多地被用作交互代理和模拟器,但它们是否能恢复超越表面动作频率的潜在顺序结构仍不清楚。这种区分对于行为模拟至关重要,因为动作通常由先前上下文塑造,而不仅仅是边缘频率。作者使用受控的双人石头-剪刀-布交互和单玩家随机n-gram延续任务研究这个问题。通过这些实验,测试LLMs是否能识别潜在策略、遵循简单马尔可夫规则并维持高阶条件依赖性。框架将分布匹配与条件依赖性分离开来。(论文赞 6)
在 Hugging Face 查看

排行第十一:多智能体以自我为中心的世界模型与细粒度具身交互
以自我为中心的世界模型预测以智能体动作为条件的第一人称观察,但大多数关注单个智能体。真实的具身设置通常涉及多个智能体在共享环境中行动和交互。现有的多智能体世界模型依赖于粗粒度动作(如移动、相机控制或离散命令),细粒度具身交互未被充分探索。本文将多智能体以自我为中心的世界建模形式化为多个智能体通过细粒度动作在共享世界中交互的同步自我流生成。这需要跨视图动作一致性、共享环境一致性以及交互引起状态的一致传播。(论文赞 27)
在 Hugging Face 查看

排行第十二:OneSearch-VL:图像和视频的统一多模态深度研究代理
单图像、多图像和视频深度研究需要不同的视觉操作,但共享视觉 grounding、外部检索和事实组合的工作流程。一个关键挑战是保留连接局部视觉锚点、实体关系、源支持事实和答案生成操作的依赖关系。作者介绍了OneSearch-VL,一个以视觉 grounded 证据图(VGEG)为中心的统一代理,它将依赖关系编码为共享任务级参考,用于数据构建、过程监督和操作级评估。基于VGEG的数据引擎构建并验证多图像和视频问题,并过滤专家轨迹。(论文赞 5)
在 Hugging Face 查看



扫描二维码,在手机上阅读

热榜(2026年10月09日 13:45 北京时间)

HN榜单(2026年10月09日 13:45 北京时间)

评 论
评论已关闭