HF榜单(2026年10月09日 01:45 北京时间)


JEV-27B-VL(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:JEV-27B-VL(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 2761,趋势分 2293。标签:qwen3_5、jev、system-one、system-two、typed-decisions。(点赞 2761 · 趋势分 2293)
在 Hugging Face 查看

排行第二:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1871,趋势分 1611。标签:qwen3_5、clef、cloudflare、systemone、decision-model。(点赞 1871 · 趋势分 1611)
在 Hugging Face 查看

排行第三:GEV-26B-Decide(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 1744,趋势分 1487。标签:gemma4、image-text-to-text、system-one、system-two、adaptive-thinking。(点赞 1744 · 趋势分 1487)
在 Hugging Face 查看

排行第四:embeddinggemma-2(特征提取)
Hugging Face 趋势榜上的模型,任务类型是特征提取,点赞 1146,趋势分 1113。标签:embedding_gemma2、embedding、sentence-transformers、multimodal-embedding、multimodal。(点赞 1146 · 趋势分 1113)
在 Hugging Face 查看

排行第五:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 803,趋势分 741。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 803 · 趋势分 741)
在 Hugging Face 查看

排行第六:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3655,趋势分 679。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3655 · 趋势分 679)
在 Hugging Face 查看

排行第七:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 685,趋势分 595。标签:qwen3_5、clef、cloudflare、systemone、decision-model。(点赞 685 · 趋势分 595)
在 Hugging Face 查看

排行第八:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 639,趋势分 587。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 639 · 趋势分 587)
在 Hugging Face 查看

排行第九:humanizer(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 604,趋势分 564。标签:gemma4_unified、image-text-to-text、humanizer、text-rewriting、rewriting。(点赞 604 · 趋势分 564)
在 Hugging Face 查看

排行第十:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6893,趋势分 482。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6893 · 趋势分 482)
在 Hugging Face 查看

排行第十一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5379,趋势分 392。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5379 · 趋势分 392)
在 Hugging Face 查看

排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 17266,趋势分 338。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 17266 · 趋势分 338)
在 Hugging Face 查看

论文

排行第一:Iris-3B:超越潜空间的像素扩散训练与微调
本研究探讨像素空间扩散模型是否优于潜空间模型,特别是在需要精细细节的下游任务中。通过预训练3B参数的像素空间文本到图像变换器Iris-3B,并转换预训练的潜空间模型FLUX.2 Klein到像素空间,论文对两者进行单目深度估计和图像恢复/超分辨率微调。结果发现,使用像素空间生成骨干并未带来显著改进。(论文赞 1)
在 Hugging Face 查看

排行第二:企业AI代理的溯源记忆治理框架
针对企业AI代理共享记忆存储时面临的数据泄露和逻辑冲突风险,论文提出分析记忆单元(AMU)框架。该框架为每个缓存结果附加完整溯源图,并通过检索策略控制访问,仅在请求者有权访问所有涉及列时才返回结果,从而解决现有系统基于内容、所有权和角色门控的不足。(论文赞 1)
在 Hugging Face 查看

排行第三:多教师策略蒸馏中的教师相对偏移方法
研究多教师策略蒸馏(MOPD)的两种设置:共同域组合和路由域蒸馏。论文引入Δ-MOPD方法,转移每个教师相对于其基线的对数偏移,并以学生冻结初始化为锚点,与端点监督进行比较。该方法旨在分离教师训练后变化与基线偏好,提升知识传递效果。(论文赞 5)
在 Hugging Face 查看

排行第四:PAMI:基于部位锚定的人-物交互生成
针对文本条件人-物交互生成中的对象漂移和接触问题,提出PAMI框架。受霍夫变换启发,该方法通过身体部位锚点投票定位物体运动,将物体运动表示为相对于锚点的变换,从而显式建模动态变化的人-物关系,改善协调性。(论文赞 1)
在 Hugging Face 查看

排行第五:系统切换:快速决策模型何时应暂停思考
研究双过程代理中快速策略与慢速推理模型的切换时机。在实时环境中,快速学习执行器持续决策,仅在门控开启时移交控制给视觉语言模型。使用Doom游戏和System One模型进行实验,分析不同参数规模模型在900个问题上的决策行为,特别是错误中选择收集物品的频率。
在 Hugging Face 查看

排行第六:CoDance:从视频学习反应式人形机器人交互
针对伴舞等连续接触的人-人形机器人交互任务,提出CoDance框架。从双人舞蹈视频中提取运动并重定向到机器人参考系,引入多链接柔顺增强技术,将运动学重定向目标转换为柔顺控制命令,使机器人能协调步态并保持双手接触,实现稳定自然的互动。(论文赞 2)
在 Hugging Face 查看

排行第七:带标量伴随匹配的Q学习
流策略能捕捉丰富的动作分布,通过离策略强化学习微调以超越示范行为受到关注。但对抗学习到的价值函数微调流策略并不简单,因为策略在多个流步骤中生成动作。伴随匹配提供了一种通过将最终动作的价值信息反向传播到每个流步骤来更新流模型的方法,但需要在每一步通过策略进行向量-雅可比乘积,计算成本随流步骤数和策略规模增长。我们观察到预训练流策略的批量平均速度雅可比集中于特定区域。(论文赞 14)
在 Hugging Face 查看

排行第八:自学习科学代理用于X射线衍射
科学代理的核心挑战是将分析经验转化为基于物理证据的可复用专业知识。本文介绍 Gan Jiang,一个基于我们开发的衍射分析生态系统构建的自学习代理:XMatcher、XQueryer、XDecomposer 和 WPEM。这些引擎涵盖相位识别、多相分解和物理约束的整体图案建模。Gan Jiang 通过诊断失败、修订技能指令和代码,并在重用前验证修订,将分析经验转化为可执行技能,无需重新训练语言模型或改变底层物理模型。(论文赞 9)
在 Hugging Face 查看

排行第九:TIDES:选择性状态空间模型中的隐式时间感知
选择性状态空间模型(SSM)如 Mamba 通过将时间离散化步长 TildeΔ 设为输入的可学习函数,实现了强大的逐标记表达能力。然而,这使得 TildeΔ 不再等于连续观测之间的物理时间间隔 Δ,限制了这些模型处理不规则时间序列的能力。连续时间 SSM 如 S5 保持 TildeΔ 等于 Δ,因此能原生处理不规则时间戳,但其动态仍为线性时不变(LTI),限制了逐标记表达能力。我们提出 TIDES,一种将选择性和连续架构调和的选择性 SSM 变体,通过将输入依赖从步长转移到对(论文赞 1)
在 Hugging Face 查看

排行第十:NAMVIS:下一代自回归多视角图像合成
稀疏视角新视角合成是3D内容创作的核心问题,但基于扩散的方法受限于迭代去噪,导致多视角生成在推理时成本高昂。我们提出 NAMVIS,一种无扩散框架,将多视角图像合成重新定义为几何条件下的下一尺度自回归。NAMVIS 通过少量粗到细的尺度步骤预测离散视觉标记,同时在每个尺度内并行采样所有标记和目标视角。为将生成过程锚定到显式相机几何,我们提出多尺度投影姿态编码。(论文赞 19)
在 Hugging Face 查看

排行第十一:FastOPD:轻量级VLA部署的在线策略蒸馏
视觉-语言-动作(VLA)基础模型迅速扩展以增强操作性能和泛化能力,但这种扩展带来了高计算成本,使现实世界部署日益困难。现有方法通常通过设计更小的架构或减少基于流的策略中的迭代去噪步骤来缓解此问题。本文提出 FastOPD,一种从基础到轻量级 VLA 的框架,通过高效的在线策略蒸馏实现大规模 VLA 的实用部署。具体而言,FastOPD 适应单状态教师监督的流映射,并结合自一致性目标构建。(论文赞 2)
在 Hugging Face 查看

排行第十二:SheetSage2:带合成监督的连贯乐谱转录
将音乐转录为人类可读的乐谱需要对节奏、和声、旋律和曲式有连贯的理解。两个障碍限制了这一目标:标注录音稀缺,且准确的局部预测仍可能产生不一致的音乐序列。我们提出 SheetSage2,一种结合合成数据、任务特定结构解码和自回归蒸馏的统一音乐转录框架。自动标注的 MIDI 转换为音频,为音乐理解任务提供可扩展的监督。任务特定的结构解码器整合互补的音乐线索及其时间依赖性,以生成音乐连贯的乐谱。自回归蒸馏进一步提升性能。(论文赞 6)
在 Hugging Face 查看



扫描二维码,在手机上阅读

热榜(2026年10月09日 01:45 北京时间)

DAIR.AI:天啊,@odysseyml 大更新了。Odyssey-3 P…

评 论
评论已关闭