HF榜单(2026年10月03日 00:45 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4928,趋势分 1088。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4928 · 趋势分 1088)
在 Hugging Face 查看

排行第二:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2792,趋势分 758。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2792 · 趋势分 758)
在 Hugging Face 查看

排行第三:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 656,趋势分 648。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 656 · 趋势分 648)
在 Hugging Face 查看

排行第四:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 640,趋势分 401。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 640 · 趋势分 401)
在 Hugging Face 查看

排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2819,趋势分 390。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2819 · 趋势分 390)
在 Hugging Face 查看

排行第六:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5929,趋势分 381。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5929 · 趋势分 381)
在 Hugging Face 查看

排行第七:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16764,趋势分 345。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16764 · 趋势分 345)
在 Hugging Face 查看

排行第八:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 360,趋势分 345。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 360 · 趋势分 345)
在 Hugging Face 查看

排行第九:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 523,趋势分 284。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 523 · 趋势分 284)
在 Hugging Face 查看

排行第十:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 615,趋势分 257。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 615 · 趋势分 257)
在 Hugging Face 查看

排行第十一:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 364,趋势分 256。标签:computer-vision、visionhope。(点赞 364 · 趋势分 256)
在 Hugging Face 查看

排行第十二:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2347,趋势分 243。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2347 · 趋势分 243)
在 Hugging Face 查看

论文

排行第一:ScholarCatalyst:激发新研究的论文检索基准
如何定义伟大的科学家?即使在AI系统开始解决开放问题时,科学家仍然远远领先于他们,能够感知哪些先前的想法 buried 在不断增长的研究档案中,一个新的问题需要。我们利用自动化管道使作者注释可扩展,构建了ScholarCatalyst,让184位计算机科学论文的主要作者标注哪些候选论文能够推进他们的项目,每篇论文都有详细的理由。我们引入了一个检索任务,作者提供有关论文的详细信息。(论文赞 1)
在 Hugging Face 查看

排行第二:在策略上或策略外学习?蒸馏动力学的系统研究
在策略上学习已被认为可以减少灾难性遗忘,产生稀疏的参数更新,并提高泛化能力。然而,现有比较同时 varying 许多因素,这使得 rollout 政策的贡献难以隔离。我们在Llama3和Qwen2.5模型家族以及科学、医学和算术领域的推理任务中,独立 varying rollout 政策、token-level KL 方向和学习率,研究了蒸馏动力学的 effect。我们的分析揭示了一个 nuanced picture,其中rollout政策的影响取决于多个因素。
在 Hugging Face 查看

排行第三:RLE-Bench:机器人学习工程师的编码代理资格考试
编码代理正在超越纯粹的数字任务,开始解决物理世界中的挑战,特别是在机器人领域。然而,现有的机器人基准主要关注单个构件(如策略或控制器)的性能,提供对编码代理更广泛工程能力的有限覆盖。现实世界的机器人扩展 beyond 控制:代理必须在资源约束下构建、集成、诊断和改进异构工件,并从多模态反馈中进行推理。为了评估这些更广泛的能力,我们引入了RLE-Bench,评估机器人学习任务,涵盖四个代表性的机器人开发工作流程:交互控制。(论文赞 2)
在 Hugging Face 查看

排行第四:SemanTok:用于高效自回归视频生成的预测语义标记
最近的基于视频的世界模型将自回归预测的可扩展性与扩散模型的视觉质量相结合。场景标记器的选择对于这两种模型的最优性能至关重要,既在保真度方面,也在语义方面。灵活长度、粗到细的标记器首先携带剪辑的全局语义,后期标记器进一步指定细节。现有灵活标记器仅通过在早期解码器隐藏状态上应用表示对齐(REPA)损失来实现这一点,而解码器可以从其噪声输入中部分达到该目标。我们引入了SemanTok,一种灵活的视频标记器,将冻结的DINO特征馈入其编码器。(论文赞 2)
在 Hugging Face 查看

排行第五:Where-OPD:引导多模态大语言模型的时空引导自蒸馏
自蒸馏在改进语言模型推理方面已被证明有效,特别是通过使用学生模型自身的输出作为教师模型。然而,对于多模态大语言模型(MLLMs),这种方法的潜力尚未完全探索。最近的方法使用特权视觉信息,如与问题对应的图像裁剪,来改善细粒度的感知,但它们的收益仅限于需要视觉放大的任务,并且需要人类注释的引导数据或外部教师模型。我们介绍了一种不同的自蒸馏形式,为MLLMs提供tea(论文赞 5)
在 Hugging Face 查看

排行第六:解码循环变换体:为(几乎)免费解码
循环变换体通过重复执行共享块来实现参数效率。每个循环产生一个中间表示,可以解码为同一个下一个令牌,但标准解码丢弃了较早的状态。因为早期的循环包含较少计算,递归 inherently 提供对齐的弱-强预测对,而无需辅助模型或外部训练。我们引入了LoopCD,一个无需训练的对比解码框架,通过将最终预测与早期递归传递进行比较,指导令牌选择,它可以在logit空间操作(LoopCD-Logits),或通过零输出开销在隐藏状态空间操作(LoopCD-HS)。(论文赞 5)
在 Hugging Face 查看

排行第七:OTRetarget:基于最优传输的机器人及物体运动重定向
OTRetarget提出一种统一方法,将人类演示中的动作同时重定向到人形机器人和多个物体上。该方法通过符号距离表示表面交互,解决了在适应机器人形态差异的同时保持与地面及操作物体接触一致性的挑战,尤其适用于移动操作任务。(论文赞 2)
在 Hugging Face 查看

排行第八:JevSpawn:通过组合动作空间实现自适应智能推理
JevSpawn构建了一种组合策略,将自然语言任务描述连接到有限概率探索空间。通过并行动作生成与反馈驱动的分支选择、表示修正及备选方案恢复机制,解决了传统LLM智能体逐令牌推理效率低下和Jev模型需预设动作空间的局限性。(论文赞 1)
在 Hugging Face 查看

排行第九:Architect-Ant:可编辑的建筑平面图自动布置框架
研究提出Architect-Ant框架和包含505个专业建筑平面图的AntPlan数据集,通过预训练模型直接从真实平面图学习专业布置知识。该方法能够生成满足几何与功能约束的家具布局,避免了传统迭代式智能推理的高昂计算成本。(论文赞 8)
在 Hugging Face 查看

排行第十:SAKIKO:工具调用LLM内部干预的机制审计框架
SAKIKO框架通过方向性错误发现、路由条件干预、目标解析验证和前瞻性统计授权等方法,对LLM调用工具前的决策机制进行审计。该研究揭示了在七款LLM中,通道键控干预能实现方向特异性性能提升。(论文赞 1)
在 Hugging Face 查看

排行第十一:LOCI:面向流式世界模型的空间线性记忆架构
LOCI提出混合空间记忆架构,在部分Transformer块中保持历史观测的键值缓存以保留视觉细节,在其余块中结合当前数据块注意力与递归记忆。这种设计平衡了记忆容量与检索精度,使视频世界模型能准确重现既往场景。(论文赞 3)
在 Hugging Face 查看

排行第十二:PhysVista:通过感知-推理-评估循环评测VLM物理智能
PhysVista构建了基于闭环认知框架的基准测试,通过整合感知、推理与物理判断环节,系统评估视觉语言模型对现实世界动力学物理一致性的理解能力。该基准旨在诊断VLM评估生成模型物理真实性的可靠性。(论文赞 7)
在 Hugging Face 查看



扫描二维码,在手机上阅读

Nathan Lambert:今天,我们推出了Trillium Labs @trilliu…

DAIR.AI:转发:谷歌研究关于多智能体证明发现的论文,值得收藏。这种新模…

评 论
评论已关闭