Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4618,趋势分 1481。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4618 · 趋势分 1481)
在 Hugging Face 查看
排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1649,趋势分 1403。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1649 · 趋势分 1403)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2511,趋势分 890。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2511 · 趋势分 890)
在 Hugging Face 查看
排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1002,趋势分 852。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1002 · 趋势分 852)
在 Hugging Face 查看
排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2702,趋势分 590。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2702 · 趋势分 590)
在 Hugging Face 查看
排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 555,趋势分 546。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 555 · 趋势分 546)
在 Hugging Face 查看
排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 549,趋势分 501。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 549 · 趋势分 501)
在 Hugging Face 查看
排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16623,趋势分 363。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16623 · 趋势分 363)
在 Hugging Face 查看
排行第九:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5661,趋势分 357。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5661 · 趋势分 357)
在 Hugging Face 查看
排行第十:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2294,趋势分 336。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2294 · 趋势分 336)
在 Hugging Face 查看
排行第十一:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1812,趋势分 328。标签:xing4_0、conversational、custom_code。(点赞 1812 · 趋势分 328)
在 Hugging Face 查看
排行第十二:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 444,趋势分 323。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 444 · 趋势分 323)
在 Hugging Face 查看
论文
排行第一:Org-Agent:超越个人助手的组织代理
语言模型代理在服务组织时,需要协调多个用户的请求并利用分布在交互中的知识。我们确定了该场景下的两种互补能力,即跨用户交互与决策能力,以及跨用户记忆与知识使用能力。这些能力受组织约束的三个方面的控制:用户身份、权限和访问权限;信息的归属和时间有效性;以及解决跨用户冲突需求和联合决策需求的规则。这些约束决定了在采取行动前必须获取的信息或决策内容。(论文赞 1)
在 Hugging Face 查看
排行第二:代理能否为其他代理设计库?
代理越来越多地依赖其他代理编写的代码,但它们倾向于重新实现而非复用,导致后续代理需要处理的代码库不断增长。为了衡量代理为其他代理设计库的能力,我们引入了LibraryDesignBench基准,该基准分为两个阶段:代理根据定义所需功能和潜在使用场景的规范,实现一个完整的库,但不规定具体设计。我们通过三个不同模型家族的用户代理编写程序的正确性和简洁性来评估该库。该基准涵盖了四种语言中15个库设计任务的242个专家验证的编程问题。在15个任务中的11个任务中,(论文赞 1)
在 Hugging Face 查看
排行第三:同家族策略蒸馏的扩展特性
强化学习(RL)可以为大语言模型(LLMs)引入显著的推理能力,但这种能力在不同模型规模间的迁移程度和速度尚不清楚。我们研究了同家族策略蒸馏(OPD)在弱到强、同基、强到弱的教师-学生设置中的扩展特性。我们发现,早期的OPD训练动态普遍表现出一种常规的有用迁移模式,其中保留准确率(黄金得分G)随着学生初始化的token级反向KL散度的平方根近似线性增长。在所有观察到的弱到强配对中,学生的(论文赞 1)
在 Hugging Face 查看
排行第四:持续学习中的学习动态:数据归属、遗忘与可塑性损失的统一视角
现代语言模型在其生命周期中可能多次更新,而非仅训练一次后冻结。因此,每次更新都参与一个循环过程:决定从哪些经验中学习,理解该更新带来的变化,并保持从后续内容中学习的能力。我们表明,这些挑战由相同的更新-行为交互机制控制。我们推导出一种基于token和层的分解方法,说明从一个token学习如何改变另一个预测。通过分离softmax力、共享输出几何结构和残差连接,揭示了两种交互通道,并提供了可前向计算的近似方法。通过跟踪这种交互过程,(论文赞 1)
在 Hugging Face 查看
排行第五:循环变压器中递归推理的调度
递归推理模型在扩展测试时计算方面受到越来越多的关注,通常通过共享参数的迭代方式优化潜在状态。然而,这些模型在应用每个学习到的更新时使用固定的单位尺度,当更新具有持续进展时可能过于保守,当更新波动时又可能过于激进,从而限制了额外循环带来的好处。为了理解尺度应如何随轨迹变化,我们首先分析了终端损失对递归更新尺度的敏感性。我们证明其时间平均值可以精确分解为持续进展和中心波动的贡献。基于此,我们引入了轨迹(论文赞 9)
在 Hugging Face 查看
排行第六:ALICE:上下文、零样本、互信息估计
从样本中估计互信息(MI)是许多科学领域的重要目标。现代神经网络估计器在大数据环境下准确,但在数据稀缺时表现不佳,且必须为每个分布重新训练。现有估计器还受限于特定数据类型。这些限制使得它们难以应用于许多无法进行每分布训练且样本量小的场景。我们提出了ALICE,一个基础模型,消除了每分布训练的需求,同时实现了具有竞争力的估计精度。ALICE仅在广泛的合成分布上进行训练,作为上下文估计器发挥作用。(论文赞 1)
在 Hugging Face 查看
排行第七:LIFT: 未来视频生成的布局控制
本文介绍了LIFT,一个统一的图像到视频生成框架,通过未来布局控制补充相机控制,允许用户指定未来视图中应出现的内容及其位置。这解决了可控视频生成的实际需求:给定初始图像,用户不仅关心相机的移动方式,还关心未来关键时刻的场景内容,尤其是最终帧。现有相机控制指定视角轨迹,而文本提示仅提供粗略的语义指导;两者都不能精确确定未来视图的内容和空间布局。这一局限性在长时间视角变化中尤为明显。(论文赞 6)
在 Hugging Face 查看
排行第八:FocusVTC: 自适应分辨率的高效视觉文本压缩
大型语言模型中的长上下文推理计算和内存成本较高。视觉文本压缩(VTC)通过将文本渲染为图像来减少输入长度,但固定分辨率渲染在压缩性能和可读性之间创建了权衡:低DPI节省标记但牺牲可读性,高DPI则浪费标记在无关内容上。我们引入了FocusVTC,通过自适应分辨率打破这一权衡,同时保留一般多模态能力。它结合压缩的低DPI全局视图和选择性区域增强,将增强视图集成到持续推理中。我们构建了29.4K个高质量的推理-证据局部化(REL)链式思路。(论文赞 13)
在 Hugging Face 查看
排行第九:SaveRouter: 经济高效的LLM路由
大型语言模型路由通过将每个查询分配到适当的模型来减少服务成本,同时保持响应质量。然而,构建这样的路由通常需要执行多个候选模型的历史查询,以收集查询-模型质量反馈,在部署前创建非平凡的监督成本。已有研究主要关注服务时间效率,而忽视了节省的成本是否足以回收前期投入。我们进一步观察到,路由质量往往在收集所有查询-模型反馈之前就已饱和,表明密集监督可能在经济上过度提供。我们提出了SaveRouter,通过稀疏监督来经济高效地训练路由。(论文赞 7)
在 Hugging Face 查看
排行第十:PMOPD: 多教师上策略蒸馏中的任务更新和保护
多教师上策略蒸馏(MOPD)已成为集成前沿语言模型特殊能力的流行后训练范式。现有OPD研究主要关注通过目标设计、蒸馏范围和教师信号构建优化单一任务蒸馏,而MOPD必须在共享参数中聚合多个能力,并解决能力跷跷板现象,即改善一个领域会抑制从另一个领域获得的能力。受OPD更新几何特性的启发,我们发现MOPD中参数更新快速集中在各自的低维子空间中。(论文赞 3)
在 Hugging Face 查看
排行第十一:改进分布扩散模型
分布扩散模型(DDMs)通过使用分布性降噪器替代标准均值预测降噪器,学习p(x_1 | x_t)的随机近似而非其条件均值。然而,将DDMs扩展到现代图像生成设置面临两个障碍:(i)多粒子训练的开销随粒子数量线性增长,(ii)DDMs使用固定的全局评分规则超参数,无法在不同采样预算中灵活调整。我们通过将粒子扩展推迟到晚期变压器层,并引入时间依赖的评分规则调度来缓解这些限制,从而在晚期变压器层中处理多粒子扩展,并在不同预算中灵活调整超参数权衡。(论文赞 3)
在 Hugging Face 查看
排行第十二:AutoRef: 利用优化进行多参考图像生成
最近的图像生成模型可以接受多个参考图像并将其组合为新图像。然而,多参考图像生成仍然具有挑战性:模型可能会遗漏或复制参考中的主体,或生成多个主体在图像中 unnaturally 粘贴的图像。近期工作提出了图像生成代理,该代理结合图像生成模型、推理模型和一个代理,该代理指定如何解析参考图像、如何执行生成、如何诊断输出以及如何选择最终图像。在多参考生成中,参考扮演不同角色,输出必须满足多个约束条件,例如一致性、多样性和最小化粘贴伪影。(论文赞 8)
在 Hugging Face 查看
