Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4626,趋势分 1460。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4626 · 趋势分 1460)
在 Hugging Face 查看
排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1687,趋势分 1421。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1687 · 趋势分 1421)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2519,趋势分 882。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2519 · 趋势分 882)
在 Hugging Face 查看
排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1016,趋势分 856。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1016 · 趋势分 856)
在 Hugging Face 查看
排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2705,趋势分 583。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2705 · 趋势分 583)
在 Hugging Face 查看
排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 556,趋势分 547。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 556 · 趋势分 547)
在 Hugging Face 查看
排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 549,趋势分 469。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 549 · 趋势分 469)
在 Hugging Face 查看
排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16631,趋势分 367。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16631 · 趋势分 367)
在 Hugging Face 查看
排行第九:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5668,趋势分 353。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5668 · 趋势分 353)
在 Hugging Face 查看
排行第十:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2294,趋势分 335。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2294 · 趋势分 335)
在 Hugging Face 查看
排行第十一:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 444,趋势分 320。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 444 · 趋势分 320)
在 Hugging Face 查看
排行第十二:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1813,趋势分 304。标签:xing4_0、conversational、custom_code。(点赞 1813 · 趋势分 304)
在 Hugging Face 查看
论文
排行第一:周期弱区:分块KV缓存压缩的阶段敏感性
分块KV缓存压缩通过将连续标记窗口压缩为固定步长的少数缓存条目,减少了长上下文推理的内存和注意力成本。这种压缩还引入了一个新的位置坐标:标记的阶段,即其相对于压缩窗口边界的定位。我们发现了使用此类压缩的大规模开放权重模型中的系统不对称性:相同的信息可以在某个阶段轻松检索,而在另一个阶段却难以检索。我们称之为周期检索性能的阶段敏感性。在大型开放权重模型中使用此类压缩时,长上下文检索准确率可以在不同阶段之间相差高达40个百分点,揭示了...(论文赞 41)
在 Hugging Face 查看
排行第二:组织代理:超越个人助理迈向组织代理
服务于组织的语言模型代理必须协调来自多个用户的请求,同时利用分布在它们交互中的知识。我们确定两个互补的能力设置,在这种设置下,语言模型代理服务于组织:一是跨用户交互和决策,二是跨用户记忆和知识使用。这两种能力都受组织约束的三个方面的制约:用户身份、权威和访问权限;信息的归属和时间有效性;以及解决跨用户和完成联合决策要求的冲突规则。这些约束塑造了在执行操作之前必须获取的信息或决策的性质,以及在模型更新过程中必须保留的知识。(论文赞 1)
在 Hugging Face 查看
排行第三:代理能否设计面向其他代理的库?
代理越来越多地建立在其他代理编写的代码上,并且它们重新实现而不是重用,导致后来的代理必须在更大的代码库中工作。为了衡量代理设计其他代理库的能力,我们引入了LibraryDesignBench,这是一个两阶段基准测试,其中代理从一个定义了所需功能和潜在用途但没有规定设计的规范中实现一个完整的库。我们通过三个用户代理在不同模型家族中的编程问题来评估库的正确性和简单性。基准测试涵盖了242个专家验证的编程问题,涉及15个库设计任务和四种语言。在十五个任务中的十一个中,专家设计的库能(论文赞 3)
在 Hugging Face 查看
排行第四:同家庭上政策蒸馏的标度性质
*强化学习(RL)* 可能在大型语言模型(LLMs)中引发实质性的推理能力,但这种能力在不同规模之间如何传递,以及传递的速度如何,仍不清楚。我们研究了*上政策蒸馏(OPD)*在不同强度、相同基础和从强到弱教师-学生设置中的标度特性。我们发现早期OPD训练动力学普遍表现出一个规则的*有用转移*阶段,在该阶段,持-out准确率(*金标准*,G)与学生初始化时的反向KL散度d=mathrm{KL(π_θVert π_{ref})}的平方根成正比。在每个观察到的弱到强的对中,学生模型(论文赞 2)
在 Hugging Face 查看
排行第五:持续学习的学习动力学:统一视角看数据归属、遗忘和塑性损失
现代语言模型很可能在其生命周期内不断更新,而不是一次训练并冻结。每个更新都参与一个重复周期:决定从哪个经验中学习,理解该更新改变了什么,并保持从接下来学习中发展的能力。我们展示了这些挑战由相同的更新行为互动所支配。通过分离软max力、共享读数几何和残差连接,它暴露了两个互动通道,并 yields一个可前计算的近似值。通过跟踪这种互动,我们揭示了数据归属和遗忘的动态平衡,以及塑性损失的机制,这些机制共同决定了持续学习的能力。(论文赞 1)
在 Hugging Face 查看
排行第六:在循环变换器中调度递归推理
递归推理模型因其扩展测试计算的能力而受到越来越多的关注,通常通过迭代地用一个共享参数集精炼潜在状态。然而,这些模型以固定的单位比例应用每个学习更新,这可能会保守当更新使持续进展时,或过于激进当它们波动时,限制了额外循环的好处。为了理解沿轨迹的比例应该如何变化,我们首先分析终端损失对递归更新比例敏感性的标度。我们展示了其时间平均值可以分解为持续进展和中心波动贡献。基于此,我们引入了轨迹调度概念,允许根据更新类型动态调整比例,从而实现更高效的递归推理。(论文赞 9)
在 Hugging Face 查看
排行第七:ALICE:上下文零样本互信息估计
本文提出ALICE,一种无需针对每个分布重新训练的基础模型,用于从样本中估计互信息。传统神经估计器在大数据下准确,但数据稀缺时表现不佳且需逐分布训练。ALICE通过在广泛的合成分布族上训练,实现上下文估计,解决了小样本场景下估计精度与训练效率的平衡问题。(论文赞 1)
在 Hugging Face 查看
排行第八:LIFT:大视角变化下的布局控制视频生成
LIFT是一个统一的图像到视频生成框架,结合相机控制和布局控制,允许用户指定未来视图的内容和位置。现有方法仅控制相机轨迹或提供粗略文本提示,无法精确确定未来帧的布局。LIFT通过布局控制弥补这一不足,特别适用于用户关注关键未来时刻场景内容的实际需求。(论文赞 6)
在 Hugging Face 查看
排行第九:FocusVTC:自适应分辨率视觉文本压缩
FocusVTC通过自适应分辨率打破视觉文本压缩的性能权衡,将文本渲染为图像以减少大语言模型的长上下文计算成本。它结合压缩的低DPI全局视图和选择性区域增强,在推理过程中集成增强视图,既节省token又保持可读性,同时保留多模态能力。(论文赞 13)
在 Hugging Face 查看
排行第十:SaveRouter:稀疏监督的经济LLM路由
SaveRouter针对大语言模型路由的监督成本问题,提出稀疏监督方法。路由学习需收集查询-模型质量反馈,产生部署前成本。研究发现路由质量在反馈收集饱和前即达峰值,密集监督可能经济过剩。该方法旨在使路由节省的成本覆盖前期支出。(论文赞 7)
在 Hugging Face 查看
排行第十一:PMOPD:多教师策略蒸馏中的任务排序与参数保护
PMOPD研究多教师策略蒸馏中的任务排序、循环和参数更新子空间保护。现有工作聚焦单任务蒸馏优化,而MOPD需在共享参数中聚合多能力并解决能力跷跷板效应。研究发现不同任务的参数更新快速集中于各自低维子空间,据此提出改进方法。(论文赞 3)
在 Hugging Face 查看
排行第十二:改进的分布扩散模型
本文改进分布扩散模型,用分布去噪器替代均值预测去噪器,通过评分规则目标学习条件分布的随机近似。针对扩展至现代图像生成的障碍:多粒子训练开销和全局固定超参数限制,提出延迟粒子扩展和引入时间依赖的评分规则调度来缓解。(论文赞 3)
在 Hugging Face 查看
