Hugging Face 模型趋势榜和每日论文。
模型
排行第一:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1325,趋势分 1232。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 1325 · 趋势分 1232)
在 Hugging Face 查看
排行第二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5201,趋势分 728。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5201 · 趋势分 728)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3198,趋势分 687。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3198 · 趋势分 687)
在 Hugging Face 查看
排行第四:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 533,趋势分 519。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 533 · 趋势分 519)
在 Hugging Face 查看
排行第五:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6405,趋势分 469。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6405 · 趋势分 469)
在 Hugging Face 查看
排行第六:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 470,趋势分 449。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 470 · 趋势分 449)
在 Hugging Face 查看
排行第七:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 388,趋势分 367。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 388 · 趋势分 367)
在 Hugging Face 查看
排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16981,趋势分 344。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16981 · 趋势分 344)
在 Hugging Face 查看
排行第九:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 415,趋势分 294。标签:computer-vision、visionhope。(点赞 415 · 趋势分 294)
在 Hugging Face 查看
排行第十:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2967,趋势分 283。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2967 · 趋势分 283)
在 Hugging Face 查看
排行第十一:Qwen3.8-Flash-Next-GSQ-RCO-GGUF(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 582,趋势分 218。标签:gsq、rco、quantization、mixed-precision、ist-daslab。(点赞 582 · 趋势分 218)
在 Hugging Face 查看
排行第十二:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 687,趋势分 209。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 687 · 趋势分 209)
在 Hugging Face 查看
论文
排行第一:接收者条件化潜在通信实现94%缓存回退
多智能体系统将大型上下文分布在多个智能体之间,通过通信协作完成任务。文本消息紧凑但需要解码,可能遗漏接收智能体所需证据。近期潜在通信转而传输KV缓存,避免了文本生成,可提高准确性和延迟。然而,完整KV缓存随单个智能体处理上下文及协作智能体数量线性增长,导致内存和上下文成本激增,常超出GPU资源和上下文窗口大小。本文关键观察是智能体只需发送接收者本地任务所需内容——称为接收者条件化。
在 Hugging Face 查看
排行第二:FrugalEvo:面向成本感知的LLM引导程序演化
LLM引导的演化方法(如AlphaEvolve)已成为解决计算优化难题(如圆包装)的有力手段。但先前工作通常在固定迭代次数下优化性能增益。我们认为实际优化应最大化单位成本收益。为此提出FrugalEvo框架:由更强但高成本LLM探索策略,低成本LLM实施并迭代优化代码。同时设计缓存高效演化过程,通过工具链和提示最大化不同演化步骤间前缀共享。(论文赞 1)
在 Hugging Face 查看
排行第三:早期问题计算能否助LLM解决新问题?
大语言模型常在同一对话中解决独立问题。早期问题的计算能否帮助解决新问题?为回答此问题,先进行初步实验显示保留历史可能提升或降低后续轮次准确率。为理解此效应,使用受控回放隔离特定问题-历史配对的内部状态变化。发现不同历史下这些变化保持当前问题间相似关系。为改进保留历史下的推理,提出STAIR(陈旧令牌注意力跨查询复用),捕获早期响应键值对。(论文赞 2)
在 Hugging Face 查看
排行第四:rollout-边缘蒸馏用于长序列自回归视频生成
自回归视频扩散支持低延迟流式生成,但长序列预测误差易累积。在自身生成序列上训练生成器会暴露于不完美历史。现有视频级分布匹配蒸馏对整个序列联合评分,导致片段修正可能为保持时序一致性而匹配周边伪影。为提供更清晰视觉质量信号,提出Rollout-Marginal蒸馏:保留生成历史进行自回归预测,但独立评分每个片段。(论文赞 3)
在 Hugging Face 查看
排行第五:多语言GSM-Symbolic:能力跨语言迁移的决定因素
我们对一种语言获得的能力如何迁移至另一语言知之甚少,现有评估依赖不可比易饱和数据集且罕有联合考察决定因素。识别迁移预测因子可避免全语言对穷举评估,助力开发者瞄准低资源语言性能限制因素。为评估跨语言能力迁移,提出多语言GSM-Symbolic数据集:覆盖30,000项匹配问答对、涵盖15种语言的可扩展数学数据集,使用符号模板防止过拟合并确保泛化。(论文赞 8)
在 Hugging Face 查看
排行第六:通过模型路由与协作的集体偏见缓解
大语言模型日益应用于公共卫生、金融和治理领域,需兼顾准确性与社会价值对齐。尽管近期有进展,LLM常延续或放大训练数据中的偏见,威胁公平性。自去偏鼓励LLM识别修正自身偏见,但依赖单一模型内在知识可能不足应对根深蒂固刻板印象。为此提出集体偏见缓解框架:通过学习细粒度模型行为并促进多样LLM间知识共享来减轻偏见,这是首个系统研究模型协作去偏的工作。(论文赞 2)
在 Hugging Face 查看
排行第七:重新思考SFT中的令牌重加权:抑制、反转与外推所学特征
监督微调(SFT)会从模型认为最不可能的令牌中最积极学习,这有助获取新行为,但也会放大噪声或冲突的监督信号、覆盖有用的预训练知识。通过统一的策略-损失视角,研究发现现有令牌重加权方法仅为演示令牌分配非负系数,只能抑制或放大监督更新,无法反转已学的有害特征;且更大的训练权重不会带来特征外推,因为它们改变的是优化轨迹,而非缩放固定的SFT方向。(论文赞 1)
在 Hugging Face 查看
排行第八:基于渐进式视觉规划的世界动作建模
世界动作模型(WAMs)通过初始观察和指令联合预测未来视觉动态与动作,用于机器人控制,但长程预测因密集视频滚播效率低而困难;部分方法仅预测单帧却忽略目标推进。本文提出ProWAM,一种渐进式世界动作模型,联合预测动作和有序稀疏视觉子目标,为任务执行中的动作生成提供明确视觉指导,解决长程预测问题。(论文赞 39)
在 Hugging Face 查看
排行第九:LVMT:用于长期视频分割的视频掩码Transformer
现有在线视频分割方法难以处理长期遮挡的长复杂视频,局限在于:①时间传播机制无法自适应选择跨时间传播的目标信息;②因内存需求和梯度消失无法在长视频上训练。本文提出轻量GRU时间传播模块(学习选择记忆和传播的信息),以及截断查询传播(TQP)以支持长视频训练,解决上述问题。(论文赞 3)
在 Hugging Face 查看
排行第十:高效推理训练未必会损害CoT的忠实性与可监控性
链式思维(CoT)推理让人类能检查大模型答案过程并监督行为,但推理成本高,推动了用更少令牌训练的高效方法。普遍担忧是此类训练可能导致模型跳过关键推理步骤,使CoT无法忠实反映决策。由于不同效率方法对CoT的长度压力不同,且部分任务需更多令牌才能忠实解释决策,目前尚不明确这种情况是否及何时发生,本文旨在理解这些动态。(论文赞 6)
在 Hugging Face 查看
排行第十一:Dream4ACT:面向多化身视频-动作建模的共享视觉动作接口
视频生成模型(VGMs)为化身的观察-动作建模提供强时空先验,但联合空间动作向量缺乏图像空间结构,且跨化身维度和语义不同,难以直接利用VGMs先验;末端执行器可视化未指定完整关节配置。本文提出Dream4ACT世界模型,用于跨化身的视频-动作联合建模;引入“动作视图”共享视觉接口,通过渲染目标关节坐标的视觉表示统一跨化身动作表征。(论文赞 1)
在 Hugging Face 查看
排行第十二:空间记忆智能:为世界模型赋予理解驱动的长期记忆
长视频生成和世界模型通过用户动作与历史记忆预测未来观察,用于交互娱乐和化身仿真,但记忆序列变长、结构复杂时,管理长程空间上下文面临挑战。本文基于多模态大语言模型(MLLMs)的空间推理能力,提出空间记忆智能(SMI)——首个系统性利用理解模型,为世界模型赋予理解驱动的长期空间记忆管理能力的框架。(论文赞 12)
在 Hugging Face 查看
