Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4525,趋势分 1755。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4525 · 趋势分 1755)
在 Hugging Face 查看
排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1544,趋势分 1354。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1544 · 趋势分 1354)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2449,趋势分 1039。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2449 · 趋势分 1039)
在 Hugging Face 查看
排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 877,趋势分 740。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 877 · 趋势分 740)
在 Hugging Face 查看
排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2659,趋势分 698。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2659 · 趋势分 698)
在 Hugging Face 查看
排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 531,趋势分 522。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 531 · 趋势分 522)
在 Hugging Face 查看
排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 520,趋势分 501。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 520 · 趋势分 501)
在 Hugging Face 查看
排行第八:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1808,趋势分 402。标签:xing4_0、conversational、custom_code。(点赞 1808 · 趋势分 402)
在 Hugging Face 查看
排行第九:ZDTaichu5.0-9B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1948,趋势分 395。标签:zdtaichu5_0、multimodal、vision-language-model、spatial-reasoning、agent。(点赞 1948 · 趋势分 395)
在 Hugging Face 查看
排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 426,趋势分 374。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 426 · 趋势分 374)
在 Hugging Face 查看
排行第十一:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5574,趋势分 352。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5574 · 趋势分 352)
在 Hugging Face 查看
排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16571,趋势分 352。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16571 · 趋势分 352)
在 Hugging Face 查看
论文
排行第一:对抗训练提升像素扩散模型性能
该研究针对像素扩散模型输出缺乏细节统计特征的问题,提出通过对抗学习进行后训练修正。在预训练模型基础上添加对抗损失,不改变模型架构和采样过程,有效提升图像分布质量。(论文赞 1)
在 Hugging Face 查看
排行第二:LIFT:基于布局控制的视频生成方法
LIFT是一种图像到视频生成框架,结合相机控制与未来布局控制,让用户指定未来视角的内容和位置。解决了现有方法无法精确控制未来视图内容和空间布局的问题。
在 Hugging Face 查看
排行第三:EasyPPO:稳定 critic 是关键
研究发现PPO算法中的critic是大语言模型强化学习不稳定的主要来源。通过分析critic的两种失效模式,提出改进方法以稳定训练过程,提升算法性能。(论文赞 6)
在 Hugging Face 查看
排行第四:Real2Gym:从视频构建机器人训练环境
Real2Gym框架将现实世界视频转化为可交互的仿真环境,实现从演示到机器人技能的转换。包含场景重建、动作验证和任务变体生成等功能模块。(论文赞 2)
在 Hugging Face 查看
排行第五:LongLive-Plug:视频生成的通用蒸馏框架
LongLive-Plug提出一次性蒸馏框架,学习可重用的LoRA适配器,实现训练-free的插件式部署。支持单次采样、长视频生成等能力,提高模型复用效率。(论文赞 5)
在 Hugging Face 查看
排行第六:CrossBFM:跨人体模型的行为空间蒸馏
CrossBFM方法在不同人体模型间建立共享的潜在行为空间,解决传统方法训练耗时长且难以迁移的问题。通过跨模型对应关系实现行为空间的统一和转移。(论文赞 3)
在 Hugging Face 查看
排行第七:机器人上下文学习:方法与应用
通用机器人必须推断新任务的需求,并将这种理解转化为适当的物理动作。机器人上下文学习(ICL)通过使用演示和交互来引导现有能力,且在部署过程中神经参数保持固定。本文综述围绕连接上下文证据与执行的接口展开,区分出四个类别:上下文条件策略、几何演示迁移、基于世界模型的控制以及基于技能和代理的执行。比较这些接口有助于明确它们的迁移假设以及训练、对应和记忆在实现上下文学习中的作用。(论文赞 2)
在 Hugging Face 查看
排行第八:Marathoner:超长时域自主智能
人类天生具备为长期目标持续工作的能力。面对具有挑战性的任务,人类可以连续数月甚至数年完成特定目标。本文提出Marathoner,一种具备超长时域执行能力的自主智能模型。具体而言,我们提出一个全面的微调流程,将这一关键能力注入基础模型。在超长时域任务合成方面,我们利用包含1000多行新代码的主要版本PR作为主要数据源,生成具有挑战性的任务级数据。此外,我们引入多任务链式结构,将多个任务串联起来。(论文赞 1)
在 Hugging Face 查看
排行第九:超越时间线:基于实体传记增强长视频记忆
回答关于长视频的问题通常需要将涉及相同对象的事件跨数小时或数天进行关联。时间顺序描述和从文本中提取的实体可能无法解决物理身份的识别问题:不同对象可能共享相同的描述,而对同一对象的观察在不同事件中可能相互分离。因此,检索相关事件并不一定能够恢复问题所涉及的特定实体的“传记”。为了解决这一问题,我们引入了基于实体传记(GEB)的长视频记忆框架,该框架将同一物理实体在不同片段中的视觉关联观察分组为可检索的传记,同时保留事件的上下文信息。(论文赞 20)
在 Hugging Face 查看
排行第十:面向潜在递归大语言系统的原理性思考
大语言模型可以通过在隐藏状态上递归或在代理之间传递隐藏状态,在连续空间中进行推理,而训练过程仅监督最终解码答案的交叉熵(CE),并不约束推理过程。理论和实证分析确立并验证了仅使用CE训练会导致四个失败情况,从而降低正确答案的概率,例如不同问题的推理过程崩溃或保留无关信息。我们引入了REST(REpresentation-Supervised Thoughts),一种训练目标,通过四个有效推理表示的属性(因果性、最小性、可分性和稳定性)来提升模型推理能力。(论文赞 1)
在 Hugging Face 查看
排行第十一:各向异性表示提升JEPA世界模型中的规划能力
潜在世界模型在表示空间中学习动作条件下的动态,并通常通过与目标表示的欧几里得距离来评估候选动作。联合训练通常通过正则化防止表示崩溃,但由此产生的表示几何也决定了规划过程中终端错误的权重。我们发现,准确的预测和非崩溃的表示并不能保证与任务对齐的潜在规划成本:各向同性高斯正则化可能诱导一种几何结构,使得可行结果的排序与任务成本不同。为了解决这一不匹配问题,我们引入了AnisoWM与ΛReg,将固定的各向同性高斯目标替换为可学习的各向异性目标。(论文赞 13)
在 Hugging Face 查看
排行第十二:密集检索何时需要非对称几何?共享与双投影的偏差-方差理论
密集检索支持检索增强生成、语义搜索和问答,但选择共享或双投影查询-文档表示的理论依据尚不明确。我们引入了一种低秩双线性评分的偏差-方差理论。共享投影会诱导正半定算子,而双投影可以实现任意低秩算子。我们推导了它们的精确近似差距,并证明了一个局部高斯边界:当方向信号的平方超过其额外自由度的估计成本时,双投影的风险更低。这一边界启发了交叉拟合非对称风险选择器(CARS),用于估计可重复的方向信号。(论文赞 6)
在 Hugging Face 查看
