Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4877,趋势分 1170。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4877 · 趋势分 1170)
在 Hugging Face 查看
排行第二:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1237,趋势分 896。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1237 · 趋势分 896)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2736,趋势分 775。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2736 · 趋势分 775)
在 Hugging Face 查看
排行第四:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 445,趋势分 442。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 445 · 趋势分 442)
在 Hugging Face 查看
排行第五:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 629,趋势分 426。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 629 · 趋势分 426)
在 Hugging Face 查看
排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2804,趋势分 420。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2804 · 趋势分 420)
在 Hugging Face 查看
排行第七:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5884,趋势分 370。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5884 · 趋势分 370)
在 Hugging Face 查看
排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16741,趋势分 348。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16741 · 趋势分 348)
在 Hugging Face 查看
排行第九:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 348,趋势分 334。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 348 · 趋势分 334)
在 Hugging Face 查看
排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 509,趋势分 293。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 509 · 趋势分 293)
在 Hugging Face 查看
排行第十一:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 606,趋势分 281。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 606 · 趋势分 281)
在 Hugging Face 查看
排行第十二:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2340,趋势分 259。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2340 · 趋势分 259)
在 Hugging Face 查看
论文
排行第一:Devils in Question Relay:源条件中继转向缓解AVLLM幻
音频-视觉大语言模型(AVLLM)通过视觉、听觉和语言信息的交互,在多模态理解和推理方面取得了显著进展。然而,近期研究表明,AVLLM面临一个关键挑战:源混淆接地幻觉,即未使用模态的线索诱导出所需模态不支持的响应,从而削弱了实际应用中的可靠性。现有方法在缓解此问题方面已取得进展,但其如何从内部跨模态交互中产生仍缺乏深入理解。为填补这一空白,我们进行了路径干预和表征分析,揭示了其内部机制。(论文赞 3)
在 Hugging Face 查看
排行第二:KaliBench:Kali Linux网络安全工具使用的细粒度基准
大语言模型(LLM)越来越多地应用于网络安全工作流,期望将分析师的意图转化为工具调用。然而,现有评估主要关注基于知识的评估或端到端代理任务,并未直接衡量LLM为真实世界网络安全工具生成可执行命令的能力。这一差距至关重要,因为网络安全操作依赖于严格的命令行接口(CLI),其中微小的语法错误、不正确的标志-值绑定或参数顺序错误都可能导致执行无效。我们引入了KaliBench,一个在Kali Linux上进行自然语言到CLI翻译的细粒度基准和数据集,包含8,504个查询-命令对。(论文赞 1)
在 Hugging Face 查看
排行第三:DataMagic:通过声明式多智能体编排创作数据视频
数据视频通过动态图表、语音叙述和同步动画来传达数据洞察,已成为广泛采用的数据叙事形式。然而,制作数据视频需要数据分析、叙事设计和视频编辑方面的专业知识。静态可视化工具缺乏叙事和动画能力;创作工具依赖于预准备图表而非原始数据;像素级模型以端到端方式生成视频,但无法保证数据准确性或来源。端到端自动生成面临两个核心挑战:如何统一表示图表、叙述和动画及其时间关系,以及如何高效搜索庞大的可能性空间。(论文赞 2)
在 Hugging Face 查看
排行第四:Memorizon:训练超越上下文窗口的世界模型
流式世界模型应在重复访问时一致地渲染同一地点。直接监督此类重访需要包含两次访问的训练样本,通常跨越数分钟。然而,对整个跨度进行密集注意力计算会产生二次成本,使得长跨度监督代价高昂。Memorizon打破了这种耦合:长跨度是监督所需,但非注意力所需,因为两次访问可以共享前向传递而无需包含所有中间帧。训练样本覆盖任意长度的跨度,但仅对其最后k个块进行评分。每个评分块通过相机共可见性检索自己的top-K潜在表示,而非对之前历史进行标记化。(论文赞 3)
在 Hugging Face 查看
排行第五:广泛探索,锐利推理:通过采样推动小模型迈向前沿
功率锐化采样是一种推理时替代强化学习(RL)后训练的方法,用于增强大语言模型(LLM)的推理能力。高概率序列在基础模型下被放大,无需参数更新或外部奖励,避免了RL的高成本优化和不稳定泛化。然而,该方法面临基本的探索-利用权衡:强锐化限制探索,使采样器陷入合理但不正确的推理轨迹;而弱锐化则使答案分布分散。为解决此权衡,我们引入了并行功率调温(PPT),实例化功率锐化的LLM采样。
在 Hugging Face 查看
排行第六:基准测试与增强部分可观测机器人操作的技能级记忆
机器人学习的最新进展使得操作策略能够执行日益多样化的任务并在环境中泛化。然而,可靠执行通常依赖于无法仅从当前观察确定的隐藏任务状态,使得交互历史至关重要。我们引入了HIDE,一个用于评估部分可观测性下操作记忆的基准。HIDE包含15个任务,涵盖重复计数、历史状态回忆和执行进度跟踪,具有随机初始配置和决策点,其中相似观察需要根据先前事件采取不同行动。我们进一步提出了SEEK,一个结合三种记忆增强技术的框架。(论文赞 3)
在 Hugging Face 查看
排行第七:小模型生成更优拒绝样本的偏好蒸馏方法
本文发现传统偏好蒸馏方法中两个假设不成立:小模型生成的拒绝样本比学生模型自生成的样本更有效,且计算成本更低。在代码生成和数学推理任务上,7B到72B规模的学生模型使用冻结小模型生成的拒绝样本训练效果更好。(论文赞 1)
在 Hugging Face 查看
排行第八:人形机器人操作技能测试时进化方法
研究人形机器人在测试时通过重新利用已有技能来学习新任务的方法,无需重新训练。关键是通过规划与控制间的接口表达接触丰富的多阶段交互,并利用执行反馈指导经验规划。(论文赞 6)
在 Hugging Face 查看
排行第九:异构多智能体LLMs的跨模型KV缓存传输
针对异构多智能体LLM系统中文本通信的冗余预填充问题,提出HeteroFold方法实现跨模型家族的KV缓存传输,保持发送方和接收方模型冻结,通过结构对齐和空间映射保留接收方行为。(论文赞 1)
在 Hugging Face 查看
排行第十:无需3D资产的3D纹理生成方法
提出Tex-Zero框架,证明高质量3D纹理生成无需真实3D资产训练。关键发现是几何信息可人工构建,而高质量颜色信息才是3D纹理训练的核心。(论文赞 2)
在 Hugging Face 查看
排行第十一:语言与视觉的统一连续生成模型
提出Multimodal Flow模型,实现语言和视觉在嵌入空间的完全连续生成建模,避免视觉量化瓶颈和模态依赖目标,通过共享分块因果流架构统一生成过程。(论文赞 6)
在 Hugging Face 查看
排行第十二:保持拓扑结构的高分辨率3D生成方法
提出SILSA框架,用紧凑滑动窗口切片潜在表示3D形状,避免昂贵体素标记生成,通过三个标准轴上的重叠切片保持横截面连续性,支持拓扑一致性生成。(论文赞 6)
在 Hugging Face 查看
