HF榜单(2026年10月02日 11:15 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4867,趋势分 1204。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4867 · 趋势分 1204)
在 Hugging Face 查看

排行第二:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1233,趋势分 892。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1233 · 趋势分 892)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2715,趋势分 782。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2715 · 趋势分 782)
在 Hugging Face 查看

排行第四:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 626,趋势分 433。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 626 · 趋势分 433)
在 Hugging Face 查看

排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2795,趋势分 431。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2795 · 趋势分 431)
在 Hugging Face 查看

排行第六:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5866,趋势分 370。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5866 · 趋势分 370)
在 Hugging Face 查看

排行第七:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 368,趋势分 365。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 368 · 趋势分 365)
在 Hugging Face 查看

排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16733,趋势分 348。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16733 · 趋势分 348)
在 Hugging Face 查看

排行第九:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 342,趋势分 328。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 342 · 趋势分 328)
在 Hugging Face 查看

排行第十:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 604,趋势分 292。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 604 · 趋势分 292)
在 Hugging Face 查看

排行第十一:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 501,趋势分 292。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 501 · 趋势分 292)
在 Hugging Face 查看

排行第十二:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2334,趋势分 260。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2334 · 趋势分 260)
在 Hugging Face 查看

论文

排行第一:DexPolicy: 轨迹引导的灵巧操作探索调度
本文研究了在轨迹引导的灵巧操作中,强化学习需要在发现手指与物体接触和精确控制物体之间取得平衡。现有方法因动作噪声干扰导致探索效率下降,提出DexPolicy通过显式控制探索规模,从宽泛到狭窄的探索策略,保持其他设置不变,以提升训练效果。
在 Hugging Face 查看

排行第二:用户意图漂移:测量与修复LLM代理中的意图变化
本文研究了LLM代理在多轮交互中用户意图变化导致的意图漂移问题,提出IntentFlux基准,将可验证任务转化为带有控制意图变化的对话,评估不同模型在动态对话中恢复正确任务的能力,发现意图变化显著影响最终结果。(论文赞 1)
在 Hugging Face 查看

排行第三:音频大模型是否先听后动?语音代理中的声学上下文门控诊断
本文研究音频语言模型在语音代理中如何判断是否响应命令,提出VGBench基准,测试在旁白、自言自语和说话者切换场景下的动作相关性判断,发现现有模型常识别目标工具但难以在情境变化时抑制不当动作。(论文赞 2)
在 Hugging Face 查看

排行第四:4Director: 基于刚体3D几何的视频世界模型控制
本文提出4Director,一种基于显式4D场景表示的视频世界模型,通过重建物体的规范网格并施加刚体变换来精确控制相机和物体运动,提供直观的3D控制界面并避免几何在帧间不一致。(论文赞 3)
在 Hugging Face 查看

排行第五:PixelDense: 像素扩散中的密集预测表示对齐
本文研究像素空间扩散中表示对齐的机制,发现空间结构而非全局语义是关键,提出使用SAM2、Depth Anything v2等密集预测模型作为对齐目标,发现几何教师模型优于语义教师,但多教师融合效果不佳。(论文赞 1)
在 Hugging Face 查看

排行第六:后训练中的锐化税:强化学习对LLM的影响
本文研究大语言模型后训练中的行为锐化现象,发现预训练模型在轻量推理框架下可作为有效代理,尽管单次准确率较低,但在多轮任务中解决方案覆盖率更高,挑战了后训练仅提升准确率的假设。(论文赞 3)
在 Hugging Face 查看

排行第七:OmniSeek:多轮视听推理的工具集成框架
OmniSeek是一种代理框架,将Omni大语言模型转化为具有原生工具使用的主动多轮推理代理。它通过动态决定何时观察或聆听,以及在哪个时间窗口内获取关键证据,使证据获取成为推理过程的一部分。通过迭代多轮协议,检索到的原始音视频片段被重新加入上下文,以支持后续推理。(论文赞 1)
在 Hugging Face 查看

排行第八:RPTune:LLM目录搜索的上下文优化方法
针对小型商户的长上下文LLM目录搜索,研究如何有效呈现和适应目录内容。RPTune提出一种端到端框架,结合学习的目录筛选与LLM后训练,提升模型在精选上下文中的产品选择能力,解决长上下文利用不均的问题。(论文赞 6)
在 Hugging Face 查看

排行第九:Align Then Reason:多模态语音同步判断方法
为实现无需参考音频的配音质量控制,提出Align Then Reason(ATR)方法。该方法通过建立帧级唇部表示与候选文本音素的单调对齐,再基于对齐结果进行推理,判断配音内容和时间是否与口型匹配,解决现有模型对时间错误不敏感的问题。(论文赞 1)
在 Hugging Face 查看

排行第十:超越记忆:基于显式信念状态的智能体
为提升LLM代理对复杂任务的理解,提出PoS框架,构建并持续维护显式信念状态作为决策上下文。信念状态结合当前世界估计和未完成任务需求,使代理明确其待学习和完成的内容,并通过一致性验证和进度监控防止信念困局。(论文赞 8)
在 Hugging Face 查看

排行第十一:ActiveSaddler:自动化课程学习优化代理
针对LLM代理优化中训练场景固定的问题,提出ActiveSaddler框架,将课程学习与代理优化结合。该框架将演化课程建模为非平稳过程,动态调整训练场景以适应代理的演进,实现更有效的反馈驱动优化。(论文赞 15)
在 Hugging Face 查看

排行第十二:ROWBench:视频模型对程序指令的遵循性评估
针对可编程世界模型的视觉一致性评估不足,提出PROWBench基准。该基准包含170个程序生成的场景和600个代理视频,记录实体状态和时间戳事件,包括视野外的交互,用于测试视频模型对程序指定世界事件的精确还原能力。(论文赞 4)
在 Hugging Face 查看



扫描二维码,在手机上阅读

中文科技热榜(2026年10月02日 11:15 北京时间)

X榜单(2026年10月02日 11:21 北京时间)

评 论
评论已关闭