HF榜单(2026年10月01日 12:45 北京时间)


Audio8-ASR-Infinite(语音识别)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1965,趋势分 1517。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1965 · 趋势分 1517)
在 Hugging Face 查看

排行第二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4698,趋势分 1364。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4698 · 趋势分 1364)
在 Hugging Face 查看

排行第三:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1107,趋势分 863。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1107 · 趋势分 863)
在 Hugging Face 查看

排行第四:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2595,趋势分 859。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2595 · 趋势分 859)
在 Hugging Face 查看

排行第五:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 577,趋势分 534。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 577 · 趋势分 534)
在 Hugging Face 查看

排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2725,趋势分 525。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2725 · 趋势分 525)
在 Hugging Face 查看

排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 565,趋势分 381。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 565 · 趋势分 381)
在 Hugging Face 查看

排行第八:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5741,趋势分 366。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5741 · 趋势分 366)
在 Hugging Face 查看

排行第九:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16671,趋势分 366。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16671 · 趋势分 366)
在 Hugging Face 查看

排行第十:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2308,趋势分 314。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2308 · 趋势分 314)
在 Hugging Face 查看

排行第十一:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 319,趋势分 309。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 319 · 趋势分 309)
在 Hugging Face 查看

排行第十二:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 458,趋势分 304。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 458 · 趋势分 304)
在 Hugging Face 查看

论文

排行第一:打破巴别塔:自适应多代理系统用于长格式字幕翻译
长格式字幕翻译需要对跨越集或整个系列的论述和文化背景进行推理,同时保持一致的术语和风格。现有单一LLM方法大多限于句子级,多代理系统通常使用静态工作流程,无法适应场景复杂性或制作背景。我们提出SMART,一个自适应多代理系统用于长格式字幕翻译。在测试时间训练期间,SMART构建持久的系列级记忆,并通过动态路由器和混合多代理层翻译一部分句子,该层包含术语验证、子标题约束验证和上下文检索的工具。裁判模型评估翻译质量并提供反馈。
在 Hugging Face 查看

排行第二:UniEvo-VL:多模态模型自我改进的自蒸馏训练配方
现代多模态模型将生成和理解整合到一个统一系统中,使它们能够提供和从自身反馈中学习。受这种统一能力的激励,我们引入了UniEvo-VL,一个多模态模型的自我进化框架,在测试时间计算期间利用这种建设性的自我纠正反馈。与单独的教师不同,我们利用他们的自我批评作为特权信息,并让单一多模态模型同时充当教师和学生。教师在特权批评的条件下工作,而学生仅看到标准问题。训练最小化每状态的差异。(论文赞 9)
在 Hugging Face 查看

排行第三:PivotOPD:从关键错误中恢复的多轮代理学习
基于政策的蒸馏(OPD)是训练语言代理的一种有希望的方法,为学生生成的轨迹提供密集的教师监督。然而,在多轮互动中,一次不正确的操作会改变学生后续遇到的状态,因此错误会在多轮中累积。我们在三个Qwen3模型(8B到235B)上进行初步实验,发现超过一半的失败行程包含一个关键错误,一个使代理远离完成任务的行动,这种错误通常发生在早期。这些关键错误通常可以恢复:在关键行动后的几轮引导可以恢复任务成功。因此,我们提出了一个基于策略的蒸馏方法,旨在通过关键错误后的恢复来提高性能。(论文赞 1)
在 Hugging Face 查看

排行第四:AREX-2:通过长期反思任务推进自改进代理
我们介绍了AREX-2,旨在推进语言代理的自改进能力,我们定义其为在测试时间迭代改进解决方案的能力。这种能力依赖于两种互补的能力:反思,产生更好的解决方案;和长期执行,使迭代在许多轮中保持有效。我们假设这两种能力都是领域通用的,因此可以在适合监督的领域中学习。为此,我们从机器学习和算法编程两个领域合成长期改进行驶,这两个领域提供了可验证的反馈和奖励持续迭代。(论文赞 4)
在 Hugging Face 查看

排行第五:绕过计算上限:Galahad在Byte-Exact内存中使LLM阅读成为一次成本
变换器语言模型每令牌执行有界计算,最近由Vishal Sikka提出的工作表明,这个限制决定了模型可以执行或验证的任务范围。我们询问在这些限制之下,有多少预算用于已完成的工作。服务 across 请求是无状态的:一个模型回答关于文档的第二个问题时会从头重新计算文档的注意力状态。在七个真实世界的数据集上,98.7%的提示令牌是模型已经阅读过的文本。我们为vLLM、SGLang和llama.cpp引入了Galahad,一个内存层,使这种阅读成为一次成本。Taliesin保存了Tr(论文赞 1)
在 Hugging Face 查看

排行第六:AdviSD:通过目标多轮自我蒸馏学习建议前沿LLM
一个小型可训练的顾问可以使用自然语言建议引导一个冻结的语言模型执行器。除了从任务奖励中学习外,顾问还可以使用完成交互的反馈来改进其建议。然而,一个合理的纠正不一定改变执行,但从这样的纠正中学习仍可能影响顾问在其他情境下的决策。在共享参数模型中,我们证明如果纠正的目标比其他纠正更弱,它们的学习可能会限制模型的最终性能。让它们比其他纠正更少出现可以提高模型最终性能。我们受到这一启发,提出了我们的方法,通过目标多轮自我蒸馏学习建议前沿LLM。
在 Hugging Face 查看

排行第七:决策导向推荐重排:Jev的实证研究
本研究探讨决策导向模型在推荐重排任务中的应用,将其视为在预定义候选项目中进行结构化选择的问题。通过对比Jev模型与推荐专用模型及点对点、列表式Qwen重排器,在多个亚马逊评论领域和不同候选集规模下进行控制实验,评估推荐质量和效率的权衡。(论文赞 1)
在 Hugging Face 查看

排行第八:Agent Error数据集:5万错误诊断对扩展
本文介绍Agent Error数据集(AED),包含来自33个环境、19种框架家族和23种策略模型的50,228个错误诊断对,覆盖9,961个源任务。该数据集保留源轨迹和执行元数据,支持跨设置故障分析和重新诊断,无需重复原始运行。研究还提出五阶段Agentic Error-to-Training(AET)流程,用于失败分析和错误感知的后训练。(论文赞 15)
在 Hugging Face 查看

排行第九:跳出框架:语言模型能否选择性依赖外部指导?
研究语言模型在人工设计工作流中的表现,探讨模型能否从有用指导中受益同时忽略不可靠指导,即“跳出框架”能力。引入Box^2-Bench基准,固定模型和任务,改变工作流可靠性以隔离模型对指导的依赖调节。前沿模型在可靠指导下表现良好,但在误导性或不可靠指导下仍易受影响。(论文赞 3)
在 Hugging Face 查看

排行第十:测试时AI4AI中代理框架设计的元技能学习
研究测试时AI-for-AI,探讨Builder模型如何学习为Target模型构建更好的执行环境,同时保持两者权重固定。引入Meta-Skill概念,定义何时需要支持及提供何种资源的原则。Builder从开发集上的执行反馈中学习这些原则,然后使用冻结技能库为未见任务构建框架。在Harness-Bench和NewtonBench上,全库元技能比无技能构建提升宏观平均性能8.95个百分点。(论文赞 33)
在 Hugging Face 查看

排行第十一:SkillSeek:重新审视市场规模的代理技能检索
针对开源聚合中超过23万技能的检索瓶颈,提出SkillSeek开源两阶段技能检索器。它基于标准IR流程(BGE-base双编码器 feeding 小型交叉编码器,通过MCP暴露),在89任务SkillsBench基准上,对比4×11网格的池、骨干和方法配置,替代代理内部LLM介导的检索循环。(论文赞 1)
在 Hugging Face 查看

排行第十二:PatchHolmes:基于列表选择的代理补丁检索
针对漏洞管理中60%-63%的CVE缺乏补丁链接的问题,提出PatchHolmes两阶段补丁检索系统。第一阶段混合检索器与第二阶段代理检查循环结合,代理以列表方式读取前100候选,通过四种预算工具选择性阅读3-10个提交后推荐最佳补丁。在GitHubAD上,PatchHolmes比点对点二元分类器Favia提升25.34%。
在 Hugging Face 查看



扫描二维码,在手机上阅读

Muse下载突破500万,超越ChatGPT

HN榜单(2026年10月01日 12:45 北京时间)

评 论
评论已关闭