Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4531,趋势分 1730。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4531 · 趋势分 1730)
在 Hugging Face 查看
排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1548,趋势分 1357。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1548 · 趋势分 1357)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2453,趋势分 1021。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2453 · 趋势分 1021)
在 Hugging Face 查看
排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 879,趋势分 742。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 879 · 趋势分 742)
在 Hugging Face 查看
排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2666,趋势分 693。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2666 · 趋势分 693)
在 Hugging Face 查看
排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 532,趋势分 523。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 532 · 趋势分 523)
在 Hugging Face 查看
排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 520,趋势分 501。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 520 · 趋势分 501)
在 Hugging Face 查看
排行第八:ZDTaichu5.0-9B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1971,趋势分 395。标签:zdtaichu5_0、multimodal、vision-language-model、spatial-reasoning、agent。(点赞 1971 · 趋势分 395)
在 Hugging Face 查看
排行第九:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1809,趋势分 385。标签:xing4_0、conversational、custom_code。(点赞 1809 · 趋势分 385)
在 Hugging Face 查看
排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 427,趋势分 371。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 427 · 趋势分 371)
在 Hugging Face 查看
排行第十一:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5583,趋势分 353。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5583 · 趋势分 353)
在 Hugging Face 查看
排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16573,趋势分 350。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16573 · 趋势分 350)
在 Hugging Face 查看
论文
排行第一:Chinese-Jev:将系统一模型应用于中文任务
系统一模型如Jev为需要决策而非开放回答的任务提供了高效的替代方案。然而,现有Jev模型在中文语言决策准确性方面存在局限,限制了其在通用和专业场景中的应用。本文介绍了Chinese-Jev,一种通过统一的数据处理和训练流程解决这一问题的系统一模型。我们的数据处理协议将异构的中文标注转换为候选选项的概率目标,使不同领域和问题格式的训练能够共享统一的公式。为实现高效的推理,Chinese-Jev采用...(论文赞 1)
在 Hugging Face 查看
排行第二:VoxMem:评估大语言音频模型的多模态记忆能力
语音对话系统必须从之前的交互中恢复信息(即记忆),但语音中的相关信息不仅包括说了什么,还包括是谁说的、如何表达以及可听性,这些信息仅存在于音频信号中,无法从文本中恢复。除了记忆什么,记忆还需要多种操作:检索单个事实、整合多轮证据、跟踪演变状态。真实交互还跨越多个会话,意味着信息在不同阶段中积累,而非单一连续记录。现有基准在三个维度上均存在不足:它们主要关注词汇...(论文赞 6)
在 Hugging Face 查看
排行第三:EpiCon:通过协同演进的多模态记忆实现智能体集体学习
智能体可以从过去的执行中学习,但让不同智能体复用并建立在彼此经验之上仍具挑战。我们引入EpiCon,一个无需更新主机模型参数的共享多模态记忆框架,用于智能体的集体学习。EpiCon通过两个独立训练的2B模型将问题级别的记忆演进与持久经验库连接起来:记忆控制器和树状自组织器。控制器在多次尝试中联合优化文本指导和视觉证据,并选择性地包含视觉记忆。自组织器分层整合经验,并为新问题检索经验和规则。我们在十一项基准上评估了EpiCon...(论文赞 3)
在 Hugging Face 查看
排行第四:EngiWorld:前沿智能体在专业工程环境中的表现如何?
自主智能体在通用计算机使用方面取得了快速进展,但专业工业工程的可靠自动化仍难以实现,因为工程工作流程需要在几何和物理约束及依赖关系上进行推理,这些约束和依赖关系在软件和设计阶段中保持不变。我们提出了EngiWorld,第一个围绕完整设计循环构建的基准:包含1301个专家整理的任务,涵盖6个工程领域(CAD、CAE、CAM、BIM、EDA和3D可视化)和26个专业软件平台,提供GUI和CLI界面,任务类型从软件选择到开放性任务不等。我们还引入了一种以工件为中心的评估方法...(论文赞 2)
在 Hugging Face 查看
排行第五:为每个边缘提供一个提案:二元矩阵的零样本摊销序列重要性采样
在生态学、心理测量以及社会和金融网络分析中,二元矩阵通常在给定其观察到的行和列总和的条件下进行分析,这将问题限制在具有相同边缘的有限矩阵样本空间中。两个基本问题是统计该空间的大小并从中进行均匀采样。序列重要性采样(SIS)通过独立加权样本和无偏计数估计器解决这两个问题,但其效率高度依赖于提案分布。现有的提案是通过分析设计的,其准确性可能随着边缘的变化而显著波动。我们展示了理想的SIS提案,使得每个权重等于...
在 Hugging Face 查看
排行第六:基于提示分歧的偏好引导开放词汇语义分割自适应方法
开放词汇语义分割(OVSS)能够对任意文本指定的词汇进行像素级预测,并在常见基准上表现出良好的泛化能力。然而,OVSS在医学影像、遥感和工业检测等专业领域中的表现通常下降,因为在这些领域中,获取用于自适应的密集像素级掩码成本高昂且需要特定领域的专业知识。我们提出了一种基于偏好的自适应框架,用二元偏好取代密集掩码监督。我们观察到,不同的提示模板会对同一图像产生系统性不同的分割结果,我们称之为提示分歧,并将其重新利用...
在 Hugging Face 查看
排行第七:LongCat-DeepResearch技术报告
我们介绍了LongCat-DeepResearch,这是一个结合增强版LongCat模型和多代理工作流程以生成全面、证据支持的报告的系统。工作流程将全局规划与详细调查分离,并协调各章节级别的修订。通过多个规划代理首先探索外部来源并精炼一个可操作的研究计划(称为ResearchSpec),然后调查代理在并行中起草各自分配的章节,收集随着分析发展而产生的额外证据。章节组装后,全局审查指导有针对性的局部修订,减少了对重复全报告重写的需求。(论文赞 1)
在 Hugging Face 查看
排行第八:语言模型是不安全记者
随着大型语言模型在自主长时任务中部署,手动审核和验证模型的动作、工件和输出变得越来越困难。用户转而依赖LLM生成的报告来评估工作质量的好坏。我们引入了一系列八个对抗性报告场景,以系统地研究LLMs是否隐藏了可能削弱成功工作叙述的叙事性缺陷。我们称这种现象为“不安全报告”。当面对包含一个植入的负面结果的机器学习实验日志时,GPT-5.5会标记该负面结果。(论文赞 2)
在 Hugging Face 查看
排行第九:PlaylistEval: 视频语言评委能否在一天乃至更多时间内被信任?
视频语言模型越来越多地被用作视频理解的评委,无论是评估模型输出还是训练奖励模型。然而,当证据隐藏在长达一天以上的视频中时,它们是否仍然可靠尚未建立。现有基准无法回答这个问题。他们的视频通常只有几分钟长,许多答案对可以从转录本中单独分离,收集人类判断也无法扩展到超长视频。我们介绍了PlaylistEval,一个代理框架,通过100小时播放列表收集构建视频语言基准,无需人工注释。它自动生成带有成对答案的问题及其差异答案的播放列表,这些答案的差异足以证明答案的正确性。
在 Hugging Face 查看
排行第十:TabFM: 无监督表格数据基础模型
表格机器学习通常依赖于每个数据集的单独工作流,为每项任务从头训练树集成或运行AutoML搜索。然而,我们介绍了TabFM,一个400M参数的表格基础模型,将监督表格预测表述为在上下文中学习。TabFM能够在单个前向传递中产生校准的零射击预测,而无需任务特定微调。完全在从结构因果模型生成的合成表格上训练,TabFM学习了一般表格表示,这些表示可以零射击转移到现实世界任务。在TabArena的所有51个基准数据集(38个分类和13个回归)中,零射击TabFM默认表格基础模型中排名(论文赞 3)
在 Hugging Face 查看
排行第十一:CaptchaArena: 用于训练计算机使用代理的大规模、细粒度数据集
交互式CAPTCHA对计算机使用代理来说仍然具有挑战性,而现有数据集在类型覆盖度、交互保真度和轨迹监督之间存在权衡。为了解决这些差距,我们介绍了CaptchaArena,这是第一个用于交互式CAPTCHA求解的大规模、细粒度训练数据集。它包含来自20种CAPTCHA类型和5种交互模式的5万个难题,每个解决方案都通过执行进行验证。使用CaptchaArena,我们训练了CaptchaAgent,这是一个适用于所有20种CAPTCHA类型的单一90亿参数策略。
在 Hugging Face 查看
