还在为了能在PDF里搜索而手动做OCR吗?Perplexity的新开放嵌入模型可以直接跳过这一步。他们发布了pplx-embed-v2-late模型,可以在Hugging Face上找到,MIT许可证,有0.6B和9B两种大小,基于Qwen3.5构建。这些是ColBERT风格的晚期交互检索器:每个词都有一个128维的向量,查询通过将每个词与文档中最接近的词匹配来评分(MaxSim)。这些模型可以处理文本、图像以及PDF和幻灯片等渲染页面。两种大小共享一个嵌入空间,所以小模型和大模型可以互相兼容。
—— huggingface (@huggingface) X帖子|2026-10-08T01:26:06+00:00
原帖:https://x.com/huggingface/status/2108213409430798428
huggingface:还在为了能在PDF里搜索而手动做OCR吗?Perplexit…
还在为了能在PDF里搜索而手动做OCR吗?Perplexity的新开放嵌入模型可以直接跳过这一步。他们发布了pplx-embed-v2-late模型,可以在Hugging Face上找到,MIT许可证,有0.6B和9B两种大小,基于Qwen
扫描二维码,在手机上阅读
