Perplexity 开源两款多模态 embedding 模型 pplx-embed-v2-late,参数规模分别为 0.6B 和 9B。两款模型的向量彼此兼容,开发者可以先用 9B 模型建立资料库,再用 0.6B 模型处理日常搜索,无需在每次查询时都运行大模型。
支持文字、图片和 PDF 页面检索
这套新模型支持文字、图片和 PDF 页面检索。与通常将一段内容压缩为单个向量的 embedding 模型不同,pplx-embed-v2-late 会为每个 token 保留一个 128 维向量,用于让搜索词分别匹配文档中的相关内容,减少细节丢失。
在处理 PDF、PPT 和扫描件时,模型可以直接把页面图像转换为向量,不需要先通过 OCR 提取文字,同时保留图表、表格和排版信息。
两款模型共用同一向量空间
Perplexity 表示,这两款模型由同一个 18B 教师模型训练而来,并共用一套向量空间。
官方披露测试结果
官方在 ViDoRe v3 图片检索测试中披露,使用 0.6B 模型建库并查询时,得分为 62.3%;改为 9B 模型建库、0.6B 模型查询后,得分提升至 63.5%;如果建库和查询都使用 9B 模型,得分为 65.2%。
目前,两款模型权重已在 Hugging Face 以 MIT 协议开放。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

