Image-to-Image · Visual Retrieval

Image2Image 视觉检索与导览 DINOv3-Large 旗舰选型

毫秒级实拍特征检索,精准连接知识库与大语言模型

博物馆文物 景点地标 业务闭集 8.6ms 检索
评测数据集概览
4 组公开基准 + 2 组业务闭集(汽车手册 199 找 1、研报切片 502 找 1)
大都会艺术博物馆 (MET)
博物馆藏品
底库: 260,655 Query: 87,942 DINOv3-L: 46.5%
汇聚全球跨越数千年的绘画、青铜器、雕塑、金工与织物,是检验海量底库下细粒度文物多视角识别的核心基准。
牛津地标建筑 (ROxford)
经典地标
底库: 4,993 Query: 70 DINOv3-L: 98.6%
覆盖牛津大学万灵学院、圆顶图书馆等历史建筑,检验严重树影遮挡、不同天气与大跨度视角下的建筑检索。
巴黎著名地标 (RParis)
经典地标
底库: 6,322 Query: 70 DINOv3-L: 98.6%
涵盖埃菲尔铁塔、巴黎圣母院、凯旋门等城市地标,检验密集人流遮挡、复杂街景背景干扰下的地标稳健命中。
真实实拍识物 (ILIAS Core)
实拍泛化
底库: 4,715 Query: 1,232 图 / 1,000 文 DINOv3-L: 77.8%
由干净 Query 对应真实杂乱环境实拍正样本,包含工艺品、日用品与雕塑,配有英文精细描述,最贴近通用实拍识物。
汽车手册图搜图
业务闭集
底库: 199 Query: 199 DINOv3-L: 97.5%
手册截图找回原图。闭集:199 次检索,每次从 199 张底库里找那 1 张。大众 / 宝马 / 宋。
研报切片图搜图
业务闭集
底库: 502 Query: 502 DINOv3-L: 95.0%
带图号的页面截图找回干净原图。闭集:502 次检索,每次从 502 张底库里找那 1 张。
单图推理耗时
8.61 ms
DINOv3-Large 硬件实测 (BS=1)
地标 Top 1 命中率
98.6% +
ROxford / RParis 权威评测
实拍 Top 1 准确率
77.8% Hit@1
ILIAS 复杂实拍环境 (较 Base +4.2%)
单卡显存开销
2.59 GiB
模型 2.09G + 26万底库 0.50G
业务闭环演示
实拍识物 ➔ 毫秒级向量匹配 ➔ 结构化知识注入 ➔ 大模型讲解生成
现场实拍
Query
8.6 ms
特征检索
Official Gallery

清乾隆 青花五彩仕女人物图赏瓶

Top 1 命中 · 0.95+
馆藏编号:MET-199471
所属年代:清 乾隆年间 (约18世纪中期)
出土地/窑口:中国江西景德镇官窑
物理材质:高白泥硬质高岭土瓷器 · 釉下青花釉上五彩
展厅位置:亚洲艺术展厅 · 206号展柜
AI 导览讲解
您眼前这件展品是藏于大都会艺术博物馆的【清乾隆青花五彩人物图赏瓶】。瓶身通体施白釉,釉质温润如脂。腹部核心开光处绘制了典型的清代宫廷仕女游园场景,线条流畅,发髻与衣褶描摹精细。背景辅以青花点缀的洞石与折枝花卉,展现了乾隆盛期景德镇官窑高超的配彩烧造工艺与文人审美情趣。
语音播报
00:08 / 00:28
模型性能矩阵
12 款模型在 4 个基准数据集上的准确率与单卡工程指标对照
体系 模型 参数 分辨率 ROxford RParis ILIAS MET (26万) 单图耗时 吞吐 (图/秒) 显存 选型定位
DINOv3 dinov3-l 推荐主力 303M 224×224 98.6% 98.6% 77.8% 46.5% 8.61 ms 611 2.59 GiB 高准确率,延迟仅 8.6ms,推荐旗舰主力
DINOv3 dinov3-b 极速备选 86M 224×224 97.1% 100.0% 73.6% 47.1% 4.37 ms 1,438 2.92 GiB 超低延迟 (4.3ms),高吞吐场景备选
DINOv3 dinov3-s 22M 224×224 94.3% 100.0% 62.7% 46.9% 4.28 ms 2,380 1.65 GiB 极轻量 / 实拍召回偏低
DINOv3 dinov3-s+ 29M 224×224 94.3% 98.6% 63.6% 46.8% 4.49 ms 1,760 1.96 GiB 轻量过渡版本
DINOv3 dinov3-h+ 841M 224×224 98.6% 98.6% 77.3% 44.9% 11.95 ms 278 2.80 GiB 参数量大,性价比不如 L
DINOv3 dinov3-7b 6.7B 224×224 98.6% 100.0% 86.4% 47.6% 32.58 ms 42 15.10 GiB 显存 13G+,不适合单卡高并发
WeCLIPv2 weclipv2-large 多模态 305M NaViT 256p 77.1% 100.0% 63.2% 41.6% 5.72 ms 300 1.22 GiB 中文图文双模态旗舰 / 任意长宽比
WeCLIPv2 weclipv2-base 多模态 87M NaViT 256p 80.0% 97.1% 57.0% 39.7% 2.97 ms 390 1.51 GiB 中文图文双模态主力 / 微信自研生态
WeCLIPv2 weclipv2-small 50M 256×256 70.0% 100.0% 56.4% 40.9% 4.23 ms 1,130 4.44 GiB 固定尺寸方图版本
WeCLIPv2 weclipv2-tiny 28M 256×256 72.9% 100.0% 53.2% 42.4% 2.48 ms 1,560 4.40 GiB 轻量图文模型
C-RADIO cradio-so400m 431M 512×512 91.4% 97.1% 85.4% 45.5% 60.03 ms 21 6.79 GiB 512 分辨率耗时长,非商用 License
C-RADIO cradio-h 652M 512×512 90.0% 97.1% 87.9% 46.1% 91.26 ms 15 8.34 GiB 仅作学术上界基准 / 单图近 100ms
业务闭集评测
汽车 199 次从 199 里找 1 · 研报 502 次从 502 里找 1 · 下表为 DINOv3-Large 与全模型 Hit@1 / Hit@5
汽车手册 Hit@1
97.5%
DINOv3-Large · 199 找 1
研报切片 Hit@1
95.0%
DINOv3-Large · 502 找 1
评测协议
闭集
每张检索图对应唯一原图,不掺公开底库
未评
文搜图
汽车 200 条 / 研报 502 条,后做
体系 模型 汽车 Hit@1 汽车 Hit@5 研报 Hit@1 研报 Hit@5
DINOv3dinov3-s98.5%100.0%95.6%98.8%
DINOv3dinov3-s+99.5%100.0%96.4%98.6%
DINOv3dinov3-b98.5%99.5%95.6%98.2%
DINOv3dinov3-l97.5%100.0%95.0%98.4%
DINOv3dinov3-h+95.0%100.0%95.2%98.0%
DINOv3dinov3-7b95.5%100.0%96.8%98.6%
C-RADIOcradio-so400m99.5%100.0%94.0%99.0%
C-RADIOcradio-h99.0%100.0%95.4%99.0%
WeCLIPv2weclipv2-tiny99.0%100.0%94.8%98.4%
WeCLIPv2weclipv2-small99.5%100.0%94.4%97.4%
WeCLIPv2weclipv2-base94.5%99.0%90.0%96.0%
WeCLIPv2weclipv2-large94.5%100.0%91.6%97.6%
中文图文双模态
WeCLIPv2 微信自研多模态系列,支持短中文与图片双向检索与跨模态对齐
型号 视觉主干 视觉参数 输入格式 文本主干 文本参数 维度 单图延迟 实拍 Hit@1 场景适配
WeCLIPv2-Large NaViT-Large/16 305 M 任意长宽比 (256p) xlm-roberta-large 305 M 768 D 5.72 ms 63.2% 高精中文图文检索、复杂语义匹配
WeCLIPv2-Base NaViT-Base/16 87 M 任意长宽比 (256p) xlm-roberta-base 85 M + 词向量 768 D 2.97 ms 57.0% 低延迟图文互搜、高并发场景
WeCLIPv2-Small ConvNeXt-Small 50 M 256×256 方图 xlm-roberta-base 85 M + 词向量 768 D 4.23 ms 56.4% 标准固定尺寸输入场景
WeCLIPv2-Tiny ConvNeXt-Tiny 28 M 256×256 方图 xlm-roberta-base 85 M + 词向量 768 D 2.48 ms 53.2% 极低算力环境 / 边缘设备备选
开源协议与商用授权
模型合规商用许可、衍生权重归属与私有化微调迭代分析

DINOv3 视觉系列 可商用

Meta DINOv3 License (2025.08)

• 许可范围:全球、免版税、非排他性许可,允许用于商业与生产环境。
• 权重归属:协议第 5.a 条明确规定:微调产出的衍生模型与权重归开发者独家所有
• 约束条件:分发时附带原 License 说明;禁止军工武器等受限领域。

自主可控。代码与权重完全开放,支持使用业务实拍进行 LoRA 或全参微调。

WeCLIPv2 多模态系列 内部开源

微信模式识别团队 (MMVision)

• 许可范围:腾讯内部全资知识产权,代码库完全开放,无外部合规风险。
• 架构优势:NaViT 任意长宽比技术,基于 45 亿+ 中文高质量图文对预训练。
• 部署协同:直接复用内部成熟工具链,支持 ONNX 与推理加速。

生态闭环。内部源码与数据清洗 Recipe 完备,可无缝对接业务中文知识库进行增量预训练。

C-RADIOv4 系列 仅限研究

NVIDIA Source Code License for RADIO

• 许可范围:协议第 3.3 条明确限制:仅限非商业研究与评测用途 (Research Only)
• 商用门槛:生产商用需向 NVIDIA 单独申请商业授权。
• 定位说明:512 尺寸推理偏慢,仅作为当前学术效果上界参考基准。

基准对照。仅作为算法效果上限参考,生产上线主线聚焦 DINOv3 与 WeCLIPv2。
高置信度实测案例库 (Good Cases)
DINOv3-Large:公开基准 32 例 · 汽车手册 / 研报切片各 12 例命中抽样
⚠️ 典型 Bad Case 风险点与排查归因 15 例典型难例
点击展开查看风险分析