最近,腾讯混元联合 UCLA、香港中文大学、香港大学等机构发布了 OpenSearch-VL。

从论文标题来看,OpenSearch-VL 的定位很明确:它不是单一模型,也不只是一个搜索工具,而是一套面向前沿多模态搜索 Agent 的开源训练方案。论文中将其称为 fully open-source recipe,目标是让研究者可以更透明地复现、分析和改进多模态深度搜索智能体。

简单来说,OpenSearch-VL 想解决的是一个很现实的问题:现在很多强大的多模态搜索 Agent 能力很强,但训练数据、工具轨迹、训练流程往往不够开放,外部研究者很难知道它们到底是怎么练出来的。OpenSearch-VL 试图把这套流程拆开讲清楚,并计划开放数据、代码和模型,让更多人能参与到多模态智能体研究中。

什么是多模态深度搜索 Agent?

普通 AI 问答,更多是“你问一句,它答一句”。

而多模态深度搜索 Agent 要做的事情更复杂。它不仅要理解图片、文字和问题,还要主动搜索外部信息,验证证据,再通过多轮推理得到答案。

比如用户给它一张图片,然后问:

“图中这座建筑所在城市的创始时间是什么?”
“这张照片里的人曾参与过哪项重大事件?”
“这张旧海报对应的电影导演还有哪些代表作?”

这类问题不是单靠看图就能回答的。模型需要先识别图像线索,再搜索相关资料,然后把不同来源的信息串起来,最后给出可靠答案。

OpenSearch-VL 面向的,正是这类“看得懂、搜得到、能验证、会推理”的复杂任务。

OpenSearch-VL 的核心亮点:不只是开源模型,而是开源方法

这次 OpenSearch-VL 值得关注的地方,不只是“开源”两个字,而是它把多模态搜索 Agent 训练中几个关键环节都系统整理了出来。

它主要包括三部分:

1. 数据生产线:减少“搜索捷径”

训练搜索 Agent 的第一步,是构建高质量数据。

论文提到,OpenSearch-VL 从 Wikipedia 链接图出发,通过路径采样、模糊实体改写和视觉锚点绑定,构建需要多跳推理的图文问答任务。这样做的目的,是避免模型通过一次简单搜索就直接找到答案,也就是减少所谓的 one-step retrieval collapse。

这点非常关键。

如果训练数据太简单,模型很容易学会“偷懒”:看到图片后直接搜图,搜到结果就回答。表面上看它完成了任务,但实际上没有学会复杂推理。

OpenSearch-VL 的数据生产方式,会有意把问题设计得更绕一点,让模型必须经过多步搜索、证据验证和信息整合,才能得到答案。

换句话说,它不是只训练模型“会搜”,而是训练模型“知道该怎么搜、搜到以后怎么判断、判断完以后怎么推理”。

工具箱升级:不仅仅是搜索

很多搜索 Agent 的工具比较单一,主要是文本搜索或图像搜索。

但真实世界里的图片质量经常并不理想。可能是模糊截图、低清缩略图、倾斜文档、局部信息太小,或者图片里有文字需要识别。

OpenSearch-VL 在工具环境上做得更完整。论文中列出的工具包括 TextSearch、ImageSearch、OCR、Crop、Sharpen、SuperResolution 和 PerspectiveCorrect,覆盖文本搜索、图像搜索、文字识别、裁剪、锐化、超分辨率和透视校正等能力。

这也是它被称为“全家桶”方案的原因。

它不只是让 AI 去搜索,而是让 AI 在搜索前可以先处理视觉证据。

比如:

图片太糊,可以先锐化;
局部文字太小,可以先裁剪再放大;
文档拍歪了,可以先做透视校正;
图片里有文字,可以先 OCR;
不知道图中物体是什么,可以做图像搜索;
需要背景知识,再继续文本搜索。

这样的工具组合,让 Agent 更接近真实使用场景。

“故障感知”算法:让模型从失败中学到东西

多模态搜索 Agent 在训练中还有一个麻烦:它会调用工具,而且经常要多轮调用。

只要中间某一步出错,后面的轨迹就可能全部偏掉。比如搜索词写错、工具调用失败、返回结果不相关、超时,或者模型重复调用无效工具。

传统做法可能会直接丢掉这条失败轨迹,或者把整条轨迹都拿来训练。但这两种方式都有问题。

直接丢掉,会浪费前面那些其实有价值的推理步骤;
整条都训练,又会把失败后的噪声也学进去。

OpenSearch-VL 提出了 multi-turn fatal-aware GRPO,也就是一种面向多轮工具使用的故障感知强化学习算法。它会屏蔽失败后无效的 token,同时尽量保留失败前有用的推理内容,让模型能够从部分成功的轨迹中继续学习。

这点很实用。

因为真实 Agent 不可能每一步都完美。一个好 Agent 不只是从成功中学习,也要能从失败中知道哪里出了问题,下一次怎样更稳。

实验表现:平均提升超过 10 分

从论文结果来看,OpenSearch-VL 在多个多模态深度搜索基准上取得了明显提升。

论文摘要中提到,基于这套方案训练后的 OpenSearch-VL,在七个 benchmark 上平均提升超过 10 分,并且在若干任务上达到可与商业闭源模型相当的效果。论文正文还给出例子:相较 Qwen3-VL-30B-A3B agentic baseline,平均分从 47.8 提升到 61.6,在 VDR、MMSearch、FVQA 和 InfoSeek 等任务上都有明显增益。

这个结果说明,OpenSearch-VL 的价值不是单纯提出概念,而是它的数据、工具和训练方法组合起来,确实能提升模型的多模态搜索能力。

当然,论文结果仍然需要更多复现和社区验证。但对于开源研究来说,它提供了一个很完整的起点。

为什么 OpenSearch-VL 对多模态 Agent 研究重要?

现在 AI Agent 很热,但很多 Agent 仍然停留在文本任务上,比如搜索网页、整理资料、写报告。

可真实世界的信息并不只有文字。很多问题来自图片、截图、图表、票据、网页界面、视频帧、文档扫描件和混合材料。

这就要求 Agent 不只是会读文字,还要会处理视觉信息。

OpenSearch-VL 的意义在于,它把多模态理解、主动搜索、工具调用和强化学习放到同一套流程里。模型不再只是被动回答“这张图里有什么”,而是能围绕图像线索主动找证据、查资料、修正视觉输入,再给出答案。

这会推动多模态 Agent 从“看图问答”走向“图文证据推理”。

对开发者和研究者有什么价值?

降低复现门槛

论文明确提出会开放数据、代码和模型,用来支持多模态深度搜索 Agent 的开放研究。对于研究者来说,这意味着不必从零开始搭建数据生产、工具环境和强化学习流程。

提供完整训练思路

OpenSearch-VL 不只是给一个模型权重,而是提供了数据构建、SFT 数据集、RL 数据集、工具环境和训练算法。这对想研究 Agent 训练方法的人来说很有参考价值。

适合做二次开发

如果后续开源内容完整释放,开发者可以基于它改造自己的多模态搜索 Agent,比如面向电商图搜、学术资料检索、票据识别、工业质检、医疗影像辅助分析等场景做定制。

OpenSearch-VL 可能适合哪些应用场景?

图文资料检索

用户上传图片、截图或文档后,Agent 可以结合图像线索和外部搜索,帮助找到更准确的背景信息。

复杂视觉问答

对于需要多步推理的问题,模型可以通过搜索和证据验证逐步接近答案,而不是只依赖模型内部记忆。

文档和票据处理

OCR、裁剪、超分、透视校正等工具,可以帮助处理拍摄质量不佳的文档、票据、表格和截图。

内容审核与事实核查

多模态搜索 Agent 可以围绕图片、文字和网页信息进行交叉验证,辅助判断内容来源和事实准确性。

企业知识检索

企业内部资料往往包含图片、截图、表格和文档扫描件。类似 OpenSearch-VL 的方案可以为多模态知识库检索提供思路。

总结:OpenSearch-VL 让多模态搜索 Agent 更透明、更可复现

腾讯混元等机构发布的 OpenSearch-VL,是一套面向多模态深度搜索 Agent 的开源方案。

它的重点不只是模型本身,而是把数据生产、工具环境和强化学习训练流程系统化地组合起来。通过 Wikipedia 路径采样、模糊实体改写和视觉锚点绑定,它试图减少模型走“搜索捷径”;通过 OCR、裁剪、锐化、超分辨率和透视校正等工具,它让 Agent 能处理更真实的视觉输入;通过故障感知强化学习,它让模型可以从失败轨迹中保留有价值的学习信号。

对于多模态 Agent 研究来说,OpenSearch-VL 的价值在于开放和可复现。它让“会看、会搜、会验证、会推理”的 AI Agent 不再只是闭源系统里的能力展示,而是有机会成为更多开发者和研究者可以参与改进的方向。

相关链接

论文详情入口:
https://arxiv.org/pdf/2605.05185

项目主页:
https://github.com/shawn0728/OpenSearch-VL