【Agent技术前沿:多模态搜索智能体可以咋做?OpenSearch-VL开源方案解读】看来看多模态搜索智能体的话题,来看一个具体的任务,想解决的问题是需要整合视觉检查、图像检索与文本证据获取的交替使用如何解决知识密集型的视觉问题,如果要做,那么就得训练。要训练,就得搞数据、设计实验环境。所以,就看一个训练方案进展,讲做一个开源、可复现的多模态深度搜索智能体训练全方案,实现主动搜索、证据验证与多步推理。来看个具体的思路,其中涉及到数据的合成、工具的设计以及训练的trick,值得一读。还是会回到数据合成、工具设计上,值得一看,http://t.cn/AXJm8m7t
发布于 北京
