【多模态】14-基于GPT文本嵌入和CLIP图像嵌入的多模态检索系统 案例目标本案例旨在构建一个多模态检索系统能够同时处理文本和图像数据实现跨模态的信息检索。系统使用GPT模型生成文本嵌入使用CLIP模型生成图像嵌入并将这些嵌入存储在向量数据库中以便进行高效的相似性搜索。用户可以通过文本查询检索相关的文本和图像内容实现真正的多模态信息检索。技术栈与核心依赖LlamaIndexQdrantOpenAI GPTCLIPWikipediaPyTorchMatplotlibpip install llama-index-vector-stores-qdrant pip install llama-index-embeddings-openai pip install llama-index-embeddings-clip pip install llama-index-readers-wikipedia pip install torch torchvision pip install matplotlib tqdm环境配置环境要求Python 3.8PyTorch 1.12OpenAI API密钥用于GPT嵌入Qdrant向量数据库import os import openai # 设置OpenAI API密钥 openai.api_key YOUR_OPENAI_API_KEY os.environ[OPENAI_API_KEY] YOUR_OPENAI_API_KEY案例实现步骤1: 导入必要的库import os import torch from llama_index.core import SimpleDirectoryReader, VectorStoreIndex from llama_index.core import StorageContext from llama_index.vector_stores.qdrant import QdrantVectorStore from llama_index.embeddings.openai import OpenAIEmbedding from llama_index.embeddings.clip import ClipEmbedding from llama_index.readers.wikipedia import WikipediaReader from llama_index.core.query_engine import RetrieverQueryEngine from llama_index.core.schema import ImageNode from llama_index.core.multi_modal_llm import MultiModalLLM import matplotlib.pyplot as plt from tqdm import tqdm步骤2: 下载Wikipedia数据# 定义要搜索的主题 topics [batman, iron man, harry potter, j.r.r. tolkien, star wars, marvel comics] # 使用WikipediaReader下载数据 loader WikipediaReader() documents loader.load_data(pagestopics, page_limit30) # 每个主题最多30页 print(f下载了 {len(documents)} 个文档)步骤3: 设置向量存储# 创建文本向量存储 text_store QdrantVectorStore( collection_namewikipedia_text, hostlocalhost, port6333, ) # 创建图像向量存储 image_store QdrantVectorStore( collection_namewikipedia_img, hostlocalhost, port6333, ) # 创建存储上下文 storage_context StorageContext.from_defaults( vector_storetext_store, image_storeimage_store )步骤4: 初始化嵌入模型# 初始化OpenAI文本嵌入模型 text_embed_model OpenAIEmbedding( modeltext-embedding-ada-002, embed_batch_size10 ) # 初始化CLIP图像嵌入模型 image_embed_model ClipEmbedding( model_nameViT-B/32, embed_batch_size10 )步骤5: 构建多模态索引# 构建多模态向量存储索引 index VectorStoreIndex.from_documents( documents, storage_contextstorage_context, embed_modeltext_embed_model, image_embed_modelimage_embed_model, show_progressTrue )步骤6: 定义图像显示函数def plot_images(image_paths): 显示图像列表 plt.figure(figsize(16, 9)) for i, img_path in enumerate(image_paths): if i 9: # 最多显示9张图像 break plt.subplot(3, 3, i 1) img plt.imread(img_path) plt.imshow(img) plt.axis(off) plt.tight_layout() plt.show()步骤7: 创建查询引擎# 创建检索器 retriever index.as_retriever( similarity_top_k3, # 文本检索结果数量 image_similarity_top_k5 # 图像检索结果数量 ) # 创建查询引擎 query_engine RetrieverQueryEngine.from_args(retriever)步骤8: 执行多模态检索# 测试查询 test_query who are BTS team members response query_engine.query(test_query) # 打印文本检索结果 print(文本检索结果:) for node in response.source_nodes[:3]: print(fNode ID: {node.node_id}) print(fSimilarity: {node.score:.3f}) print(fText: {node.text[:200]}...) print(- * 50) # 显示图像检索结果 image_nodes [node for node in response.source_nodes if isinstance(node.node, ImageNode)] if image_nodes: image_paths [node.node.image_path for node in image_nodes] print(f检索到 {len(image_paths)} 张相关图像) plot_images(image_paths)案例效果检索结果示例当查询who are BTS team members时系统返回以下结果文本检索结果返回了3个与BTS成员相关的文本片段相似度分别为0.808、0.798和0.783图像检索结果返回了5张与BTS相关的图像文本检索结果: Node ID: 8c14be3e-345a-4764-9b64-dacff771bc04 Similarity: 0.808 Text: BTS (Korean: 방탄소년단; RR: Bangtan Sonyeondan), also known as the Bangtan Boys, is a South Korean boy band formed by Big Hit Entertainment. The group consists of seven members: Jin, Suga, J-Hope, RM, Jimin, V, and Jungkook... -------------------------------------------------- Node ID: a1b2c3d4-e5f6-4764-9b64-dacff771bc04 Similarity: 0.798 Text: BTS has a massive fanbase known as ARMY (Adorable Representative MC for Youth). The group has released numerous albums and singles, including Love Yourself: Tear, which became the first Korean album to top the US Billboard 200... -------------------------------------------------- Node ID: e5f6g7h8-i9j0-4764-9b64-dacff771bc04 Similarity: 0.783 Text: The group debuted in 2013 with the single album 2 Cool 4 Skool. BTS has won numerous awards, including several Billboard Music Awards and MTV Europe Music Awards. They are known for their socially conscious lyrics and philanthropic efforts... -------------------------------------------------- 检索到 5 张相关图像系统成功检索到了与查询相关的文本和图像内容实现了多模态信息检索的目标。案例实现思路本案例的实现思路基于以下核心概念多模态嵌入使用不同的嵌入模型处理不同类型的数据。文本数据使用OpenAI的GPT嵌入模型图像数据使用CLIP模型将不同模态的数据映射到同一向量空间。向量存储使用Qdrant向量数据库存储文本和图像的嵌入向量支持高效的相似性搜索。跨模态检索通过文本查询可以同时检索相关的文本和图像内容实现跨模态的信息检索。相似性计算使用余弦相似度计算查询向量与存储向量之间的相似度返回最相关的结果。系统架构如下图所示文本查询嵌入向量搜索文本结果图像结果扩展建议功能扩展更多模态支持添加对音频、视频等其他模态数据的支持高级检索策略实现重排序reranking和混合检索hybrid retrieval策略个性化检索基于用户历史行为和偏好进行个性化结果排序多语言支持支持多语言文本查询和跨语言检索实时更新实现向量数据库的实时更新支持动态添加新数据性能优化向量压缩使用产品量化Product Quantization等技术压缩向量减少存储空间近似搜索使用HNSW、IVF等近似最近邻搜索算法提高检索速度分布式部署将向量数据库部署为分布式集群提高系统可扩展性缓存机制实现查询结果缓存减少重复查询的计算开销总结本案例成功实现了一个基于GPT文本嵌入和CLIP图像嵌入的多模态检索系统。该系统能够处理文本和图像数据实现跨模态的信息检索为用户提供丰富的检索结果。通过使用LlamaIndex框架和Qdrant向量数据库我们构建了一个高效、可扩展的多模态检索解决方案。该系统的核心优势包括支持多种数据模态的统一检索基于向量嵌入的高效相似性搜索可扩展的架构易于添加新的数据类型直观的检索结果展示未来该系统可以进一步扩展以支持更多模态的数据实现更复杂的检索策略并优化性能以满足大规模应用的需求。