以下表格梳理了当前 RAG 系统中主流的嵌入模型、重排模型与向量数据库,均经过社区验证与企业实践检验,供选型时参考。
B.1 常用嵌入模型
| 模型名称 | 开发者 | 维度 | 最大输入长度 | 是否开源 | 主要特点 | 适用场景 |
|----------|--------|------|--------------|----------|----------|----------|
| text-embedding-3-small | OpenAI | 512/1536 可调 | 8191 tokens | 否(API 调用) | 性价比高,维度可灵活缩减,支持大规模批量任务 | 通用英文/多语言场景,成本敏感型项目 |
| text-embedding-3-large | OpenAI | 3072 | 8191 tokens | 否(API 调用) | 精度更高,适合复杂语义匹配 | 对精度要求高的检索、分类 |
| BGE-M3 | BAAI(智源) | 1024 | 8192 tokens | 是 | 多语言、支持稠密+稀疏混合检索,训练方式新颖 | 中文及跨语种场景,需本地部署 |
| BGE-large-zh-v1.5 | BAAI | 1024 | 512 tokens | 是 | 中文向量质量优秀,轻量高效 | 中文短文本搜索、FAQ 匹配 |
| jina-embeddings-v3 | Jina AI | 1024(可自选) | 8192 tokens | 是 | 多语言、支持任务特定 LoRA 适配,输入长度大 | 中长文本、需要任务适配的场景 |
| multilingual-e5-large | Microsoft | 1024 | 512 tokens | 是 | 多语言,指令式微调,效果均衡 | 通用多语言检索 |
选择建议:若调用方便且预算允许,OpenAI 嵌入模型是稳定首选;若需要离线部署或强中文表现,BGE-M3 或 BGE-large-zh 更合适;长文档处理可考虑 jina-embeddings-v3。
B.2 常用重排模型
| 模型名称 | 开发者 | 是否开源 | 最大上下文 | 主要特点 | 适用场景 |
|----------|--------|----------|------------|----------|----------|
| Cohere Rerank 3 | Cohere | 否(API) | 4K tokens | 多语言,推理速度快,准确性高,使用简单 | 对延迟敏感的商业应用 |
| Cohere Rerank 3.5 | Cohere | 否(API) | 8K tokens | 更强调长上下文和复杂推理,支持多轮相关性判断 | 复杂多步推理、长文档精排 |
| BGE-Reranker-v2-m3 | BAAI | 是 | 8192 tokens | 与 BGE-M3 配合效果好,多语言,支持交叉注意力推理 | 需本地部署、多语言、强耦合 BGE 生态 |
| bge-reranker-large | BAAI | 是 | 512 tokens | 轻量,中文表现稳定 | 中文短文本重排 |
| mxbai-rerank-large | mixedbread.ai | 是 | 4K tokens | 英文效果好,轻量,可部署方便 | 英文场景本地部署 |
选择建议:生产环境追求稳定低延迟可用 Cohere Rerank;若必须本地部署或已有 BGE 嵌入,则用 BGE-Reranker-v2-m3;中文短文本可用 bge-reranker-large。
B.3 常用向量数据库
| 数据库 | 类型 | 开源 | 部署方式 | 突出特性 | 适合场景 |
|--------|------|------|----------|----------|----------|
| Milvus | 专用向量库 | 是 | 自托管/云托管(Zilliz Cloud) | 十亿级向量秒级检索,丰富索引类型(IVF、HNSW、DiskANN),支持标量过滤 | 大规模生产环境,高并发、高召回 |
| Qdrant | 专用向量库 | 是 | 自托管/云托管 | Rust 编写,高性能,过滤能力强,提供便捷的 RESTful API | 中等规模,需高效过滤的场景 |
| Pinecone | 专用向量库 | 否(SaaS) | 仅云托管 | 全托管免运维,自动扩缩容,简单易上手 | 不想自建运维的团队,快速原型到生产 |
| Weaviate | 向量库+全文本 | 是 | 自托管/云托管 | 原生支持混合搜索(向量+关键词),自带多种嵌入集成 | 需要结合标量/关键词过滤的应用 |
| Chroma | 嵌入式向量库 | 是 | 嵌入到 Python 应用 | 极轻量,零配置,适合开发和测试 | 原型验证、小规模实验 |
| Elasticsearch | 搜索引擎+向量 | 部分开源 | 自托管/云托管 | 成熟的全文本引擎,通过 dense_vector 支持向量搜索,生态完善 | 需要强文本搜索+向量检索一体的企业 |
选择建议:企业级大规模生产首选 Milvus;追求易用性和全托管用 Pinecone;需要混合全文搜索用 Elasticsearch 或 Weaviate;原型开发用 Chroma。
综合搭配示例:
中等规模的中文知识库系统,常见组合为 BGE-M3 嵌入 + BGE-Reranker-v2-m3 重排 + Milvus/Qdrant,全部可本地部署,数据不出域,效果稳定。若偏好全云服务,可用 text-embedding-3-small + Cohere Rerank + Pinecone,数小时即可搭建完成。