TATECHATLAS
◎ 简体中文
人工智能

理解语义搜索:工作原理及为何相似文本可能无法回答您的问题

探索语义搜索的原理、它对嵌入的依赖性,以及为何看起来相似的文本可能无法提供所需答案的原因。了解向量搜索、混合搜索及其在信息检索中的应用。

本文内容

语义搜索由向量嵌入提供支持,它基于概念相似性而非精确关键词匹配来查找信息。它通过将文本、图像或其他内容转换为数值向量来工作。当您进行查询时,您的输入也会被转换为向量,系统会检索嵌入空间中向量最接近的内容。这使得匹配概念上相似的术语(例如,“狗”和“犬”)甚至多语言内容成为可能。然而,语义搜索并非万无一失。如果底层嵌入未能捕捉到精确的细微差别,或者最相似的向量未能直接解决查询的意图,它可能无法回答特定问题。结合了向量搜索和传统关键词搜索的混合搜索,通过利用这两种方法的优势,通常能产生更好的结果。

什么是语义搜索?

语义搜索是一种先进的信息检索技术,它超越了简单的关键词匹配。它不寻找文档中的确切单词,而是旨在理解查询背后的含义和上下文。这使得它能够查找概念上相似的信息,即使措辞不同。例如,搜索“犬”可能会返回有关“狗”的文档,因为系统识别它们之间的语义关系。这种能力对于处理同义词、相关概念甚至不同语言至关重要。

语义搜索的核心在于其数值表示内容的能力。这是通过嵌入模型实现的,这些模型将文本、图像或其他数据类型转换为高维向量。这些向量捕获了内容的语义本质。当进行查询时,它也会被转换为一个向量,然后搜索引擎在该多维空间中查找其索引中最接近查询向量的向量。

向量搜索的工作原理

向量搜索是语义搜索背后的技术实现。它涉及索引和查询内容的数值表示,称为嵌入或向量。在索引阶段,内容由嵌入模型处理以生成这些向量。然后将这些向量存储在专门的向量索引中,通常使用分层可导航小世界(HNSW)或穷举 K 最近邻(eKNN)等算法来高效地组织它们,并将相似的向量彼此靠近放置。

当用户提交查询时,它也会使用相同或兼容的嵌入模型转换为向量。然后,搜索系统执行相似性搜索,查找“k”个最近邻(kNN) - - 即索引中在数学上最接近查询向量的向量。此过程能够基于概念相似性、多语言内容,甚至文本和图像等不同模态进行匹配。

```python
# 生成嵌入的示例(概念性的,实际实现取决于模型提供商)
from sentence_transformers import SentenceTransformer

# 加载预训练模型
model = SentenceTransformer('all-MiniLM-L6-v2')

# 要嵌入的文本
text = "A photo of a cat sitting on a mat."

# 生成嵌入
embedding = model.encode(text)

print(f"Embedding shape: {embedding.shape}")
# print(f"Embedding: {embedding}") # 取消注释以查看实际向量
```

**解释:**此 Python 代码片段演示了如何使用预训练的 Sentence Transformer 模型将文本转换为数值向量(嵌入)。`encode` 方法接收文本并返回表示其语义含义的 NumPy 数组。然后,该向量将被存储在向量索引中以供搜索。

嵌入的作用

嵌入是语义搜索的基石。它们是数值表示,通常是密集向量,用于捕获数据片段(如单词、句子或图像)的含义。这些向量由在海量数据上训练的机器学习模型生成。训练过程确保语义上相似的项目在多维嵌入空间中具有彼此靠近的向量,而语义上不相似的项目则具有彼此远离的向量。

例如,“国王”和“王后”这两个词的向量可能很接近,而“国王”和“男人”之间的向量差可能类似于“王后”和“女人”之间的向量差。这种特性使搜索引擎能够理解语言中的关系和细微差别,从而实现比传统基于关键词的方法更相关的搜索结果。

为何相似文本可能无法回答问题

虽然语义搜索在查找概念上相似的内容方面表现出色,但它并非万无一失。相似文本可能无法回答特定问题的一个常见原因是,嵌入虽然捕捉了普遍含义,但可能无法精确地表示查询的细微意图。例如,查询“烘烤蛋糕的最佳方法”可能会检索到关于“蛋糕食谱”或“烘焙技巧”的文档,这些文档在语义上是相关的,但并未直接回答“最佳”方法。

另一个因素是所使用的嵌入模型的质量和范围。如果模型没有在与特定领域相关的数据上进行训练,或者它存在固有的偏见,那么它的嵌入可能无法准确地反映所需的关联。此外,在索引过程中内容被分块和向量化的方式会影响检索。如果关键信息被分割到不同的块中,或者相关块的嵌入与查询向量没有紧密对齐,则可能会错过答案。

混合搜索:结合优势

为了克服纯粹的语义搜索或基于关键词的搜索的局限性,混合搜索应运而生。这种方法在单个查询请求中结合了向量搜索和传统全文(关键词)搜索的优点。通过在包含嵌入和纯文本的搜索索引上并行执行这两种类型的搜索,混合搜索可以利用向量搜索的概念理解能力和关键词匹配的精确性。

然后,通常使用诸如倒数排名融合(RRF)之类的算法来合并和重新排序来自两种搜索的结果。这种统一的方法显著提高了搜索相关性。例如,如果您要搜索特定的产品代码(最适合关键词搜索)以及通用的产品描述(最适合语义搜索),混合搜索可以提供更全面、更准确的结果集。

```json
{
  "search": "historic hotel walk to restaurants",
  "vectorQueries": [
    {
      "kind": "vector",
      "vector": [ 0.1, 0.5, -0.2, ... ], 
      "k": 50,
      "fields": "DescriptionVector"
    }
  ],
  "queryType": "semantic",
  "semanticConfiguration": "my-semantic-config"
}
```

**解释:**此 JSON 片段说明了混合查询结构。`search` 参数处理全文查询,而 `vectorQueries` 指定向量搜索参数。`queryType` 和 `semanticConfiguration` 指示使用了语义排名。这种组合方法确保同时考虑关键词相关性和语义相似性。

支持的场景

向量搜索和混合搜索支持广泛的场景。相似性搜索是基础,它允许用户查找概念上相似的项目。混合搜索尤其强大,它将向量搜索和关键词搜索合并以提高相关性,这对于涉及特定术语、代码或名称的查询特别有用。

多模态搜索通过使用多模态嵌入(例如 CLIP)实现跨不同内容类型(如文本和图像)的搜索来扩展这一点。多语言搜索也得到支持,它允许用一种语言进行的查询找到另一种语言的相关内容,前提是使用了适当的嵌入模型。过滤向量搜索增加了另一层控制,允许将向量查询与对元数据字段的传统过滤相结合,从而根据特定标准缩小结果范围。

集成和可用性

向量搜索功能已集成到 Azure AI Search 等服务中。这种集成允许直接在搜索服务中索引、存储和查询向量嵌入。Azure AI Search 提供了在索引器管道内部(需要连接到 Azure OpenAI 等服务)或外部(将预向量化内容推送到搜索索引)生成嵌入的选项。

向量搜索在所有 Azure 区域和层级均可普遍获得,且不收取额外费用,尽管嵌入生成本身可能会产生模型提供商的费用。可以通过 Azure 门户、REST API 和 Azure SDK 访问。需要注意的是,较旧的搜索服务(在 2019 年 1 月 1 日之前创建)可能不支持向量工作负载,可能需要创建新服务。

局限性和注意事项

尽管语义搜索功能强大,但仍存在局限性。如前所述,如果嵌入未能捕捉到查询的特定意图或细微差别,相似的文本可能无法始终提供精确的答案。其有效性在很大程度上还取决于所使用的嵌入模型的质量和相关性及其训练数据。选择不当的模型或不足的训练数据可能导致结果不理想。

此外,向量搜索在计算上是密集型的,需要专门的索引和查询技术。虽然混合搜索可以解决一些问题,但至关重要的是要理解,语义搜索不能替代事实准确性或逻辑推理。它在查找相关信息方面表现出色,但不能固有地保证检索到的内容对于特定问题的正确性或适用性。尤其是在检索增强生成(RAG)等应用中,通常需要仔细的提示工程和结果验证。

检查清单

  • 验证所使用的嵌入模型是否适合正在搜索的内容的领域和语言。
  • 确保在嵌入之前对内容进行适当分块,以避免丢失上下文或分割关键信息。
  • 考虑使用混合搜索来结合语义搜索和关键词匹配的优点,以提高准确性。
  • 使用不同的措辞测试查询,以了解语义相似性如何转化为检索结果。
  • 通过检查检索到的结果是否直接满足用户意图,而不仅仅是概念相似性来评估其质量。

向量搜索功能虽然普遍可用,但可能不支持 2019 年 1 月 1 日之前创建的非常旧的 Azure AI Search 服务实例。特定的嵌入模型及其相关成本独立于搜索服务本身。语义搜索的有效性在很大程度上取决于所选嵌入模型的质量和训练数据。

参考来源

  1. Microsoft Learn: vector search ↗
  2. Microsoft Learn: hybrid search ↗
返回顶部 ↑