登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  科技周边 >  人工智能

向量搜索的余弦距离和内积怎么按模型选择

来源:17golang原创

时间:2026-09-09 11:53:24 260浏览 收藏

向量搜索选余弦距离还是内积,关键不在数据库品牌,而在 embedding 模型怎样定义“相似”。如果模型输出已经是单位向量,余弦相似度与内积会给出相同的排序,此时可优先使用实现更简单、查询更快的内积;如果向量长度本身携带置信度、热度或强度信息,就不要随意归一化,应按照模型训练目标保留内积的幅值影响。

要点速览
  • 归一化向量满足 cosine similarity = inner product,最近邻排序一致。
  • 余弦只看方向,内积同时看方向和长度;长度有业务含义时才保留它。
  • Redis 等向量库常把相似度转成 distance,数值越小越近,不能把阈值方向写反。

先确认模型输出有没有归一化

先看模型说明或实际输出的 L2 范数,而不是凭“这是文本向量”猜测。对向量 uv,余弦相似度是 u·v / (||u|| × ||v||);内积只是 u·v。当两边的范数都等于 1 时,两者数值相等。

工程上可以在写入和查询两条路径都统一处理。下面的示例只用于理解度量边界,不要把查询向量归一化、文档向量却保持原样。

import math

def l2_normalize(values):
    # 让向量长度变成 1,保留方向信息
    norm = math.sqrt(sum(value * value for value in values))
    if norm == 0:
        raise ValueError("零向量不能用于相似度比较")
    return [value / norm for value in values]

def inner_product(left, right):
    # 维度相同才能逐项相乘;长度差异代表幅值影响
    if len(left) != len(right):
        raise ValueError("向量维度不一致")
    return sum(a * b for a, b in zip(left, right))

query = l2_normalize([3.0, 4.0])
item = l2_normalize([6.0, 8.0])
print(inner_product(query, item))  # 归一化后等于 cosine similarity
向量搜索中单位向量的方向、余弦相似度和内积相等关系示意图
图1:两条单位向量长度相同,余弦相似度与内积只剩方向差异,因此排序一致。

余弦看方向,内积还会看长度

余弦相似度会把向量长度消掉,适合“语义方向更重要、文本长短不应改变相关性”的场景。内积则会奖励更长的向量:方向相近时,长度越大,分数可能越高。这个差异不是实现细节,而是模型输出空间的一部分。

因此,优先级应是“模型训练目标 > 数据库默认值”。模型文档明确采用 dot product 或让向量幅值代表置信度时,使用 IP;模型输出未归一化、但任务只关心语义方向时,使用 COSINE 并在同一处完成归一化。不要为了让分数看起来都在 0 到 1 之间而改度量。

判断条件更合适的选择需要留意
模型已输出单位向量Cosine 或 IP排序相同,但距离/相似度命名可能不同
只关心语义方向Cosine写入和查询的归一化策略必须一致
长度承载置信度、强度或权重IP不要事后归一化抹掉幅值
模型训练目标未说明先做离线对照用标注查询比较 Recall@k、MRR 或人工相关性
未归一化向量搜索中方向相近但长度不同导致内积分数变化的静态关系图
图2:方向接近时,未归一化向量的长度会改变内积;是否保留这份信息要由模型和业务决定。

在向量库里别把 similarity 和 distance 混为一谈

不同引擎的字段名相似,返回值方向却可能相反。以 Redis 向量索引为例,COSINE 的距离可理解为 1 - cosine similarityIP 也会按距离形式参与排序;距离越小越接近。业务层若把“相似度至少 0.8”改成数据库过滤条件,必须先确认返回的是相似度还是距离,否则会出现相关结果被过滤、无关结果反而留下的情况。

上线前至少核对四件事:模型文档的度量名称;文档与查询向量是否同维;两条路径的数据类型和归一化是否一致;离线阈值是否针对数据库实际返回值重新标定。HNSW 等近似索引还会引入召回率与延迟取舍,这属于索引参数问题,不能靠更换 cosine/IP 掩盖。

常见问题

归一化后为什么还要选 cosine?

数学上排序等价,但 cosine 的语义更直观;如果向量库对 IP 有更高效的实现,也可以选 IP。重点是固定一种分数解释并统一阈值。

内积分数越大越相似吗?

原始内积通常是越大越相似,但向量库可能把它包装成 distance。以返回字段和官方定义为准,不要只看字段名。

能不能把所有向量都先归一化?

不能盲目这样做。归一化会删除长度信息;只有确认长度不是任务信号,或模型本来就要求单位向量时才这样处理。

简单记忆就是:方向决定语义时看 cosine,幅值也代表信息时看 IP;模型已经归一化时两者排序相同,但数据库的“距离”与“相似度”仍需分开解释。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>