首页 >  科技周边 >  人工智能

向量检索召回低时如何区分嵌入模型和切片问题

来源:17golang原创

时间:2026-09-12 10:34:06 446浏览 收藏

向量检索召回低,先不要急着换嵌入模型。最稳妥的排查方法是固定一组小样本,把“切片是否保留了答案”“嵌入是否表达了问题”“阈值是否过滤过严”分别测出来。只要每条测试问题都有正确片段编号,就能用 Recall@k 和正确片段排名定位故障:换切片后指标明显变化,多半是分块问题;固定切片后换模型才变化,才值得继续评估嵌入模型。

要点速览
  • 先固定评测问题、正确片段和向量库查询方式,每次只改一个变量。
  • 切片实验看答案是否完整、标题和父级上下文是否保留;模型实验看同义表达和领域词能否拉近。
  • top_k 与相似度阈值放到最后调,记录变更前后的命中率,便于回滚。

先把“召回低”变成可比较的指标

准备一份很小但覆盖真实问题的评测集,例如 20 条查询。每条查询记录一个或多个正确的 gold_chunk_ids,并注明答案需要标题、正文还是表格字段。不要拿生成答案的好坏代替检索指标,先只看检索结果里有没有正确片段。

指标含义适合判断
Recall@5前 5 个候选是否包含任一正确片段整体能否召回答案
MRR第一个正确片段排名的倒数正确内容是否靠前
命中片段长度命中时上下文是否完整切片是否截断语义
def recall_at_k(results, gold_ids, k=5):
    # results 已按向量库返回顺序排列,gold_ids 是人工标注的正确片段集合
    top_ids = {item["chunk_id"] for item in results[:k]}
    return int(bool(top_ids & set(gold_ids)))

def reciprocal_rank(results, gold_ids):
    # 记录第一个正确片段的位置;没有命中时返回 0,避免把未召回误算成低分命中
    for index, item in enumerate(results, start=1):
        if item["chunk_id"] in set(gold_ids):
            return 1 / index
    return 0.0

固定嵌入模型,先做切片对照实验

同一个嵌入模型、同一批查询、同一套向量距离,只替换切片策略。至少保留三份索引:按自然段切片、带重叠的固定长度切片、保留标题路径的结构化切片。每份索引都记录原文位置,不能只保存向量,否则命中了也无法判断内容是否被截断。

向量检索切片边界中标题、正文和答案片段的结构关系
图1:切片实验应关注标题路径、正文上下文与答案片段是否落在同一语义边界内。

如果自然段切片 Recall@5 很低,而保留标题路径或适度重叠后明显上升,问题不在模型。常见原因是“问题在标题、答案在下一段”、表格被拆成孤立单元格,或者固定长度把条件和结论分开。反过来,如果三种切片的命中率都接近,继续改切片的收益通常有限。

固定切片结果,再比较嵌入模型

确定一套表现稳定的切片后,重新为同一批片段生成候选模型的向量。比较时不要只看向量维度或平均相似度,要看同义问法、缩写、领域术语和相邻概念的区分能力。一个模型把所有候选分数都压得很高,并不代表检索更好,关键仍是正确片段能否进入前 k。

嵌入模型比较中查询向量、候选片段和相似度评分的静态关系
图2:模型对照要保持切片不变,观察查询向量与正确、相邻候选之间的相似度关系。

若只有更换模型后 Recall@5 和 MRR 同时改善,且改善集中在同义表达或行业术语问题,可以把模型升级列入方案。若模型换了但命中仍低,优先检查文本清洗、语言混杂、元数据过滤和查询改写;嵌入模型无法补回已经被过滤掉的片段。

最后再调 top_k 和相似度阈值

阈值过高会把“排名靠后但正确”的片段直接丢掉,top_k 过小则会让答案依赖一个偶然的近邻。建议先不设阈值,记录 k=3、5、10 的召回曲线,再根据误召回数量决定是否加阈值。若 Recall@10 很高而 Recall@3 很低,说明排序或混合检索需要优化,不是单纯把阈值调低。

生产改动可以按“索引版本、嵌入模型、切片参数、top_k、阈值”完整记录。保留上一版索引一段时间,小流量比较同一评测集和真实查询,确认没有把原本命中的问题变成漏召回。

常见问题

只增加 top_k 能解决召回低吗?

只能解决正确片段排名靠后且尚未被过滤的情况。如果答案已经被切断、元数据过滤掉或没有进入索引,增加 top_k 没有帮助。

如何判断是切片太短还是太长?

看命中片段是否缺少条件、标题或结论。缺上下文通常偏短;片段很长但正确答案被大量无关内容淹没,且相邻问题混在一起,通常偏长。

平均相似度更高的模型一定更好吗?

不一定。检索要看正确片段的 Recall@k、MRR 和误召回,而不是所有候选的平均分。评分尺度变化时,阈值也必须重新标定。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>