登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  科技周边 >  人工智能

RAG 评测怎么分别统计召回率和答案正确率

来源:17golang原创

时间:2026-09-08 07:29:09 293浏览 收藏

RAG 评测里最容易混淆的两个数字,就是“检索找到了多少”和“模型答对了多少”。它们不是同一项指标:前者看参考信息有没有进入 retrieved_contexts,后者看 response 是否符合 reference_answer。因此,先固定一份问题集和检索配置,再把 Context Recall 与 Answer Correctness 分开统计,才知道问题出在检索、生成,还是评测数据。

实操上,保留每道题的参考上下文、检索上下文、模型答案和标准答案;先算检索覆盖率,再在同一批结果上算答案正确率。
要点速览
  • Context Recall 衡量参考事实在 top-k 检索结果中的覆盖情况。
  • Answer Correctness 衡量最终回答与 reference_answer 的事实和结论一致性。
  • 低召回低正确、低召回高正确、高召回低正确,分别指向不同的排查路径。

一、先把召回和答案拆成两套样本

评测集不要只保存问题和最终分数。每条记录至少要能还原一次实验,字段可以这样设计:

字段回答的问题统计用途
question用户问了什么按任务分组
reference_contexts哪些片段包含参考事实召回分母
retrieved_contexts检索实际返回什么计算 Context Recall
reference_answer可接受的结论是什么答案对照
response模型实际回答什么计算 Answer Correctness
RAG 评测样本中 reference_contexts、retrieved_contexts、reference_answer 和 response 的静态字段关系图
图1:把参考信息、检索上下文和最终答案放进同一条可复现样本,避免用答案分数反推检索质量。

这里的 reference_contexts 可以是包含关键事实的文档片段或事实集合,不一定要求与切片后的文本逐字相同。关键是提前写清“什么算命中”,例如一条政策题需要命中适用条件、时间和例外条款,而不是只出现一个关键词。

二、固定 top-k 和评测集,先统计检索召回

检索召回可以理解为:参考信息中,有多少比例在实际返回的 top-k 上下文里出现。按问题统计后再求平均,能避免长文档题因为参考片段多而压过短问题。示意数据如下:

{"question":"退款期限是多少?","reference_contexts":["退款期限为7天","超过7天的例外条件"],"retrieved_contexts":["退款期限为7天"],"reference_answer":"通常为7天,特殊情况另行判断"}

对这条样本,若命中1个参考事实、总计2个,样本召回率就是 1/2。整套数据可记录 recall@1recall@3recall@5 等结果,比较切分策略、向量检索和 reranker 时要保持问题集不变。NVIDIA 的评测说明也把 Context Recall 放在不同 top-k 截止点比较;提高 top-k 可能扩大覆盖,但会增加延迟和送入模型的上下文量。

注意不要把“上下文与问题相关”直接当召回。相关性高但漏掉关键条件,召回仍然不足;反过来,塞入很多相关但重复的片段,也不代表答案一定正确。

三、用同一批结果计算答案正确率

检索结果冻结后,再比较 responsereference_answer。封闭式数字、枚举和布尔结论可以用规则或精确匹配;开放式回答则要先拆出事实点,再按“正确、遗漏、错误扩写”制定评审标准。不要把引用存在与否当成答案正确,引用正确但结论算错仍应判错。

from dataclasses import dataclass

@dataclass
class EvalRow:
    # 每行来自固定评测集,便于复现实验和定位失败样本
    reference_facts: set[str]
    retrieved_facts: set[str]
    answer_facts: set[str]

def score_row(row: EvalRow) -> tuple[float, float]:
    # 召回只看参考事实是否进入检索结果
    recall = len(row.reference_facts & row.retrieved_facts) / max(len(row.reference_facts), 1)
    # 答案正确率只看答案事实是否覆盖且没有明显错误;生产环境应替换为明确的评审器
    answer = len(row.reference_facts & row.answer_facts) / max(len(row.reference_facts), 1)
    return recall, answer

上面的函数只是把统计边界写清楚,不是通用语义评审器。真实开放问答要把判定规则、评审模型、温度、提示词版本和失败理由一起落盘,否则今天的“正确率”无法和下一次实验公平比较。

RAG 评测从固定样本分流到 Context Recall 与 Answer Correctness 两条指标支路的静态关系图
图2:同一份评测样本先经过检索覆盖率支路,再经过答案事实一致性支路,两个分数互不替代。

四、用指标组合定位 RAG 瓶颈

把两项指标放在一张表里,比追一个总分更有行动价值:

Context RecallAnswer Correctness优先排查
文档切分、查询改写、召回 top-k、reranker 和评测集覆盖
检查是否题目过于简单,或参考答案没有覆盖长尾事实
检查提示词、事实整合、模型幻觉、遗漏和错误扩写
继续看困难样本、分组差异和回归变化,不代表系统没有盲区

每次实验只改变一个主要变量,例如只改 reranker_top_k 或只改生成提示词,并保存 JSONL、配置哈希和失败样本。这样才能把“召回变了”与“答案变了”分别归因。延迟、吞吐和 groundedness 很有价值,但它们是其他维度,不能混进这两个比例。

相关问题

召回率高,答案为什么还是错?

上下文进来了不等于模型正确使用了它。优先检查事实冲突、答案遗漏、提示词约束和评审规则。

只有一个标准答案能评测开放问答吗?

可以起步,但最好保存关键事实点和可接受变体,否则表达不同却正确的回答容易被误判。

top-k 越大,召回率就一定越好吗?

在同一检索器和评测集下通常更有机会覆盖参考片段,但噪声、延迟和上下文预算也会上升,最终要结合答案正确率判断。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>