登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  科技周边 >  人工智能

RAG引用来源回传与答案段落对齐的实现方法

来源:17golang原创

时间:2026-09-23 16:14:00 354浏览 收藏

RAG 引用对不上的根因,通常不是“少返回了一个链接”,而是检索片段、模型答案和展示来源没有共享同一个稳定标识。可靠的做法是:检索阶段生成 source_id,生成阶段只允许引用这些编号,服务层再把答案段落中的编号映射为真实来源对象。

把引用当成答案数据的一部分,而不是回答完成后再拼接的装饰字段。每个段落返回自己的引用集合;没有可验证片段时明确返回“无充分证据”。

适用场景:知识库问答、内部文档助手、客服检索问答以及需要逐段展示来源的 RAG 接口。

先把检索片段变成可回溯的证据对象

Hugging Face 的 RAG 文档把检索文档、上下文输入和文档分数作为生成链路中的独立数据。应用层不要只把纯文本拼到 prompt 里,而要保留一份不会因排序变化而改变的证据对象。

from dataclasses import asdict, dataclass
from hashlib import sha256

@dataclass
class Evidence:
    source_id: str
    title: str
    url: str
    text: str
    chunk_index: int
    score: float

def make_evidence(doc: dict, rank: int) -> Evidence:
    # 用来源 URL、分块编号和正文摘要生成稳定键,避免只依赖当前排序。
    raw = f"{doc['url']}|{doc.get('chunk_index', rank)}|{doc['text'][:80]}"
    source_id = "src_" + sha256(raw.encode("utf-8")).hexdigest()[:12]
    return Evidence(
        source_id=source_id,
        title=doc.get("title", "未命名来源"),
        url=doc["url"],
        text=doc["text"],
        chunk_index=doc.get("chunk_index", rank),
        score=float(doc.get("score", 0)),
    )

这里的关键不是哈希算法本身,而是返回对象要同时保留标题、地址、原文片段、分块位置和检索分数。排序改变时,source_id 仍能指向同一个片段;同一来源的不同分块也不会互相覆盖。

RAG检索片段、来源元数据与稳定source_id的关系说明图
图1:RAG 证据对象关系说明图,展示检索文本如何与来源元数据绑定;这是原创静态说明图,不是截图或运行证据。

让答案段落显式携带 citation_id

不要让模型自由生成 URL。可以把允许引用的 source_id 列表放入上下文,并约定输出段落和引用集合。即使实际使用 JSON Schema 或函数调用,原则也一样:引用编号必须来自检索结果,不能由模型临时创造。

def align_answer(answer: dict, evidence: list[Evidence]) -> dict:
    # 只接受本次检索实际提供的编号,防止模型返回不存在的来源。
    allowed = {item.source_id: item for item in evidence}
    paragraphs = []
    for item in answer.get("paragraphs", []):
        ids = [sid for sid in item.get("citation_ids", []) if sid in allowed]
        # 没有合法证据的段落不补猜链接,交给前端显示证据不足。
        if not ids:
            paragraphs.append({"text": item["text"], "citation_ids": [], "evidence_status": "insufficient"})
            continue
        paragraphs.append({"text": item["text"], "citation_ids": ids, "evidence_status": "linked"})
    return {"paragraphs": paragraphs, "sources": [asdict(allowed[sid]) for sid in sorted({sid for p in paragraphs for sid in p["citation_ids"]})]}

前端拿到 paragraphs 后可以在每段末尾显示来源标题或展开片段,拿到 sources 后还能提供统一的来源面板。需要注意:编号合法只代表“确实检索过”,不代表片段一定支持整句话,所以还应在检索阶段设置最低相关性,并避免让一句话跨越多个无法互相印证的事实。

答案段落与citation_id映射到来源集合的回传结构说明图
图2:答案段落与引用集合的回传结构说明图,展示合法引用、证据不足和前端展开来源的边界;这是原创静态说明图,不是截图或运行证据。

无证据和多来源冲突要单独处理

如果所有片段分数都低于阈值,返回“证据不足”比生成一个看似完整的答案更安全。多个来源冲突时,不要把它们合并成一句确定结论:可以把段落拆成“来源 A 认为……”“来源 B 记录……”并分别挂载引用,或者进入人工复核队列。

日志也建议保存查询、检索结果的 source_id、最终段落的 citation_ids 和过滤原因。这样排查“引用错位”时,能区分召回错误、模型乱引和展示层丢字段三类问题。

常见问题

只返回 URL 能不能实现引用? 可以展示,但无法稳定定位到具体段落。至少还应保留标题、分块编号和被引用文本。

模型返回了不存在的 citation_id 怎么办? 服务层过滤并标记证据不足,不能根据编号反查或拼接一个新链接。

引用越多越可靠吗? 不一定。引用应覆盖当前句子的事实范围;无关来源越多,读者越难判断哪一段真正支持答案。

总结起来,RAG 引用对齐需要三层契约:检索层产出稳定证据对象,生成层只选择允许的 citation_id,回传层按段落返回引用集合与证据状态。先把这条数据链路固定下来,再讨论模型提示词和排序策略,问题会更容易定位。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>