首页
看点啥
插画图片
首页 看点啥 扣子知识库召回率测试与多维度评估手册

扣子知识库召回率测试与多维度评估手册

2026-08-03 0

必须用量化方式评估扣子知识库召回效果:构建92条人工标注的测试集,执行单次向量、Agentic RAG、混合检索三轮测试,计算忠实度、相关性、完整性、简洁性四大指标,并基于11条低召回问题根因(术语/版本/语义)触发对应优化动作。

要验证扣子知识库在真实业务场景中能否稳定召回关键信息,必须绕过界面“测试问答”的简单反馈,用可复现、可归因、可对比的量化方式跑通一次完整评估流程。

准备测试数据集与基线答案

从近3个月客服工单中抽样127条高频问题,剔除含模糊指代(如“那个文件”“上次说的政策”)的条目,保留92条语义明确、有唯一标准答案的问题;对每条问题人工标注3个核心关键词和1份权威答案原文(来自合规手册V3.2或最新法务FAQ),保存为CSV格式,字段包括:question_id、query、keywords、ground_truth_text。

这一步不能跳过——若用模型自动生成“标准答案”,后续所有指标都会失真。【ground_truth_text必须来自原始文档原文,禁止改写或摘要

将92条问题按业务模块打标签:产品规则(38条)、资费说明(29条)、风控政策(25条),便于后续分层分析。

执行三轮召回率测试

方法一:单次向量检索(默认配置)

在扣子后台→知识库→测试面板中,粘贴第一条问题→点击“执行检索”→记录返回的Top-5结果中,有多少条包含ground_truth_text中的任意一个完整句子(需字符级匹配,不接受语义等价替换)→重复该操作至第92条,汇总命中条数。

方法二:启用Agentic RAG动态检索

进入知识库设置→高级选项→开启“动态chunk适配”与“多轮意图扩展”→重新运行全部92条问题→仅统计Top-3结果的命中情况(因动态策略会主动压缩冗余片段)→注意观察日志中是否出现“扩展检索至XX文档”的提示。

方法三:混合检索(BM25+向量)

在测试面板下方勾选“启用关键词增强”→保持向量权重0.6、BM25权重0.4不变→运行全量问题→导出结果JSON,用Python脚本比对每条query的Top-5中是否存在ground_truth_text的精确子串。

三次测试必须使用同一份知识库快照(时间戳锁定为2026-07-28T14:00:00Z),否则版本漂移会导致数据不可比。

计算四大核心指标

第一步:忠实度(Faithfulness)

对每条问题的生成答案,逐句检查是否能在召回的Top-5文本块中找到对应依据——找不到依据的句子即计为幻觉句;最终用(总句数−幻觉句数)/总句数得出单题分数,再取92题平均值。

第二步:相关性(Relevancy)

人工盲审20条答案(随机抽取,覆盖三个业务模块),按0-2分打分:0分=完全答非所问,1分=部分回应但偏题,2分=精准切中问题核心;去掉最高最低分后取均值,乘以50换算为百分制。

第三步:完整性(Completeness)

针对每条问题的ground_truth_text,拆解出所有必要知识点(如“科创板上市条件”需包含:预计市值、营收、净利润、研发投入四项硬指标),统计答案覆盖的知识点数量占总知识点数的比例,取92题平均值。

第四步:简洁性(Conciseness)

用正则过滤掉答案中的重复句式、语气词(如“一般来说”“需要特别注意的是”)、无信息量的过渡句,剩余有效信息字数与原答案字数之比即为该题简洁性得分,阈值设为≥0.65才算合格。

定位低召回问题根因

筛选出三轮测试中均未召回ground_truth_text的问题(共11条),逐条执行以下诊断:

① 检查问题中是否含领域术语缩写(如“SOP”“KYC”)→若存在,确认知识库文档中是否统一使用全称(如“Standard Operating Procedure”)→若是,则需在预处理阶段添加术语映射表。

② 提取问题中的时间状语(如“2023年修订版”“最新一期”)→核查知识库中对应文档的元数据version字段是否准确写入→若version为空或格式错误(如写成“v3.2_2023”而非ISO标准“2023-07-01”),则版本过滤器失效。

③ 将问题query与ground_truth_text分别通过扣子Embedding API获取向量→计算余弦相似度→若低于0.42,说明嵌入模型对当前语义空间表征能力不足,需切换至bge-reranker-v2-m3等重排序专用模型。

对11条问题完成上述三项检查后,导出根因分类统计表:术语不匹配(4条)、版本元数据缺失(3条)、向量语义偏离(4条)。

生成评估报告并触发优化动作

将四组指标结果填入预置模板Excel,自动渲染折线图(三轮测试的召回率对比)与雷达图(四大维度得分分布);在“行动建议”栏根据根因统计表生成具体指令:术语问题→调用API更新同义词库;版本问题→执行SQL语句UPDATE kb_docs SET version='2023-07-01' WHERE doc_id IN (xxx,yyy);语义问题→在知识库设置中切换Embedding模型为bge-large-zh,并重新触发向量化任务。

喜欢(0)

上一篇

生化危机9研究主任室谜题的解密技巧大全

下一篇

通义灵码如何写代码?

通义灵码如何写代码?
猜你喜欢