本文提出了 Ragas(Retrieval Augmented Generation Assessment,检索增强生成评估)框架,用于对检索增强生成(RAG)流水线进行免参考(reference-free)评估。RAG 系统由检索模块和基于 LLM 的生成模块组成,它通过从参考文本数据库中为 LLM 提供知识,使其成为用户与文本数据库之间的自然语言层,从而降低幻觉风险。
然而,评估 RAG 架构具有挑战性,因为需要考虑多个维度:
Ragas 提出了一套可用于评估这些不同维度的指标,无需依赖人工标注的黄金标准(ground truth)。作者认为,这一框架能够显著加快 RAG 架构的评估周期,尤其是在 LLM 快速普及的背景下具有重要意义。
文中指出,Ragas 是一个免参考的评估框架,即不依赖于是否拥有黄金标准标注数据。