国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:刘宜欣, 刘祥根, 刘文, 邓洪波, 张子野, 穆骅
单位:1.四川大学 计算机学院,成都 610065;2.西南电子设备研究所,成都 610036;3.武汉开目信息技术股份有限公司,武汉 430076
关键词:检索增强生成,大型语言模型,长文档处理,基准数据集,自动问答构建
基金:国家自然科学基金资助项目(62206192);国家重点研发计划项目(2024YFB3312503);四川省自然科学基金资助项目(2024NSFTD0048)
随着预训练语言模型(PLM)的发展,检索增强生成(RAG)作为一个新兴任务受到广泛关注。全面客观地评价RAG可以揭示现有方法的局限并指明研究方向,然而,现有的研究针对RAG的系统性评估基准不足,尤其是在长文档场景中。针对这一问题,提出一种基于焦点片段的自动问答构建策略,旨在高效而准确地构建大规模问答数据集。基于该策略,构建首个专门针对长文档的双语RAG评估基准数据集LoRAG,涵盖法律、金融和文学等多领域的英汉双语文档,英文文档平均长度达5.7万词元,中文文档平均长度为7.6万词元。通过LoRAG数据集,对RAG的检索与生成这两个关键阶段进行系统性实验。在检索阶段,评估text-embedding-ada-002、bge-large系列、bge-m3和Multilingual-E5-large-instruct等多种主流嵌入模型,并引入bge-reranker-v2-m3重排序模型进行性能优化与对比;在生成阶段,全面测试Vicuna-13B、ChatGLM2-6B、Llama2-7B和Claude2等代表性大语言模型(LLM)。实验结果表明,所构建数据集LoRAG有效揭示了当前嵌入方法在长文档检索中的定位难题,以及LLM在生成过程中权衡相关性与精炼性之间的局限性,这些为后续方法的改进提供了清晰的研究方向。
来源:2026年第2期
《计算机应用》期刊编辑部