计算机应用

北大核心,INSPEC,JST,Pж(AJ),CSCD扩展版

国内刊号:51-1307/TP

国际刊号:1001-9081

计算机应用杂志2025年第3期:大语言模型的偏见挑战:识别、评估与去除

发布日期:

作者:徐月梅, 叶宇齐, 何雪怡

单位:1.北京外国语大学 信息科学技术学院,北京 100089;2.北京外国语大学 国际商学院,北京 100089

关键词:大语言模型,偏见溯源,偏见识别,偏见评估,偏见去除

基金:国家社会科学基金资助项目(24CYY107);教育部人文社会科学项目(22YJA630018);中文信息学会SMP-智谱AI大模型交叉学科基金资助项目;中央高校基本科研业务费专项(2024TD001)

针对大语言模型(LLM)输出内容存在偏见而导致LLM不安全和不可控的问题,从偏见识别、偏见评估和偏见去除3个角度出发深入梳理和分析现有LLM偏见的研究现状、技术与局限。首先,概述LLM的三大关键技术,从中分析LLM不可避免存在内隐偏见(Intrinsic Bias)的根本原因;其次,总结现有LLM存在的语言偏见、人口偏见和评估偏见三类偏见类型,并分析这些偏见的特点和原因;再次,系统性回顾现有LLM偏见的评估基准,并探讨这些通用型评估基准、特定语言评估基准以及特定任务评估基准的优点及局限;最后,从模型去偏和数据去偏2个角度出发深入分析现有LLM去偏技术,并指出它们的改进方向,同时,分析指出LLM偏见研究的3个方向:偏见的多文化属性评估、轻量级的偏见去除技术以及偏见可解释性的增强。

来源:2025年第3期

《计算机应用》期刊编辑部

查看计算机应用杂志2025年第3期

联系我们

  • 地址:四川天府新区兴隆街道科智路1369号
  • 电话:028-85224283-803
  • E-mail:bjb@joca.cn

咨询工作人员