国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:徐月梅, 叶宇齐, 何雪怡
单位:1.北京外国语大学 信息科学技术学院,北京 100089;2.北京外国语大学 国际商学院,北京 100089
关键词:大语言模型,偏见溯源,偏见识别,偏见评估,偏见去除
基金:国家社会科学基金资助项目(24CYY107);教育部人文社会科学项目(22YJA630018);中文信息学会SMP-智谱AI大模型交叉学科基金资助项目;中央高校基本科研业务费专项(2024TD001)
针对大语言模型(LLM)输出内容存在偏见而导致LLM不安全和不可控的问题,从偏见识别、偏见评估和偏见去除3个角度出发深入梳理和分析现有LLM偏见的研究现状、技术与局限。首先,概述LLM的三大关键技术,从中分析LLM不可避免存在内隐偏见(Intrinsic Bias)的根本原因;其次,总结现有LLM存在的语言偏见、人口偏见和评估偏见三类偏见类型,并分析这些偏见的特点和原因;再次,系统性回顾现有LLM偏见的评估基准,并探讨这些通用型评估基准、特定语言评估基准以及特定任务评估基准的优点及局限;最后,从模型去偏和数据去偏2个角度出发深入分析现有LLM去偏技术,并指出它们的改进方向,同时,分析指出LLM偏见研究的3个方向:偏见的多文化属性评估、轻量级的偏见去除技术以及偏见可解释性的增强。
来源:2025年第3期
《计算机应用》期刊编辑部