国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:冯涛, 刘晨
单位:1.北方工业大学 信息学院,北京 100144;2.大规模流数据集成与分析技术北京市重点实验室(北方工业大学),北京 100144
关键词:大语言模型,垂直领域优化,偏好对齐,提示优化
基金:国家自然科学基金资助项目(62061136006);广州市科技计划-重点研发计划项目(202206030009)
用户提示通常缺乏特定领域的专业性和术语的使用,这导致大型语言模型(LLM)难以准确理解意图并生成符合领域要求的信息。因此,提出一种自动化偏好对齐的双阶段提示调优方法(APADPT),解决LLM在垂直领域应用时面临的偏好对齐问题。APADPT通过构建包含人类偏好的监督微调数据集,并利用LLM进行成对回复的语义分析和评估,实现对输入提示的精细化调整。经过双阶段训练,模型不仅能掌握通用领域的提示优化规律,还可以针对垂直领域特性进行专业化调整。在医疗领域的实验结果表明,APADPT显著提升了基于API的LLM与开源LLM的偏好对齐一致性,在相同模型参数量条件下,平均胜率提高了9.5%~20.5%。此外,所提方法在不同参数规模的开源模型上均展现出了良好的鲁棒性和泛化能力,为LLM在垂直专业化领域中的应用提供了新的优化策略,并有助于在保持模型的泛化性和适应性的前提下提高模型的性能。
来源:2025年第8期
《计算机应用》期刊编辑部