国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:吕剑清, 王先兵, 陈刚, 张华, 王明刚
单位:1.空天信息安全与可信计算教育部重点实验室(武汉大学), 武汉 430072;2.武汉大学 计算机学院, 武汉 430072;3.遵义铝业股份有限公司, 贵州 遵义 563100
关键词:中文Text-to-SQL任务,工业数据集,元数据,自注意力模型,基于变换器的双向编码器表示技术
基金:国家自然科学基金资助项目(51977155)
英文自然语言查询转SQL语句(Text-to-SQL)任务的模型迁移到中文工业Text-to-SQL任务时,由于工业数据集的可解释差且比较分散,会出现数据库的表名列名等信息与问句中关键信息的表示形式不一致以及问句中的列名隐含在语义中等问题导致模型精确匹配率变低。针对迁移过程中出现的问题,提出了对应的解决方法并构建修改后的模型。首先,在数据使用过程中融入工厂元数据信息以解决表示形式不一致以及列名隐含在语义中的问题;然后,根据中文语言表达方式的特性,使用基于相对位置的自注意力模型直接通过问句以及数据库模式信息识别出where子句的value值;最后,根据工业问句查询内容的特性,使用微调后的基于变换器的双向编码器表示技术(BERT)对问句进行分类以提高模型对SQL语句结构预测的准确率。构建了一个基于铝冶炼行业的工业数据集,并在该数据集上进行实验验证。结果表明所提模型在工业测试集上的精确匹配率为74.2%,对比英文数据集Spider上各阶段主流模型的效果后可以看出,所提模型能有效处理中文工业Text-to-SQL任务。
来源:2022年第10期
《计算机应用》期刊编辑部