近期,山西大学智能信息处理研究所中文信息处理团队在大语言模型知识推理研究方面取得重要进展,相关成果“Prompting Large Language Models with Partial Knowledge for Answering Questions with Unseen Entities”发表在数据挖掘与信息检索领域顶级期刊 ACM Transactions on Information Systems(简称TOIS,影响因子11.2,CCF-A类)。该论文的第一作者为2023级博士生闫智超,通讯作者为李茹教授,合作者为梁吉业教授、谭红叶教授、王艳艳讲师,南京理工大学王家普副教授,英国爱丁堡大学Jeff Z. Pan教授,新加坡科技设计大学李晓黎教授,英国曼彻斯特大学陈矫彦副教授。

大语言模型(LLM)已广泛应用于知识问答、信息检索与智能推理,但“学会知识”并不等于“会用知识”,模型常常已经掌握相关事实,却难以在回答问题时将其及时激活并用于推理。受人脑记忆扩散激活理论启发,即部分相关线索可沿语义关联传播并唤醒潜在记忆,研究团队提出大语言模型的“知识唤醒”机制:利用部分相关的知识(从语义或者结构上与标准推理路径相关,但不足以推出答案)作为激活线索,引导模型调用潜在参数知识,实现从“外部补充知识”向“内部唤醒知识”的转变。
与传统检索增强生成主要关注“如何更好地检索到答案”不同,该研究重点探索什么样的部分相关知识能够唤醒模型,以及不同知识结构为什么具有不同的唤醒能力。研究围绕知识图谱中的标准推理路径,系统构造了多种部分相关知识,并通过知识探测筛选出模型参数中已经编码但未被直接调用的知识,再将这些知识重新输入模型,证明了“知识唤醒”现象的存在性。
进一步的内部机制分析表明,部分相关知识并非简单地为模型补充外部事实,而是能够改变模型内部参数知识的激活状态。研究团队通过知识归因定位答案相关神经元,并对知识注入前后的跨层激活进行可视化分析(见图3)。结果发现,直接问答时,正确答案相关知识虽已编码于模型参数中,但关键神经元在深层网络中受到抑制;注入部分相关知识后,相关神经元由抑制转向显著激活,并形成从中间层向输出层传播的激活过程。这一结果从模型内部表征层面揭示了“相关线索—神经元激活—知识调用”的作用链路,为大语言模型知识唤醒机制提供了可解释的实验证据。该研究工作得到国家自然科学基金重点、面上项目等支持。(通讯员:张颖)
编辑:耿玥