DOI:10.3969/j.issn.1673-6036.2026.04.014
中图分类号:TP18;|TP391.1;|R-05
徐永祥1, 束建华1,2, 阚峻岭1, 张璐瑶3, 张文力3, 王鹏2,3
| 【作者机构】 | 1安徽中医药大学医药信息工程学院; 2安徽中医药大学新安医学与中医药现代化研究所; 3安徽中医药大学中医学院 |
| 【分 类 号】 | TP18;TP391.1;R-05 |
| 【基 金】 | 国家科技重大专项(项目编号:2024ZD0532401) 安徽省高校自然科学研究重大项目(项目编号:2024AH040143) 安徽省研究生质量工程项目(项目编号:2024lhpysfjd047)。 |
新安医学起源于宋元时期的古徽州新安江畔,兴盛于明清,其学术思想与临床经验对现代中医诊疗体系具有重要指导意义[1]。然而,由于长期依赖口传心授、文献散佚以及派系分流,新安医学的传承呈现出碎片化特征,缺乏系统化的整合与梳理。各类知识之间的内在关联较弱,未能形成清晰的知识网络与逻辑体系,导致学术思想在传承过程中易出现误解。近年来,中医药领域人工智能技术应用经历了从专家系统向机器学习、深度学习的转变[2]。其中大语言模型(large language model, LLM)具有文本理解与生成能力,能够深入挖掘中医理论与实践智慧,已在古籍整理、处方推荐等领域展现应用潜力[3-4]。知识图谱(knowledge graph, KG)通过构建结构化知识网络,可实现中医药领域海量信息的系统化整合。二者的有机融合,为中医药传承创新开辟了广阔空间[5-6]。
本研究基于新安医家数据集[7],构建知识图谱,并提出基于知识图谱与大语言模型协同的新安医家问答方法KG-LLM-CQA,设计两层提示词模板,以“大语言模型+外挂知识库”的形式,提升大语言模型回答问题的准确性,为新安医家知识传播与中医药数字化提供可落地的技术方案。
大语言模型指基于超大规模语料库训练、参数量超过百亿的深度神经网络模型[8]。自2022年ChatGPT发布以来,国内外涌现出多种大语言模型。医学领域的大语言模型应用有其独特之处,尤其是在基座模型选择和微调技术等方面[9]。目前常用的微调方法主要包括有监督微调和低秩适配微调等。例如,数智本草大模型利用9万余条方剂数据和4万余条中成药数据,通过低秩适配微调方法对华为盘古大模型进行优化,并结合检索增强技术,实现了“从病到方”和“从方到病”的双向推理。然而,数据集质量、隐私与安全,以及评估基准和衡量标准缺失等问题,成为制约医学大语言模型发展的主要障碍[10]。这些局限性的根源之一在于大语言模型主要依赖参数中隐式存储的知识,缺乏对结构化显性知识的有效利用。为应对该挑战,知识图谱技术因其结构化知识组织方式广受关注。
知识图谱是基于图论设计的结构化语义网络,用于表示实体及其之间的关系[11]。通过将用户提出的问题与知识图谱中的实体及关系进行匹配,系统能够更好地理解用户意图,提供更精准的搜索结果[12]。与大语言模型相比,知识图谱具有可解释性强、知识表达清晰、易于更新维护等优势,能够为大语言模型提供可靠的事实依据。
目前知识图谱多面向单一领域,缺乏跨领域能力,且传统数据处理方式难以应对数据持续变化的挑战。如何实现知识图谱的动态更新,并将其与大语言模型的语义理解能力有机结合,成为当前研究的焦点。在此背景下,基于“大语言模型+知识库”的问答系统逐渐成为自然语言处理领域的研究热点。
问答系统是自然语言处理领域的重要研究方向。早期问答系统基于规则设计,仅能处理简单问题,对复杂问题难以给出有效回答。大语言模型的引入使问答系统表现显著提升[13],但是其主要依赖非结构化外部知识和通用领域知识,在特定领域存在一定局限性。尤其是在知识更新速度较快的领域(如医学),基于大语言模型的问答系统往往难以及时更新数据。
知识图谱构建方法主要分为自顶向下和自底向上两种类型。鉴于新安医家的领域知识较为明确,采用自顶向下的构建方式,见图1。
图1 新安医家知识图谱构建流程
3.1.1 实体定义与属性设计 实体是知识图谱的基础组成要素,在新安医家领域是对具有独立语义的客观对象的抽象化表示。以“医家”为核心实体,通过对新安医家数据集的系统性梳理,提炼12项核心属性,全面覆盖医家个人信息、学术流派及学术思想等维度,见表1。各属性数据类型均为String。
表1 医家实体属性及示例
属性名称属性定义示例姓名医家姓名郑承瀚别名医家曾用名或别称郑枢扶医家ID医家编号XA635字医家表字若溪号医家别号枢扶年代医家生殁年代生于乾隆十一年,殁于嘉庆十八年朝代医家所处的历史朝代清籍贯医家籍贯歙县郑村人学术流派医家学术流派新安医派生平简介医家生平经历郑承瀚系新安著名喉科专家郑梅涧长子,幼承庭训临症经验特点医家独特经验专攻喉科,擅针灸,精儿科痘疹,尤对白喉研究精深学术思想医家核心思想与观点最早提出“白缠喉”,即白喉的症状
3.1.2 实体关系定义 实体间的关系是构建知识网络的关键纽带,用于描述医家实体在家族传承和学术谱系等维度的语义关联。基于新安医家的社会网络与学术互动特征,定义12种核心关系类型:老师、弟子、儿子、父亲、后代、侄子、女儿、妻子、亲家、孙子、先祖、兄弟,见表2。
表2 实体关系示例(部分)
关系类型关系含义示例弟子医家2是医家1的弟子<医家1,弟子,医家2>老师医家2是医家1的老师<医家1,老师,医家2>儿子医家2是医家1的儿子<医家1,儿子,医家2>
本研究团队通过人工提取和专家核验,已形成高可信度的新安医家数据集(xlsx格式)[7]。为便于后续读取并提高数据质量,使用Python将其重构为实体关系三元组数据(csv格式)。三元组基本结构为G =(V,E,A),其中,V表示实体节点集合,E表示实体间的关系集合,A表示实体的属性集合[14]。以“医家”字段为核心,构建实体关系三元组,例如<医家,关系,医家>等。
基于数据持久化理论与图数据建模思想,采用Python的Pandas库对三元组数据进行结构化预处理,并结合Neo4j官方驱动库完成图数据库存储操作。利用Neo4j图数据库内置可视化引擎实现知识图谱的结构化展示,直观呈现医家师承等拓扑结构,见图2。其中,节点为医家姓名,边表示医家之间的关系名称,便于快速识别知识图谱中的核心实体与关键关系,为中医流派传承规律挖掘提供视觉化支持。
图2 新安医家知识图谱(局部)
针对大语言模型可能出现的“幻觉”现象以及回答与事实不符的问题,采用“先检索、后生成”的架构方案,结合“大语言模型主导+新安医家知识图谱外挂”的融合模式,依托检索增强生成实现知识动态补充,见图3。核心方法是通过两层提示词模板实现问答服务。Cypher生成提示词模板利用大语言模型解析用户问题,并生成符合知识图谱查询语法的Cypher语句;知识整合提示词模板基于知识图谱检索返回的结果,引导模型整合“事实数据”,并回答用户问题。新安医家知识图谱作为外部事实数据库,为大语言模型提供精准的数据支持,使其无需重新训练即可动态调用领域知识,从机制上避免模型依赖模糊记忆生成错误内容。
图3 基于知识图谱与大语言模型协同的新安医家问答系统整体框架
检索阶段流程,见图4。
图4 检索阶段流程
系统将Cypher生成提示词模板中的 schema 与question 分别替换为知识图谱结构(包含知识图谱的核心要素)和用户提问,由此具备根据不同知识图谱自动更新的能力,从而为 Cypher 语句的有效生成提供稳定的结构参照框架。
在生成阶段,系统将知识整合提示词模板中的 question 和 data 分别替换为用户的具体问题和检索阶段获取的数据,二者共同作为大模型生成回答的依据。此外,设置特殊场景处理机制:如果检索阶段未获取任何结果,返回“问答难辨,请稍后重试”;当检测到用户输入为问候语时,直接生成相应的问候回复。
新安医家数据集(358—1949年)[7]包含姓名、拼音、字、号、别名、籍贯、朝代、年代、学术流派、学术思想、临症经验特点、生平简介(含著作)等文本信息,以及医家间的关联数据。基于该数据集构建新安医家知识图谱,共包含1 028个实体以及111对关系,每个实体包含12种属性,记录每位医家的详细信息。基于新安医家知识图谱,构建包含20条性能评估数据的标准化问答数据集,以“问题-正确答案”的成对形式呈现,涵盖医家基本信息、传承路径等类型。所有问题均由具备新安医学研究背景的中医专家主导设计,正确答案从知识图谱中提取后,经专家复核答案的完整性与准确性,最终形成标准参考答案,用于后续模型性能评估。
5.2.1 实验设计 为测试知识图谱对问答效果提升的影响,设计两个对比实验和一个消融实验。(1)对比实验1。以Yi-Lightning为基座模型,基于仅采用提示词工程策略的LLM-QA和基于协同策略的KG-LLM-CQA分别构建问答系统,并对比各项性能,以最小的实验成本确认改进方向的有效性。(2)对比实验2。基于4种基座模型,采用KG-LLM-CQA分别构建问答系统,并对比各项性能。(3)消融实验。选用对比实验2中表现最佳的基座模型,构建基于LLM-QA和KG-LLM-CQA的问答系统,通过对比验证知识图谱增强机制的必要性。
5.2.2 评价指标 采用3类评价指标评估问答系统性能[15]。(1)ROUGE-L[16]。基于最长公共子序列(longest common subsequence,LCS)的长度计算,核心优势在于通过LCS捕捉文本间的长程匹配关系,用于衡量问答系统生成答案与标准答案之间的文本语义匹配度。(2)精确率(Plcs)。基于LCS与模型生成文本长度的比值计算,聚焦生成答案的信息有效性,用于评估系统输出中与标准答案重合的有用信息占比,避免生成冗余或无关内容。(3)答案正确性(Rlcs)。采用RAG领域专用评估框架Ragas[17]进行计算,用于校验生成答案的事实一致性。其中,X表示标准答案,Y表示模型生成的答案,m表示X的长度,n表示Y的长度,LCS(X,Y)表示X和Y的最长公共子序列,β是超参数,Flcs即ROUGE-L值。
5.3.1 对比实验1 单纯LLM-QA方法难以保证回答正确性,精确率和ROUGE-L值较低,“幻觉”现象突出。KG-LLM-CQA方法综合性能显著优于LLM-QA方法,答案正确性提升42.71个百分点,见表3。
表3 LLM-QA与KG-LLM-CQA性能对比(%)
方法精确率ROUGE-L答案正确性KG-LLM-CQA66.1465.9177.48LLM-QA56.9552.7434.77
5.3.2 对比实验2 基于KG-LLM-CQA方法,4个基座模型中Qwen-Max的综合性能最佳,尤其在答案正确性上优势明显,见表4。表明该模型能更有效地融合知识图谱信息,以提升对问题的理解与回答的准确性。
表4 不同基座模型在KG-LLM-CQA方法中的性能对比(%)
模型精确率ROUGE-L答案正确性Qwen-Max70.2269.9091.73 DeepSeek-V356.5456.1881.22 Yi-Lightning66.1465.9177.48 ERNIE 4.5 Turbo64.4364.2381.25
5.3.3 消融实验 选用Qwen-Max作为基座模型。移除知识图谱后,各项指标均显著下降,见表5。答案正确性指标的显著下降表明,在缺少知识图谱提供的事实支撑后,模型产生事实性错误或“幻觉”的频率显著增加。进一步验证了知识图谱在增强问答系统性能方面的重要性。
表5 系统性能评估(%)
方法精确率ROUGE-L答案正确性KG-LLM-CQA70.2269.9091.73 LLM-QA58.4754.3831.67
本研究针对垂直领域智能问答中的“幻觉”问题,提出基于知识图谱与大语言模型协同的新安医家问答方法。通过“先检索、后生成”架构实现了知识图谱与大语言模型的显式对齐,为领域知识服务提供了可复用的技术路径。本研究仍存在局限有待进一步优化:一是知识覆盖范围有限,仅包含基础医家信息,缺乏古籍、医案等深层数据支撑,后续可扩充新安古籍与医案数据库,丰富实体与关系类型;二是复杂知识推理能力和隐性知识挖掘深度不足,未来可通过优化提示词设计,引入少样本学习或思维链机制,增强模型推理能力。此外,未来还可引入智能体与联网搜索技术,构建可追溯、多源融合的智能问答系统,并进一步挖掘医家师承关系与学术思想传承规律。
作者贡献:徐永祥负责研究设计、论文撰写;束建华、阚峻岭、张璐瑶负责论文修订;张文力负责数据整理与分析;王鹏负责提供指导。
利益声明:所有作者均声明不存在利益冲突。
1陈雪功.新安医学学术思想精华[M].北京:中国中医药出版社,2009.
2唐书宣,徐永祥,周洁,等.基于人工智能的新安医学智能辅助诊疗系统研究[J].南京中医药大学学报,2024(12):1348-1356.
3陈子佳,彭文茜,张德政,等.大语言模型在中医药领域的应用、挑战与前景[J].协和医学杂志,2025,16(1):83-89.
4李欣桐,马素芬,张丰聪,等.中医药领域大语言模型的研究进展与应用前景[J].南京中医药大学学报,2024,40(12):1393-1403.
5曾子玲,张华敏,于彤,等.知识图谱及其关键技术在中医药领域的研究与应用综述[J].世界科学技术-中医药现代化,2022,24(2):780-788.
6孙华君,李海燕,聂莹,等.知识图谱及其在中医药领域应用研究进展[J].世界科学技术-中医药现代化,2020,22(6):1969-1974.
7张文力,王鹏,束建华,等.新安医家数据集(358—1949年)[DS/OL].科学数据银行(2025-07-04)[2026-03-16].https://cstr.cn/31253.11.sciencedb.j00001.00914.
8秦小林,古徐,李弟诚,等.大语言模型综述与展望[J].计算机应用,2025,45(3):685-696.
9籍欣萌,昝红英,崔婷婷,等.中文医疗大模型综述:进展、评估与挑战[J].中文信息学报,2024(11):1-12.
10肖革新,陈善吉,王博远,等.医疗大模型的应用现状与展望[J].中国数字医学,2025,20(2):39-45.
11李建辛,司冠南,田鹏新,等.多模态知识图谱的3D场景识别与表达方法综述[J].计算机工程与应用,2023(20):35-50
12周永章,陈川,张旗,等.地质大数据分析的若干工具与应用[J].大地构造与成矿学,2020(2):173-182.
13文森,钱力,胡懋地,等.基于大语言模型的问答技术研究进展综述[J].数据分析与知识发现,2024,8(6):16-29.
14胡佳慧,李姣,姚宽达,等.大语言模型融合知识图谱的医学问答系统构建研究[J].中国数字医学,2024,19(6):91-95.
15黄奕明,邹喜华,邓果,等.预回答与召回过滤:双阶段RAG问答系统优化方法[J].计算机应用,2026, 46(3):696-707.
16LIN C Y.Rouge: a package for automatic evaluation of summaries[C].Barcelona: Association for Computational Linguistics, 2004.
17ES S, JAMES J, ANKE L E, et al.Ragas: automated evaluation of retrieval augmented generation[C].St.Julians: The 18th Conference of the European Chapter of the Association for Computational Linguistics: System Demonstrations, 2024.
Study on Xin’an Physician Question-answering System Based on Collaboration of Knowledge Graph and Large Language Model
X