Structured Multi-Step Reasoning for Entity Matching Using Large Language Model

Structured Multi-Step Reasoning for Entity Matching Using Large Language Model 文章核心总结与翻译一、主要内容该研究聚焦于实体匹配(Entity Matching, EM)任务,针对现有大语言模型(LLM)基于单步提示的方法缺乏结构化推理、可解释性不足的问题,提出了基于结构化多步推理的LLM实体匹配框架,主要内容如下:研究背景:实体匹配是数据清洗与集成的基础任务,现有方法包括传统规则/机器学习、深度学习(如BERT等预训练语言模型微调)和LLM提示工程,但LLM相关方法多依赖单步提示,未充分利用其推理能力。核心框架:三步推理框架:将匹配过程分解为三个显式阶段,分别是识别记录间匹配/不匹配令牌、确定对匹配决策最具影响的属性、最终预测记录是否指向同一实体,提供单提示(所有步骤封装于一个提示)和多提示(各步骤通过连续提示链式执行)两种实现方式。辩论式推理策略:引导LLM生成支持和反对匹配的双方论据,再综合双方观点做出最终决策,以提升决策稳健性。实验验证:在6个真实世界基准数据集(涵盖产品、引文、电子产品等领域)上进行零样本和两样本学习实验,以F1分数为主要效果指标,以令牌数量衡量LLM成本。结果显示,三步推理框架在4个数据集上优于基线方法,多提示方式整体性能略优于单提示,但令牌消耗显著更高;辩论式策略性能较差,未具可行性;少样本场景下推理策略的优势较零样本场景有所减弱。二、创新点首次将结构化多步