近日,我校计算机科学与技术学院24级电子信息专业硕士生叶阳春的论文“Rethinking Graph‑LLMs: Are Performance Gains Confounded by Data Leakage?”(《重新思考图大模型:性能提升是否被数据泄露所混淆?》)被国际顶级学术会议CIKM 2026录用,将在CIKM 2026上进行报告展示。
CIKM(ACM International Conference on Information and Knowledge Management,国际信息与知识管理会议)是ACM旗下信息检索、知识管理与数据库领域的顶级国际会议,由ACM SIGIR与SIGWEB联合主办。会议始于1992年,三十余年来一直是信息检索、知识管理、数据挖掘和数据库系统研究的顶级国际论坛,汇聚全球学术界与工业界研究者,探讨信息访问、知识表示、数据挖掘、推荐系统及人工智能对智能信息系统的影响。
近年来,大语言模型(LLMs)显著提升了文本属性图(TAG)学习性能,但其增益可能部分来自大模型预训练过程中记忆的、与目标相关的参数化先验,而非真实的图推理能力。在TAG中,这类记忆触发信号还可能通过邻域聚合沿图结构传播,进一步放大偏差。
叶阳春同学的研究提出一种基于结构因果模型(SCMs)的Graph-LLM数据泄露分析框架,通过提示干预和实体匿名化分析模型记忆对下游图预测的影响,并构建保持图结构不变的全局一致实体匿名化基准。在多种数据集、嵌入模型和图骨干上的实验表明:目标相关元信息可能成为预测捷径,图消息传递会传播并放大记忆诱导偏差,而实体匿名化会显著降低Graph-LLM性能。实验结果说明,若没有对模型中记忆的参数化先验进行适当控制,当前Graph-LLM基准上的实验结果可能会高估模型真实的泛化能力。
据本次会议官方统计数据,CIKM 2026本届共收到2216篇投稿,最终录用597篇论文,整体录用率为27%,在投稿量规模较大的背景下,论文竞争十分激烈,该篇工作能够成功录用,体现出领域同行对研究议题的认可。
责编:符方德
初审:漆祖希
复审:许浩丰
| 相关附件: |