摘要:源代码相似性是指不同代码段功能上的相似程度,是软件工程领域一项重要的研究问题.现有的方法主要从文本、结构两方面,利用代码的统计学特征计算相似性,其最大缺点就是无法表达代码的语义特征.为解决此类问题,提出了一种融合统计信息的卷积神经网络(statistics information for code embedding-convolutional neural networks,SICE-CNN)源代码相似性检测方法.该方法首先通过词嵌入对源代码进行信息表示,获取代码的词嵌入向量信息;其次,构建CNN训练模型学习源代码文档的嵌入表示;最后,计算源代码对的余弦相似值.实验表明,该方法和一般词嵌入方法相比提高了一定的性能,能较好地检测源代码的语义相似性.
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社
热门期刊服务
教育研究与评论·课堂观察 首都医科大学学报·社科版 教育研究与评论·小学教育教学 雷达与对抗 冶金设备管理与维修 大学物理实验 高校辅导员学刊 产业质量研究 安徽农学通报·下半月刊 集美大学学报·自然科学版 临床普外科电子 遗传与疾病相关文章
改进工作作风心得体会