本发明涉及教育信息化中题目检索和知识点标记领域,具体是指基于bert和协同过滤的题目知识点标签推荐方法及系统。
背景技术:
1、在当前教育信息化全面推进的时代大背景下,题库建设和管理无疑已成为提升教学质量和优化学习效果的关键环节。
2、题库的作用至关重要。一方面,它为教师提供了丰富的教学素材,帮助教师依据不同的教学目标和学生层次,灵活地选取适宜的题目,精心设计个性化的教学方案和评估方式。另一方面,对于学生而言,一个精准分类和标注的题库犹如一座知识宝库,他们可以根据自身的学习进度和具体需求,迅速检索到与之匹配的练习题,从而有的放矢地进行学习,显著提高学习效率。
3、然而,要实现题库的高效利用,题目知识点标签的准确性和一致性是不可或缺的前提条件。只有通过对题目进行科学合理且精准无误的知识点标注,才能让教师和学生在海量的题库中迅速找到所需的题目。但现实情况却并不乐观,随着教育信息化的深入发展,题库的规模日益庞大,内容愈加繁杂,单纯依赖专家对题目逐个进行标注的传统方式,暴露出诸多弊端。这种方式不仅工作量浩如烟海,消耗大量的人力和时间成本,而且由于人的主观性和疲劳等因素,标注的一致性难以保障,无法及时满足教学的实际需求。因此,开发出一种高效、精准且智能的题目知识点标签推荐方法和系统迫在眉睫。
4、近年来,自然语言处理(nlp)技术的蓬勃发展为这一难题的解决提供了全新的思路和可能。以bert为代表的预训练语言模型开创性地引入了深度学习的框架,通过对文本进行全方位的上下文建模,成功实现了语义向量化。bert与众不同的优势在于其能够深刻理解和精准捕捉句子中的深层次语义结构,绝非仅仅局限于词汇的表面匹配。这一显著特点使得bert在处理题目与知识点之间的复杂匹配关系时,展现出了更高的灵活性和令人惊叹的准确性。
5、基于bert的语义向量化技术,能够将题目巧妙地转换成向量表示,进而在高维空间中进行相似度查询。通过精确计算这些向量之间的距离,系统能够有效地识别出与特定题目相似的一系列题目。
6、除此之外,关键字全文检索也在题目检索中发挥着重要作用。它能够在海量的文本中迅速定位包含特定关键字的部分,通过对题目的关键字提取和匹配,实现初步的题目检索。与其他方法相比,它具有操作简便、响应迅速等突出优点,因而可以作为第一步的范围筛选算法。
7、协同过滤算法是一种在推荐系统中广泛使用的技术。该技术通过分析事物之间的相似性(“协同”),来预测用户可能感兴趣的内容并将此内容推荐给用户。借助协同过滤算法,可以将nlp中多标签分类问题,转化为“相似题目都打了什么知识点标签”的协同过滤问题。
8、通过计算题目语义向量之间的夹角或距离,能够更加精准、高效地计算相似题目。最后,结合相似度分值、知识点标签位置等信息进行融合打分,便能够构建出准确度较高的自动标注算法。
9、在教育信息化的浪潮中,不断探索和创新题目知识点标签的标注方法和技术,对于提升教育质量、优化教学资源配置具有深远的意义和价值。
技术实现思路
1、本发明所要解决的问题是,通过融合关键词全文检索和bert的语义信息,采用协同过滤算法对相似题目的知识点标签打分和筛选,提升题目知识点自动标注性能和精准度。
2、为解决上述技术问题,本发明提供的技术方案为:基于bert和协同过滤的题目知识点标签推荐方法,包括以下步骤:
3、s1、将题目题干、选项拼接组成原文。其中公式采用latex格式直接拼入,图片使用[img]作为占位符;
4、s2、将上述拼接的题目原文,建立倒排索引,作为题目的第一个特征f1;
5、s3、使用预训练bert模型,将上述题目原文进行语义向量化,采用mean方法计算整句语义[cls],作为题目的第二个特征f2;
6、s4、上述语义向量化过程中,题目原文超过512长度时,将原文拆分成512长度的分段,计算每个分段的语义[cls],然后将所有分段语义取平均值,作为整个题目的第二个特征f2;
7、s5、将上述步骤中取得的题目原文、特征f1、特征f2,以及题目学科、题型、分值等原始特征,作为一个完整特征,存入列式数据库中;
8、s6、按上述步骤对题库中所有题目进行特征化处理,形成题目特征库;
9、s7、新增题目,按上述步骤取得的题目原文tn;
10、s8、将上述步骤取得的新题目原文tn,使用分词,使用textrank算法提取题目关键词,并去掉停用词,得到题目关键词kwn;
11、s9、使用上述步骤得到的题目关键词kwn、题目自带的学科特征,在题目特征库中筛选得到题目集合s1;
12、s10、按照上述计算题目特征f2n的方法,计算新题目的语义向量特征f2n;
13、s11、在题目集合s1中,计算与新题目语义向量特f2n的余弦距离,得到余弦相似度scosq;使用公式1-abs(scosq)计算相似度得分scoreq,确保scoreq取值范围为1~0;
14、s12、按相似度得分从大到小顺序,对题目集合s1排序后,截取相似度得分scoreq>0.5的题目,得到相似题目集合s2;
15、s13、取相似度集合s2,剔除没有知识点标签的题目后,取topn(n=3)个题目,作为标签推荐候选集合s3;
16、s14、计算候选集合s3中每个题目的知识点标签得分:i为知识点标签位置,count是题目知识点标签数;
17、s15、合并上述步骤中得到的每个题目中的知识点标签得分率,得到最终知识点标签推荐得分:
18、s16、将上述每个知识点标签的推荐得分stag从高到低排序,取top5个,作为最终推荐的知识点标签相应的,还包括方法所搭载的系统,即基于bert和协同过滤的题目知识点标签推荐系统,包括关键词提取模块、bert语义向量化模块、倒排索引构建与检索模块、相似度计算模块、协同过滤模块。
19、本发明与现有技术相比的优点在于:本发明能够显著降低知识点标签推荐的复杂度,融合关键词和语义相似度算法,显著提升相似题目计算精准度。采用协同过滤算法,得到新增题目知识点标签,且随着题库特征库的不断丰富,可进一步提升知识点标签的准确度。本发明中建立的题库特征库,还可用于根据关键词的检索,相似题目(举一反三)推荐等场景,具备更广泛的适应场景。
1.基于bert和协同过滤的题目知识点标签推荐方法,其特征在于包括以下步骤:
2.基于bert和协同过滤的题目知识点标签推荐系统,其特征在于包括关键词提取模块、bert语义向量化模块、倒排索引构建与检索模块、相似度计算模块、协同过滤模块。
