本发明涉及跨模态信息处理,具体为一种图片与html源码相结合的网页信息结构化提取方法。
背景技术:
1、随着互联网的快速发展,网络的网页排版呈现多种多样化。在舆情领域,我们针对一条html原始网页,往往只需要提取其中的标题、正文、作者、发布时间、图片等信息,便于后续的数据分析。然而实际情况是爬虫得到的网页数据是半结构化的,包含大量的html元素。因此,我们需要进一步针对网页数据进行处理,得到结构化的数据,这样便于后续的数据分析。可以说,网页数据结构化提取结果的好坏直接影响后续的分析效果。
2、目前主要有两种方式:第一、基于规则的方式解析一些具体网页,即针对不同的网页,去写不同的正则表达式来提取相应的字段。该方法虽然准确率较高,但是每当遇到一个新的网页,就要写新的正则表达式,非常的耗时,对于现在网络各种排版的网页来说工作量巨大。同时,一旦一个网页进行了改版升级,正则表达式就得重新构造,因此该方法非常的不切实际。第二、目前通用的网页结构化技术,往往是基于各个字段文字密度与分布,来区别我们要提取的各个字段。该方法虽然可以针对通用的网页结构进行提取,但是里面需要设置很多阈值,阈值的设置会直接影响最终的效果,且不同网页阈值可能不一致,因此针对各种类型的网页,准确率不是很高。
3、针对上述出现的问题,我们提出了一种结合图片和html源码信息,来对html网页进行结构化处理。提出结合图片信息和html源码信息来对html网页结构化的动机来自于:人直接看到的网页往往很容易区分标题、正文、作者、发布时间、图片等信息,而直接看html源码,也很难做到区分标题、正文、作者、发布时间、图片等信息。这是因为html源码到网页之间,做了一层css样式的转换。
技术实现思路
1、本发明目的在于提供一种图片与html源码相结合的网页信息结构化提取方法,以解决上述背景技术中提出的问题。
2、为了解决上述技术问题,本发明提供如下技术方案:一种图片与html源码相结合的网页信息结构化提取方法,具体步骤包括:
3、步骤s1,html页面源码预处理,获取预处理数据,具体包括:
4、s11、根据html的标签划分html页面源码,按顺序形成列表;
5、s12、采用正则匹配所述标签的内容,将其分为纯url格式和非url格式,并将其记为:和
6、s13、将url的非图片网址过滤,留下图片网址并下载图片,得到html页面源码图片列表,记为:
7、步骤s2,搭建html页面图片版面分析模型,具体包括:
8、s21、利用python库将html页面版面转换为html图片;
9、s22、训练一个针对步骤s21获得的所述html图片的版面分析模型,用以实现输入所述html图片,输出标题、正文、作者、发布时间、图片在所述html图片中的像素位置;
10、s23、训练步骤s22中所获得的所述版面分析模型;
11、s24、将html图片送入到训练后的所述版面分析模型,用以推理,获得标题、正文、作者、发布时间、图片的相关位置;
12、步骤s3,html图片ocr模型识别,采用ocr模型对步骤s2获得的标题、正文、作者、发布时间数据进行文本行的检测与文字识别,得到相应内容,并按顺序排序形成文本列表,记为:ocrtxt=[title,publishtime,author,content];
13、步骤s4,搭建图片相似度模型picsim,具体包括:
14、s41、将html图片按照像素位置截取图片列表,记为:
15、s42、将步骤s41获得的所述图片列表与html页面源码得到的原图进行标注,训练相似度模型;
16、s43、对图片pic1和pic2,计算其相似度,获得图片列表,公式为:
17、picsim(pic1,pic2)=psim1,2;
18、步骤s5,对比html源码解析数据与html图片解析数据,获取最终正文,具体包括:
19、s51、将html源码图片列表和图片列表送入图片相似度网络得到相似度矩阵:
20、
21、针对矩阵列表,将每一列的最大值选取出来,当存在num个最大值对应的行一致时,则在这num个最大值中选择最大的值保留行不变,其余num-1则选择次大值对应的行,如果仍存在一致,则继续上述步骤,输出最终图片;
22、s52、将html源码文本列表和html图片通过ocr模型识别得到的标题、作者、发布时间的文本列表ocrtxt=[title,publishtime,author],计算编辑距离相似度矩阵,输出最终标题、作者、发布时间,具体公式为:
23、
24、其中sthi表示title和htmltxti的编辑距离相似度,sphi表示publishtime和htmltxti的编辑距离相似度,sahi表示author和htmltxti的编辑距离相似度,选取每一行的最大值对应的列下标记为[tindex,pindex,aindex],则最终选择的标题为发布时间为作者为
25、s53、将html源码文本列表htmltxt的剩余向量进行重新拼接,获得html源码拼接文本列表,记为:togetherhtml,将图片通过ocr模型识别得到的正文列表ocrtxt=[content]与html源码拼接文本列表togetherhtml,计算编辑距离相似度向量,输出最终文本,具体公式为:
26、
27、其中si为content和的编辑距离相似度,最终选择相似度最大的下标记为cindex,则最终选择的正文内容为
28、进一步地,步骤s53中所述html源码拼接文本列表togetherhtml,为html源码文本列表htmltxt去除标题、作者、发布时间剩余的n―3个向量对其进行拼接,具体过程为:
29、针对拼接得到n―3种文本,每种文本的起始下标为i;
30、确定终止下标方案如下:拼接文本长度为lij,拼接文本长度为lij+1,满足条件:
31、(lij―l)(lij+1―l)≤0;
32、如满足下列条件:
33、l―lij≤lij+1―l;
34、则最终的下标选择为j,即最终的拼接文本为:否则,最终的下标选择为j+1,即最终的拼接文本方案为:其中,l为ocr识别出的content文字长度;
35、通过上述方式,得到n―3个向量拼接的文本,并记为:
36、本发明有益效果:本发明将图片版面信息与html源码内容结合起来,通过分析图片的版面信息,提取出与文本相关的标题、正文、作者、发布时间的结构化信息,从而丰富了提取的内容,使得结果更加准确全面,泛化性更强;
37、本发明利用文字编辑距离相似度和图片相似度进行判断,不仅仅是依靠文本的相似度来判断信息的准确性,还考虑了图片的相似度,与传统的html网页结构化技术分析相比,利用html源码抽取的文本和图片相比对的结果,提高了对信息的判断和抽取的准确性,比单一的分析结果更准确。本发明适用于各种类型的网页,提高了应用的广泛性。
1.一种图片与html源码相结合的网页信息结构化提取方法,其特征在于,具体步骤包括:
2.根据权利要求1所述的图片与html源码相结合的网页信息结构化提取方法,其特征在于,步骤s53中所述html源码拼接文本列表togetherhtml,为html源码文本列表htmltxt去除标题、作者、发布时间剩余的n―3个向量对其进行拼接,具体过程为:
