本发明属于法律人工智能领域,尤其涉及一种类案检索增强的诉请生成和评测方法、系统、介质及设备。
背景技术:
1、在法律人工智能领域,传统任务旨在帮助个人完成各类法律任务,包括法律判决预测、庭审观点生成、类似案件匹配、法律语言理解和法律问答等。然而,现有研究主要针对庭审和法官辅助,而对庭前情况或非专业需求(如诉请生成)的关注较少。诉请是指原告在案件中的诉请,在司法程序中具有重要作用,因为它们对纠纷结果产生重大影响。然而,复杂的法律语言和聘请律师的经济负担往往使非专业人士处于相当不利的地位。尽管政府努力通过培养本地法律从业者来扩大法律服务的覆盖范围,但在一些法律专业人士稀缺的地区,仍面临诸多挑战。提出并研究基于案件事实的诉请生成问题能促进法治和增加法律支持的可及性。
2、民事诉讼领域的法律人工智能研究中存在一些法律数据集。然而,现有工作存在数据覆盖范围不足、缺乏多样且细致的评估指标和诉请生成效果不好的挑战。构建涵盖100种案由的法律数据集和语料库能应对现有法律数据集范围和多样性方面的限制。引入包括真实性、清晰度和一致性的细粒度标准能更好地评估模型在诉请生成中的表现。一种基于类似案件增强的诉请生成方法能够利用先前的类似案件有效提高生成诉请的质量。
技术实现思路
1、本发明的目的是克服现有数据和技术的不足,提供一种类案检索增强的诉请生成和评测方法、系统、介质及设备。
2、为了实现上述发明目的,本发明具体采用如下技术方案:
3、第一方面,本发明提供了一种类案检索增强的诉请生成和评测方法,包括以下步骤:
4、s1、获取民事判决文书,每份民事判决文书包含整个文件的非结构化内容以及额外信息,对获取到的民事判决文书进行筛选,仅保留初审民事判决文书;利用正则表达式寻找初审民事判决文书的非结构化内容中包含关键词的文本部分,对关键词前后的文本部分进行分段,将初审民事判决文书的非结构化内容划分为特定片段,在特定片段中只保留与诉请生成任务相关的段落,得到仅包含原告事实和原告诉请的民事案件语料数据;在民事案件语料数据筛选出法院支持原告诉请的民事案件语料数据,由筛选后的民事案件语料数据构成民事案件语料数据库;其中,额外信息包含案由、标题、起始时间和结束时间;所述特定片段包含引言、原告事实、原告诉请、被告辩护、法院查明和判决;
5、s2、将待生成诉请案件的原告事实和民事案件语料数据库共同输入到检索模型中,由检索模型进行类似案件检索,输出与待生成诉请案件相关的类似案件;
6、s3、使用少样本学习方法将待生成诉请案件的原告事实、以及类似案件的原告事实和类似案件的原告诉请共同输入到大型语言模型中,同时将第一提示词输入到大型语言模型中,由大型语言模型生成原告诉请;
7、s4、从民事案件语料数据库中获取待生成诉请案件的真实原告诉请,将真实原告诉请和大型语言模型生成的原告诉请输入到大型语言模型中,并将第二提示词输入至大型语言模型中,由大型语言模型进行诉请理解并在不同的评价指标上评测生成的原告诉请,输出每个评价指标上的对原告诉请的评分结果。
8、在上述方案基础上,各步骤可以采用如下优选的具体方式实现。
9、作为上述第一方面的优选,分段过程中采用的关键词包括:向本院提起诉讼、事实与理由、辩称、本院认为和判决如下。
10、作为上述第一方面的优选,在初审民事判决文书中保留前100种常见的民事案由作为民事案件语料数据库的所有案由。
11、作为上述第一方面的优选,输出的评分结果为1与5之间的正整数,其中,1表示最低质量,5表示最高质量。
12、第二方面,本发明提供了一种类案检索增强的诉请生成和评测系统,包括:
13、数据获取模块,用于获取民事判决文书,每份民事判决文书包含整个文件的非结构化内容以及额外信息,对获取到的民事判决文书进行筛选,仅保留初审民事判决文书;利用正则表达式寻找初审民事判决文书的非结构化内容中包含关键词的文本部分,对关键词前后的文本部分进行分段,将初审民事判决文书的非结构化内容划分为特定片段,在特定片段中只保留与诉请生成任务相关的段落,得到仅包含原告事实和原告诉请的民事案件语料数据;在民事案件语料数据筛选出法院支持原告诉请的民事案件语料数据,由筛选后的民事案件语料数据构成民事案件语料数据库;其中,额外信息包含案由、标题、起始时间和结束时间;所述特定片段包含引言、原告事实、原告诉请、被告辩护、法院查明和判决;
14、检索模块,用于将待生成诉请案件的原告事实和民事案件语料数据库共同输入到检索模型中,由检索模型进行类似案件检索,输出与待生成诉请案件相关的类似案件;
15、诉请生成模块,用于使用少样本学习方法将待生成诉请案件的原告事实、以及类似案件的原告事实和类似案件的原告诉请共同输入到大型语言模型中,同时将第一提示词输入到大型语言模型中,由大型语言模型生成原告诉请;
16、评测模块,用于从民事案件语料数据库中获取待生成诉请案件的真实原告诉请,将真实原告诉请和大型语言模型生成的原告诉请输入到大型语言模型中,并将第二提示词输入至大型语言模型中,由大型语言模型进行诉请理解并在不同的评价指标上评测生成的原告诉请,输出每个评价指标上的对原告诉请的评分结果。
17、第三方面,本发明提供了一种计算机可读存储介质,所述存储介质上存储有计算机程序,当所述计算机程序被处理器执行时,实现如上述第一方面任一方案所述的类案检索增强的诉请生成和评测方法。
18、第四方面,本发明提供了一种计算机电子设备,其特征在于,包括存储器和处理器;
19、所述存储器,用于存储计算机程序;
20、所述处理器,用于当执行所述计算机程序时,实现如上述第一方面任一方案所述的类案检索增强的诉请生成和评测方法。
21、第五方面,本发明提供了一种计算机程序产品,包括计算机程序/指令,其特征在于,该计算机程序/指令被处理器执行时,能实现如上述第一方面任一方案所述的类案检索增强的诉请生成和评测方法。
22、本发明相对于现有技术而言,具有以下有益效果:
23、本发明针对法律场景的诉请生成需求提出了一种类案检索增强的诉请生成和评测方法、系统、介质及设备。该方法从实际应用角度出发,有效应对现有法律数据集范围和多样性方面的限制,利用先前的类似案件有效提高生成诉请的质量。引入包括真实性、清晰度和一致性的细粒度标准更好地评估模型在诉请生成中的表现。
1.一种类案检索增强的诉请生成和评测方法,其特征在于,包括以下步骤:
2.如权利要求1所述的类案检索增强的诉请生成和评测方法,其特征在于,分段过程中采用的关键词包括:向本院提起诉讼、事实与理由、辩称、本院认为和判决如下。
3.如权利要求1所述的类案检索增强的诉请生成和评测方法,其特征在于,在初审民事判决文书中保留前100种常见的民事案由作为民事案件语料数据库的所有案由。
4.如权利要求1所述的类案检索增强的诉请生成和评测方法,其特征在于,输出的评分结果为1与5之间的正整数,其中,1表示最低质量,5表示最高质量。
5.一种类案检索增强的诉请生成和评测系统,其特征在于,包括:
6.一种计算机可读存储介质,其特征在于,所述存储介质上存储有计算机程序,当所述计算机程序被处理器执行时,实现如权利要求1~4任一项所述的类案检索增强的诉请生成和评测方法。
7.一种计算机电子设备,其特征在于,包括存储器和处理器;
8.一种计算机程序产品,包括计算机程序/指令,其特征在于,该计算机程序/指令被处理器执行时,能实现如权利要求1~4任一项所述的类案检索增强的诉请生成和评测方法。
