欢迎访问德思杂志网!
从事期刊服务十年行业深耕,专业杂志服务网站!

德思杂志网

德思杂志网

期刊服务网站、杂志服务平台

融合SIF和Doc2vec的主观题自动评分系统设计与实现
作者:  来源: 发布时间:2026-09-21 09:06:44
 加权语义引导的段落表征:融合SIF和Doc2vec的主观题自动评分系统设计与实现
 
摘要:主观题自动评分的核心困难在于学生作答的表达多样性与参考答案的有限性之间的张力,而单一文本表示方法在应对这一张力时各有局限。SIF句向量依赖通用词频统计,无法感知教育语境下的领域知识分布;Doc2vec虽能捕捉上下文语义,但在短文本场景下段落向量训练不充分,区分度不足。本文提出一种融合SIF与Doc2vec的主观题自动评分方法,其核心设计是将SIF的平滑逆频率加权机制嵌入Doc2vec的PV-DM训练过程,使段落向量的生成同时受到通用语料词频分布和学科领域概念权重的双重调节。在此基础上,设计了加权语义向量生成、评分映射、得分校准的三阶段评分流程,并实现了一套可部署的自动评分系统。在自建的中文主观题数据集上,融合方法的评分偏差率为4.87%,与人工评分的Pearson相关系数为0.893,相较于单一Doc2vec方法(偏差率7.23%,相关系数0.814)有显著提升。本文还讨论了系统在题型适配和评分可解释性方面的设计考量。
 
关键词:主观题自动评分;平滑逆频率;Doc2vec;文本表示;语义相似度;信息与电脑
 
 
 一、引言
 
主观题评分一直是教育评估中人力消耗最大的环节之一。与客观题不同,主观题允许学生在表达方式、论证结构和术语使用上保留个体差异,这种开放性使评分过程难以完全标准化。有经验的教师可以通过语义理解对意思对但表述不同的答案给出合理分数,但人工评分的一致性受评分者疲劳、顺序效应和主观标准漂移的影响,在大规模考试场景中尤为突出。自动评分技术的价值不在于完全替代人工,而在于为评分提供可追溯、可重复的第一轮过滤,将教师的精力集中于需要深度判断的边界案例。
 
主观题自动评分的技术路线大致可以分为两类。一类是基于参考答案与作答之间显式特征匹配的方法,如关键词命中率、句法结构对比和逻辑关系检测。这类方法的优势是评分依据可解释,但难以处理语义等价的多样化表达。另一类是基于文本向量表示的方法,其基本假设是:如果学生作答与参考答案在语义空间中的距离足够近,就应当获得较高的分数。这一假设将评分问题转化为文本相似度计算问题,其效果高度依赖于文本表示的质量。在“计算机科学技术与应用”领域,文本表示学习一直是自然语言处理方向的研究热点,其在教育评估场景中的落地需要兼顾表示质量与工程可行性。
 
在中文主观题场景中,文本表示面临两个特殊困难。第一,作答文本通常较短,一般在五十字到两百字之间,可用的上下文信息有限,模型训练容易不充分。第二,学生在作答中使用的术语往往与教材或参考答案不完全一致,存在大量的同义替换和口语化表达,这对表示方法的语义泛化能力提出了更高要求。现有研究多采用单一表示方法,有的使用Doc2vec直接计算段落向量相似度,有的使用SIF句向量进行加权平均,但各自的效果均不够理想。宫皓明等人将BTM与Doc2vec融合用于中文短文本评分,实验表明融合模型BTM-D2V的效果优于单一Doc2vec。这提示了一种可行的技术方向:通过引入外部语义约束来弥补单一表示方法的不足。
 
本文选择SIF作为与Doc2vec融合的对象,而非BTM或其他主题模型,基于以下考量。SIF的计算不依赖额外模型的训练,仅利用词频统计和词向量即可生成句子的加权表示,工程实现成本低,且其去除共有成分的操作与评分场景中区分学生个性化表达与通用表述的需求在逻辑上高度契合。本文的核心设计思想是:将SIF的词权重计算机制嵌入Doc2vec的PV-DM训练过程,使段落向量的生成不仅受上下文预测误差的驱动,还受到词语在学科领域中的信息量权重的调节。
 
本文的主要工作包括三个方面。第一,提出SIF权重与Doc2vec段落向量生成的融合机制,设计加权语义向量的生成流程。第二,实现包含生成、映射、校准三阶段的自动评分系统。第三,在自建中文主观题数据集上进行对比实验,验证融合方法的有效性。
 
 
 二、相关工作与技术基础
 
 (一)主观题自动评分的研究进展
 
中文主观题自动评分的研究主要集中在两个方向。一是基于统计特征的评分方法,通过提取作答文本与参考答案在关键词覆盖率、句子长度、术语密度等维度的特征,使用支持向量机、随机森林等浅层机器学习模型进行分数预测。这类方法依赖人工设计的特征,对语义等价表达的识别能力有限。二是基于深度学习的语义相似度方法。有研究将BTM主题模型与Doc2vec融合,构建了BTM-W2V和BTM-D2V两种评分模型,实验发现BTM-D2V在中文短文本主观题评分中表现最优。也有研究使用BERT和Sentence-BERT等预训练模型进行语义匹配,在基准数据集上取得了较好的效果。但预训练模型对计算资源要求较高,且在中文学科领域缺乏充分的领域适配。
 
 (二)SIF句向量表示
 
平滑逆频率是一种加权句向量生成方法,其核心思想是对句子中的每个词赋予一个与其出现频率成反比的权重,使得高频的功能词获得较低的权重,而承载核心语义的低频词获得较高的权重。SIF方法的另一个关键步骤是去除句向量中的共有成分。具体做法是对所有句向量构成的矩阵进行主成分分析,将每个句向量减去其在第一主成分上的投影。这一操作的理论解释是:第一主成分通常捕捉的是语料中普遍存在的语义成分,去除它可以使句向量更聚焦于句子特有的语义内容。
 
SIF在英文文本相似度任务中表现良好,但在中文主观题评分场景中的应用研究较少。一个需要关注的问题是:SIF的权重计算依赖于词频统计,而词频统计的语料选择对结果影响显著。如果使用通用新闻语料计算词频,教育领域中的核心概念词可能因为语料中不常见而获得过高的权重,而实际上它们在不同答案中可能反复出现,应当被适度降权。
 
 (三)Doc2vec段落向量表示
 
Doc2vec是Le和Mikolov在Word2vec基础上提出的段落级文本表示方法,其核心是在词向量训练过程中增加一个段落向量,使模型能够同时学习词级和段落级的语义表示。Doc2vec有两种训练模式:PV-DM和PV-DBOW。PV-DM模式将段落向量与上下文词向量拼接或累加后预测目标词,段落向量在同一个段落的多次训练中共享,可以视为该段落的主题向量。
 
在PV-DM的训练过程中,给定一个段落和段落中的一个词,以该词为中心取其前后若干词构成上下文窗口,将段落向量与上下文词向量输入模型,通过投影层得到中间向量,以中间向量为输入预测目标词,根据预测误差反向传播更新段落向量和词向量。Doc2vec在中文主观题评分中的局限性在于:当作答文本较短时,段落中可用于训练的上下文样本数量有限,段落向量的训练容易欠拟合;此外,PV-DM的段落向量更新完全由上下文预测的准确性驱动,模型倾向于学习与预测下一个词相关的语义特征,而非与判断作答质量相关的判别性特征。
 
 (四)SIF与Doc2vec的互补性分析
 
SIF和Doc2vec在文本表示上具有互补性。SIF的优势在于利用全局词频信息来调节词的贡献度,其权重分配是显式的、可解释的,但SIF生成的句向量本质上是词向量的加权平均,丢失了词序信息和部分上下文语义。Doc2vec的优势在于通过神经网络训练捕捉上下文语义和词序信息,但其段落向量的质量受训练数据量的限制,在短文本场景下容易不稳定。
 
两者的互补性为融合提供了逻辑基础:SIF的权重信息可以作为一种先验知识,引导Doc2vec在训练段落向量时对信息量不同的词给予不同程度的关注。具体而言,如果PV-DM在预测目标词时,对SIF权重较高的词产生更大的预测误差惩罚,段落向量的学习就会更倾向于保留与这些词相关的语义特征,从而提升对评分关键信息的敏感度。
 
 
 三、融合方法设计
 
 (一)SIF权重与Doc2vec PV-DM的融合机制
 
本文提出的融合方法的核心创新在于:在Doc2vec的PV-DM训练过程中,将目标词的预测误差以其SIF权重进行加权。标准PV-DM的训练目标是使模型对目标词的预测概率最大化,各词的预测误差在总损失中贡献相同。本文修改后的训练目标是使预测误差的加权和最小化,其中每个词的权重由SIF公式计算。这一修改的含义是:在训练段落向量时,对SIF权重较高的词赋予更大的预测误差惩罚,迫使段落向量在编码时更多地保留与这些词相关的语义信息。
 
需要说明的是,SIF权重在训练过程中的作用与标准SIF句向量生成中的作用有所不同。在标准SIF中,权重用于对词向量进行加权平均以生成句向量;在本文的融合方法中,权重用于调节训练过程中不同词的预测误差对段落向量更新的贡献。两者的共同逻辑是信息量大的词应当对语义表示产生更大的影响,但实现方式不同。
 
此外,本文在SIF权重的词频估计中使用了教育领域语料而非通用语料。具体做法是:从自建主观题数据集中收集所有参考答案和标准答案的文本,统计词频,并在此基础上计算词频估计值。这样,学科核心概念词的词频估计会更接近其在教育语境中的实际分布,避免了使用通用语料时可能出现的权重失真。
 
 (二)加权语义向量的生成流程
 
融合方法的向量生成流程包括四个步骤。
 
第一步是语料预处理。对参考答案和学生作答进行中文分词、去停用词和标点过滤。分词使用jieba工具,停用词表在通用停用词表基础上增加了教育领域的虚词和套话表述。
 
第二步是词频统计与SIF权重计算。在教育领域语料上统计词频,计算每个词的SIF权重。对于未登录词,使用平滑参数计算最大权重作为其权重。
 
第三步是加权Doc2vec训练。使用修改后的训练目标训练Doc2vec PV-DM模型。训练语料包括参考答案、学生作答以及从教材和教辅中收集的学科相关文本,以增加段落向量的训练充分性。段落向量维度设为两百,上下文窗口大小设为五,训练迭代次数为二十。
 
第四步是句向量生成。对于参考答案和学生作答,分别生成两类向量表示:一是Doc2vec训练得到的段落向量,二是使用SIF加权平均生成的句向量。最终的融合向量为两者的拼接,融合系数通过验证集上的评分性能确定,实验中取值为零点六。
 
 (三)评分映射与得分校准
 
得到参考答案和学生作答的融合向量后,系统通过以下流程计算得分。
 
在相似度计算环节,使用余弦相似度计算学生作答向量与参考答案向量之间的相似度。由于参考答案可能包含多个得分点,系统将参考答案按照得分点分解为多个子参考答案,分别计算学生作答与每个子参考答案的相似度,取加权平均作为最终的相似度得分。每个子参考答案的权重由其对应的分值决定。
 
在分数映射环节,将相似度映射到题目分值范围。本文采用分段线性映射而非简单的线性缩放,原因是相似度分布在两端较为集中,高相似度和低相似度的案例较多,中间区域的区分度更为关键。映射函数将相似度区间划分为三段,分别对应不同的分数区间,阈值参数通过在验证集上网格搜索确定。
 
在得分校准环节,由于相似度与得分之间的关系并非严格线性,本文在映射之后引入一个基于梯度提升树的校准模型。校准模型的输入特征包括余弦相似度、学生作答长度、与参考答案的长度比、SIF权重排名前10的关键词覆盖率。校准模型在人工评分数据上进行训练,目标是最小化预测得分与人工得分之间的均方误差。校准模型的引入使系统能够利用相似度之外的信息来修正评分偏差。
 
 
 四、系统实现
 
 (一)系统架构
 
系统采用三层架构,从底向上分别为数据层、算法层和应用层。
 
数据层负责存储和管理参考答案库、学生作答数据、人工评分记录和语料资源。数据库使用MySQL存储结构化数据,使用Redis缓存高频访问的段落向量。参考答案和得分点分解信息以JSON格式存储,支持多得分点题目的灵活配置。
 
算法层是系统的核心,包含五个模块:预处理模块、SIF权重计算模块、Doc2vec训练模块、融合向量生成模块和评分校准模块。算法层使用Python实现,依赖gensim库的Doc2vec接口、jieba分词库和scikit-learn的梯度提升树实现。Doc2vec的训练和推理部署在GPU服务器上,以支持批量评分场景下的吞吐量需求。
 
应用层提供RESTful API接口和Web管理界面。API接口支持单条评分请求和批量评分任务提交。Web界面面向教师用户,提供评分结果查看、异常案例标注和校准参数调整功能。教师在查看评分结果时,可以查看系统给出的相似度分解和校准依据,这为人工复核提供了可解释的参考信息。
 
 (二)关键实现细节
 
在多得分点处理方面,主观题的参考答案通常包含多个得分点。系统支持两种得分点分解方式:一是教师手动标注得分点,将参考答案拆分为若干独立的语义单元;二是使用基于TextRank的关键句提取算法自动分解参考答案。自动分解的结果由教师确认或修改后入库。
 
在训练语料构建方面,为保证Doc2vec段落向量的训练充分性,系统在训练语料中不仅包含了本次评分任务的参考答案和学生作答,还整合了同一学科的历史考试数据和教材文本。训练语料的规模对段落向量的质量影响显著:实验发现,当训练语料低于五万字时,Doc2vec的段落向量在相似度计算中的表现明显下降;当训练语料达到二十万字以上时,段落向量的质量趋于稳定。
 
在评分阈值的自适应调整方面,不同题目的难度和评分标准存在差异,固定的相似度阈值难以适应所有题目。系统引入了一种基于题目历史评分的自适应阈值调整机制:对于每道题,系统记录该题目在历史评分中的相似度分布和人工评分分布,据此动态调整映射函数的阈值参数。这一机制使系统在应对新题目时能够快速校准到合理的评分尺度。
 
在模块间的数据流方面,从软件工程的角度看,系统的数据流可以描述为:预处理模块接收原始文本,输出分词结果和词频统计;SIF权重计算模块基于词频统计和教育领域语料计算每个词的权重,输出权重字典;Doc2vec训练模块接收分词结果和SIF权重,训练并输出段落向量模型;融合向量生成模块使用训练好的模型生成参考答案和作答的融合向量;评分校准模块接收相似度特征,输出最终得分。各模块之间通过标准化的数据接口交互,支持独立测试和替换。
 
 
 五、实验与结果分析
 
 (一)数据集与实验设置
 
实验使用自建中文主观题数据集,来源于某高职院校管理学基础和计算机应用基础两门课程的主观题考试。数据集包含一百二十道主观题,每道题对应二十至五十份学生作答,共收集有效作答三千八百四十七份。所有作答均由两位教师独立评分,评分一致性加权Kappa为0.783。最终得分取两位教师评分的均值。
 
对比方法包括Doc2vec单独评分、SIF句向量单独评分、TF-IDF余弦相似度评分,以及本文提出的融合方法。评价指标包括偏差率(预测得分与人工得分之差的绝对值除以满分,取均值)、Pearson相关系数和均方根误差。
 
 (二)评分性能对比
 
实验结果如下表所示。
 
| 方法 | 偏差率 | Pearson相关系数 | 均方根误差 |
|------|--------|-----------------|-----------|
| TF-IDF | 12.47% | 0.682 | 1.83 |
| Doc2vec | 7.23% | 0.814 | 1.21 |
| SIF | 8.91% | 0.769 | 1.47 |
| 融合方法 | 4.87% | 0.893 | 0.86 |
 
融合方法在三个指标上均优于所有对比方法。与单一Doc2vec相比,偏差率降低了2.36个百分点,Pearson相关系数提升了0.079,均方根误差降低了0.35。与SIF相比,融合方法的优势更为明显,说明Doc2vec提供的上下文语义信息对评分精度有实质贡献。已有研究表明,基于Doc2vec的评分方法在中文主观题场景中具有较好的稳定性,本文的融合方法在此基础上进一步提升了精度。
 
从方法对比中可以看出,Doc2vec的表现优于SIF和TF-IDF,这符合预期,因为Doc2vec能够捕捉上下文语义,在处理意思对但表述不同的答案时具有优势。但Doc2vec单独使用时偏差率仍达到7.23%,说明其在短文本场景下的段落向量质量不够稳定。融合方法通过引入SIF权重调节,在不增加大量计算开销的前提下显著提升了评分精度。
 
 (三)消融实验
 
为验证融合方法中各组件的贡献,本文进行了消融实验。实验设置三个变体:变体A去掉SIF权重调节,仅使用标准PV-DM训练Doc2vec;变体B保留SIF权重调节但去掉得分校准模块;变体C使用通用语料计算SIF权重而非教育领域语料。
 
| 变体 | 偏差率 | Pearson相关系数 |
|------|--------|-----------------|
| 完整融合方法 | 4.87% | 0.893 |
| A:无SIF权重调节 | 6.92% | 0.827 |
| B:无得分校准 | 6.15% | 0.851 |
| C:通用语料SIF权重 | 5.63% | 0.872 |
 
消融实验的结果揭示了几个值得关注的发现。首先,去掉SIF权重调节后,偏差率从4.87%上升到6.92%,Pearson相关系数从0.893降至0.827,说明SIF权重对段落向量的质量有实质性贡献。其次,去掉得分校准模块后,偏差率上升1.28个百分点,说明校准模块对修正系统性偏差具有独立价值。最后,将SIF权重的词频估计从教育领域语料替换为通用语料后,偏差率上升0.76个百分点,虽然幅度不大,但表明领域语料的选择对权重计算有一定影响。
 
 (四)不同题型上的表现差异
 
将数据集按题型分为概念解释型和分析论述型两类,分别评估融合方法的表现。概念解释型题目共四十八题,评分偏差率为3.92%,Pearson相关系数为0.921。这类题目的参考答案较为明确,关键词集中,语义空间紧凑,融合方法的段落向量能够较好地区分准确表述与模糊表述。分析论述型题目共七十二题,评分偏差率为5.51%,Pearson相关系数为0.876。这类题目的参考答案通常包含多个得分点,且学生作答的自由度较高,得分点的覆盖情况对总分影响显著。偏差率较高说明,当学生作答的得分点覆盖不完整时,段落向量相似度与得分之间的对应关系不够稳定。一种可能的改进方向是将得分点覆盖度的显式检测作为相似度计算之外的独立特征引入。
 
 
 六、讨论与局限
 
本文的实验结果支持融合方法在中文主观题评分场景中的有效性,但有几个问题需要进一步讨论。
 
第一,关于评分可解释性。与关键词匹配方法相比,基于向量的评分方法在可解释性上存在劣势。教师看到一个分数时,难以直接从分数追溯到哪些部分得分了、哪些部分扣分了。本文的系统通过得分点分解和相似度分解在一定程度上缓解了这一问题,但仍有改进空间。
 
第二,关于训练语料的依赖。融合方法的性能在一定程度上依赖于Doc2vec训练语料的规模和质量。在本文的实验中,训练语料来自同一学科的历史数据,规模约为十五万字。对于新开设的课程或缺少历史数据的场景,训练语料不足可能导致段落向量质量下降。一种缓解方案是使用跨学科的教育文本进行预训练,再在目标学科的小规模数据上进行微调。
 
第三,关于评分标准的一致性。自动评分系统的效果上限受限于人工评分数据的一致性。本文数据集的加权Kappa为0.783,属于较好水平,但并非完美一致。如果人工评分本身存在较大的主观差异,自动评分系统学到的标准就会包含这种噪声。在实际部署中,系统的评分结果应当作为教师评分的第二意见,而非替代方案。
 
 
 七、结语
 
本文针对中文主观题自动评分中单一文本表示方法效果不足的问题,提出了一种融合SIF和Doc2vec的方法。其核心设计是将SIF的词权重计算机制嵌入Doc2vec的PV-DM训练过程,使段落向量的生成同时受到上下文预测驱动和词信息量驱动的双重调节。在自建数据集上的实验表明,融合方法的评分偏差率为4.87%,Pearson相关系数为0.893,优于Doc2vec和SIF的单独使用。消融实验进一步验证了SIF权重调节和得分校准模块各自的贡献。
 
从信息与电脑领域的技术视角看,本文的方法属于文本表示学习与教育评估的交叉应用。近年来,信息与电脑领域的相关研究也在探索自然语言处理技术在教育场景中的落地方式,例如结合计算机视觉与自然语言处理技术实现自动阅卷,以及基于大语言模型构建全维度评测系统。与这些工作相比,本文的方法在计算成本和部署便利性上具有优势,适合在计算资源有限的院校环境中应用。未来的工作将聚焦于两个方向:一是引入轻量级的注意力机制,使系统能够自动识别作答中的关键语义片段;二是在更多学科和更多题型的场景中验证方法的泛化能力,并探索将计算机科学技术与应用领域中的图神经网络方法引入得分点关联建模的可能性。
 
 
参考文献:
 
[1] 基于doc2vec的主观题自动评分应用[J]. 现代计算机,2022(1):21-26.
 
[2] 肖灵云,刘军库,李春红. 基于相似度组合的主观题评分方法研究[J]. 贵州大学学报(自然科学版),2021(5).
 
[3] 宫皓明,万小芬,康春花. 融合BTM和Doc2vec的中文短文本自动评分方法[J]. 江西师范大学学报(自然科学版),2025,49(2):120-127.