中国式现代化道路需要教育推动,考试作为最重要的教育评价手段之一,需要全面深化改革,以中国式考试现代化服务于教育评价改革.考试内容改革从考试起点出发,目标是让考生做有意义的事情;考试评价改革是从考试功能出发,目标是让考生所做事情的结果得到科学、准确的阐释,并使这些结果得到充分、有效的应用.考试评价工作通常包括评价考试、评价考生、评价教育教学3个主要方向,从与考试相关的直接、间接数据出发,以评价结果反馈促进考试质量的提升,促进考生个性化发展,促进教育教学精准改进.为推进中国式考试现代化,深化考试评价改革的路径是:一要强化科技赋能数字化考试评价,二要建立有效的评价反馈与持续改进机制,三要创新考试评价的理论与技术,四要提升多元评价主体和社会公众的评价素养.
探索增值评价是深化新时代教育评价改革的任务之一.为研究常见增值评价方法在实际应用中的有效性,选取30所学校共34830名高三年级学生的2次数学考试数据作为样本,分别使用标准分法、效应量法、分层回归法及学生成长百分位法计算增值效应,以评价不同学校及不同特征群体的增值表现.结果显示:增值评价能够提供区别于结果评价之外的有效信息,拓宽了评价学校整体表现的视角;较其他增值评价方法,学生成长百分位法可以较好地解决优秀学生进步空间受限等局限性.增值评价在实践中尚存在诸多探索空间,但也要注意应慎用增值评价的结果,使用时应结合其他评价指标作为综合参考.
《深化新时代教育评价改革总体方案》(以下简称《总体方案》)提出"四个评价"的改革思路,并针对"五类主体"统筹设计改革任务.高考作为教育评价指挥棒之一,面对教育评价改革新形势新要求,需要立足"四个评价",从服务"五类主体"的角度进一步深化改革.高考评价改革要积极探索高考在改进结果评价、强化过程评价、探索增值评价、健全综合评价中的定位和作用,整体提升高考评价的科学性、客观性和公平性.高考评价改革要以学生评价这一主体为抓手,立足全局,整体谋划,加快推进服务"五类主体"的目标.锚定2035年远景目标,高考评价改革要以《总体方案》为根本遵循,以"中国高考评价体系"为理论基础和实践指南,从考试内容、考试形式和考试评价3个方面重点突破,完善评价工具,创新评价手段,健全评价结果反馈与使用,全方位提升高考评价功能,助力新时代教育评价改革落地.
对试题、试卷的难度、区分功能一般都是运用数值进行量化评价,应用图形分析法对评价数据进行直观展示将有助于公众和命题人员理解评价数据的含义,同时更进一步深化对数据的理解.分数分布直方图能够反映考生的分布情况.各批次考生成绩分布图能展示试题对各层次考生的区分情况.试题难度分布图能够深入揭示试题对总分在哪个分数段的考生区分良好.不同组别考生成绩分布图可以了解各组别考生的得分情况和考生分数的走势.不同年份试题难度对比图可以比较年度间试题的水平和变化情况.
与基于全体考生的总体分析不同,基于条件得分的分析是基于不同能力水平的考生子群体的分析.条件得分分析技术可以应用于对选择题的选项分析和主观题的图形分析、主观题的项目功能差异分析、选考题的公平性分析、评分宽严尺度分析等,不依赖于任何数学模型,原理简单直观,结果容易解释,但缺点是尚没有建立公认的判断准则.基于条件得分的分析技术在我国考试质量评价中有广泛应用空间.
The purpose of this study is to analyze test fairness of the 2016 National Matriculation English Test (NMET) through conducting differential item function (DIF) analyses. If the responses of two groups of students with the same level of language ability differ on a common item, then the item owns DIF values, which means the item poses different level of difficulty for the two groups. The descriptive statistics indicated that there was significant difference in NMET scores between urban test-takers and rural test-takers. The standardization approach was applied to assess the three NMET papers focusing on urban/rural test-takers by using STDIF software which can detect both uniform DIF and non-uniform DIF. DIF is also investigated for a single writing item using the conditional P-value method. The result shows that no DIF values were found in the three NMET papers between urban and rural test-takers, suggesting that the score difference between the groups could not be attributed to DIF.
新高考改革的重要内容之一是将学业水平考试选考科目实行等级赋分,并计入高考总成绩.结合新一轮高考改革的相关政策文件和相关研究结果,以及试点省份的实践反馈等,通过梳理现有选考科目等级赋分的优点和可能存在的缺陷,并对其原因进行探讨,从兼顾科学性、公平性和可操作性出发,提出改进选考科目赋分的方案,为进一步深化考试改革提供参考建议.
新高考改革背景下,考试质量监测与评价要求:科学监测高考作为考试工具自身的质量,以监测促考试质量提升;科学监测和评价考试改革进程中的问题与对策,以监测推动考试改革动态调整.教育部考试中心以“大评价”观为指导,以提高考试质量为核心,以信息化平台为支撑,在建立全维度、全流程、全功能的考试质量监测与评价体系上进行了不断探索.下一步将聚焦改革,全力迎接新高考考试性质的再认识、新高考难度模型重构,以及大数据分析等带来的新挑战,进一步建立健全考试质量监测与评价体系,为提升教育质量、推进考试改革服务.
本文基于不同能力水平组考生在具体题目上的反应曲线,研究如何基于条件概率估计,采用图形分析法对高考试题进行评价.图形法既可以做0/1计分题目分析,如直观展示选择题的难度、区分度、选项的迷惑性及随考生能力水平的递增而变化的趋势等,也可以做多级计分题目分析,如直观展示主观题在可能获得的不同分数点上的难度和对不同层次考生的区分情况.本文结合2017年高考物理试题和考试数据,对图形分析法所传达的信息进行解读,希望能为考试工作者特别是命题人员提供参考.
高考不分文理科是此次考试招生制度改革的一个重要举措.选取Y省高考现有文理科考生的数学成绩为研究样本,将文理数学试卷中的共同题作为内锚,采用等值技术对比分析了Y省现有文科考生与理科考生的高考数学成绩的差异,并对使用同一试卷的不同省份的文理差异程度进行了分析.研究发现:(1)理科考生群体的数学成绩普遍且明显高于文科考生群体.以Y省为例,基于共同题等值后,两个考生群体的数学成绩平均相差13分.(2)不同省的文理科考生群体在数学成绩的差异上程度明显不同,文理数学水平差距最大的省比文理差距最小的省在差异程度上又有12分之多.文理科数学成绩差异及不同省差异程度的问题值得关注,为进一步落实高考数学文理不分科提供参考.
数学能力性别差异一直是国内外教育考试界关注的热点问题.选取2016年使用全国同一数学试卷的多个省的高考考生为研究样本,对比分析了总体以及每一个省的高考数学成绩的性别差异,并依据题型、能力和知识内容维度分类后对性别差异的具体表现形式进行了详细分析.结论如下:(1)总体上,男生在高考数学表现上更加优异.(2)女生的选择题成绩总体上优于男生,而男生的填空题与解答题成绩总体上优于女生.(3)男生的逻辑思维、空间想象、数据处理3种能力总体上均高于女生,而女生的运算求解能力总体上高于男生,创新应用能力性别差异不显著.(4)男生在代数、立体几何、概率与统计3项成绩上总体高于女生,而女生在解析几何和三角函数两项成绩上则高于男生.(5)不同省之间在高考数学成绩的性别差异程度及差异的具体表现形式有所不同,个别省性别差异程度较大,其原因值得教育研究者与实践者不断关注与探讨.
1 前言 数学成绩及能力的性别差异研究一直是教育界研究的热点问题.此领域的研究在国际上已取得很多重要成果,总体上来看是男生的数学成绩优于女生,但有的国家也并非如此[1].近几年国内关于中学生数学成绩性别差异进行了一些研究,既有一致的结果,亦有互相矛盾的结论.如叶宏(2011)指出,男女考生在数学各分支内容上的得分率不同,历年来男生高于(或等于)女生的部分有集合与简易逻辑、平面向量、排列组合、二项式定理等;女生高于男生的有三角函数、直线平面简单几何体、圆锥曲线、极限与导数、复数、解析几何等[2].
文章以PETS-5为例,在设计并实现机考形式后,选取出国培训班学生共404人参加了该机考测试.测试结束后,通过在线问卷调查的形式调查了被试对该机考形式的感受与意见,并收集了考生参加PETS-5纸笔考试的考试成绩.研究结果表明:(1)该机考总体的Alpha信度为0.82,各部分为0.63~0.65,具有较好的内部一致性信度;(2)该机考各部分的相关系数为0.34~0.43,与纸笔考试各部分相关的结果基本相近,具有较好的结构效度;(3)该机考成绩与纸笔考试成绩的相关系数为0.709,具有较好的效标关联效度;(4)该机考模式对于男生和女生是公平的,试题在性别上不存在项目功能差异;(5)关于测验总分及各部分性别差异t检验结果显示,男女考生仅在阅读理解成绩上存在性别差异,男生的平均成绩高于女生.
高考是选拔性考试,强调对考生的精确区分,研究试卷的区分功能有助于科学评价试卷的区分效果,进而提高试卷的区分能力.试卷的区分功能可以用标准差的临界值、变异系数等统计学方法进行评价,也可参照试题区分度的评价方法,应用相关系数法和极端分组法进行评价.
<span id="ChDivSummary" name="ChDivSummary" class="abstract-text">聚焦科学素养的PISA2015,作为国际上最大的比较教育研究评价项目,为了解我国中学生科学素养的性别差异提供了可靠的工具。对最新公布的PISA2015的测评结果分析显示:我国男生的科学成绩总体上好于女生。在能力维度上,男生在"科学地解释现象"、"科学地解释数据和进行证明"两个子维度上的表现优于女生;在知识维度上,男生在"内容性知识"上的表现优于女生;在内容维度上,男生在"物理"、"地球与空间"两个子维度上的表现优于女生。从科学水平的等级分布来看,男生表现优异的比例高于女生。尽管我国学生科学素养总体较好,但学生科学素养的性别差异及其表现形式值得关注;另外,我国15岁学生未来从事科学相关的职业倾向意识有待引导提升。</span>
阅读理解测试通常为多个题目共用一个语篇材料,属于典型的题组题型,传统的基于单题的信度估计方法将会高估测试的信度.研究采用概化理论模型,通过比较传统(a)信度系数以及不同的概化理论测量设计模型,探讨不同方法对阅读理解测量精度估计的差别;同时,通过改变语篇和题目的数量来观察概化系数和可靠性指数等指标的变化,为改进考试设计和命题提供参考信息.结果表明,忽略语篇的单变量概化设计以及基于题目的a系数会在概化系数上高估0.0404,将语篇作为多变量的交叉设计会在概化系数上高估0.0480,基于语篇的(a)系数与单变量嵌套设计的概化系数一致.另外,增加阅读理解中的语篇量或题目量都可以提高测量的精度,但增加语篇量在提高阅读理解测试的测量精度上更为高效.
从测量学角度来看,高考作文因其评分主观性强影响了对考生写作能力甚至是语文能力的测量.如何改革作文才能进一步减小评分误差、提高考试的公平性,是落实此次考试招生制度改革的一项具体任务.研究一表明,与西方采用的小评分量表相比,我国高考采用的60分制大评分量表评分趋中效应更为严重,评分标准更为宽松,不同评分者对评分标准的掌握一致性较差,据此建议改革高考作文评分量表的设计,将目前的大评分量表改为小评分量表,成绩单独报告.研究二表明,增加作文任务数量有助于明显提高评分信度,据此建议将高考作文由一个大作文变为一大一小两个作文.
本研究以PETS-1级拟聘口试教师为研究对象,对口试教师评分的培训效果进行了研究.采用多面Rasch分析对比口试教师接受培训前后的评分效果.结果发现:培训后,提升了口试教师与专家评分完全一致的比率,评分偏于严格的口试教师在评分标准上做了恰当的调整,所有口试教师评分拟合值都在可接受范围内,总体上,口试教师评分的培训比较有效,培训后提升了评分的准确性.多面Rasch分析有助于发现评分过于宽松、过于严格、评分拟合差的口试教师以及评分异常情况,为开展有针对性的培训提供了可靠的依据.
Computerized item banking has emerged as an essential activity in the development of educational examinations from tradition to modern, which is the inevitable choice of examination authority. This paper discusses our understanding and thoughts about frequently asked questions of item banking according to the experience of NEEA. We give some suggestions as well. NEEA will try our best to make the item bank as perfect and effective as possible.
为了评价和改进硕士研究生入学考试一般能力测试的写作评分,研究者采用概化理论和多面Rasch分析对113位考生的写作样本的评分误差来源、评分信度等进行了探讨.概化理论研究显示,评分者和题目对评分准确性影响不大,以两道写作题的考试设计而言,评分者为2人即可保证评分信度在0.75以上.多面Rasch分析显示,评分者宽严度的估计值及其误差均在可接受的范围内,评分者之间在宽严度上不存在显著差异,且评分者自身在评分时总体上比较稳定.但个别评分者在特定考生特定题目上表现出特殊偏向.概化理论和多面Rasch分析丰富了写作评分研究的量化指标,证实了硕士研究生入学考试一般能力测试的写作评分具有较高的信度.