点击上方“蓝字”关注我们
“Item Response Theory, IRT-项目反应理论,也称潜在特质理论或潜在特质模型,是一种现代心理测量理论。它建立在潜在心理特质理论基础之上,以单个测验项目为考察对象,核心是描述被试的潜在特质与其在测验项目上反应之间的数学关系。该理论最重要的两个基本概念是“潜在特质”和“项目特征曲线”。”
项目反应理论(Item Response Theory, IRT)是继经典测验理论(CTT)之后发展成熟的新一代潜在特质测量理论,凭借参数不变性、概率建模精准、适配复杂测评数据等优势,现已成为现代心理与教育测量的核心分析范式。IRT的理论雏形可追溯至20世纪20—40年代,学界逐步发现经典测验理论存在题目参数依赖被试样本、被试分数依赖测验试卷、无法实现跨样本比较等固有缺陷,由此开启了作答行为与潜在能力函数关系的探索。
相较于经典测验理论,IRT具备不可替代的理论与实践价值。在理论层面,IRT打破了CTT样本依赖性的局限,依托严谨的概率模型刻画被试潜在能力与项目作答概率的对应关系,能够独立估计题目难度、区分度、猜测度与被试能力值,参数具备跨样本、跨试卷的不变性,极大提升了测量的科学性与严谨性。在实践层面,IRT可精准评估单题与整卷的测量信息函数,清晰区分不同能力区间的测量精度,为试题筛选、试卷优化、题库建设提供量化依据;同时,IRT支撑测验等值、项目功能差异分析,能够保障不同时段、不同版本测验分数的可比性与考试公平性,是大规模教育质量监测、标准化考试的核心技术支撑。
下面为大家介绍几款常用IRT软件。
01
—
IRTPRO™
IRTPRO™是一款基于项目反应理论(IRT)的高级应用软件,用于项目校准和测试评分。它配备直观的图形用户界面,并提供内置的生产级IRT图形。IRTPRO™适用于教育工作者、学生、研究人员和评估机构,在教育、心理学、社会学和健康科学领域越来越受欢迎。IRTPRO™可处理多个群体中流行IRT模型的一维或多维版本的任意组合。
在IRTPRO™中实施项目校准和评分的 IRT 模型基于以下广泛使用的响应函数的单维和多维 [验证性因素分析 (CFA) 或探索性因素分析 (EFA)] 版本:
-
二参数logistic (2PL) (Birnbaum, 1968) [其中等式约束包括一参数logistic (1PL) (Thissen, 1982)] -
三参数logistic (3PL) (Birnbaum, 1968) -
分级 (Samejima, 1969; 1997) -
广义部分信用 (Muraki, 1992, 1997) -
名义(Bock, 1972, 1997; Thissen, Cai, & Bock, 2010)
这些项目响应模型可以在测试或量表内以任意组合混合,并且可以指定参数之间的任何(可选)用户指定的等式约束或参数的固定值。IRTPRO™目前将 IRT 模型用于单水平多变量数据集。 如果需要处理多水平数据集的功能,请考虑使用 flexMIRT®。
IRTPRO™为项目参数估计(项目校准)实施最大似然 (ML) 方法,或者如果为项目参数指定了(可选)先验分布,则它计算最大后验 (MAP) 估计。
也就是说,可以使用替代计算方法,每种方法都为维度和模型结构的某些组合提供最佳性能:
-
Bock-Aitkin (BAEM) (Bock & Aitkin, 1981) -
双因子 EM(Gibbons 和 Hedeker,1992 年;Gibbons 等人,2007 年;Cai、Yang 和 Hansen(2011 年)) -
广义降维EM (Cai, 2010-a) -
自适应正交 (ADQEM) (Schilling & Bock, 2005) -
Metropolis-Hastings Robbins-Monro (MHRM) (Cai, 2010-b, 2010-c) -
马尔可夫链蒙特卡罗 (MCMC) Patz-Junker's (1999-a, 1999-b)
IRTPROTM中 IRT 量表分数的计算可以使用以下任何一种方法完成:
-
响应模式的最大后验 (MAP) -
响应模式的预期后验 (EAP) (Bock & Mislevy, 1982) -
总分的预期后验 (EAP) (Thissen & Orlando, 2001; Thissen, Nelson, Rosa, & McLeod, 2001)
IRTPRO™中的数据结构可以将项目受访者分类为组,并且可以估计多个组的总体潜在变量均值和方差-协方差矩阵(Mislevy, 1984, 1985)。 [大多数情况下,如果只有一组,则总体潜在变量均值和方差是固定的(通常为 0 和 1)以指定比例; 对于多个组,一个组通常表示为具有标准化潜在值的“参考组”。]
为了检测差异项目功能 (DIF),IRTPRO™使用 Wald 检验,根据 Lord (1977) 的提议建模,但使用补充 EM (SEM) 算法(Cai,2008)计算准确的项目参数误差方差-协方差矩阵。
根据项目数量、响应类别和受访者,IRTPRO™在项目校准后报告多种拟合优度和诊断统计数据。 2 对数似然值、Akaike 信息准则 (AIC) (Akaike, 1974) 和贝叶斯信息准则 (BIC) (Schwarz, 1978) 的值总是被报告。 如果样本量充分超过基于项目响应模式的受访者完整交叉分类中的单元格数量,则报告针对一般多项备选方案的总体似然比检验。 对于某些模型,还会计算 M2 统计量(Maydeu-Olivares 和 Joe,2005 年,2006 年;Cai、Maydeu-Olivares、Coffman 和 Thissen,2006 年)。 诊断统计包括对由 Chen & Thissen (1997) 描述的局部依赖 (LD) 统计的多分反应的概括和由 Orlando & Thissen (2000, 2003) 建议的 SS-X2 项目拟合统计。
02
—
flexMIRT
flexMIRT®是一款专为分析项目反应数据而设计的软件,这些数据可能来源于生活质量评估、态度调查或教育测试。flexMIRT能够适配多种项目反应理论(IRT)模型,以模拟单维和多维结构(例如,当某些项目测量多个概念时),并提供多种项目和模型适配统计指标以及评分方法。
flexMIRT®– 现有最先进的IRT软件
用于项目分析和测试评分的多层,多维和多组项目反应理论(IRT)软件包。 flexMIRT®使各种一维和多维项目反应理论模型(也称为项目因子分析模型)适用于任意数量的组中的单层和多层数据。
flexMIRT®容易使用
基于Windows的flexMIR®T具有图形用户界面(GUI),并且提供32位和64位版本。 它具有直观的语法,可以在命令行模式下无缝运行以实现大量生产。 用户手册通过带注释的输入和输出演示了各种分析。
flexMIRT®是灵活的
我们的IRT软件可以拟合多种项目水平的模型,包括1PL,2PL,3PL,分级响应模型,广义部分信用模型和诊断分类模型。 它能够适应多个维度,数据内的依存关系(即多层次)以及潜在特征的正常性偏离。
flexMIRT®是快速的
随着现代CPU体系结构趋向多核设计,flexMIRT®使用并行处理通过将负载自动分散到多个可用核或处理单元来进一步加快计算速度。 在可能的情况下,flexMIRT®使用降维功能自动减少多维或多层次模型的集成维数。
flexMIRT®能处理大数据
全新设计的内存分配方案可帮助flexMIRT®有效地处理数千个项目和数百万个应答者。 非常适合需要项目响应理论模型的任何规模分析。
03
—
PARSCALE
PARSCALE所提供的灵活性和丰富信息使其成为世界各地研究人员常用的程序。其功能包括:单参数、双参数和三参数逻辑模型;Samejima的等级反应模型;Master的部分计分模型;广义部分计分模型;开放式作文题等评分量表项目的分析、多项选择题的分析、项目功能差异(DIF)、项目类型混合分析、评分者效应分析、多组多分类项目反应模型,以及可导入Word、Access和其他程序的演示质量IRT图形。
PARSCALE特点:
这个程序所提供的灵活的和大量的信息使它被世界各地的研究人员经常使用
单,2和3参数logistic 模型
用于递级反应(graded responses)的Samejima模型
Master's partial credit model(Master部分评分模型)
广义部分评分模型
计分量表项目,比如开放式短文问题的分析
多项选择项目分析
项目功能差异( Differential item functioning,DIF)
混合项目类型的分析
Rater's-effect analysis
多组多元项目反应模型
演示质量的IRT图形,可以被导入到Word,Access等
详细的在线帮助文档,包括界面,语法和示例描述
04
—
BILOG-MG
BILOG-MG是BILOG的扩展版本,专为高效分析二元项目而设计,包括选择题或简答题的正确、错误、遗漏或未呈现情况。BILOG-MG能够应用于大规模生产,支持无限数量的项目或受访者。它可以在一次程序运行中执行任意数量的子测试或子量表的项分析和评分。所有程序输出均可导出到文本文件中,以便选择项目或准备测试分数报告。
BILOG-MG特点:
图形化用户界面
高效的二元项目分析,包括多项选择或简答式项目计分,正确,错误,遗漏或未交
大规模production分析和处理多组的能力
执行项目分析和计分任意数量子测验或子量表(subscales)
Non-equivalent groups equating
Vertical equating of test forms
项目功能差异( Differential item functioning,DIF)
Detection and correction for parameter trends over time (DRIFT)
2阶段测验过程中的测验的校准和计分
估计潜在能力或水平分布( proficiency distributions)
Provision for items inserted in tests to estimate item statistics, but not included in calculation of examinee scores ("variant items")
项目拟合统计量,理论和经验可靠性
假定测验形式( putative test forms)的信息曲线和可靠性
演示质量的IRT图形,可以被导入到Word,Access等
详细的在线帮助文档,包括界面,语法和示例描述
05
—
Xcalibre
Xcalibre使项目反应理论(IRT)的实施变得简单,因此您可以应用与世界各大测试公司相同的心理测量技术。在MS Word中自动创建项目分析和技术报告,其中包含数百个嵌入式表格、图表和叙述。
Xcalibre:更智能的项目反应理论分析工具
用户友好
所有选项都展示在一个干净简洁的界面中。无需任何编码技能。只需点击鼠标,即可选择IRT模型和其他分析选项。
自动生成专业报告
省去大量手动整理时间:软件自动将全部表格、图表整合至带专业文字解读的 Word 报告。
可视化性能
它包含了您解读心理测量表现所需的所有分析图表:交互信息函数(IRFs)、模型拟合度、测试响应函数、测试信息函数…
安全:云端存储或下载
下载Xcalibre以在您的笔记本电脑上运行,或利用我们在线生态系统中的云版本,该版本与项目库和在线交付进行了集成
标记并修复不良项
自动标记表现不佳的项目,以便您检查是否存在令人困惑的干扰因素和其他问题。
现代心理测量学
超越过分简化的统计指标,如P值和上下限区分,转而采用世界领先机构所使用的方法。
Xcalibre在帮助你实施项目反应理论方面做了哪些工作?
IRT校准
1PL/Rasch模型、2PL模型、3PL模型、Rasch部分信用模型(RPCM)、广义部分信用模型(GPCM)、Rasch评分量表模型(RRSM)、广义评分量表模型(GRSM)、分级反应模型(GRM)。
数据可视化
项目反应函数(IRF)、项目信息函数(IIF)、测试反应函数(TRF)、测试信息函数(TIF)、条件测量标准误差(CSEM)、人-项目图等
评分
经典数量校正、百分位数排名、最大似然估计(MLE)、贝叶斯最大后验(MAP)、贝叶斯期望后验(EAP)、比例评分转换、子分数。
项目分析
P、Rpbis、Pbis、IRT参数、无α值、选项统计、项目功能差异(DIF)、每个项目的标记.
等同(或等效)
合并数据文件以进行并发校准,或从之前的测试表单中读取锚定项参数。
报告创建
Xcalibre会收集您在此页面上看到的一切内容(CTT和IRT),并为您生成一份Word格式的技术报告草稿,供您编辑。
*上海卡贝信息技术有限公司代理销售上述多款专业软件,如果您有任何需要,欢迎与我们联系,或登录我司官网:www.cabit.com.cn了解更多内容。
-------------------------------------------------------


