在测量设计负担的异质性上,汇总的可靠性估计可能会模糊不清,因此单一的 G-或 D-研究可能会错误地表征设计在特定层次的适用性。本文提出了一种包含三个组成部分的条件通用性框架。首先,将自动评分配置(包括编码器架构和在固定管道内可接受的评分头系列)视为一个可接受测量条件的宇宙,而不是偶然的建模选择。其次,将分析性 D-研究投影与有限评分池的经验配置扫描进行比较,得出两个设计适用性的估计量,其一致性或差异可诊断实现的配置宇宙。第三,证据基于熵定义的响应层次进行条件化,熵被视为一个操作性分层变量,而不是关于写作质量的构念声明。尽管最近的通用性理论扩展关注于响应侧的 AI 生成项目变体,但该框架解决了类似的评分侧问题:AI介导的评分配置。通过对限时的 L2 写作进行的自动作文评分展示,实际设计在总体上是可靠的(Phi 约为 0.76)。在熵层次内重新估计后,可靠性保持较高,但稳步下降(Phi = 0.88, 0.87, 0.84)——这一梯度暗示不同的决策研究要求,其中熵最高的层次需要最复杂的条件交叉。该框架提供了一种可移植的工作流程,用于评估非均匀的可靠性。
博主点评: 该研究提出了一种创新的框架,解决了传统评分方法在异质性测量设计下的局限,尤其是在自动化作文评分中应用的有效性。通过分析性与经验性的结合,提供了更为细致的可靠性评估,具有广泛的应用潜力和实用价值。其对熵的使用为未来研究提供了新的视角,值得深入探讨。