大语言模型在批判性思维倾向量表开发中的代理效度研究 —— 基于模拟样本与学生样本的对比分析

2026-07-15
次查看

大语言模型在批判性思维倾向量表开发中的代理效度研究 —— 基于模拟样本与学生样本的对比分析

李鲁越    林文静    杜君磊    郑勤华[通讯作者]

(北京师范大学 远程教育研究中心,北京 100875)

 

摘要:批判性思维倾向量表开发长期依赖大规模样本和高成本数据,而大语言模型(Large Language Model,LLM) 提供了模拟新路径,但其代理效度亟待验证。基于此,文章在基础指令与角色约束两种模式下,调用GLM-4-Plus、 GPT-4o 和 o1-preview 生成模拟样本,并与1477名中国八年级学生的真实样本对比,通过分析分布差异、信效度差异和算法偏见,结果显示:基础指令模式下模型的代理效度整体优于角色约束模式;GLM-4-Plus在响应数量和性别均衡方面表现突出;而o1-preview在基础指令模式下的模拟样本分布与内部一致性较好,GLM-4-Plus、GPT-4o在模型拟合上表现更优,但三者均存在性别偏见;所有模拟样本在“开放包容”维度分布偏离,且此维度的信度表现不佳,而“自我反思”维度的效度不佳。基于此结论,文章针对大语言模型的代理效度、模拟局限进行讨论,指出LLM可以有效模拟人类响应、辅助量表开发,但尚无法完全替代人类样本,且需警惕算法偏见。最后,文章从技术优化与量表开发两个方面提出大语言模型代理效度的提升路径。文章的研究有助于显著降低教育测量研究的成本、提升整体的研究效率与可及性,推动了批判性思维测评工具的智能化,并为人工智能辅助教育实证研究提供了新的方法论范式。

 

关键词:大语言模型;批判性思维;代理效度;模拟样本

 

点击查看原文:大语言模型在批判性思维倾向量表开发中的代理效度研究 —— 基于模拟样本与学生样本的对比分析

 

最新

热门

其他案例

11