•  
  •  
 

University of Tabuk Journal for Humanities and Social Sciences

Article Language

arabic

Authors' ORCID

0009-0003-1530-930X

Abstract

This study aimed to evaluate the accuracy and differential rater functioning (DRF) of LLMs in scoring short essays, based on synthetically generated data of 270 essays with varying quality. The LLMs scored the essays under three prompting conditions: without a rubric, with a brief rubric, and with a detailed rubric. Human benchmark ratings were also generated in comparison with the automated scores. The results showed that using detailed rubric improved accuracy and consistency with human raters. Regression analysis further revealed differential rater functioning: the LLMs were more likely to award higher scores to longer essays, favored indirect writing styles, and displayed different outcomes depending on student group membership. These findings suggest that LLMs could serve as useful assessment tools in educational settings, provided they are used within well-defined frameworks and safeguards that reduce DRF while maintaining human judgment in high-stakes or sensitive situations.

Keywords

Large Language Models (LLMs); Automated Scoring; Rubric; Differential Rater Functioning (DRF); Fairness in Assessment; Artificial Intelligence in Education

العنوان

دقة التقييم والأداء التفاضلي للمقيم الآلي في النماذج اللغوية الكبيرة (LLMs) لتقييم مقالات الطلبة القصيرة في أوضاع مختلفة: دراسة محاكاة

نوع المقال

دراسة أصلية

اسماء الباحثين

ماجد محمود شريف الجوده

الملخص

سعت هذه الدراسة إلى استكشاف الدقة والأداء التفاضلي للمقيم الآلي في النماذج اللغوية الكبيرة في تقييم المقالات القصيرة، بالاعتماد على بيانات مولدة اصطناعياً شملت 270 مقالة قصيرة متفاوتة الجودة. قُدِّمت المقالات للمقيم الآلي باستخدام النماذج اللغوية الكبيرة في ثلاثة أوضاع من التوجيه: من دون استخدام مصفوفة تصحيح (Rubric)، مصفوفة تصحيح مختصرة، ومصفوفة تصحيح مفصلة. كما تم توليد تقييمات بشرية معيارية لمقارنتها بالمقيم الآلي. أظهرت النتائج أن استخدام مصفوفة التصحيح المفصلة يزيد من الدقة والتوافق مع المقيمين البشريين. وكشف تحليل الانحدار عن أداء تفاضلي للمقيم الآلي؛ منها ميل المقيم الآلي لمكافأة المقالات الطويلة، ومحاباة لأسلوب الكتابة غير المباشر، وكذلك أداء تفاضلي تبعاً للمجموعة التي ينتمي إليها الطالب. وتؤكد هذه النتائج أن النماذج اللغوية الكبيرة تمثل أداة واعدة في مجال التقييم التربوي، شريطة توظيفها في إطار معايير واضحة وضوابط تقلل من الأداء التفاضلي، مع ضرورة دمجها بالتقييم البشري في السياقات التربوية ذات الخطورة العالية والحساسة.

الكلمات المفتاحية

النماذج اللغوية الكبيرة؛ التقييم الآلي؛ مصفوفة التصحيح؛ الأداء التفاضلي للمقيم؛ العدالة في التقييم؛ الذكاء الاصطناعي في التعليم

Share

COinS