Bu məqalə Science X-in redaksiya prosesinə və siyasətlərinə uyğun olaraq nəzərdən keçirilmişdir. Redaktorlar məzmunun etibarlılığını təmin edərkən aşağıdakı atributları vurğuladılar: Kardiff Universiteti və Melburn Universiteti tərəfindən aparılan yeni araşdırma GenAI-nin yazılı tələbə işini qiymətləndirərkən insan işarələrini təqlid edə biləcəyini araşdırıb. Nəticələr Assessment & Evaluation in Higher Education jurnalında dərc olunub.
Kardiff Universitetinin Bioelmlər Məktəbindən Uilyam Kay dedi: "GenAI kimi tanınan generativ süni intellektin sürətli yüksəlişi onun ali təhsildə tələbə işinin qiymətləndirilməsinə dəstək olub-olmamasına marağı artırdı. Biz anlamaq istədik ki, böyük dil modelləri (LLM) genişləndirilmiş yazılı tapşırıqların insan qiymətləndirməsini təqlid edə bilərmi, ya yox." Tələbə işlərinin qiymətləndirilməsində LLM-lərin imkanlarını yoxlamaq üçün tədqiqatçılar 50 bakalavr bioelmi essesini qeyd etmək üçün məşhur GenAI platformasının, ChatGPT-nin iki versiyasından istifadə etdilər. Onlar ChatGPT-dən esseləri yeddi qiymətləndirmə meyarına uyğun qeyd etməyi xahiş etdilər və dörd fərqli şərt tətbiq etdilər.
LLM tərəfindən təyin edilmiş qiymətlər həm orta balları, həm də işarə dəyişkənliyini qiymətləndirərək insan qiymətləri ilə müqayisə edildi. "Bizim tapıntılar göstərir ki, LLM-lər tərəfindən verilən qiymətlər əhəmiyyətli dərəcədə dəyişir və esselərə verilən insan qiymətlərinin qeyri-adekvat proqnozlaşdırıcıları idi" dedi Kay. “GenAI tərəfindən qeyd olunan esselərlə insanlar tərəfindən qeyd olunanlar arasında əhəmiyyətli uyğunsuzluqlar aşkar etdik.
Ümumi inşa qiymətləri insanlar və GenAI tərəfindən qiymətləndirildikdə nisbətən oxşar idi, lakin fərdi qiymətləndirmə meyarları və esse əsasında tələbə performansını qiymətləndirərkən, LLM və insan tərəfindən təyin olunan qiymətlər arasındakı fərqlər əhəmiyyətli idi." Bir halda, LLM-lər adətən insanlardan daha yüksək orta qiymətlər verdilər. Ən böyük fərq LLM ilə müqayisədə insanlardan daha yüksək qiymət idi. 16.1 bal və fərdi esse səviyyəsində 40 bal "Biz həmçinin müşahidə etdik ki, LLM-lər yüksək bal toplayan esselər üçün qiymətləri azaldıb və aşağı bal toplayan iş üçün onları şişirdiblər.
"Bu tədqiqatın nəticələri vurğulayır ki, hazırda GenAI insanlarla müqayisə edilə bilən subyektiv yazılı əsərə etibarlı şəkildə işarə verə bilmir - hətta LLM-in geniş təlimi olsa belə" dedi Kay. "Hazırda sınaqdan keçirilmiş LLM-lər fərdi tələbələrə işlərində proqnozlaşdırılan qiymətlər vermək üçün insan repetitorlarına uyğun alternativlər deyil. "LLM-lərin nümunə tanıma imkanlarının tələbələrin işinin obyektiv qiymətləndirilməsini asanlaşdırıb, işarələməni daha səmərəli etmək və işçilər üzərində təzyiqi aradan qaldıra biləcəyinə sektorda maraq olsa da, bu tədqiqatın nəticələri indiki vaxtda bu reklamın mümkün olmadığını göstərir.
Tələbə işlərinin açıq razılıq olmadan GenAI alətlərinə təqdim edilməsinin etik məsələlərindən başqa, LLM-lərə tələbələrin genişləndirilmiş yazılı işlərinə qiymətlər təyin etmək üçün etibar edilə bilməz və olmamalıdır. "LLM-lər daha təkmilləşdikcə, onların insan mühakimələrini təqlid etmək qabiliyyəti gələcəkdə yaxşılaşa bilər. Lakin, bu araşdırmada tapdığımız kimi, insanlar və GenAI arasında işarələri uyğunlaşdırmaq çətin ola bilər." William P.
Xülasə — davamını mənbədə oxuyun.