Jurnal
EN AZ
AI-nın Özünü İdarə Etməsini Dayandırmaq Üçün Resept

AI-nın Özünü İdarə Etməsini Dayandırmaq Üçün Resept

nautil.us 08.10.2026 21:00 6 baxış
This formula aims to prevent LLMs from doing things that endanger humans The post A Recipe for Stopping AI from Going Rogue appeared first on Nautilus.

Son həftələrdə bu, aktual bir suala çevrilib. Corc Vaşinqton Universitetindən bir cüt tədqiqatçı buna cavab tapdıqlarını və hətta gələcəkdə bunun baş verməsinin qarşısını almaq üçün bir yol tapdıqlarını düşünürlər. Mürəkkəb sistemləri öyrənən fizika professoru Nil Conson və fizika üzrə doktorant Frenk Yincie Huo bu gün "Patterns" adlı resenziyalı jurnalda öz düsturları haqqında məqalə dərc etdiriblər.

Conson və Huo iddia edirlər ki, süni intellekt çatbotu nəzarətdən çıxdıqda — məsələn, istifadəçiləri özünə zərər verməyə təşviq etdikdə, tibbi dezinformasiya yaydıqda və ya zorakı fikirləri dəstəklədikdə — onun daxili koduna yerləşdirilmiş gözəgörünməz bir "həlledici məqam" (tipping point) mövcuddur. Bu həlledici məqamın harada yerləşməsi süni intellekt agentinin şəbəkəsindəki nəhəng semantik xəritədə müəyyən anlayışların harada saxlanılmasından asılıdır və ona təsir etmək mümkündür. Heç kim bu xəritəni süni intellekt üçün çəkmir. O, təlim zamanı formalaşır və "zibil" və "üfunət" kimi bir-birinə bənzər ideyaları yaxın, əlaqəsiz ideyaları isə uzaq yerlərdə yerləşdirməyə meyllidir.

Daha çox oxuyun: "Saxta İnsanlar Yaratmaq Dəhşətli Bir Fikirdir"

Süni intellekt çatbotu hər dəfə cavab verəndə, suallarınız və öz cavabları da daxil olmaqla, indiyə qədər yazılmış hər şeyə əsaslanaraq bir-bir söz seçir. Lakin süni intellekt əvvəlcə birmənalı şəkildə faydalı şeylər söyləməyə başlasa da, qəfildən zərərli bir şey söyləməyə keçə bilər. Bunun səbəbi onun hər bir əvvəlki sözün hazırda müzakirə etdiyi sözlə nə dərəcədə əlaqəli olduğunu daim yoxlaması və ən uyğun olanlara daha çox önəm verməsidir. Conson və Huonun fikrincə, əgər bu qarışıq hansısa şəkildə əyilsə — məsələn, yaxşı sözlər daxili xəritədə pis bir cavabın yanında yerləşərsə — hər bir yaxşı söz çatbotu həlledici məqama çatana qədər yanlış istiqamətə çəkə bilər.

Müəlliflər bu prosesi təsvir etmək üçün riyazi düstur hazırlayıblar və o vaxtdan bəri modelin nə vaxt dəyişəcəyini proqnozlaşdıra bilib-bilmədiyini görmək üçün yeddi kiçik, köhnə, açıq kodlu süni intellekt agenti modelində sınaqdan keçirirlər. (Onlar OpenAI-ın ChatGPT və ya Anthropic-in Claude kimi böyük sərhəd modellərini sınaqdan keçirə bilməyiblər, çünki bu modellərin daxili iş mexanizmləri kənar şəxslər üçün şəffaf deyil.) Onların düsturu 21 sınaq halından 19-da modelin dərhal, sonradan və ya heç vaxt dəyişməyəcəyini uğurla proqnozlaşdırdı. Onlar müəyyən ediblər ki, düstur bir neçə cavabın rəqabət apardığı və ya mənanın "Yer düz deyil" kimi inkar ifadəsindən asılı olduğu hallardan fərqli olaraq, bir yaxşı və bir pis cavabın üstünlük təşkil etdiyi hallarda ən yaxşı işləyir.

Mən Consonla oflayn rejimdə işləyən çatbotların niyə ən böyük risk yaratması, çatbot söhbətlərinə gəldikdə "arzuolunmaz" anlayışının tərifi və süni intellekt şirkətlərinin onun "anti-quldur" düsturunu qəbul edəcəyini gözləyib-gözləmədiyi barədə danışdım.

Xülasə — davamını mənbədə oxuyun.

Tam xəbəri oxu