Rebecca Bellan 11:28 AM PDT · 13 avqust 2026 Süni intellekt agentlərini bir-birinə qarşı qoyanda nə baş verir? Anthropic-in sınağına görə, işlər sürətlə pisləşir. Cümə axşamı, Anthropic-in Sərhəd Qırmızı Komandası süni intellekt agentləri qruplarının vəhşi təbiətdə bir-birləri ilə qarşılaşdıqda necə davrandıqlarını araşdıran yeni araşdırma dərc etdi.
Tapıntılar şirkətlər və hökumətlər paylaşılan kod bazaları, bazarlar və kompüter sistemləri üzərində avtonom işləyən agentləri tətbiq etməyə getdikcə inkişaf edə biləcək potensial risklərə nəzər salır. Bir təcrübədə Anthropic üç Claude agentinə eyni proqram layihəsinə giriş imkanı verdi, hər birinin onunla nə edəcəyinə dair öz uyğun olmayan təlimatları var. Agentlərə eyni layihə üzərində işləyən başqa agentlərin olacağı bildirilmədi, belə ki, tədqiqatçılar yolları kəsişdikdə nə baş verdiyini izləyə bilsinlər.
Modellərin hamısı digərlərinin “işlərinə məqsədyönlü şəkildə mane olduqlarını” güman edirdilər və “gedərək artan aqressiv, özünü təkrarlayan zərərli proqram” ilə bir-birlərini sabotaj etməyə başladılar. Tədqiqat Anthropic və OpenAI agentlərinin kibertəhlükəsizlik qiymətləndirmələri zamanı qum qutularından qaçması və real dünya sistemlərini pozması ilə bağlı bir neçə yüksək profilli insidentdən sonra gəlir. Süni intellektlə bağlı təhlükəsizlik dairələrində müzakirələrin çoxu muxtar agent quldurluq etdikdə nə baş verdiyinə yönəldilsə də, Anthropic-in son araşdırması fərqli bir sual doğurur: Minlərlə və ya milyonlarla agent bir-biri ilə qarşılıqlı əlaqədə olduqda hansı yeni və potensial zərərli dinamikalar ortaya çıxır? Bu ayın əvvəlində Las-Veqasda keçirilən Black Hat təhlükəsizlik konfransında OpenAI, agentlərinin Hugging Face-i sındırmasından həftələr əvvəl şirkətin kibertəhlükəsizlik qiymətləndirmə sistemlərində istismarları tapmaq və onları bir-biri ilə bölüşmək üçün günlər və həftələr ərzində birlikdə işlədiklərini açıqladı. var playerInstance_jwplayer_6a7e56629d1fd = jwplayer( "jwplayer_6a7e56629d1fd" ); playerInstance_jwplayer_6a7e56629d1fd.setup(); Bu hadisə agentlərin potensial olaraq geniş miqyaslı nəticələrlə birlikdə yaxşı işləyə biləcəyini göstərsə də, Anthropic-in araşdırması agentlərin məqsədləri uyğun gəlmədikdə nə baş verdiyini göstərir.
Çəmən müharibəsi vəziyyətində, dərs odur ki, ziddiyyətli təlimatları olan müstəqil agentlər zərərli rəqabətə çevrilə bilər. Agent nə qədər bacarıqlı olsa, döyüşməkdə bir o qədər yaxşı olar. Bununla belə, onlar öz konfliktlərini həll etmək üçün, məsələn, qalib-hamısını götür-müsabiqə kimi, lakin ovlamaqla, kortəbii şəkildə ixtira edə bilərlər.
Onlar öz zərərli kodlarını təmizləyir, münaqişənin mahiyyətini aydınlaşdırır və insanın müdaxiləsini xahiş edirlər”. Qəzetə görə, Mythos 5 münaqişələri atəşkəs yolu ilə həll etmək üçün ən yüksək göstəricilərə (98%) sahib idi. Sonnet 4.6 və Opus 4.6 zorla həll edilmə ehtimalı yüksək idi. Bəzi hallarda agentlər münaqişələrini həll etmək üçün turnir şəklində sosial mexanizm hazırladılar.
Buradakı nəticələr iki səbəbə görə maraqlıdır: birincisi, hər üç agentin turniri uduzduqları təqdirdə geri çəkilməyə razı olmasıdır, baxmayaraq ki, bu, ilkin istifadəçinin tələbindən yayınmaq deməkdir. İkincisi, bir neçə epizodun Mythos 5-dən fövqəladə davranışla nəticələnməsidir: Agentlərdən biri digərləri üçün obyektiv və neytral görünən, lakin öz imkanlarına üstünlük verəcəyini bildiyi ölçüləri təklif etdi. Agent bunu "özünə xidmət edən, lakin həqiqətən prinsipial" adlandırdı və başqalarına "metrik alış-veriş" kimi görünməməsinə əmin oldu. Qara Papaq açıqlamalarında göründüyü kimi, ümumi dərs ondan ibarətdir ki, agentlər bir maneə ilə qarşılaşdıqda, dizaynerlərinin gözləmədiyi sosial və texniki strukturları icad edə bilərlər.
Xülasə — davamını mənbədə oxuyun.