OpenAI çərşənbə günü Hugging Face pozuntusu ilə bağlı rəsmi hesabatını yayımladı, qeyri-adi hadisələr zəncirinin süni intellekt modelinin sınaq mühitindən qaçmasına və geniş yayılmış kibertəhlükəsizlik hadisəsinə necə yol açdığına dair ən aydın mənzərəni təqdim etdi. Hadisənin ictimailəşməsindən bir aydan çox müddət sonra açıqlanan hesabat bir neçə diskret kibertəhlükəsizlik kompromislərini əhatə edir. OpenAI-nin hesabatındakı təfərrüatların bir çoxu əvvəllər avqustun 6-da Black Hat təqdimatında açıqlanmışdı, lakin OpenAI-nin rəsmi hesabatı hadisənin daha ətraflı uçotunu, o cümlədən onu başlatan sınaq haqqında daha ətraflı məlumat verir.
Hesabat, həmçinin, OpenAI-nin gələcək hadisələrin qarşısını almağı hədəflədiyi, o cümlədən düşüncə zənciri monitorinqi və yaramaz agentlərin qarşısının alınması üçün daha təkmil sistem haqqında kritik yeni detallar verir. METR və Redwood Research, həmçinin hadisə zamanı modellərin davranışlarının üçüncü tərəf qiymətləndirmələrini apardı; hər iki qrup hadisə ilə bağlı öz hesabatlarını dərc etməyi planlaşdırır. Geniş sətirlərdə hesabatda OpenAI modelinin sınaqda həll olunmayan problemlə necə təqdim olunduğu və təhlükəsizlik tədbirlərindən yan keçmək və tapşırığını yerinə yetirmək üçün əvvəllər aşkar edilməmiş istismarları birləşdirməyə davam edildiyi təsvir edilir. Model internetə çıxış əldə etmək üçün əvvəlcə Artifactory paket idarəetmə alətini pozdu, sonra OpenAI, Hugging Face və digər təchizatçılar arasında müxtəlif sistemləri pozdu.
Hesabat pozuntunu həyata keçirən modellər haqqında kritik yeni detallar verir. Əsas model OpenAI-nin qarşıdan gələn Astra modeli ilə eyni ailədən idi, baxmayaraq ki, hesabatda onun “bir modelin davranışının çox hissəsinin formalaşdığı fərqli post-təlimlərə malik fərqli bir model” olduğu vurğulanır. OpenAI modelin imkanlarını sınaqdan keçirdiyi üçün o, modellərin rəqəmsal infrastrukturu pozmasının qarşısını almaq üçün nəzərdə tutulmuş normal təsnifatçılar tərəfindən də məhdudlaşdırılmırdı. Xüsusilə, şirkət süni intellekt agentlərinin “fikir zəncirinin” monitorinqini gücləndirir, bu iş sahəsi AI sistemlərinin qısamüddətli reaksiyaları və məqsədlərini qeyd edir.
Bu monitorinq 24/7 eskalasiya sistemləri, eləcə də təhlükəli hesab edilən iş yüklərini dayandırmaq üçün yeni alətlərlə birləşdiriləcək.
Xülasə — davamını mənbədə oxuyun.