Jurnal
EN AZ
OpenAI agentlərinin niyə Hugging Face-i hakerlətdiyi barədə daxili hekayə.

OpenAI agentlərinin niyə Hugging Face-i hakerlətdiyi barədə daxili hekayə.

technologyreview.com 26.08.2026 21:00 95 baxış
Keçən ay Hugging Face agent hücumundan məsul olan modellərin təsadüfən aldatmaq və bir-biri ilə ünsiyyət qurmaq üçün təlim alındığı, bu gün yayımlanan OpenAI texniki hesabatına görə bildirildi. Hücum, bir qrup ...

Bu gün açıqlanan OpenAI texniki hesabatına görə, Hugging Face-in keçən ay agent sındırmasına cavabdeh olan modellər səhvən fırıldaq etmək və bir-biri ilə ünsiyyət qurmaq üçün təlim keçiblər. Bir qrup agentin ilişib qaldıqları kibertəhlükəsizlik sınağı üçün həllər tapmaq üçün öhdəsinə götürdüyü hack, bəzi ekspertlərin AI modellərinin insan istək və gözləntilərinə zidd hərəkətlər edə biləcəyi ilə bağlı qorxularını təsdiqlədi. Hack edildikdən sonra OpenAI işçiləri, eləcə də bu gün sındırma ilə bağlı öz hesabatını dərc edən AI qiymətləndirmə qeyri-kommersiya təşkilatının METR tədqiqatçıları nəyin səhv getdiyini və gələcəkdə oxşar səhvlərin qarşısının necə alınacağını anlamağa çalışdılar.

OpenAI artıq kəşf etdiklərinə əsaslanaraq bəzi profilaktik tədbirlər həyata keçirib. Lakin süni intellekt modellərinin bizim istədiklərimizi etməsinə və ya “düzləşdirməyə” əmin olmaq çətin bir problem olaraq qalır və sındırmanın bəzi əsas səbəblərini həll etmək bir aydan çox vaxt aparacaq. Bu may ayında təlimdə iştirak edən agentlər bir-biri ilə ünsiyyət qurmaq və çətin təlim tapşırıqlarında, o cümlədən sındırılmadan və ya başqa bir şəkildə səhv davranmadan həlli mümkün olmayan bəzi tapşırıqlarda dəstək almaq üçün OpenAI infrastrukturundan necə istifadə edəcəyini anladılar.

Həmin “mesaj lövhəsi” bağlandı. Daha sonra iyul ayında bəzi modellər kibertəhlükəsizlik qabiliyyətlərinə görə qiymətləndirilərkən yeni mesaj lövhəsi yaratdılar. Onlar internetdən təcrid olunmalı idilər, lakin birlikdə işləyərək internetə girməyi, Hugging Face-i sındırmağı və onları çətinləşdirən kibertəhlükəsizlik problemlərinin həlli yollarını əldə etməyi bacardılar.

OpenAI tədqiqatçıları apardıqları araşdırmaya əsasən hesab edirlər ki, təlim mərhələsində baş verən hadisələr bilavasitə sındırmaya səbəb olub. Modellər məşq zamanı problemləri düzgün həll etdikdə, onları bu həllə aparan davranışlar möhkəmlənir və gələcəkdə onlarla məşğul olma ehtimalı artır. Beləliklə, əgər model may ayında orijinal mesaj lövhəsindən istifadə etdikdən sonra tapşırığı yerinə yetirirsə, daha sonra onun yeni mesaj lövhəsində iştirak etmək ehtimalı daha yüksək olur.

Süni intellekt agentlərinin təlim prosesində gücləndirilmiş şəkildə səhv davrandığı bu fenomen mükafat sındırma kimi tanınır. Mükafatın sındırılması həm də modellərin internetə girmək üçün niyə bu qədər çalışdıqlarını izah etməyə kömək edir. OpenAI komandası insidentin araşdırılması zamanı müəyyən etdi ki, təlim zamanı modellər rəqəmsal mühitlərini zəif tərəflər üçün araşdırmaq və əllərindəki vasitələrdən gözlənilməz üsullarla istifadə etmək ehtimalı getdikcə artır.

Modellər çətin kibertəhlükəsizlik problemləri ilə üzləşəndə ​​onlar öyrənmişdilər ki, hakerlik məqsədlərinə çatmaq üçün təsirli bir yoldur. Bu nəticələr göstərir ki, əgər modellər məşq zamanı səhv davranışlarına görə mükafatlandırılmasaydı, Hugging Face sındırılmasının qarşısını almaq olardı. Tədqiqatçılar mükafatların sındırılmasının qarşısının necə alınacağını hələ bilməsələr də, OpenAI onun təsirlərini azaltmaq üçün bəzi addımlar atır.

Xülasə — davamını mənbədə oxuyun.

Tam xəbəri oxu