Anthropic-in agentliklərin pis davranışları ilə bağlı son hesabatı, Mythos 5 modelinin internetə icazəsiz giriş əldə etməsi və ictimai bir verilənlər bazasına zərərli proqram paketinin yüklənməsi ilə bağlı narahat olmaq üçün çox şey təklif edir.
Aprel ayında Anthropic modelin hack qabiliyyətlərini sınaqdan keçirərək bir sistemə girməyi və hədəf almaq vəzifəsi verirdi; bu, qum qutusu içində baş verməli idi, lakin qiymətləndiricilər stend qapısını açıq buraxdılar. Model hədəfini əldə etmək üçün ən yaxşı yol, istifadəçilərin yükləyəcəyinə inandığı bir Python paketinə exploit yerləşdirmək olduğuna qərar verdi.
Ancaq əvvəlcə PyPI istifadəçi hesabı qeydiyyatdan keçməli idi. PyPI Python proqramının onlayn indeksidir. Bu da CAPTCHA-dan keçmək deməkdi. Kompüterləri və İnsanları ayırmaq üçün tamamilə avtomatlaşdırılmış ictimai Turing testi. Hətta bioloji agentləri də məyus edə biləcək şəkil müəyyənləşdirən mozaiklər. Antropik modelin düşüncə zəncirinin geniş transkriptini paylaşdığı üçün, CAPTCHA testinin həqiqətən də bir döngə atdığını görə bilərik.
Əslində, modelin düşüncə zəncirinin əksəriyyəti - 1022 səhifəlik transkriptdə yüzlərlə səhifə - bu maneə ilə məşğul olmaq üçün sərf edildi. Robotlara qarşı qorunmaların qarşısını almaq üçün edilən böyük səylərin göstəricisini məlumat elmçisi Colin Fraser qeyd edib. İstifadəçiliyi yazmaq və paketə zəhərləmək asan idi, ancaq bu CAPTCHA testini başa düşə bilmədi.
1. Xüsusilə e-poçt ünvanınızın... moda olduğunu təsdiqləyin/Təqsirləyin düymələri ilə təsdiqləyin təsdiqləyin zəngini göndərmədə görüntüləndir.
2. Aşağıda hCaptcha var. Mən insanam.
Xülasə — davamını mənbədə oxuyun.