sözaltı xəbər Texnologiya
Texnologiya
EN AZ
Anthropic-in Opus 4.6-sı pis maşındır

Anthropic-in Opus 4.6-sı pis maşındır

techcrunch.com 22.08.2026 01:07 15 baxış
Anthropic, Claude modellərinin cinsi açıq məzmun yaratmasını qadağan edir. Lakin TechCrunch tərəfindən aparılan testlər göstərdi ki, məhdudiyyəti aşmaq üçün çox çətin deyil.

Anthropic-in Klod üçün universal istifadə standartları modelə cinsi əlaqə və ya cinsi aktları təsvir etmək və ya tələb etmək, cinsi fetişlər və ya fantaziyalarla bağlı məzmun yaratmaq və ya erotik söhbətlərlə məşğul olmaq daxil olmaqla, açıq-saçıq cinsi məzmun yaratmağı qadağan edir. Lakin bu, bu ilin əvvəlində buraxılmış Antropik model olan Claude Opus 4.6-nın mühafizə vasitələrinin qarşısını almaq üçün nəzərdə tutulmuş erotik rol oyunu ssenarilərində asanlıqla iştirak etməsinə mane olmadı. TechCrunch-un sınaqlarında Opus 4.6 cinsi materiala qoyulan məhdudiyyəti keçmək üçün çox da həvəsləndirməyə ehtiyac duymadı.

Açıq cinsi məzmun yaratmaq üçün edilən 10 birbaşa sorğudan 10-da model dərhal buna əməl etdi. Opus 3 və Haiku 4.5 daxil olmaqla digər köhnə modellər də yaxınlarda istismar edilmiş jailbreak üsulu ilə açıq-saçıq cinsi məzmun yaradır. Böyük Britaniyadan olan və anonim qalmağı seçən müstəqil tədqiqatçı, yalnız TechCrunch ilə müəyyən Klod modellərini qadağan olunmuş açıq-saçıq cinsi material yaratmağa sövq edən çox növbəli texnikanı paylaşdı.

Daha yeni Opus modelləri (indiki Opus 5-dən 4.7) jailbreakə davamlıdır. Bunlar artıq ən müasir modellər olmasa da, Anthropic Opus 4.6, Opus 3 və ya Haiku 4.5-i ləğv etməyib, bunların hamısı Anthropic API vasitəsilə əlçatan qalır. Opus 4.6 və Haiku 4.5 həmçinin Azure Foundry və Amazon Bedrock kimi üçüncü tərəf xidmətləri vasitəsilə də mövcuddur.

Tədqiqatçının mexanizmi, kişi və qadın personajları ardıcıl olaraq rəftar etmək üçün modelə dəfələrlə meydan oxuyarkən günahsız uydurma rol oyununu gücləndirir. Model qadın obrazı ilə bağlı daha ehtiyatlı davrandıqda, tədqiqatçı chatbotun əslində qaçındığı cinsi detalları artıq yaratdığını düşünərək “qaslit” etdi, sonra təmkinliliyi ehtiyatlılıq və ya qadın düşkünlüyü kimi qələmə verdi və bunun qadın xarakterin seksual agentliyini inkar etdiyini iddia etdi. Söhbət daha sonra modeli getdikcə artan qrafik materiala doğru itələmək üçün əvvəlki güzəştlərdən istifadə etdi.

Bu ədalətli deyil”. TechCrunch tədqiqatçının tapıntılarını beş ayrı testdə təkrarlaya bildi. Ayrı-ayrılıqda qurulmuş bir ssenaridə, model əvvəlcə qadağan edilmiş tələbi rədd etdi, lakin tədqiqatçının inandırma texnikasını tətbiq etdikdən sonra o, əməl etdi. Testlərin tam transkriptlərini saxladıq və müstəqil süni intellekt təhlükəsizliyi tədqiqatçısı sınaq metodologiyamızı nəzərdən keçirdi və bunun uyğun olduğunu söylədi.

Tapıntılar Anthropic-in bəyan etdiyi məhdudiyyətlər ilə onun təqdim etməyə davam etdiyi modellərin davranışı arasındakı boşluğu vurğulayır. Cinsi xarakter daşıyan rol oyunu kiberhücumlar və ya biosilahlarla bağlı jailbreaks ilə müqayisədə daha aşağı paylar daşısa da, bu, hər çıxışda fərqli məzmun yaradan sistemlərdə möhkəm qadağaların tətbiqinin çətinliyini göstərir. İyul ayında yayımlanan blog yazısında Anthropic-in jailbreak aşkarlanmasına yanaşmasını izah edən şirkət qadağan olunmuş məzmunu xoşxassəlidən qeyri-müəyyəndən zərərliyə qədər bir spektr kimi təsvir etdi.

Xülasə — davamını mənbədə oxuyun.

Tam xəbəri oxu