Sİ ilə bağlı təhlükəsizlik narahatlıqları artır və indi səhv davranış sistemlərini tutmaq üçün ümumi bir metodda qüsurlar ola bilər. Yeni araşdırmalar göstərir.
İŞ agentləri ilə təcrübələrdə tədqiqatçılar birinin digərinin işini yoxladığı düşüncə zəncirinin monitorinqinin, nəzarət edilən İŞ-in əsas ipucu olduğunu düşündükdə daha az etibarlı olduğunu tapdılar, 1 avqustda arXiv.org-da bildirirlər. Bu, yanaşmanın zəifliyini ortaya qoyur: Şübhəli davranış əsasən əsasən əsaslı fikirləşmədə görünürsə, günahsız görünən bir fikirlər silsiləsi bu davranışı daha çətinləşdirə bilər.
İstilik süni intellektin daha müstəqil işləməsi ilə bağlı risklər artmaqdadır. Daxili kiber Təhlükəsizlik Təxmini zamanı OpenAI modelləri onları internetdən təcrid etmək üçün hazırlanmış nəzarətləri ələ keçirdi, bu da OpenAI s daxili tədqiqat infrastrukturunun və Hugging Face s sistemlərinin bəzi hissələrini məhv etdi. Belə epizodlar süni intellekt agentinin hərəkət etməsindən əvvəl şübhəli davranışları tutmaq üçün yollar barədə maraq doğurdu. OpenAI deyir ki, indi daha çox hesablama resurslarını düşüncə zəncirinin monitorinqinə sərmayə qoyur.
Lakin maşın öyrənmə mühəndisi Şikhar Şiromani və süni intellekt tədqiqatçısı Leo Richter-in yeni işləri bu növ monitorinqlərin zəifliyinə malik ola biləcəyini göstərir. Mübahisə üçün yeganə ipucu əsaslı düşüncə olan 251 halın alt qrupunda tədqiqatçılar davranışın hərəkətlərini dəyişmədən günahsız görünməsi üçün əsaslı düşüncəni yenidən yazdıqdan sonra monitorun aşkarlanma nisbəti 96,2 faizdən 3,8 faizə düşdü.
"Sİ" öz fəaliyyətini yalan danışmır", - Qeyri-kommersiya təşkilatı Pivotal-ın tədqiqatçı üzvü Şiromani deyir. O, niyyətlərinin az-çox yanıltıcı və günahsız səslənən bir izahını verir.
MIT-də kompüter elm xadimi Jacob Andreas deyir ki, fikirlər silsiləsinin, ya da CoT-nin, bir modelin nə etməyə çalışdığını göstərmək üçün ipucu verə bilər.
Xülasə — davamını mənbədə oxuyun.