OpenAI-nin yeni Astra modeli, əksər məntiq modellərinin xarakterizə etdiyi ardıcıl düşüncədən kənarda işləməyə imkan verən "Recurrent depth" adlı məntiq texnikasından istifadə edəcək. Bu texnika, opaque recurrence də adlandırılır, modelin düşüncə zəncirini izləmək daha çətinləşdirəcək və bu, süni intellekt təhlükəsizliyi mütəxəssislərinin narahatlığına səbəb olacaq.
Astra-nun bu texnikanın istifadəsi məhdud olduğu bildirilirsə də, onun ortaya çıxması hələ də süni intellekt təhlükəsizliyi mütəxəssisləri arasında əhəmiyyətli narahatlıq doğurdu.
"Astra'nın qeyri-aşkar təkrarlanma istifadə etdiyini bildirən xəbərlər məni çox narahat edir", - deyə Redwood-un baş direktoru Buck Shlegeris xəbərdən sonra yazdı. Astra-nın əvvəlki modellərdən daha az CoT-li nəzarət edilə biləcəyini bilmirəm. Lakin OpenAI bu texnikanı daha da irəli sürsə, təkrarlanmaların kütləvi şəkildə artırılması və CoT-nin monitorinq qabiliyyətini tamamilə məhv etmək imkanı olacaq.
Uzun müddətdir süni intellekt təhlükəsizliyinin müdafiəçisi Zvi Mowshowitz də bu məsələdə iştirak edib və süni intellekt laboratoriyaları arasında aşağıya doğru yarışın qarşısını almaq üçün qanunların lazım ola biləcəyini yazıb.
Teknik atəşlə oynayır, OpenAI və Anthropic-in mümkün qədər uzun müddət düşüncə zəncirinin sadiqliyini və izləmə qabiliyyətini qorumaq üçün çox çalışdığımızı təsdiq etmək üçün mübarizə apardıqları tabu riskini atır, Mowshowitz yazıb. Bu cür texnikaların daha intensiv istifadəsi, ehtimal ki, monitorinq qabiliyyətinə zərər verəcəkdir.
Normal şəraitdə, bir əsaslandırma modeli bir problemi həll etməyə çalışırkən model tərəfindən atılan ardıcıl addımları təqdim edir. Bu təmsil mükəmməl olmasa da, hələ də yanlış davranış və ya uyğunsuzluğu izləmək üçün dəyərli bir vasitə kimi xidmət edir. OpenAI-nin son vaxtlarki pis agent fəaliyyətində, zəncirlə bağlı məlumatlar agentlərin niyə bu cür davrandıqlarını izah etmək üçün vacib bir vasitə idi.
Xülasə — davamını mənbədə oxuyun.