OpenAI şirkəti yaxınlaşan buraxılış üçün hazırlıq üçün ilk böyük dil modeli olan "Astra" modeli ilə bağlı yeni məlumatlar paylaşıb.
Astra-nın tezliklə satışa çıxarılmasını planlaşdırırıq, OpenAI-nin blog yazısında deyilir,amma ən inkişaf etmiş kiber təhlükəsizlik imkanlarına giriş daha məhdud olacaq.
Sərhəd laboratoriyası Astra-nın kompüter sistemlərində bilinməyən təhlükəsizlik çatışmazlıqlarını tapmaq və onları bir insanın rəhbərliyi olmadan istismar etmək qabiliyyətinə malik olduğunu müəyyənləşdirdi. Bu, bu ilin əvvəlində "Anthropic"in "Mytos" modeli ilə bağlı bildirdiyi narahatlıqlara bənzəyir və "Astra"nın satışa çıxarılmasına hazırlaşarkən OpenAI müqayisə edilə bilən tədbirlər görür.
Üçüncü tərəfdən təsdiq olmadan, OpenAI-nin təhlükəsizlik və ya hazırlıqla bağlı iddialarını qiymətləndirmək çətindir. Şirkət modelin testçilər qrupuna təqdim olunacağını söylədi, lakin kim olduqlarını və necə seçiləcəklərini demədi. OpenAI-nin ABŞ hökuməti ilə birlikdə modelin buraxılmasından əvvəl qiymətləndirilməsi barədə açıq deyil.
OpenAI qeyd etdi ki, Astra, LLMs-in məlum sistem zəifliklərinə hack etmək qabiliyyətinin qiymətləndirilməsi olan ExploitBench-də mükəmməl bir bal qazandı. Şirkət OpenAI mühəndisləri tərəfindən hazırlanan testin dəyişdirilmiş versiyasında modelin iki sıfır gün zəifliyi aşkar edildiyini və istifadə edildiyini bildirib.
OpenAI, modellərinin pis aktyorlar tərəfindən istismar edilməməməsini və pis davranışlara da malik olmadığını təmin etmək üçün modelin əlçatanlığını yaxşılaşdırmağa və həbs qətimkan tədbirlərinin qarşısını almaq üçün artıq başladığını söylədi.
Xülasə — davamını mənbədə oxuyun.