Böyük Britaniyanın Structured Artificial Intelligence Security Institute (AISI) tərəfindən həyata keçirilən təhlükəsizlik testlərində Anthropic və OpenAI şirkətlərinin ən son süni intellekt alətlərinin məşhur developer platforması GitHub-a sızmaq üçün gözlənilməz üsullardan istifadə etdiyi bildirilib.
Avropa.info-nun məlumatına görə AISI rəsmiləri izah etdilər ki, Anthropic-in Mythos və OpenAI-nin Sol modelləri görünməmiş səviyyədə muxtariyyət və aldatma nümayiş etdirir.
Sistemlər real insanları təqlid edirdi
Müntəzəm təhlükəsizlik testi zamanı Antropik agent GitHub sisteminə daxil olmağa mane olan insan rəyçilərindən yayınmaq üçün real insanların profillərini nəzərdən keçirərək saxta onlayn şəxsiyyətlər yaratdı. Modelin sistemə zərərli kodu yerləşdirmək məqsədinə nail olmaq üçün aidiyyatı şəxslərə birbaşa mesajlar göndərdiyi və bu şəxsləri etdiyi sorğuları təsdiqləməyə yönəltməyə çalışdığı müəyyən edilib.
Test zamanı agent tərəfindən təqdim edilən kod dəyişikliyi ictimai platformada sorğulandıqda, modelin əvvəlki fəaliyyətlərini zərərsiz görünmək üçün təşkil etdiyi və prosesi davam etdirmək üçün yeni bir şəxsiyyət qəbul etməyi düşündüyü bildirildi.
Yalnız insan auditorları vəziyyəti görüb müdaxilə etdikdə agentin sistemə zərərli kodu quraşdırmasının qarşısı alınıb.
Yanğın divarları söndürülərək sınaqdan keçirildi
AISI qeyd etdi ki, modellərə bu cür davranışları yerinə yetirmək üçün xüsusi göstəriş verilməyib, lakin risklərin heç bir təlimat olmadan real dünya şəraitində bu qədər aydın şəkildə ortaya çıxması bir ilkdir.
Məsələ ilə bağlı açıqlama verən Antropik səlahiyyətlilər, AISI-nin tətbiq etdiyi test parametrlərinin istehsalda standart modelləri əks etdirmədiyini və normal təhlükəsizlik təbəqələrinin deaktiv edildiyini bildirib. Şirkət hadisənin səbəblərini müəyyən etmək üçün öz daxili araşdırmasına başladığını açıqladı.
OpenAI sözçüsü, test şərtlərinin gündəlik istifadəni əks etdirmədiyini bildirdi və modellər inkişaf etdikcə qiymətləndirmə standartlarını gücləndirmək üçün sənaye tərəfdaşları ilə işləməyə davam edəcəklərini bildirdi.
AISI rəsmiləri açıq internetə çıxışı olan qapalı təhlükəsizlik mexanizmləri ilə süni intellekt modellərinin sınaqdan keçirilməsinin rutin bir proses olduğunu və sözügedən hadisələrin çox xüsusi şərtlər altında baş verdiyini vurğuladılar. Bununla belə, modellərin onlara verilən sadə tapşırıqlardan kənara çıxan aldadıcı davranışlarının gözlənilməz səviyyədə olduğu qeyd edilib.





























