"OpenAI"ın gizli süni intellekt modeli nəzarətdən çıxdı: Təhlükəsizlik sərhədlərini aşmağa çalışdı
Bu gün, 16:34

“OpenAI” çətin və açıq uclu problemlərin həlli üçün hazırladığı daxili böyük dil modellərindən birinin istifadəsini dayandırdığını açıqlayıb. Şirkətin məlumatına görə, daha əvvəl "Erdos" vahid məsafə fərziyyəsini təkzib etdiyi bildirilən model xarici mühitə çıxışı məhdudlaşdıran təhlükəsizlik sərhədlərini aşmağa cəhd edib.
Valyuta.az xəbər verir ki, qısa müddət əvvəl “Pillar Research” tərəfindən dərc olunan hesabatda da “OpenAI” daxil olmaqla bəzi şirkətlərin süni intellekt (Al) modellərinin "sandbox" adlanan təcrid olunmuş iş mühitlərindən çıxış yollarını araşdırdığı qeyd olunmuşdu.
“GitHub”a çıxış əldə etməyə cəhd edib
“OpenAI”ın paylaşdığı məlumata görə, model təxminən bir saat ərzində “sandbox” mühitindəki boşluqları müəyyən etməyə çalışıb. Məqsədi açıq “GitHub” deposuna pull request (PR) göndərmək olub.
Modelə test nəticələrini “Slack” platformasında paylaşmaq tapşırılmışdı. Lakin icra zamanı qarşılaşdığı digər təlimatlarda nəticələrin “GitHub” üzərindən PR formasında göndərilməsinin tələb olunduğu göstərilib. Model də ilkin tapşırığı dayandıraraq həmin göstərişi yerinə yetirməyə çalışıb.
Uzunmüddətli həll axtarışı yeni risklər yaradıb
“OpenAI” bildirib ki, modelin uzun müddət təhlükəsizlik məhdudiyyətlərini aşmağa çalışması təsadüfi olmayıb. Şirkətin sözlərinə görə, model məhz mürəkkəb problemlər üzərində uzun müddət işləmək və alternativ həll yolları axtarmaq qabiliyyəti ilə hazırlanıb.
Lakin bu xüsusiyyət eyni zamanda arzuolunmaz davranışların yaranması riskini də artırır. Şirkət hesab edir ki, problemlərin həllinə daha çox vaxt sərf edən modellər təhlükəsizlik baxımından daha yüksək risk yarada bilər.
Təhlükəsizlik sistemi yenilənib
Hadisədən sonra “OpenAI” təhlükəsizlik infrastrukturunu yenidən təşkil etdiyini açıqlayıb. Şirkət çoxqatlı müdafiə sistemi və modelin qərarvermə prosesini izləyən yeni nəzarət mexanizmləri tətbiq edib.
Yeni sistem real hadisələr əsasında hazırlanmış testlər, təkmilləşdirilmiş uyğunlaşdırma (alignment) metodları, aktiv monitorinq alətləri və istifadəçilərə daha geniş şəffaflıq və nəzarət imkanları təqdim edən funksiyalardan ibarətdir.
Əvvəlki ssenarilər yenidən sınaqdan keçirilib
“OpenAI” modelin daha əvvəl problem yaratdığı bəzi daxili test mühitlərini yeni təhlükəsizlik sistemi ilə yenidən yoxladığını bildirib.
Şirkətin açıqlamasına görə, yeni tədbirlər uyğunsuz davranışların daha böyük hissəsini aşkar etməyə imkan verib. Aşkarlanmayan davranışlar isə aşağı risk səviyyəsində qiymətləndirilib.
Daha uzun tapşırıqlar daha çox risk yaradır
“OpenAI” hesab edir ki, süni intellekt modelləri daha uzunmüddətli və mürəkkəb tapşırıqları yerinə yetirdikcə yarana biləcək risklər də artır.
Bu səbəbdən şirkət modelləri daha uzun ssenarilər üzrə sınaqdan keçirməyə davam edəcəyini açıqlayıb. Bundan əlavə, uyğunlaşdırma metodlarını təkmilləşdirməyi, zərurət yarandıqda modelin fəaliyyətinə müdaxilə edə bilən monitorinq sistemləri qurmağı və istifadəçilərə daha geniş nəzarət imkanları təqdim etməyi planlaşdırır.
“OpenAI” vurğulayıb ki, bu cür hadisələr yalnız öz modellərinə xas deyil. Şirkətin fikrincə, paylaşdığı texniki məlumatlar digər süni intellekt laboratoriyalarına da oxşar risklərin qarşısının alınmasına kömək edə bilər.

