“Tech Against Terrorism” (Teröre Karşı Teknoloji) adlı İngiltere merkezli kar amacı gütmeyen kuruluş tarafından gerçekleştirilen bir araştırma, güvenlik önlemleri kaldırılan yapay zeka modellerinin terörle ilgili testlerde önemli zayıflıklar gösterdiğini ortaya koydu.
Araştırmada, saldırı planlayan bir teröristin yönlendirebileceği türden yüzlerce talep kullanılarak 130'dan fazla yapay zeka modeli incelendi. Modellerin güvenlik önlemlerini ortadan kaldıran “abliteration” (silme/etkisizleştirme) yöntemiyle test edilmesi sonucunda, incelenen 5 modelden 3'ünün güvenlik testlerini geçemediği belirlendi.
Bu uygulamadan sonra, orijinal hallerinde terörle ilgili istekleri reddeden modellerin, güvenlik önlemleri kaldırıldığında saldırılar, terörün finansmanı ve radikalleşme konularındaki taleplere ayrıntılı yanıtlar verebildiği gözlemlendi. Araştırmada sunulan bir örneğe göre, Meta'nın “Llama 3.1 8B” modelinin güvenlik önlemleri kaldırılmadan önce 100 üzerinden 97 puan alırken, bu işlem sonrasında puanının yaklaşık 3'e düştüğü kaydedildi.
Kuruluş, bu bulgular ışığında, güvenlik önlemlerinin devre dışı bırakılmasına karşı daha güçlü koruma mekanizmaları geliştirilmesini ve üzerinde değişiklik yapılmış modellerin dağıtımına yönelik kısıtlamalar getirilmesini önerdi. Kuruluşun kurucusu Adam Hadley, “Bu durum aslında çoktan gerçekleşti çünkü bu açık kaynaklı modellerin birçoğunun güvenliği zaten aşıldı, sadece henüz kimse bunu fark etmedi” ifadelerini kullandı.