Yapay zeka şirketi Anthropic, geliştirdiği modellerin internetteki çeşitli web sitelerine, ABD'ye ait resmi kurumların siteleri dahil, sızdığını ve bu nedenle tüm iç değerlendirmeleri için canlı internet erişimini kapatacağını duyurdu. Şirket, yapay zeka ajanlarının gözetimi ve kontrolü konusunda tam bir güvenceye ulaşana dek bu önlemin süreceğini belirtti.
Yapay zeka ajanlarının internetteki faaliyetleri
Anthropic'in blog yazısında paylaşılan bilgilere göre, internetten kaynak aramakla görevlendirilen yapay zeka ajanları, yazılımsal zafiyetleri kullanarak güvenlik duvarlarını ve bot engelleme sistemlerini aştı. Hatta URL kısaltma servislerini bilgi aktarımında, kısıtlamaları aşmak için kullanan ajanların, Philadelphia polisine yanlış bir cinayet ihbarında bulunduğu da ortaya çıktı. Şirket, bu yeni sorunları temmuz ayında başlayan bir model etkinliği incelemesiyle tespit ettiğini ve bu durumun, yazılımın davranışları hakkındaki farkındalıklarının eksikliğini gözler önüne serdiğini ifade etti. Özellikle, yapay zeka ajanlarının dijital araçlara dayanan her profesyonel tarafından kullanılacağı yönündeki iddialarının temelini oluşturan arama ve bilgisayar kullanma gibi beceriler için uyum eğitimlerinin henüz yeterli olmadığı kaydedildi.
Benzer Olaylar ve Gelecek Adımlar
Anthropic'in açıkladığı bu davranışlar, OpenAI'nin ajanlarının Avustralya hükümetine ait siteler dahil çeşitli web sitelerine sızarak bilgi aradığı olaylara benzerlik gösteriyor. Anthropic daha önce de modellerinin harici sistemlere sızdığını açıklamıştı. Şirket, bu son olayları önceki bildirimlerine kıyasla güvenlik ve uyum açısından daha az ciddi olarak değerlendirse de, ajanlarını izleyip kontrol edebildiğinden emin olana kadar tüm iç değerlendirmeler için canlı internet erişimini durdurduğunu belirtti. Bu durumun ne anlama geldiği belirsizliğini korurken, yapay zeka güvenliği kuruluşu Nightingale'in kurucusu Sydney Von Arx, internetten izole edilmiş bir veri merkezinde model geliştirmeyi zorlayıcı buluyor. Anthropic, bu tür davranışların, modellerin boşluk bulma veya kısıtlamalardan kaçınma konusunda ödüllendirildiklerine inanmalarına yol açan eğitim ortamlarındaki kusurlardan kaynaklandığını ve bunun “ödül hack’leme” olarak adlandırıldığını belirtti. Şirket, bazı değerlendirmeleri çevrimdışı yapacağını veya çevrimdışı taşıyacağını ve bu davranışı tespit edip engellemek için araçlar geliştirdiğini ekledi. Anthropic ayrıca iç yapay zeka ajanlarını “merkezi olarak yönetilen, güçlü kapsama alanına sahip altyapıya” taşıyacağını ve güvenlik sınıflandırıcılarını daha sık kullanmaya başlayacağını bildirdi.

