Anthropic, Perşembe günü yayımladığı yeni raporda, Çin merkezli yapay zeka şirketleri tarafından gerçekleştirilen sürekli distilasyon saldırılarını ele aldı.
Artan rekabetle birlikte saldırılar yoğunlaştı
Son aylarda bu saldırıların arttığını belirten rapor, “Son birkaç ayda, yetkisiz laboratuvarlar savunmalarımızı aşmak ve ABD'nin öncü modellerinin yeteneklerini ele geçirmek için giderek daha karmaşık yöntemler geliştirdi” ifadesini içeriyor. Rapor, bu kampanyaların Claude’un en değerli yeteneklerine, özellikle de araç kullanma, programlama, veri analizi ve mantıksal akıl yürütme gibi yeteneklere odaklandığını vurguladı.
200 milyon saldırı kaydedildi
Anthropic, distilasyon saldırılarına dair 200 milyonun üzerinde etkileşim kaydettiğini, bunun beş ayrı kampanyaya atfedildiğini aktardı. Distilasyon saldırıları, bir modelin yanıtındaki düşünce zincirini çıkarmaya yönelik. Bu düşünce zinciri, ardından daha küçük bir modeli genel akıl yürütme yeteneği için eğitmekte kullanılabiliyor. Ancak, Anthropic genellikle modellerinin iç düşünce zincirini kullanıcılarla paylaşmıyor ve sadece “özet düşünme” blokları sunuyor.

