Anthropic, Alibaba ve Moonshot AI'nın distilasyon saldırılarını açıkladı

Anthropic, Perşembe günü yayımladığı yeni raporda, Çin merkezli yapay zeka şirketleri tarafından gerçekleştirilen sürekli distilasyon saldırılarını ele aldı.

Artan rekabetle birlikte saldırılar yoğunlaştı

Son aylarda bu saldırıların arttığını belirten rapor, “Son birkaç ayda, yetkisiz laboratuvarlar savunmalarımızı aşmak ve ABD'nin öncü modellerinin yeteneklerini ele geçirmek için giderek daha karmaşık yöntemler geliştirdi” ifadesini içeriyor. Rapor, bu kampanyaların Claude’un en değerli yeteneklerine, özellikle de araç kullanma, programlama, veri analizi ve mantıksal akıl yürütme gibi yeteneklere odaklandığını vurguladı.

200 milyon saldırı kaydedildi

Anthropic, distilasyon saldırılarına dair 200 milyonun üzerinde etkileşim kaydettiğini, bunun beş ayrı kampanyaya atfedildiğini aktardı. Distilasyon saldırıları, bir modelin yanıtındaki düşünce zincirini çıkarmaya yönelik. Bu düşünce zinciri, ardından daha küçük bir modeli genel akıl yürütme yeteneği için eğitmekte kullanılabiliyor. Ancak, Anthropic genellikle modellerinin iç düşünce zincirini kullanıcılarla paylaşmıyor ve sadece “özet düşünme” blokları sunuyor.

Sitemizin daha işlevsel hale getirilmesi için yasal mevzuata uygun çerezler kullanılır. Fikrini Söyle’yi kullanarak bu çerezleri kabul etmiş olursunuz. Çerez kullanımına ilişkin detaylı bilgilere çerez politikamız'dan ulaşabilirsiniz.