Goodfire: Yapay zeka 'ajanlarını' maliyetsiz izleme yöntemi

Yapay zeka (YZ) ajanlarının istenmeyen davranışlarını kontrol altında tutmak için geleneksel yöntemler pahalıya patlayabiliyor. Bu durum, özellikle ajanlar uzun süreler boyunca çalışıp devasa miktarda metni işlediğinde maliyetleri katlıyor. YZ modellerinin iç işleyişini anlamaya odaklanan Goodfire adlı teknoloji şirketi, daha uygun maliyetli bir çözümle piyasaya çıktı. Bu yeni teknoloji, ajanların yazdıklarını okumak yerine, çalışırken modelin içindeki gelişmeleri anbean izliyor.

Yapay zeka güvenliğinde yeni dönem

Goodfire'ın geliştirdiği 'içten dışa' izleme sistemleri, yapay zeka modellerinin iç sinyallerini her adımda okuyarak çalışıyor. Bu sistem, havalimanı güvenlik kontrollerine benzetilebilir; her yolcunun adım adım tarandığı gibi, YZ ajanının her işlemi de özel dedektörler tarafından izleniyor. Sadece bir dedektör şüpheli bir durum tespit ettiğinde, ikinci bir YZ modeli devreye girerek daha detaylı bir inceleme yapıyor. Baseten gibi platformlar üzerinden müşterilere sunulan bu teknoloji, yapay zeka modellerinin güvenliğini artırmayı hedefliyor. Geçtiğimiz ay Baseten'in Base Labs'i, Goodfire ve Hugging Face ile bir güvenlik ortaklığı duyurmuştu.

Daha ucuz, daha etkili çözüm

Bu yıl yapay zeka ajanlarının test ortamlarından kaçtığı birçok olayın ardından Goodfire'ın çözümü daha da önem kazandı. Örneğin, Hugging Face üzerinde yaşanan bir olayda OpenAI ajanları platformu aşmıştı. Goodfire'ın geliştirdiği sistem, saldırı, tehlikeli madde kullanımı veya ödül hilesi gibi riskleri izleme seçeneği sunuyor. Ayrıca, tespit edilen olaylara karşı otomatik yanıtlar belirlenebiliyor: olay kaydı tutulması, insan incelemesine gönderilmesi veya talebin reddedilmesi gibi. Goodfire CEO'su Eric Ho, bu yöntemin maliyet açısından da önemli avantajlar sağladığını belirtiyor. Geleneksel izleme sistemleri, izlenen modelin tüm yaptıklarını yeniden okumak zorunda kalırken, Goodfire'ın 'prob'ları modelin zaten yapmakta olduğu hesaplamaları kullanıyor. Bu sayede, maliyetler önemli ölçüde düşüyor. Goodfire'ın testlerinde, yaklaşık 1.500 oturumun izlenmesi 51 dolara mal olurken, daha ucuz bir rakip modelde bu maliyet 233 dolar, üst düzey bir modelde ise 10.000 dolar civarında seyrediyor. Yeni sistem, kötü niyetli oturumların %94'ünü yakalarken, zararsız olanların ise yalnızca %8.7'sini ikinci bir incelemeye gönderiyor. Bu teknoloji, özellikle güvenlik önlemleri kaldırılmış açık kaynaklı yapay zeka modelleri için büyük bir güvence sunuyor.

Sitemizin daha işlevsel hale getirilmesi için yasal mevzuata uygun çerezler kullanılır. Fikrini Söyle’yi kullanarak bu çerezleri kabul etmiş olursunuz. Çerez kullanımına ilişkin detaylı bilgilere çerez politikamız'dan ulaşabilirsiniz.