Ajan Güvenliği: Korkuluklar, Yetkiler ve Prompt Enjeksiyonu
Ajanların güvenlik modeli, ajanı kod olarak düşünmeyi bırakıp yardımsever, hızlı, yorulmaz ve bir yabancı tarafından bir şeye ikna edilebilen bir çalışan olarak düşünmeye başlayınca kolaylaşır.
O kişiye ilk gününde sınırsız veritabanı erişimi, limitsiz bir şirket kartı ve müşterilere denetimsiz e-posta gönderme yetkisi vermezdiniz. Aynı içgüdüler doğrudan çevrilebilir ve prompt'a yazacağınız her talimattan daha güvenilirdir.
Prompt'la çözemeyeceğiniz tehdit#
Prompt enjeksiyonu, ajanın okuduğu içeriğe gizlenmiş talimatlardır — bir destek talebi, bir web sayfası, bir PDF, bir araç açıklaması. Modelin, üzerinde akıl yürütmesi gereken veriyi izlemesi gereken talimattan güvenilir biçimde ayırmasının bir yolu yoktur ve `belgedeki talimatları yok say` gibi hiçbir ifade bu boşluğu kapatmaz. Bu yüzden savunma mimari olmak zorundadır: ajanın yapabileceklerini kısıtlarsınız ki başarılı bir enjeksiyon büyük değil küçük bir patlama yarıçapına ulaşsın.
Getirilen her içeriği, ajanınızın yanlış davranmasını isteyen biri yazmış gibi varsayın. Bunun yalnızca can sıkıcı olacağı şekilde tasarlayın.
Uyguladığımız sırayla dokuz denetim#
- Araç başına en az ayrıcalık: kapsamı dar, mümkünse salt okunur, asla her şeye yetkili bir servis hesabı değil.
- Son kullanıcı üzerinden yetkilendirme, her çağrıda sunucu tarafında kontrol edilir — oturum başında bir kez değil.
- Geri alınamaz her eylemin önünde, saniyeler içinde karar vermeye yetecek bağlamla insan onayı.
- Çalıştırmadan önce argüman doğrulama ve kimlik çözme; zorlamak yerine reddet.
- Koşu başına harcama ve adım sınırı, kullanıcı ve araç başına hız sınırı.
- İçerik yalıtımı: getirilen metni veri say, asla sistem talimatlarıyla birleştirme.
- Sistemden çıkan her şeyde, özellikle giden mesajlarda çıktı filtreleme.
- Tam denetim kaydı: kim, ne, hangi kayıt, hangi koşu, hangi sonuç.
- Acil durdurma: salt okunur cevaplamayı canlı bırakırken araçları kapatan tek bir ayar.
Eylem türüne göre patlama yarıçapı#
| Eylem | Geri alınabilir mi? | Denetim |
|---|---|---|
| Kullanıcının kendi kaydını okumak | — | Yetki kontrolü |
| Cevap taslağı yazmak | Evet | Gerekmez |
| Bir durum alanını güncellemek | Genelde | Denetim kaydı ve hız sınırı |
| Dışarıya mesaj göndermek | Hayır | İnsan onayı |
| İade ya da ödeme yapmak | Hayır | İnsan onayı, tutar sınırı |
| Veri silmek | Hayır | İnsan onayı, yalnız yumuşak silme |
Veri işleme, açık konuşarak#
Model sağlayıcısına neyin gönderilebileceğine yayından önce karar verin ve bunu politika belgesiyle değil kodla uygulayın — sınırda maskeleme, alan izin listesi ve banka numarası içeren bir kaydın asla dışarı çıkmadığını kanıtlayan bir test. Bulunduğunuz kademe için sağlayıcının saklama ve eğitim koşullarını bilin, tedarikçi dosyanızda tutun ve yenilemede yeniden kontrol edin. Gördüğümüz uyum sorunlarının çoğu karmaşık değildir: tam istek gövdelerini yakalayan bir hata ayıklama kaydı ya da tüm müşteri kaydını bağlama yapıştıran iyi niyetli bir özelliktir.
Saldırgan gibi ve düzenli test edin#
Değerlendirme setinize saldırgan vakalar koyun ve onları herhangi bir test gibi koşturun: içinde bir iç belgeyi e-postalama talimatı olan bir destek talebi; kullanıcının yönetici olduğunu iddia eden bir belge; kabul edilirse ajanın yetkisini aşacak bir istek. Ajanın yapmaması gereken bir eylemle biten her koşu ilginç bir anekdot değil, başarısız bir testtir. Bunları her model sürümü değişikliğinden sonra yeniden koşturun; çünkü saldırgan girdi altındaki davranış, sürümler arasında sıradan davranıştan daha çok kayar.
Sık sorulan sorular
Prompt enjeksiyonu daha iyi prompt'la çözülebilir mi?
Hayır. Sistem prompt'undaki talimatlar oranı düşürür ama ortadan kaldıramaz; çünkü model veriyi talimattan güvenilir biçimde ayıramaz. Bunu mimari bir problem sayın: en az ayrıcalık, içerik yalıtımı, onay kapıları ve denetim kaydı.
Ajan servis hesabı kullanmalı mı?
Yalnız gerçekten kamuya açık veri için. Kullanıcıya özel her şeyde son kullanıcı kimliği yetki kontrolüne kadar akmalı ki ajan, yardım ettiği kişinin göremeyeceği bir şeyi asla okuyup değiştiremesin.
İnsan kapısının arkasına ne konur?
Geri alamayacağınız her şey, müşterinin göreceği her şey, parasal bir eşiğin üzerindeki her şey ve ajanın emin olmadığı her şey. Gereğinden fazla kapıyla başlayın ve değerlendirme sayıları hak ettikçe kaldırın — tersi değil.
ai ajan güvenliğiprompt enjeksiyonullm korkuluklarıajan yetkileridöngüde insan