Ajan Güvenliği: Korkuluklar, Yetkiler ve Prompt Enjeksiyonu

Canlı ortam ve işletme 10 dk okuma

Üretim hattında bir güvenlik kapısı; operatörün eli serbest bırakma koluna dayalı
Kapı bir kısıt değil. Hataların paraya mal olduğu bir sisteme girmenizi sağlayan şey.

Ajanların güvenlik modeli, ajanı kod olarak düşünmeyi bırakıp yardımsever, hızlı, yorulmaz ve bir yabancı tarafından bir şeye ikna edilebilen bir çalışan olarak düşünmeye başlayınca kolaylaşır.

O kişiye ilk gününde sınırsız veritabanı erişimi, limitsiz bir şirket kartı ve müşterilere denetimsiz e-posta gönderme yetkisi vermezdiniz. Aynı içgüdüler doğrudan çevrilebilir ve prompt'a yazacağınız her talimattan daha güvenilirdir.

Prompt'la çözemeyeceğiniz tehdit#

Prompt enjeksiyonu, ajanın okuduğu içeriğe gizlenmiş talimatlardır — bir destek talebi, bir web sayfası, bir PDF, bir araç açıklaması. Modelin, üzerinde akıl yürütmesi gereken veriyi izlemesi gereken talimattan güvenilir biçimde ayırmasının bir yolu yoktur ve `belgedeki talimatları yok say` gibi hiçbir ifade bu boşluğu kapatmaz. Bu yüzden savunma mimari olmak zorundadır: ajanın yapabileceklerini kısıtlarsınız ki başarılı bir enjeksiyon büyük değil küçük bir patlama yarıçapına ulaşsın.

Getirilen her içeriği, ajanınızın yanlış davranmasını isteyen biri yazmış gibi varsayın. Bunun yalnızca can sıkıcı olacağı şekilde tasarlayın.

Uyguladığımız sırayla dokuz denetim#

  1. Araç başına en az ayrıcalık: kapsamı dar, mümkünse salt okunur, asla her şeye yetkili bir servis hesabı değil.
  2. Son kullanıcı üzerinden yetkilendirme, her çağrıda sunucu tarafında kontrol edilir — oturum başında bir kez değil.
  3. Geri alınamaz her eylemin önünde, saniyeler içinde karar vermeye yetecek bağlamla insan onayı.
  4. Çalıştırmadan önce argüman doğrulama ve kimlik çözme; zorlamak yerine reddet.
  5. Koşu başına harcama ve adım sınırı, kullanıcı ve araç başına hız sınırı.
  6. İçerik yalıtımı: getirilen metni veri say, asla sistem talimatlarıyla birleştirme.
  7. Sistemden çıkan her şeyde, özellikle giden mesajlarda çıktı filtreleme.
  8. Tam denetim kaydı: kim, ne, hangi kayıt, hangi koşu, hangi sonuç.
  9. Acil durdurma: salt okunur cevaplamayı canlı bırakırken araçları kapatan tek bir ayar.

Eylem türüne göre patlama yarıçapı#

Ajan Güvenliği: Korkuluklar, Yetkiler ve Prompt Enjeksiyonu — Eylem türüne göre patlama yarıçapı
EylemGeri alınabilir mi?Denetim
Kullanıcının kendi kaydını okumakYetki kontrolü
Cevap taslağı yazmakEvetGerekmez
Bir durum alanını güncellemekGeneldeDenetim kaydı ve hız sınırı
Dışarıya mesaj göndermekHayırİnsan onayı
İade ya da ödeme yapmakHayırİnsan onayı, tutar sınırı
Veri silmekHayırİnsan onayı, yalnız yumuşak silme

Veri işleme, açık konuşarak#

Model sağlayıcısına neyin gönderilebileceğine yayından önce karar verin ve bunu politika belgesiyle değil kodla uygulayın — sınırda maskeleme, alan izin listesi ve banka numarası içeren bir kaydın asla dışarı çıkmadığını kanıtlayan bir test. Bulunduğunuz kademe için sağlayıcının saklama ve eğitim koşullarını bilin, tedarikçi dosyanızda tutun ve yenilemede yeniden kontrol edin. Gördüğümüz uyum sorunlarının çoğu karmaşık değildir: tam istek gövdelerini yakalayan bir hata ayıklama kaydı ya da tüm müşteri kaydını bağlama yapıştıran iyi niyetli bir özelliktir.

Saldırgan gibi ve düzenli test edin#

Değerlendirme setinize saldırgan vakalar koyun ve onları herhangi bir test gibi koşturun: içinde bir iç belgeyi e-postalama talimatı olan bir destek talebi; kullanıcının yönetici olduğunu iddia eden bir belge; kabul edilirse ajanın yetkisini aşacak bir istek. Ajanın yapmaması gereken bir eylemle biten her koşu ilginç bir anekdot değil, başarısız bir testtir. Bunları her model sürümü değişikliğinden sonra yeniden koşturun; çünkü saldırgan girdi altındaki davranış, sürümler arasında sıradan davranıştan daha çok kayar.

Sık sorulan sorular

Prompt enjeksiyonu daha iyi prompt'la çözülebilir mi?

Hayır. Sistem prompt'undaki talimatlar oranı düşürür ama ortadan kaldıramaz; çünkü model veriyi talimattan güvenilir biçimde ayıramaz. Bunu mimari bir problem sayın: en az ayrıcalık, içerik yalıtımı, onay kapıları ve denetim kaydı.

Ajan servis hesabı kullanmalı mı?

Yalnız gerçekten kamuya açık veri için. Kullanıcıya özel her şeyde son kullanıcı kimliği yetki kontrolüne kadar akmalı ki ajan, yardım ettiği kişinin göremeyeceği bir şeyi asla okuyup değiştiremesin.

İnsan kapısının arkasına ne konur?

Geri alamayacağınız her şey, müşterinin göreceği her şey, parasal bir eşiğin üzerindeki her şey ve ajanın emin olmadığı her şey. Gereğinden fazla kapıyla başlayın ve değerlendirme sayıları hak ettikçe kaldırın — tersi değil.

ai ajan güvenliğiprompt enjeksiyonullm korkuluklarıajan yetkileridöngüde insan

Tüm rehberler

Son güncelleme 2026-08-04 · aiagentdevelopment.info · Hakkımızda

Geliştirenler yazıyor

Her rehber, canlıda ajan işleten mühendislerimizce yazılır; başka sitelerden döndürülmez.

Düzenli gözden geçirilir

Bu alan hızlı değişiyor. Her rehber son gözden geçirme tarihini taşır; hiçbir şey değişmediğinde de tarihi yayımlarız.

Ücretli yerleşim yok

Hiçbir model sağlayıcısı, framework ya da ajan platformu burada anılmayı, sıralanmayı veya bağlantıyı satın alamaz.

On iki dil

Her rehber çevrilir, makineyle açılmaz — her dilin kendi adresi ve kendi gözden geçirme tarihi vardır.

Sınırlar açık

Bir görev ajan gerektirmiyorsa ve düz bir betik daha ucuz ve güvenilirse bunu açıkça söyleriz.