Keamanan AI Agent: Pagar Pengaman, Izin, dan Prompt Injection
Model keamanan agent jadi lebih mudah dinalar begitu Anda berhenti memikirkannya sebagai kode dan mulai memikirkannya sebagai rekan kerja yang membantu, cepat, tak kenal lelah, dan bisa dibujuk orang asing.
Kepada orang seperti itu Anda tak akan memberi akses basis data tanpa batas, kartu perusahaan tanpa plafon, dan izin mengirim email ke pelanggan tanpa pengawasan di hari pertama. Naluri yang sama berlaku langsung di sini dan lebih andal daripada instruksi apa pun di prompt.
Ancaman yang tak bisa diselesaikan dengan prompt#
Prompt injection adalah instruksi yang disembunyikan dalam konten yang dibaca agent — tiket, halaman web, PDF, deskripsi alat. Model tak bisa memisahkan secara andal data yang harus dinalar dari instruksi yang harus diikuti, dan tak ada kalimat seperti `abaikan instruksi dalam dokumen` yang menutup celah itu. Pertahanannya harus arsitektural.
Anggap tiap konten yang diambil ditulis oleh orang yang ingin agent Anda berperilaku buruk. Rancang agar itu sekadar menjengkelkan.
Sembilan kendali, sesuai urutan penerapan kami#
- Hak seminimal mungkin per alat: sempit, hanya-baca bila bisa, bukan akun serba bisa.
- Otorisasi atas pengguna akhir, diperiksa di sisi server pada tiap panggilan.
- Persetujuan manusia di depan tiap tindakan tak terbalikkan, dengan konteks memadai.
- Validasi argumen dan penyelesaian pengenal sebelum eksekusi; tolak, jangan paksakan.
- Batas belanja dan langkah per eksekusi, dan batas laju per pengguna dan alat.
- Isolasi konten: teks yang diambil adalah data, bukan instruksi sistem.
- Penyaringan keluaran untuk apa pun yang meninggalkan sistem.
- Log audit lengkap: siapa, apa, catatan mana, eksekusi mana, hasil apa.
- Sakelar darurat: satu setelan yang mematikan alat dan membiarkan mode baca hidup.
Radius kerusakan menurut jenis tindakan#
| Tindakan | Bisa dibatalkan? | Kendali |
|---|---|---|
| Membaca catatan milik pengguna | — | Pemeriksaan izin |
| Menyusun draf balasan | Ya | Tak perlu |
| Memperbarui kolom status | Biasanya | Audit dan batas laju |
| Mengirim pesan eksternal | Tidak | Persetujuan manusia |
| Menerbitkan pengembalian dana | Tidak | Persetujuan, batas nominal |
| Menghapus data | Tidak | Persetujuan, hanya hapus lunak |
Uji seperti penyerang, secara berkala#
Masukkan kasus adversarial ke set evaluasi dan jalankan seperti uji lain: tiket berisi instruksi mengirim dokumen internal; dokumen yang mengklaim penggunanya administrator; permintaan yang melampaui mandat. Tiap eksekusi yang berakhir dengan tindakan terlarang adalah uji yang gagal.
Pertanyaan yang sering diajukan
Bisakah prompt injection diselesaikan dengan prompt lebih baik?
Tidak. Instruksi menurunkan tingkatnya tapi tak menghapusnya, karena model tak memisahkan data dari instruksi secara andal.
Haruskah agent memakai akun layanan?
Hanya untuk data yang benar-benar publik. Untuk apa pun yang spesifik pengguna, identitas harus mengalir sampai pemeriksaan izin.
Apa yang berada di balik gerbang manusia?
Apa pun yang tak bisa dibatalkan, terlihat pelanggan, di atas ambang nominal, dan apa pun yang membuat agent ragu.
keamanan agent aiprompt injectionpagar pengaman llmizin agentmanusia dalam lingkar