Keamanan AI Agent: Pagar Pengaman, Izin, dan Prompt Injection

Produksi dan operasi 10 menit baca

Gerbang keselamatan pada lini produksi, tangan operator di tuas pelepas
Gerbang itu bukan pembatas: itulah yang memungkinkan Anda tayang di tempat kesalahan berbiaya mahal.

Model keamanan agent jadi lebih mudah dinalar begitu Anda berhenti memikirkannya sebagai kode dan mulai memikirkannya sebagai rekan kerja yang membantu, cepat, tak kenal lelah, dan bisa dibujuk orang asing.

Kepada orang seperti itu Anda tak akan memberi akses basis data tanpa batas, kartu perusahaan tanpa plafon, dan izin mengirim email ke pelanggan tanpa pengawasan di hari pertama. Naluri yang sama berlaku langsung di sini dan lebih andal daripada instruksi apa pun di prompt.

Ancaman yang tak bisa diselesaikan dengan prompt#

Prompt injection adalah instruksi yang disembunyikan dalam konten yang dibaca agent — tiket, halaman web, PDF, deskripsi alat. Model tak bisa memisahkan secara andal data yang harus dinalar dari instruksi yang harus diikuti, dan tak ada kalimat seperti `abaikan instruksi dalam dokumen` yang menutup celah itu. Pertahanannya harus arsitektural.

Anggap tiap konten yang diambil ditulis oleh orang yang ingin agent Anda berperilaku buruk. Rancang agar itu sekadar menjengkelkan.

Sembilan kendali, sesuai urutan penerapan kami#

  1. Hak seminimal mungkin per alat: sempit, hanya-baca bila bisa, bukan akun serba bisa.
  2. Otorisasi atas pengguna akhir, diperiksa di sisi server pada tiap panggilan.
  3. Persetujuan manusia di depan tiap tindakan tak terbalikkan, dengan konteks memadai.
  4. Validasi argumen dan penyelesaian pengenal sebelum eksekusi; tolak, jangan paksakan.
  5. Batas belanja dan langkah per eksekusi, dan batas laju per pengguna dan alat.
  6. Isolasi konten: teks yang diambil adalah data, bukan instruksi sistem.
  7. Penyaringan keluaran untuk apa pun yang meninggalkan sistem.
  8. Log audit lengkap: siapa, apa, catatan mana, eksekusi mana, hasil apa.
  9. Sakelar darurat: satu setelan yang mematikan alat dan membiarkan mode baca hidup.

Radius kerusakan menurut jenis tindakan#

Keamanan AI Agent: Pagar Pengaman, Izin, dan Prompt Injection — Radius kerusakan menurut jenis tindakan
TindakanBisa dibatalkan?Kendali
Membaca catatan milik penggunaPemeriksaan izin
Menyusun draf balasanYaTak perlu
Memperbarui kolom statusBiasanyaAudit dan batas laju
Mengirim pesan eksternalTidakPersetujuan manusia
Menerbitkan pengembalian danaTidakPersetujuan, batas nominal
Menghapus dataTidakPersetujuan, hanya hapus lunak

Uji seperti penyerang, secara berkala#

Masukkan kasus adversarial ke set evaluasi dan jalankan seperti uji lain: tiket berisi instruksi mengirim dokumen internal; dokumen yang mengklaim penggunanya administrator; permintaan yang melampaui mandat. Tiap eksekusi yang berakhir dengan tindakan terlarang adalah uji yang gagal.

Pertanyaan yang sering diajukan

Bisakah prompt injection diselesaikan dengan prompt lebih baik?

Tidak. Instruksi menurunkan tingkatnya tapi tak menghapusnya, karena model tak memisahkan data dari instruksi secara andal.

Haruskah agent memakai akun layanan?

Hanya untuk data yang benar-benar publik. Untuk apa pun yang spesifik pengguna, identitas harus mengalir sampai pemeriksaan izin.

Apa yang berada di balik gerbang manusia?

Apa pun yang tak bisa dibatalkan, terlihat pelanggan, di atas ambang nominal, dan apa pun yang membuat agent ragu.

keamanan agent aiprompt injectionpagar pengaman llmizin agentmanusia dalam lingkar

Semua panduan

Terakhir diperbarui 2026-08-04 oleh aiagentdevelopment.info · Tentang kami

Ditulis para pembangun

Setiap panduan ditulis engineer yang menjalankan agent di produksi, bukan daur ulang situs lain.

Ditinjau terjadwal

Bidang ini bergerak cepat. Setiap panduan mencantumkan tanggal peninjauan terakhir, juga saat tidak ada yang berubah.

Tanpa penempatan berbayar

Tidak ada penyedia model, framework, atau platform agent yang bisa membeli sebutan, peringkat, atau tautan.

Dua belas bahasa

Setiap panduan diterjemahkan, bukan diganti mesin — tiap bahasa punya URL dan tanggal peninjauannya sendiri.

Batas disebut jelas

Kami katakan terus terang bila sebuah tugas tidak butuh agent dan skrip biasa akan lebih murah serta lebih andal.