Menekan Biaya Agent Tanpa Membuatnya Lebih Buruk
Saat tagihan token mengejutkan seseorang, naluri pertama adalah pindah ke model murah di semua tempat dan menerima penurunan kualitas. Itu jarang perlu. Pada sistem yang kami audit, sebagian besar belanja berasal dari konteks yang tak perlu ada dan langkah yang tak butuh model mahal.
Metode di bawah ini membosankan dan efektif: ukur dulu, lalu terapkan empat perubahan menurut urutan hasilnya, lalu putuskan apakah masih ada masalah. Kebanyakan tim berhenti setelah yang kedua.
Ukur per eksekusi sebelum mengubah apa pun#
Total belanja bulanan tak memberi tahu apa pun yang bisa ditindaklanjuti. Catat per eksekusi: token masukan dan keluaran, jumlah panggilan, model per panggilan, dan jenis tugas. Lalu lihat biaya per tugas selesai, dipilah menurut jenis. Hampir selalu satu atau dua jenis mendominasi.
Sertakan eksekusi gagal dalam penyebutnya. Lingkar coba ulang yang membakar tiga percobaan adalah masalah biaya berkedok kualitas.
Empat perubahan, menurut hasilnya#
| Perubahan | Penghematan khas | Risiko |
|---|---|---|
| Pangkas konteks: buang dokumen terpakai, ringkas riwayat | 20–40% | Rendah bila tujuan tetap disematkan |
| Rutekan langkah murah ke model lebih kecil | 20–40% | Rendah, dengan evaluasi per langkah |
| Cache prefiks prompt yang stabil | 10–30% pada trafik berulang | Rendah |
| Kurangi langkah: alat lebih baik, coba ulang lebih sedikit | 10–25% | Sedang — perlu kerja pada alat |
Tagihannya adalah konteks#
Tiap giliran mengirim ulang konteks yang menumpuk, jadi eksekusi delapan langkah bisa membayar dokumen yang sama delapan kali. Tiga kebiasaan memperbaiki sebagian besar: buang paragraf yang diambil begitu langkahnya selesai; ringkas giliran lama jadi catatan faktual; pangkas hasil alat ke kolom yang dipakai.
Rutekan menurut langkah, bukan selera#
Ekstraksi, klasifikasi, dan pemformatan jarang butuh model terkuat; perencanaan dan prosa untuk pengguna sering butuh. Turunkan kelompok pertama satu tingkat, jalankan set evaluasi, dan pertahankan perubahan hanya bila angkanya bertahan.
- Mulai dari langkah bervolume tertinggi dan berpertimbangan terendah.
- Ubah satu langkah tiap kali dan jalankan ulang evaluasi.
- Catat model mana yang menghasilkan keputusan mana.
- Pasang batas belanja per eksekusi.
Pertanyaan yang sering diajukan
Apakah caching sepadan?
Kalau eksekusi Anda berbagi prefiks panjang yang stabil, ya, dan itu salah satu kemenangan termurah.
Perlukah fine-tuning untuk berhemat?
Hanya untuk langkah bervolume tinggi, sempit, dan stabil di mana model kecil yang disetel menyamai model besar.
Bagaimana mencegah satu eksekusi jadi sangat mahal?
Batasi langkah dan belanja per eksekusi, deteksi panggilan identik berulang, dan berhenti dengan hasil parsial.
biaya agent aioptimasi biaya llmmenekan biaya tokencache promptperutean model