Memilih Model untuk Agent Anda: Kemampuan, Latensi, dan Biaya
Pertanyaan yang biasa diajukan: model mana yang terbaik untuk agent? Pertanyaan yang menghasilkan sistem bagus: model mana yang terbaik untuk langkah ini, pada data kami, dalam anggaran latensi kami — dan jawabannya biasanya lebih dari satu.
Satu eksekusi agent tidak seragam. Memutuskan tindakan berikutnya butuh penalaran. Menarik tiga kolom dari dokumen tidak. Merangkum hasil untuk pengguna juga tidak. Memperlakukan semuanya sebagai satu keputusan pembelian itulah cara tim membayar harga tertinggi hanya untuk merapikan JSON.
Belah eksekusinya sebelum memilih#
| Langkah | Yang dibutuhkan | Tingkat model yang masuk akal |
|---|---|---|
| Merencana atau memilih tindakan | Penalaran, patuh instruksi | Sekuat yang mampu Anda bayar |
| Memanggil alat dengan argumen | Keluaran terstruktur andal | Kelas menengah dengan skema ketat |
| Menarik kolom dari hasil | Akurasi pada teks pendek | Kecil dan cepat |
| Klasifikasi atau perutean | Konsistensi | Kecil atau klasifier yang disetel |
| Menulis jawaban ke pengguna | Nada dan kejelasan | Kelas menengah |
Benchmark membuat daftar pendek, bukan keputusan#
Benchmark publik memberi tahu model mana yang masuk akal. Ia tak memberi tahu mana yang sanggup menangani skema Anda, format dokumen Anda, dan pelanggan Anda yang sulit. Bangun tiga puluh kasus nyata dari log Anda — termasuk lima yang memalukan — lalu jalankan daftar pendek pada kasus itu.
Sertakan kasus di mana perilaku yang benar adalah menolak atau bertanya. Model berbeda jauh lebih besar dalam hal kapan berhenti.
Tiga batasan yang benar-benar mengikat#
- Lantai latensi: tiap panggilan punya, dan agent melakukan beberapa. Ukur seluruh eksekusi.
- Keandalan keluaran terstruktur: 97% argumen valid merusak satu dari sepuluh eksekusi bertiga panggilan.
- Perilaku konteks: konteks panjang mahal dan mengencerkan perhatian; ukur pada panjang nyata.
Perutean tanpa proyek riset#
Perutean model terdengar canggih dan biasanya hanya berkas konfigurasi. Tetapkan model bawaan per jenis langkah, izinkan penggantian per alat, dan catat model mana yang menghasilkan keputusan mana. Mulailah dengan menurunkan satu tingkat langkah ekstraksi dan klasifikasi saja.
Pertanyaan yang sering diajukan
Pakai model terbesar untuk semuanya?
Hanya kalau Anda belum mengukur. Langkah keputusan biasanya diuntungkan; ekstraksi, klasifikasi, dan pemformatan jarang.
Apakah model terbuka cocok untuk agent?
Untuk langkah sempit dengan skema ketat sering kali ya, dan ekonominya menarik pada volume besar.
Seberapa sering meninjau ulang pilihan model?
Setiap kali penyedia merilis versi yang mungkin Anda adopsi, dan selebihnya sekitar dua kuartal sekali.
memilih llmpemilihan model agentperutean llmlatensi agentkeluaran terstruktur