Ajanınız İçin Model Seçimi: Yetenek, Gecikme ve Maliyet
Ekiplerin sorduğu soru "ajanlar için en iyi model hangisi" oluyor. İyi bir sistem üreten soru ise şu: bu adım için, bizim verimizde, bizim gecikme bütçemizde en iyi model hangisi — ve cevap genelde birden fazla model.
Bir ajan koşusu türdeş değildir. Bir sonraki eyleme karar vermek muhakeme ister. Dönen bir belgeden üç alan çıkarmak istemez. Sonucu kullanıcı için özetlemek istemez. Bunların hepsini tek bir satın alma kararı gibi ele almak, ekiplerin JSON biçimlendirmek için sınır model fiyatı ödemesine yol açar.
Seçmeden önce koşuyu parçalayın#
| Adım | İhtiyacı | Makul model kademesi |
|---|---|---|
| Planlama ya da eylem seçimi | Muhakeme, talimata uyum | Karşılayabildiğiniz en güçlüsü |
| Argümanlarla araç çağırma | Güvenilir yapılı çıktı | Katı şemalarla orta kademe |
| Sonuçtan alan çıkarma | Kısa metinde doğruluk | Küçük ve hızlı |
| Sınıflandırma ya da yönlendirme | Tutarlılık | Küçük ya da ince ayarlı sınıflandırıcı |
| Kullanıcıya dönük cevabı yazma | Ton ve netlik | Orta kademe |
Karşılaştırmalar kısa liste yapar, karar vermez#
Genel karşılaştırmalar hangi modellerin makul olduğunu söyler. Sizin araç şemalarınızı, belge biçimlerinizi ve zor müşterilerinizi nasıl karşıladıklarını söyleyemez, çünkü bunların hiçbiri karşılaştırmada yoktur. Kendi kayıtlarınızdan otuz gerçek vaka toplayın — sizi utandıran beş tanesi de dahil — ve kısa listeyi bunlarla koşturun. Karşılaştırma sırası ile kendi-verinizdeki sıra arasındaki fark, kararı değiştirecek kadar büyük çıkıyor.
Doğru davranışın reddetmek ya da soru sormak olduğu vakaları da ekleyin. Modeller ne söyleyeceğini bilmekten çok, ne zaman duracağını bilmekte ayrışıyor.
Gerçekten bağlayan üç kısıt#
- Gecikme tabanı: her model çağrısının bir tabanı var ve ajan birkaç çağrı yapıyor. Tek çağrıyı değil tüm koşuyu ölçün.
- Yapılı çıktı güvenilirliği: geçerli argümanı %97 döndüren bir model, üç araç çağrılı koşularda on koşudan birini bozar.
- Bağlam davranışı: uzun bağlam pahalıdır ve dikkati zayıflatır; pazarlama üst sınırında değil, gerçekten kullanacağınız uzunlukta doğruluğu ölçün.
Araştırma projesine dönüşmeyen yönlendirme#
Model yönlendirme kulağa gelişmiş geliyor, genelde bir yapılandırma dosyası. Adım türü başına varsayılan model atayın, araç bazında geçersiz kılmaya izin verin ve hangi kararı hangi modelin ürettiğini kaydedin ki hataları ilişkilendirebilesiniz. Yalnız çıkarma ve sınıflandırma adımlarını bir kademe aşağı taşıyarak başlayın; bu tek başına, kullanıcıların gördüğü kısmın kalitesine dokunmadan token faturasının üçte biriyle yarısı arasını sıklıkla siler.
Kullanımdan kalkmayı baştan planlayın#
Model sürümleri sizin değil sağlayıcının takvimiyle emekli edilir. İki alışkanlık bunu olaysızlaştırır: kayan bir takma ad yerine açık sürüm sabitleyin ki altınızdan sessizce bir şey değişmesin ve değerlendirme setinizi tek komutla koşturulabilir tutun ki yerine geçecek modeli yeniden onaylamak bir proje değil bir öğleden sonra olsun. Bu alışkanlıkları olmayan ekipler, kullanımdan kalkma e-postasıyla olayı aynı sabah öğreniyor.
Sık sorulan sorular
Her şey için en büyük modeli mi kullanmalıyım?
Yalnızca ölçmediyseniz. Karar adımı genelde en güçlü modelden fayda görür; çıkarma, sınıflandırma ve biçimlendirme nadiren görür. Adım bazında ayırmak, elinizdeki en kolay maliyet düşürme yöntemidir ve kullanıcıların gördüğü kaliteye dokunmaz.
Açık ağırlıklı modeller ajanlarda işe yarar mı?
Katı şemalı, dar ve iyi tanımlanmış adımlarda sıklıkla evet ve hacimde ekonomisi cazip olabilir. Çok araçlı açık uçlu planlamada hâlâ daha fazla iskele istiyorlar. Lider tablosunda değil, kendi otuz vakanızda test edin.
Model seçimimi ne sıklıkla gözden geçirmeliyim?
Sağlayıcı benimseyebileceğiniz bir sürüm çıkardığında ve bunun dışında yaklaşık iki çeyreklik sabit bir ritimde. Bu ancak değerlendirme setini yeniden koşturmak tek komutsa sürdürülebilir; ona yatırım yapmanın asıl sebebi budur.
llm seçimiajanlar için model seçimillm yönlendirmeajan gecikmesiyapılı çıktı güvenilirliği