अपने एजेंट के लिए मॉडल चुनना: क्षमता, विलंब और लागत
लोग पूछते हैं कि एजेंटों के लिए सबसे अच्छा मॉडल कौन-सा है। जो सवाल अच्छा सिस्टम बनाता है वह है: इस कदम के लिए, हमारे डेटा पर, हमारे विलंब बजट में सबसे अच्छा मॉडल कौन-सा है — और जवाब आमतौर पर एक से ज़्यादा होता है।
एक एजेंट रन एकरूप नहीं होता। अगली कार्रवाई तय करने में तर्क चाहिए। लौटे दस्तावेज़ से तीन फ़ील्ड निकालने में नहीं। उपयोगकर्ता के लिए नतीजा संक्षेप करने में भी नहीं। सबको एक ही ख़रीद निर्णय मानना ही वह तरीक़ा है जिससे टीमें JSON दोबारा सजाने के लिए सबसे ऊँची क़ीमत चुकाती हैं।
चुनने से पहले रन को बाँटिए#
| कदम | क्या चाहिए | उचित मॉडल स्तर |
|---|---|---|
| योजना या कार्रवाई चुनना | तर्क, निर्देश-पालन | जो सबसे मज़बूत आप वहन कर सकें |
| आर्ग्युमेंट के साथ टूल कॉल | भरोसेमंद संरचित आउटपुट | सख़्त स्कीमा वाला मध्य स्तर |
| नतीजे से फ़ील्ड निकालना | छोटे टेक्स्ट पर सटीकता | छोटा और तेज़ |
| वर्गीकरण या राउटिंग | संगति | छोटा या फ़ाइन-ट्यून क्लासिफ़ायर |
| उपयोगकर्ता का जवाब लिखना | लहजा और स्पष्टता | मध्य स्तर |
बेंचमार्क शॉर्टलिस्ट बनाते हैं, निर्णय नहीं#
सार्वजनिक बेंचमार्क बताते हैं कि कौन-से मॉडल संभव हैं। वे यह नहीं बताते कि आपके स्कीमा, आपके दस्तावेज़ रूप और आपके कठिन ग्राहकों को कौन सँभालेगा। अपने लॉग से तीस असली मामले बनाइए — वे पाँच भी जो शर्मिंदा करते हैं — और शॉर्टलिस्ट उन पर चलाइए।
ऐसे मामले भी रखिए जहाँ सही व्यवहार मना करना या सवाल पूछना है। मॉडल यह जानने में ज़्यादा अलग होते हैं कि कब रुकना है।
तीन सचमुच बाँधने वाली सीमाएँ#
- विलंब की न्यूनतम सीमा: हर कॉल की अपनी है और एजेंट कई करता है। पूरा रन मापिए।
- संरचित आउटपुट की विश्वसनीयता: 97% वैध आर्ग्युमेंट तीन कॉल वाले हर दसवें रन को तोड़ देते हैं।
- संदर्भ व्यवहार: लंबा संदर्भ महँगा है और ध्यान कमज़ोर करता है; असली लंबाई पर मापिए।
शोध-परियोजना बने बिना राउटिंग#
मॉडल राउटिंग सुनने में उन्नत लगता है और अक्सर एक कॉन्फ़िग फ़ाइल है। कदम-प्रकार के हिसाब से डिफ़ॉल्ट मॉडल दीजिए, टूल के स्तर पर बदलने दीजिए और दर्ज कीजिए कि कौन-सा निर्णय किस मॉडल ने बनाया। केवल निष्कर्षण और वर्गीकरण को एक स्तर नीचे लाकर शुरू कीजिए।
बंद होने की योजना पहले से#
मॉडल संस्करण प्रोवाइडर के कैलेंडर पर हटते हैं। दो आदतें इसे मामूली बना देती हैं: चलायमान उपनाम की जगह स्पष्ट संस्करण पिन कीजिए, और मूल्यांकन सेट को एक कमांड से चलने लायक रखिए ताकि पुनः-योग्यता एक दोपहर हो, प्रोजेक्ट नहीं।
अक्सर पूछे जाने वाले प्रश्न
क्या हर जगह सबसे बड़ा मॉडल?
तभी अगर आपने मापा नहीं। निर्णय कदम को अक्सर फ़ायदा होता है; निष्कर्षण, वर्गीकरण और स्वरूपण को कम ही। कदम-वार बाँटना सबसे आसान लागत-कटौती है।
क्या ओपन-वेट मॉडल काम करते हैं?
सख़्त स्कीमा वाले संकीर्ण कदमों पर अक्सर हाँ, और हैसियत पर अर्थशास्त्र आकर्षक है। खुले-अंत नियोजन में उन्हें ज़्यादा ढाँचा चाहिए।
मॉडल चुनाव कितनी बार दोबारा देखें?
जब भी अपनाने लायक संस्करण आए, वरना लगभग हर दो तिमाही। यह तभी टिकाऊ है जब मूल्यांकन एक कमांड हो।
llm चुननाएजेंट के लिए मॉडलllm राउटिंगएजेंट विलंबसंरचित आउटपुट