गुणवत्ता बिगाड़े बिना एजेंट की लागत घटाना
जब टोकन बिल किसी को चौंकाता है, तो पहली प्रवृत्ति हर जगह सस्ता मॉडल लगाकर गुणवत्ता की हानि स्वीकारने की होती है। यह शायद ही ज़रूरी है। जिन सिस्टमों की हमने जाँच की, उनमें अधिकांश ख़र्च ऐसे संदर्भ से आया जिसकी ज़रूरत ही नहीं थी और ऐसे कदमों से जिन्हें महँगा मॉडल नहीं चाहिए था।
नीचे का तरीक़ा उबाऊ और असरदार है: पहले मापिए, फिर लाभ के क्रम में चार बदलाव लागू कीजिए और तब तय कीजिए कि समस्या बची भी है या नहीं। ज़्यादातर टीमें दूसरे बदलाव के बाद रुक जाती हैं।
कुछ बदलने से पहले प्रति रन मापिए#
मासिक कुल ख़र्च कुछ भी अमल-योग्य नहीं बताता। हर रन के लिए दर्ज कीजिए: इनपुट और आउटपुट टोकन, मॉडल कॉल की संख्या, प्रति कॉल मॉडल और काम का प्रकार। फिर काम-प्रकार के हिसाब से बँटी, प्रति पूर्ण कार्य लागत देखिए। लगभग हमेशा एक-दो प्रकार हावी होते हैं और उनमें एक कदम।
विफल और छोड़े गए रन भी हर में गिनिए। तीन कोशिशें जलाने वाला रीट्राई लूप गुणवत्ता के भेस में लागत समस्या है।
चार बदलाव, लाभ के क्रम में#
| बदलाव | सामान्य बचत | जोखिम |
|---|---|---|
| संदर्भ काटिए: इस्तेमाल दस्तावेज़ हटाइए, इतिहास संपीड़ित कीजिए | 20–40% | कम, अगर लक्ष्य स्थिर रहे |
| सस्ते कदम छोटे मॉडल पर भेजिए | 20–40% | प्रति कदम मूल्यांकन के साथ कम |
| स्थिर prompt उपसर्ग कैश कीजिए | दोहराव ट्रैफ़िक पर 10–30% | कम |
| कदम घटाइए: बेहतर टूल, कम रीट्राई | 10–25% | मध्यम — टूल पर काम चाहिए |
बिल ही संदर्भ है#
हर मोड़ जमा संदर्भ दोबारा भेजता है, इसलिए आठ कदम का रन वही दस्तावेज़ आठ बार चुका सकता है। तीन आदतें अधिकांश ठीक कर देती हैं: जिस कदम को पैराग्राफ़ चाहिए थे वह पूरा होते ही उन्हें हटाइए; पुराने मोड़ छोटी तथ्य-नोट में संपीड़ित कीजिए; और टूल नतीजे उन्हीं फ़ील्ड तक काटिए जो एजेंट इस्तेमाल करता है।
स्वाद से नहीं, कदम से राउट कीजिए#
निष्कर्षण, वर्गीकरण और स्वरूपण को शायद ही आपका सबसे मज़बूत मॉडल चाहिए; योजना और उपयोगकर्ता को दिखने वाला गद्य अक्सर चाहिए। पहला समूह एक स्तर नीचे लाइए, मूल्यांकन सेट चलाइए और आँकड़े टिकें तभी बदलाव रखिए।
- सबसे ज़्यादा हैसियत और सबसे कम विवेक वाले कदम से शुरू कीजिए।
- एक बार में एक कदम बदलिए और मूल्यांकन दोबारा चलाइए।
- दर्ज कीजिए कि कौन-सा निर्णय किस मॉडल ने बनाया।
- प्रति रन ख़र्च सीमा रखिए।
जो नहीं करना चाहिए#
जवाबों को आधार देने वाला retrieval मत काटिए — जब किसी को सुधार करना पड़े तो हैलुसिनेशन टोकन से कहीं महँगा है। एक कॉल बचाने के लिए अपरिवर्तनीय कार्रवाइयों पर समीक्षक चक्र मत हटाइए। और prompt शब्दों की सूक्ष्म-अनुकूलन के पीछे मत भागिए।
अक्सर पूछे जाने वाले प्रश्न
क्या कैशिंग सार्थक है?
अगर आपके रन लंबा स्थिर उपसर्ग साझा करते हैं — सिस्टम निर्देश, टूल परिभाषाएँ, नीति टेक्स्ट — तो हाँ, और यह सबसे सस्ती जीतों में है।
क्या बचत के लिए फ़ाइन-ट्यून करें?
केवल ऐसे उच्च-हैसियत, संकीर्ण और स्थिर कदम के लिए जहाँ छोटा ट्यून मॉडल बड़े की बराबरी करे। कम हैसियत पर राउटिंग और संदर्भ-कटौती बेहतर हैं।
एक भारी रन को कैसे रोकें?
प्रति रन कदम और ख़र्च सीमित कीजिए, दोहराई गई समान कॉल पहचानिए और आंशिक नतीजे के साथ रुकिए। सीमा छूने वाले रन पर अलर्ट रखिए।
एजेंट लागतllm लागत अनुकूलनटोकन लागत घटानाprompt कैशिंगमॉडल राउटिंग