AI एजेंट को स्केल करना: विलंब, समवर्तीता और दर सीमाएँ
पहला ट्रैफ़िक उछाल हर टीम को यही सिखाता है। आपके सर्वर लगभग ख़ाली हैं, डेटाबेस ठीक है और सब धीमा है — क्योंकि हर अनुरोध कोटा वाले प्रोवाइडर को कई सेकंड की कई कॉल है, और कोटा को इससे मतलब नहीं कि आपने कितने कंटेनर चलाए।
इसलिए एजेंट स्केलिंग ज़्यादातर क़तार सिद्धांत और अपेक्षा प्रबंधन है, थोड़ी क्षमता योजना भी। अच्छी ख़बर: तकनीकें जानी-पहचानी हैं और किसी में एजेंट दोबारा लिखना नहीं पड़ता।
तीन में से कौन-सी सीमा लगी है, जानिए#
| लक्षण | संभावित सीमा | उपाय |
|---|---|---|
| प्रोवाइडर से 429 | प्रति मिनट अनुरोध या टोकन | क़तार, बैकऑफ़, कुंजी/क्षेत्र में बाँटना |
| धीमा पर बिना त्रुटि | प्रति रन क्रमिक कॉल | स्वतंत्र कदम समानांतर; लूप छोटा |
| मेमोरी या कनेक्शन ख़त्म | आपकी अपनी सेवा | सामान्य क्षमता काम |
| केवल व्यस्त समय धीमा | साझा कोटा प्रतिस्पर्धा | प्राथमिकता क़तार; कम मूल्य टालिए |
जो इंटरैक्टिव नहीं, उसे क़तार में डालिए#
पहले दिन से ट्रैफ़िक दो वर्गों में बाँटिए। इंटरैक्टिव — कोई इंतज़ार कर रहा है — को छोटी समय-सीमा, सख़्त कदम सीमा और गुणवत्ता की अनुमति हो तो तेज़ मॉडल। पृष्ठभूमि काम — बैच वर्गीकरण, संवर्धन, रात्रि प्रसंस्करण — उस क़तार में जिसकी समवर्तीता आप नियंत्रित करते हैं, और कोटा तंग होते ही पहले उसी को दबाइए।
इंतज़ार को ईमानदारी से छोटा कीजिए#
- जवाब बनते ही स्ट्रीम कीजिए, आख़िरी टोकन के बाद नहीं।
- मौजूदा कदम सादे शब्दों में दिखाइए: `आपका ऑर्डर देखा जा रहा है`।
- सीमा पर उपयोगी आंशिक नतीजा लौटाइए और बताइए क्या छूटा।
- जो रोकता नहीं उसे क्रिटिकल पथ से हटाइए और बाद में दीजिए।
विलंब की अनुभूति इंजीनियरिंग जितनी ही उत्पाद समस्या है। दिखती प्रगति वाले पाँच सेकंड ख़ाली स्क्रीन के तीन सेकंड को हरा देते हैं।
गिरावट मोड ज़रूरत से पहले बनाइए#
पहले से तय कीजिए कि प्रोवाइडर धीमा, कोटा-पार या बंद होने पर एजेंट क्या करेगा — और इसे शांति से बनाइए। एक समझदार सीढ़ी: पूरा एजेंट, फिर सस्ता या वैकल्पिक मॉडल, फिर बिना टूल केवल retrieval जवाब, फिर ईमानदार माफ़ी और इंसान को सौंपना। इसे ऐसे स्विच के पीछे रखिए जिसे ऑन-कॉल सेकंडों में पलट सके।
दो आँकड़ों से क्षमता योजना#
प्रति पूर्ण कार्य मॉडल कॉल और प्रति पूर्ण कार्य टोकन। इन्हें व्यस्त समय के प्रति मिनट कार्यों से गुणा कीजिए, कोटा से तुलना कीजिए, और लॉन्च के दौरान नहीं, पहले पता चल जाएगा कि सीमा बढ़वानी है या नहीं।
अक्सर पूछे जाने वाले प्रश्न
कई प्रोवाइडर खाते या क्षेत्र?
असली स्केल या लचीलेपन के लिए हाँ। इसे एक आंतरिक इंटरफ़ेस के पीछे कीजिए और प्रति मार्ग मॉडल संस्करण पिन कीजिए।
इंटरैक्टिव विलंब स्वीकार्य कैसे रखें?
कदम सख़्ती से सीमित कीजिए, सरल कदम तेज़ मॉडल पर, स्वतंत्र कॉल समानांतर और आउटपुट स्ट्रीम।
ट्रैफ़िक बढ़ने पर पहले क्या टूटता है?
लगभग हमेशा प्रोवाइडर की दर सीमाएँ, फिर आपके सबसे व्यस्त टूल की आंतरिक API।
एजेंट स्केलिंगllm दर सीमाएँएजेंट विलंबllm क़तारगिरावट मोड