AI एजेंट का परीक्षण: ऐसा मूल्यांकन सेट जो अपनी क़ीमत निकाले

प्रोडक्शन और ऑपरेशन 9 मिनट पढ़ें

स्क्रीन पर पास-फ़ेल कोशिकाओं का ग्रिड और पास में छपी टेस्ट सूची
वह बेरौनक़ फ़ाइल जो तय करती है कि आपका एजेंट कभी पायलट से बाहर आएगा या नहीं।

जो एजेंट लॉन्च होते हैं और जो पायलट में सड़ते हैं, उनके बीच का सवाल सरल है: आपको कैसे पता कि कल के बदलाव ने चीज़ें बेहतर कीं? जवाब न हो तो हर prompt बदलाव एक जुआ है और हर रिग्रेशन ग्राहक खोजता है।

मूल्यांकन सेट यही जवाब है, और इसके लिए प्लेटफ़ॉर्म नहीं चाहिए। एक फ़ाइल में पचास मामले, उन्हें चलाने वाली एक स्क्रिप्ट और प्रति मामला एक अंकन नियम — यह किसी लीडरबोर्ड से ज़्यादा बताते हैं, क्योंकि ये आपके मामले हैं।

एक मामला कैसा दिखता है#

मामला यानी एक इनपुट, दुनिया की शुरुआती स्थिति और एक जाँचने योग्य अपेक्षा। अपेक्षा लगभग कभी ठीक-ठीक टेक्स्ट नहीं होती — एजेंट कई शब्दों में सही हो सकता है। इसके बजाय नतीजे को अंक दीजिए: क्या उसने ऑर्डर 4471 के साथ रिफ़ंड टूल बुलाया; क्या अंतिम जवाब में सही तारीख़ है; क्या उसने ठीक ही मना करके सवाल पूछा।

हर मामले को चाहिए स्थिति उसी के साथ रखिए। जो टेस्ट लाइव डेटा के कारण केवल मंगलवार को पास हो, वह टेस्ट नहीं है।

पचास मामले और वे कहाँ से आते हैं#

AI एजेंट का परीक्षण: ऐसा मूल्यांकन सेट जो अपनी क़ीमत निकाले — पचास मामले और वे कहाँ से आते हैं
स्रोतलगभग कितनेक्यों
लॉग से आम असली अनुरोध20रोज़मर्रा का रास्ता बचाता है
ज्ञात पुरानी विफलताएँ10रिग्रेशन लौटने से रोकता है
अस्पष्ट इनपुट8पूछना चाहिए, अनुमान नहीं
मना करने वाले मामले6दायरे से बाहर, बिना अनुमति, असुरक्षित
ख़ाली या टूटे टूल नतीजे6सबसे आम असली घटना

रास्ता नहीं, नतीजा अंकित कीजिए#

अलग रास्तों से एक ही सही नतीजे तक पहुँचे दो रन दोनों सही हैं, और एक ही प्रतिलेख माँगने वाला सूट बेवजह लगातार फ़ेल होगा। जाँचिए कि क्या बदला और क्या कहा गया: प्रभाव वाली कॉल, जवाब के मुख्य तथ्य, इंसानी दरवाज़ा माँगा गया या नहीं। पूरी ट्रेस डीबगिंग के लिए रखिए, पर उस पर दावा मत लिखिए।

समय के साथ चार आँकड़े#

  1. पूरे सेट पर सफलता दर और अलग से मना-करने वाले उपसमूह पर।
  2. बेबुनियाद दावों की दर — ऐसे जवाब जिनके तथ्य प्रमाणों में नहीं।
  3. प्रति रन लागत और विलंब का माध्यक और 95वाँ प्रतिशतक।
  4. इंसानी दख़ल दर: कितनी बार किसी को आना पड़ा और क्यों।

पाइपलाइन में और लॉन्च के बाद भी#

prompt, टूल, मॉडल संस्करण या retrieval कॉन्फ़िगरेशन में किसी भी बदलाव पर सेट चलाइए — व्यवहार बदलने वाली केवल यही चार चीज़ें हैं। लॉन्च के बाद असली ट्रैफ़िक से नमूना लेते रहिए: रोज़ कुछ रन हाथ से अंकित कीजिए और जो चौंकाए उसे सेट में जोड़िए। जो सेट बढ़ना बंद कर दे, वह एक तिमाही में आपके उपयोगकर्ताओं का प्रतिनिधित्व करना बंद कर देता है।

अक्सर पूछे जाने वाले प्रश्न

शुरू करने के लिए कितने मामले?

पचास असली रिग्रेशन पकड़ते हैं और कुछ दिनों में लिखे जाते हैं। बीस शुरू करने के लिए काफ़ी हैं। संख्या से ज़्यादा ज़रूरी है असहज श्रेणियाँ ढँकना।

क्या मॉडल से अंकन करा सकते हैं?

हाँ, सावधानी से। स्पष्ट मानदंड दीजिए, सूची छोटी रखिए और नियमित रूप से हाथ से नमूना जाँचिए। अंकन-मॉडल खिसकते हैं।

क्या मूल्यांकन तैनाती रोके?

सुरक्षा-महत्वपूर्ण उपसमूह पर रोके — मना-करने वाले मामले और अपरिवर्तनीय सब कुछ। सामान्य गुणवत्ता में रुझान देखिए और गिरावट पर इंसानी निर्णय माँगिए।

एजेंट मूल्यांकनएजेंट परीक्षणllm eval सेटllm रिग्रेशन टेस्टएजेंट गुणवत्ता मीट्रिक

सभी गाइड
ठंडे गलियारे में फैली सर्वर रैक, एक गलियारा रोशन

AI एजेंट को स्केल करना: विलंब, समवर्तीता और दर सीमाएँ

एजेंट अलग तरह से स्केल होते हैं: अड़चन आपका CPU नहीं, एक दर सीमा और कई सेकंड की कॉल है। धीमे को क़तार में, तेज़ को स्ट्रीम, और जान-बूझकर गिरावट।

प्रोडक्शन और ऑपरेशन 8 मिनट पढ़ें

उत्पादन लाइन पर सुरक्षा द्वार, ऑपरेटर का हाथ रिलीज़ लीवर पर

AI एजेंट सुरक्षा: सुरक्षा-रेखाएँ, अनुमतियाँ और prompt injection

एजेंट आपके सिस्टम का ऐसा उपयोगकर्ता है जिसे बहलाया जा सकता है। न्यूनतम विशेषाधिकार, हर लाई गई सामग्री अविश्वसनीय, और अपरिवर्तनीय के आगे एक इंसान।

प्रोडक्शन और ऑपरेशन 10 मिनट पढ़ें

शांत ऑपरेशन कक्ष में डैशबोर्ड की दीवार, एक पैनल उभरा हुआ

प्रोडक्शन में एजेंट की निगरानी: क्या दर्ज करें, किस पर अलर्ट

अपटाइम एजेंट के बारे में कुछ नहीं बताता। हर रन ट्रेस कीजिए, छह व्यवहार मीट्रिक देखिए और केवल त्रुटियों पर नहीं, व्यवहार-बहाव पर अलर्ट कीजिए।

प्रोडक्शन और ऑपरेशन 9 मिनट पढ़ें

अंतिम अपडेट 2026-08-04 · aiagentdevelopment.info · हमारे बारे में

बनाने वालों की लिखी

हर गाइड प्रोडक्शन में एजेंट चलाने वाले इंजीनियर लिखते हैं, दूसरी साइटों से घुमा-फिरा कर नहीं।

तय समय पर समीक्षित

यह क्षेत्र तेज़ी से बदलता है। हर गाइड पर अंतिम समीक्षा की तारीख होती है — कुछ न बदलने पर भी।

कोई भुगतान वाली जगह नहीं

कोई मॉडल प्रोवाइडर, framework या एजेंट प्लेटफ़ॉर्म यहाँ उल्लेख, रैंकिंग या लिंक नहीं खरीद सकता।

बारह भाषाएँ

हर गाइड अनुवादित है, मशीन से बदली नहीं — हर भाषा का अपना URL और अपनी समीक्षा तारीख है।

सीमाएँ स्पष्ट

जब किसी काम को एजेंट की ज़रूरत नहीं और सादा स्क्रिप्ट सस्ता व भरोसेमंद होगा, हम साफ़ कहते हैं।