AI एजेंट का परीक्षण: ऐसा मूल्यांकन सेट जो अपनी क़ीमत निकाले
जो एजेंट लॉन्च होते हैं और जो पायलट में सड़ते हैं, उनके बीच का सवाल सरल है: आपको कैसे पता कि कल के बदलाव ने चीज़ें बेहतर कीं? जवाब न हो तो हर prompt बदलाव एक जुआ है और हर रिग्रेशन ग्राहक खोजता है।
मूल्यांकन सेट यही जवाब है, और इसके लिए प्लेटफ़ॉर्म नहीं चाहिए। एक फ़ाइल में पचास मामले, उन्हें चलाने वाली एक स्क्रिप्ट और प्रति मामला एक अंकन नियम — यह किसी लीडरबोर्ड से ज़्यादा बताते हैं, क्योंकि ये आपके मामले हैं।
एक मामला कैसा दिखता है#
मामला यानी एक इनपुट, दुनिया की शुरुआती स्थिति और एक जाँचने योग्य अपेक्षा। अपेक्षा लगभग कभी ठीक-ठीक टेक्स्ट नहीं होती — एजेंट कई शब्दों में सही हो सकता है। इसके बजाय नतीजे को अंक दीजिए: क्या उसने ऑर्डर 4471 के साथ रिफ़ंड टूल बुलाया; क्या अंतिम जवाब में सही तारीख़ है; क्या उसने ठीक ही मना करके सवाल पूछा।
हर मामले को चाहिए स्थिति उसी के साथ रखिए। जो टेस्ट लाइव डेटा के कारण केवल मंगलवार को पास हो, वह टेस्ट नहीं है।
पचास मामले और वे कहाँ से आते हैं#
| स्रोत | लगभग कितने | क्यों |
|---|---|---|
| लॉग से आम असली अनुरोध | 20 | रोज़मर्रा का रास्ता बचाता है |
| ज्ञात पुरानी विफलताएँ | 10 | रिग्रेशन लौटने से रोकता है |
| अस्पष्ट इनपुट | 8 | पूछना चाहिए, अनुमान नहीं |
| मना करने वाले मामले | 6 | दायरे से बाहर, बिना अनुमति, असुरक्षित |
| ख़ाली या टूटे टूल नतीजे | 6 | सबसे आम असली घटना |
रास्ता नहीं, नतीजा अंकित कीजिए#
अलग रास्तों से एक ही सही नतीजे तक पहुँचे दो रन दोनों सही हैं, और एक ही प्रतिलेख माँगने वाला सूट बेवजह लगातार फ़ेल होगा। जाँचिए कि क्या बदला और क्या कहा गया: प्रभाव वाली कॉल, जवाब के मुख्य तथ्य, इंसानी दरवाज़ा माँगा गया या नहीं। पूरी ट्रेस डीबगिंग के लिए रखिए, पर उस पर दावा मत लिखिए।
समय के साथ चार आँकड़े#
- पूरे सेट पर सफलता दर और अलग से मना-करने वाले उपसमूह पर।
- बेबुनियाद दावों की दर — ऐसे जवाब जिनके तथ्य प्रमाणों में नहीं।
- प्रति रन लागत और विलंब का माध्यक और 95वाँ प्रतिशतक।
- इंसानी दख़ल दर: कितनी बार किसी को आना पड़ा और क्यों।
पाइपलाइन में और लॉन्च के बाद भी#
prompt, टूल, मॉडल संस्करण या retrieval कॉन्फ़िगरेशन में किसी भी बदलाव पर सेट चलाइए — व्यवहार बदलने वाली केवल यही चार चीज़ें हैं। लॉन्च के बाद असली ट्रैफ़िक से नमूना लेते रहिए: रोज़ कुछ रन हाथ से अंकित कीजिए और जो चौंकाए उसे सेट में जोड़िए। जो सेट बढ़ना बंद कर दे, वह एक तिमाही में आपके उपयोगकर्ताओं का प्रतिनिधित्व करना बंद कर देता है।
अक्सर पूछे जाने वाले प्रश्न
शुरू करने के लिए कितने मामले?
पचास असली रिग्रेशन पकड़ते हैं और कुछ दिनों में लिखे जाते हैं। बीस शुरू करने के लिए काफ़ी हैं। संख्या से ज़्यादा ज़रूरी है असहज श्रेणियाँ ढँकना।
क्या मॉडल से अंकन करा सकते हैं?
हाँ, सावधानी से। स्पष्ट मानदंड दीजिए, सूची छोटी रखिए और नियमित रूप से हाथ से नमूना जाँचिए। अंकन-मॉडल खिसकते हैं।
क्या मूल्यांकन तैनाती रोके?
सुरक्षा-महत्वपूर्ण उपसमूह पर रोके — मना-करने वाले मामले और अपरिवर्तनीय सब कुछ। सामान्य गुणवत्ता में रुझान देखिए और गिरावट पर इंसानी निर्णय माँगिए।
एजेंट मूल्यांकनएजेंट परीक्षणllm eval सेटllm रिग्रेशन टेस्टएजेंट गुणवत्ता मीट्रिक