मल्टी-एजेंट AI में फैलती विफलताओं को कैसे रोकें
सीमित फैन-आउट, रीट्राई और बजट, सर्किट ब्रेकर, इडेम्पोटेंसी तथा टेनेंट अलगाव से मल्टी-एजेंट AI विफलताएँ रोकें।
इस मार्गदर्शिका में
मल्टी-एजेंट AI में फैलती विफलताएँ कैसे रोकें?
मल्टी-एजेंट वर्कफ़्लो इस तरह बनाएँ कि गलत उत्तर, प्रभावित टूल, धीमी निर्भरता या दूषित काम बिना सीमा न फैले। हर काम का समय, लागत, सौंपे गए चरण और डाउनस्ट्रीम प्रभाव सीमित करें; विफलताओं को अलग रखें; रीट्राई को इडेम्पोटेंट बनाएँ; और विश्वास या नीति जाँच विफल होने पर वर्कफ़्लो रोकें। OWASP के अनुसार एजेंट विफलताएँ जुड़े एजेंटों और टूलों में फैलकर स्थानीय समस्या को बड़ी सेवा या ग्राहक घटना में बदल सकती हैं।
पूरे एजेंट ग्राफ़ के लिए कुल काम बजट तय करें
मूल अनुरोध के लिए कुल समय, अनुमानित खर्च, एजेंट हस्तांतरण, टूल कॉल, उत्तर आकार और रीट्राई संख्या की अधिकतम सीमा तय करें। बचा बजट हर उपकाम को दें, ताकि अगला एजेंट नई सीमा शुरू न कर दे। मॉडल निर्देशों में नहीं, ऑर्केस्ट्रेटर में सीमा लागू करें। बजट खत्म हो तो काम रोकें या सुरक्षित आंशिक परिणाम दें।
फैन-आउट और गहराई सीमित करें
हर वर्कफ़्लो में समवर्ती शाखाओं और एजेंट प्रतिनिधित्व की अधिकतम गहराई तय करें। मॉडल से असीम एजेंट समूह बनाने के बजाय मंजूर चरणों वाला स्पष्ट ग्राफ़ अपनाएँ। प्रति टेनेंट समवर्ती काम और क्यू सीमा रखें तथा जरूरी ट्रैफिक और पुनर्प्राप्ति के लिए क्षमता बचाएँ। स्वीकृत हर अनुरोध का कुल भार देखें, क्योंकि वह कई मॉडल और टूल कॉल शुरू कर सकता है।
वर्कफ़्लो में विश्वास और मंजूरी की सीमाएँ तय करें
कौन-से चरण डेटा पढ़, रिकॉर्ड बदल, बाहरी पक्ष से संपर्क या दूसरे एजेंट को अधिकार दे सकते हैं—यह स्पष्ट करें। प्रभावशाली कार्रवाई से पहले नई नीति जाँचें और जरूरी असर पर मानवीय पुष्टि लें। ऊपर के एजेंट का नतीजा नीचे की कार्रवाई की सटीकता, अनुमति या सुरक्षा का प्रमाण न बने।
| वर्कफ़्लो | अधिकतम गहराई/शाखाएँ | समय/लागत/टूल बजट | रोकने की शर्त | पुनर्प्राप्ति मालिक |
|---|---|---|---|---|
सर्किट ब्रेकर, रीट्राई और इडेम्पोटेंसी विफलता कैसे सीमित करते हैं?
अस्वस्थ निर्भरता पर सर्किट ब्रेकर लगाएँ
हर मॉडल, टूल और डाउनस्ट्रीम सेवा के टाइमआउट, त्रुटि और क्षमता मापें। सेवा विफल हो तो नया कॉल कुछ समय रोकें, फिर सीमित ट्रैफिक से वापसी जाँचें। एजेंटों को विफल नियंत्रण से बचकर बार-बार उसी सेवा को बुलाने देने के बजाय स्पष्ट सीमित मोड या सुरक्षित अस्वीकार दें।
रीट्राई सीमित और साइड इफेक्ट इडेम्पोटेंट बनाएँ
केवल सुरक्षित रूप से दोहराई जा सकने वाली विफलता पर छोटी सीमा, बढ़ते अंतराल और jitter के साथ रीट्राई करें। लिखने वाले ऑपरेशन की इडेम्पोटेंसी ID और स्थायी स्थिति रखें ताकि सफल काम के बाद आए टाइमआउट से दोहरा भुगतान, संदेश या रिकॉर्ड न बने। उपकाम को लंबित, पूरा, अस्वीकृत या अनिश्चित दर्ज करें; अनिश्चित नतीजे को अपरिवर्तनीय कार्रवाई दोहराने की अनुमति न समझें।
क्यू, स्थिति और बजट को टेनेंट के अनुसार अलग करें
वर्कफ़्लो स्थिति और संसाधन सीमा को टेनेंट-सचेत रखें। अधिक भार या प्रभावित टेनेंट सभी वर्कर न घेर सके और साझा रीट्राई तूफ़ान न बने। क्यू की गहराई सीमित करें, पुराने काम समाप्त करें, दूषित संदेश अलग रखें और मृत-संदेश रिकॉर्ड पर पहुँच सीमित करें। वर्कर काम फिर शुरू करे तो अनुमति दोबारा जाँचे; संग्रहित स्थिति को स्थायी अधिकार न माने।
फैलती विफलता का पता लगाकर रोकें और पुनर्प्राप्त करें
एक मूल अनुरोध को उसके सभी उपकामों तक ट्रेस करें
सहसंबंध ID आगे पहुँचाएँ और मूल तथा उप-काम संबंध, एजेंट पहचान, टेनेंट संदर्भ, नीति निर्णय, निर्भरता, रीट्राई संख्या, समय, खर्च और साइड इफेक्ट स्थिति दर्ज करें। इससे पता चलेगा कि कौन-सी कॉल बढ़ी और सीमा कहाँ पार हुई। लॉग में प्रॉम्प्ट और संदेश कम रखें तथा परिचालन ट्रेस तक पहुँच सीमित करें।
रोकने की शर्त और परखा आपात नियंत्रण तय करें
बजट खत्म होने, बार-बार अनुमति अस्वीकृति, लूप, असामान्य शाखाओं, प्रभावित निर्भरता या नीति उल्लंघन पर रोकें। ऑपरेटर को एक एजेंट, टूल, मॉडल मार्ग या टेनेंट वर्कफ़्लो रोकने, लंबित काम रद्द करने और क्रेडेंशियल रद्द करने का तरीका दें। अभ्यास में सत्यापित करें कि नियंत्रण डाउनस्ट्रीम काम रोकता है, केवल स्क्रीन छिपाता नहीं।
मिलान के बाद नियंत्रित रीप्ले करें
रोकने के बाद पता लगाएँ कि कौन-से बदलाव पूरे हुए, कौन-से संदेश दोहराए गए और ग्राहक पर क्या असर पड़ा। दोबारा चलाने से पहले बाहरी प्रदाता या व्यावसायिक रिकॉर्ड का मिलान करें; केवल इडेम्पोटेंट काम या समीक्षा के बाद सुरक्षित रूप से फिर बनाए गए काम दोहराएँ। शुरुआत की खामी का प्रतिगमन मामला जोड़ें और वर्कफ़्लो चालू करने से पहले रोलबैक या भरपाई जाँचें।
मल्टी-एजेंट विफलता रोकथाम के आम सवाल
AI एजेंट वर्कफ़्लो में फैलती विफलता क्या है?
यह तब होती है जब एक एजेंट, मॉडल, टूल या डेटा स्रोत की खामी जुड़े चरणों में फैलकर त्रुटियों, भार या हानिकारक कार्रवाइयों को बढ़ा देती है।
क्या हर अनुरोध पर टोकन सीमा एजेंट विफलता रोकती है?
नहीं। वर्कफ़्लो कई छोटी कॉल कर सकता है। पूरे ग्राफ़ में कुल समय, हस्तांतरण, समवर्ती काम, रीट्राई, टूल कॉल, खर्च और डाउनस्ट्रीम प्रभाव भी सीमित करें।
क्या दूसरा एजेंट टाइमआउट करे तो पहला अपने आप रीट्राई करे?
केवल सीमित नीति के तहत और तब जब काम दोहराने से सुरक्षित हो। इडेम्पोटेंसी रखें और बाहरी प्रभाव वाली कार्रवाई दोहराने से पहले अनिश्चित परिणाम जाँचें।
एक टेनेंट को सभी ग्राहकों पर असर डालने से SaaS टीम कैसे रोके?
टेनेंट-सचेत क्यू, समवर्ती और लागत सीमा लगाएँ; वर्कफ़्लो अलग रखें; और साझा सेवा की सुरक्षा जाँच दरकिनार किए बिना एक टेनेंट का काम रोकने या अलग करने की सुविधा दें।
संबंधित व्यावहारिक मार्गदर्शिकाएँ
संबंधित मुद्दों की मार्गदर्शिकाएँ
स्रोत और प्रकाशन रिकॉर्ड
मसौदा 27 सितंबर 2026 को तैयार; इंजीनियरिंग, सुरक्षा और संपादकीय समीक्षा लंबित · स्रोत जाँचे गए .