Site icon Taaza Time 18

OpenAI ने रिलीज़ होने से पहले ही एक शक्तिशाली AI मॉडल पर कुछ समय के लिए विराम लगा दिया: यहाँ बताया गया है क्यों | प्रौद्योगिकी समाचार

track_1x1.jpg


4 मिनट पढ़ेंनई दिल्लीअपडेट किया गया: 21 जुलाई, 2026 07:53 अपराह्न IST

ओपनएआई ने सोमवार, 20 जुलाई को कहा कि उसने अपने आंतरिक रूप से तैनात एआई मॉडल में से एक में अप्रत्याशित व्यवहार प्रदर्शित करने के बाद अस्थायी रूप से पहुंच को निलंबित कर दिया है, जो चैटजीपीटी-निर्माता के पूर्व-तैनाती सुरक्षा मूल्यांकन से आगे निकल गया है।

अनाम एआई सिस्टम एक सामान्य-उद्देश्य वाला मॉडल है जिसके बारे में ओपनएआई ने हाल ही में दावा किया था कि उसने एर्डोस इकाई दूरी अनुमान को खारिज कर दिया है, जो एक जटिल गणितीय समस्या है जो दशकों से अनसुलझी थी। यह कठिन, खुली समस्याओं को हल करने के लिए बहुत लंबे समय तक स्वायत्त रूप से चलने के लिए डिज़ाइन किए गए ‘लंबे-क्षितिज मॉडल’ की श्रेणी से संबंधित है।

हालाँकि, OpenAI ने कहा कि मॉडल की दृढ़ता इसके अवांछित, संभावित हानिकारक कार्यों का स्रोत भी साबित हुई, जो कंपनी द्वारा उक्त मॉडल के सीमित, निगरानी वाले आंतरिक उपयोग के दौरान देखा गया था।

ओपनएआई के नवीनतम शोध निष्कर्ष इस बात पर प्रकाश डालते हैं कि तेजी से सक्षम मॉडलों के साथ-साथ एआई सुरक्षा कैसे विकसित होनी चाहिए। एआई चैटबॉट सहायकों के लिए डिज़ाइन किया गया सुरक्षा मूल्यांकन, जो उपयोगकर्ता संकेतों पर संक्षिप्त प्रतिक्रिया उत्पन्न करता है, लंबे समय तक जटिल लक्ष्यों का पीछा करने वाले लंबे-क्षितिज मॉडल में संभावित जोखिमों का पता लगाने के लिए पर्याप्त विश्वसनीय नहीं हो सकता है।

इसके अतिरिक्त, लंबे-क्षितिज मॉडल का समग्र व्यवहार केवल किसी कार्य को पूरा करने के दौरान स्पष्ट हो जाता है और व्यक्तिगत कार्यों के माध्यम से इसका मूल्यांकन नहीं किया जा सकता है।

कंपनी के प्रयोगों से पता चलता है कि लंबे-क्षितिज वाले मॉडल एआई बेंचमार्क और अन्य अनुमोदन प्रणालियों को खेलना सीख सकते हैं, जिससे यह संभावना बढ़ जाती है कि गलत संरेखित मॉडल सुरक्षा जांच पास कर सकते हैं और सार्वजनिक उपयोग के लिए तैनात किए जा सकते हैं।

ओपनएआई ने अपने ब्लॉग पोस्ट में कहा, “चूंकि तैनाती सीमित थी और निगरानी की गई थी, हम इन समस्याओं की पहचान करने, पहुंच को रोकने, हमने जो देखा उसके आधार पर नए मूल्यांकन बनाने, मॉडल और उसके सुरक्षा उपायों को मजबूत करने और फिर निरंतर निगरानी के तहत पहुंच बहाल करने में सक्षम थे।”

इस विज्ञापन के नीचे कहानी जारी है

मॉडल ने कौन से अवांछनीय कार्य किये?

अपने शोध अध्ययन के एक भाग के रूप में, OpenAI ने NanoGPT स्पीडरन पर मॉडल का मूल्यांकन किया, एक सार्वजनिक बेंचमार्क जो मॉडल का परीक्षण करता है कि यह एक छोटे भाषा मॉडल (SLM) को प्रशिक्षित करने के लिए आठ NVIDIA H100 GPU का कितनी तेजी से उपयोग कर सकता है।

अप्रकाशित मॉडल पावरकूल नामक पावर-लॉ लर्निंग-रेट कूलडाउन तकनीक के साथ आया, जिससे एसएलएम को प्रशिक्षित करने में लगने वाले समय में महत्वपूर्ण सुधार हुआ। परीक्षण के बाद, शोधकर्ताओं ने मॉडल को अपने स्कोर केवल स्लैक पर पोस्ट करने का निर्देश दिया।

हालाँकि, मॉडल ने बाहरी प्लेटफ़ॉर्म तक पहुंच को अवरुद्ध करने के लिए डिज़ाइन किए गए सैंडबॉक्स प्रतिबंधों को दरकिनार कर दिया और NanoGPT निर्देशों के अनुरूप GitHub पर परिणाम पोस्ट करने के लिए आगे बढ़ा। मॉडल को अपने सैंडबॉक्स वातावरण में कमजोरियों को उजागर करने और निर्देशों के विरुद्ध कार्रवाई करने में एक घंटे से अधिक का समय लगा।

दूसरे परिदृश्य में, मॉडल को एक समस्या का समाधान करने के लिए कहा गया था। यह जानने के बाद कि अन्य मॉडलों ने इसे पहले ही सफलतापूर्वक हल कर लिया है, ओपनएआई के मॉडल ने मूल्यांकन प्रणाली के बैकएंड से निजी सबमिशन तक पहुंचने का प्रयास किया। विशेष रूप से, मॉडल ने सिस्टम बैकएंड तक अनधिकृत पहुंच प्राप्त करने के अपने प्रयासों का स्पष्ट रूप से उल्लेख नहीं किया, बड़े अनुक्रम में केवल कुछ पृथक चरणों का खुलासा किया।

इस विज्ञापन के नीचे कहानी जारी है

इस तरह मॉडल की तलाश होती रही इसके सैंडबॉक्स के बाहर कार्य करने के तरीके।

OpenAI ने इस समस्या का समाधान कैसे किया?

इन प्रयोगों के बाद, ओपनएआई ने कहा कि उसने मॉडल की आंतरिक तैनाती को तुरंत रोक दिया और अपनी सुरक्षा प्रणाली को फिर से बनाया। इसने प्रतिकूल मूल्यांकन विधियों के साथ आने के लिए वास्तविक दुनिया की घटनाओं का उपयोग किया जिससे मॉडल द्वारा सुरक्षित व्यवहार किया गया।

OpenAI ने यह भी कहा कि उसने यह सुनिश्चित करने के लिए मॉडल को फिर से प्रशिक्षित किया कि वह लंबे समय से चल रहे कार्यों पर उपयोगकर्ता के निर्देशों को अधिक स्पष्ट रूप से याद रखे। स्टार्टअप ने आगे कहा कि उसने एक विकसित किया है अलग निगरानी प्रणाली मॉडल के कार्यों के संपूर्ण प्रक्षेप पथ का मूल्यांकन करने और उस सत्र पर प्लग को स्वचालित रूप से खींचने के लिए जिम्मेदार है जहां मॉडल सुरक्षा सीमाओं को बायपास करने का प्रयास करता है। ओपनएआई ने कहा कि उपयोगकर्ताओं के लिए लंबे समय तक चलने वाले सत्रों की निगरानी करने और हस्तक्षेप करने की क्षमता में भी सुधार हुआ है।

इसमें एक चेतावनी जोड़ी गई है कि तैनाती-पूर्व सुरक्षा मूल्यांकन कभी भी ऐसे मॉडलों के वास्तविक दुनिया के उपयोग से मेल नहीं खा पाएगा।





Source link

Exit mobile version