लाभ:
- कृत्रिम बुद्धिमत्ता के साथ डेटा सेट का पता लगाने, समाचार योग्य प्रश्न उत्पन्न करने और संवेदनशील डेटा निकालने की क्षमता
- कृत्रिम बुद्धिमत्ता के बजाय गणनाएँ करें, वर्णित विधि को अपनाएँ और एक श्रवण योग्य उपकरण में चलाएँ और प्रत्येक निष्कर्ष को कच्चे डेटा से सत्यापित करने की आदत डालें।
- यह समझते हुए कि यह पत्रकार की ज़िम्मेदारी है कि वह आउटलेर्स का मसौदा तैयार करे और अभिलेखीय संबंधों का दस्तावेजीकरण करे और मूल स्रोत में उनकी पुष्टि करे।
खोजी पत्रकारिता अक्सर ढेर से शुरू होती है: हजारों पंक्तियों की एक निविदा स्प्रेडशीट, सैकड़ों पृष्ठों की एक बैलेंस शीट, एक लीक हुआ ईमेल संग्रह, एक ओपन-सोर्स सार्वजनिक व्यय सेट। डेटा पत्रकारिता - संख्यात्मक और दस्तावेजी डेटा में पैटर्न, विसंगतियों और संबंधों को खोजने और उन्हें समाचार में बदलने का अभ्यास - वास्तव में इस द्रव्यमान को समझने का काम है। इन ढेरों में, जिन्हें मैन्युअल रूप से देखने में एक मानव जीवन लग जाएगा, कृत्रिम बुद्धिमत्ता (एआई) एक शक्तिशाली प्रथम-स्क्रीनिंग और विचार उत्पन्न करने वाला उपकरण है: यह एक तालिका को सारांशित कर सकता है, एक पाठ संग्रह में डुप्लिकेट नाम निकाल सकता है, सुझाव दे सकता है कि विश्लेषण के लिए कौन से प्रश्न पूछे जाएं, यहां तक कि डेटा सफाई के चरणों का भी वर्णन किया जा सकता है। लेकिन आइए शुरू से एक वाक्य कहें: एआई डेटा का विश्लेषण करने में भागीदार है; यह पत्रकार ही है जो परिणाम की सटीकता और समाचार मूल्य तय करता है और कच्चे डेटा से संख्या की फिर से जांच करता है। संख्या के हिसाब से मतिभ्रम का खतरा यहां सबसे खतरनाक है।
चरण दर चरण: AI के साथ डेटा सेट की खोज करना
चरण 1 - डेटा के बारे में जानें। सबसे पहले कॉलम, पंक्तियों की संख्या, दिनांक सीमा, इकाइयों को समझें। कच्ची फ़ाइल को एआई में लोड करने से पहले स्वयं जानें कि यह क्या है; अन्यथा, एआई के "निष्कर्ष" हवा में ही रहेंगे।
चरण 2 - संवेदनशील डेटा निकालें। यदि इसमें व्यक्तिगत डेटा (नाम, टीआर आईडी, पता, स्वास्थ्य) है, तो इसे सार्वजनिक एआई टूल को दिए बिना अज्ञात करें या केवल विश्लेषण के लिए कॉलम भेजें। स्रोत का खुलासा करने वाले लीक हुए दस्तावेज़ों के निशान भी साफ़ कर दिए गए हैं (इकाई 1 और 10)।
चरण 3 - एआई के साथ खोज प्रश्न उत्पन्न करें। "यह डेटा सेट कौन सी ख़बर छुपा सकता है?" कहकर प्रारंभ करें. एआई पूछने के लिए प्रश्नों की एक सूची लेकर आता है: शीर्ष 10 आइटम, बार-बार आपूर्तिकर्ता, असामान्य छलांग, खाली छोड़े गए क्षेत्र।
चरण 4 - एआई के पास विश्लेषण न करें, उसका वर्णन करें। यह महत्वपूर्ण बिंदु है. एआई दिमाग में जिस औसत या प्रतिशत की गणना करता है वह अक्सर गलत होता है। इसके बजाय, एआई से उन चरणों के बारे में पूछें जिन्हें आप एक विश्वसनीय टूल (स्प्रेडशीट फॉर्मूला, क्वेरी, स्क्रिप्ट) में चलाएंगे। इस प्रकार कैलकुलस को एक श्रवण योग्य उपकरण बनाते हुए, एआई सिर्फ विधि देता है।
चरण 5 - निष्कर्ष को सत्यापित करें। प्रत्येक विसंगति को देखें जिसे एआई कच्ची रेखा पर वापस जाकर इंगित करता है। तालिका को फ़िल्टर करें और दावे को गिनें "इस कंपनी ने 40 में से 31 निविदाएं जीतीं"। कोई भी असत्यापित संख्या समाचार में नहीं आएगी।
चरण 6 - संदर्भ स्थापित करें। सिर्फ संख्या ही खबर नहीं है. तुलना (पिछले वर्ष, समान संस्थान, जनसंख्या का अनुपात), संदर्भ और विशेषज्ञ की राय पत्रकार का काम है।
ध्यान दें: एआई का यह कहना कि "इस तालिका के औसत की गणना करें" और परिणाम को सीधे समाचार में डालना डेटा पत्रकारिता की सबसे आम अस्वीकरण-उत्पादक गलती है। एआई एक भाषा मॉडल है, कैलकुलेटर नहीं। टूल से गणित करवाएं, बस विधि और व्याख्या के लिए एआई से पूछें।
मेटाडेटा और दस्तावेज़ विश्लेषण
संख्यात्मक तालिकाओं के अलावा, खोजी पत्रकारिता बड़े पाठ संग्रहों से भी संबंधित है: ईमेल, मिनट्स, अनुबंध। यहां, एआई "किसने किससे कब बात की", "कौन सा विषय दोहराया गया है", "कौन से नामों का एक साथ उल्लेख किया गया है" जैसे संबंध मानचित्र तैयार कर सकता है। फिर, नियम वही है: एआई एक प्रारंभिक मानचित्र देता है; मूल दस्तावेज़ में प्रत्येक लिंक की पुष्टि की जाती है, क्योंकि AI उस लिंक को स्पष्ट रूप से समझा सकता है जो मौजूद नहीं है।
तीन मिनी मामले
केस 1 - छुपा हुआ संक्षेपण। एक रिपोर्टर के पास 2,400 पंक्तियों वाली सार्वजनिक खरीद स्प्रेडशीट थी। उनके पास एआई से खोजपूर्ण प्रश्न थे; प्रश्न "एक ही आपूर्तिकर्ता को कितनी निविदाएँ प्राप्त हुईं?" सामने आया. रिपोर्टर के पास इसकी गणना करने के लिए AI नहीं था; उन्होंने स्वयं YZ द्वारा सुझाए गए स्प्रेडशीट फॉर्मूले को चलाया और पाया कि एक एकल फर्म को 2,400 वस्तुओं में से 380 (15.8%) प्राप्त हुए। उन्होंने इसे मैन्युअल रूप से जांचा और संख्या सही थी। एआई के प्रारंभिक "अनुमान" में 22% कहा गया है - इसलिए यदि एआई पर भरोसा किया जाए, तो खबर गलत होगी।
केस 2 - समय बचाने वाला, ईमेल संग्रह। 6,000 ईमेल के संग्रह में "कौन से विषय चल रहे हैं" को मैन्युअल रूप से खोजने में कई दिन लगेंगे। एआई ने 15 मिनट में विषय समूहों की एक रूपरेखा तैयार की; इनमें से, रिपोर्टर ने 3 आशाजनक समूहों का चयन किया और मूल ईमेल पढ़े। कुल खोज का समय घटाकर ~3 दिन कर दिया गया, लेकिन लाइव होने वाले प्रत्येक उद्धरण को मूल ईमेल से शब्दशः सत्यापित किया गया था।
केस 3 - मतिभ्रम पकड़ा गया। एक आर्थिक रिपोर्टर को YZ से एक सारांश प्राप्त हुआ कि बैलेंस शीट से "एक वर्ष में कार्मिक खर्च 60% बढ़ गया"। जब वह रॉ टेबल पर लौटा, तो उसने देखा कि वृद्धि 6% थी और एआई ने एक अंक को गलत तरीके से पढ़ा था। एक एकल तथ्य जांच ने "60% विस्फोट" जैसे झूठे और दिखावटी शीर्षक को अवरुद्ध कर दिया।
कॉपी करने योग्य टेम्पलेट
1) डेटा सेट पहचान और खोज प्रश्न:
मैं आपको कॉलम शीर्षक और डेटा सेट की पहली 20 पंक्तियाँ दूंगा। 10 पत्रकारीय प्रश्न उत्पन्न करें जो इस डेटा के साथ किए जा सकते हैं: एकाग्रता, बाहरी, समय में उछाल, लापता/खाली क्षेत्र, आवर्ती अभिनेताओं के संदर्भ में। कोई संख्या गणना नहीं; बस यह लिखें कि कौन से प्रश्न पूछने लायक हैं और वे समाचार क्यों बन सकते हैं। डेटा: [शीर्षक + नमूना पंक्तियाँ]
2) गणनाएँ करना नहीं, बल्कि उनका वर्णन करना:
मैं निम्नलिखित विश्लेषण करना चाहता हूं: [उदा. प्रत्येक आपूर्तिकर्ता की कुल निविदा राशि और शेयर प्रतिशत ज्ञात करें]। मैं इसे स्वयं एक स्प्रेडशीट में चलाना चाहता हूं। मुझे चरण दर चरण लिखें कि कौन से फ़ॉर्मूले/पिवट सेटिंग्स इंस्टॉल करनी हैं। एसईएन गणना का परिणाम; बस विधि बताएं। मेरे कॉलम: [कॉलम नाम]
3) बाहरी शिकार:
मैं नीचे सारांश आँकड़े (न्यूनतम, अधिकतम, औसत, माध्यिका) दूँगा। बताएं कि कौन से मूल्य असामान्य/संदिग्ध हैं और मुझे समाचार के लिए उनकी जांच क्यों करनी चाहिए। अंतिम निर्णय न लें; एक चेकलिस्ट "निम्नलिखित पंक्तियों को मैन्युअल रूप से जांचा जाना चाहिए" प्रारूप में दिखाई देती है। सारांश: [यहाँ]
4) दस्तावेज़ संग्रह संबंध मानचित्र (ड्राफ्ट):
मैं आपको दस्तावेज़ पाठ का एक सेट दूंगा। निम्नलिखित को ड्राफ्ट के रूप में आउटपुट करें: नाम जो अक्सर एक साथ आते हैं, आवर्ती विषय, उल्लेखनीय तिथियां। उस दस्तावेज़ को चिह्नित करें जिसमें से प्रत्येक लिंक आता है, जैसे [बी12]। ऐसा कोई भी संबंध न जोड़ें जो दस्तावेज़ में स्पष्ट रूप से नहीं लिखा गया हो। दस्तावेज़ीकरण: [यहाँ]
कमजोर संकेत/मजबूत संकेत
कमजोर संकेत: "इस चार्ट का विश्लेषण करें और कोई महत्वपूर्ण निष्कर्ष बताएं।"
परिणाम: एआई प्रतिशत और औसत बनाता है, विसंगतियों की कल्पना करता है, यह स्पष्ट नहीं है कि यह किस रेखा पर आधारित है। इसे सत्यापित नहीं किया जा सकता.
शक्तिशाली संकेत: "मैं इस तालिका के कॉलम और पहली 20 पंक्तियाँ देता हूँ। (1) सूची बनाएं कि कौन सा विश्लेषण समाचार योग्य हो सकता है। (2) प्रत्येक विश्लेषण के लिए एक स्प्रेडशीट फॉर्मूला सुझाएं ताकि मैं इसे चला सकूं। (3) किसी भी परिणाम की गणना न करें। (4) जांच की जाने वाली पंक्तियों को चिह्नित करें, जैसे [एस45]।"
अंतर: मजबूत संकेत गणना को नियंत्रणीय उपकरण पर छोड़ देता है, एआई को विधि और दिशा की भूमिका में कम कर देता है; मतिभ्रम को संख्या में लीक होने से रोकता है।
तुलना चार्ट
मंच
एआई करता है
पत्रकार करता है
सत्यापन
डेटा को पहचानना
कॉलम/पैटर्न सारांश
इकाई और संदर्भ जानता है
स्रोत डेटा शब्दकोश
खोज प्रश्न
प्रश्नों की एक सूची तैयार करता है
समाचार मान का चयन करता है
—
गणना
विधि का वर्णन करता है
वाहन में सूत्र चलाता है
मैन्युअल प्रावधान
बाह्य
अभ्यर्थियों को चिन्हित करता है
कच्ची रेखा को देखता है
फ़िल्टर करें और गिनें
टिप्पणी/संदर्भ
ड्राफ्ट फ्रेम
तुलना, विशेषज्ञ
दूसरा स्रोत
सामान्य गलतियाँ
- एआई गणना करना। एआई के माध्यम से औसत, प्रतिशत, कुल आदि की गणना करें और परिणाम का उपयोग करें; एआई अक्सर गलतियाँ करता है, वाहन को गणित करने दें।
- खोज को कच्ची रेखा से नहीं जोड़ना। तालिका को फ़िल्टर किए बिना और गिनती किए बिना "इस कंपनी ने अधिकांश निविदाएं जीतीं" दावा लिखना।
- बिना सन्दर्भ के संख्याएँ प्रकाशित करना। तुलना और अनुपात के बिना खाली संख्याओं की रिपोर्ट करना भ्रामक है।
- संवेदनशील डेटा को वैसे ही अपलोड किया जा रहा है. वाहन को साफ़ किए बिना व्यक्तिगत डेटा या स्रोत बताने वाला दस्तावेज़ देना।
- ये सोच कर कि झूठा रिश्ता सच्चा है. उस लिंक को संसाधित करना जिसे एआई संग्रह में "देखता है" मूल दस्तावेज़ में इसकी पुष्टि किए बिना मानचित्र में।
सारांश
डेटा पत्रकारिता में, एआई एक खोज और अंतर्दृष्टि भागीदार है: यह ढेर को स्कैन करता है, पूछने के लिए प्रश्न उत्पन्न करता है, विश्लेषण की विधि का वर्णन करता है, आउटलेर्स के लिए उम्मीदवारों को चिह्नित करता है। लेकिन AI द्वारा संख्या की गणना करना ही सबसे जोखिम भरी गलती है; गणना को एक ऑडिटेबल टूल पर आउटसोर्स करें, कच्चे डेटा पर वापस जाकर प्रत्येक निष्कर्ष को सत्यापित करें, और संख्या में संदर्भ और तुलना जोड़ें। दस्तावेज़ अभिलेखागार में, AI एक प्रारंभिक मानचित्र देता है; मूल दस्तावेज़ में प्रत्येक लिंक की पुष्टि की गई है।
आवेदन कार्य
आपके पास मौजूद (या सार्वजनिक रूप से उपलब्ध) डेटा सेट लें। सबसे पहले, उन्हें "अन्वेषण प्रश्न" प्रॉम्प्ट के साथ 10 प्रश्न उत्पन्न करने को कहें। एक प्रश्न चुनें, "गणना का वर्णन करें" संकेत के साथ एआई से सूत्र प्राप्त करें, और इसे स्वयं चलाएं। फिर एआई से सीधे उसी गणना के लिए पूछें और दोनों परिणामों की तुलना करें; अंतर और उसके सबक पर ध्यान दें।
चेकलिस्ट
- [ ] टूल में डेटा देने से पहले मैंने कॉलम, यूनिट और संवेदनशील फ़ील्ड को समझा।
- [ ] मैं एआई को गणना नहीं करने देता; मैं विधि का वर्णन करता हूं और इसे ऑडिटेबल टूल में चलाता हूं।
- [ ] मैं कच्ची पंक्ति पर वापस जाकर प्रत्येक निष्कर्ष को मैन्युअल रूप से सत्यापित करता हूं।
- [ ] मैं संख्या में तुलना और संदर्भ जोड़ता हूं; मैं खाली संख्याएँ नहीं बता रहा हूँ।
- [ ] मैं मूल दस्तावेज़ के संग्रह में प्रत्येक संबंध की पुष्टि करता हूं।