इकाई 2 / 11

व्यय और चालान डेटा प्रोसेसिंग

लाभ:

  • एक निश्चित स्कीमा के अनुसार संरचित तालिका में निःशुल्क टेक्स्ट और इनवॉइस डेटा को परिवर्तित करने की क्षमता
  • व्यय वर्गीकरण, वैट बैक गणना और विसंगति का पता लगाने के लिए दोहराए जाने योग्य संकेत स्थापित करने की क्षमता
  • वैट समानता और कुल स्थिरता जांच के साथ निकाले गए वित्तीय क्षेत्रों को सत्यापित करने की क्षमता

लेखांकन टीमें जिन कार्यों पर सबसे अधिक समय खर्च करती हैं उनमें से एक है बिखरे हुए व्यय और चालान डेटा को व्यवस्थित तालिकाओं में व्यवस्थित करना। ईमेल से जुड़ा एक चालान, व्हाट्सएप से भेजी गई रसीद की एक तस्वीर, "अंकारा मीटिंग भोजन + टैक्सी 840 टीएल" जैसा एक मुफ्त-पाठ व्यय नोट... इन सभी को एक ही स्थान पर समाप्त होना चाहिए: श्रेणियों, राशि, वैट (मूल्य वर्धित कर), तिथि और आपूर्तिकर्ता क्षेत्रों के साथ संरचित एक पंक्ति।

इस "मुक्त पाठ से संरचना" परिवर्तन में कृत्रिम बुद्धिमत्ता (एआई) बहुत शक्तिशाली है। लेकिन वित्तीय आंकड़ों में रत्ती भर भी गड़बड़ी होना अस्वीकार्य है। इसलिए इस इकाई में हम दो चीजें एक साथ सीखेंगे: एआई को एक निश्चित स्कीमा (फ़ील्ड की पूर्व निर्धारित सूची) के अनुसार डेटा तैयार करना और समग्र स्थिरता जांच के साथ आउटपुट को मान्य करना।

"स्कीमा" इतना महत्वपूर्ण क्यों है?

स्कीम तब होती है जब आप पहले से बताते हैं कि प्रत्येक पंक्ति में कौन से फ़ील्ड, किस क्रम में और किस प्रारूप में होंगे। यदि आप कोई स्कीमा प्रदान नहीं करते हैं, तो मॉडल प्रत्येक चालान के लिए एक अलग प्रारूप तैयार करता है; फिर उन्हें मैन्युअल रूप से सही किए बिना एक तालिका में संयोजित करना मुश्किल होगा। यदि आप एक स्कीमा प्रदान करते हैं, तो आउटपुट सुसंगत और सत्यापन योग्य दोनों होगा।

एक अच्छे व्यय चार्ट में निम्नलिखित फ़ील्ड शामिल होते हैं: दिनांक, आपूर्तिकर्ता, विवरण, श्रेणी, वैट बहिष्करण राशि (आधार), वैट दर, वैट राशि, वैट सहित कुल, दस्तावेज़ संख्या।

युक्ति: संख्यात्मक फ़ील्ड को हमेशा "अवधि/अल्पविराम" परंपरा से परिभाषित करें। "हजारों विभाजक के बिना, राशियाँ 1234.56 प्रारूप में लिखें" कहने से बाद में एक्सेल में निर्यात करते समय घंटों तक प्रारूपण के दुःस्वप्न से बचा जा सकेगा।

चरण दर चरण: निःशुल्क टेक्स्ट से तालिका तक

  1. योजना को ठीक करें. फ़ील्ड के नाम, क्रम और प्रारूप लिखें.
  2. श्रेणी सूची दीजिए। मॉडल को अपनी सूची में से चुनने के लिए कहें, न कि उसके दिमाग में श्रेणियां बनाने के लिए।
  3. अनिश्चितता का नियम बनाएं. जिस क्षेत्र के बारे में वह निश्चित नहीं है उसे खाली छोड़ दें और "चेक" चिन्ह लगा दें।
  4. वैट तर्क सत्यापित करें. मॉडल से समीकरण आधार + वैट = कुल की जांच करवाएं।
  5. कुल मिलाकर क्रॉस चेक करें. क्या सभी पंक्तियों का योग आपके चेकसम से मेल खाता है?

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत: निम्नलिखित खर्चों को एक तालिका में बदलें: - अंकारा फूड टैक्सी 840 - वैट सहित स्टेशनरी 300 - होटल 2 रातें 3600

यह श्रेणी असंगत, वैट मिश्रित, प्रत्येक पंक्ति पर अलग-अलग प्रारूप के साथ एक आउटपुट देता है।

शक्तिशाली संकेत:निम्नलिखित निःशुल्क पाठ शुल्कों को बिल्कुल इस योजना के अनुसार एक तालिका में परिवर्तित करें:फ़ील्ड (इस क्रम में): दिनांक | आपूर्तिकर्ता | विवरण | श्रेणी |आधार | वैट दर | वैट_राशि | कुल | नोटनियम: - केवल निम्नलिखित सूची से श्रेणी: [यात्रा, आवास, भोजन, स्टेशनरी, परिवहन, अन्य] - राशियाँ 1234.56 प्रारूप में लिखें (हजार विभाजक नहीं)। - यदि "वैट शामिल" कहा गया है, तो आधार और वैट की गणना करें; यदि आप वैट दर नहीं जानते हैं, तो नोट फ़ील्ड में "दर पुष्टिकरण" लिखें और इसे खाली छोड़ दें। - प्रत्येक पंक्ति में कर आधार + VAT_राशि = कुल की समानता प्रदान करें; यदि यह इसे प्रदान नहीं करता है, तो नोट फ़ील्ड में "मिलता नहीं है" लिखें। - जिस फ़ील्ड के बारे में आप निश्चित नहीं हैं उसे छोड़ दें, नोट में "चेक" जोड़ें।

यह संकेत स्टेशनरी के लिए आधार की गणना करता है जिसमें वैट से 250 और वैट से 50 तक शामिल है, अस्पष्ट दरों वाले आइटम को चिह्नित करता है और एक साफ आउटपुट उत्पन्न करता है जिसे एक ही तालिका में जोड़ा जा सकता है।

वैट बैक गणना तर्क

वैट सहित किसी राशि से कर आधार ढूँढना लेखांकन में अक्सर आवश्यक प्रक्रिया है। सूत्र: आधार = कुल / (1 + दर)। उदाहरण के लिए, 20% वैट सहित 300 टीएल के लिए, आधार = 300 / 1.20 = 250, वैट = 50। यदि आप स्पष्ट रूप से मॉडल को यह सूत्र देते हैं, तो त्रुटि का मार्जिन कम हो जाता है।

लेनदेन

सूत्र

नमूना (20%)

वैट शामिल नहीं → शामिल

कुल = आधार × (1 + दर)

250 × 1.20 = 300

वैट शामिल → आधार

आधार = कुल / (1 + दर)

300 / 1.20 = 250

वैट राशि

वैट = कुल - आधार

300 − 250 = 50

नियंत्रण

आधार + वैट = कुल

250 + 50 = 300

चालान फोटो और ओसीआर प्रिंटआउट के साथ कार्य करना

क्षेत्र से व्यय अक्सर रसीद फोटो या पीडीएफ चालान के रूप में आते हैं। इन छवियों से टेक्स्ट निकालने वाली तकनीक को OCR (ऑप्टिकल कैरेक्टर रिकॉग्निशन) कहा जाता है। विज़ुअल एआई उपकरण काम कर सकते हैं, लेकिन ओसीआर आउटपुट हमेशा त्रुटिपूर्ण होता है: अल्पविराम को बिंदु के रूप में पढ़ा जा सकता है, "5" को "एस" के साथ भ्रमित किया जा सकता है, राशि का एक अंक खो सकता है। इसलिए, कभी भी ओसीआर से प्राप्त रकम को सीधे लेखांकन में शामिल न करें।

इस इनवॉइस छवि से निम्नलिखित फ़ील्ड निकालें और उन्हें निम्नलिखित स्कीमा में सटीक रूप से लिखें: दिनांक | आपूर्तिकर्ता | कर_संख्या | आधार | वैट दर | वैट_राशि | totalRules:- किसी भी क्षेत्र में "अपठित" लिखें जिसे आप पढ़ नहीं सकते हैं या जिसके बारे में निश्चित नहीं हैं, अनुमान न लगाएं।- आधार + वेट_राशि = कुल जांचें; यदि नहीं, तो "चेक" चिह्नित करें। - राशि प्रारूप 1234.56 में दें।

यह एक महत्वपूर्ण सुरक्षा नियम है कि किसी को भी अनिश्चित क्षेत्र का अनुमान न लगाया जाए। यदि मॉडल किसी संख्या को "सबसे अधिक संभावना" के साथ पूरा करता है, तो रिकॉर्ड चुपचाप त्रुटि दर्ज कर देता है। "अपठित" ध्वज मानव को मूल दस्तावेज़ पर वापस जाने और उसकी पुष्टि करने की अनुमति देता है।

युक्ति: ओसीआर प्रिंटआउट में, कुल राशि आमतौर पर पढ़ने के लिए सबसे विश्वसनीय फ़ील्ड होती है क्योंकि यह बड़े फ़ॉन्ट में लिखी जाती है। यदि कर आधार + वैट = कुल समीकरण सही नहीं है, तो आप इस समीकरण से पीछे जाकर पता लगा सकते हैं कि त्रुटि किस क्षेत्र में है।

विसंगति और डुप्लिकेट रिकॉर्ड का पता लगाना

एआई सिर्फ अनुवाद नहीं करता; इसमें संदिग्ध वस्तुएं भी मिलती हैं। उदाहरण के लिए, एक ही दिन में एक ही आपूर्तिकर्ता से लगभग एक ही राशि दो बार, या श्रेणी के लिए असामान्य रूप से बड़ा खर्च।

नीचे दी गई व्यय तालिका में, निम्नलिखित विसंगतियों को चिह्नित करें और कारण लिखें: 1) संभावित डुप्लिकेट रिकॉर्ड (समान आपूर्तिकर्ता + समान राशि + हाल की तारीख) 2) श्रेणी औसत से 3 गुना से अधिक राशि 3) श्रेणी के लिए अपेक्षित से अलग वैट दर, बस कारण चिह्नित करें और लिखें; किसी भी पंक्ति को हटाएं या परिवर्तित न करें.

सावधानी: एआई की "यह दोहरावदार हो सकता है" चेतावनी एक संकेत है, निर्णय नहीं। ये दोनों रिकॉर्ड वास्तव में दो अलग-अलग सेवाएँ हो सकते हैं। हटाने या विलय करने का निर्णय हमेशा मनुष्यों द्वारा किया जाता है; मॉडल बस आपका ध्यान खींचती है।

मिनी मामले

केस 1 - 300 चिप्स का ढेर। एक लेखांकन विशेषज्ञ ने आरेख संकेत के साथ लगभग 15 मिनट में 300-पंक्ति मुक्त-पाठ माह-अंत व्यय सूची को एक तालिका में परिवर्तित कर दिया। जिस कार्य को मैन्युअल रूप से करने में 4 घंटे लगते थे, सत्यापन के साथ उसे घटाकर 40 मिनट कर दिया गया। लाभ सिर्फ गति नहीं है; श्रेणी संगति में भी वृद्धि हुई।

केस 2 - दोहरा भुगतान पकड़ा गया। विसंगति संकेत ने संकेत दिया कि एक आपूर्तिकर्ता को 4,720 टीएल का चालान दो अलग-अलग दस्तावेज़ संख्याओं के साथ दो बार दर्ज किया गया था। जांच से पता चला कि एक ड्राफ्ट था और दूसरा अंतिम चालान था, और दोनों का भुगतान बकाया था। एआई के बिना दोहरा भुगतान होगा।

केस 3 - वैट दर जाल। मॉडल ने मुख्य भोजन की खरीद पर 20% वैट लगाया; जबकि वस्तु निम्न दर समूह में थी। "दर पुष्टिकरण" नियम के लिए धन्यवाद, विशेषज्ञ स्रोत द्वारा लाइन को चिह्नित, सत्यापित और सही किया गया था। पाठ: वैट दर को मॉडल पर न छोड़ें, सूची या दस्तावेज़ से इसकी पुष्टि करें।

सामान्य गलतियाँ

  • स्कीमा प्रदान किए बिना डेटा का अनुवाद करना। प्रत्येक पंक्ति एक अलग प्रारूप में आती है, संयोजन के लिए मैन्युअल सुधार की आवश्यकता होती है।
  • श्रेणी सूची उपलब्ध नहीं करायी जा रही है. मॉडल अपनी श्रेणियों में फिट बैठता है; रिपोर्टिंग असंगत हो जाती है.
  • वैट समानता की जाँच नहीं होना। कर आधार + वैट = पंक्तियाँ जो कुल में नहीं जुड़ती हैं उन्हें चुपचाप तालिका में दर्ज कर दिया जाता है।
  • किसी विसंगतिपूर्ण चेतावनी को निर्णय समझ लेना। "दोहराया जा सकता है" एक शुरुआत है; मिटाने का निर्णय मनुष्य करता है।
  • चेकसम छोड़ना. किसी ज्ञात नियंत्रण राशि से पंक्तियों के कुल की तुलना किए बिना आउटपुट पर भरोसा करना।

संक्षेप में

  • एआई के साथ मुफ्त टेक्स्ट व्यय/चालान डेटा संसाधित करते समय, सबसे विश्वसनीय तरीका एक निश्चित स्कीमा के अनुसार आउटपुट का अनुरोध करना है।
  • श्रेणियों की सूची प्रदान करना और स्वरूपण नियमों (अवधि/अल्पविराम, हजारों विभाजक) को स्पष्ट करना आउटपुट को सुसंगत और हस्तांतरणीय रखता है।
  • मॉडल को वैट बैक गणना सूत्र स्पष्ट रूप से दें और प्रत्येक पंक्ति में कर आधार + वैट = कुल की समानता की जांच करें।
  • एआई डुप्लिकेट और असंगत रिकॉर्ड को चिह्नित करने में शक्तिशाली है, लेकिन हटाने/विलय करने का निर्णय हमेशा मानव द्वारा किया जाता है।
  • ज्ञात चेकसम के साथ लाइन योग को क्रॉस-सत्यापन करने से संपूर्ण कार्य सुरक्षित हो जाता है।

आवेदन कार्य

कम से कम 10 पंक्तियों की खर्चों (वास्तविक या नमूना) की मिश्रित सूची तैयार करें; जानबूझकर एक डुप्लिकेट प्रविष्टि और गलत वैट दर वाला एक आइटम शामिल करें। इसे शक्तिशाली प्रॉम्प्ट टेम्पलेट के साथ एक तालिका में बदलें, फिर विसंगति प्रॉम्प्ट चलाएँ। जांचें कि क्या मॉडल आपके द्वारा निर्धारित दो जालों को पकड़ता है और तीन पंक्तियों में वैट समानता को मैन्युअल रूप से सत्यापित करें।

चेकलिस्ट

  • [ ] मैंने फ़ील्ड नाम, क्रम और प्रारूप के साथ एक निश्चित स्कीमा परिभाषित किया है।
  • [ ] मैंने मॉडल को श्रेणी सूची दी, मैंने इसे बनाने नहीं दिया।
  • [ ] मैंने संख्यात्मक प्रारूप (अवधि/अल्पविराम, कोई हजारों विभाजक नहीं) नियम जोड़ा।
  • मैंने [ ] कर आधार + वैट = कुल समानता की जाँच की।
  • [ ] मैंने एक विसंगति/डुप्लिकेट स्कैन करवाया और एक इंसान के रूप में निर्णय लिया।
  • [ ] मैंने पंक्ति के कुल योग की तुलना ज्ञात चेकसम से की।