ትርፍ፡
- ንድፍ እና ደንብ ላይ የተመሠረተ የውጤት ማረጋገጫ ንብርብሮችን የማቋቋም ችሎታ
- ከፍተኛ ተጽዕኖ በሚያሳድሩ ውሳኔዎች ትርጉም ባለው መልኩ የሰው ልጅን የመፈለግ ችሎታ
- ከሁለተኛው ሞዴል ጋር የማረጋገጫ ንድፍ የመንደፍ እና የመነሻ ደረጃን የመተማመን ችሎታ
የቋንቋ ሞዴል ፈሳሽ፣ አሳማኝ እና ብዙ ጊዜ ትክክለኛ ያመነጫል - ነገር ግን "ማሳመን" ከ"ትክክለኛ" ጋር አንድ አይነት አይደለም። ሞዴሉ መጠንን፣ ቀንን ወይም የJSON መስክን በጸጥታ ማስማማት ይችላል። ይህ ቅዠት (ሞዴሉ በእውነታው ላይ የማይገኝ መረጃን በልበ ሙሉነት ያመጣል) ይባላል. በድርጅት ሥርዓት ውስጥ፣ ያ ውፅዓት ወደሚቀጥለው ደረጃ የሚፈስ ከሆነ - ክፍያ፣ ኢሜል፣ የውሂብ ጎታ ይፃፉ - ስህተቱ ወደ እውነተኛው ዓለም ይሄዳል። በዚህ ክፍል ውስጥ፣ ወደ ስርዓቱ ከመግባቱ በፊት ውጤቱን በማረጋገጫ ንብርብሮች ማጣራት እና ከፍተኛ ተጽዕኖ በሚያሳድሩ ውሳኔዎች ውስጥ የሰው ልጅ መፈለግን እንማራለን።
የውጤት ማረጋገጫ ለምን ያስፈልጋል?
የሞዴል ውፅዓት በሁለት ዋና መንገዶች ሊበላሽ ይችላል-ቅርጸት (ከተጠበቀው JSON እቅድ ጋር አይጣጣምም, መስክ ጠፍቷል / ከመጠን በላይ) እና ይዘት (ቅርጸቱ ትክክል ነው ነገር ግን እሴቱ የተሳሳተ ነው - የሌለ ምርት ኮድ, ምክንያታዊ ያልሆነ ቀን). ከደህንነት አንፃር ሦስተኛው ልኬት አለ፡ ተንኮል አዘል ውፅዓት (በመርፌ ወይም በማፍሰስ ምክንያት የሚፈጠር ተንኮል አዘል ትእዛዝ)። ጠንካራ ስርዓት ሦስቱንም በር ላይ ያቆማል.
ጥንቃቄ፡- "በአጠቃላይ ትክክለኛ ሞዴል" የምርት መስፈርት አይደለም። ማረጋገጫ በሌለበት ስርዓት በሺህ ውስጥ አንድ ስህተት እንኳን በቀን 100,000 ጥያቄዎች ውስጥ በቀን 100 የተሳሳቱ ግብይቶች ማለት ነው።
የማረጋገጫ ንብርብሮች፡ ደረጃ በደረጃ
- የመርሃግብር ማረጋገጫ። ውጤቱ ከሚጠበቀው መዋቅር ጋር የሚጣጣም መሆኑን በማሽኑ ያረጋግጡ: መስኮቹ ይገኛሉ, የእነሱ ዓይነቶች ትክክል ናቸው, አስፈላጊዎቹ መስኮች ተሞልተዋል?
- ደንብ/የንግድ ሎጂክ ማረጋገጫ። እሴቶቹ ከንግድ ሕጎች ጋር ይዛመዳሉ? (መጠን > 0፣ ቀን ወደፊት አይደለም፣ የምርት ኮድ የካታሎግ ነው።)
- ማጣቀሻ/ምንጭ ቁጥጥር. ሞዴሉ ማረጋገጫ ካቀረበ ከምንጩ ጋር ሊገናኝ ይችላል? (የ RAG ጥቅስ በእውነቱ በሰነዱ ውስጥ አለ?)
- ከሁለተኛው ሞዴል (LLM-እንደ ዳኛ) ጋር ማረጋገጥ. ገለልተኛ ሞዴል ውጤቱን እንደ "ትክክል/ያልተጠናቀቀ/አደጋ" ይገመግማል።
- የእምነት ገደብ እና አቅጣጫ። ሞዴሉ ወይም አረጋጋጭ ዝቅተኛ በራስ መተማመንን ከዘገበው, ውፅዓት በራስ-ሰር አያልፍም; ወደ ሰዎች ይመራል።
- የሰው ቁጥጥር. ከፍተኛ አቅም ወይም ዝቅተኛ-ደህንነት ያለው ውጤት በባለሙያዎች ይሁንታ ላይ የተመሰረተ ነው.
አራት ሊገለበጡ የሚችሉ አብነቶች
እቅድ + "ካላወቃችሁ አስተካክሉት" አንድ ላይ፡-
ምላሹን በሚከተለው የJSON ንድፍ ብቻ ይመልሱ፡ "ዝቅተኛ" ይጻፉ። ግምቱ ትክክል እንደሆነ በጭራሽ አይጻፉ።
በሁለተኛው ሞዴል ማረጋገጫ (የዳኛ ጥያቄ)፡-
እርስዎ ገለልተኛ አረጋጋጭ ነዎት። ከዚህ በታች <ምንጭ> ጽሑፍ እና <የይገባኛል ጥያቄ> አለ። የይገባኛል ጥያቄው ውስጥ ያለው እያንዳንዱ ቁጥር እና ቀን ምንጩ ውስጥ ቃል በቃል መከሰቱን ያረጋግጡ። ለእያንዳንዳቸው፡ "የተረጋገጠ | ከምንጭ አይደለም | ምንጩን ይቃረናል" ይበሉ። ከመካከላቸው አንዱ እንኳን 'የሌለ/የሚጋጭ' ከሆነ፣ ውጤቱን እንደ "ሰብአዊ ግምገማ ያስፈልጋል" ምልክት ያድርጉበት።<ምንጭ>{{ጽሑፍ }}</source><claim>{{ model_output }}</claim>
የመነሻ ማዘዋወር ደንብን ይመኑ፡
የማዞሪያ ህግ፡- emin_misin = "ከፍተኛ" እና መጠን <10,000 TL -> አውቶማቲክ ሂደት- emin_misin = "መካከለኛ" ወይም መጠን 10,000-100,000 TL -> ሁለተኛ ሞዴል ማረጋገጫ- emin_misin = "ዝቅተኛ" ወይም መጠን > 100,000 TL -> የሰው ፈቃድ ያስፈልጋል
የሰው ኦዲት ማጠቃለያ ካርድ (ግምገማውን ያፋጥናል)
ውሳኔውን ለአንድ ሰው ሲያቀርቡ, ይህንን ካርድ ያዘጋጁ: - ምን እየቀረበ ነው? (አንድ ዓረፍተ ነገር) - በምን ምንጭ ላይ የተመሰረተ ነው? (አንቀጽ / ሰነድ ማጣቀሻ) - 2 በጣም ደካማ ግምቶች ምንድን ናቸው? - ከፀደቁ, ሊገለበጡ ይችላሉ? (አዎ/አይ)
ደካማ ፈጣን/ጠንካራ ፍጥነት
ደካማ አቀራረብ
ጠንካራ አቀራረብ
"ከክፍያ መጠየቂያ ደረሰኝ ቀንስ" (ነጻ ጽሑፍ)
ጥብቅ የJSON schema + null + እምነት መስክ
ውጤቱን በቀጥታ ወደ የክፍያ ስርዓት መፃፍ
መርሐግብር → ደንብ → የሰው ፈቃድ (አስፈላጊ ከሆነ)
ሞዴሉን "እርግጠኛ ሁን" በማለት ብቻ
ቁጥር/ቀን ማረጋገጫ ከሁለተኛው ሞዴል ጋር
እያንዳንዱን ምርት በእኩል መተማመን ማካሄድ
በተፅእኖ እና እምነት ላይ የተመሰረተ መስመር
ጠንካራው አቀራረብ ሞዴሉ ትክክል ነው ብሎ ተስፋ አያደርግም; ስትሳሳት የሚይዝህ በር ይፈጥራል።
ሶስት ሚኒ ጉዳዮች
ጉዳይ 1 - እቅዱ ብቻውን በቂ አልነበረም. የሂሳብ አያያዝ አውቶማቲክ መጠኑን ከደረሰኞች እንደ JSON እያወጣ ነበር። መርሃግብሩ ትክክል ነበር፣ ነገር ግን ሞዴሉ በ "1,250.00" ምትክ "125,000" በደረሰኝ (የአስርዮሽ ፈረቃ) አወጣ። መርሃግብሩ ይህንን ለመያዝ አልቻለም; የደንብ ማረጋገጫ ("ገንዘቡ ከጠቅላላው የክፍያ መጠየቂያ እቃዎች በ ± 1% ጋር የሚስማማ መሆን አለበት") ተይዟል እና 112,500 TL የተሳሳተ ቀረጻ ተከልክሏል.
ጉዳይ 2 - ሁለተኛው ሞዴል ቅዠትን ያዘ. የሕግ ድጋፍ ሰጪ ረዳት በኮንትራቱ ማጠቃለያ ላይ "የ 30 ቀናት የማቋረጥ ማስታወቂያ" አለ; ይሁን እንጂ በውሉ ውስጥ 90 ቀናት ነበር. ነፃው ዳኛ ሞዴሉን "ከምንጩ ጋር ይጋጫል" ብሎ ሲጠቁመው ውጤቱ ወደ ሰው ተላልፏል እና ተስተካክሏል. አውቶማቲክ ከሆነ ደንበኛው ስረዛውን በተሳሳተ ቀን መሠረት ያሳውቃል።
ጉዳይ 3 - ማዘዋወር ጭነቱን በ 70% ቀንሷል. የኢንሹራንስ የይገባኛል ጥያቄ ስርዓት ዝቅተኛ መጠን እና ከፍተኛ የደህንነት ጥያቄዎችን በራስ-ሰር አጽድቆ ከላይ/ደህንነታቸው ዝቅተኛ የሆኑትን ብቻ ለባለሙያው ልኳል። ከ 3,200 ዕለታዊ ፍላጎቶች ውስጥ, 950 ብቻ በሰዎች ላይ ወድቀዋል; ባለሙያዎች ጊዜያቸውን ለእውነተኛው አደገኛ 30% አሳልፈው ሰጥተዋል፣ አማካይ የግብይት ጊዜ ከ4 ሰዓት ወደ 40 ደቂቃዎች ወርዷል።
ጠቃሚ ምክር፡ "ሰዎች ሁሉንም ነገር ማየት እንዲችሉ" የሰው ቁጥጥር አታስቀምጡ - ይህ ሰዎችን ያደክማል እና ተቀባይነት የጎማ ማህተም ይሆናል። ይልቁንስ ከፍተኛ ተጽዕኖ እና ዝቅተኛ በራስ መተማመን ውጤቶችን ወደ ሰው ብቻ ያዙሩ; ይህ በእውነቱ አስፈላጊ በሆኑ ነገሮች ላይ ያተኩራል.
የሰው ቁጥጥርን ትርጉም ያለው ማድረግ
ሰው-በ-ሉፕ አመልካች ሳጥን በወረቀት ላይ ስለማስቀመጥ አይደለም። ገምጋሚው (1) ውሳኔውን ለመረዳት አውድ፣ (2) ምንጩን ማግኘት እና (3) “አይሆንም” የማለት ሥልጣን ሊኖረው ይገባል። አለበለዚያ መቆጣጠሪያው መዋቢያ ይቀራል. የግምገማ ካርዱ (ከላይ አራተኛው አብነት) ያንን አውድ ለማቅረብ ነው።
የተለመዱ ስህተቶች
- የመርሃግብር ማረጋገጫን ማድረግ እና የይዘት/የእሴት ስህተቶችን መዝለል ብቻ።
- ሞዴሉን "አረጋግጥ" በመንገር እውነተኛ ማረጋገጫ እየሰሩ እንደሆነ በማሰብ።
- ከፍተኛ ተጽዕኖ የሚያሳድሩ እና የማይመለሱ ውሳኔዎችን በራስ-ሰር ይተግብሩ።
- በእያንዳንዱ ውፅዓት ላይ የሰው ቁጥጥር ማድረግ እና ማፅደቅን ወደ ትርጉም የለሽ የጎማ ማህተም መለወጥ።
- ምንጩን እና አውዱን ሳይሰጡ ለገምጋሚው "አጽድቁ" በማለት።
- የእምነት ገደብ እና ማዘዋወር ሳያስፈልግ ሁሉንም ውጤቶች በተመሳሳይ አደጋ ማካሄድ።
በማጠቃለያው
- ውጤቱ በሦስት መንገዶች ተበላሽቷል፡ ቅጽ፣ ይዘት እና ተንኮል አዘል ዓላማ; ጠንካራ ስርዓት ሦስቱንም በር ላይ ያቆማል.
- ንብርብሮች፡ የሼማ ማረጋገጫ፣ ደንብ/ቢዝነስ አመክንዮ፣ የምንጭ ቁጥጥር፣ ሁለተኛ ሞዴል (ኤልኤልኤም-እንደ ዳኛ)፣ እና የእምነት ገደብ ማዘዋወር።
- ለከፍተኛ ተፅእኖ እና ዝቅተኛ-ደህንነት ውጤቶች የሰው-በ-ዘ-ሉፕ አስገዳጅ መሆን አለበት.
- የሰዎች ግምገማ ትርጉም ያለው መሆን አለበት፡ ገምጋሚው አውድ፣ የሀብት መዳረሻ እና “አይሆንም” የማለት ስልጣን ሊኖረው ይገባል።
- ሁለቱም ደህንነት እና ቅልጥፍና የሚገኘው እያንዳንዱን ምርት ሳይሆን አደገኛ የሆኑትን ወደ ሰዎች ብቻ በመምራት ነው።
የመተግበሪያ ተግባር
ከራስዎ AI ውፅዓት ምሳሌ ይውሰዱ። መጀመሪያ የJSON ንድፍ ይግለጹ እና ውጤቱን ወደ እሱ ያስገድዱት። ከዚያም ቢያንስ ሁለት የንግድ ደንቦችን ይፃፉ (ለምሳሌ, "መጠን ከጠቅላላው እቃዎች ጋር ይዛመዳል"). በመጨረሻም የማዞሪያ ሠንጠረዥን አዘጋጁ፡ የትኛው እምነት/ተፅእኖ ውህድ በራስ-ሰር ይሄዳል፣ ወደ ሁለተኛው ሞዴል የሚሄደው፣ ወደ ሰው የሚሄደው? የተሳሳተ ናሙና ይፍጠሩ እና እያንዳንዱ ሽፋን የት እንደሚይዝ ይመልከቱ።
የማረጋገጫ ዝርዝር
- [] ለውጤቱ ጥብቅ ንድፍ እገልጻለሁ እና በማሽኑ አረጋግጣለሁ።
- [] ቢያንስ አንድ የንግድ/የደንቦች ማረጋገጫ (የእሴት አመክንዮ) አክዬያለሁ።
- [ ] ማረጋገጫዎቹን ከምንጩ ጋር አቆራኝቼ ማረጋገጥ እችላለሁ።
- [] ለከፍተኛ ተጽዕኖ/ዝቅተኛ የደህንነት ውጤቶች ሁለተኛ ሞዴል ወይም የሰው ማረጋገጫ ይገኛል።
- [ ] የመተላለፊያ ደንብ በመተማመን እና በተጽእኖ ላይ በመመስረት ይገለጻል።
- [ ] ገምጋሚው አውድ፣ ምንጭ እና ውድቅ የማድረግ ስልጣን ተሰጥቶታል።