ክፍል 6 / 11

የመላምት ሙከራ እና ፒ-እሴት፡ አስፈላጊነት፣ ኃይል እና በርካታ ንጽጽሮች

ትርፍ፡

  • ባዶ መላምት፣ ፒ-እሴት፣ የመተማመን ክፍተት እና ስታቲስቲካዊ ኃይልን በትክክል የመግለጽ ችሎታ እና በፈተና ምርጫ እና አተረጓጎም ውስጥ አርቴፊሻል ኢንተለጀንስ የመጠቀም ችሎታ።
  • የ p-value የሆነውን እና ያልሆነውን የመለየት ችሎታ (የተፅዕኖ መጠን አይደለም ፣ የትክክለኛነት ዕድል ሳይሆን) እና ብዙ የንፅፅር እርማት ለምን አስፈላጊ እንደሆነ ይረዱ
  • በአርቴፊሻል ኢንተለጀንስ የተሰጡ አስተያየቶችን የማወቅ ችሎታ እና ትርጉም ያለውነትን ከቁሳዊነት ጋር ግራ የሚያጋቡ እና በውጤት መጠን እና እርግጠኛነት ሪፖርት ያደረጉ

በጣም ጥቅም ላይ የዋለው እና በጣም ያልተረዳው የስታቲስቲክስ መሳሪያ መላምት ሙከራ ነው። መሰረታዊ ሀሳቡ ቀላል ነው፡ የይገባኛል ጥያቄ አለን (ለምሳሌ “የእነዚህ ሁለት ቡድኖች አማካኝ የተለየ ነው”) እና ተቃራኒው፣ ባዶ መላምት (H0 — “በእርግጥ ምንም ልዩነት የለም”)። ፈተናው መረጃው ከንቱ መላምት ጋር ምን ያህል እንደሚስማማ ይለካል። በዚህ ክፍል ውስጥ አርቴፊሻል ኢንተለጀንስ (AI) የፈተና ምርጫን እና አተረጓጎምን እንዴት ቀላል እንደሚያደርግ እናያለን ነገርግን በ p-value ዙሪያ ያሉ ወጥመዶች ለምን የተለመዱ እና አደገኛ እንደሆኑ እንመለከታለን። ከመጀመሪያው እንጀምር፡ AI የትኛውን የፈተና አገባብ መፃፍ እንዳለበት ያውቃል። ነገር ግን የፈተናው ግምት መሟላቱን እና ውጤቱ ምን ማለት እንደሆነ መተርጎም የእርስዎ ስራ ነው።

በእውነቱ p-value ምንድነው?

ፒ-እሴቱ እርስዎ የሚመለከቱት ውጤት ወይም በጣም የከፋ ውጤት፣ ባዶ መላምት እውነት ሲሆን በአጋጣሚ የመከሰቱ ዕድል ነው (ማለትም፣ ምንም ውጤት የለም)። አንድ ትንሽ p-እሴት (0.05 ባህላዊ ደፍ ነው) ማለት "በእርግጥ ምንም ውጤት ከሌለ እንዲህ ያለ ውሂብ ማየት የሚያስደንቅ ነበር"; ይህ ከንቱ መላምት ላይ እንደ ማስረጃ ይቆጠራል።

አሁን ፒ-እሴቱ ምን እንዳልሆነ እናብራራ - የትኛው AI ብዙውን ጊዜ ግራ የሚያጋባ ነው-

  • p-value ባዶ መላምት እውነት የመሆን እድሉ አይደለም። p=0.03 "ምንም ውጤት የማያስከትል 3% ዕድል አለ" ማለት አይደለም።
  • ፒ-እሴቱ የውጤቱን መጠን አያመለክትም. በጣም ትንሽ የሆነ ውጤት በትልቅ ናሙና ውስጥ ትንሽ p-valueን ሊያመጣ ይችላል.
  • ፒ-እሴቱ ግኝቱ ጠቃሚ ወይም እውነተኛ መሆኑን አያረጋግጥም። "ጉልህ" የስታቲስቲክስ ቃል ነው, "ጉልህ" ፍርድ ነው.
  • p>0.05 "ምንም ውጤት የለም" ማለት አይደለም; "በዚህ ውሂብ ውጤቱን ማሳየት አልቻልንም" ማለት ነው። የማስረጃ አለመኖር መቅረት ማስረጃ አይደለም.
ማስጠንቀቂያ፡ በጣም የተለመደው የ AI አተረጓጎም ስህተት “ጉልህ” የሚለውን ቃል እንደ “ትልቅ/ጠንካራ/አቢይ ተጽዕኖ” ማቅረብ ነው። የስታቲስቲክስ ጠቀሜታ እና ተግባራዊ ጠቀሜታ ሁለት የተለያዩ ነገሮች ናቸው; ሁል ጊዜ ሁለቱን በተናጠል ሪፖርት ያድርጉ።

የመተማመን ክፍተት እና የውጤት መጠን፡ የበለፀገ መረጃ

ከአንድ ፒ-እሴት ይልቅ፣ የመተማመን ክፍተት የበለጠ መረጃ ሰጪ ነው፡ ለግምትዎ አሳማኝ የእሴቶችን ክልል ይሰጣል። "ውጤት 1,200, 95% የመተማመን ልዩነት [300, 2,100]" የሚለው ዓረፍተ ነገር ሁለቱንም አቅጣጫ, መጠን እና እርግጠኛ አለመሆንን ያሳያል; "p<0.05" ብቻ "ከዜሮ የራቀ" ይላል። ዘመናዊ የስታቲስቲክስ ልምምድ ብቻውን ሳይሆን p-valueን ይጠቀማል; የሶስትዮሽ የውጤት መጠን + የመተማመን ክፍተት + p-value ጋር ሪፖርት ማድረግን ይመክራል።

የስታቲስቲክስ ኃይል እና ናሙና

ስታቲስቲካዊ ሃይል በእውነቱ ያለውን ተፅእኖ የማወቅ እድሉ ነው (ከአይነት II ስህተት 1 ሲቀንስ ፣ ማለትም “ትክክለኛውን ውጤት ማጣት”)። በቂ ያልሆነ ጥናት ለሁለት አደጋዎች የተጋለጠ ነው፡ (1) እውነተኛ ውጤቶችን ያመልጣል (ሐሰት አሉታዊ)። (2) በጣም ጠቃሚ ሆነው የተገኙት ጥቂት ውጤቶች የተጋነኑ መጠኖችን ይይዛሉ - የአሸናፊው እርግማን እየተባለ የሚጠራው ምክንያቱም የተጋነኑ ትንበያዎች ብቻ መድረኩን ማለፍ ይችላሉ። ስለዚህ, ከመተንተን በፊት ኃይልን / ናሙናን ማስላት ጥሩ ነው. AI ለዚህ መለያ ኮድ ያመነጫል; የታለመውን የውጤት መጠን በንድፈ ሀሳብ ይወስናሉ።

በርካታ የንጽጽር ችግር

ፈተናን በሚሰሩበት ጊዜ የ 0.05 ገደብ ማለት "5% የውሸት አወንታዊ አደጋ" ማለት ነው. ነገር ግን 20 ሙከራዎችን ካደረጉ በአማካይ አንድ ሰው p<0.05 በአጋጣሚ ይሰጣል ተብሎ ይጠበቃል፣ ምንም እንኳን ሁሉም በትክክል ውጤታማ ባይሆኑም። ይህ የበርካታ ንጽጽር ችግር ይባላል. ብዙ ቁጥር ያላቸው ተለዋዋጮች፣ ንኡስ ቡድኖች ወይም የውጤት ተለዋዋጮች ሲፈተኑ የውሸት አወንታዊ እድላቸው በፍጥነት ይጨምራል። መፍትሄው ጣራውን ማረም ነው-Bonferroni (ገደቡን በፈተናዎች ብዛት - ጥብቅ), የሆልም ወይም ቤንጃሚን-ሆችበርግ ዘዴዎች የውሸት ግኝት መጠን (ኤፍዲአር) የሚቆጣጠሩት. ይህ አደጋ በ AI ዕድሜ ውስጥ የበለጠ ይሆናል, ምክንያቱም AI በደርዘን የሚቆጠሩ ሙከራዎችን በሰከንዶች ውስጥ ማምረት ስለሚችል - ይህ የሚቀጥለው ክፍል (p-hacking) ቀጥተኛ ርዕሰ ጉዳይ ነው.

የንጽጽር ሰንጠረዥ፡- p-value የሚለው እና የማይናገረው

አገላለጽ

እውነት ነው?

መግለጫ

"p=0.02፣ ምንም ውጤት የማያስከትል ዕድል 2% ነው"

ስህተት

p የ H0 ዕድል አይደለም

"p<0.05፣ ውጤቱ ትልቅ ነው"

ስህተት

p መጠኑን አያመለክትም

"p=0.20፣ ምንም ውጤት የለም"

ስህተት

ማሳየት አለመቻል መቅረት አይደለም።

"p<0.05, H0 ላይ ማስረጃ አለ"

እውነት ነው።

ጥንቁቅ እና ነጥብ ላይ

"ውጤት 1.200 [300; 2.100], p=0.01"

ምርጥ

መጠን + እርግጠኛ አለመሆን + ማስረጃ

አራት ሊገለበጡ የሚችሉ ጥያቄዎች

1. ትክክለኛውን ፈተና መምረጥ;

የእርስዎ ሚና፡ የስታቲስቲክ ሙከራ ረዳት። የሁለት ገለልተኛ ቡድኖችን አማካይ (ቀጣይ ተለዋዋጭ) ማወዳደር እፈልጋለሁ። ስጠኝ የትኛው ፈተና ተገቢ ነው (ከግምቶቹ ጋር፡ መደበኛነት፣ የልዩነት እኩልነት)፣ ግምቱ ካልተሟላ (ለምሳሌ ዌልች፣ ማን-ዊትኒ) እና አር ኮድ። ውጤቱን አሂድ እና ግምቶችን አረጋግጣለሁ.

2. p-valueን በትክክል ሪፖርት ማድረግ፡-

የፈተናውን ውጤት ከዚህ በታች ሪፖርት ያድርጉ, ነገር ግን ደንቦች: - p-valueን እንደ "የ H0 ዕድል" ወይም "የተፅዕኖ መጠን" አያቅርቡ, - የውጤት መጠን እና 95% የመተማመን ልዩነት ማካተትዎን ያረጋግጡ, - "ጉልህ" እና "ጉልህ" ለየብቻ ይፃፉ - p>0.05 ከሆነ, "ምንም ውጤት የለም" አትበል, "ማሳየት አልቻልንም" ይበሉ. ውጤት: [ለጥፍ]

3. የኃይል/ናሙና ስሌት፡-

አንድ ሙከራ እያቀድኩ ነው፡ ሁለት ቡድኖች፣ የሚጠበቀው የውጤት መጠን (Cohen's d) ~0.4፣ power 0.80፣ alpha 0.05. የሚፈለገውን የናሙና መጠን (pwr ጥቅል) የሚያሰላ R ኮድ ይፃፉ እና ዝቅተኛ ኃይል ያለው ጥናት (የአሸናፊ እርግማን) ስጋቶችን ያብራሩ።

4. ብዙ ንጽጽር እርማት፡-

15 የተለያዩ መላምት ሙከራዎችን አድርጌያለሁ እና p-values ​​አለኝ። የቦንፌሮኒ እና ቤንጃሚን-ሆችበርግ (ኤፍዲአር) እርማቶችን የሚተገበር R ኮድ ይፃፉ፣ በሁለቱ ዘዴዎች መካከል ያለውን ልዩነት ያብራሩ እና ለምን ባዶውን p<0.05 ማመን እንደሌለብኝ በአንድ ዓረፍተ ነገር አጠቃል።

ደካማ ጥያቄ / ጠንካራ ጥያቄ

ደካማ ጥያቄ፡

የዚህ ፈተና ውጤት ትርጉም ያለው ነው? በውጤቱ ላይ አስተያየት ይስጡ.

ይህ የይገባኛል ጥያቄ AI በ "ትርጉም / ትርጉም የሌለው" ሁለትዮሽ ውስጥ ይይዛል; እንደ “አዎ ጉልህ ነው፣ ውጤቱ ጠንካራ ነው” የሚል ትልቅ ትርጉም ካለው ጋር የሚያምታታ ዓረፍተ ነገር ያመነጫል።

ኃይለኛ ጥያቄ፡-

የእርስዎ ሚና፡ በትኩረት የሚከታተል ስታቲስቲካዊ ረዳት። ውጤቱን ተርጉም ነገር ግን: (1) የውጤት መጠን + 95% የመተማመን ልዩነት + ፒ-እሴትን አንድ ላይ ይስጡ, (2) ከትርጉሙ የተለየ ትርጉም, (3) p>0.05 በ "ማሳየት አልቻለም" (4) ምን ያህል ሙከራዎች እንዳደረግሁ ይጠይቁ; ከአንድ በላይ ከሆኑ፣ ብዙ የንፅፅር እርማትን ይጠቁሙ፣ (5) የፈተናው ግምቶች መፈተሽ እንዳለባቸው ያስታውሱ።

ልዩነት፡ ጠንካራ ፈጣን የበለጸገ ሪፖርት ማድረግን ያስፈጽማል እና ከ p-value ወጥመዶች ይከላከላል።

ሶስት ጥቃቅን ጉዳዮች

ጉዳይ 1 - በትልቁ ናሙና ውስጥ ጉልህ ያልሆነ "አስፈላጊነት". አንድ ተንታኝ በሁለቱ ቡድኖች መካከል ያለውን አማካኝ ልዩነት "በጣም ጠቃሚ" በ p<0.001 መረጃ በ500,000 ምልከታዎች አግኝቷል። ግን ልዩነቱ 0.3 ነጥብ ብቻ ነበር (ከ100) እና በተግባር ትርጉም የለሽ ነበር። ግዙፉ ናሙና ትንሹን ልዩነት እንኳን "ጉልህ" አድርጓል. የውጤቱ መጠን ሲነገር ግኝቱ እዚህ ግባ የማይባል ሆኖ ተገኝቷል። ትምህርት: አስፈላጊነት ትልቅነት አይደለም; n ትልቅ ከሆነ, እያንዳንዱ ልዩነት ጉልህ ነው.

ጉዳይ 2 - ብዙ የሙከራ ቅዠት። አንድ ቡድን 22 የውጤት ተለዋዋጮችን ሞክሯል; ከመካከላቸው አንዱ p=0.04 አሳይቷል እና "ተፅዕኖውን አገኘን" ተብሎ ታውቋል. በ Bonferroni እርማት, ደረጃው ወደ 0.05/22 = 0.0023 ቀንሷል; 0.04 ይህን ገደብ አላለፈም። ብቸኛው "ትርጉም" ውጤት ከ 22 ሙከራዎች ውስጥ በአጋጣሚ ሊሆን ይችላል. ትምህርት: ብዙ ሲፈተሽ, እርማት አስፈላጊ ነው.

ጉዳይ 3 - ዝቅተኛ ኃይል እና የአሸናፊው እርግማን. አንድ ትንሽ የፓይለት ጥናት (n=15 በቡድን) በጣም ትልቅ (d=0.9) እና ጠቃሚ ውጤት አግኝቷል። አንድ ትልቅ የማባዛት ጥናት ውጤቱን ወደ d = 0.2 ቀንሷል. ትንሹ ናሙና ከመጠን በላይ ግምት ጣራውን እንዲያቋርጥ ፈቅዷል። ትምህርት፡ በዝቅተኛ ኃይል ላይ ያሉ ጉልህ የውጤት መጠኖች ሊታመኑ አይችሉም።

የተለመዱ ስህተቶች

  • ከአስፈላጊነት/ትልቅነት ጋር ግራ መጋባት። p ትንሽ ስለሆነ ውጤቱ ትልቅ አይደለም; የውጤት መጠንን በተናጠል ሪፖርት ያድርጉ።
  • ለ H0 የመሆን p-valueን በመሳሳት ላይ። p "ምንም ውጤት የሌለው ዕድል" አይደለም; በፅንሰ-ሀሳብ የተለየ ነው።
  • p>0.05 "ምንም ውጤት የለውም" በማለት ማንበብ። አለማሳየት መቅረት ማስረጃ አይደለም; እርግጠኛ አለመሆንን ይግለጹ።
  • ለብዙ-ሙከራ አለመስተካከል። በጣም ብዙ ሙከራዎች የውሸት አወንታዊ ውጤቶችን ያመጣሉ; Bonferroni/FDR ያመልክቱ።
  • ኃይልን ችላ ማለት. በትንሽ ናሙና ውስጥ ያለው ከፍተኛ ውጤት የተጋነነ ነው; ከመተንተን በፊት ኃይልን አስሉ.
ጠቃሚ ምክር፡ ውጤቱን “ጠቃሚ” ብሎ ከመጻፍዎ በፊት፣ ሁለት ጥያቄዎችን ይጠይቁ፡ “ተፅእኖው በተግባር ጉልህ ነው (መጠን)?” እና "ይህን ውጤት ከማግኘቴ በፊት ስንት ፈተናዎችን ወስጃለሁ?" ሁለተኛው ጥያቄ የታማኝነት ፈተና ነው።

በማጠቃለያው

የመላምት ሙከራ እና p-value ኃይለኛ ነገር ግን ያልተረዱ መሳሪያዎች ናቸው። የ p-value ባዶ መላምት እውነት በሚሆንበት ጊዜ ውሂቡን የማየት እድል ነው; የ H0 ዕድል የውጤቱ መጠን ወይም የግኝቱ አስፈላጊነት አይደለም. ሁልጊዜ ከውጤቱ መጠን እና የመተማመን ልዩነት ጋር ያለውን ጠቀሜታ ያሳውቁ; p>0.05 "ምንም ውጤት የለም" ብለው አያነብቡ; ብዙ ሙከራዎችን ካደረጉ ብዙ የንጽጽር እርማትን ይተግብሩ; ዝቅተኛ ኃይል ካላቸው ጥናቶች የተጋነኑ ተፅእኖዎችን አደጋ ይገንዘቡ. AI የሙከራ ኮድ እና ንድፍ ያወጣል; ትርጉም ባለው እና በቁሳዊ ነገሮች መካከል ያለውን ልዩነት መለየት እና ግምቶችን መፈተሽ የእርስዎ ኃላፊነት ነው።

የመተግበሪያ ተግባር

በመረጃ ስብስብ ውስጥ በሁለት ቡድኖች መካከል ያለውን ንጽጽር ያድርጉ። ተገቢውን ፈተና (ከግምቶቹ ጋር) እና ኮድ እንዲሰጠው ይጠይቁ, ያሂዱት እና ግምቶቹን ያረጋግጡ. ውጤቱን በሶስት አካላት ሪፖርት ያድርጉ፡ የውጤት መጠን፣ 95% የመተማመን ክፍተት፣ p-value። ከዚያም በተመሳሳዩ ውሂብ ላይ ምን ያህል የተለያዩ ንጽጽሮችን ማድረግ እንደሚችሉ ያስቡ; ብዙ ሙከራዎችን ካደረጉ፣ Bonferroni ወይም FDR እርማትን ይተግብሩ እና ውጤቱ አሁንም የሚቆይ ከሆነ ሪፖርት ያድርጉ። በመጨረሻም ለመተንተንዎ ግምታዊ የሃይል ግምገማ ይጻፉ።

የማረጋገጫ ዝርዝር

  • [ ] ፈተናውን ከግምቶቹ ጋር መርጫለሁ እና ግምቶቹን አጣራሁ።
  • [] ውጤቱን የውጤት መጠን + የመተማመን ክፍተት + p-value ብዬ ሪፖርት አድርጌዋለሁ።
  • [ ] "አስፈላጊ" እና "አስፈላጊ" ተለያይቼ ነበር; p የ H0 ዕድል ነው ብዬ አላሰብኩም ነበር።
  • [ ] p>0.05 ን የጻፍኩት "ምንም ውጤት የለም" ከማለት ይልቅ "ማሳየት አልቻልንም" ብዬ ነው።
  • [ ] ብዙ ፈተናዎችን ከሮጥኩ ብዙ የንጽጽር እርማትን ተግባራዊ አድርጌያለሁ።
  • [] የናሙናውን ኃይል ገምግሜአለሁ; በአነስተኛ ኃይል ላይ ስላለው የውጤት መጠን መጠንቀቅ ነበር.