యూనిట్లు
1. ఎకనామెట్రిక్స్ మరియు స్టాటిస్టిక్స్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్: పాత్రలు, సరిహద్దులు, ప్రమాణీకరణ మరియు గోప్యత 2. డేటా క్లీనింగ్ మరియు ప్రిపరేషన్: మిస్సింగ్ డేటా, అవుట్‌లియర్స్ మరియు కోడింగ్ 3. అన్వేషణాత్మక డేటా విశ్లేషణ మరియు విజువలైజేషన్: కృత్రిమ మేధస్సుతో గ్రాఫింగ్ మరియు వివరణ 4. లీనియర్ రిగ్రెషన్: మోడల్ బిల్డింగ్, కోఎఫీషియంట్ ఇంటర్‌ప్రిటేషన్ మరియు అస్ప్షన్స్ 5. రిగ్రెషన్ డయాగ్నోస్టిక్స్ మరియు ఉల్లంఘనలు: కోలినియారిటీ, హెటెరోస్కేడాస్టిసిటీ, ఆటోకోరిలేషన్ 6. పరికల్పన పరీక్ష మరియు p-విలువ: ప్రాముఖ్యత, శక్తి మరియు బహుళ పోలికలు 7. p-హ్యాకింగ్, హార్కింగ్ మరియు గణాంక సమగ్రత: ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ యుగంలో ఆపదలు 8. సమయ శ్రేణి విశ్లేషణ: స్థిరత్వం, ARIMA మరియు అంచనా 9. కారణం మరియు విధాన విశ్లేషణ: డిఐడి, IV, RDD మరియు ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ 10. కోడ్ ఉత్పత్తి మరియు పునరుత్పత్తి: R/Python, సంస్కరణ మరియు పునరుత్పత్తి 11. రిపోర్ట్ రైటింగ్, కమ్యూనికేషన్ మరియు ఎథిక్స్: ఫలితాలను ప్రదర్శించడం మరియు సరిహద్దులను కమ్యూనికేట్ చేయడం
యూనిట్ 6 / 11

పరికల్పన పరీక్ష మరియు p-విలువ: ప్రాముఖ్యత, శక్తి మరియు బహుళ పోలికలు

లాభాలు:

  • శూన్య పరికల్పన, p-విలువ, విశ్వాస విరామం మరియు గణాంక శక్తిని సరిగ్గా నిర్వచించగల సామర్థ్యం మరియు పరీక్ష ఎంపిక మరియు వివరణలో కృత్రిమ మేధస్సును ఉపయోగించడం.
  • p-విలువ ఏది మరియు కాదో గుర్తించగల సామర్థ్యం (ప్రభావ పరిమాణం కాదు, ఖచ్చితత్వం యొక్క సంభావ్యత కాదు) మరియు బహుళ పోలిక దిద్దుబాటు ఎందుకు అవసరమో అర్థం చేసుకోవడం
  • ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ చేసిన వ్యాఖ్యలను మెటీరియలిటీతో అర్థవంతంగా గందరగోళపరిచే మరియు వాటిని ప్రభావం పరిమాణం మరియు అనిశ్చితితో నివేదించగల సామర్థ్యం

గణాంకాలలో ఎక్కువగా ఉపయోగించే మరియు తప్పుగా అర్థం చేసుకున్న సాధనం పరికల్పన పరీక్ష. ప్రాథమిక ఆలోచన చాలా సులభం: మనకు దావా ఉంది (ఉదా. “ఈ రెండు సమూహాల సగటు భిన్నంగా ఉంటుంది”) మరియు దాని వ్యతిరేక, శూన్య పరికల్పన (H0 — “వాస్తవానికి తేడా లేదు”). డేటా శూన్య పరికల్పనతో ఎంతవరకు అంగీకరిస్తుందో పరీక్ష కొలుస్తుంది. ఈ యూనిట్‌లో కృత్రిమ మేధస్సు (AI) పరీక్ష ఎంపిక మరియు వివరణను ఎలా సులభతరం చేస్తుందో చూద్దాం, అయితే p-విలువ చుట్టూ ఉన్న ఆపదలు ఎందుకు చాలా సాధారణమైనవి మరియు ప్రమాదకరమైనవి. ప్రారంభం నుండి ప్రారంభిద్దాం: ఏ పరీక్ష సింటాక్స్ రాయాలో AIకి తెలుసు; కానీ పరీక్ష యొక్క ఊహ సంతృప్తికరంగా ఉందో లేదో మరియు ఫలితం నిజంగా అర్థం ఏమిటో అర్థం చేసుకోవడం మీ పని.

నిజానికి p-విలువ అంటే ఏమిటి?

p-విలువ అనేది శూన్య పరికల్పన నిజమైనప్పుడు (అంటే, వాస్తవానికి ఎటువంటి ప్రభావం ఉండదు) మీరు గమనించిన ఫలితం లేదా మరింత తీవ్రమైన ఫలితం యాదృచ్ఛికంగా సంభవించే సంభావ్యత. ఒక చిన్న p-విలువ (0.05 సంప్రదాయ థ్రెషోల్డ్) అంటే "నిజంగా ఎటువంటి ప్రభావం లేనట్లయితే అటువంటి డేటాను చూడటం ఆశ్చర్యంగా ఉంటుంది"; ఇది శూన్య పరికల్పనకు వ్యతిరేకంగా సాక్ష్యంగా పరిగణించబడుతుంది.

ఇప్పుడు p-విలువ ఏది కాదని స్పష్టం చేద్దాం - ఇది AI తరచుగా గందరగోళానికి గురిచేస్తుంది:

  • p-విలువ అనేది శూన్య పరికల్పన నిజమని సంభావ్యత కాదు. p=0.03 అంటే "ప్రభావం లేని 3% సంభావ్యత ఉంది" అని కాదు.
  • p-విలువ ప్రభావం యొక్క పరిమాణాన్ని సూచించదు. చాలా చిన్న ప్రభావం పెద్ద నమూనాలో చిన్న p-విలువను అందించవచ్చు.
  • కనుగొనబడినది ముఖ్యమైనది లేదా వాస్తవమైనది అని p-విలువ నిరూపించలేదు. "ముఖ్యమైనది" అనేది గణాంక పదం, "ముఖ్యమైనది" అనేది ఒక తీర్పు.
  • p>0.05 అంటే "ప్రభావం లేదు" అని కాదు; దీని అర్థం "మేము ఈ డేటాతో ప్రభావాన్ని చూపలేకపోయాము." సాక్ష్యాలు లేకపోవటం లేదనడానికి నిదర్శనం కాదు.
హెచ్చరిక: "ముఖ్యమైనది" అనే పదాన్ని "ముఖ్యమైన/బలమైన/ప్రధాన ప్రభావం"గా ప్రదర్శించడం అత్యంత సాధారణ AI వివరణ లోపం. గణాంక ప్రాముఖ్యత మరియు ఆచరణాత్మక ప్రాముఖ్యత రెండు వేర్వేరు విషయాలు; ఎల్లప్పుడూ రెండింటిని విడివిడిగా నివేదించండి.

విశ్వాస విరామం మరియు ప్రభావం పరిమాణం: రిచ్ సమాచారం

ఒకే p-విలువకు బదులుగా, విశ్వాస విరామం మరింత సమాచారంగా ఉంటుంది: ఇది మీ అంచనాకు ఆమోదయోగ్యమైన విలువలను అందిస్తుంది. "ప్రభావం 1,200, 95% విశ్వాస విరామం [300, 2,100]" వాక్యం దిశ, పరిమాణం మరియు అనిశ్చితి రెండింటినీ చూపుతుంది; "p<0.05" కేవలం "సున్నాకి దూరంగా" అని చెప్పింది. ఆధునిక గణాంక అభ్యాసం p-విలువను ఒంటరిగా ఉపయోగించదు; ప్రభావం పరిమాణం + విశ్వాస విరామం + p-విలువ త్రయంతో నివేదించమని సిఫార్సు చేస్తుంది.

గణాంక శక్తి మరియు నమూనా

గణాంక శక్తి అనేది వాస్తవంగా ఉనికిలో ఉన్న ప్రభావాన్ని గుర్తించే సంభావ్యత (1 మైనస్ రకం II లోపం యొక్క సంభావ్యత, అనగా "వాస్తవ ప్రభావాన్ని కోల్పోవడం"). శక్తి లేని అధ్యయనం రెండు ప్రమాదాలకు లోనవుతుంది: (1) ఇది నిజమైన ప్రభావాలను కోల్పోతుంది (తప్పుడు ప్రతికూల); (2) ముఖ్యమైనవిగా మారే కొన్ని ఫలితాలు పెంచిన పరిమాణాలను కలిగి ఉంటాయి-విజేత శాపం అని పిలవబడేది ఎందుకంటే పెంచిన అంచనాలు మాత్రమే థ్రెషోల్డ్‌ను దాటగలవు. కాబట్టి, విశ్లేషణకు ముందు పవర్/నమూనాను లెక్కించడం మంచి పద్ధతి. AI ఈ ఖాతా కోసం కోడ్‌ను రూపొందిస్తుంది; మీరు సిద్ధాంతంతో లక్ష్య ప్రభావ పరిమాణాన్ని నిర్ణయిస్తారు.

బహుళ పోలిక సమస్య

పరీక్ష చేస్తున్నప్పుడు, 0.05 థ్రెషోల్డ్ అంటే "తప్పుడు పాజిటివ్‌ల ప్రమాదం 5%". కానీ మీరు 20 పరీక్షలు చేస్తే, అవన్నీ అసమర్థంగా ఉన్నప్పటికీ, సగటున ఒక p<0.05ని యాదృచ్ఛికంగా అందించవచ్చు. దీనిని బహుళ పోలిక సమస్య అంటారు. పెద్ద సంఖ్యలో వేరియబుల్స్, సబ్‌గ్రూప్‌లు లేదా ఫలిత వేరియబుల్‌లను పరీక్షించినప్పుడు తప్పుడు పాజిటివ్‌ల సంభావ్యత వేగంగా పెరుగుతుంది. థ్రెషోల్డ్‌ను సరిచేయడం దీనికి పరిష్కారం: బోన్‌ఫెరోని (పరీక్షల సంఖ్యతో థ్రెషోల్డ్‌ను విభజించడం - కఠినమైనది), హోల్మ్ లేదా బెంజమిని-హోచ్‌బర్గ్ పద్ధతులు తప్పుడు డిస్కవరీ రేట్ (FDR). AI వయస్సులో ఈ ప్రమాదం మరింత ఎక్కువ అవుతుంది, ఎందుకంటే AI సెకన్లలో డజన్ల కొద్దీ పరీక్షలను ఉత్పత్తి చేయగలదు - ఇది తదుపరి యూనిట్ (p-హ్యాకింగ్) యొక్క ప్రత్యక్ష అంశం.

పోలిక పట్టిక: p-విలువ ఏమి చెబుతుంది మరియు ఏమి చెప్పదు

వ్యక్తీకరణ

నిజమేనా?

వివరణ

"p=0.02, ప్రభావం లేని సంభావ్యత 2%"

తప్పు

p అనేది H0 యొక్క సంభావ్యత కాదు

"p<0.05, ప్రభావం పెద్దది"

తప్పు

p పరిమాణాన్ని సూచించదు

"p=0.20, ప్రభావం లేదు"

తప్పు

చూపించలేకపోవడం అంటే లేకపోవడం కాదు

"p<0.05, H0కి వ్యతిరేకంగా సాక్ష్యం ఉంది"

నిజమే

జాగ్రత్తగా మరియు పాయింట్

"ప్రభావం 1.200 [300;2.100], p=0.01"

ఉత్తమమైనది

పరిమాణం + అనిశ్చితి + సాక్ష్యం

నాలుగు కాపీ చేయదగిన ప్రాంప్ట్‌లు

1. సరైన పరీక్షను ఎంచుకోవడం:

మీ పాత్ర: స్టాటిస్టికల్ టెస్టింగ్ అసిస్టెంట్. నేను రెండు స్వతంత్ర సమూహాల సగటును (నిరంతర వేరియబుల్) పోల్చాలనుకుంటున్నాను. నాకు ఇవ్వండి: ఏ పరీక్ష సముచితమైనది (దాని ఊహలతో: సాధారణత, వ్యత్యాస సమానత్వం), ఊహను అందుకోకపోతే ప్రత్యామ్నాయం (ఉదా. వెల్చ్, మన్-విట్నీ) మరియు R కోడ్. నేను ఫలితాన్ని అమలు చేస్తాను మరియు అంచనాలను తనిఖీ చేస్తాను.

2. p-విలువను సరిగ్గా నివేదించడం:

పరీక్ష అవుట్‌పుట్‌ను దిగువ నివేదించండి, కానీ నియమాలు:- p-విలువను "H0 సంభావ్యత" లేదా "ప్రభావ పరిమాణం"గా ప్రదర్శించవద్దు,- ప్రభావ పరిమాణం మరియు 95% విశ్వాస విరామాన్ని చేర్చాలని నిర్ధారించుకోండి,- "ముఖ్యమైనది" మరియు "ముఖ్యమైనది" అని విడివిడిగా వ్రాయండి,- p>0.05 అయితే, మేము "ప్రభావం చూపలేము" అని చెప్పలేము," "చెప్పండి. అవుట్‌పుట్: [అతికించు]

3. శక్తి/నమూనా గణన:

నేను ఒక ప్రయోగాన్ని ప్లాన్ చేస్తున్నాను: రెండు సమూహాలు, ఆశించిన ప్రభావం పరిమాణం (కోహెన్స్ d) ~0.4, పవర్ 0.80, ఆల్ఫా 0.05. అవసరమైన నమూనా పరిమాణాన్ని (pwr ప్యాకేజీ) లెక్కించే R కోడ్‌ను వ్రాయండి మరియు తక్కువ శక్తితో కూడిన అధ్యయనం (విజేత శాపం) యొక్క నష్టాలను వివరించండి.

4. బహుళ పోలిక దిద్దుబాటు:

నేను 15 వేర్వేరు పరికల్పన పరీక్షలు చేసాను మరియు నాకు p-విలువలు ఉన్నాయి. Bonferroni మరియు Benjamin-Hochberg (FDR) దిద్దుబాట్లను వర్తించే R కోడ్‌ని వ్రాయండి, రెండు పద్ధతుల మధ్య వ్యత్యాసాన్ని వివరించండి మరియు నేను బేర్ p<0.05ని ఎందుకు విశ్వసించకూడదో ఒక వాక్యంలో సంగ్రహించండి.

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనమైన ప్రాంప్ట్:

ఈ పరీక్ష ఫలితం అర్థవంతంగా ఉందా? ఫలితంపై వ్యాఖ్యానించండి.

ఈ దావా AIని "అర్ధవంతమైన/అర్థం లేని" బైనరీలో ట్రాప్ చేస్తుంది; చాలా మటుకు "అవును, ఇది ముఖ్యమైనది, ప్రభావం బలంగా ఉంది" వంటి ప్రాముఖ్యతతో పరిమాణాన్ని గందరగోళపరిచే వాక్యాన్ని ఉత్పత్తి చేస్తుంది.

శక్తివంతమైన ప్రాంప్ట్:

మీ పాత్ర: శ్రద్ధగల గణాంక సహాయకుడు. ఫలితాన్ని వివరించండి కానీ: (1) ప్రభావ పరిమాణం + 95% విశ్వాస విరామం + p-విలువను కలిపి ఇవ్వండి, (2) ప్రాముఖ్యత నుండి ప్రత్యేక ప్రాముఖ్యత, (3) p>0.05 "చూపలేకపోయింది", (4) నేను ఎన్ని పరీక్షలు చేసాను అని అడగండి; ఒకటి కంటే ఎక్కువ ఉంటే, బహుళ పోలిక దిద్దుబాటును సూచించండి, (5) పరీక్ష యొక్క ఊహలను తనిఖీ చేయాలని గుర్తు చేయండి.

తేడా: బలమైన ప్రాంప్ట్ రిచ్ రిపోర్టింగ్‌ను అమలు చేస్తుంది మరియు p-వాల్యూ ట్రాప్‌ల నుండి రక్షిస్తుంది.

మూడు చిన్న కేసులు

కేసు 1 — పెద్ద నమూనాలో అప్రధానమైన "ప్రాముఖ్యత". 500,000 పరిశీలనలతో డేటాలో p<0.001 వద్ద రెండు సమూహాల మధ్య సగటు వ్యత్యాసాన్ని ఒక విశ్లేషకుడు కనుగొన్నారు. కానీ తేడా కేవలం 0.3 పాయింట్లు (100 లో) మరియు ఆచరణాత్మకంగా అర్థరహితం. భారీ నమూనా చిన్న వ్యత్యాసాన్ని కూడా "ముఖ్యమైనది" చేసింది. ప్రభావ పరిమాణాన్ని నివేదించినప్పుడు, కనుగొన్నది చాలా తక్కువగా ఉన్నట్లు కనుగొనబడింది. పాఠం: ప్రాముఖ్యత పరిమాణం కాదు; n పెద్దదైతే, ప్రతి వ్యత్యాసం ముఖ్యమైనది.

కేసు 2 - బహుళ పరీక్ష భ్రాంతి. ఒక బృందం 22 ఫలిత వేరియబుల్‌లను పరీక్షించింది; వాటిలో ఒకటి p=0.04 చూపింది మరియు "మేము ప్రభావాన్ని కనుగొన్నాము" అని ప్రకటించబడింది. బోన్‌ఫెరోని దిద్దుబాటుతో, థ్రెషోల్డ్ 0.05/22 = 0.0023కి తగ్గింది; 0.04 ఈ థ్రెషోల్డ్‌ను దాటలేదు. 22 ట్రయల్స్‌లో యాదృచ్ఛికంగా మాత్రమే "అర్ధవంతమైన" ఫలితం వచ్చేది. పాఠం: చాలా పరీక్షించేటప్పుడు, దిద్దుబాటు అవసరం.

కేస్ 3 - అండర్ పవర్ మరియు విజేత యొక్క శాపం. ఒక చిన్న పైలట్ అధ్యయనం (సమూహానికి n=15) ప్రభావం చాలా పెద్దది (d=0.9) మరియు ముఖ్యమైనది. ఒక పెద్ద ప్రతిరూపణ అధ్యయనం ప్రభావం d = 0.2కి తగ్గించబడింది. చిన్న నమూనా థ్రెషోల్డ్‌ను దాటడానికి అతిగా అంచనా వేయడానికి మాత్రమే అనుమతించింది. పాఠం: తక్కువ శక్తితో ముఖ్యమైన ప్రభావ పరిమాణాలు విశ్వసించబడవు.

సాధారణ తప్పులు

  • ప్రాముఖ్యత/పరిమాణంతో అర్థవంతంగా గందరగోళం. p చిన్నది అయినందున ప్రభావం పెద్దది కాదు; ప్రభావ పరిమాణాన్ని విడిగా నివేదించండి.
  • H0 సంభావ్యత కోసం p-విలువను తప్పుగా అర్థం చేసుకోవడం. p అనేది "ప్రభావం లేని సంభావ్యత" కాదు; సంభావితంగా భిన్నంగా ఉంటుంది.
  • p>0.05ని "ప్రభావం లేదు"గా చదవడం. చూపించడంలో వైఫల్యం లేకపోవడం రుజువు కాదు; అనిశ్చితిని తెలియజేయండి.
  • బహుళ పరీక్షల కోసం సరిదిద్దడం లేదు. చాలా పరీక్షలు తప్పుడు పాజిటివ్‌లను ఉత్పత్తి చేస్తాయి; బోన్‌ఫెరోని/FDRని వర్తింపజేయండి.
  • అధికారాన్ని విస్మరిస్తున్నారు. చిన్న నమూనాలో ముఖ్యమైన ప్రభావం అతిశయోక్తి; విశ్లేషణకు ముందు శక్తిని లెక్కించండి.
చిట్కా: ఫలితాన్ని "ముఖ్యమైనది" అని వ్రాసే ముందు రెండు ప్రశ్నలను అడగండి: "ప్రభావం ఆచరణాత్మకంగా ముఖ్యమైనదా (పరిమాణం)?" మరియు "నేను ఈ ఫలితాన్ని కనుగొనే ముందు నేను ఎన్ని పరీక్షలు చేసాను?" రెండవ ప్రశ్న నిజాయితీకి అగ్ని పరీక్ష.

సారాంశంలో

పరికల్పన పరీక్ష మరియు p-విలువ శక్తివంతమైనవి కానీ తప్పుగా అర్థం చేసుకోబడిన సాధనాలు. p-విలువ అనేది శూన్య పరికల్పన నిజం అయినప్పుడు డేటాను చూసే సంభావ్యత; H0 యొక్క సంభావ్యత ప్రభావం యొక్క పరిమాణం లేదా అన్వేషణ యొక్క ప్రాముఖ్యత కాదు. ప్రభావం పరిమాణం మరియు విశ్వాస విరామంతో పాటు ఎల్లప్పుడూ ప్రాముఖ్యతను నివేదించండి; p>0.05ని "ప్రభావం లేదు" అని చదవవద్దు; మీరు అనేక పరీక్షలు చేసినట్లయితే బహుళ పోలిక దిద్దుబాటును వర్తింపజేయండి; తక్కువ శక్తితో కూడిన అధ్యయనాల నుండి అతిశయోక్తి ప్రభావాల ప్రమాదం గురించి తెలుసుకోండి. AI పరీక్ష కోడ్ మరియు బ్లూప్రింట్‌ను ఉత్పత్తి చేస్తుంది; అర్ధవంతం మరియు భౌతికత మధ్య తేడాను గుర్తించడం మరియు ఊహలను తనిఖీ చేయడం మీ బాధ్యత.

అప్లికేషన్ టాస్క్

డేటా సెట్‌లో రెండు సమూహాల మధ్య మార్గాలను సరిపోల్చండి. తగిన పరీక్ష (దాని అంచనాలతో) మరియు కోడ్ కోసం AIని అడగండి, దాన్ని అమలు చేయండి మరియు అంచనాలను తనిఖీ చేయండి. మూడు భాగాలతో ఫలితాన్ని నివేదించండి: ప్రభావం పరిమాణం, 95% విశ్వాస విరామం, p-విలువ. అదే డేటాపై మీరు ఎన్ని విభిన్న పోలికలను చేయగలరో ఆలోచించండి; మీరు అనేక పరీక్షలను అమలు చేసి ఉంటే, బోన్‌ఫెరోని లేదా FDR దిద్దుబాటును వర్తింపజేయండి మరియు ఫలితం ఇప్పటికీ ఉంటే నివేదించండి. చివరగా, మీ విశ్లేషణ కోసం రఫ్ పవర్ అసెస్‌మెంట్ రాయండి.

చెక్లిస్ట్

  • [ ] నేను పరీక్షను దాని అంచనాలతో ఎంచుకున్నాను మరియు అంచనాలను తనిఖీ చేసాను.
  • [ ] నేను ఫలితాన్ని ప్రభావ పరిమాణం + విశ్వాస విరామం + p-విలువగా నివేదించాను.
  • [ ] నేను "ముఖ్యమైనవి" మరియు "ముఖ్యమైనవి" వేరుగా ఉంచాను; p అనేది H0 యొక్క సంభావ్యత అని నేను అనుకోలేదు.
  • [ ] నేను p>0.05ని "ఎఫెక్ట్ లేదు" అని కాకుండా "మేము దానిని చూపించలేకపోయాము" అని వ్రాసాను.
  • [ ] నేను బహుళ పరీక్షలను నిర్వహించినట్లయితే నేను బహుళ పోలిక దిద్దుబాటును వర్తింపజేసాను.
  • [] నేను నమూనా శక్తిని మూల్యాంకనం చేసాను; నేను తక్కువ శక్తితో ప్రభావం పరిమాణం గురించి జాగ్రత్తగా ఉన్నాను.