ಲಾಭಗಳು:
- ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ ಬೆಂಬಲದೊಂದಿಗೆ ರೇಖೀಯ ಹಿಂಜರಿತ ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಗುಣಾಂಕಗಳು, ಪ್ರಮಾಣಿತ ದೋಷಗಳು ಮತ್ತು R- ವರ್ಗವನ್ನು ನಿಖರ ಮತ್ತು ಕಾರಣವಲ್ಲದ ಭಾಷೆಯಲ್ಲಿ ಅರ್ಥೈಸುವ ಸಾಮರ್ಥ್ಯ
- ಮಾದರಿಯು ಆಧಾರವಾಗಿರುವ ಮೂಲಭೂತ ಊಹೆಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ (ರೇಖಾತ್ಮಕತೆ, ಬಾಹ್ಯತೆ, ನಿರಂತರ ವ್ಯತ್ಯಾಸ) ಮತ್ತು ಅವುಗಳನ್ನು ಉಲ್ಲಂಘಿಸಿದಾಗ ಏನಾಗುತ್ತದೆ ಮತ್ತು ಊಹೆ ನಿಯಂತ್ರಣಕ್ಕಾಗಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯನ್ನು ಬಳಸಿ.
- ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯಿಂದ ಉತ್ಪತ್ತಿಯಾಗುವ ಗುಣಾಂಕದ ವ್ಯಾಖ್ಯಾನಗಳಲ್ಲಿ ಮಿತಿಮೀರಿದ ಸಾಂದರ್ಭಿಕ ಹಕ್ಕುಗಳು ಮತ್ತು ಕಡೆಗಣಿಸಲಾದ ವೇರಿಯಬಲ್ ಸಮಸ್ಯೆಗಳನ್ನು ಗುರುತಿಸುವ ಮತ್ತು ಸರಿಪಡಿಸುವ ಸಾಮರ್ಥ್ಯ
ಲೀನಿಯರ್ ರಿಗ್ರೆಶನ್ ಎಕನಾಮೆಟ್ರಿಕ್ಸ್ ಮತ್ತು ಅನ್ವಯಿಕ ಅಂಕಿಅಂಶಗಳ ಬೆನ್ನೆಲುಬು. ಅದರ ಸರಳ ರೂಪದಲ್ಲಿ, ಅವಲಂಬಿತ ವೇರಿಯೇಬಲ್ (ಆದಾಯದಂತಹ ನೀವು ವಿವರಿಸಲು ಬಯಸುವ ಫಲಿತಾಂಶ) ಒಂದು ಅಥವಾ ಹೆಚ್ಚು ಸ್ವತಂತ್ರ ಅಸ್ಥಿರಗಳೊಂದಿಗಿನ ರೇಖಾತ್ಮಕ ಸಂಬಂಧದ ಮೂಲಕ ಹೇಗೆ ಬದಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಇದು ಅಂದಾಜು ಮಾಡುತ್ತದೆ (ವಿವರಣೆಯ ಅಂಶಗಳು, ವರ್ಷಗಳ ಶಿಕ್ಷಣ, ಅನುಭವ). ಮಾದರಿಯು ರೂಪವನ್ನು ಹೊಂದಿದೆ: ಆದಾಯ = β0 + β1· ಶಿಕ್ಷಣ + β2· ಅನುಭವ + ಯು. ಇಲ್ಲಿ β (ಬೀಟಾ) ಗುಣಾಂಕಗಳು ಸಂಬಂಧದ ಗಾತ್ರವನ್ನು ತೋರಿಸುತ್ತವೆ ಮತ್ತು ಮಾದರಿಯು ವಿವರಿಸಲಾಗದ ದೋಷ ಪದವನ್ನು (ಎಲ್ಲಾ ಗಮನಿಸದ ಪರಿಣಾಮಗಳು) ಯು ತೋರಿಸುತ್ತದೆ. ಈ ಘಟಕದಲ್ಲಿ, ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ (AI) ರಿಗ್ರೆಷನ್ ನಿರ್ಮಾಣ ಮತ್ತು ವ್ಯಾಖ್ಯಾನವನ್ನು ಹೇಗೆ ವೇಗಗೊಳಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ನಾವು ನೋಡುತ್ತೇವೆ, ಆದರೆ ಗುಣಾಂಕದ ವ್ಯಾಖ್ಯಾನವು ಏಕೆ ತಪ್ಪುಗಳನ್ನು ಹೆಚ್ಚಾಗಿ ಮಾಡಲಾಗುತ್ತದೆ.
ಮೊದಲಿನಿಂದಲೂ ಮೂಲಭೂತ ಉದ್ದೇಶವನ್ನು ಇಡೋಣ: AI ರಿಗ್ರೆಷನ್ ಕೋಡ್ ಅನ್ನು ಬರೆಯುತ್ತದೆ, ಔಟ್ಪುಟ್ ಟೇಬಲ್ ಅನ್ನು ಆಯೋಜಿಸುತ್ತದೆ, ಗುಣಾಂಕದ ವ್ಯಾಖ್ಯಾನಕ್ಕಾಗಿ ಡ್ರಾಫ್ಟ್ ಅನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ. ಆದರೆ ಯಾವ ಅಸ್ಥಿರಗಳು ಮಾದರಿಗೆ (ಮಾದರಿ ವಿವರಣೆ) ಹೋಗುತ್ತವೆ ಎಂಬುದು ನಿಮ್ಮ ನಿರ್ಧಾರವಾಗಿದೆ, ಗುಣಾಂಕವನ್ನು ಸಾಂದರ್ಭಿಕ ಅಥವಾ ಸಂಬಂಧಿತ ಎಂದು ಅರ್ಥೈಸಲಾಗುತ್ತದೆ ಮತ್ತು ಕಡೆಗಣಿಸದ ವೇರಿಯಬಲ್ ಇದೆಯೇ. AI ಯ ಅತ್ಯಂತ ಅಪಾಯಕಾರಿ ಅಭ್ಯಾಸವೆಂದರೆ ಸಾಮಾನ್ಯ ರಿಗ್ರೆಷನ್ ಗುಣಾಂಕಗಳನ್ನು ಸಾಂದರ್ಭಿಕ ಭಾಷೆಯಲ್ಲಿ ಪ್ರಸ್ತುತಪಡಿಸುವುದು ಉದಾಹರಣೆಗೆ "X ಹೆಚ್ಚಿಸುತ್ತದೆ Y"; ಆದರೆ ಹೆಚ್ಚಿನ ಹಿಂಜರಿಕೆಗಳು ಸಂಬಂಧವನ್ನು ಮಾತ್ರ ತೋರಿಸುತ್ತವೆ (ಪರಸ್ಪರ ಸಂಬಂಧ).
ಸ್ಟೆಪ್ವೈಸ್ ರಿಗ್ರೆಷನ್ ವರ್ಕ್ಫ್ಲೋ
1. ಸಿದ್ಧಾಂತದೊಂದಿಗೆ ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸಿ. ಯಾವ ಅಸ್ಥಿರಗಳು ಅವಲಂಬಿತವಾಗಿರುತ್ತವೆ ಮತ್ತು ಯಾವುದು ಸ್ವತಂತ್ರವಾಗಿರುತ್ತದೆ ಎಂಬುದು ಕ್ಷೇತ್ರ ಜ್ಞಾನ ಮತ್ತು ಸಿದ್ಧಾಂತದಿಂದ ಬರುತ್ತದೆ, ಅಂಕಿಅಂಶಗಳಿಂದಲ್ಲ. "ಈ ಫಲಿತಾಂಶದ ಮೇಲೆ ಯಾವ ಅಂಶಗಳು ತಾರ್ಕಿಕವಾಗಿ ಪರಿಣಾಮ ಬೀರುತ್ತವೆ?" "ನಾನು ಡೇಟಾದಲ್ಲಿ ಏನೇ ಹಾಕಿದರೂ, ಗುಣಾಂಕವು ಗಮನಾರ್ಹವಾಗಿರುತ್ತದೆ" ಎಂಬ ತರ್ಕವಲ್ಲ.
2. ಊಹೆ. ಅತ್ಯಂತ ಸಾಮಾನ್ಯ ವಿಧಾನವೆಂದರೆ OLS (ಸಾಮಾನ್ಯ ಕಡಿಮೆ ಚೌಕಗಳು): ಇದು ಗಮನಿಸಿದ ಮತ್ತು ಊಹಿಸಲಾದ ಮೌಲ್ಯಗಳ ನಡುವಿನ ವರ್ಗ ವ್ಯತ್ಯಾಸಗಳ ಮೊತ್ತವನ್ನು ಕಡಿಮೆ ಮಾಡುವ ರೀತಿಯಲ್ಲಿ ಗುಣಾಂಕಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡುತ್ತದೆ. AI ಇದಕ್ಕಾಗಿ ಕೋಡ್ ಅನ್ನು (lm() R ನಲ್ಲಿ, ಪೈಥಾನ್ನಲ್ಲಿ ಸ್ಟ್ಯಾಟ್ಸ್ಮಾಡೆಲ್ಗಳು) ಫ್ಲೈನಲ್ಲಿ ಉತ್ಪಾದಿಸುತ್ತದೆ.
3. ಔಟ್ಪುಟ್ ಓದಿ. ರಿಗ್ರೆಶನ್ ಔಟ್ಪುಟ್ನಲ್ಲಿ ನಾಲ್ಕು ವಿಷಯಗಳನ್ನು ನೋಡಿ: ಗುಣಾಂಕ (ಸಂಬಂಧದ ದಿಕ್ಕು ಮತ್ತು ಪ್ರಮಾಣ), ಪ್ರಮಾಣಿತ ದೋಷ (ಗುಣಾಂಕದ ಅಂದಾಜು ಅನಿಶ್ಚಿತತೆ), t-ಅಂಕಿಅಂಶ ಮತ್ತು p-ಮೌಲ್ಯ (ಗುಣಾಂಕವು ಶೂನ್ಯದಿಂದ ಭಿನ್ನವಾಗಿದೆ ಎಂಬುದಕ್ಕೆ ಪುರಾವೆಗಳ ಸಾಮರ್ಥ್ಯ), R-ವರ್ಗ (ಅವಲಂಬಿತ ವೇರಿಯಬಲ್ನಲ್ಲಿ ಎಷ್ಟು ವ್ಯತ್ಯಾಸವಿದೆ ಎಂಬುದನ್ನು ಮಾದರಿ ವಿವರಿಸುತ್ತದೆ, 0 ರಿಂದ 1 ವರೆಗೆ). ಹೆಚ್ಚಿನ R-ಸ್ಕ್ವೇರ್ ಎಂದರೆ "ಉತ್ತಮ ಮಾದರಿ" ಎಂದಲ್ಲ; ಯಾವುದೇ ಕಾರಣಿಕತೆಯಿಲ್ಲ.
4. ಗುಣಾಂಕವನ್ನು ಸರಿಯಾಗಿ ಅರ್ಥೈಸಿಕೊಳ್ಳಿ. ಶಿಕ್ಷಣ ಗುಣಾಂಕವು 1,200 ಆಗಿದ್ದರೆ, ಸರಿಯಾದ ವ್ಯಾಖ್ಯಾನ: "ಇತರ ಅಸ್ಥಿರಗಳು ಸ್ಥಿರವಾಗಿರುತ್ತವೆ, ಶಿಕ್ಷಣದಲ್ಲಿ ಒಂದು ವರ್ಷದ ಹೆಚ್ಚಳವು ಸರಾಸರಿ 1,200 ಯುನಿಟ್ಗಳ ಹೆಚ್ಚಿನ ಆದಾಯದೊಂದಿಗೆ ಸಂಬಂಧಿಸಿದೆ." ತಪ್ಪಾದ ವ್ಯಾಖ್ಯಾನ: "ಇನ್ನೊಂದು ವರ್ಷದ ಶಿಕ್ಷಣವು ಆದಾಯವನ್ನು 1,200 ರಷ್ಟು ಹೆಚ್ಚಿಸುತ್ತದೆ." ಎರಡನೆಯದು ಕಾರಣದ ಹಕ್ಕು ಮತ್ತು ಸೂಕ್ತವಾದ ವಿನ್ಯಾಸದೊಂದಿಗೆ ಮಾತ್ರ ಸಮರ್ಥಿಸಿಕೊಳ್ಳಬಹುದು (ಘಟಕ 9).
5. ಊಹೆಗಳನ್ನು ಪರಿಶೀಲಿಸಿ. ಹಿಂಜರಿತದ ಸಿಂಧುತ್ವವು ಕೆಲವು ಊಹೆಗಳನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ (ಕೆಳಗೆ). AI ಡಯಾಗ್ನೋಸ್ಟಿಕ್ ಕೋಡ್ ಅನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ; ನೀವು ಕಾಮೆಂಟ್ ಮಾಡಿ.
ರೇಖೀಯ ಹಿಂಜರಿತದ ಮೂಲ ಊಹೆಗಳು
ಗುಣಾಂಕಗಳು ನಿಷ್ಪಕ್ಷಪಾತವಾಗಿರಲು (ರೇಖೆ-ಕೇಂದ್ರಿತ) ಮತ್ತು ಪ್ರಮಾಣಿತ ದೋಷಗಳು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿರಲು ಶಾಸ್ತ್ರೀಯ ರೇಖೀಯ ಮಾದರಿಯನ್ನು ಆಧರಿಸಿದ ಊಹೆಗಳು ಅವಶ್ಯಕ:
- ರೇಖೀಯತೆ: ಸಂಬಂಧವು ನಿಯತಾಂಕಗಳಲ್ಲಿ ರೇಖೀಯವಾಗಿದೆ (ಅಗತ್ಯವಿದ್ದರೆ ಲಾಗ್/ಸ್ಕ್ವೇರ್ ಪದಗಳಲ್ಲಿ ವಿಸ್ತರಿಸಲಾಗಿದೆ).
- ಎಕ್ಸೋಜೆನಿಟಿ (ಶೂನ್ಯ ಷರತ್ತುಬದ್ಧ ಸರಾಸರಿ): ದೋಷ ಪದವು ವಿವರಣಾತ್ಮಕ ಅಸ್ಥಿರಗಳೊಂದಿಗೆ ಪರಸ್ಪರ ಸಂಬಂಧ ಹೊಂದಿಲ್ಲ. ಇದು ಅತ್ಯಂತ ನಿರ್ಣಾಯಕ ಮತ್ತು ಆಗಾಗ್ಗೆ ಉಲ್ಲಂಘಿಸುವ ಊಹೆಯಾಗಿದೆ; ಉಲ್ಲಂಘನೆಯು ಬಿಟ್ಟುಬಿಟ್ಟ ವೇರಿಯಬಲ್ ಪಕ್ಷಪಾತವನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ.
- ನಿರಂತರ ವ್ಯತ್ಯಾಸ (ಹೋಮೊಸ್ಸೆಡಾಸ್ಟಿಸಿಟಿ): ದೋಷ ಪದದ ವ್ಯತ್ಯಾಸವು ಎಲ್ಲಾ ಅವಲೋಕನಗಳಲ್ಲಿ ಒಂದೇ ಆಗಿರುತ್ತದೆ (ಉಲ್ಲಂಘನೆ: ಹೆಟೆರೊಸೆಡೆಸ್ಟಿಸಿಟಿ - ಘಟಕ 5).
- ಸ್ವಯಂ ಸಂಬಂಧದ ಅನುಪಸ್ಥಿತಿ: ದೋಷಗಳು ಪರಸ್ಪರ ಸ್ವತಂತ್ರವಾಗಿರುತ್ತವೆ (ಸಮಯ ಸರಣಿಯಲ್ಲಿ ಆಗಾಗ್ಗೆ ಉಲ್ಲಂಘನೆಗಳು - ಘಟಕಗಳು 5 ಮತ್ತು 8).
- ತೀವ್ರ ಮಲ್ಟಿಕಾಲಿನಿಯರಿಟಿಯ ಅನುಪಸ್ಥಿತಿ: ವಿವರಣಾತ್ಮಕ ಅಸ್ಥಿರಗಳು ಒಂದಕ್ಕೊಂದು ಹೋಲುವಂತಿಲ್ಲ (ಘಟಕ 5).
ಎಚ್ಚರಿಕೆ: ಅತ್ಯಂತ ಅಪಾಯಕಾರಿ ಸಮಸ್ಯೆಯೆಂದರೆ ವೇರಿಯಬಲ್ ಪಕ್ಷಪಾತವನ್ನು ಕಡೆಗಣಿಸಲಾಗಿದೆ. ನಿಮ್ಮ ಮಾದರಿಯಿಂದ ಆದಾಯ ಮತ್ತು ಶಿಕ್ಷಣ ಎರಡಕ್ಕೂ ಸಂಬಂಧಿಸಿದ ಅಂಶವನ್ನು ನೀವು ಬಿಟ್ಟರೆ (ಉದಾ. ಕುಟುಂಬದ ಹಿನ್ನೆಲೆ, ಸಾಮರ್ಥ್ಯ), ಶಿಕ್ಷಣ ಗುಣಾಂಕವು ಈ ಕಾಣೆಯಾದ ಅಂಶದ ಪರಿಣಾಮವನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ ಮತ್ತು ಉಬ್ಬಿಕೊಳ್ಳುತ್ತದೆ. ಕಾಣೆಯಾದ ವೇರಿಯಬಲ್ ಅನ್ನು AI ತಿಳಿಯುವುದಿಲ್ಲ; ನಿಮ್ಮ ಕ್ಷೇತ್ರದ ಜ್ಞಾನ ಮಾತ್ರ ಅದನ್ನು ಸೆರೆಹಿಡಿಯಬಹುದು.
ಹೋಲಿಕೆ ಕೋಷ್ಟಕ: ಸರಿ ವಿರುದ್ಧ ತಪ್ಪು ಗುಣಾಂಕದ ವ್ಯಾಖ್ಯಾನ
ಔಟ್ಪುಟ್
ತಪ್ಪಾದ (ಕಾರಣ) ವ್ಯಾಖ್ಯಾನ
ಸರಿಯಾದ (ಸಂಬಂಧಿತ) ವ್ಯಾಖ್ಯಾನ
ಶಿಕ್ಷಣ ಗುಣಾಂಕ = 1.200
"ಶಿಕ್ಷಣವು 1,200 ಆದಾಯವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ"
"ಒಂದು ವರ್ಷದ ಹೆಚ್ಚಿನ ಶಿಕ್ಷಣ, ಸೆಟೆರಿಸ್ ಪ್ಯಾರಿಬಸ್, 1,200 ಹೆಚ್ಚಿನ ಆದಾಯದೊಂದಿಗೆ ಸಂಬಂಧಿಸಿದೆ."
R² = 0.68
"ಮಾದರಿಯು ವಾಸ್ತವವನ್ನು ಹಿಡಿದಿದೆ"
"68% ಬದಲಾವಣೆಯನ್ನು ವಿವರಿಸಲಾಗಿದೆ; ಕಾರಣವನ್ನು ತೋರಿಸುವುದಿಲ್ಲ"
ಪು <0.01
"ಪರಿಣಾಮ ದೊಡ್ಡದಾಗಿದೆ"
"ಗುಣಾಂಕವು ಶೂನ್ಯದಿಂದ ಭಿನ್ನವಾಗಿದೆ ಎಂಬುದಕ್ಕೆ ಬಲವಾದ ಪುರಾವೆ; ಪ್ರಮಾಣವು ಪ್ರತ್ಯೇಕವಾಗಿದೆ"
ಋಣಾತ್ಮಕ ಗುಣಾಂಕ
"X Y ಅನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ"
"X ಹೆಚ್ಚಾದಂತೆ, Y ಸರಾಸರಿ ಕಡಿಮೆಯಾಗುತ್ತದೆ; ಇನ್ನೊಂದು ಸಮಸ್ಯೆ ಏಕೆ?"
ನಕಲಿಸಬಹುದಾದ ನಾಲ್ಕು ಪ್ರಾಂಪ್ಟ್ಗಳು
1. ರಿಗ್ರೆಷನ್ ಕೋಡ್ ಅನ್ನು ರಚಿಸುವುದು:
ನಿಮ್ಮ ಪಾತ್ರ: ಎಕನಾಮೆಟ್ರಿಕ್ಸ್ ಕೋಡ್ ಸಹಾಯಕ. ನಾನು ಡೇಟಾವನ್ನು ಹಂಚಿಕೊಳ್ಳುವುದಿಲ್ಲ, ನನಗೆ R ಕೋಡ್ ಬೇಕು. ಡೇಟಾ.ಫ್ರೇಮ್ನಲ್ಲಿ 'ಡೇಟಾ', ಆದಾಯ (ಅವಲಂಬಿತ), ಶಿಕ್ಷಣ, ಅನುಭವ, ಲಿಂಗ (ವರ್ಗೀಯ). ಕಾರ್ಯ: ಆದಾಯ ~ ಶಿಕ್ಷಣ + ಅನುಭವ + ಲಿಂಗಕ್ಕಾಗಿ lm() ನೊಂದಿಗೆ ರಿಗ್ರೆಷನ್ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ, ಸಾರಾಂಶ ಔಟ್ಪುಟ್ ಮತ್ತು ಗುಣಾಂಕಗಳ ವಿಶ್ವಾಸಾರ್ಹ ಮಧ್ಯಂತರವನ್ನು (ಕಡಿತ) ತೋರಿಸಿ. ಪ್ರತಿ ಭಾಗವನ್ನು ಕಾಮೆಂಟ್ ಲೈನ್ನೊಂದಿಗೆ ವಿವರಿಸಿ. ನಾನು ಓಡಿ ಫಲಿತಾಂಶವನ್ನು ಪರಿಶೀಲಿಸುತ್ತೇನೆ.
2. ಗುಣಾಂಕದ ವ್ಯಾಖ್ಯಾನದ ರೇಖಾಚಿತ್ರ (ಸಂಬಂಧಿತ ಭಾಷೆಯಲ್ಲಿ):
ಕೆಳಗಿನ ರಿಗ್ರೆಶನ್ ಔಟ್ಪುಟ್ ಅನ್ನು ವ್ಯಾಖ್ಯಾನಿಸಿ ಆದರೆ ನಿಯಮಗಳು:- ಸಂಬಂಧಿತ ಭಾಷೆಯಲ್ಲಿ ಗುಣಾಂಕಗಳನ್ನು ಬರೆಯಿರಿ ("ಸಂಯೋಜಿತ"), ಸಾಂದರ್ಭಿಕ ಭಾಷೆಯನ್ನು ಬಳಸಬೇಡಿ, "ಇತರ ಅಸ್ಥಿರಗಳನ್ನು ಸ್ಥಿರ" ಸೇರಿಸಿ,- ಪ್ರಸ್ತುತ R-ವರ್ಗವನ್ನು 'ಕಾರಣತೆ' ಎಂದು ಸೇರಿಸಿ,- ಪರಿಣಾಮದ ಗಾತ್ರದೊಂದಿಗೆ ಮಹತ್ವವನ್ನು ಗೊಂದಲಗೊಳಿಸಬೇಡಿ. ಔಟ್ಪುಟ್: [ಪೇಸ್ಟ್ ಟೇಬಲ್]
3. ಊಹೆ ಚೆಕ್ ಕೋಡ್:
ಆದಾಯ ~ ಶಿಕ್ಷಣ + ಅನುಭವದ ಮಾದರಿ (R) ಗಾಗಿ ಊಹೆಯ ರೋಗನಿರ್ಣಯ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ: ಉಳಿದಿರುವ-ಹೊಂದಿಸುವ (ಉಳಿದಿರುವ) ಗ್ರಾಫ್ಗಳು, QQ ಗ್ರಾಫ್, ಶೇಷಗಳ ವಿತರಣೆ. ಪ್ರತಿ ಗ್ರಾಫ್ ಯಾವ ಊಹೆಯನ್ನು ಪರೀಕ್ಷಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ಕಾಮೆಂಟ್ ಸಾಲಿನಲ್ಲಿ ವಿವರಿಸಿ. ತಿದ್ದುಪಡಿಯನ್ನು ಸೂಚಿಸಿ; ರೋಗನಿರ್ಣಯವನ್ನು ಮಾಡಿ ಮತ್ತು ನಾನು ನಿರ್ಧಾರವನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತೇನೆ.
4. ತಪ್ಪಿದ ವೇರಿಯಬಲ್ ಪ್ರಶ್ನೆ:
ಆದಾಯ ~ ಶಿಕ್ಷಣ ಮಾದರಿಯಲ್ಲಿ ನಿರ್ಲಕ್ಷಿಸಲಾದ ವೇರಿಯಬಲ್ ಪಕ್ಷಪಾತದ ಅಪಾಯವನ್ನು ಪರಿಗಣಿಸಲು ನನಗೆ ಸಹಾಯ ಮಾಡಿ. ಆದಾಯ ಮತ್ತು ಶಿಕ್ಷಣ ಎರಡಕ್ಕೂ ಸಂಬಂಧಿಸಿದ ಆದರೆ ಮಾದರಿಯಲ್ಲಿಲ್ಲದ ಸಂಭವನೀಯ ಅಸ್ಥಿರಗಳನ್ನು ಪಟ್ಟಿ ಮಾಡಿ (ಉದಾ., ಕುಟುಂಬದ ಹಿನ್ನೆಲೆ, ಪ್ರದೇಶ, ಸಾಮರ್ಥ್ಯ) ಮತ್ತು ಪ್ರತಿಯೊಂದೂ ಶಿಕ್ಷಣ ಗುಣಾಂಕವನ್ನು ಯಾವ ದಿಕ್ಕಿನಲ್ಲಿ ಪಕ್ಷಪಾತ ಮಾಡಬಹುದು ಎಂಬುದನ್ನು ವಿವರಿಸಿ. ಇದು ಖಚಿತತೆಯಲ್ಲ, ಇದು ಪರಿಗಣನೆಗಳ ಪಟ್ಟಿಯಾಗಿರಲಿ; ನಾನು ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುತ್ತೇನೆ.
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್:
ಈ ರಿಗ್ರೆಶನ್ ಔಟ್ಪುಟ್ ಅನ್ನು ವ್ಯಾಖ್ಯಾನಿಸಿ ಮತ್ತು ಫಲಿತಾಂಶಗಳನ್ನು ವಿವರಿಸಿ.
ಈ ಪ್ರಾಂಪ್ಟ್ AI ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡುತ್ತದೆ; "ತರಬೇತಿಯು ಆದಾಯವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ" ಮತ್ತು "ಮಾದರಿಯು ಅತ್ಯಂತ ಯಶಸ್ವಿಯಾಗಿದೆ" ನಂತಹ ಸಾಂದರ್ಭಿಕ ಮತ್ತು ಉತ್ಪ್ರೇಕ್ಷಿತ ವಾಕ್ಯಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.
ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್:
ನಿಮ್ಮ ಪಾತ್ರ: ಎಚ್ಚರಿಕೆಯ ಅರ್ಥಶಾಸ್ತ್ರ ಸಹಾಯಕ. ಔಟ್ಪುಟ್ ಅನ್ನು ಅರ್ಥೈಸಿ, ಆದರೆ: (1) ಎಲ್ಲಾ ಗುಣಾಂಕಗಳನ್ನು ಸಂಬಂಧಿತ ಭಾಷೆಯಲ್ಲಿ ಬರೆಯಿರಿ, (2) "ಎಲ್ಲಾ ಬೇರೆ ಸೆಟೆರಿಸ್ ಪ್ಯಾರಿಬಸ್" ಮಾದರಿಯನ್ನು ಬಳಸಿ, (3) R- ವರ್ಗವನ್ನು ಕಾರಣಕ್ಕಾಗಿ ತಪ್ಪಾಗಿ ಮಾಡಬೇಡಿ, (4) ಪರಿಣಾಮದ ಗಾತ್ರದಿಂದ ಪ್ರತ್ಯೇಕ ಪ್ರಾಮುಖ್ಯತೆ, (5) ಮಾದರಿಯ ಬಹಿರ್ಮುಖತೆಯ ಊಹೆಯನ್ನು ಪರೀಕ್ಷಿಸಲು ವಿಫಲವಾದ ಮತ್ತು ವೇರಿಯಬಲ್ ಅಪಾಯದ ಅಪಾಯವನ್ನು ಗಮನಿಸಿ ಔಟ್ಪುಟ್: [ಟೇಬಲ್]
ವ್ಯತ್ಯಾಸ: ಬಲವಾದ ಇಚ್ಛೆಯು ಸಾಂದರ್ಭಿಕ ಭಾಷೆಯನ್ನು ನಿಷೇಧಿಸುತ್ತದೆ, ಅಸ್ಪಷ್ಟತೆ ಮತ್ತು ಊಹೆಯ ಮಿತಿಗಳನ್ನು ಗೋಚರಿಸುತ್ತದೆ.
ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು
ಪ್ರಕರಣ 1 - ಕಾರಣ ಭಾಷೆಯ ಬಲೆ. ಒಬ್ಬ ವಿಶ್ಲೇಷಕನು ತನ್ನ ಜಾಹೀರಾತು ~ ಮಾರಾಟದ ಹಿನ್ನಡೆಯಲ್ಲಿ ಜಾಹೀರಾತು ಗುಣಾಂಕವನ್ನು 2.4 ಎಂದು ಕಂಡುಹಿಡಿದನು ಮತ್ತು AI ಬ್ಲೂಪ್ರಿಂಟ್ ಅನ್ನು ಹೀಗೆ ಬಳಸಿದನು: "ಜಾಹೀರಾತಿಗಾಗಿ ಖರ್ಚು ಮಾಡಿದ ಪ್ರತಿಯೊಂದು ಘಟಕವು 2.4 ಯೂನಿಟ್ಗಳಷ್ಟು ಮಾರಾಟವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ." ಮ್ಯಾನೇಜ್ಮೆಂಟ್ ಅದಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಬಜೆಟ್ ಅನ್ನು ಹೆಚ್ಚಿಸಿತು; ಆದರೆ ಹೆಚ್ಚಿನ ಮಾರಾಟದ ಅವಧಿಯಲ್ಲಿ ಈಗಾಗಲೇ ಹೆಚ್ಚಿನ ಜಾಹೀರಾತು (ರಿವರ್ಸ್ ಕಾಸ್ಯಾಲಿಟಿ) ಇತ್ತು ಮತ್ತು ಗುಣಾಂಕವು ಇದನ್ನು ಪ್ರತಿಬಿಂಬಿಸುತ್ತದೆ. ಪಾಠ: ಸಾಮಾನ್ಯ ಹಿಂಜರಿಕೆಯು ಕಾರಣದ ಪುರಾವೆಯಲ್ಲ; ದಿಕ್ಕು ಅಸ್ಪಷ್ಟವಾಗಿದೆ.
ಪ್ರಕರಣ 2 - ಕಡೆಗಣಿಸಲಾದ ವೇರಿಯಬಲ್. ಒಂದು ಅಧ್ಯಯನದಲ್ಲಿ, ಆದಾಯ ~ ಶಿಕ್ಷಣ ಗುಣಾಂಕ 1,900 ಆಗಿತ್ತು. ಪೋಷಕರ ಶಿಕ್ಷಣ ಮತ್ತು ಪ್ರದೇಶವನ್ನು ಮಾದರಿಗೆ ಸೇರಿಸಿದಾಗ, ಗುಣಾಂಕವು 1.150 ಕ್ಕೆ ಇಳಿಯಿತು. ಮೊದಲ ಮಾದರಿಯಲ್ಲಿ, ಶಿಕ್ಷಣವು ವಾಸ್ತವವಾಗಿ ಕುಟುಂಬದ ಹಿನ್ನೆಲೆಯ ಕೆಲವು ಪ್ರಭಾವವನ್ನು ತೆಗೆದುಕೊಂಡಿತು. ಪಾಠ: ಕಾಣೆಯಾದ ಆದರೆ ಪರಸ್ಪರ ಸಂಬಂಧ ಹೊಂದಿರುವ ವೇರಿಯಬಲ್ ಗುಣಾಂಕವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ; ಡೊಮೇನ್ ಜ್ಞಾನದೊಂದಿಗೆ ಸಂಭವನೀಯ ನ್ಯೂನತೆಗಳನ್ನು ಪರಿಗಣಿಸಿ.
ಪ್ರಕರಣ 3 - ಹೆಚ್ಚಿನ R-ವರ್ಗದ ಭ್ರಮೆ. ಒಬ್ಬ ವಿದ್ಯಾರ್ಥಿ R²=0.94 ನೋಡಿ "ನನ್ನ ಮಾದರಿ ಪರಿಪೂರ್ಣವಾಗಿದೆ" ಎಂದು ಹೇಳಿದರು. ಆದರೆ ಸ್ವತಂತ್ರ ವೇರಿಯಬಲ್ಗಳಲ್ಲಿ ಒಂದು ಅವಲಂಬಿತ ವೇರಿಯಬಲ್ಗೆ ಬಹುತೇಕ ಒಂದೇ ಆಗಿರುತ್ತದೆ (ಈಗಾಗಲೇ ಮಾರಾಟದಲ್ಲಿ ಸೇರಿಸಲಾದ ಐಟಂ). ಮಾದರಿಯು ವಾಸ್ತವವನ್ನು ವಿವರಿಸುತ್ತಿಲ್ಲ, ಅದು ಸ್ವತಃ ವಿವರಿಸುತ್ತದೆ. ಪಾಠ: ಹೆಚ್ಚಿನ ಆರ್-ಸ್ಕ್ವೇರ್ಡ್ ಮಾದರಿ ಗುಣಮಟ್ಟವನ್ನು ಖಾತರಿಪಡಿಸುವುದಿಲ್ಲ; ಲಾಜಿಕ್ ಚೆಕ್ ಅಗತ್ಯವಿದೆ.
ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು
- ಗುಣಾಂಕವನ್ನು ಸಾಂದರ್ಭಿಕವಾಗಿ ವ್ಯಾಖ್ಯಾನಿಸುವುದು. ವಿನ್ಯಾಸದಿಂದ ಸಮರ್ಥಿಸದ ಹೊರತು "ಹೆಚ್ಚಿಸುತ್ತದೆ/ಕಡಿಮೆಗಳು" ಭಾಷೆ ತಪ್ಪಾಗಿದೆ; "ಸಂಬಂಧಿತ" ಎಂದು ಹೇಳಿ.
- ಕಡೆಗಣಿಸಲಾದ ವೇರಿಯಬಲ್ ಅನ್ನು ನಿರ್ಲಕ್ಷಿಸಲಾಗುತ್ತಿದೆ. X ಮತ್ತು Y ಎರಡಕ್ಕೂ ಸಂಬಂಧಿಸಿದ ಕಾಣೆಯಾದ ಅಂಶವು ಗುಣಾಂಕವನ್ನು ಪಕ್ಷಪಾತಗೊಳಿಸುತ್ತದೆ; ಸಂಭವನೀಯ ನ್ಯೂನತೆಗಳನ್ನು ಪರಿಗಣಿಸಿ.
- R-ಸ್ಕ್ವೇರ್ ಅನ್ನು ಯಶಸ್ಸಿನ ಅಳತೆಯಾಗಿ ತಪ್ಪಾಗಿ ಗ್ರಹಿಸುವುದು. ಹೆಚ್ಚಿನ R-ವರ್ಗವು ಕಾರಣ ಅಥವಾ ಸರಿಯಾದ ಮಾದರಿ ಎಂದರ್ಥವಲ್ಲ; ಇದು ವೇರಿಯಬಲ್ ಸೋರಿಕೆಯ ಸಂಕೇತವೂ ಆಗಿರಬಹುದು.
- ಶ್ರೇಷ್ಠತೆಯೊಂದಿಗೆ ಮಹತ್ವವನ್ನು ಗೊಂದಲಗೊಳಿಸುವುದು. p<0.05 ಪರಿಣಾಮವು ದೊಡ್ಡದಾಗಿದೆ ಎಂದು ಸೂಚಿಸುವುದಿಲ್ಲ; ಗುಣಾಂಕದ ಪ್ರಾಯೋಗಿಕ ಪ್ರಮಾಣವನ್ನು ಸಹ ನೋಡಿ.
- ಊಹೆಗಳನ್ನು ಪರಿಶೀಲಿಸದೆಯೇ ಅರ್ಥೈಸುವುದು. ಉಲ್ಲಂಘನೆಗಳು ಪ್ರಮಾಣಿತ ದೋಷಗಳು ಮತ್ತು ವ್ಯಾಖ್ಯಾನವನ್ನು ವಿರೂಪಗೊಳಿಸುತ್ತವೆ; ರೋಗನಿರ್ಣಯವನ್ನು ತಪ್ಪಿಸಲಾಗುವುದಿಲ್ಲ.
ಸುಳಿವು: ಪ್ರತಿ ಗುಣಾಂಕಕ್ಕೆ, "ನಾನು ಈ ಸಂಬಂಧವನ್ನು ವಿರುದ್ಧ ದಿಕ್ಕಿನಲ್ಲಿ ವಿವರಿಸಬಹುದೇ? ಅಥವಾ ಎರಡರ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರುವ ಮೂರನೇ ಅಂಶವಿದೆಯೇ?" ಎಂದು ಕೇಳಿ. ಈ ಎರಡು ಪ್ರಶ್ನೆಗಳು ಪೆನ್ನು ಪೇಪರ್ ಅನ್ನು ಮುಟ್ಟುವ ಮೊದಲೇ ಸಾಂದರ್ಭಿಕ ಅತಿವ್ಯಾಖ್ಯಾನವನ್ನು ನಿಲ್ಲಿಸುತ್ತವೆ.
ಸಾರಾಂಶದಲ್ಲಿ
ರೇಖೀಯ ಹಿಂಜರಿತವು ವಿವರಣಾತ್ಮಕ ಅಂಶಗಳಿಗೆ ಫಲಿತಾಂಶದ ಸಂಬಂಧವನ್ನು ಅಳೆಯುವ ಮೂಲ ಸಾಧನವಾಗಿದೆ. AI ತ್ವರಿತವಾಗಿ ಮಾಡೆಲ್ನ ಕೋಡ್, ಔಟ್ಪುಟ್ ಲೇಔಟ್ ಮತ್ತು ಇಂಟರ್ಪ್ರಿಟೇಶನ್ ಔಟ್ಲೈನ್ ಅನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ; ಆದರೆ ಮಾದರಿ ವಿವರಣೆ, ಗುಣಾಂಕದ ಸಂಬಂಧಿತ ವ್ಯಾಖ್ಯಾನ ಮತ್ತು ಕಡೆಗಣಿಸದ ಅಸ್ಥಿರಗಳ ಅಪಾಯವು ತಜ್ಞರ ಜವಾಬ್ದಾರಿಯಾಗಿದೆ. ಗುಣಾಂಕವನ್ನು ಸಾಂದರ್ಭಿಕವಾಗಿ ಪ್ರಸ್ತುತಪಡಿಸುವುದು ಸಾಮಾನ್ಯ ತಪ್ಪು ("ಹೆಚ್ಚಳ"); ಸರಿಯಾದ ಭಾಷೆ ಸಂಬಂಧಿತವಾಗಿದೆ ("ಸಂಬಂಧಿತವಾಗಿದೆ, ಉಳಿದೆಲ್ಲವೂ ಸ್ಥಿರವಾಗಿರುತ್ತದೆ"). ಹೆಚ್ಚಿನ R-ವರ್ಗವು ಯಶಸ್ಸು ಅಥವಾ ಕಾರಣವಲ್ಲ; ಊಹೆಗಳನ್ನು ಪರಿಶೀಲಿಸದೆ ಯಾವುದೇ ವ್ಯಾಖ್ಯಾನವು ಸುರಕ್ಷಿತವಲ್ಲ (ವಿಶೇಷವಾಗಿ ಬಹಿರ್ಮುಖತೆ).
ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ
ಡೇಟಾ ಸೆಟ್ನಲ್ಲಿ ಒಂದು ಅವಲಂಬಿತ ಮತ್ತು ಕನಿಷ್ಠ ಎರಡು ಸ್ವತಂತ್ರ ಅಸ್ಥಿರಗಳೊಂದಿಗೆ ಹಿಂಜರಿತವನ್ನು ಹೊಂದಿಸಿ. AI ನಿಂದ ಕೋಡ್ ಅನ್ನು ವಿನಂತಿಸಿ ಮತ್ತು ಅದನ್ನು ರನ್ ಮಾಡಿ. ಮೊದಲಿಗೆ, ಸಂಬಂಧಿತ ಭಾಷೆಯಲ್ಲಿ ಗುಣಾಂಕಗಳನ್ನು AI ಅರ್ಥೈಸಿಕೊಳ್ಳಿ, ಮತ್ತು ನಂತರ ನೀವು ಪ್ರತಿ ಸಾಂದರ್ಭಿಕ ಹೇಳಿಕೆಯನ್ನು ಪರಿಶೀಲಿಸಿ ಮತ್ತು ಸರಿಪಡಿಸಿ. ಮಾದರಿಗೆ ಸಂಭಾವ್ಯ ಸಂಬಂಧಿತ ವೇರಿಯಬಲ್ ಅನ್ನು ಸೇರಿಸಿ ಮತ್ತು ಮುಖ್ಯ ಗುಣಾಂಕವು ಹೇಗೆ ಬದಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಗಮನಿಸಿ ಮತ್ತು ಬಿಟ್ಟುಬಿಡಲಾದ ವೇರಿಯಬಲ್ ಪಕ್ಷಪಾತದ ಚೌಕಟ್ಟಿನೊಳಗೆ ಪ್ಯಾರಾಗ್ರಾಫ್ನಲ್ಲಿ ಇದನ್ನು ಅರ್ಥೈಸಿಕೊಳ್ಳಿ. ಅಂತಿಮವಾಗಿ, ಊಹೆಯ ರೋಗನಿರ್ಣಯದ ಪ್ಲಾಟ್ಗಳನ್ನು ತಯಾರಿಸಿ ಮತ್ತು ಯಾವ ಊಹೆಯು ಘನವಾಗಿ ಕಾಣುತ್ತದೆ ಮತ್ತು ಯಾವುದು ಪ್ರಶ್ನಾರ್ಹವಾಗಿ ಕಾಣುತ್ತದೆ ಎಂಬುದನ್ನು ಗಮನಿಸಿ.
ಪರಿಶೀಲನಾಪಟ್ಟಿ
- [ ] ನಾನು ಸಿದ್ಧಾಂತ ಮತ್ತು ಕ್ಷೇತ್ರ ಜ್ಞಾನದ ಆಧಾರದ ಮೇಲೆ ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸಿದೆ, ಡೇಟಾದ ಮೇಲೆ ಅಲ್ಲ.
- [ ] ನಾನು ಗುಣಾಂಕಗಳನ್ನು ಸಂಬಂಧಿತ ಭಾಷೆಯಲ್ಲಿ ಅರ್ಥೈಸಿದ್ದೇನೆ ("ಸೆಟೆರಿಸ್ ಪ್ಯಾರಿಬಸ್ಗೆ ಸಂಬಂಧಿಸಿದೆ").
- [ ] ಸಾಂದರ್ಭಿಕ ಹಕ್ಕುಗಳಿಗೆ ಪ್ರತ್ಯೇಕ ವಿನ್ಯಾಸದ ಅಗತ್ಯವಿದೆ ಎಂದು ನಾನು ಗಮನಿಸಿದ್ದೇನೆ.
- [ ] ಸಂಭವನೀಯ ನಿರ್ಲಕ್ಷಿಸಲಾದ ಅಸ್ಥಿರಗಳನ್ನು ಪರಿಗಣಿಸುವ ಮೂಲಕ ನಾನು ಮುಖ್ಯ ಗುಣಾಂಕದ ಸೂಕ್ಷ್ಮತೆಯನ್ನು ಪರೀಕ್ಷಿಸಿದೆ.
- [ ] ನಾನು R-ಸ್ಕ್ವೇರ್ ಅನ್ನು ಯಶಸ್ಸು/ಕಾರಣತೆಯ ಅಳತೆಯಾಗಿ ಪ್ರಸ್ತುತಪಡಿಸಲಿಲ್ಲ.
- [ ] ಕಾಲ್ಪನಿಕ ರೋಗನಿರ್ಣಯದ ಪ್ಲಾಟ್ಗಳನ್ನು ಉತ್ಪಾದಿಸಿ ಮತ್ತು ವ್ಯಾಖ್ಯಾನಿಸಲಾಗಿದೆ; ಉಲ್ಲಂಘನೆಯಾಗಿದೆಯೇ ಎಂದು ನಾನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದ್ದೇನೆ.