ಘಟಕಗಳು
1. ಜೀವಶಾಸ್ತ್ರದಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯ ಪರಿಚಯ: ಪಾತ್ರಗಳು, ಗಡಿಗಳು, ಮೌಲ್ಯೀಕರಣ ಮತ್ತು ನೀತಿಶಾಸ್ತ್ರ 2. ಪೈಥಾನ್‌ನೊಂದಿಗೆ ಜೈವಿಕ ಡೇಟಾ ವಿಶ್ಲೇಷಣೆ ಮೂಲಭೂತ ಅಂಶಗಳು 3. ಸೀಕ್ವೆನ್ಸ್ ಅನಾಲಿಸಿಸ್ ಮತ್ತು ಬಯೋಇನ್ಫರ್ಮ್ಯಾಟಿಕ್ಸ್: ಡಿಎನ್ಎ, ಆರ್ಎನ್ಎ ಮತ್ತು ಪ್ರೋಟೀನ್ಗಳು 4. ಓಮಿಕ್ಸ್ ಡೇಟಾ ಮತ್ತು ಹೈ ಡೈಮೆನ್ಷನಲ್ ಅನಾಲಿಸಿಸ್ 5. ಪ್ರೋಟೀನ್ ರಚನೆ ಮತ್ತು ಆಲ್ಫಾಫೋಲ್ಡ್: ಜೀವಶಾಸ್ತ್ರದಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯ ವಿಜಯ 6. ಚಿತ್ರ ವಿಶ್ಲೇಷಣೆ ಮತ್ತು ಪ್ರಕಾರ/ಕೋಶ ಗುರುತಿಸುವಿಕೆ 7. ಪ್ರಾಯೋಗಿಕ ವಿನ್ಯಾಸ: ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯೊಂದಿಗೆ ಘನ ಯೋಜನೆಯನ್ನು ಸ್ಥಾಪಿಸುವುದು 8. ಡೇಟಾ ವಿಶ್ಲೇಷಣೆ ಮತ್ತು ಅಂಕಿಅಂಶಗಳ ಮೌಲ್ಯೀಕರಣ 9. ವೈಜ್ಞಾನಿಕ ದೃಶ್ಯೀಕರಣ: ಡೇಟಾವನ್ನು ಪ್ರಾಮಾಣಿಕವಾಗಿ ಮತ್ತು ಅರ್ಥವಾಗುವಂತೆ ಪ್ರದರ್ಶಿಸುವುದು 10. ಸಾಹಿತ್ಯ ವಿಮರ್ಶೆ ಮತ್ತು ವೈಜ್ಞಾನಿಕ ಬರವಣಿಗೆ 11. ನೈತಿಕತೆ, ಜೈವಿಕ ಭದ್ರತೆ, ಗೌಪ್ಯತೆ ಮತ್ತು ವೈಜ್ಞಾನಿಕ ಸಮಗ್ರತೆ
ಘಟಕ 4 / 11

ಓಮಿಕ್ಸ್ ಡೇಟಾ ಮತ್ತು ಹೈ ಡೈಮೆನ್ಷನಲ್ ಅನಾಲಿಸಿಸ್

ಲಾಭಗಳು:

  • ಬಹು ಹೋಲಿಕೆಯ ಸಮಸ್ಯೆಯನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ವಿಶ್ಲೇಷಣೆಯಲ್ಲಿ FDR (ತಪ್ಪು ಪತ್ತೆ ದರ) ತಿದ್ದುಪಡಿಯನ್ನು ಸೇರಿಸುವುದು
  • p-ಮೌಲ್ಯ ಮತ್ತು ಪರಿಣಾಮದ ಗಾತ್ರವನ್ನು (log2 ಪಟ್ಟು ಬದಲಾವಣೆ) ಒಟ್ಟಿಗೆ ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ ಮೂಲಕ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ಮತ್ತು ಜೈವಿಕ ಪ್ರಾಮುಖ್ಯತೆಯನ್ನು ಪ್ರತ್ಯೇಕಿಸುವ ಸಾಮರ್ಥ್ಯ
  • ಬ್ಯಾಚ್ ಎಫೆಕ್ಟ್ ಮತ್ತು ಕಾಸ್ಯಾಲಿಟಿ ಜಂಪ್‌ನಂತಹ ಹೆಚ್ಚಿನ ಆಯಾಮದ ಡೇಟಾ ಟ್ರ್ಯಾಪ್‌ಗಳನ್ನು ಗುರುತಿಸುವ ಮತ್ತು ತಪ್ಪಿಸುವ ಸಾಮರ್ಥ್ಯ

"ಓಮಿಕ್ಸ್" ಎಂಬ ಪದವು ಕೋಶದಲ್ಲಿನ ಅಣುಗಳ ಸಂಪೂರ್ಣ ವರ್ಗವನ್ನು ಅಳೆಯುವ ವಿಧಾನಗಳನ್ನು ವಿವರಿಸುತ್ತದೆ: ಜೀನೋಮಿಕ್ಸ್ (ಎಲ್ಲಾ ಡಿಎನ್‌ಎ), ಟ್ರಾನ್ಸ್‌ಕ್ರಿಪ್ಟೊಮಿಕ್ಸ್ (ಎಲ್ಲಾ ಆರ್‌ಎನ್‌ಎ / ಜೀನ್ ಅಭಿವ್ಯಕ್ತಿ), ಪ್ರೋಟಿಯೊಮಿಕ್ಸ್ (ಎಲ್ಲಾ ಪ್ರೋಟೀನ್‌ಗಳು), ಮೆಟಾಬೊಲೊಮಿಕ್ಸ್ (ಎಲ್ಲಾ ಸಣ್ಣ ಅಣುಗಳು). ಈ ಅಳತೆಗಳ ಸಾಮಾನ್ಯ ಲಕ್ಷಣವೆಂದರೆ ಅವುಗಳ ಹೆಚ್ಚಿನ ಆಯಾಮ: ಸಾವಿರಾರು ಅಥವಾ ಹತ್ತಾರು ಅಸ್ಥಿರಗಳನ್ನು (ಜೀನ್‌ಗಳು, ಪ್ರೋಟೀನ್‌ಗಳು) ಒಂದೇ ಮಾದರಿಯಲ್ಲಿ ಏಕಕಾಲದಲ್ಲಿ ಅಳೆಯಲಾಗುತ್ತದೆ, ಆದರೆ ಮಾದರಿಗಳ ಸಂಖ್ಯೆ ಸಾಮಾನ್ಯವಾಗಿ ಚಿಕ್ಕದಾಗಿದೆ (ಉದಾ. 20 ರೋಗಿಗಳು). ಈ "ಅನೇಕ ಅಸ್ಥಿರಗಳು, ಕೆಲವು ಮಾದರಿಗಳು" ಪರಿಸ್ಥಿತಿಯು ಜೀವಶಾಸ್ತ್ರಕ್ಕೆ ವಿಶಿಷ್ಟವಾದ ಸವಾಲುಗಳ ಮೂಲವಾಗಿದೆ ಮತ್ತು AI ಹೆಚ್ಚು ಸಹಾಯಕವಾಗಬಹುದು.

ಈ ಘಟಕದಲ್ಲಿ, ಡಿಫರೆನ್ಷಿಯಲ್ ಎಕ್ಸ್‌ಪ್ರೆಶನ್ ಅನಾಲಿಸಿಸ್ (ಎರಡು ಗುಂಪುಗಳ ನಡುವೆ ಅಭಿವ್ಯಕ್ತಿ ಗಮನಾರ್ಹವಾಗಿ ಬದಲಾಗುವ ಜೀನ್‌ಗಳನ್ನು ಕಂಡುಹಿಡಿಯುವುದು) ಮತ್ತು ಟ್ರಾನ್ಸ್‌ಕ್ರಿಪ್ಟೋಮಿಕ್ಸ್ (ಆರ್‌ಎನ್‌ಎ-ಸೆಕ್) ಉದಾಹರಣೆಯ ಮೂಲಕ ಈ ವರ್ಕ್‌ಫ್ಲೋನಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯ ಪಾತ್ರವನ್ನು ನಾವು ಚರ್ಚಿಸುತ್ತೇವೆ.

ಹೆಚ್ಚಿನ ಆಯಾಮದ ಡೇಟಾದ ಮುಖ್ಯ ಸಮಸ್ಯೆ

ನೀವು ಒಂದೇ ಬಾರಿಗೆ ಸಾವಿರಾರು ಜೀನ್‌ಗಳನ್ನು ಪರೀಕ್ಷಿಸಿದರೆ, ನಿಜವಾದ ವ್ಯತ್ಯಾಸಗಳಿಲ್ಲದಿದ್ದರೂ ಸಹ ಆಕಸ್ಮಿಕವಾಗಿ "ಮಹತ್ವ" ಎಂದು ತೋರುವ ಜೀನ್‌ಗಳನ್ನು ನೀವು ಕಾಣಬಹುದು. ನೀವು 20,000 ಜೀನ್‌ಗಳನ್ನು 5% ಮಾರ್ಜಿನ್ ದೋಷದೊಂದಿಗೆ ಪರೀಕ್ಷಿಸಿದರೆ, ~1,000 ಜೀನ್‌ಗಳು ಆಕಸ್ಮಿಕವಾಗಿ "ಮಹತ್ವ" ಎಂದು ಹೊರಹೊಮ್ಮಬಹುದು. ಇದನ್ನು ಬಹು ಹೋಲಿಕೆಯ ಸಮಸ್ಯೆ ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ ಮತ್ತು ಓಮಿಕ್ಸ್ ವಿಶ್ಲೇಷಣೆಯ ಅತ್ಯಂತ ನಿರ್ಣಾಯಕ ಅಪಾಯವಾಗಿದೆ. ಪಿ-ಮೌಲ್ಯಗಳನ್ನು ಸರಿಪಡಿಸುವುದು ಪರಿಹಾರವಾಗಿದೆ (ಉದಾ. ಎಫ್‌ಡಿಆರ್ ಅನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ - ಬೆಂಜಮಿನಿ-ಹೋಚ್‌ಬರ್ಗ್ ವಿಧಾನದೊಂದಿಗೆ ತಪ್ಪು ಪತ್ತೆ ದರ). ಈ ಪರಿಕಲ್ಪನೆಯನ್ನು ವಿವರಿಸಲು ಮತ್ತು ಸರಿಯಾದ ಕೋಡ್ ಅನ್ನು ಬರೆಯಲು AI ಬಹಳ ಸಹಾಯಕವಾಗಿದೆ; ಆದರೆ ತಿದ್ದುಪಡಿಯನ್ನು ಅನ್ವಯಿಸುವುದನ್ನು ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವುದು ನಿಮ್ಮ ಜವಾಬ್ದಾರಿಯಾಗಿದೆ.

ಸಲಹೆ: ಓಮಿಕ್ಸ್ ಫಲಿತಾಂಶದಲ್ಲಿ "3,000 ಜೀನ್‌ಗಳು ಗಣನೀಯವಾಗಿ ಬದಲಾಗಿದೆ" ನಂತಹ ಸಂಖ್ಯೆಯನ್ನು ನೀವು ನೋಡಿದರೆ, ಗಾಬರಿಯಾಗಿರಿ. ಇದು ಸಾಮಾನ್ಯವಾಗಿ ಬಹು ಹೋಲಿಕೆಯ ತಿದ್ದುಪಡಿಯನ್ನು ಮಾಡಲಾಗಿಲ್ಲ ಎಂಬ ಸಂಕೇತವಾಗಿದೆ. ಒಂದು ನೈಜವಾದ ಪಟ್ಟಿಯು ಉತ್ತಮವಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಿದ ಪ್ರಯೋಗದಲ್ಲಿ ಹತ್ತರಿಂದ ನೂರಾರು ಜೀನ್‌ಗಳಾಗಿರುತ್ತದೆ.

RNA-seq ಭೇದಾತ್ಮಕ ಅಭಿವ್ಯಕ್ತಿ: ಹಂತ ಹಂತವಾಗಿ

  1. ಕಚ್ಚಾ ಎಣಿಕೆಗಳು: ಪ್ರತಿ ಜೀನ್‌ಗೆ ಪ್ರತಿ ಮಾದರಿಯಲ್ಲಿ ಎಷ್ಟು ರೀಡ್‌ಗಳು ಬಿದ್ದಿವೆ ಎಂಬುದನ್ನು ಒಳಗೊಂಡಿರುವ ಕೋಷ್ಟಕ.
  2. ಗುಣಮಟ್ಟ ಮತ್ತು ಫಿಲ್ಟರಿಂಗ್: ಅತ್ಯಂತ ಕಡಿಮೆ ಅಭಿವ್ಯಕ್ತಿಯೊಂದಿಗೆ ಜೀನ್‌ಗಳನ್ನು ತ್ಯಜಿಸಿ.
  3. ಸಾಮಾನ್ಯೀಕರಣ: ಮಾದರಿಗಳ ನಡುವಿನ ಸರಿಯಾದ ಲೈಬ್ರರಿ ಗಾತ್ರದ ವ್ಯತ್ಯಾಸ (ಬ್ರೂಟ್ ಸಂಖ್ಯೆಯನ್ನು ಹೋಲಿಸಲಾಗುವುದಿಲ್ಲ).
  4. ಅಂಕಿಅಂಶ ಮಾದರಿ: ಪೈಥಾನ್‌ನಲ್ಲಿ DESeq2 ಅಥವಾ ಎಡ್ಜ್‌ಆರ್ (R ಲೈಬ್ರರಿಗಳು) ಅಥವಾ pyDESeq2 ನೊಂದಿಗೆ ಗುಂಪು ವ್ಯತ್ಯಾಸವನ್ನು ಪರೀಕ್ಷಿಸಿ.
  5. ಬಹು ಹೋಲಿಕೆ ತಿದ್ದುಪಡಿ: FDR ಅನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ; ಸಾಮಾನ್ಯವಾಗಿ FDR <0.05 ರ ಮಿತಿ.
  6. ಪರಿಣಾಮದ ಗಾತ್ರ: log2 ಪಟ್ಟು ಬದಲಾವಣೆಯೊಂದಿಗೆ ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ: ಅಭಿವ್ಯಕ್ತಿ ಎಷ್ಟು ಬಾರಿ ಹೆಚ್ಚಾಗುತ್ತದೆ/ಕಡಿಮೆಯಾಗುತ್ತದೆ.
  7. ಕಾಮೆಂಟ್: ಜೈವಿಕ ಮಾರ್ಗಗಳೊಂದಿಗೆ ಗಮನಾರ್ಹ ಜೀನ್‌ಗಳನ್ನು ಸಂಯೋಜಿಸಿ.

ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ 3-6. ಇದು ಹಂತಗಳನ್ನು ಸಂಕೇತಿಸುತ್ತದೆ, ಪರಿಕಲ್ಪನೆಗಳನ್ನು ವಿವರಿಸುತ್ತದೆ ಮತ್ತು ಔಟ್‌ಪುಟ್ ಅನ್ನು ಅರ್ಥೈಸಲು ನಿಮಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಆದಾಗ್ಯೂ, ಮಾದರಿಯು ನಿಮ್ಮ ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ನೋಡದೆ "ಯಾವ ಜೀನ್ ಬದಲಾಗಿದೆ" ಎಂದು ಹೇಳಲು ಸಾಧ್ಯವಿಲ್ಲ; ಕೋಡ್ ಮತ್ತು ಅಂಕಿಅಂಶಗಳು ಇದನ್ನು ನಿಮಗೆ ತಿಳಿಸುತ್ತವೆ.

ನಕಲು ಮಾಡಬಹುದಾದ ಪ್ರಾಂಪ್ಟ್ ಟೆಂಪ್ಲೇಟ್‌ಗಳು

ಪಾತ್ರ: ನೀವು ಪ್ರತಿಲೇಖನ ವಿಶ್ಲೇಷಣೆ ಸಹಾಯಕರು. ಸಂದರ್ಭ: ನಾನು 12 ನಿಯಂತ್ರಣ, 12 ಚಿಕಿತ್ಸಾ ಮಾದರಿಗಳಿಂದ RNA-seq ಕಚ್ಚಾ ಕೌಂಟ್ ಟೇಬಲ್ (CSV) ಅನ್ನು ಹೊಂದಿದ್ದೇನೆ. ಕಾರ್ಯ: pyDESeq2 ನೊಂದಿಗೆ ವಿಭಿನ್ನ ಅಭಿವ್ಯಕ್ತಿ ವಿಶ್ಲೇಷಣೆಯ ಹಂತಗಳನ್ನು ಪಟ್ಟಿ ಮಾಡಿ, ಪ್ರತಿ ಹಂತವು ಏಕೆ ಅಗತ್ಯ ಎಂಬುದನ್ನು ವಿವರಿಸಿ. ಮೊದಲು ಯೋಜನೆ ಮಾಡಿ, ಎರಡನೆಯದಾಗಿ ಕೋಡ್ ಮಾಡಿ. ಬಹು ಹೋಲಿಕೆ ತಿದ್ದುಪಡಿಯನ್ನು ಸೇರಿಸಲು ಮರೆಯದಿರಿ.

ನನ್ನ ವಿಶ್ಲೇಷಣೆಯ ಔಟ್‌ಪುಟ್ 4,200 ಜೀನ್‌ಗಳನ್ನು "p<0.05" ಎಂದು ತೋರಿಸಿದೆ. ಇದು ಏಕೆ ಅನುಮಾನಾಸ್ಪದವಾಗಿರಬಹುದು? ಬಹು ಹೋಲಿಕೆ ತಿದ್ದುಪಡಿಯನ್ನು ವಿವರಿಸಿ (ಬೆಂಜಮಿನಿ-ಹೊಚ್‌ಬರ್ಗ್ ಎಫ್‌ಡಿಆರ್) ಮತ್ತು ಸರಿಯಾದ ಫಿಲ್ಟರಿಂಗ್ ಮಾಡುವ ಪೈಥಾನ್ ಕೋಡ್ ನೀಡಿ.

ನನ್ನ ಡಿಫರೆನ್ಷಿಯಲ್ ಎಕ್ಸ್‌ಪ್ರೆಶನ್ ಫಲಿತಾಂಶ ಕೋಷ್ಟಕದಿಂದ (ಜೀನ್, ಲಾಗ್2ಎಫ್‌ಸಿ, ಪ್ಯಾಡ್‌ಜೆ ಕಾಲಮ್‌ಗಳು) ಜ್ವಾಲಾಮುಖಿಯ ಕಥಾವಸ್ತುವನ್ನು ಸೆಳೆಯುವ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ. FDR<0.05 ಮತ್ತು |log2FC|>1 ನೊಂದಿಗೆ ಜೀನ್‌ಗಳನ್ನು ಬಣ್ಣ ಮಾಡಿ, ಟಾಪ್ 10 ಅನ್ನು ಲೇಬಲ್ ಮಾಡಿ.

ಮಾರ್ಗ ಪುಷ್ಟೀಕರಣಕ್ಕಾಗಿ ಈ ಮಹತ್ವದ ಜೀನ್ ಪಟ್ಟಿಯನ್ನು ನಾನು ಹೇಗೆ ವಿಶ್ಲೇಷಿಸುವುದು? gseapy ಅಥವಾ g:Profiler ಹಂತಗಳನ್ನು ವಿವರಿಸಿ. ಕಾಮೆಂಟ್‌ನಲ್ಲಿ ಸಂಪೂರ್ಣ ಕಾರಣವನ್ನು ಹೇಳಬೇಡಿ, ಪರಸ್ಪರ ಸಂಬಂಧದ ಭಾಷೆಯನ್ನು ಬಳಸಿ. ಜೀನ್ ಪಟ್ಟಿ: [ಪಟ್ಟಿ]

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್

ದುರ್ಬಲ: "ಆರ್‌ಎನ್‌ಎ-ಸೆಕ್ ಇಳುವರಿಯಲ್ಲಿ ಯಾವ ಜೀನ್‌ಗಳು ಮುಖ್ಯವೆಂದು ಹೇಳಿ."

ಪ್ರಬಲ: "ನಾನು 12 ನಿಯಂತ್ರಣದಿಂದ pyDESeq2 ಔಟ್‌ಪುಟ್ ಹೊಂದಿದ್ದೇನೆ, 12 ಚಿಕಿತ್ಸಾ ಮಾದರಿಗಳು: ಜೀನ್‌ನೊಂದಿಗೆ ಟೇಬಲ್, log2FoldChange, padj ಕಾಲಮ್‌ಗಳು. ಗಮನಾರ್ಹ ಜೀನ್‌ಗಳನ್ನು FDR<0.05 ಮತ್ತು |log2FC|>1 ರ ಥ್ರೆಶೋಲ್ಡ್‌ಗಳೊಂದಿಗೆ ಫಿಲ್ಟರ್ ಮಾಡುವ ಕೋಡ್ ಅನ್ನು ನೀಡಿ, ಅವುಗಳ ಸಂಖ್ಯೆಗಳನ್ನು ವರದಿ ಮಾಡುತ್ತದೆ ಮತ್ತು ಈ ಪರಿಣಾಮವು 20 ನೇ ಶ್ರೇಣಿಯ ಗಾತ್ರದಲ್ಲಿ ಏಕೆ ಪ್ರಬಲವಾಗಿದೆ ಎಂಬುದನ್ನು ವಿವರಿಸುತ್ತದೆ. ಸಮಂಜಸ."

ವ್ಯತ್ಯಾಸ: ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್ ನಿಜವಾದ ಔಟ್‌ಪುಟ್ ಕಾಲಮ್‌ಗಳು, ಥ್ರೆಶೋಲ್ಡ್‌ಗಳು ಮತ್ತು ಮೌಲ್ಯೀಕರಣ ವಿನಂತಿಯನ್ನು ಹೊಂದಿದೆ. ಮಾಡೆಲ್ ಜೀನ್ ಹೆಸರನ್ನು ಉತ್ಪಾದಿಸುವ ಬದಲು ನಿಮ್ಮ ಡೇಟಾವನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುತ್ತದೆ.

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 — ತಿದ್ದುಪಡಿ ಇಲ್ಲದ ವಿಪತ್ತು: ಒಂದು ಗುಂಪು p<0.05 ನೊಂದಿಗೆ 3,800 "ಮಹತ್ವದ" ಜೀನ್‌ಗಳನ್ನು ತಿದ್ದುಪಡಿ ಮಾಡದೆ ಪತ್ತೆ ಮಾಡಿ ಅದನ್ನು ಪ್ರಕಟಣೆಗೆ ಸಲ್ಲಿಸಿತು. ರೆಫರಿ FDR ತಿದ್ದುಪಡಿಯನ್ನು ಕೇಳಿದಾಗ, ಪಟ್ಟಿಯು 47 ಜೀನ್‌ಗಳಿಗೆ ಇಳಿಯಿತು. ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ ಮೊದಲಿನಿಂದಲೂ ಬೆಂಜಮಿನಿ-ಹೊಚ್ಬರ್ಗ್ ಕೋಡ್ ಅನ್ನು ಸೇರಿಸಿದ್ದರೆ, ಈ ಮುಜುಗರ ಸಂಭವಿಸುತ್ತಿರಲಿಲ್ಲ. ಪಾಠ: ತಿದ್ದುಪಡಿ ನೆಗೋಶಬಲ್ ಅಲ್ಲ.

ಪ್ರಕರಣ 2 - ಬ್ಯಾಚ್ ಪರಿಣಾಮ: ಒಂದು ಅಧ್ಯಯನದಲ್ಲಿ, ಮಾದರಿಗಳನ್ನು ಎರಡು ವಿಭಿನ್ನ ದಿನಗಳಲ್ಲಿ ಸಂಸ್ಕರಿಸಲಾಗಿದೆ. "ರೋಗಿ ವಿರುದ್ಧ ನಿಯಂತ್ರಣ" ವ್ಯತ್ಯಾಸ ಎಂದು ಅವರು ಭಾವಿಸಿದ್ದು ವಾಸ್ತವವಾಗಿ "1 ನೇ ದಿನ ಮತ್ತು 2 ನೇ ದಿನ" ವ್ಯತ್ಯಾಸವಾಗಿದೆ (ಬ್ಯಾಚ್ ಪರಿಣಾಮ: ಮಾದರಿ ಪಕ್ಷದಿಂದಾಗಿ ತಾಂತ್ರಿಕ ವ್ಯತ್ಯಾಸ). ಮಾದರಿಗೆ ಬ್ಯಾಚ್ ವೇರಿಯೇಬಲ್ ಅನ್ನು ಸೇರಿಸಲು ಸಲಹೆ ನೀಡುವ ಮೂಲಕ ನಕಲಿ ಸಿಗ್ನಲ್ ಅನ್ನು ಹೊರಹಾಕಲು AI ಸಹಾಯ ಮಾಡಿತು (~ ಬ್ಯಾಚ್ + ಮಾದರಿ ಸೂತ್ರದಲ್ಲಿ ಸ್ಥಿತಿ).

ಪ್ರಕರಣ 3 - ಪಟ್ಟು ಬದಲಾವಣೆಯನ್ನು ನಿರ್ಲಕ್ಷಿಸುವುದು: ವಿದ್ಯಾರ್ಥಿಯು "ಅತ್ಯಂತ ಪ್ರಮುಖ" ಜೀನ್ ಅನ್ನು ಘೋಷಿಸಿದನು, ಅದರ ಅಭಿವ್ಯಕ್ತಿ 2% ರಷ್ಟು ಬದಲಾಗಿದೆ ಆದರೆ p-ಮೌಲ್ಯವನ್ನು ನೋಡುವ ಮೂಲಕ ಬಹಳ ಸ್ಥಿರವಾಗಿದೆ ಎಂದು ಅಳೆಯಲಾಗುತ್ತದೆ. ಆದರೆ ಪರಿಣಾಮದ ಗಾತ್ರ (log2FC) ಬಹುತೇಕ ಶೂನ್ಯವಾಗಿತ್ತು; ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ಮಹತ್ವವು ಜೈವಿಕ ಮಹತ್ವವಲ್ಲ. ಮಾದರಿಯು ಈ ವ್ಯತ್ಯಾಸವನ್ನು ವಿವರಿಸಿತು ಮತ್ತು ಅದನ್ನು ಜ್ವಾಲಾಮುಖಿ ಗ್ರಾಫ್ನೊಂದಿಗೆ ದೃಶ್ಯೀಕರಿಸುವಂತೆ ಸೂಚಿಸಿತು.

ಹೋಲಿಕೆ ಕೋಷ್ಟಕ: ಪರಿಕಲ್ಪನೆಯ ಸ್ಪಷ್ಟತೆ

ಪರಿಕಲ್ಪನೆ

ಅರ್ಥ

ಇದು ಏಕೆ ಮುಖ್ಯ?

p-ಮೌಲ್ಯ

ವ್ಯತ್ಯಾಸದ ಸಂಭವನೀಯತೆಯು ಕಾಕತಾಳೀಯವಾಗಿದೆ

ಕೇವಲ ತಪ್ಪುದಾರಿಗೆಳೆಯಬಹುದು

FDR (padj)

ಬಹು ಪರೀಕ್ಷೆಯಲ್ಲಿ ದೋಷ ದರವನ್ನು ಸರಿಪಡಿಸಲಾಗಿದೆ

ತಪ್ಪು ಧನಾತ್ಮಕತೆಯನ್ನು ಮಿತಿಗೊಳಿಸುತ್ತದೆ

log2 ಪಟ್ಟು ಬದಲಾವಣೆ

ಪರಿಣಾಮದ ಗಾತ್ರ

ಜೈವಿಕ ಮಹತ್ವವನ್ನು ಸೂಚಿಸುತ್ತದೆ

ಬ್ಯಾಚ್ ಪರಿಣಾಮ

ತಾಂತ್ರಿಕ ಬ್ಯಾಚ್ ವ್ಯತ್ಯಾಸ

ನಕಲಿ ಸಂಕೇತವನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ

ಸಾಮಾನ್ಯೀಕರಣ

ಇಂಟರ್-ಮಾದರಿ ಪ್ರಮಾಣದ ತಿದ್ದುಪಡಿ

ಹೋಲಿಕೆಯನ್ನು ನ್ಯಾಯೋಚಿತವಾಗಿ ಮಾಡುತ್ತದೆ

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಬಹು ಹೋಲಿಕೆ ತಿದ್ದುಪಡಿಯನ್ನು ಬಿಟ್ಟುಬಿಡುವುದು: ಅತ್ಯಂತ ಸಾಮಾನ್ಯ ಮತ್ತು ಅತ್ಯಂತ ಗಂಭೀರವಾದ ತಪ್ಪು.
  • ಕೇವಲ p-ಮೌಲ್ಯವನ್ನು ನೋಡುವುದು: ಪರಿಣಾಮದ ಗಾತ್ರವನ್ನು (log2FC) ಒಟ್ಟಿಗೆ ಪರಿಗಣಿಸಲು ಮರೆಯದಿರಿ.
  • ಮಾದರಿಯಲ್ಲಿ ಬ್ಯಾಚ್ ಪರಿಣಾಮವನ್ನು ಒಳಗೊಂಡಿಲ್ಲ: ಜೈವಿಕ ವ್ಯತ್ಯಾಸಕ್ಕಾಗಿ ತಾಂತ್ರಿಕ ವ್ಯತ್ಯಾಸವನ್ನು ತಪ್ಪಾಗಿ ಗ್ರಹಿಸುವುದು.
  • ಸಾಮಾನ್ಯೀಕರಣವನ್ನು ಮರೆತುಬಿಡುವುದು: ಕಚ್ಚಾ ಸಂಖ್ಯೆಗಳನ್ನು ನೇರವಾಗಿ ಹೋಲಿಸುವುದು.
  • ಕಾರಣ ಭಾಷೆ: "ಈ ಜೀನ್ ರೋಗವನ್ನು ಉಂಟುಮಾಡುತ್ತದೆ" ಎಂದು ಹೇಳುವುದು; ಓಮಿಕ್ಸ್ ಡೇಟಾವು ಪರಸ್ಪರ ಸಂಬಂಧವನ್ನು ತೋರಿಸುತ್ತದೆ, ಕಾರಣಕ್ಕೆ ಹೆಚ್ಚುವರಿ ಪ್ರಯೋಗದ ಅಗತ್ಯವಿದೆ.
ಎಚ್ಚರಿಕೆ: ಹೆಚ್ಚಿನ ಆಯಾಮದ ಡೇಟಾದಲ್ಲಿ, "ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯವಾಗಿ ಮಹತ್ವದ್ದಾಗಿದೆ" ಮತ್ತು "ಜೈವಿಕವಾಗಿ ಮಹತ್ವದ್ದಾಗಿದೆ" ಎರಡು ವಿಭಿನ್ನ ವಿಷಯಗಳು. ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯಿಂದ ಉತ್ಪತ್ತಿಯಾಗುವ ಜೀನ್ ಪಟ್ಟಿಯು ಆರಂಭಿಕ ಊಹೆಯಾಗಿದೆ; ಪ್ರತಿ ಅಭ್ಯರ್ಥಿ ಜೀನ್ ಅನ್ನು ಸ್ವತಂತ್ರ ವಿಧಾನದಿಂದ (qPCR, ಪ್ರೋಟೀನ್ ಮಾಪನ) ಪರಿಶೀಲಿಸದೆ ನಿರ್ಣಾಯಕವೆಂದು ಪರಿಗಣಿಸಬಾರದು.

ಗಾತ್ರ ಕಡಿತ ಮತ್ತು ಗುಣಮಟ್ಟದ ನಿಯಂತ್ರಣ

ಹೆಚ್ಚಿನ ಆಯಾಮದ ಡೇಟಾದಲ್ಲಿ ಮಾಡಬೇಕಾದ ಮೊದಲ ವಿಷಯವೆಂದರೆ ಮಾದರಿಗಳ ಸಾಮಾನ್ಯ ರಚನೆಯನ್ನು ನೋಡುವುದು. ಪಿಸಿಎ (ಪ್ರಧಾನ ಘಟಕ ವಿಶ್ಲೇಷಣೆ: ಸಾವಿರಾರು ವೇರಿಯೇಬಲ್‌ಗಳನ್ನು ಕೆಲವು ಸಾರಾಂಶ ಅಕ್ಷಗಳಾಗಿ ಕಡಿಮೆ ಮಾಡುವುದು ಮತ್ತು ಅವುಗಳನ್ನು 2 ಆಯಾಮಗಳಲ್ಲಿ ಪ್ರದರ್ಶಿಸುವುದು) ಇದಕ್ಕೆ ಪ್ರಮಾಣಿತ ಸಾಧನವಾಗಿದೆ. ನೀವು ನಿರೀಕ್ಷಿಸುವ ಗುಂಪುಗಳನ್ನು (ನಿಯಂತ್ರಣ/ಚಿಕಿತ್ಸೆ) ಪಿಸಿಎ ಚಾರ್ಟ್‌ನಲ್ಲಿ ಪ್ರತ್ಯೇಕಿಸಿದ್ದರೆ, ಅದು ಒಳ್ಳೆಯದು; ಆದರೆ ಮಾದರಿಗಳನ್ನು ಗುಂಪಿನ ಬದಲಿಗೆ "ದಿನ ಸಂಸ್ಕರಿಸಿದ" ಮೂಲಕ ಕ್ಲಸ್ಟರ್ ಮಾಡಿದ್ದರೆ, ಇದು ಬ್ಯಾಚ್ ಪರಿಣಾಮದ ಎಚ್ಚರಿಕೆಯಾಗಿದೆ. ಅದೇ ಚಾರ್ಟ್ ಕೂಡ ತಕ್ಷಣವೇ ಒಂದು ಔಟ್ಲೈಯರ್ (ವಿಫಲವಾದ) ಉದಾಹರಣೆಯನ್ನು ತೋರಿಸುತ್ತದೆ.

ನನ್ನ ಸಾಮಾನ್ಯೀಕರಿಸಿದ ಅಭಿವ್ಯಕ್ತಿ ಕೋಷ್ಟಕದಿಂದ PCA ಬರೆಯಿರಿ (ಸಾಲು ಜೀನ್, ಕಾಲಮ್ ಮಾದರಿ). ಗುಂಪಿನ ಮೂಲಕ ಬಣ್ಣದ ಮಾದರಿಗಳು (ನಿಯಂತ್ರಣ/ಚಿಕಿತ್ಸೆ), ಬ್ಯಾಚ್ ಅನ್ನು ಸಂಸ್ಕರಿಸುವ ಮೂಲಕ ಆಕಾರ. ಗ್ರಾಫ್‌ನಲ್ಲಿ ಬ್ಯಾಚ್ ಎಫೆಕ್ಟ್ ಅಥವಾ ಔಟ್‌ಲೈಯರ್ ಪ್ಯಾಟರ್ನ್ ಕಂಡುಬಂದಿದೆಯೇ ಎಂಬುದರ ಕುರಿತು ಕಾಮೆಂಟ್ ಮಾಡಿ.

ಈ ಹ್ಯೂರಿಸ್ಟಿಕ್ ಹಂತವು ಉಳಿದ ವಿಶ್ಲೇಷಣೆಯನ್ನು ನಡೆಸುತ್ತದೆ: ನಕಲಿ ಫಲಿತಾಂಶಕ್ಕಾಗಿ ತಿಂಗಳುಗಳನ್ನು ವ್ಯರ್ಥ ಮಾಡುವುದಕ್ಕಿಂತ ಮುಂಚೆಯೇ ಹೊರಭಾಗವನ್ನು ಹಿಡಿಯುವುದು ಉತ್ತಮ.

ಏಕ ಕೋಶ ಡೇಟಾ: ಹೊಸ ಆಯಾಮ

ಇತ್ತೀಚಿನ ವರ್ಷಗಳಲ್ಲಿ, ಏಕ-ಕೋಶ ಆರ್‌ಎನ್‌ಎ ಅನುಕ್ರಮವು (ಏಕ-ಕೋಶ ಆರ್‌ಎನ್‌ಎ-ಸೆಕ್: ಸಾವಿರಾರು ಪ್ರತ್ಯೇಕ ಕೋಶಗಳ ಅಭಿವ್ಯಕ್ತಿ ಪ್ರೊಫೈಲ್ ಅನ್ನು ಅಳೆಯುವುದು) ವ್ಯಾಪಕವಾಗಿದೆ. ಇಲ್ಲಿ ಡೇಟಾವು ಇನ್ನೂ ದೊಡ್ಡದಾಗುತ್ತದೆ: ಹತ್ತಾರು ಸಾವಿರ ಕೋಶಗಳು, ಸಾವಿರಾರು ಜೀನ್‌ಗಳು. Scanpy (Python) ನಂತಹ ಉಪಕರಣಗಳು ಈ ಡೇಟಾವನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುತ್ತವೆ; ಜೀವಕೋಶಗಳನ್ನು ಕ್ಲಸ್ಟರ್ ಮಾಡುತ್ತದೆ ಮತ್ತು ಜೀವಕೋಶದ ಪ್ರಕಾರಗಳನ್ನು ಗುರುತಿಸುತ್ತದೆ. AI ಈ ವರ್ಕ್‌ಫ್ಲೋಗಾಗಿ ಕೋಡ್ ಅನ್ನು ಬರೆಯುತ್ತದೆ, ಆದರೆ ಜೀವಕೋಶದ ಪ್ರಕಾರಗಳ ಜೈವಿಕ ನಾಮಕರಣವು (ಕ್ಲಸ್ಟರ್ "ಟಿ ಸೆಲ್" ಅಥವಾ "ಮ್ಯಾಕ್ರೋಫೇಜ್" ಆಗಿರಲಿ) ಮಾರ್ಕರ್ ಜೀನ್‌ಗಳು ಮತ್ತು ತಜ್ಞರ ಜ್ಞಾನವನ್ನು ಅವಲಂಬಿಸಿದೆ. ತಿಳಿದಿರುವ ಮಾರ್ಕರ್‌ಗಳೊಂದಿಗೆ ಕ್ಲಸ್ಟರ್‌ಗೆ ಮಾದರಿಯು ನಿಯೋಜಿಸುವ ಸೆಲ್ ಪ್ರಕಾರದ ಲೇಬಲ್ ಅನ್ನು ಖಚಿತಪಡಿಸಲು ಮರೆಯದಿರಿ; ಏಕಕೋಶದ ವಿಶ್ಲೇಷಣೆಯಲ್ಲಿ ಇದು ಸಾಮಾನ್ಯವಾಗಿ ತಪ್ಪಾಗಿ ಅರ್ಥೈಸಿಕೊಳ್ಳುವ ಹಂತವಾಗಿದೆ.

ತೆರೆದ ಡೇಟಾ ಮತ್ತು ಪುನರುತ್ಪಾದನೆ

ಹೆಚ್ಚಿನ ಓಮಿಕ್ಸ್ ಅಧ್ಯಯನಗಳು ತಮ್ಮ ಡೇಟಾವನ್ನು ಸಾರ್ವಜನಿಕ ರೆಪೊಸಿಟರಿಗಳಿಗೆ ಅಪ್‌ಲೋಡ್ ಮಾಡುತ್ತವೆ: GEO (ಜೀನ್ ಎಕ್ಸ್‌ಪ್ರೆಶನ್ ಆಮ್ನಿಬಸ್) ಮತ್ತು ಜೀನ್ ಅಭಿವ್ಯಕ್ತಿಗಾಗಿ ಅರೇಎಕ್ಸ್‌ಪ್ರೆಸ್, ಕಚ್ಚಾ ಅನುಕ್ರಮಗಳಿಗಾಗಿ SRA (ಸೀಕ್ವೆನ್ಸ್ ರೀಡ್ ಆರ್ಕೈವ್), ಪ್ರೋಟಿಯೊಮಿಕ್ಸ್‌ಗಾಗಿ ಪ್ರೈಡ್. ಇದು ನಿರ್ಣಾಯಕವಾಗಿದೆ, ಇದರಿಂದ ಇತರರು ನಿಮ್ಮ ಫಲಿತಾಂಶಗಳನ್ನು ಪರಿಶೀಲಿಸಬಹುದು ಮತ್ತು ಇತರ ಅಧ್ಯಯನಗಳಿಂದ ನೀವು ಡೇಟಾವನ್ನು ಮರುವಿಶ್ಲೇಷಿಸಬಹುದು. AI ಕೋಡ್ ಅನ್ನು ಬರೆಯಬಹುದು (GEOparse ನಂತಹ ಸಾಧನಗಳೊಂದಿಗೆ) ಅದು GEO ನೋಂದಣಿ ಸಂಖ್ಯೆಯಿಂದ ಡೇಟಾವನ್ನು ಡೌನ್‌ಲೋಡ್ ಮಾಡುತ್ತದೆ ಮತ್ತು ಸಂಘಟಿಸುತ್ತದೆ (ಉದಾ. GSE ಸಂಖ್ಯೆ); ಆದರೆ ಮೂಲ ದಾಖಲೆಯಿಂದ ನೀವು ಡೌನ್‌ಲೋಡ್ ಮಾಡಿದ ಡೇಟಾದ ವಿನ್ಯಾಸವನ್ನು (ಎಷ್ಟು ಗುಂಪುಗಳು, ಎಷ್ಟು ಪುನರಾವರ್ತನೆಗಳು, ಯಾವ ಪ್ರಕ್ರಿಯೆ) ಓದಲು ಮತ್ತು ಖಚಿತಪಡಿಸಲು ಮರೆಯದಿರಿ. ಮಾದರಿಯು ಅಧ್ಯಯನದ ವಿನ್ಯಾಸವನ್ನು "ನೆನಪಿಡಿ" ಎಂದು ಹೇಳಿಕೊಂಡರೆ, ಇದು ಯಾವಾಗಲೂ ಪರಿಶೀಲಿಸಬೇಕಾದ ಊಹೆಯಾಗಿದೆ.

ಸಾರಾಂಶದಲ್ಲಿ

ಓಮಿಕ್ಸ್ ಡೇಟಾವು ಸಣ್ಣ ಮಾದರಿ ಗಾತ್ರದಲ್ಲಿ ಸಾವಿರಾರು ಅಸ್ಥಿರಗಳನ್ನು ಅಳೆಯುತ್ತದೆ; ಇದು ಬಹು ಹೋಲಿಕೆಗಳು, ಬ್ಯಾಚ್ ಪರಿಣಾಮಗಳು ಮತ್ತು ಅತಿವ್ಯಾಖ್ಯಾನದ ಬಲೆಗಳನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ; ಇದು ವಿಭಿನ್ನ ಅಭಿವ್ಯಕ್ತಿ ವಿಶ್ಲೇಷಣೆಗಾಗಿ ಕೋಡ್ ಅನ್ನು ಬರೆಯುತ್ತದೆ, ಪರಿಕಲ್ಪನೆಗಳನ್ನು ವಿವರಿಸುತ್ತದೆ ಮತ್ತು ಫಲಿತಾಂಶಗಳನ್ನು ಅರ್ಥೈಸಲು ನಿಮಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಆದಾಗ್ಯೂ, ಎಫ್‌ಡಿಆರ್ ತಿದ್ದುಪಡಿಯನ್ನು ಅನ್ವಯಿಸುವುದು, ಪರಿಣಾಮದ ಗಾತ್ರವನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವುದು ಮತ್ತು ಕಾರಣದ ಭಾಷೆಯನ್ನು ತಪ್ಪಿಸುವುದು ನಿಮ್ಮ ಜವಾಬ್ದಾರಿಯಾಗಿದೆ. ಸ್ವತಂತ್ರ ವಿಧಾನದಿಂದ ಪರಿಶೀಲಿಸುವವರೆಗೆ ಅಭ್ಯರ್ಥಿ ಜೀನ್‌ಗಳು ಊಹೆಗಳಾಗಿವೆ.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ಮಾದರಿ ಭೇದಾತ್ಮಕ ಅಭಿವ್ಯಕ್ತಿ ಫಲಿತಾಂಶಗಳ ಕೋಷ್ಟಕವನ್ನು ಪಡೆಯಿರಿ ಅಥವಾ ರಚಿಸಿ (gen, log2FC, padj). FDR<0.05 ಮತ್ತು |log2FC|>1 ರಿಂದ ಫಿಲ್ಟರ್ ಮಾಡುವ, ಗಮನಾರ್ಹ ಜೀನ್‌ಗಳ ಸಂಖ್ಯೆಯನ್ನು ವರದಿ ಮಾಡುವ ಮತ್ತು ಜ್ವಾಲಾಮುಖಿ ಗ್ರಾಫ್ ಅನ್ನು ಪ್ಲಾಟ್ ಮಾಡುವ AI ರೈಟ್ ಕೋಡ್ ಅನ್ನು ಹೊಂದಿರಿ. ಕೋಡ್ ಅನ್ನು ರನ್ ಮಾಡಿ. ನಂತರ ತಿದ್ದುಪಡಿಯನ್ನು ಮಾಡದೇ ಇದ್ದಲ್ಲಿ ಎಷ್ಟು ಜೀನ್‌ಗಳು "ಮಹತ್ವ" ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತವೆ ಎಂಬುದನ್ನು ಮಾದರಿ ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ ಮತ್ತು ವ್ಯತ್ಯಾಸವನ್ನು ಅರ್ಥೈಸಿಕೊಳ್ಳಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ನಾನು ಬಹು ಹೋಲಿಕೆ ತಿದ್ದುಪಡಿಯನ್ನು (FDR) ಅನ್ವಯಿಸಿದ್ದೇನೆ.
  • ನಾನು ಪರಿಣಾಮದ ಗಾತ್ರವನ್ನು (log2FC) ಹಾಗೂ [ ] p-ಮೌಲ್ಯವನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದ್ದೇನೆ.
  • [ ] ನಾನು ಬ್ಯಾಚ್/ತಾಂತ್ರಿಕ ವೇರಿಯಬಲ್‌ಗಳನ್ನು ಪರಿಶೀಲಿಸಿದ್ದೇನೆ.
  • [ ] ನಾನು ಸಾಮಾನ್ಯೀಕರಣ ಹಂತವನ್ನು ಬಿಟ್ಟುಬಿಡಲಿಲ್ಲ.
  • [ ] ನಾನು ಸಾಂದರ್ಭಿಕತೆಯ ಬದಲಿಗೆ ಪರಸ್ಪರ ಸಂಬಂಧದ ಭಾಷೆಯನ್ನು ಬಳಸಿದ್ದೇನೆ.
  • [ ] ನಾನು ಅಭ್ಯರ್ಥಿ ಜೀನ್‌ಗಳನ್ನು ದೃಢೀಕರಿಸಬೇಕಾದ ಊಹೆಗಳಾಗಿ ಗುರುತಿಸಿದ್ದೇನೆ.