ਲਾਭ:
- ਮਲਟੀਪਲ ਤੁਲਨਾ ਸਮੱਸਿਆ ਨੂੰ ਸਮਝਣ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ FDR (ਗਲਤ ਖੋਜ ਦਰ) ਸੁਧਾਰ ਸ਼ਾਮਲ ਕਰਨਾ
- ਪੀ-ਮੁੱਲ ਅਤੇ ਪ੍ਰਭਾਵ ਆਕਾਰ (ਲੌਗ2 ਫੋਲਡ ਬਦਲਾਅ) ਦਾ ਮੁਲਾਂਕਣ ਕਰਕੇ ਅੰਕੜਾ ਅਤੇ ਜੀਵ-ਵਿਗਿਆਨਕ ਮਹੱਤਤਾ ਨੂੰ ਵੱਖ ਕਰਨ ਦੀ ਸਮਰੱਥਾ
- ਉੱਚ-ਆਯਾਮੀ ਡੇਟਾ ਟ੍ਰੈਪਾਂ ਨੂੰ ਪਛਾਣਨ ਅਤੇ ਬਚਣ ਦੀ ਸਮਰੱਥਾ ਜਿਵੇਂ ਕਿ ਬੈਚ ਪ੍ਰਭਾਵ ਅਤੇ ਕਾਰਨਤਾ ਜੰਪ
ਸ਼ਬਦ "ਓਮਿਕਸ" ਉਹਨਾਂ ਪਹੁੰਚਾਂ ਦਾ ਵਰਣਨ ਕਰਦਾ ਹੈ ਜੋ ਸੈੱਲ ਵਿੱਚ ਅਣੂਆਂ ਦੀ ਇੱਕ ਪੂਰੀ ਸ਼੍ਰੇਣੀ ਨੂੰ ਮਾਪਦੇ ਹਨ: ਜੀਨੋਮਿਕਸ (ਸਾਰੇ ਡੀਐਨਏ), ਟ੍ਰਾਂਸਕ੍ਰਿਪਟੌਮਿਕਸ (ਸਾਰੇ ਆਰਐਨਏ / ਜੀਨ ਸਮੀਕਰਨ), ਪ੍ਰੋਟੀਓਮਿਕਸ (ਸਾਰੇ ਪ੍ਰੋਟੀਨ), ਮੈਟਾਬੋਲੋਮਿਕਸ (ਸਾਰੇ ਛੋਟੇ ਅਣੂ)। ਇਹਨਾਂ ਮਾਪਾਂ ਦੀ ਆਮ ਵਿਸ਼ੇਸ਼ਤਾ ਉਹਨਾਂ ਦੀ ਉੱਚ ਅਯਾਮਤਾ ਹੈ: ਹਜ਼ਾਰਾਂ ਜਾਂ ਹਜ਼ਾਰਾਂ ਵੇਰੀਏਬਲ (ਜੀਨ, ਪ੍ਰੋਟੀਨ) ਨੂੰ ਇੱਕੋ ਸਮੇਂ ਇੱਕ ਨਮੂਨੇ ਵਿੱਚ ਮਾਪਿਆ ਜਾਂਦਾ ਹੈ, ਪਰ ਨਮੂਨਿਆਂ ਦੀ ਗਿਣਤੀ ਆਮ ਤੌਰ 'ਤੇ ਛੋਟੀ ਹੁੰਦੀ ਹੈ (ਜਿਵੇਂ ਕਿ 20 ਮਰੀਜ਼)। ਇਹ "ਬਹੁਤ ਸਾਰੇ ਵੇਰੀਏਬਲ, ਕੁਝ ਨਮੂਨੇ" ਸਥਿਤੀ ਜੀਵ-ਵਿਗਿਆਨ ਲਈ ਵਿਲੱਖਣ ਚੁਣੌਤੀਆਂ ਦਾ ਸਰੋਤ ਹੈ ਅਤੇ ਉਹਨਾਂ ਖੇਤਰਾਂ ਵਿੱਚ ਜਿੱਥੇ AI ਸਭ ਤੋਂ ਵੱਧ ਮਦਦਗਾਰ ਹੋ ਸਕਦਾ ਹੈ।
ਇਸ ਇਕਾਈ ਵਿੱਚ, ਅਸੀਂ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟੌਮਿਕਸ (RNA-seq) ਦੀ ਉਦਾਹਰਨ ਦੁਆਰਾ ਵਿਭਿੰਨ ਸਮੀਕਰਨ ਵਿਸ਼ਲੇਸ਼ਣ (ਜੀਨਾਂ ਨੂੰ ਲੱਭਣਾ ਜਿਨ੍ਹਾਂ ਦੀ ਸਮੀਕਰਨ ਦੋ ਸਮੂਹਾਂ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਰੂਪ ਵਿੱਚ ਬਦਲਦੀ ਹੈ) ਅਤੇ ਇਸ ਵਰਕਫਲੋ ਵਿੱਚ ਨਕਲੀ ਬੁੱਧੀ ਦੀ ਭੂਮਿਕਾ ਬਾਰੇ ਚਰਚਾ ਕਰਾਂਗੇ।
ਉੱਚ ਆਯਾਮੀ ਡੇਟਾ ਦੀ ਮੁੱਖ ਸਮੱਸਿਆ
ਜੇ ਤੁਸੀਂ ਇੱਕੋ ਸਮੇਂ ਹਜ਼ਾਰਾਂ ਜੀਨਾਂ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹੋ, ਤਾਂ ਤੁਹਾਨੂੰ ਅਜਿਹੇ ਜੀਨ ਮਿਲਣਗੇ ਜੋ ਸੰਭਾਵਤ ਤੌਰ 'ਤੇ "ਮਹੱਤਵਪੂਰਨ" ਜਾਪਦੇ ਹਨ, ਭਾਵੇਂ ਕੋਈ ਅਸਲ ਅੰਤਰ ਨਾ ਵੀ ਹੋਵੇ। ਜੇਕਰ ਤੁਸੀਂ ਗਲਤੀ ਦੇ 5% ਮਾਰਜਿਨ ਨਾਲ 20,000 ਜੀਨਾਂ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹੋ, ਤਾਂ ~1,000 ਜੀਨ ਸੰਜੋਗ ਨਾਲ "ਮਹੱਤਵਪੂਰਨ" ਸਾਬਤ ਹੋ ਸਕਦੇ ਹਨ। ਇਸ ਨੂੰ ਮਲਟੀਪਲ ਤੁਲਨਾ ਸਮੱਸਿਆ ਕਿਹਾ ਜਾਂਦਾ ਹੈ ਅਤੇ ਇਹ ਓਮਿਕਸ ਵਿਸ਼ਲੇਸ਼ਣ ਦੀ ਸਭ ਤੋਂ ਗੰਭੀਰ ਸਮੱਸਿਆ ਹੈ। ਹੱਲ ਹੈ p-ਮੁੱਲਾਂ ਨੂੰ ਠੀਕ ਕਰਨਾ (ਜਿਵੇਂ ਕਿ FDR ਦੀ ਗਣਨਾ ਕਰੋ — ਬੈਂਜਾਮਿਨੀ-ਹੋਚਬਰਗ ਵਿਧੀ ਨਾਲ ਗਲਤ ਖੋਜ ਦਰ)। AI ਇਸ ਸੰਕਲਪ ਨੂੰ ਸਮਝਾਉਣ ਅਤੇ ਸਹੀ ਕੋਡ ਲਿਖਣ ਵਿੱਚ ਬਹੁਤ ਮਦਦਗਾਰ ਹੈ; ਪਰ ਸੁਧਾਰ ਨੂੰ ਲਾਗੂ ਕਰਨਾ ਯਾਦ ਰੱਖਣਾ ਤੁਹਾਡੀ ਜ਼ਿੰਮੇਵਾਰੀ ਹੈ।
ਸੰਕੇਤ: ਜੇਕਰ ਤੁਸੀਂ ਕਿਸੇ ਓਮਿਕਸ ਨਤੀਜੇ ਵਿੱਚ "3,000 ਜੀਨਾਂ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਤਬਦੀਲੀ" ਵਰਗੀ ਕੋਈ ਸੰਖਿਆ ਦੇਖਦੇ ਹੋ, ਤਾਂ ਘਬਰਾ ਜਾਓ। ਇਹ ਆਮ ਤੌਰ 'ਤੇ ਇਸ ਗੱਲ ਦਾ ਸੰਕੇਤ ਹੁੰਦਾ ਹੈ ਕਿ ਕਈ ਤੁਲਨਾਤਮਕ ਸੁਧਾਰ ਨਹੀਂ ਕੀਤੇ ਗਏ ਹਨ। ਇੱਕ ਯਥਾਰਥਵਾਦੀ ਸੂਚੀ ਇੱਕ ਚੰਗੀ ਤਰ੍ਹਾਂ ਤਿਆਰ ਕੀਤੇ ਪ੍ਰਯੋਗ ਵਿੱਚ ਕਈ ਸੌ ਜੀਨਾਂ ਤੱਕ ਹੋਵੇਗੀ।
RNA-seq ਵਿਭਿੰਨ ਸਮੀਕਰਨ: ਕਦਮ ਦਰ ਕਦਮ
- ਕੱਚੀ ਗਿਣਤੀ: ਸਾਰਣੀ ਜਿਸ ਵਿੱਚ ਹਰੇਕ ਜੀਨ ਲਈ ਹਰੇਕ ਨਮੂਨੇ ਵਿੱਚ ਕਿੰਨੇ ਪੜ੍ਹੇ ਗਏ ਹਨ।
- ਗੁਣਵੱਤਾ ਅਤੇ ਫਿਲਟਰਿੰਗ: ਬਹੁਤ ਘੱਟ ਸਮੀਕਰਨ ਵਾਲੇ ਜੀਨਾਂ ਨੂੰ ਰੱਦ ਕਰੋ।
- ਸਧਾਰਣਕਰਨ: ਨਮੂਨਿਆਂ ਵਿਚਕਾਰ ਸਹੀ ਲਾਇਬ੍ਰੇਰੀ ਆਕਾਰ ਅੰਤਰ (ਬ੍ਰੂਟ ਨੰਬਰ ਤੁਲਨਾਯੋਗ ਨਹੀਂ)।
- ਅੰਕੜਾ ਮਾਡਲ: ਪਾਈਥਨ ਵਿੱਚ DESeq2 ਜਾਂ edgeR (R ਲਾਇਬ੍ਰੇਰੀਆਂ) ਜਾਂ pyDESeq2 ਨਾਲ ਟੈਸਟ ਗਰੁੱਪ ਅੰਤਰ।
- ਮਲਟੀਪਲ ਤੁਲਨਾ ਸੁਧਾਰ: FDR ਦੀ ਗਣਨਾ ਕਰੋ; ਆਮ ਤੌਰ 'ਤੇ FDR <0.05 ਦੀ ਇੱਕ ਥ੍ਰੈਸ਼ਹੋਲਡ।
- ਪ੍ਰਭਾਵ ਦਾ ਆਕਾਰ: log2 ਫੋਲਡ ਤਬਦੀਲੀ ਨਾਲ ਮੁਲਾਂਕਣ ਕਰੋ: ਸਮੀਕਰਨ ਕਿੰਨੀ ਵਾਰ ਵਧਦਾ/ਘਟਦਾ ਹੈ।
- ਟਿੱਪਣੀ: ਜੈਵਿਕ ਮਾਰਗਾਂ ਨਾਲ ਮਹੱਤਵਪੂਰਨ ਜੀਨਾਂ ਨੂੰ ਜੋੜੋ।
ਨਕਲੀ ਬੁੱਧੀ 3-6. ਇਹ ਕਦਮਾਂ ਨੂੰ ਕੋਡ ਕਰਦਾ ਹੈ, ਸੰਕਲਪਾਂ ਦੀ ਵਿਆਖਿਆ ਕਰਦਾ ਹੈ, ਅਤੇ ਆਉਟਪੁੱਟ ਦੀ ਵਿਆਖਿਆ ਕਰਨ ਵਿੱਚ ਤੁਹਾਡੀ ਮਦਦ ਕਰਦਾ ਹੈ। ਹਾਲਾਂਕਿ, ਮਾਡਲ ਤੁਹਾਡੇ ਕੱਚੇ ਡੇਟਾ ਨੂੰ ਦੇਖੇ ਬਿਨਾਂ "ਕਿਸ ਜੀਨ ਬਦਲਿਆ" ਨਹੀਂ ਕਹਿ ਸਕਦਾ; ਕੋਡ ਅਤੇ ਅੰਕੜੇ ਤੁਹਾਨੂੰ ਇਹ ਦੱਸਦੇ ਹਨ।
ਕਾਪੀ ਕਰਨ ਯੋਗ ਪ੍ਰੋਂਪਟ ਟੈਂਪਲੇਟਸ
ਭੂਮਿਕਾ: ਤੁਸੀਂ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟੌਮਿਕ ਵਿਸ਼ਲੇਸ਼ਣ ਸਹਾਇਕ ਹੋ। ਸੰਦਰਭ: ਮੇਰੇ ਕੋਲ 12 ਨਿਯੰਤਰਣ, 12 ਇਲਾਜ ਦੇ ਨਮੂਨੇ ਤੋਂ ਇੱਕ RNA-seq ਰਾਅ ਕਾਉਂਟ ਟੇਬਲ (CSV) ਹੈ। ਟਾਸਕ: pyDESeq2 ਨਾਲ ਵਿਭਿੰਨ ਸਮੀਕਰਨ ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਪੜਾਵਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ, ਸਮਝਾਓ ਕਿ ਹਰੇਕ ਕਦਮ ਕਿਉਂ ਜ਼ਰੂਰੀ ਹੈ। ਯੋਜਨਾ ਪਹਿਲਾਂ, ਕੋਡ ਦੂਜਾ। ਇੱਕ ਤੋਂ ਵੱਧ ਤੁਲਨਾਤਮਕ ਸੁਧਾਰ ਸ਼ਾਮਲ ਕਰਨਾ ਯਕੀਨੀ ਬਣਾਓ।
ਮੇਰੇ ਵਿਸ਼ਲੇਸ਼ਣ ਆਉਟਪੁੱਟ ਨੇ 4,200 ਜੀਨਾਂ ਨੂੰ "p<0.05" ਵਜੋਂ ਦਿਖਾਇਆ। ਇਹ ਸ਼ੱਕੀ ਕਿਉਂ ਹੋ ਸਕਦਾ ਹੈ? ਕਈ ਤੁਲਨਾਤਮਕ ਸੁਧਾਰ (ਬੈਂਜਾਮਿਨੀ-ਹੋਚਬਰਗ FDR) ਦੀ ਵਿਆਖਿਆ ਕਰੋ ਅਤੇ ਪਾਈਥਨ ਕੋਡ ਦਿਓ ਜੋ ਸਹੀ ਫਿਲਟਰਿੰਗ ਕਰਦਾ ਹੈ।
ਕੋਡ ਲਿਖੋ ਜੋ ਮੇਰੇ ਵਿਭਿੰਨ ਸਮੀਕਰਨ ਨਤੀਜਾ ਸਾਰਣੀ (ਜੀਨ, ਲੌਗ2ਐਫਸੀ, ਪੈਡਜ ਕਾਲਮ) ਤੋਂ ਇੱਕ ਜੁਆਲਾਮੁਖੀ ਪਲਾਟ ਖਿੱਚਦਾ ਹੈ। ਜੀਨਾਂ ਨੂੰ FDR<0.05 ਅਤੇ |log2FC|>1 ਨਾਲ ਰੰਗੋ, ਚੋਟੀ ਦੇ 10 ਨੂੰ ਲੇਬਲ ਕਰੋ।
ਮੈਂ ਪਾਥਵੇਅ ਸੰਸ਼ੋਧਨ ਲਈ ਇਸ ਮਹੱਤਵਪੂਰਣ ਜੀਨ ਸੂਚੀ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਿਵੇਂ ਕਰਾਂ? gseapy ਜਾਂ g:ਪ੍ਰੋਫਾਈਲਰ ਦੇ ਕਦਮਾਂ ਦੀ ਵਿਆਖਿਆ ਕਰੋ। ਟਿੱਪਣੀ ਵਿੱਚ ਪੂਰਨ ਕਾਰਨ ਦਾ ਦਾਅਵਾ ਨਾ ਕਰੋ, ਸਬੰਧ ਭਾਸ਼ਾ ਦੀ ਵਰਤੋਂ ਕਰੋ। ਜੀਨ ਸੂਚੀ: [ਸੂਚੀ]
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ: "ਮੈਨੂੰ ਦੱਸੋ ਕਿ RNA-seq ਉਪਜ ਵਿੱਚ ਕਿਹੜੇ ਜੀਨ ਮਹੱਤਵਪੂਰਨ ਹਨ।"
ਮਜ਼ਬੂਤ: "ਮੇਰੇ ਕੋਲ 12 ਨਿਯੰਤਰਣ ਤੋਂ pyDESeq2 ਆਉਟਪੁੱਟ ਹੈ, 12 ਇਲਾਜ ਦੇ ਨਮੂਨੇ: ਜੀਨ ਦੇ ਨਾਲ ਸਾਰਣੀ, log2FoldChange, padj ਕਾਲਮਾਂ। ਕੋਡ ਦਿਓ ਜੋ FDR<0.05 ਅਤੇ |log2FC|>1 ਦੇ ਥ੍ਰੈਸ਼ਹੋਲਡ ਨਾਲ ਮਹੱਤਵਪੂਰਨ ਜੀਨਾਂ ਨੂੰ ਫਿਲਟਰ ਕਰਦਾ ਹੈ, ਉਹਨਾਂ ਦੇ ਨੰਬਰਾਂ ਦੀ ਰਿਪੋਰਟ ਕਰਦਾ ਹੈ, ਅਤੇ ਫਿਰ ਇਹਨਾਂ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਆਕਾਰਾਂ ਨੂੰ 0.2 ਦੇ ਆਕਾਰ ਦੁਆਰਾ ਵਿਆਖਿਆ ਕਰਦਾ ਹੈ। ਥ੍ਰੈਸ਼ਹੋਲਡ ਵਾਜਬ ਹਨ।"
ਅੰਤਰ: ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰੋਂਪਟ ਵਿੱਚ ਅਸਲ ਆਉਟਪੁੱਟ ਕਾਲਮ, ਥ੍ਰੈਸ਼ਹੋਲਡ ਅਤੇ ਪ੍ਰਮਾਣਿਕਤਾ ਬੇਨਤੀ ਹੈ। ਮਾਡਲ ਮੇਡ-ਅੱਪ ਜੀਨ ਨਾਮ ਬਣਾਉਣ ਦੀ ਬਜਾਏ ਤੁਹਾਡੇ ਡੇਟਾ 'ਤੇ ਪ੍ਰਕਿਰਿਆ ਕਰਦਾ ਹੈ।
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 - ਬਿਨਾਂ ਸੁਧਾਰ ਦੇ ਤਬਾਹੀ: ਇੱਕ ਸਮੂਹ ਨੇ ਬਿਨਾਂ ਸੁਧਾਰ ਦੇ p<0.05 ਵਾਲੇ 3,800 "ਮਹੱਤਵਪੂਰਣ" ਜੀਨ ਲੱਭੇ ਅਤੇ ਇਸਨੂੰ ਇੱਕ ਪ੍ਰਕਾਸ਼ਨ ਵਿੱਚ ਜਮ੍ਹਾਂ ਕਰਾਇਆ। ਜਦੋਂ ਰੈਫਰੀ ਨੇ ਐਫਡੀਆਰ ਸੁਧਾਰ ਲਈ ਕਿਹਾ, ਤਾਂ ਸੂਚੀ 47 ਜੀਨਾਂ ਤੱਕ ਘਟ ਗਈ। ਜੇ ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ ਨੇ ਸ਼ੁਰੂ ਤੋਂ ਹੀ ਬੈਂਜਾਮਿਨੀ-ਹੋਚਬਰਗ ਕੋਡ ਨੂੰ ਜੋੜਿਆ ਹੁੰਦਾ, ਤਾਂ ਇਹ ਸ਼ਰਮਿੰਦਗੀ ਪੈਦਾ ਨਹੀਂ ਹੋਣੀ ਸੀ। ਸਬਕ: ਸੁਧਾਰ ਗੈਰ-ਸੋਧਯੋਗ ਹੈ।
ਕੇਸ 2 - ਬੈਚ ਪ੍ਰਭਾਵ: ਇੱਕ ਅਧਿਐਨ ਵਿੱਚ, ਨਮੂਨਿਆਂ 'ਤੇ ਦੋ ਵੱਖ-ਵੱਖ ਦਿਨਾਂ 'ਤੇ ਕਾਰਵਾਈ ਕੀਤੀ ਗਈ ਸੀ। ਉਹ ਜੋ ਸੋਚਦੇ ਸਨ ਕਿ "ਮਰੀਜ਼ ਬਨਾਮ ਨਿਯੰਤਰਣ" ਅੰਤਰ ਅਸਲ ਵਿੱਚ ਇੱਕ "ਪਹਿਲਾ ਦਿਨ ਬਨਾਮ ਦੂਜੇ ਦਿਨ" ਅੰਤਰ ਸੀ (ਬੈਚ ਪ੍ਰਭਾਵ: ਸੈਂਪਲਿੰਗ ਪਾਰਟੀ ਦੇ ਕਾਰਨ ਤਕਨੀਕੀ ਅੰਤਰ)। AI ਨੇ ਮਾਡਲ ਵਿੱਚ ਬੈਚ ਵੇਰੀਏਬਲ ਨੂੰ ਜੋੜਨ ਦਾ ਸੁਝਾਅ ਦੇ ਕੇ ਨਕਲੀ ਸਿਗਨਲ ਨੂੰ ਖਤਮ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕੀਤੀ (ਮਾਡਲ ਫਾਰਮੂਲੇ ਵਿੱਚ ~ ਬੈਚ + ਸਥਿਤੀ)।
ਕੇਸ 3 - ਫੋਲਡ ਬਦਲਾਅ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਨਾ: ਇੱਕ ਵਿਦਿਆਰਥੀ ਨੇ "ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ" ਇੱਕ ਜੀਨ ਘੋਸ਼ਿਤ ਕੀਤਾ ਜਿਸਦਾ ਸਮੀਕਰਨ 2% ਬਦਲਿਆ ਗਿਆ ਸੀ ਪਰ ਸਿਰਫ p-ਮੁੱਲ ਨੂੰ ਦੇਖ ਕੇ, ਬਹੁਤ ਸਥਿਰ ਹੋਣ ਲਈ ਮਾਪਿਆ ਗਿਆ ਸੀ। ਜਦੋਂ ਕਿ ਪ੍ਰਭਾਵ ਦਾ ਆਕਾਰ (log2FC) ਲਗਭਗ ਜ਼ੀਰੋ ਸੀ; ਅੰਕੜਾ ਮਹੱਤਤਾ ਜੀਵ-ਵਿਗਿਆਨਕ ਮਹੱਤਤਾ ਨਹੀਂ ਹੈ। ਮਾਡਲ ਨੇ ਇਸ ਅੰਤਰ ਨੂੰ ਸਮਝਾਇਆ ਅਤੇ ਇਸ ਨੂੰ ਜੁਆਲਾਮੁਖੀ ਗ੍ਰਾਫ ਨਾਲ ਦੇਖਣ ਦਾ ਸੁਝਾਅ ਦਿੱਤਾ।
ਤੁਲਨਾ ਸਾਰਣੀ: ਸੰਕਲਪ ਸਪਸ਼ਟਤਾ
ਸੰਕਲਪ
ਭਾਵ
ਇਹ ਮਹੱਤਵਪੂਰਨ ਕਿਉਂ ਹੈ?
p-ਮੁੱਲ
ਅੰਤਰ ਦੀ ਸੰਭਾਵਨਾ ਇੱਕ ਇਤਫ਼ਾਕ ਹੈ
ਇਕੱਲਾ ਗੁੰਮਰਾਹਕੁੰਨ ਹੋ ਸਕਦਾ ਹੈ
FDR (padj)
ਮਲਟੀਪਲ ਟੈਸਟਿੰਗ ਵਿੱਚ ਗਲਤੀ ਦਰ ਨੂੰ ਠੀਕ ਕੀਤਾ
ਝੂਠੇ ਸਕਾਰਾਤਮਕ ਨੂੰ ਸੀਮਿਤ ਕਰਦਾ ਹੈ
log2 ਫੋਲਡ ਬਦਲਾਅ
ਪ੍ਰਭਾਵ ਦਾ ਆਕਾਰ
ਜੈਵਿਕ ਮਹੱਤਤਾ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ
ਬੈਚ ਪ੍ਰਭਾਵ
ਤਕਨੀਕੀ ਬੈਚ ਅੰਤਰ
ਜਾਅਲੀ ਸਿਗਨਲ ਬਣਾਉਂਦਾ ਹੈ
ਸਧਾਰਣਕਰਨ
ਅੰਤਰ-ਨਮੂਨਾ ਸਕੇਲ ਸੁਧਾਰ
ਤੁਲਨਾ ਨੂੰ ਨਿਰਪੱਖ ਬਣਾਉਂਦਾ ਹੈ
ਆਮ ਗਲਤੀਆਂ
- ਕਈ ਤੁਲਨਾਤਮਕ ਸੁਧਾਰਾਂ ਨੂੰ ਛੱਡਣਾ: ਸਭ ਤੋਂ ਆਮ ਅਤੇ ਸਭ ਤੋਂ ਗੰਭੀਰ ਗਲਤੀ।
- ਸਿਰਫ਼ p-ਮੁੱਲ ਨੂੰ ਦੇਖਦੇ ਹੋਏ: ਪ੍ਰਭਾਵ ਆਕਾਰ (log2FC) ਨੂੰ ਇਕੱਠੇ ਵਿਚਾਰਨਾ ਯਕੀਨੀ ਬਣਾਓ।
- ਮਾਡਲ ਵਿੱਚ ਬੈਚ ਪ੍ਰਭਾਵ ਨੂੰ ਸ਼ਾਮਲ ਨਹੀਂ ਕਰਨਾ: ਇੱਕ ਜੈਵਿਕ ਅੰਤਰ ਲਈ ਤਕਨੀਕੀ ਅੰਤਰ ਨੂੰ ਗਲਤ ਕਰਨਾ।
- ਸਧਾਰਣਕਰਨ ਨੂੰ ਭੁੱਲਣਾ: ਕੱਚੇ ਨੰਬਰਾਂ ਦੀ ਸਿੱਧੀ ਤੁਲਨਾ ਕਰਨਾ।
- ਕਾਰਕ ਭਾਸ਼ਾ: "ਇਹ ਜੀਨ ਰੋਗ ਪੈਦਾ ਕਰਦਾ ਹੈ" ਕਹਿਣਾ; ਓਮਿਕਸ ਡੇਟਾ ਆਪਸੀ ਸਬੰਧਾਂ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ, ਕਾਰਣ ਨੂੰ ਵਾਧੂ ਪ੍ਰਯੋਗਾਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
ਸਾਵਧਾਨ: ਉੱਚ-ਆਯਾਮੀ ਡੇਟਾ ਵਿੱਚ, "ਸੰਖਿਆਤਮਕ ਤੌਰ 'ਤੇ ਮਹੱਤਵਪੂਰਨ" ਅਤੇ "ਜੀਵ-ਵਿਗਿਆਨਕ ਤੌਰ 'ਤੇ ਮਹੱਤਵਪੂਰਨ" ਦੋ ਵੱਖਰੀਆਂ ਚੀਜ਼ਾਂ ਹਨ। ਨਕਲੀ ਬੁੱਧੀ ਦੁਆਰਾ ਪੈਦਾ ਕੀਤੀ ਜੀਨ ਸੂਚੀ ਇੱਕ ਸ਼ੁਰੂਆਤੀ ਪਰਿਕਲਪਨਾ ਹੈ; ਹਰੇਕ ਉਮੀਦਵਾਰ ਜੀਨ ਨੂੰ ਸੁਤੰਤਰ ਢੰਗ (qPCR, ਪ੍ਰੋਟੀਨ ਮਾਪ) ਦੁਆਰਾ ਤਸਦੀਕ ਕੀਤੇ ਬਿਨਾਂ ਨਿਸ਼ਚਿਤ ਨਹੀਂ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।
ਆਕਾਰ ਵਿਚ ਕਮੀ ਅਤੇ ਗੁਣਵੱਤਾ ਨਿਯੰਤਰਣ
ਉੱਚ-ਆਯਾਮੀ ਡੇਟਾ ਵਿੱਚ ਕਰਨ ਲਈ ਸਭ ਤੋਂ ਪਹਿਲਾਂ ਨਮੂਨੇ ਦੀ ਆਮ ਬਣਤਰ ਨੂੰ ਵੇਖਣਾ ਹੈ. PCA (ਪ੍ਰਧਾਨ ਕੰਪੋਨੈਂਟ ਵਿਸ਼ਲੇਸ਼ਣ: ਹਜ਼ਾਰਾਂ ਵੇਰੀਏਬਲਾਂ ਨੂੰ ਕੁਝ ਸੰਖੇਪ ਧੁਰਿਆਂ ਵਿੱਚ ਘਟਾਉਣਾ ਅਤੇ ਉਹਨਾਂ ਨੂੰ 2 ਅਯਾਮਾਂ ਵਿੱਚ ਪ੍ਰਦਰਸ਼ਿਤ ਕਰਨਾ) ਇਸਦੇ ਲਈ ਇੱਕ ਮਿਆਰੀ ਸਾਧਨ ਹੈ। ਜੇਕਰ ਤੁਹਾਡੇ ਦੁਆਰਾ ਉਮੀਦ ਕੀਤੇ ਸਮੂਹਾਂ (ਨਿਯੰਤਰਣ/ਇਲਾਜ) ਨੂੰ PCA ਚਾਰਟ ਵਿੱਚ ਵੱਖ ਕੀਤਾ ਗਿਆ ਹੈ, ਤਾਂ ਇਹ ਚੰਗਾ ਹੈ; ਪਰ ਜੇਕਰ ਨਮੂਨੇ ਸਮੂਹ ਦੀ ਬਜਾਏ "ਦਿਨ ਪ੍ਰੋਸੈਸਡ" ਦੁਆਰਾ ਕਲੱਸਟਰ ਕੀਤੇ ਗਏ ਹਨ, ਤਾਂ ਇਹ ਇੱਕ ਬੈਚ ਪ੍ਰਭਾਵ ਚੇਤਾਵਨੀ ਹੈ। ਉਹੀ ਚਾਰਟ ਤੁਰੰਤ ਇੱਕ ਸਿੰਗਲ ਆਊਟਲੀਅਰ (ਅਸਫ਼ਲ) ਉਦਾਹਰਨ ਦਿਖਾਉਂਦਾ ਹੈ।
ਮੇਰੀ ਸਧਾਰਣ ਸਮੀਕਰਨ ਸਾਰਣੀ (ਕਤਾਰ ਜੀਨ, ਕਾਲਮ ਨਮੂਨਾ) ਤੋਂ PCA ਬਣਾਓ। ਸਮੂਹ ਦੁਆਰਾ ਰੰਗ ਦੇ ਨਮੂਨੇ (ਨਿਯੰਤਰਣ/ਇਲਾਜ), ਪ੍ਰੋਸੈਸਿੰਗ ਬੈਚ ਦੁਆਰਾ ਸ਼ਕਲ। ਇਸ 'ਤੇ ਟਿੱਪਣੀ ਕਰੋ ਕਿ ਕੀ ਗ੍ਰਾਫ ਵਿੱਚ ਇੱਕ ਬੈਚ ਪ੍ਰਭਾਵ ਜਾਂ ਆਊਟਲੀਅਰ ਪੈਟਰਨ ਦੇਖਿਆ ਗਿਆ ਹੈ।
ਇਹ ਖੋਜੀ ਕਦਮ ਬਾਕੀ ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ ਨੂੰ ਚਲਾਉਂਦਾ ਹੈ: ਇੱਕ ਜਾਅਲੀ ਨਤੀਜੇ 'ਤੇ ਮਹੀਨਿਆਂ ਦੀ ਬਰਬਾਦੀ ਕਰਨ ਨਾਲੋਂ ਜਲਦੀ ਇੱਕ ਆਊਟਲੀਅਰ ਨੂੰ ਫੜਨਾ ਬਿਹਤਰ ਹੈ।
ਸਿੰਗਲ ਸੈੱਲ ਡੇਟਾ: ਇੱਕ ਨਵਾਂ ਮਾਪ
ਹਾਲ ਹੀ ਦੇ ਸਾਲਾਂ ਵਿੱਚ, ਸਿੰਗਲ-ਸੈੱਲ ਆਰਐਨਏ ਸੀਕਵੈਂਸਿੰਗ (ਸਿੰਗਲ-ਸੈੱਲ ਆਰਐਨਏ-ਸੀਕ: ਹਜ਼ਾਰਾਂ ਵਿਅਕਤੀਗਤ ਸੈੱਲਾਂ ਦੇ ਸਮੀਕਰਨ ਪ੍ਰੋਫਾਈਲ ਨੂੰ ਮਾਪਣਾ) ਵਿਆਪਕ ਹੋ ਗਿਆ ਹੈ। ਇੱਥੇ ਡੇਟਾ ਹੋਰ ਵੀ ਵੱਡਾ ਹੋ ਜਾਂਦਾ ਹੈ: ਹਜ਼ਾਰਾਂ ਸੈੱਲ, ਹਜ਼ਾਰਾਂ ਜੀਨ ਹਰੇਕ। ਸਕੈਨਪੀ (ਪਾਈਥਨ) ਵਰਗੇ ਟੂਲ ਇਸ ਡੇਟਾ ਦੀ ਪ੍ਰਕਿਰਿਆ ਕਰਦੇ ਹਨ; ਸੈੱਲਾਂ ਨੂੰ ਕਲੱਸਟਰ ਕਰਦਾ ਹੈ ਅਤੇ ਸੈੱਲ ਕਿਸਮਾਂ ਦੀ ਪਛਾਣ ਕਰਦਾ ਹੈ। AI ਇਸ ਵਰਕਫਲੋ ਲਈ ਕੋਡ ਲਿਖਦਾ ਹੈ, ਪਰ ਸੈੱਲ ਕਿਸਮਾਂ ਦਾ ਜੀਵ-ਵਿਗਿਆਨਕ ਨਾਮਕਰਨ (ਭਾਵੇਂ ਇੱਕ ਕਲੱਸਟਰ "ਟੀ ਸੈੱਲ" ਜਾਂ "ਮੈਕ੍ਰੋਫੇਜ" ਹੋਵੇ) ਮਾਰਕਰ ਜੀਨਾਂ ਅਤੇ ਮਾਹਰ ਗਿਆਨ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ। ਸੈੱਲ ਕਿਸਮ ਦੇ ਲੇਬਲ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨਾ ਯਕੀਨੀ ਬਣਾਓ ਕਿ ਮਾਡਲ ਜਾਣੇ-ਪਛਾਣੇ ਮਾਰਕਰਾਂ ਵਾਲੇ ਕਲੱਸਟਰ ਨੂੰ ਨਿਰਧਾਰਤ ਕਰਦਾ ਹੈ; ਸਿੰਗਲ ਸੈੱਲ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ ਇਹ ਸਭ ਤੋਂ ਆਮ ਤੌਰ 'ਤੇ ਗਲਤ ਸਮਝਿਆ ਜਾਣ ਵਾਲਾ ਕਦਮ ਹੈ।
ਡਾਟਾ ਅਤੇ ਪ੍ਰਜਨਨਯੋਗਤਾ ਖੋਲ੍ਹੋ
ਜ਼ਿਆਦਾਤਰ ਓਮਿਕਸ ਅਧਿਐਨ ਆਪਣੇ ਡੇਟਾ ਨੂੰ ਜਨਤਕ ਭੰਡਾਰਾਂ ਵਿੱਚ ਅਪਲੋਡ ਕਰਦੇ ਹਨ: ਜੀਨ ਸਮੀਕਰਨ ਲਈ ਜੀਓ (ਜੀਨ ਐਕਸਪ੍ਰੈਸ਼ਨ ਓਮਨੀਬਸ) ਅਤੇ ਐਰੇ ਐਕਸਪ੍ਰੈਸ, ਕੱਚੇ ਕ੍ਰਮਾਂ ਲਈ ਐਸਆਰਏ (ਸੀਕਵੈਂਸ ਰੀਡ ਆਰਕਾਈਵ), ਪ੍ਰੋਟੀਓਮਿਕਸ ਲਈ ਪ੍ਰਾਈਡ। ਇਹ ਮਹੱਤਵਪੂਰਨ ਹੈ ਤਾਂ ਜੋ ਦੂਸਰੇ ਤੁਹਾਡੇ ਨਤੀਜਿਆਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰ ਸਕਣ ਅਤੇ ਤਾਂ ਜੋ ਤੁਸੀਂ ਹੋਰ ਅਧਿਐਨਾਂ ਤੋਂ ਡੇਟਾ ਦਾ ਮੁੜ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰ ਸਕੋ। AI ਕੋਡ ਲਿਖ ਸਕਦਾ ਹੈ (GEOparse ਵਰਗੇ ਟੂਲਸ ਨਾਲ) ਜੋ ਕਿ GEO ਰਜਿਸਟ੍ਰੇਸ਼ਨ ਨੰਬਰ (ਜਿਵੇਂ ਕਿ GSE ਨੰਬਰ) ਤੋਂ ਡਾਟਾ ਡਾਊਨਲੋਡ ਅਤੇ ਵਿਵਸਥਿਤ ਕਰਦਾ ਹੈ; ਪਰ ਅਸਲ ਰਿਕਾਰਡ ਤੋਂ ਤੁਹਾਡੇ ਦੁਆਰਾ ਡਾਊਨਲੋਡ ਕੀਤੇ ਡੇਟਾ (ਕਿੰਨੇ ਸਮੂਹ, ਕਿੰਨੇ ਦੁਹਰਾਓ, ਕਿਹੜੀ ਪ੍ਰਕਿਰਿਆ) ਨੂੰ ਪੜ੍ਹਨਾ ਅਤੇ ਪੁਸ਼ਟੀ ਕਰਨਾ ਯਕੀਨੀ ਬਣਾਓ। ਜੇ ਮਾਡਲ ਅਧਿਐਨ ਦੇ ਡਿਜ਼ਾਈਨ ਨੂੰ "ਯਾਦ" ਰੱਖਣ ਦਾ ਦਾਅਵਾ ਕਰਦਾ ਹੈ, ਤਾਂ ਇਹ ਲਗਭਗ ਹਮੇਸ਼ਾ ਇੱਕ ਅਨੁਮਾਨ ਹੁੰਦਾ ਹੈ ਜਿਸਦੀ ਪੁਸ਼ਟੀ ਕਰਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
ਸਾਰੰਸ਼ ਵਿੱਚ
ਓਮਿਕਸ ਡੇਟਾ ਇੱਕ ਛੋਟੇ ਨਮੂਨੇ ਦੇ ਆਕਾਰ ਵਿੱਚ ਹਜ਼ਾਰਾਂ ਵੇਰੀਏਬਲਾਂ ਨੂੰ ਮਾਪਦਾ ਹੈ; ਇਹ ਮਲਟੀਪਲ ਤੁਲਨਾਵਾਂ, ਬੈਚ ਪ੍ਰਭਾਵਾਂ, ਅਤੇ ਓਵਰਪ੍ਰੀਟੇਸ਼ਨ ਦੇ ਜਾਲ ਬਣਾਉਂਦਾ ਹੈ। ਬਣਾਵਟੀ ਗਿਆਨ; ਇਹ ਵਿਭਿੰਨ ਸਮੀਕਰਨ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਕੋਡ ਲਿਖਦਾ ਹੈ, ਸੰਕਲਪਾਂ ਦੀ ਵਿਆਖਿਆ ਕਰਦਾ ਹੈ, ਅਤੇ ਨਤੀਜਿਆਂ ਦੀ ਵਿਆਖਿਆ ਕਰਨ ਵਿੱਚ ਤੁਹਾਡੀ ਮਦਦ ਕਰਦਾ ਹੈ। ਹਾਲਾਂਕਿ, FDR ਸੁਧਾਰ ਨੂੰ ਲਾਗੂ ਕਰਨਾ, ਪ੍ਰਭਾਵ ਦੇ ਆਕਾਰ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨਾ, ਅਤੇ ਕਾਰਨ ਦੀ ਭਾਸ਼ਾ ਤੋਂ ਬਚਣਾ ਤੁਹਾਡੀ ਜ਼ਿੰਮੇਵਾਰੀ ਹੈ। ਉਮੀਦਵਾਰ ਜੀਨ ਉਦੋਂ ਤੱਕ ਪਰਿਕਲਪਨਾ ਹੁੰਦੇ ਹਨ ਜਦੋਂ ਤੱਕ ਸੁਤੰਤਰ ਵਿਧੀ ਦੁਆਰਾ ਪੁਸ਼ਟੀ ਨਹੀਂ ਕੀਤੀ ਜਾਂਦੀ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਇੱਕ ਨਮੂਨਾ ਵਿਭਿੰਨ ਸਮੀਕਰਨ ਨਤੀਜੇ ਸਾਰਣੀ (gen, log2FC, padj) ਪ੍ਰਾਪਤ ਕਰੋ ਜਾਂ ਬਣਾਓ। AI ਲਿਖਣ ਵਾਲਾ ਕੋਡ ਰੱਖੋ ਜੋ FDR<0.05 ਅਤੇ |log2FC|>1 ਦੁਆਰਾ ਫਿਲਟਰ ਕਰਦਾ ਹੈ, ਮਹੱਤਵਪੂਰਨ ਜੀਨਾਂ ਦੀ ਸੰਖਿਆ ਦੀ ਰਿਪੋਰਟ ਕਰਦਾ ਹੈ, ਅਤੇ ਇੱਕ ਜਵਾਲਾਮੁਖੀ ਗ੍ਰਾਫ ਨੂੰ ਪਲਾਟ ਕਰਦਾ ਹੈ। ਕੋਡ ਚਲਾਓ। ਫਿਰ ਮਾਡਲ ਨੂੰ ਇਹ ਗਣਨਾ ਕਰਨ ਲਈ ਕਹੋ ਕਿ ਜੇਕਰ ਸੁਧਾਰ ਨਹੀਂ ਕੀਤਾ ਗਿਆ ਸੀ, ਤਾਂ ਕਿੰਨੇ ਜੀਨ "ਮਹੱਤਵਪੂਰਨ" ਦਿਖਾਈ ਦੇਣਗੇ, ਅਤੇ ਅੰਤਰ ਦੀ ਵਿਆਖਿਆ ਕਰੋ।
ਚੈੱਕਲਿਸਟ
- [ ] ਮੈਂ ਮਲਟੀਪਲ ਤੁਲਨਾ ਸੁਧਾਰ (FDR) ਲਾਗੂ ਕੀਤਾ ਹੈ।
- ਮੈਂ ਪ੍ਰਭਾਵ ਆਕਾਰ (log2FC) ਦੇ ਨਾਲ ਨਾਲ [ ] p-ਮੁੱਲ ਦਾ ਮੁਲਾਂਕਣ ਕੀਤਾ।
- [ ] ਮੈਂ ਬੈਚ/ਤਕਨੀਕੀ ਵੇਰੀਏਬਲ ਦੀ ਜਾਂਚ ਕੀਤੀ।
- [ ] ਮੈਂ ਸਧਾਰਣਕਰਨ ਪੜਾਅ ਨੂੰ ਨਹੀਂ ਛੱਡਿਆ।
- [ ] ਮੈਂ ਕਾਰਣ ਦੀ ਬਜਾਏ ਸਬੰਧ ਦੀ ਭਾਸ਼ਾ ਵਰਤੀ ਹੈ।
- ਮੈਂ ਉਮੀਦਵਾਰ ਜੀਨਾਂ ਨੂੰ ਅਨੁਮਾਨਾਂ ਵਜੋਂ ਚਿੰਨ੍ਹਿਤ ਕੀਤਾ ਹੈ ਜਿਨ੍ਹਾਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨ ਦੀ ਲੋੜ ਹੈ।