ਇਕਾਈਆਂ
1. ਜੀਵ ਵਿਗਿਆਨ ਵਿੱਚ ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ ਦੀ ਜਾਣ-ਪਛਾਣ: ਭੂਮਿਕਾਵਾਂ, ਸੀਮਾਵਾਂ, ਪ੍ਰਮਾਣਿਕਤਾ ਅਤੇ ਨੈਤਿਕਤਾ 2. ਪਾਈਥਨ ਦੇ ਨਾਲ ਜੀਵ-ਵਿਗਿਆਨਕ ਡੇਟਾ ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਬੁਨਿਆਦੀ ਤੱਤ 3. ਕ੍ਰਮ ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਬਾਇਓਇਨਫੋਰਮੈਟਿਕਸ: ਡੀਐਨਏ, ਆਰਐਨਏ ਅਤੇ ਪ੍ਰੋਟੀਨ 4. ਓਮਿਕਸ ਡੇਟਾ ਅਤੇ ਉੱਚ ਅਯਾਮੀ ਵਿਸ਼ਲੇਸ਼ਣ 5. ਪ੍ਰੋਟੀਨ ਢਾਂਚਾ ਅਤੇ ਅਲਫਾਫੋਲਡ: ਜੀਵ ਵਿਗਿਆਨ ਵਿੱਚ ਨਕਲੀ ਬੁੱਧੀ ਦੀ ਜਿੱਤ 6. ਚਿੱਤਰ ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਕਿਸਮ/ਸੈੱਲ ਪਛਾਣ 7. ਪ੍ਰਯੋਗਾਤਮਕ ਡਿਜ਼ਾਈਨ: ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ ਦੇ ਨਾਲ ਇੱਕ ਠੋਸ ਯੋਜਨਾ ਦੀ ਸਥਾਪਨਾ 8. ਡੇਟਾ ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਅੰਕੜਾ ਪ੍ਰਮਾਣਿਕਤਾ 9. ਵਿਗਿਆਨਕ ਦ੍ਰਿਸ਼ਟੀਕੋਣ: ਇਮਾਨਦਾਰੀ ਅਤੇ ਸਮਝਦਾਰੀ ਨਾਲ ਡੇਟਾ ਪ੍ਰਦਰਸ਼ਿਤ ਕਰਨਾ 10. ਸਾਹਿਤ ਸਮੀਖਿਆ ਅਤੇ ਵਿਗਿਆਨਕ ਲਿਖਤ 11. ਨੈਤਿਕਤਾ, ਜੀਵ ਸੁਰੱਖਿਆ, ਗੁਪਤਤਾ ਅਤੇ ਵਿਗਿਆਨਕ ਇਕਸਾਰਤਾ
ਯੂਨਿਟ 3 / 11

ਕ੍ਰਮ ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਬਾਇਓਇਨਫੋਰਮੈਟਿਕਸ: ਡੀਐਨਏ, ਆਰਐਨਏ ਅਤੇ ਪ੍ਰੋਟੀਨ

ਲਾਭ:

  • ਬੁਨਿਆਦੀ ਕ੍ਰਮ ਵਿਸ਼ਲੇਸ਼ਣ ਕਾਰਜਾਂ ਦੇ ਕੋਡ ਨੂੰ ਪ੍ਰਿੰਟ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਜਿਵੇਂ ਕਿ FASTA ਰੀਡਿੰਗ, ਅਨੁਵਾਦ, ਅਲਾਈਨਮੈਂਟ ਅਤੇ BLAST ਅਤੇ ਨਤੀਜਿਆਂ ਦੀ ਵਿਆਖਿਆ
  • ਈ-ਵੈਲਯੂ, ਕਵਰੇਜ ਦਰ ਅਤੇ ਰੀਡਿੰਗ ਫਰੇਮ ਵਰਗੀਆਂ ਧਾਰਨਾਵਾਂ ਦੀ ਸਹੀ ਵਿਆਖਿਆ ਕਰਕੇ ਗਲਤ ਸਿੱਟਿਆਂ ਤੋਂ ਬਚਣ ਦੀ ਸਮਰੱਥਾ
  • ਅਧਿਕਾਰਤ ਡੇਟਾਬੇਸ (NCBI, UniProt, Ensembl) ਦੇ ਨਾਲ ਇੱਕ ਕ੍ਰਮ ਦੇ ਫੰਕਸ਼ਨ ਦਾਅਵੇ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨ ਦੀ ਜ਼ਰੂਰਤ ਨੂੰ ਸਮਝਣ ਦੀ ਸਮਰੱਥਾ।

ਜੀਵ ਵਿਗਿਆਨ ਦਾ ਸਭ ਤੋਂ ਬੁਨਿਆਦੀ ਡੇਟਾ ਕ੍ਰਮ ਹੈ: ਡੀਐਨਏ ਦਾ ਕ੍ਰਮ ਜਿਸ ਵਿੱਚ A, T, G, C ਅੱਖਰ ਹੁੰਦੇ ਹਨ; ਆਰਐਨਏ ਦਾ ਏ, ਯੂ, ਜੀ, ਸੀ ਕ੍ਰਮ; ਪ੍ਰੋਟੀਨ ਦੇ 20 ਅਮੀਨੋ ਐਸਿਡ ਅੱਖਰਾਂ ਦੀ ਲੜੀ। ਅਸੀਂ ਸਮਝਦੇ ਹਾਂ ਕਿ ਜੀਨ ਕੀ ਹੈ, ਦੋ ਸਪੀਸੀਜ਼ ਕਿਸ ਤਰ੍ਹਾਂ ਸਬੰਧਿਤ ਹਨ, ਅਤੇ ਇਹਨਾਂ ਕ੍ਰਮਾਂ ਰਾਹੀਂ ਇੱਕ ਪਰਿਵਰਤਨ (ਕ੍ਰਮ ਵਿੱਚ ਤਬਦੀਲੀ) ਅਤੇ ਬਿਮਾਰੀ ਵਿਚਕਾਰ ਸਬੰਧ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਅਸੀਂ ਕ੍ਰਮ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਇੱਕ ਕੋਡ ਅਤੇ ਵਿਆਖਿਆ ਸਹਾਇਕ ਦੇ ਤੌਰ 'ਤੇ ਨਕਲੀ ਬੁੱਧੀ ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਸਿੱਖਾਂਗੇ: FASTA ਫਾਈਲਾਂ ਨੂੰ ਪੜ੍ਹਨਾ, ਕ੍ਰਮਾਂ ਦਾ ਅਨੁਵਾਦ ਕਰਨਾ, ਅਲਾਈਨਿੰਗ (ਅਲਾਈਨਿੰਗ: ਦੋ ਕ੍ਰਮਾਂ ਦੇ ਅੱਖਰਾਂ ਦੀ ਅੱਖਰ ਨਾਲ ਤੁਲਨਾ ਕਰਨਾ ਅਤੇ ਉਹਨਾਂ ਦੀਆਂ ਸਮਾਨਤਾਵਾਂ ਨੂੰ ਦੇਖਣਾ), ਅਤੇ BLAST ਵਰਗੇ ਟੂਲ ਨੂੰ ਸਮਝਣਾ।

ਸ਼ੁਰੂਆਤ ਤੋਂ ਨਾਜ਼ੁਕ ਚੇਤਾਵਨੀ: AI ਇੱਕ ਕ੍ਰਮ ਦੇ ਅਸਲ ਕਾਰਜ ਨੂੰ "ਜਾਣਦਾ" ਨਹੀਂ ਹੈ; ਸਿਰਫ਼ ਅਧਿਕਾਰਤ ਡੇਟਾਬੇਸ (NCBI, UniProt, Ensembl) ਅਤੇ ਅਨੁਭਵੀ ਸਬੂਤ ਇਹ ਕਹਿੰਦੇ ਹਨ।

ਬੁਨਿਆਦੀ ਸੰਕਲਪ ਅਤੇ ਸੰਦ

  • FASTA: ਟੈਕਸਟ ਫਾਰਮੈਟ ਜੋ ਸਤਰ ਨੂੰ ਸਟੋਰ ਕਰਦਾ ਹੈ; ਹਰੇਕ ਐਰੇ ਵਿੱਚ > ਨਾਲ ਸ਼ੁਰੂ ਹੋਣ ਵਾਲੀ ਇੱਕ ਸਿਰਲੇਖ ਲਾਈਨ ਅਤੇ ਇਸਦੇ ਹੇਠਾਂ ਸਬੈਰੇ ਲਾਈਨਾਂ ਸ਼ਾਮਲ ਹੁੰਦੀਆਂ ਹਨ।
  • BLAST (ਬੇਸਿਕ ਲੋਕਲ ਅਲਾਈਨਮੈਂਟ ਸਰਚ ਟੂਲ): ਇੱਕ ਟੂਲ ਜੋ ਤੁਹਾਡੇ ਕੋਲ ਇੱਕ ਵਿਸ਼ਾਲ ਡੇਟਾਬੇਸ ਵਿੱਚ ਲੱਖਾਂ ਕ੍ਰਮਾਂ ਦੇ ਨਾਲ ਇੱਕ ਕ੍ਰਮ ਦੀ ਤੁਲਨਾ ਕਰਦਾ ਹੈ ਅਤੇ ਸਭ ਤੋਂ ਵੱਧ ਸਮਾਨ ਲੱਭਦਾ ਹੈ। "ਇਹ ਸੀਰੀਜ਼ ਕਿਹੋ ਜਿਹੀ ਲੱਗਦੀ ਹੈ?" ਸਵਾਲ ਦਾ ਮਿਆਰੀ ਜਵਾਬ.
  • ਅਲਾਈਨਮੈਂਟ: ਦੋ ਜਾਂ ਦੋ ਤੋਂ ਵੱਧ ਐਰੇ ਨੂੰ ਵਿਵਸਥਿਤ ਕਰਨਾ ਤਾਂ ਜੋ ਸਮਾਨ ਖੇਤਰ ਇੱਕ ਦੂਜੇ ਦੇ ਹੇਠਾਂ ਰੱਖੇ ਜਾਣ। ਇਹ ਜੋੜਾ ਜਾਂ ਮਲਟੀਪਲ ਕ੍ਰਮ ਅਲਾਈਨਮੈਂਟ (MSA) ਹੋ ਸਕਦਾ ਹੈ।
  • ਅਨੁਵਾਦ: ਡੀਐਨਏ/ਆਰਐਨਏ ਕੋਡਿੰਗ ਕ੍ਰਮ ਨੂੰ ਤੀਹਰੀ ਅੱਖਰ ਸਮੂਹਾਂ (ਕੋਡਨ) ਦੁਆਰਾ ਇੱਕ ਅਮੀਨੋ ਐਸਿਡ ਕ੍ਰਮ ਵਿੱਚ ਬਦਲਣਾ।
  • ਮੋਟਿਫ: ਕ੍ਰਮ ਵਿੱਚ ਇੱਕ ਸੰਖੇਪ ਆਵਰਤੀ ਪੈਟਰਨ ਜਿਸਦਾ ਕਾਰਜਸ਼ੀਲ ਅਰਥ ਹੈ (ਉਦਾਹਰਨ ਲਈ, ਇੱਕ ਬਾਈਡਿੰਗ ਸਾਈਟ)।
ਸੰਕੇਤ: ਤੁਸੀਂ AI ਨੂੰ "ਉਸ ਲੜੀ ਨੂੰ ਬਲਾਸਟ" ਕਰਨ ਲਈ ਨਹੀਂ ਕਹਿ ਸਕਦੇ ਹੋ; ਮਾਡਲ BLAST ਡੇਟਾਬੇਸ ਤੱਕ ਪਹੁੰਚ ਨਹੀਂ ਕਰ ਸਕਦਾ ਹੈ। ਪਰ "ਮੈਂ ਆਪਣੇ BLAST ਨਤੀਜੇ ਦੀ ਵਿਆਖਿਆ ਕਿਵੇਂ ਕਰਾਂ, ਈ-ਮੁੱਲ (ਈ-ਮੁੱਲ) ਦਾ ਕੀ ਅਰਥ ਹੈ?" ਤੁਸੀਂ ਪੁੱਛ ਸਕਦੇ ਹੋ, ਅਤੇ ਕੋਡ ਵੀ ਲਿਖ ਸਕਦੇ ਹੋ ਜੋ ਬਾਇਓਪਾਈਥਨ ਨਾਲ ਪ੍ਰੋਗਰਾਮੇਟਿਕ ਤੌਰ 'ਤੇ BLAST ਨੂੰ ਕਾਲ ਕਰਦਾ ਹੈ।

ਕਦਮ ਦਰ ਕਦਮ: ਇੱਕ ਐਰੇ ਦੀ ਪਛਾਣ ਦੀ ਜਾਂਚ ਕਰਨਾ

  1. ਕ੍ਰਮ ਪ੍ਰਾਪਤ ਕਰੋ: FASTA ਦੇ ਰੂਪ ਵਿੱਚ ਫਾਈਲ ਵਿੱਚ ਸੇਵ ਕਰੋ।
  2. ਮੁੱਢਲੀ ਜਾਂਚ: ਲੰਬਾਈ, ਅੱਖਰ ਸਮੱਗਰੀ (ਕੀ ਇਹ ਸਿਰਫ਼ A/T/G/C ਹੈ ਜਾਂ ਕੋਈ ਅਗਿਆਤ "N" ਹੈ), GC ਅਨੁਪਾਤ (ਗੁਆਨੀਨ-ਸਾਈਟੋਸਾਈਨ ਦੀ ਪ੍ਰਤੀਸ਼ਤਤਾ: ਪ੍ਰਜਾਤੀਆਂ ਅਤੇ ਖੇਤਰ ਦੁਆਰਾ ਵੱਖ-ਵੱਖ ਹੁੰਦੀ ਹੈ)।
  3. BLAST: NCBI ਵੈੱਬ ਇੰਟਰਫੇਸ ਜਾਂ ਪ੍ਰੋਗਰਾਮੇਟਿਕ ਤੌਰ 'ਤੇ ਖੋਜ ਕਰੋ।
  4. ਟਿੱਪਣੀ: ਸਭ ਤੋਂ ਵਧੀਆ ਮੈਚ ਦੇ ਈ-ਮੁੱਲ ਨੂੰ ਦੇਖੋ (ਇਹ ਜਿੰਨਾ ਛੋਟਾ ਹੈ, ਘੱਟ ਸੰਭਾਵਨਾ ਹੈ ਕਿ ਇਹ ਇੱਕ ਇਤਫ਼ਾਕ ਹੈ) ਅਤੇ ਪੁੱਛਗਿੱਛ ਕਵਰੇਜ.
  5. ਪੁਸ਼ਟੀ: UniProt ਜਾਂ NCBI ਵਿੱਚ ਮੇਲ ਖਾਂਦਾ ਜੀਨ/ਪ੍ਰੋਟੀਨ ਖੋਲ੍ਹੋ ਅਤੇ ਤਸਦੀਕ ਕਰੋ ਕਿ ਇਹ ਅਸਲ ਵਿੱਚ ਉਸ ਫੰਕਸ਼ਨ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ ਜਿਸਦੀ ਤੁਸੀਂ ਭਾਲ ਕਰ ਰਹੇ ਹੋ।

AI ਤੁਹਾਨੂੰ ਕਦਮ 2 ਵਿੱਚ ਕੋਡ ਅਤੇ ਕਦਮ 4 ਵਿੱਚ ਟਿੱਪਣੀ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ; ਪਰ ਕਦਮ 3 ਅਤੇ 5 ਵਿੱਚ ਅਸਲ ਡੇਟਾ ਆਪਣੇ ਆਪ ਅਤੇ ਤੁਹਾਡੇ ਦੁਆਰਾ ਟੂਲਸ ਦੁਆਰਾ ਪ੍ਰਦਾਨ ਕੀਤਾ ਗਿਆ ਹੈ।

ਕਾਪੀ ਕਰਨ ਯੋਗ ਪ੍ਰੋਂਪਟ ਟੈਂਪਲੇਟਸ

ਭੂਮਿਕਾ: ਤੁਸੀਂ ਬਾਇਓਇਨਫੋਰਮੈਟਿਕਸ ਸਹਾਇਕ ਹੋ। ਟਾਸਕ: ਬਾਇਓਪਾਈਥਨ ਨਾਲ ਇੱਕ FASTA ਫਾਈਲ (sequences.fasta) ਪੜ੍ਹੋ। ਮੈਂ ਚਾਹੁੰਦਾ ਹਾਂ: ਇੱਕ ਸਾਰਣੀ ਵਿੱਚ ਹਰੇਕ ਕ੍ਰਮ ਲਈ ਨਾਮ, ਲੰਬਾਈ ਅਤੇ GC ਅਨੁਪਾਤ ਲਿਖੋ; ਨਤੀਜੇ ਨੂੰ CSV ਦੇ ਰੂਪ ਵਿੱਚ ਸੁਰੱਖਿਅਤ ਕਰੋ। ਟਿੱਪਣੀਆਂ ਦੇ ਨਾਲ ਵਰਕਿੰਗ ਪਾਈਥਨ ਕੋਡ ਦਿਓ।

ਮੇਰੇ ਕੋਲ ਡੀਐਨਏ ਕ੍ਰਮ ਦਾ ਪ੍ਰੋਟੀਨ ਕ੍ਰਮ ਵਿੱਚ ਅਨੁਵਾਦ ਕਰੋ। Biopython Seq.translate ਦੀ ਵਰਤੋਂ ਕਰੋ; ਸ਼ੋਅ ਸਟਾਪ ਕੋਡਨ (*); ਰੀਡਿੰਗ ਫਰੇਮ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ। ਕੋਡ ਦਿਓ, ਸਮਝਾਓ। ਕ੍ਰਮ: [FASTA]

ਮੇਰੇ BLAST ਨਤੀਜੇ ਦੀ ਵਿਆਖਿਆ ਕਰੋ। ਹੇਠਾਂ ਮੁੱਲ-ਮੁੱਲ, ਪਛਾਣ ਪ੍ਰਤੀਸ਼ਤ, ਅਤੇ ਚੋਟੀ ਦੇ 5 ਮੈਚਾਂ ਦੀ ਕਵਰੇਜ ਦਰ ਦਿੱਤੀ ਗਈ ਹੈ। ਮੈਨੂੰ ਦੱਸੋ ਕਿ ਕਿਹੜਾ ਮੈਚ ਭਰੋਸੇਯੋਗ ਹੈ ਅਤੇ ਕਿਉਂ, ਸਹੀ ਫੰਕਸ਼ਨ ਦਾਅਵੇ ਨਾ ਕਰੋ, ਮੈਨੂੰ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ ਲੋੜੀਂਦੇ ਕਦਮ ਦੱਸੋ। ਸਾਰਣੀ: [ਡਾਟਾ]

ਦੋ ਪ੍ਰੋਟੀਨ ਕ੍ਰਮਾਂ ਨੂੰ ਜੋੜੇ ਅਨੁਸਾਰ ਇਕਸਾਰ ਕਰੋ ਅਤੇ ਪ੍ਰਤੀਸ਼ਤ ਸਮਾਨਤਾ ਲੱਭੋ। Biopython pairwise2 ਜਾਂ Bio.Align ਦੀ ਵਰਤੋਂ ਕਰੋ; ਅਲਾਈਨਮੈਂਟ ਨੂੰ ਪੜ੍ਹਨਯੋਗ ਪ੍ਰਿੰਟ ਕਰੋ। ਕੋਡ ਦਿਓ ਅਤੇ ਸਕੋਰਿੰਗ ਸਕੀਮ ਦੀ ਵਿਆਖਿਆ ਕਰੋ।

ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ

ਕਮਜ਼ੋਰ: "ਇਹ ਕ੍ਰਮ ਕਿਹੜਾ ਜੀਨ ਹੈ?"

ਮਜਬੂਤ: "ਮੇਰੇ ਕੋਲ 1,140 ਬੇਸ ਜੋੜਿਆਂ ਦਾ ਮਨੁੱਖੀ DNA ਕ੍ਰਮ ਹੈ (ਹੇਠਾਂ FASTA)। ਮੈਂ ਇਸ ਕ੍ਰਮ ਨੂੰ ਖੁਦ ਬਲਾਸਟ ਕੀਤਾ ਹੈ; ਸਭ ਤੋਂ ਵਧੀਆ ਮੇਲ TP53, ਈ-ਮੁੱਲ 0.0, ਪਛਾਣ 99.8%, ਕਵਰੇਜ 100% ਹੈ। ਦੱਸੋ ਕਿ ਇਹ ਨਤੀਜਾ ਮਜ਼ਬੂਤ ​​ਸਬੂਤ ਕਿਉਂ ਹੈ; ਹਾਲਾਂਕਿ, ਮੈਨੂੰ ਦੱਸੋ ਕਿ ਮੈਨੂੰ ਇਸਦੀ ਤਸਦੀਕ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਕਿਸ 2 ਦੀ ਲੋੜ ਹੈ।"

ਅੰਤਰ: ਮਜ਼ਬੂਤ ​​ਪ੍ਰੋਂਪਟ ਵਿੱਚ, ਮਾਡਲ ਨੂੰ ਅਸਲ ਡੇਟਾ (ਲੰਬਾਈ, BLAST ਨਤੀਜਾ) ਪ੍ਰਦਾਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ; ਤੁਸੀਂ ਮਾਡਲ ਨੂੰ ਤੁਹਾਡੇ ਦੁਆਰਾ ਪ੍ਰਦਾਨ ਕੀਤੇ ਗਏ ਸਬੂਤ ਦੀ ਵਿਆਖਿਆ ਕਰਨ ਲਈ ਕਹਿ ਰਹੇ ਹੋ, ਨਾ ਕਿ ਇਸਨੂੰ "ਯਾਦ" ਕਰਨ ਲਈ। ਉਸਨੂੰ ਇੱਕ ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ 'ਤੇ ਇੱਕ ਮਾਡਲ ਬਣਾਉਣ ਲਈ ਮਜਬੂਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ.

ਤਿੰਨ ਛੋਟੇ ਕੇਸ

ਕੇਸ 1 — ਗਲਤ ਰੀਡਿੰਗ ਫਰੇਮ: ਇੱਕ ਵਿਦਿਆਰਥੀ ਨੇ ਡੀਐਨਏ ਕ੍ਰਮ ਨੂੰ ਪ੍ਰੋਟੀਨ ਵਿੱਚ ਅਨੁਵਾਦ ਕੀਤਾ, ਪਰ ਸ਼ੁਰੂ ਤੋਂ, ਸਹੀ ਸਟਾਰਟ ਕੋਡਨ (ATG) ਲੱਭੇ ਬਿਨਾਂ। ਨਤੀਜਾ ਇੱਕ ਅਰਥਹੀਣ, ਛੇਤੀ ਰੋਕਣ ਵਾਲਾ ਪ੍ਰੋਟੀਨ ਸੀ। ਜਦੋਂ ਮਾਡਲ ਨੇ ਸਾਰੇ ਤਿੰਨ ਰੀਡਿੰਗ ਫਰੇਮਾਂ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ ਅਤੇ ਕੋਡ ਲਿਖਿਆ ਜਿਸ ਵਿੱਚ ATG ਨਾਲ ਸ਼ੁਰੂ ਹੋਣ ਵਾਲਾ ਸਭ ਤੋਂ ਲੰਬਾ ਓਪਨ ਰੀਡਿੰਗ ਫਰੇਮ (ORF) ਪਾਇਆ ਗਿਆ, ਤਾਂ ਸਹੀ 380 ਐਮੀਨੋ ਐਸਿਡ ਪ੍ਰੋਟੀਨ ਸਾਹਮਣੇ ਆਇਆ।

ਕੇਸ 2 — ਈ-ਮੁੱਲ ਦਾ ਭੁਲੇਖਾ: ਇੱਕ ਟੈਕਨੀਸ਼ੀਅਨ ਨੇ "ਲੱਭਿਆ" ਵਜੋਂ 2.0 ਦੇ ਈ-ਵੈਲਯੂ ਦੇ ਨਾਲ ਇੱਕ BLAST ਮੈਚ ਦੀ ਰਿਪੋਰਟ ਕੀਤੀ। ਜਦੋਂ ਕਿ, 1 ਤੋਂ ਵੱਧ ਈ-ਮੁੱਲ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਮੈਚ ਸੰਭਾਵਤ ਤੌਰ 'ਤੇ ਇੱਕ ਇਤਫ਼ਾਕ ਹੈ। ਮਾਡਲ ਨੇ ਇਸ ਦੀ ਵਿਆਖਿਆ ਕੀਤੀ ਅਤੇ ਯਾਦ ਦਿਵਾਇਆ ਕਿ e <1e-5 ਨੂੰ ਆਮ ਤੌਰ 'ਤੇ ਭਰੋਸੇਯੋਗ ਥ੍ਰੈਸ਼ਹੋਲਡ ਵਜੋਂ ਵਰਤਿਆ ਜਾਂਦਾ ਹੈ।

ਕੇਸ 3 - ਗੰਦਗੀ: ਇੱਕ ਪ੍ਰਯੋਗਸ਼ਾਲਾ ਵਿੱਚ ਇੱਕ ਬੈਕਟੀਰੀਆ ਦੇ ਕ੍ਰਮ ਦੇ ਇੱਕ ਧਮਾਕੇ ਨੇ ਮਨੁੱਖੀ ਡੀਐਨਏ ਨੂੰ ਸਭ ਤੋਂ ਵਧੀਆ ਮੈਚ ਵਜੋਂ ਬਦਲ ਦਿੱਤਾ। ਇਹ ਨਮੂਨੇ ਦੇ ਗੰਦਗੀ ਦੀ ਨਿਸ਼ਾਨੀ ਸੀ। ਏਆਈ ਨੇ ਇਹ ਕਹਿ ਕੇ ਸਹੀ ਸ਼ੱਕ ਪੈਦਾ ਕੀਤਾ ਕਿ "ਅਚਾਨਕ ਕਿਸਮ ਦਾ ਮੈਚ ਗੰਦਗੀ ਦਾ ਸੰਕੇਤ ਹੋ ਸਕਦਾ ਹੈ"; ਤਕਨੀਸ਼ੀਅਨ ਨੇ ਉਦਾਹਰਣ ਨੂੰ ਦੁਹਰਾਇਆ।

ਤੁਲਨਾ: ਨਕਲੀ ਬੁੱਧੀ ਦੀ ਭੂਮਿਕਾ

ਖੋਜ

ਨਕਲੀ ਬੁੱਧੀ

ਟੂਲ/ਡਾਟਾਬੇਸ

ਮਨੁੱਖ

FASTA ਰੀਡ, GC/ਲੰਬਾਈ

ਕੋਡ ਲਿਖਦਾ ਹੈ

-

ਆਉਟਪੁੱਟ ਨੂੰ ਕੰਟਰੋਲ ਕਰਦਾ ਹੈ

ਅਨੁਵਾਦ, ORF ਖੋਜ

ਕੋਡ ਲਿਖਦਾ ਹੈ

ਬਾਇਓਪਾਈਥਨ ਚਲਾਉਂਦਾ ਹੈ

ਫਰੇਮ ਨੂੰ ਪ੍ਰਮਾਣਿਤ ਕਰਦਾ ਹੈ

ਐਰੇ ਆਈ.ਡੀ

ਟਿੱਪਣੀਆਂ

BLAST/NCBI ਲੱਭਦਾ ਹੈ

ਪੁਸ਼ਟੀ ਕਰਦਾ ਹੈ

ਫੰਕਸ਼ਨ ਦਾ ਦਾਅਵਾ

ਸੁਝਾਅ ਪੇਸ਼ ਕਰਦਾ ਹੈ

UniProt ਸਬੂਤ ਦਿੰਦਾ ਹੈ

ਫੈਸਲਾ ਕਰਦਾ ਹੈ

ਆਮ ਗਲਤੀਆਂ

  • ਮਾਡਲ ਨੂੰ ਸਤਰ ID ਨੂੰ "ਯਾਦ" ਰੱਖਣ ਲਈ ਕਹਿਣਾ: ਮਾਡਲ ਸਤਰ ਨੂੰ ਯਾਦ ਨਹੀਂ ਰੱਖਦਾ; BLAST ਦੀ ਵਰਤੋਂ ਕਰੋ।
  • ਈ-ਮੁੱਲ ਦੀ ਗਲਤ ਵਿਆਖਿਆ: ਛੋਟਾ ਚੰਗਾ ਹੈ, ਵੱਡਾ ਬੁਰਾ ਹੈ; ਥ੍ਰੈਸ਼ਹੋਲਡ ਨੂੰ ਯਾਦ ਰੱਖੋ.
  • ਰੀਡਿੰਗ ਫਰੇਮ ਦੀ ਜਾਂਚ ਨਾ ਕਰਨਾ: ਗਲਤ ਫਰੇਮ ਬਕਵਾਸ ਪ੍ਰੋਟੀਨ ਪੈਦਾ ਕਰਦਾ ਹੈ।
  • ਕਵਰੇਜ ਨੂੰ ਅਣਡਿੱਠ ਕਰਨਾ: ਉੱਚ ਪਛਾਣ ਪਰ ਘੱਟ ਕਵਰੇਜ ਦਾ ਮਤਲਬ ਹੈ ਅੰਸ਼ਕ ਮੈਚ।
  • ਗਾਇਬ ਗੰਦਗੀ: ਅਚਾਨਕ ਪ੍ਰਜਾਤੀਆਂ ਦਾ ਮੇਲ ਇੱਕ ਗੰਭੀਰ ਚੇਤਾਵਨੀ ਹੈ।
ਸਾਵਧਾਨ: ਸਿਰਫ਼ ਇਸ ਲਈ ਕਿ ਇੱਕ ਕ੍ਰਮ "99% TP53 ਵਰਗਾ" ਹੈ, ਇਹ ਸਾਬਤ ਨਹੀਂ ਕਰਦਾ ਕਿ ਉਹ ਕ੍ਰਮ TP53 ਫੰਕਸ਼ਨ ਰੱਖਦਾ ਹੈ; ਇਹ ਇੱਕ ਮਜ਼ਬੂਤ ​​ਅਨੁਮਾਨ ਹੈ। ਫੰਕਸ਼ਨ ਨੂੰ ਅਨੁਭਵੀ ਸਬੂਤ ਅਤੇ ਡੇਟਾਬੇਸ ਵਰਣਨ ਦੁਆਰਾ ਸਮਰਥਤ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਏਆਈ ਲਈ ਇਹ ਕਹਿਣਾ ਕਾਫ਼ੀ ਨਹੀਂ ਹੈ ਕਿ "ਇਹ ਇੱਕ ਟਿਊਮਰ ਨੂੰ ਦਬਾਉਣ ਵਾਲਾ ਹੈ."

ਮਲਟੀਪਲ ਕ੍ਰਮ ਅਲਾਈਨਮੈਂਟ ਅਤੇ ਫਾਈਲੋਜੀਨੀ ਦਾ ਆਧਾਰ

ਸਿਰਫ਼ ਦੋ ਦੀ ਬਜਾਏ ਦਰਜਨਾਂ ਕ੍ਰਮਾਂ ਨੂੰ ਇੱਕਠੇ ਕਰਨ ਨੂੰ ਮਲਟੀਪਲ ਸੀਕੁਏਂਸ ਅਲਾਈਨਮੈਂਟ (MSA) ਕਿਹਾ ਜਾਂਦਾ ਹੈ ਅਤੇ ਇਹ ਬਹੁਤ ਸਾਰੇ ਵਿਸ਼ਲੇਸ਼ਣਾਂ ਦਾ ਆਧਾਰ ਹੈ: ਸੁਰੱਖਿਅਤ ਖੇਤਰਾਂ ਨੂੰ ਲੱਭਣਾ (ਹਿੱਸੇ ਜੋ ਵਿਕਾਸ ਵਿੱਚ ਕੋਈ ਬਦਲਾਅ ਨਹੀਂ ਹਨ ਅਤੇ ਇਸ ਲਈ ਕਾਰਜਸ਼ੀਲ ਤੌਰ 'ਤੇ ਮਹੱਤਵਪੂਰਨ ਹਨ), ਫਾਈਲੋਜੈਨੇਟਿਕ ਰੁੱਖਾਂ ਦਾ ਨਿਰਮਾਣ ਕਰਨਾ, ਪ੍ਰੋਟੀਨ ਪਰਿਵਾਰਾਂ ਦੀ ਪਛਾਣ ਕਰਨਾ। MAFFT, MUSCLE ਅਤੇ Clustal ਵਰਗੇ ਟੂਲ ਇਹ ਕੰਮ ਕਰਦੇ ਹਨ। AI ਉਹ ਕੋਡ ਲਿਖਦਾ ਹੈ ਜੋ ਇਹਨਾਂ ਟੂਲਾਂ ਨੂੰ Python ਤੋਂ ਕਾਲ ਕਰਦਾ ਹੈ (ਉਦਾਹਰਣ ਵਜੋਂ Biopython ਦੁਆਰਾ) ਅਤੇ ਆਉਟਪੁੱਟ ਦੀ ਵਿਆਖਿਆ ਕਰਨ ਵਿੱਚ ਤੁਹਾਡੀ ਮਦਦ ਕਰਦਾ ਹੈ; ਪਰ ਅਲਾਈਨਮੈਂਟ ਆਪਣੇ ਆਪ ਟੂਲ ਬਣਾਉਂਦੀ ਹੈ, ਮਾਡਲ "ਰੋਟ ਦੁਆਰਾ" ਨਹੀਂ।

ਇੱਕ MSA ਦੀ ਵਿਆਖਿਆ ਕਰਦੇ ਸਮੇਂ, ਸੁਰੱਖਿਅਤ ਕਾਲਮਾਂ ਵੱਲ ਧਿਆਨ ਦਿਓ: ਇੱਕ ਅਮੀਨੋ ਐਸਿਡ ਜੋ ਸਾਰੇ ਕ੍ਰਮਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ ਰਹਿੰਦਾ ਹੈ, ਪ੍ਰੋਟੀਨ ਦੇ ਕੰਮ (ਉਦਾਹਰਨ ਲਈ, ਇੱਕ ਐਂਜ਼ਾਈਮ ਦੀ ਸਰਗਰਮ ਸਾਈਟ) ਲਈ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ। ਇਹ ਇੱਕ ਮਜ਼ਬੂਤ ​​ਸੁਰਾਗ ਦਿੰਦਾ ਹੈ ਕਿ ਇੱਕ ਪਰਿਵਰਤਨ ਹਾਨੀਕਾਰਕ ਕਿਉਂ ਹੋ ਸਕਦਾ ਹੈ। ਪਰ "ਰੱਖਿਅਤ = ਮਹੱਤਵਪੂਰਨ" ਇੱਕ ਪਰਿਕਲਪਨਾ ਹੈ; ਪ੍ਰਯੋਗਾਤਮਕ ਪੁਸ਼ਟੀਕਰਨ ਦੀ ਲੋੜ ਹੈ।

ਮੇਰੀ ਮਲਟੀਪਲ ਅਲਾਈਨਮੈਂਟ ਫਾਈਲ (aligned.fasta), ਜੋ ਕਿ MAFFT ਆਉਟਪੁੱਟ ਹੈ, Biopython ਨਾਲ ਪੜ੍ਹੋ। ਹਰੇਕ ਕਾਲਮ ਲਈ ਧਾਰਨ ਦਰ ਦੀ ਗਣਨਾ ਕਰੋ; 90% ਤੋਂ ਵੱਧ ਸੁਰੱਖਿਅਤ ਅਹੁਦਿਆਂ ਦੀ ਸੂਚੀ ਬਣਾਓ। ਸਮਝਾਓ ਕਿ ਇਹ ਸਥਿਤੀਆਂ ਕਾਰਜਾਤਮਕ ਮਹੱਤਤਾ ਦੀਆਂ ਕਿਉਂ ਹੋ ਸਕਦੀਆਂ ਹਨ, ਨਿਸ਼ਚਿਤ ਫੰਕਸ਼ਨ ਦਾ ਦਾਅਵਾ ਨਾ ਕਰੋ।

ਪਰਿਵਰਤਨ ਅਤੇ ਰੂਪ ਵਿਆਖਿਆ ਜਾਲ

ਜਦੋਂ ਤੁਸੀਂ ਇੱਕ ਸਤਰ ਵਿੱਚ ਇੱਕ ਅੱਖਰ ਤਬਦੀਲੀ (ਵਰਗ) ਦੇਖਦੇ ਹੋ, ਤਾਂ ਇਹ "ਹਾਨੀਕਾਰਕ" ਕਹਿਣਾ ਇੱਕ ਵੱਡੀ ਛਾਲ ਹੈ। ਜ਼ਿਆਦਾਤਰ ਰੂਪ ਨਿਰਪੱਖ (ਬੇਅਸਰ) ਹਨ। ਇੱਕ ਵੇਰੀਐਂਟ ਦੇ ਪ੍ਰਭਾਵ ਦੀ ਵਿਆਖਿਆ ਕਰਦੇ ਸਮੇਂ, ਕਿਸੇ ਨੂੰ ਸਮਰਪਿਤ ਵੇਰੀਐਂਟ ਡੇਟਾਬੇਸ (ਜਿਵੇਂ ਕਿ ਕਲਿਨਵਰ) ਅਤੇ ਆਬਾਦੀ ਬਾਰੰਬਾਰਤਾ ਡੇਟਾ (ਜਿਵੇਂ ਕਿ gnomAD) ਨੂੰ ਵੇਖਣ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਨਾ ਕਿ AI ਦੇ ਸ਼ਬਦ ਨੂੰ। ਜੇਕਰ ਮਾਡਲ ਦਾਅਵਾ ਕਰਦਾ ਹੈ ਕਿ ਇੱਕ ਰੂਪ "ਪੈਥੋਜਨਿਕ" ਹੈ, ਤਾਂ ਇਹਨਾਂ ਸਰੋਤਾਂ ਤੋਂ ਇਸਦੀ ਪੁਸ਼ਟੀ ਕੀਤੇ ਬਿਨਾਂ ਇਸਨੂੰ ਕਦੇ ਵੀ ਕਲੀਨਿਕਲ ਜਾਂ ਖੋਜ ਸਿੱਟੇ ਵਿੱਚ ਨਾ ਲਿਖੋ।

ਤਸਦੀਕ ਲਈ ਅਧਾਰ ਡਾਟਾਬੇਸ

ਲੜੀ ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ ਹਰ ਦਾਅਵੇ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ ਅਧਿਕਾਰਤ ਸਰੋਤਾਂ ਨੂੰ ਜਾਣਨਾ ਨਕਲੀ ਬੁੱਧੀ ਦੇ ਬਨਾਵਟ ਦੇ ਵਿਰੁੱਧ ਤੁਹਾਡੀ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਢਾਲ ਹੈ। ਸਭ ਤੋਂ ਵੱਧ ਅਕਸਰ ਵਰਤੇ ਜਾਂਦੇ ਹਨ:

ਡਾਟਾਬੇਸ

ਕਿਸ ਲਈ

ਆਮ ਪੁਸ਼ਟੀ

NCBI GenBank/RefSeq

ਡੀਐਨਏ/ਆਰਐਨਏ ਕ੍ਰਮ, ਜੀਨ ਰਿਕਾਰਡ

ਸਤਰ ID, ਲੰਬਾਈ

ਯੂਨੀਪ੍ਰੋਟ

ਪ੍ਰੋਟੀਨ ਕ੍ਰਮ ਅਤੇ ਫੰਕਸ਼ਨ

ਫੰਕਸ਼ਨ, ਅਮੀਨੋ ਐਸਿਡ ਦੀ ਗਿਣਤੀ

ਸਮੂਹ

ਜੀਨੋਮ ਐਨੋਟੇਸ਼ਨ, ਜੀਨ ਟਿਕਾਣੇ

ਜੀਨ-ਕ੍ਰੋਮੋਸੋਮ ਮੈਪਿੰਗ

ਕਲੀਨਵਰ

ਰੂਪਾਂ ਦੀ ਕਲੀਨਿਕਲ ਮਹੱਤਤਾ

ਪਾਥੋਜਨਿਕ/ਨਿਰਪੱਖ ਫੈਸਲਾ

gnomAD

ਆਬਾਦੀ ਵਿੱਚ ਰੂਪਾਂਤਰ ਦੀ ਬਾਰੰਬਾਰਤਾ

ਦੁਰਲੱਭ/ਆਮ ਰੂਪ

AI ਇਹ ਸੁਝਾਅ ਦੇ ਸਕਦਾ ਹੈ ਕਿ ਤੁਹਾਨੂੰ ਇਹਨਾਂ ਵਿੱਚੋਂ ਕਿਹੜਾ ਆਧਾਰ ਦੇਖਣਾ ਚਾਹੀਦਾ ਹੈ; ਪਰ ਤੁਸੀਂ ਪੁੱਛਗਿੱਛ ਕਰਦੇ ਹੋ ਅਤੇ ਤੁਸੀਂ ਨਤੀਜਾ ਪੜ੍ਹਦੇ ਹੋ. "ਮਾਡਲ ਨੇ ਕਿਹਾ ਕਿ ਇਹ ਉਹੀ ਹੈ ਜੋ UniProt ਕਹਿੰਦਾ ਹੈ" ਇੱਕ ਪੁਸ਼ਟੀ ਨਹੀਂ ਹੈ; ਪੁਸ਼ਟੀਕਰਣ ਯੂਨੀਪ੍ਰੋਟ ਪੇਜ ਨੂੰ ਖੁਦ ਖੋਲ੍ਹ ਰਿਹਾ ਹੈ।

ਸੰਖੇਪ ਵਿੱਚ

ਕ੍ਰਮ ਵਿਸ਼ਲੇਸ਼ਣ ਬਾਇਓਇਨਫੋਰਮੈਟਿਕਸ ਦਾ ਦਿਲ ਹੈ; FASTA, BLAST, ਅਲਾਈਨਮੈਂਟ ਅਤੇ ਅਨੁਵਾਦ ਬੁਨਿਆਦੀ ਕਾਰਜ ਹਨ। AI ਇਹਨਾਂ ਓਪਰੇਸ਼ਨਾਂ ਲਈ ਕੋਡ ਲਿਖਦਾ ਹੈ ਅਤੇ ਉਹਨਾਂ ਦੇ ਨਤੀਜਿਆਂ ਦੀ ਵਿਆਖਿਆ ਕਰਨ ਵਿੱਚ ਤੁਹਾਡੀ ਮਦਦ ਕਰਦਾ ਹੈ, ਪਰ ਟੂਲ (BLAST) ਅਤੇ ਡੇਟਾਬੇਸ (NCBI, UniProt) ਅਸਲ ਕ੍ਰਮ ਪਛਾਣ ਪ੍ਰਦਾਨ ਕਰਦੇ ਹਨ। ਈ-ਮੁੱਲ, ਕਵਰੇਜ, ਅਤੇ ਰੀਡਿੰਗ ਫਰੇਮ ਵਰਗੀਆਂ ਧਾਰਨਾਵਾਂ ਨੂੰ ਸਹੀ ਢੰਗ ਨਾਲ ਸਮਝਣਾ ਗਲਤ ਸਿੱਟੇ ਤੋਂ ਬਚਣ ਦੀ ਕੁੰਜੀ ਹੈ। ਇੱਕ ਫੰਕਸ਼ਨ ਦਾਅਵੇ ਲਈ ਹਮੇਸ਼ਾ ਸੁਤੰਤਰ ਸਬੂਤ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।

ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ

ਇੱਕ ਨਮੂਨਾ ਡੀਐਨਏ ਕ੍ਰਮ (ਜਾਂ ਇੱਕ ਜੀਨ ਜੋ ਤੁਸੀਂ NCBI ਤੋਂ ਡਾਊਨਲੋਡ ਕੀਤਾ ਹੈ) ਲਓ। AI ਨੂੰ Biopython ਨਾਲ ਲੰਬਾਈ ਅਤੇ GC ਅਨੁਪਾਤ ਦੀ ਗਣਨਾ ਕਰਨ ਲਈ ਕਹੋ, ਫਿਰ ਇਸਨੂੰ ਤਿੰਨਾਂ ਰੀਡਿੰਗ ਫ੍ਰੇਮਾਂ ਅਤੇ ਪ੍ਰਿੰਟ ਕੋਡ ਵਿੱਚ ਅਨੁਵਾਦ ਕਰੋ ਜੋ ਸਭ ਤੋਂ ਲੰਬਾ ORF ਲੱਭਦਾ ਹੈ। ਨਤੀਜਾ ਚਲਾਓ. ਫਿਰ NCBI BLAST ਵਿੱਚ ਖੁਦ ਇਸ ਕ੍ਰਮ ਦੀ ਖੋਜ ਕਰੋ ਅਤੇ ਮਾਡਲ ਨੂੰ ਸਭ ਤੋਂ ਵਧੀਆ ਮੈਚ ਦੀ ਈ-ਮੁੱਲ ਅਤੇ ਕਵਰੇਜ ਦਰ ਦੀ ਵਿਆਖਿਆ ਕਰਨ ਲਈ ਕਹੋ। UniProt ਵਿੱਚ ਮਾਡਲ ਦੇ ਕਾਰਜਾਤਮਕ ਦਾਅਵੇ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ।

ਚੈੱਕਲਿਸਟ

  • [ ] ਮੈਂ ਸਤਰ ਦੀ ਪ੍ਰਕਿਰਿਆ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਲੰਬਾਈ ਅਤੇ ਅੱਖਰ ਸਮੱਗਰੀ ਦੀ ਜਾਂਚ ਕੀਤੀ।
  • ਮੈਂ ਅਨੁਵਾਦ ਵਿੱਚ ਸਹੀ ਰੀਡਿੰਗ ਫਰੇਮ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਹੈ।
  • [ ] ਮੈਂ ਖੁਦ BLAST ਦੌੜਿਆ, ਮੈਂ ਮਾਡਲ ਨੂੰ "ਯਾਦ ਨਹੀਂ ਕਰਾਇਆ"।
  • [ ] ਮੈਂ ਈ-ਮੁੱਲ ਅਤੇ ਕਵਰੇਜ ਅਨੁਪਾਤ ਦੀ ਸਹੀ ਵਿਆਖਿਆ ਕੀਤੀ ਹੈ।
  • [ ] ਮੈਂ ਗੰਦਗੀ ਲਈ ਅਚਾਨਕ ਸਪੀਸੀਜ਼ ਮੈਚ ਦਾ ਮੁਲਾਂਕਣ ਕੀਤਾ।
  • [ ] ਮੈਂ ਅਧਿਕਾਰਤ ਡੇਟਾਬੇਸ ਨਾਲ ਫੰਕਸ਼ਨ ਦਾਅਵੇ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ ਹੈ।