ਲਾਭ:
- NER, ਰਿਸ਼ਤਾ ਕੱਢਣ, ਟਾਈਮਲਾਈਨ ਅਤੇ ਨੈੱਟਵਰਕ ਵਿਸ਼ਲੇਸ਼ਣ ਵਰਗੀਆਂ ਤਕਨੀਕਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ ਟੈਕਸਟ ਦੇ ਵੱਡੇ ਸੈੱਟਾਂ ਤੋਂ ਪੈਟਰਨ ਕੱਢਣ ਦੀ ਸਮਰੱਥਾ
- ਪੈਟਰਨ ਨੂੰ ਸਬੂਤ ਦੀ ਬਜਾਏ ਇੱਕ ਪਰਿਕਲਪਨਾ ਦੇ ਰੂਪ ਵਿੱਚ ਦੇਖਣ ਦੇ ਯੋਗ ਹੋਣਾ, ਇਕਾਈਆਂ ਨੂੰ ਸਰੋਤ ਨਾਲ ਜੋੜਨਾ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਮਨੁੱਖੀ ਪ੍ਰਵਾਨਗੀ ਨਾਲ ਆਮ ਕਰਨਾ
- ਇਹ ਸਮਝਣ ਦੀ ਸਮਰੱਥਾ ਕਿ ਕਿਵੇਂ ਗੁੰਮ ਹੋਏ ਡੇਟਾ ਅਤੇ ਨਮੂਨੇ ਦੇ ਪੱਖਪਾਤ ਦੇ ਕਾਰਨ ਸੰਖਿਆਵਾਂ ਨੂੰ ਗੁੰਮਰਾਹ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ, ਅਤੇ ਵਿਵਾਦਿਤ ਸਬੰਧਾਂ ਅਤੇ ਕਾਲਕ੍ਰਮ ਤੋਂ ਬਚਣ ਲਈ।
ਇਤਿਹਾਸਕ ਖੋਜ ਸਿਰਫ਼ ਵਿਅਕਤੀਗਤ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਪੜ੍ਹਨ ਬਾਰੇ ਨਹੀਂ ਹੈ; ਅਕਸਰ ਦਸਤਾਵੇਜ਼ਾਂ ਦੇ ਵੱਡੇ ਸੈੱਟਾਂ ਵਿੱਚ ਪੈਟਰਨ ਲੱਭਦੇ ਹਨ। ਸਾਲਾਂ ਦੌਰਾਨ ਇੱਕ ਖਾਸ ਨਾਮ ਕਿਹੜੇ ਸੰਦਰਭਾਂ ਵਿੱਚ ਪ੍ਰਗਟ ਹੁੰਦਾ ਹੈ? ਕਿਹੜੇ ਲੋਕ ਬੰਦੋਬਸਤ ਨਾਲ ਜੁੜੇ ਹੋਏ ਹਨ? ਸਮੇਂ ਦੇ ਨਾਲ ਵਿਸ਼ਾ ਕਿਵੇਂ ਬਦਲਦਾ ਹੈ? ਕੌਣ ਕਿਸ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ? ਅਜਿਹੇ ਸਵਾਲਾਂ ਲਈ ਕਿਸੇ ਇੱਕ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਨਹੀਂ, ਸਗੋਂ ਸੈਂਕੜੇ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਇਕੱਠੇ ਦੇਖਣ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਇਸਨੂੰ ਅਕਸਰ ਡਿਜ਼ੀਟਲ ਹਿਊਮੈਨਟੀਜ਼ ਕਿਹਾ ਜਾਂਦਾ ਹੈ—ਇਤਿਹਾਸ ਅਤੇ ਸਾਹਿਤ ਵਰਗੇ ਖੇਤਰਾਂ ਵਿੱਚ ਗਣਨਾਤਮਕ ਤਰੀਕਿਆਂ ਦੀ ਵਰਤੋਂ।
AI ਟੈਕਸਟ ਦੇ ਵੱਡੇ ਸੈੱਟਾਂ ਤੋਂ ਢਾਂਚਾਗਤ ਜਾਣਕਾਰੀ ਕੱਢਣ ਵਿੱਚ ਸ਼ਕਤੀਸ਼ਾਲੀ ਹੈ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਤੁਸੀਂ NER (ਨਾਮ ਵਾਲੀ ਇਕਾਈ ਦੀ ਪਛਾਣ), ਪੈਟਰਨ ਅਤੇ ਰਿਲੇਸ਼ਨਸ਼ਿਪ ਐਕਸਟਰੈਕਸ਼ਨ, ਵਿਸ਼ਾ ਮਾਡਲਿੰਗ ਤਰਕ ਅਤੇ ਸਮਾਂ-ਰੇਖਾ ਬਣਾਉਣ ਬਾਰੇ ਸਿੱਖੋਗੇ; ਪਰ ਅਸੀਂ ਇਹਨਾਂ ਤਕਨੀਕਾਂ ਦੇ ਸਭ ਤੋਂ ਖ਼ਤਰਨਾਕ ਨੁਕਸਾਨ ਬਾਰੇ ਵੀ ਚਰਚਾ ਕਰਾਂਗੇ - AI ਆਪਣੇ ਆਪ ਨੂੰ ਇੱਕ ਪੈਟਰਨ "ਲੱਭਿਆ" ਵਜੋਂ ਪੇਸ਼ ਕਰਦਾ ਹੈ ਜੋ ਮੌਜੂਦ ਨਹੀਂ ਹੈ।
ਬੁਨਿਆਦੀ ਤਕਨੀਕ
- NER (ਨਾਮ ਵਾਲੀ ਇਕਾਈ ਦੀ ਪਛਾਣ): ਲਿਖਤ ਤੋਂ ਵਿਅਕਤੀ, ਸਥਾਨ, ਸੰਸਥਾ, ਮਿਤੀ ਵਰਗੀਆਂ ਸੰਸਥਾਵਾਂ ਦਾ ਆਟੋਮੈਟਿਕ ਐਕਸਟਰੈਕਸ਼ਨ। ਇਹ ਮਿੰਟਾਂ ਵਿੱਚ "ਇਨ੍ਹਾਂ 500 ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਦੱਸੇ ਗਏ ਸਾਰੇ ਸਥਾਨਾਂ ਦੇ ਨਾਮ" ਵਰਗੀ ਇੱਕ ਸੂਚੀ ਤਿਆਰ ਕਰਦਾ ਹੈ।
- ਸਬੰਧਾਂ ਦਾ ਅਨੁਮਾਨ: ਇਕਾਈਆਂ ਦੇ ਵਿਚਕਾਰ ਸਬੰਧਾਂ ਨੂੰ ਚਿੰਨ੍ਹਿਤ ਕਰਨਾ ("Y ਸਥਾਨ 'ਤੇ ਵਿਅਕਤੀ X", "A B ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ")।
- ਵਿਸ਼ਾ ਮਾਡਲਿੰਗ: ਪਾਠ ਦੇ ਇੱਕ ਵੱਡੇ ਸਮੂਹ ਵਿੱਚ ਆਵਰਤੀ ਵਿਸ਼ਿਆਂ ਦੇ ਕਲੱਸਟਰਾਂ ਨੂੰ ਅੰਕੜਾਤਮਕ ਤੌਰ 'ਤੇ ਲੱਭਣਾ। ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਕਿਹੜੇ ਥੀਮ ਕਿਸ ਮਿਆਦ ਵਿੱਚ ਕੇਂਦ੍ਰਿਤ ਹਨ।
- ਸਮਾਂ-ਰੇਖਾ ਦਾ ਅਨੁਮਾਨ: ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਮਿਤੀ ਵਾਲੀਆਂ ਘਟਨਾਵਾਂ ਨੂੰ ਇੱਕ ਕਾਲਕ੍ਰਮਿਕ ਕ੍ਰਮ ਵਿੱਚ ਵਿਵਸਥਿਤ ਕਰਨਾ।
- ਨੈੱਟਵਰਕ ਵਿਸ਼ਲੇਸ਼ਣ: ਇੱਕ ਨੈੱਟਵਰਕ ਦੇ ਰੂਪ ਵਿੱਚ ਅੰਤਰ-ਵਿਅਕਤੀ/ਸੰਸਥਾਗਤ ਸਬੰਧਾਂ ਦੀ ਕਲਪਨਾ ਕਰਨਾ (ਕੌਣ ਕੇਂਦਰ ਹੈ, ਕਨੈਕਸ਼ਨ ਪੁਆਇੰਟ ਕੌਣ ਹੈ)।
ਇਹਨਾਂ ਸਾਰਿਆਂ ਦਾ ਸਾਂਝਾ ਟੀਚਾ ਉਹਨਾਂ ਢਾਂਚਿਆਂ ਨੂੰ ਪ੍ਰਗਟ ਕਰਨਾ ਹੈ ਜੋ ਇੱਕ ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਦਿਖਾਈ ਨਹੀਂ ਦਿੰਦੇ ਪਰ ਪੂਰੇ ਸੰਗ੍ਰਹਿ ਵਿੱਚ ਦਿਖਾਈ ਦਿੰਦੇ ਹਨ। ਇਹ ਤਕਨੀਕਾਂ ਦ੍ਰਿਸ਼ਮਾਨ ਪੈਟਰਨ ਬਣਾਉਂਦੀਆਂ ਹਨ ਜੋ ਇਕੱਲੇ ਪੜ੍ਹਨ ਦੁਆਰਾ ਕਦੇ ਵੀ ਦਿਖਾਈ ਨਹੀਂ ਦਿੰਦੀਆਂ। ਪਰ ਉਹਨਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ "ਨਿਸ਼ਾਨ" ਹੈ, "ਸਬੂਤ" ਨਹੀਂ; ਇਹ ਤਸਦੀਕ ਕਰਨਾ ਜ਼ਰੂਰੀ ਹੈ ਕਿ ਅਸਲ ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਕੀ ਪਾਇਆ ਗਿਆ ਹੈ।
ਇਸ ਖੇਤਰ ਵਿੱਚ ਇੱਕ ਅਕਸਰ ਵਰਤਿਆ ਜਾਣ ਵਾਲਾ ਸੰਕਲਪ ਨਜ਼ਦੀਕੀ ਪਾਠ (ਡੂੰਘਾਈ ਵਿੱਚ ਇੱਕ ਪਾਠ ਨੂੰ ਪੜ੍ਹਨਾ, ਲਾਈਨ ਦੁਆਰਾ ਲਾਈਨ) ਅਤੇ ਦੂਰ ਪੜ੍ਹਨਾ (ਸੈਂਕੜੇ/ਹਜ਼ਾਰਾਂ ਪਾਠਾਂ ਨੂੰ ਸਮੂਹਿਕ ਤੌਰ 'ਤੇ, ਅੰਕੜਿਆਂ ਦੇ ਰੂਪ ਵਿੱਚ ਵੇਖਣਾ) ਵਿਚਕਾਰ ਅੰਤਰ ਹੈ। AI ਰਿਮੋਟਲੀ ਪੜ੍ਹਨਾ ਸੰਭਵ ਬਣਾਉਂਦਾ ਹੈ: ਤੁਸੀਂ ਇੱਕ ਕਾਰਪਸ ਵਿੱਚ ਪੈਟਰਨ ਦੇਖਦੇ ਹੋ ਜੋ ਇੱਕ ਮਨੁੱਖੀ ਜੀਵਨ ਕਾਲ ਤੱਕ ਚੱਲਣ ਲਈ ਕਾਫੀ ਵੱਡਾ ਹੁੰਦਾ ਹੈ। ਪਰ ਜਦੋਂ ਦੂਰ-ਦੁਰਾਡੇ ਦੀ ਰੀਡਿੰਗ ਕਿਸੇ ਪੈਟਰਨ ਵੱਲ ਇਸ਼ਾਰਾ ਕਰਦੀ ਹੈ, ਤਾਂ ਇਸ ਨੂੰ ਸਮਝਣ ਲਈ ਨਜ਼ਦੀਕੀ ਰੀਡਿੰਗ, ਯਾਨੀ ਅਸਲੀ ਦਸਤਾਵੇਜ਼ ਵੱਲ ਵਾਪਸ ਜਾਣਾ ਜ਼ਰੂਰੀ ਹੈ। ਦੋ ਤਰੀਕੇ ਪਰਿਵਰਤਨਯੋਗ ਨਹੀਂ ਹਨ; ਇੱਕ ਪੈਟਰਨ ਦਿਖਾਉਂਦਾ ਹੈ, ਦੂਜਾ ਇਸਦਾ ਅਰਥ ਦਿੰਦਾ ਹੈ. ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਖੋਜ ਦੋਵਾਂ ਨੂੰ ਇਕੱਠੇ ਵਰਤਦੀ ਹੈ।
ਸੰਕੇਤ: ਇੱਕ ਪਰਿਕਲਪਨਾ ਜਨਰੇਟਰ ਵਜੋਂ ਪੈਟਰਨ ਵਿਸ਼ਲੇਸ਼ਣ ਦੀ ਵਰਤੋਂ ਕਰੋ: "ਏਆਈ ਨੇ ਇੱਥੇ ਇੱਕ ਪੈਟਰਨ ਦੇਖਿਆ ਹੈ, ਕੀ ਇਹ ਅਸਲ ਹੈ?" ਫਿਰ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿਚ ਇਕ-ਇਕ ਕਰਕੇ ਉਸ ਪੈਟਰਨ ਦੀ ਜਾਂਚ ਕਰੋ। ਪੈਟਰਨ ਤੁਹਾਡੀ ਖੋਜ ਦਾ ਸ਼ੁਰੂਆਤੀ ਬਿੰਦੂ ਹੈ, ਨਤੀਜਾ ਨਹੀਂ।
ਵਰਕਫਲੋ: ਕਦਮ ਦਰ ਕਦਮ
1. ਸਵਾਲ ਸਪਸ਼ਟ ਕਰੋ। "ਇਸ ਸੰਗ੍ਰਹਿ ਵਿੱਚ ਕਿਹੜੇ ਲੋਕ ਅਕਸਰ ਇਕੱਠੇ ਦਿਖਾਈ ਦਿੰਦੇ ਹਨ?" ਇੱਕ ਸਪਸ਼ਟ ਪੈਟਰਨ ਸਵਾਲ ਵਰਗਾ.
2. ਡਾਟਾ ਤਿਆਰ ਕਰੋ ਅਤੇ ਲੇਬਲ ਕਰੋ। ਸਰੋਤ ਸੰਦਰਭਾਂ ਦੇ ਨਾਲ ਟੈਕਸਟ ਨੂੰ ਵਿਵਸਥਿਤ ਕਰੋ ਤਾਂ ਜੋ ਕੋਈ ਵੀ ਸੰਪੱਤੀ ਲੱਭੀ ਜਾ ਸਕੇ ਜੋ ਦਸਤਾਵੇਜ਼ ਨਾਲ ਵਾਪਸ ਲਿੰਕ ਕੀਤੀ ਜਾ ਸਕੇ।
3. ਇਕਾਈ/ਪੈਟਰਨ ਦਿਸਦਾ ਹੈ। AI ਨਾਲ NER, ਸਬੰਧ ਜਾਂ ਸਮਾਂ-ਰੇਖਾ ਦੀ ਰੂਪਰੇਖਾ ਤਿਆਰ ਕਰੋ।
4. ਆਮ ਕਰੋ. ਇੱਕੋ ਵਿਅਕਤੀ/ਸਥਾਨ (“ਇਸਤਾਂਬੁਲ/ਇਸਤਾਂਬੁਲ/ਕੋਸਟੈਂਟਿਨੀਏ” ਇੱਕੋ ਥਾਂ?) ਦੇ ਵੱਖ-ਵੱਖ ਸ਼ਬਦ-ਜੋੜਾਂ ਨੂੰ ਮਿਲਾਓ। ਇਹ ਕਦਮ ਨਾਜ਼ੁਕ ਹੈ; ਜੇਕਰ ਇਸਨੂੰ ਛੱਡ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਪੈਟਰਨ ਵੱਖ ਹੋ ਜਾਵੇਗਾ।
5. ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਪੁਸ਼ਟੀ ਕਰੋ। ਫਲੈਗ ਕੀਤੇ ਗਏ ਕਿਸੇ ਵੀ ਮਹੱਤਵਪੂਰਨ ਪੈਟਰਨ ਲਈ ਅਸਲ ਦਸਤਾਵੇਜ਼ਾਂ ਦੀ ਜਾਂਚ ਕਰੋ। ਯਕੀਨੀ ਬਣਾਓ ਕਿ AI ਇੱਕ ਬਣਾਇਆ-ਅੱਪ ਲਿੰਕ ਨਹੀਂ ਜੋੜਦਾ ਹੈ।
6. ਟਿੱਪਣੀ. ਪੈਟਰਨ ਦਾ ਕੀ ਅਰਥ ਹੈ ਇਤਿਹਾਸਕਾਰ ਦਾ ਨਿਰਣਾ; AI ਸਿਰਫ਼ ਪੈਟਰਨ ਨੂੰ ਚਿੰਨ੍ਹਿਤ ਕਰਦਾ ਹੈ।
ਸੰਖਿਆ ਅਤੇ ਅੰਕੜਿਆਂ ਦਾ ਜਾਲ
ਪੈਟਰਨ ਵਿਸ਼ਲੇਸ਼ਣ ਅਕਸਰ ਨੰਬਰ ਪੈਦਾ ਕਰਦਾ ਹੈ: "ਨਾਮ X 47 ਵਾਰ ਆਉਂਦਾ ਹੈ", "ਇਹ ਥੀਮ 30% ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਮੌਜੂਦ ਹੈ"। ਇਹ ਨੰਬਰ ਉਦੇਸ਼ਪੂਰਨ ਜਾਪਦੇ ਹਨ ਪਰ ਗੁੰਮਰਾਹਕੁੰਨ ਹੋ ਸਕਦੇ ਹਨ:
- ਗੁੰਮ ਡੇਟਾ: ਜੇਕਰ ਸੰਗ੍ਰਹਿ ਪਹਿਲਾਂ ਹੀ ਅਧੂਰਾ ਹੈ (ਦਸਤਾਵੇਜ਼ ਗੁੰਮ ਹੋ ਗਏ ਹਨ, ਇੱਕ ਸਮੂਹ ਨੂੰ ਕਦੇ ਰਿਕਾਰਡ ਨਹੀਂ ਕੀਤਾ ਗਿਆ ਹੈ), ਤਾਂ ਸੰਖਿਆ ਬਚੇ ਹੋਏ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ, ਅਸਲੀਅਤ ਨਹੀਂ।
- ਸਧਾਰਨਕਰਨ ਗਲਤੀ: ਜੇਕਰ ਇੱਕੋ ਵਿਅਕਤੀ ਦੀ ਸਪੈਲਿੰਗ ਵੱਖਰੀ ਹੈ ਅਤੇ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਗਿਣੀ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਨੰਬਰ ਗਲਤ ਹੋਵੇਗਾ।
- ਸੰਦਰਭ ਦਾ ਨੁਕਸਾਨ: "47 ਵਾਰ ਵਾਪਰਦਾ ਹੈ" ਕੁਝ ਨਹੀਂ ਕਹਿੰਦਾ; ਇਹ ਕਿਵੇਂ ਪਾਸ ਕੀਤਾ ਜਾਂਦਾ ਹੈ (ਸਕਾਰਾਤਮਕ/ਨਕਾਰਾਤਮਕ, ਵਿਸ਼ਾ/ਵਸਤੂ) ਮਹੱਤਵਪੂਰਨ ਹੈ।
ਪੈਟਰਨ ਆਉਟਪੁੱਟ
ਸਪੱਸ਼ਟ ਅਰਥ
ਅਸਲ ਜੋਖਮ
"X 47 ਵਾਰ ਆਉਂਦਾ ਹੈ"
ਮਹੱਤਵਪੂਰਨ ਵਿਅਕਤੀ
ਅਧੂਰਾ ਸੰਗ੍ਰਹਿ, ਸਪੈਲਿੰਗ ਭਿੰਨਤਾ
"ਥੀਮ 30%"
ਪ੍ਰਮੁੱਖ ਵਿਸ਼ਾ
ਨਮੂਨਾ ਪੱਖਪਾਤ
"ਏ-ਬੀ ਅਕਸਰ ਇਕੱਠੇ"
ਗੂੜ੍ਹਾ ਰਿਸ਼ਤਾ
ਸੰਜੋਗ, ਗੁੰਮ ਪ੍ਰਸੰਗ
"ਟਾਈਮਲਾਈਨ"
ਸਹੀ ਕਾਲਕ੍ਰਮ
ਪੁਰਾਣੇ ਦਸਤਾਵੇਜ਼, ਮਨਘੜਤ ਆਰਡਰ
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 - ਨੈੱਟਵਰਕ ਵਿਸ਼ਲੇਸ਼ਣ ਨੇ ਇੱਕ ਲੁਕਵੇਂ ਵਿਚੋਲੇ ਦਾ ਖੁਲਾਸਾ ਕੀਤਾ। ਇੱਕ ਖੋਜਕਰਤਾ ਨੇ 800 ਪੱਤਰਾਂ ਦੇ ਇੱਕ ਪੱਤਰ ਸੰਗ੍ਰਹਿ ਦੀ ਜਾਂਚ ਕੀਤੀ। ਏਆਈ ਦੇ ਨਾਲ, ਕਿਸ ਨੇ ਕਿਸ ਨੂੰ ਲਿਖਿਆ ਸੀ ਇਹ ਨਿਰਧਾਰਤ ਕੀਤਾ ਗਿਆ ਸੀ ਅਤੇ ਇੱਕ ਨੈਟਵਰਕ ਬਣਾਇਆ ਗਿਆ ਸੀ. ਨੈਟਵਰਕ ਨੇ ਦਿਖਾਇਆ ਕਿ ਪਹਿਲੀ ਨਜ਼ਰ ਵਿੱਚ ਇੱਕ ਮਾਮੂਲੀ ਜਿਹਾ ਵਿਅਕਤੀ ਅਸਲ ਵਿੱਚ ਦੋ ਸਮੂਹਾਂ ਵਿਚਕਾਰ ਸੰਪਰਕ ਦਾ ਮੁੱਖ ਬਿੰਦੂ ਸੀ। ਖੋਜਕਰਤਾ ਨੇ ਇਸ ਵਿਅਕਤੀ ਦੇ ਪੱਤਰਾਂ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕੀਤਾ ਅਤੇ ਇੱਕ ਨਵੀਂ ਖੋਜ 'ਤੇ ਪਹੁੰਚਿਆ। ਪਰ ਪਹਿਲਾਂ ਦਸਤਾਵੇਜ਼ਾਂ ਦੇ ਸਾਰੇ ਲਿੰਕਾਂ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ.
ਕੇਸ 2 - ਸਧਾਰਣਕਰਨ ਗਲਤੀ ਨੇ ਨੰਬਰ ਨੂੰ ਖਰਾਬ ਕਰ ਦਿੱਤਾ। ਇੱਕ ਵਿਦਿਆਰਥੀ ਨੇ ਉਹਨਾਂ ਨੂੰ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਇੱਕ ਸਥਾਨ ਦੀ ਗਿਣਤੀ ਦੀ ਗਿਣਤੀ ਕਰਨ ਲਈ ਕਿਹਾ। ਕਿਉਂਕਿ AI ਨੇ ਇੱਕੋ ਥਾਂ ਦੇ ਤਿੰਨ ਵੱਖ-ਵੱਖ ਸਪੈਲਿੰਗਾਂ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਗਿਣਿਆ ਹੈ, ਸੰਖਿਆ ਅਸਲ ਸੰਖਿਆ ਦਾ ਇੱਕ ਤਿਹਾਈ ਨਿਕਲੀ ਹੈ। ਜਦੋਂ ਸ਼ਬਦ-ਜੋੜਾਂ ਨੂੰ ਜੋੜਿਆ ਗਿਆ ਸੀ, ਸਥਾਨ ਅਸਲ ਵਿੱਚ ਤੀਜੀ ਸਭ ਤੋਂ ਵੱਧ ਅਕਸਰ ਹੋਣ ਵਾਲੀ ਸਥਿਤੀ ਵਿੱਚ ਸੀ। ਸਬਕ: ਸਧਾਰਣਕਰਨ ਤੋਂ ਬਿਨਾਂ ਨੰਬਰ 'ਤੇ ਭਰੋਸਾ ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ।
ਕੇਸ 3 — ਮੇਡ-ਅੱਪ ਟਾਈਮਲਾਈਨ। ਇੱਕ ਖੋਜਕਰਤਾ ਨੇ ਅਣਗਿਣਤ ਦਸਤਾਵੇਜ਼ਾਂ ਤੋਂ ਇੱਕ ਸਮਾਂਰੇਖਾ ਬਣਾਈ ਹੈ। AI ਨੇ ਅਣਜਾਣ ਘਟਨਾਵਾਂ ਨੂੰ "ਤਰਕਪੂਰਨ" ਕ੍ਰਮ ਵਿੱਚ ਵਿਵਸਥਿਤ ਕੀਤਾ ਅਤੇ ਇੱਕ ਸਟੀਕ ਕਾਲਕ੍ਰਮ ਪੇਸ਼ ਕੀਤਾ। ਹਾਲਾਂਕਿ, ਇਹ ਕ੍ਰਮ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਨਹੀਂ ਸੀ, AI ਨੇ ਇਸਨੂੰ ਬਣਾਇਆ ਸੀ। ਪਾਠ: ਸਮਾਂਰੇਖਾ ਸਿਰਫ਼ ਉਹਨਾਂ ਘਟਨਾਵਾਂ ਤੋਂ ਬਣਾਈ ਜਾਂਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ਦੀ ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਇੱਕ ਤਾਰੀਖ ਹੁੰਦੀ ਹੈ; ਬਾਕੀ "ਅਣਮਿਤ" ਰਹਿੰਦਾ ਹੈ।
ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ
1) NER (ਹਸਤੀ ਦਾ ਅਨੁਮਾਨ):
ਹੇਠਾਂ ਦਿੱਤੇ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਦੱਸੇ ਗਏ ਵਿਅਕਤੀ, ਸਥਾਨ, ਸੰਸਥਾਵਾਂ ਅਤੇ ਮਿਤੀਆਂ ਵੱਖਰੀਆਂ ਸੂਚੀਆਂ ਦੇ ਰੂਪ ਵਿੱਚ ਦਿਖਾਈ ਦਿੰਦੀਆਂ ਹਨ। ਦੱਸੋ ਕਿ ਕਿਸ ਦਸਤਾਵੇਜ਼ (ਹਵਾਲਾ) ਵਿੱਚ ਹਰੇਕ ਇਕਾਈ ਦਾ ਜ਼ਿਕਰ ਕੀਤਾ ਗਿਆ ਹੈ। ਸਿਰਫ਼ ਉਹੀ ਲਓ ਜੋ ਟੈਕਸਟ ਵਿੱਚ ਸਪਸ਼ਟ ਤੌਰ 'ਤੇ ਕਿਹਾ ਗਿਆ ਹੈ; ਅੰਦਾਜ਼ਾ ਲਗਾ ਕੇ ਜੋੜੋ। ਜੇਕਰ ਤੁਸੀਂ ਉਚਾਰਨ ਬਾਰੇ ਯਕੀਨੀ ਨਹੀਂ ਹੋ ਤਾਂ [?] ਮਾਰਕ ਕਰੋ। ਦਸਤਾਵੇਜ਼: [ਇੱਥੇ]
2) ਇਕਾਈ ਦਾ ਸਧਾਰਣਕਰਨ:
ਹੇਠਾਂ ਦਿੱਤੀ ਇਕਾਈ ਸੂਚੀ ਵਿੱਚ, ਵੱਖ-ਵੱਖ ਸ਼ਬਦ-ਜੋੜਾਂ ਦਾ ਸਮੂਹ ਕਰੋ ਜੋ ਇੱਕੋ ਵਿਅਕਤੀ/ਸਥਾਨ ਦੇ ਹੋ ਸਕਦੇ ਹਨ (ਉਦਾਹਰਨ ਲਈ "ਇਸਤਾਂਬੁਲ / ਕੋਸਟੈਂਟਿਨੀਏ")। ਹਰੇਕ ਸਮੂਹ ਲਈ ਸੰਭਾਵੀ ਸਾਂਝੇ ਫਾਰਮੈਟ ਦਾ ਸੁਝਾਅ ਦਿਓ ਪਰ ਸਹੀ ਸੁਮੇਲ ਨਾ ਲਗਾਓ; ਨੋਟ ਸ਼ਾਮਲ ਕਰੋ "ਸ਼ਾਇਦ ਉਹੀ, ਲੋਕਾਂ ਨੂੰ ਤਸਦੀਕ ਕਰਨ ਦਿਓ"। ਜੇ ਤੁਹਾਨੂੰ ਯਕੀਨ ਨਹੀਂ ਹੈ ਤਾਂ ਇਸ ਨੂੰ ਛੱਡ ਦਿਓ। ਸੂਚੀ: [ਇੱਥੇ]
3) ਸਬੰਧ/ਨੈੱਟਵਰਕ ਰੂਪਰੇਖਾ:
ਹੇਠਾਂ ਦਿੱਤੇ ਪੱਤਰ-ਵਿਹਾਰ/ਦਸਤਾਵੇਜ਼ਾਂ ਦੇ ਸਮੂਹ ਵਿੱਚੋਂ "ਕੌਣ ਕਿਸ ਨਾਲ ਸਬੰਧਤ ਹੈ" ਲਿੰਕਾਂ ਨੂੰ ਐਕਸਟਰੈਕਟ ਕਰੋ। ਹਰੇਕ ਲਿੰਕ ਲਈ, ਦੱਸੋ ਕਿ ਇਹ ਕਿਸ ਦਸਤਾਵੇਜ਼ (ਹਵਾਲੇ) 'ਤੇ ਆਧਾਰਿਤ ਹੈ। ਇੱਕ ਅਜਿਹਾ ਰਿਸ਼ਤਾ ਬਣਾਇਆ ਜੋ ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਸਪੱਸ਼ਟ ਨਹੀਂ ਹੈ। ਅਸਪਸ਼ਟ ਲਿੰਕ [ਅਸਪਸ਼ਟ] ਮਾਰਕ ਕਰੋ। ਦਸਤਾਵੇਜ਼: [ਇੱਥੇ]
4) ਮਿਤੀ ਟਾਈਮਲਾਈਨ:
ਕਾਲਕ੍ਰਮਿਕ ਕ੍ਰਮ ਵਿੱਚ ਸਿਰਫ ਉਹਨਾਂ ਘਟਨਾਵਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ ਜੋ ਹੇਠਾਂ ਦਿੱਤੇ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਸਪਸ਼ਟ ਤੌਰ 'ਤੇ ਦੱਸੇ ਗਏ ਹਨ; ਹਰ ਘਟਨਾ ਨੂੰ ਇਸਦੇ ਸਰੋਤ ਨਾਲ ਲਿੰਕ ਕਰੋ। "ਅਨਡੇਟਿਡ" ਸਿਰਲੇਖ ਹੇਠ ਅਨਿਸ਼ਚਿਤ ਮਿਤੀਆਂ ਵਾਲੀਆਂ ਘਟਨਾਵਾਂ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਸੂਚੀਬੱਧ ਕਰੋ, ਉਹਨਾਂ ਨੂੰ ਕ੍ਰਮ ਵਿੱਚ ਨਾ ਰੱਖੋ। ਅਨੁਮਾਨਿਤ ਮਿਤੀ ਨੂੰ ਨਾ ਬਣਾਓ। ਦਸਤਾਵੇਜ਼: [ਇੱਥੇ]
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ:
ਇਹਨਾਂ ਦਸਤਾਵੇਜ਼ਾਂ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰੋ ਅਤੇ ਮਹੱਤਵਪੂਰਨ ਪੈਟਰਨ, ਸਬੰਧਾਂ ਅਤੇ ਸਮਾਂ-ਸੀਮਾਵਾਂ ਨੂੰ ਐਕਸਟਰੈਕਟ ਕਰੋ।
"ਮਹੱਤਵਪੂਰਨ ਪੈਟਰਨਾਂ ਨੂੰ ਐਕਸਟਰੈਕਟ ਕਰੋ" AI ਨੂੰ ਗੈਰ-ਮੌਜੂਦ ਕਨੈਕਸ਼ਨਾਂ ਅਤੇ ਸਟੀਕ ਕਾਲਕ੍ਰਮਾਂ ਦੀ ਖੋਜ ਕਰਨ ਲਈ ਧੱਕਦਾ ਹੈ, ਬਿਨਾਂ ਸਧਾਰਣਕਰਨ ਦੇ ਸੰਖਿਆਵਾਂ ਨੂੰ ਪੇਸ਼ ਕਰਦਾ ਹੈ।
ਮਜ਼ਬੂਤ:
ਹਰੇਕ ਨੂੰ ਦਸਤਾਵੇਜ਼ ਸੰਦਰਭ ਨਾਲ ਜੋੜ ਕੇ ਹੇਠਾਂ ਦਿੱਤੇ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚੋਂ ਵਿਅਕਤੀ/ਸਥਾਨ/ਸੰਸਥਾ ਦੀਆਂ ਸੰਸਥਾਵਾਂ ਨੂੰ ਕੱਢਦਾ ਹੈ। ਵੱਖ-ਵੱਖ ਸ਼ਬਦ-ਜੋੜਾਂ ਦੀ ਨਿਸ਼ਾਨਦੇਹੀ ਕਰੋ ਜੋ ਕਿ "ਅਭੇਦ ਹੋ ਸਕਦੇ ਹਨ" ਦੇ ਸਮਾਨ ਹੋ ਸਕਦੇ ਹਨ, ਪਰ ਅਭੇਦ ਨਾ ਕਰੋ। ਉਹ ਰਿਸ਼ਤੇ ਜੋ ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਸਪਸ਼ਟ ਤੌਰ 'ਤੇ ਨਹੀਂ ਦੱਸੇ ਗਏ ਹਨ ਅਤੇ ਅਨਿਸ਼ਚਿਤ ਮਿਤੀਆਂ ਵਾਲੀਆਂ ਘਟਨਾਵਾਂ ਜਾਅਲੀ ਨਹੀਂ ਹਨ; ਮਿਤੀਆਂ ਤੋਂ ਬਿਨਾਂ ਉਹਨਾਂ ਨੂੰ ਵੱਖ ਰੱਖੋ। ਦਸਤਾਵੇਜ਼: [ਇੱਥੇ]
ਅੰਤਰ: ਸਰੋਤ ਨੂੰ ਵਿਸ਼ੇਸ਼ਤਾ, ਮਨੁੱਖਾਂ ਲਈ ਸਧਾਰਣਕਰਨ ਨੂੰ ਛੱਡਣਾ, ਫਰਜ਼ੀ ਸਬੰਧਾਂ/ਇਤਿਹਾਸ 'ਤੇ ਪਾਬੰਦੀ, ਅਤੇ ਅਣਗਿਣਤ ਘਟਨਾਵਾਂ ਨੂੰ ਵੱਖ ਕਰਨਾ ਪੈਟਰਨ ਨੂੰ ਬਚਾਅ ਯੋਗ ਬਣਾਉਂਦੇ ਹਨ।
ਆਮ ਗਲਤੀਆਂ
- ਸਬੂਤ ਲਈ ਪੈਟਰਨ ਨੂੰ ਗਲਤ. ਪੈਟਰਨ ਕਲਪਨਾ ਹੈ; ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਪ੍ਰਮਾਣਿਤ ਹੈ।
- ਸਧਾਰਣਕਰਨ ਨੂੰ ਛੱਡਣਾ। ਇੱਕੋ ਇਕਾਈ ਦੇ ਵੱਖੋ-ਵੱਖ ਸਪੈਲਿੰਗ ਨੰਬਰ ਅਤੇ ਨੈੱਟਵਰਕ ਨੂੰ ਵਿਗਾੜਦੇ ਹਨ।
- ਸੰਖਿਆ 'ਤੇ ਅੰਨ੍ਹਾ ਭਰੋਸਾ। ਅਧੂਰਾ ਸੰਗ੍ਰਹਿ ਅਤੇ ਸੈਂਪਲਿੰਗ ਪੱਖਪਾਤ ਨੰਬਰ ਨੂੰ ਗੁੰਮਰਾਹਕੁੰਨ ਬਣਾਉਂਦੇ ਹਨ।
- ਬਣਾਈ ਗਈ ਸਮਾਂਰੇਖਾ। ਅਣਡਿੱਠੀਆਂ ਘਟਨਾਵਾਂ ਕਾਲਕ੍ਰਮ ਵਿੱਚ ਸ਼ਾਮਲ ਨਹੀਂ ਹਨ।
- ਪ੍ਰਸੰਗ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ। ਇਹ "ਇਹ ਕਿੰਨੀ ਵਾਰ ਪਾਸ ਹੋਇਆ" ਨਹੀਂ ਹੈ, ਪਰ "ਇਹ ਕਿਵੇਂ ਪਾਸ ਹੋਇਆ" ਇਹ ਮਹੱਤਵਪੂਰਨ ਹੈ।
ਸਾਰੰਸ਼ ਵਿੱਚ
ਸਮਗਰੀ ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਪੈਟਰਨ ਖੋਜ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਖੇਤਰ ਹੈ ਜਿੱਥੇ AI ਦ੍ਰਿਸ਼ਮਾਨ ਢਾਂਚਾ ਬਣਾਉਂਦਾ ਹੈ ਜੋ ਇਕੱਲੇ ਪੜ੍ਹਨ ਦੁਆਰਾ ਦਿਖਾਈ ਨਹੀਂ ਦੇਵੇਗਾ: ਇਕਾਈ ਐਕਸਟਰੈਕਸ਼ਨ, ਰਿਲੇਸ਼ਨਸ਼ਿਪ ਨੈਟਵਰਕ, ਵਿਸ਼ਾ ਕਲੱਸਟਰ, ਟਾਈਮਲਾਈਨਾਂ। ਪਰ ਹਰ ਪੈਟਰਨ ਇੱਕ ਪਰਿਕਲਪਨਾ ਹੈ, ਸਬੂਤ ਨਹੀਂ। ਸਰੋਤ ਨਾਲ ਸੰਪਤੀਆਂ ਨੂੰ ਲਿੰਕ ਕਰੋ, ਸਾਵਧਾਨੀ ਨਾਲ ਅਤੇ ਮਨੁੱਖੀ ਪ੍ਰਮਾਣਿਕਤਾ ਦੇ ਨਾਲ ਸਧਾਰਣ ਕਰੋ, ਗੁੰਮ ਹੋਏ ਡੇਟਾ ਅਤੇ ਪੱਖਪਾਤ ਲਈ ਪੁੱਛਗਿੱਛ ਨੰਬਰ, ਵਿਵਾਦਿਤ ਸਬੰਧਾਂ ਅਤੇ ਕ੍ਰਮ-ਕ੍ਰਮ ਤੋਂ ਬਚੋ। AI ਪੈਟਰਨ ਨੂੰ ਚਿੰਨ੍ਹਿਤ ਕਰਦਾ ਹੈ; ਇਸਦਾ ਕੀ ਅਰਥ ਹੈ ਅਤੇ ਕੀ ਇਹ ਸੱਚ ਹੈ ਇਹ ਇਤਿਹਾਸਕਾਰ ਦਾ ਨਿਰਣਾ ਹੈ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਦਸਤਾਵੇਜ਼ਾਂ ਦੇ ਘੱਟੋ-ਘੱਟ 15 ਟੁਕੜੇ ਇਕੱਠੇ ਕਰੋ (ਹਵਾਲੇ ਦੇ ਨਾਲ)। "NER" ਟੈਂਪਲੇਟ ਨਾਲ ਵਿਅਕਤੀ ਅਤੇ ਸਥਾਨਾਂ ਨੂੰ ਐਕਸਟਰੈਕਟ ਕਰੋ। ਫਿਰ ਵੱਖ-ਵੱਖ ਸਪੈਲਿੰਗਾਂ ਨੂੰ "ਹਸਤੀ ਸਧਾਰਣਕਰਨ" ਨਾਲ ਸਮੂਹ ਕਰੋ ਅਤੇ ਸਮੂਹਾਂ ਦੀ ਖੁਦ ਪੁਸ਼ਟੀ ਕਰੋ। ਅੰਤ ਵਿੱਚ, "ਡੇਟਡ ਟਾਈਮਲਾਈਨ" ਟੈਮਪਲੇਟ ਚਲਾਓ ਅਤੇ ਵੇਖੋ ਕਿ ਕਿੰਨੇ ਇਵੈਂਟ "ਅਨਡੇਟ" ਰਹਿੰਦੇ ਹਨ। ਤੁਲਨਾ ਕਰੋ ਕਿ ਕਿੰਨੇ ਮਨਘੜਤ ਲਿੰਕ ਜਾਂ ਕ੍ਰੋਨੋਲੋਜੀ ਮਾੜੀ ਪ੍ਰੋਂਪਟਿੰਗ ਨਾਲ AI ਪੈਦਾ ਕਰੇਗੀ।
ਚੈੱਕਲਿਸਟ
- [ ] ਮੈਂ ਆਪਣੇ ਪੈਟਰਨ ਸਵਾਲ ਨੂੰ ਸਪਸ਼ਟ ਰੂਪ ਵਿੱਚ ਪਰਿਭਾਸ਼ਿਤ ਕੀਤਾ ਹੈ।
- [ ] ਮੇਰੇ ਕੋਲ ਹਰੇਕ ਇਕਾਈ ਨੂੰ ਦਸਤਾਵੇਜ਼ ਸੰਦਰਭ ਨਾਲ ਲਿੰਕ ਕੀਤਾ ਹੋਇਆ ਹੈ।
- [ ] ਮੈਂ ਇਕਾਈ ਟਾਈਪਿੰਗ ਨੂੰ ਆਮ ਬਣਾਇਆ ਹੈ ਅਤੇ ਇਸਨੂੰ ਮਨੁੱਖੀ ਪ੍ਰਵਾਨਗੀ ਨਾਲ ਜੋੜਿਆ ਹੈ।
- [ ] ਮੈਂ ਗੁੰਮ ਹੋਏ ਡੇਟਾ ਅਤੇ ਪੱਖਪਾਤ ਲਈ ਨੰਬਰਾਂ 'ਤੇ ਸਵਾਲ ਕੀਤਾ।
- [] ਮੈਂ ਅਣਗਿਣਤ ਘਟਨਾਵਾਂ ਨੂੰ ਕਾਲਕ੍ਰਮ ਵਿੱਚ ਨਹੀਂ ਪਾਇਆ, ਮੈਂ ਉਹਨਾਂ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਰੱਖਿਆ ਹੈ।