ਲਾਭ:
- ਹਾਈਬ੍ਰਿਡ ਖੋਜ ਨੂੰ ਲਾਗੂ ਕਰਨਾ ਜੋ ਟੌਪ-ਕੇ ਚੋਣ ਅਤੇ ਅਰਥ ਅਤੇ ਕੀਵਰਡ ਖੋਜ ਨੂੰ ਜੋੜਦਾ ਹੈ
- ਰੀ-ਰੈਂਕਿੰਗ ਦੇ ਨਾਲ ਪਹਿਲੀ ਖੋਜ ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ ਵਧਾਉਣਾ
- ਪੁੱਛਗਿੱਛ ਪਰਿਵਰਤਨ ਅਤੇ HyDE ਵਰਗੀਆਂ ਤਕਨੀਕਾਂ ਨਾਲ ਮੁਸ਼ਕਲ ਸਵਾਲਾਂ ਨੂੰ ਵਧੇਰੇ ਖੋਜਯੋਗ ਬਣਾਉਣਾ
ਤੁਸੀਂ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਚੰਗੀ ਤਰ੍ਹਾਂ ਕੱਟਿਆ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਵੈਕਟਰ ਡੇਟਾਬੇਸ ਵਿੱਚ ਪਾ ਦਿੱਤਾ ਹੈ। ਹੁਣ ਅਸਲ ਕੰਮ: ਜਦੋਂ ਉਪਭੋਗਤਾ ਕੋਈ ਸਵਾਲ ਪੁੱਛਦਾ ਹੈ ਤਾਂ ਸਹੀ ਟੁਕੜਿਆਂ ਨੂੰ ਪ੍ਰਾਪਤ ਕਰਨਾ। ਇਸ ਨੂੰ ਮੁੜ ਪ੍ਰਾਪਤੀ ਕਿਹਾ ਜਾਂਦਾ ਹੈ ਅਤੇ ਇਹ RAG ਗੁਣਵੱਤਾ ਦੀ ਰੀੜ੍ਹ ਦੀ ਹੱਡੀ ਹੈ। ਵਾਕੰਸ਼ ਨੂੰ ਯਾਦ ਰੱਖੋ "ਪ੍ਰਾਪਤ ਗੁਣਵੱਤਾ = RAG ਗੁਣਵੱਤਾ"; ਇਹ ਇਕਾਈ ਬਿਲਕੁਲ ਉਸ ਗੁਣ ਨੂੰ ਸੁਧਾਰਨ ਦੀ ਕਲਾ ਹੈ। ਅਸੀਂ ਟੌਪ-ਕੇ ਚੋਣ ਤੋਂ ਲੈ ਕੇ ਹਾਈਬ੍ਰਿਡ ਖੋਜ ਤੱਕ, ਰੀ-ਰੈਂਕਿੰਗ ਤੋਂ ਪੁੱਛਗਿੱਛ ਤਬਦੀਲੀ ਤੱਕ ਵਿਹਾਰਕ ਤਕਨੀਕਾਂ ਨੂੰ ਕਵਰ ਕਰਾਂਗੇ।
ਟੌਪ-ਕੇ: ਅਸੀਂ ਕਿੰਨੇ ਟੁਕੜੇ ਲਿਆਵਾਂਗੇ?
ਸਭ ਤੋਂ ਬੁਨਿਆਦੀ ਸੈਟਿੰਗ: ਖੋਜ ਤੋਂ ਕਿੰਨੇ ਟੁਕੜੇ (k) ਵਾਪਸ ਕਰਨੇ ਹਨ। ਜੇਕਰ ਤੁਸੀਂ ਘੱਟ (k=1) ਲਿਆਉਂਦੇ ਹੋ ਤਾਂ ਸਹੀ ਟੁਕੜੇ ਦੇ ਗੁੰਮ ਹੋਣ ਦਾ ਵਧੇਰੇ ਜੋਖਮ ਹੁੰਦਾ ਹੈ; ਜੇਕਰ ਤੁਸੀਂ ਬਹੁਤ ਜ਼ਿਆਦਾ (k=20) ਜੋੜਦੇ ਹੋ, ਤਾਂ ਇਹ ਮਾਡਲ ਵਿੱਚ ਰੌਲਾ ਪਾਵੇਗਾ ਅਤੇ ਟੋਕਨ ਦੀ ਲਾਗਤ ਵਧ ਜਾਵੇਗੀ।
ਦੋ ਧਾਰਨਾਵਾਂ ਵਿਚਕਾਰ ਫਰਕ ਕਰੋ। ਯਾਦ ਕਰੋ: ਉਹ ਦਰ ਜਿਸ 'ਤੇ ਸਹੀ ਟੁਕੜਾ ਮੁੜ ਪ੍ਰਾਪਤ ਕਰਨ ਵਾਲਿਆਂ ਵਿੱਚੋਂ ਹੈ। ਸ਼ੁੱਧਤਾ: ਉਹ ਦਰ ਜਿਸ 'ਤੇ ਕੀ ਪ੍ਰਾਪਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਉਹ ਸੰਬੰਧਿਤ ਹੈ। k ਨੂੰ ਵਧਾਉਣ ਨਾਲ ਰੀਕਾਲ ਵਧਦਾ ਹੈ ਪਰ ਸ਼ੁੱਧਤਾ ਘਟਦੀ ਹੈ। ਟੀਚਾ ਦੋਵਾਂ ਨੂੰ ਸੰਤੁਲਿਤ ਕਰਨਾ ਹੈ.
ਸਿਖਰ-ਕੇ
ਪ੍ਰਭਾਵ
ਅਨੁਕੂਲ ਸਥਿਤੀ
1-3
ਉੱਚ ਸ਼ੁੱਧਤਾ, ਖੁੰਝਣ ਦਾ ਜੋਖਮ
ਸਧਾਰਨ, ਇੱਕ-ਜਵਾਬ ਵਾਲੇ ਸਵਾਲ
4-8
ਸੰਤੁਲਨ; ਜ਼ਿਆਦਾਤਰ ਦ੍ਰਿਸ਼
ਜਨਰਲ ਕਾਰਪੋਰੇਟ RAG
10-20
ਜ਼ਿਆਦਾ ਯਾਦ, ਰੌਲਾ ਵਧਦਾ ਹੈ
ਮੁੜ ਦਰਜਾਬੰਦੀ ਦੇ ਨਾਲ (ਹੇਠਾਂ)
ਸੰਕੇਤ: ਆਮ ਅਤੇ ਸ਼ਕਤੀਸ਼ਾਲੀ ਪੈਟਰਨ: ਪ੍ਰਾਪਤ ਕਰੋ ਚੌੜਾ (k=20), ਫਿਰ ਮੁੜ-ਰੈਂਕਿੰਗ (ਚੋਟੀ 4) ਨਾਲ ਤੰਗ। ਇਸ ਤਰ੍ਹਾਂ ਤੁਸੀਂ ਕੁਝ ਵੀ ਨਹੀਂ ਗੁਆਓਗੇ ਅਤੇ ਤੁਸੀਂ ਮਾਡਲ ਨੂੰ ਸਾਫ਼ ਸੰਦਰਭ ਦਿੰਦੇ ਹੋ।
ਹਾਈਬ੍ਰਿਡ ਖੋਜ: ਦੋ ਖੋਜਾਂ ਦੀ ਸ਼ਕਤੀ
ਸਿਮੈਂਟਿਕ (ਵੈਕਟਰ) ਖੋਜ ਅਰਥ ਨੂੰ ਹਾਸਲ ਕਰਦੀ ਹੈ ਪਰ ਚੀਜ਼ਾਂ ਨੂੰ ਖੁੰਝਾਉਂਦੀ ਹੈ: ਪੂਰਾ ਉਤਪਾਦ ਕੋਡ ("XR-4471"), ਦੁਰਲੱਭ ਸੰਖੇਪ, ਸਹੀ ਨਾਮ, ਸੰਸਕਰਣ ਨੰਬਰ। ਇਹਨਾਂ ਸਹੀ-ਮੇਲ ਵਾਲੇ ਕੰਮਾਂ ਲਈ, ਪੁਰਾਣੇ-ਸਕੂਲ ਕੀਵਰਡ ਖੋਜ-ਖਾਸ ਕਰਕੇ ਕਲਾਸਿਕ ਐਲਗੋਰਿਦਮ ਜਿਸਨੂੰ BM25 ਕਿਹਾ ਜਾਂਦਾ ਹੈ-ਬਹੁਤ ਵਧੀਆ ਹੈ।
Hybrid search combines the two: both semantic and keyword searches work, combining the results. ਇਸ ਤਰ੍ਹਾਂ, ਇੱਕ ਸਵਾਲ ਵਿੱਚ ਜਿਵੇਂ ਕਿ "ਵਾਰੰਟੀ ਦੀ ਮਿਆਦ
ਮਿਲਾਨ ਆਮ ਤੌਰ 'ਤੇ RRF (ਰਿਸੀਪ੍ਰੋਕਲ ਰੈਂਕ ਫਿਊਜ਼ਨ) ਨਾਲ ਕੀਤਾ ਜਾਂਦਾ ਹੈ: ਦੋਵੇਂ ਸੂਚੀਆਂ ਵਿੱਚ ਉੱਚਾ ਟ੍ਰੈਕ ਅੱਗੇ ਆਉਂਦਾ ਹੈ।
# ਹਾਈਬ੍ਰਿਡ ਮੁੜ ਪ੍ਰਾਪਤੀ (ਸੰਕਲਪਿਕ)sem = ਵੈਕਟਰ_ਖੋਜ(ਸਵਾਲ, k=20) # meaningkey = bm25_search(ਸਵਾਲ, k=20) # fullwordresult = rrf_merge(sem, key)[:8] # ਦੋਨਾਂ ਨੂੰ ਫਿਊਜ਼ ਕਰੋ, ਸਿਖਰ 8
ਮੁੜ ਦਰਜਾਬੰਦੀ: ਦੂਜਾ ਅਤੇ ਚੁਸਤ ਪਾਸ
ਪਹਿਲੀ ਕਾਲ ਤੇਜ਼ ਪਰ ਬੇਈਮਾਨ ਹੋ ਸਕਦੀ ਹੈ। ਰੀ-ਰੈਂਕਿੰਗ ਸਕੋਰ ਪਹਿਲੀ ਖੋਜ ਦੁਆਰਾ ਇੱਕ-ਇੱਕ ਕਰਕੇ ਵਾਪਸ ਆਏ ਉਮੀਦਵਾਰਾਂ ਨੂੰ ਵਧੇਰੇ ਸ਼ਕਤੀਸ਼ਾਲੀ ਮਾਡਲ (ਆਮ ਤੌਰ 'ਤੇ ਇੱਕ ਕਰਾਸ-ਏਨਕੋਡਰ — ਇੱਕ ਮਾਡਲ ਜੋ ਪ੍ਰਸ਼ਨ ਅਤੇ ਬੀਤਣ ਨੂੰ ਇਕੱਠੇ ਪੜ੍ਹਦਾ ਹੈ ਅਤੇ ਪ੍ਰਸੰਗਿਕਤਾ ਨੂੰ ਸਕੋਰ ਕਰਦਾ ਹੈ) ਅਤੇ ਸਭ ਤੋਂ ਢੁੱਕਵੇਂ ਵਿਅਕਤੀਆਂ ਨੂੰ ਸਿਖਰ 'ਤੇ ਲੈ ਜਾਂਦਾ ਹੈ।
ਤਰਕ ਇਹ ਹੈ: ਪਹਿਲੀ ਖੋਜ ਰੀਕਾਲ (20 ਉਮੀਦਵਾਰ) ਲਈ ਵੱਡੀ ਗਿਣਤੀ ਵਿੱਚ ਉਮੀਦਵਾਰਾਂ ਨੂੰ ਨਿਰਧਾਰਤ ਕਰਦੀ ਹੈ, ਮੁੜ-ਰੈਂਕਰ ਸ਼ੁੱਧਤਾ ਲਈ ਸਭ ਤੋਂ ਵਧੀਆ 4 ਦੀ ਚੋਣ ਕਰਦਾ ਹੈ। ਇਹ ਦੋ-ਪੜਾਅ ਦੀ ਪਹੁੰਚ ਇੱਕ ਸਿੰਗਲ-ਪੜਾਅ ਦੀ ਖੋਜ ਨਾਲੋਂ ਬਹੁਤ ਜ਼ਿਆਦਾ ਸਹੀ ਹੈ। ਇਸ ਵਿੱਚ ਕੁਝ ਦੇਰੀ ਅਤੇ ਵਾਧੂ ਪ੍ਰੋਸੈਸਿੰਗ ਦੀ ਲਾਗਤ ਹੁੰਦੀ ਹੈ; ਲਾਭ ਗੁਣਵੱਤਾ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਵਾਧਾ ਹੈ.
# ਦੋ-ਪੜਾਅ ਦੀ ਪ੍ਰਾਪਤੀ (ਸੰਕਲਪਿਕ) ਉਮੀਦਵਾਰ = ਹਾਈਬ੍ਰਿਡ_ਖੋਜ (ਸਵਾਲ, k=20) # ਵਿਆਪਕ, ਕੁਇੱਕਸਕੋਰ = reranker.score(ਪ੍ਰਸ਼ਨ, ਉਮੀਦਵਾਰ) # ਹਰੇਕ ਉਮੀਦਵਾਰ ਦੇ ਸੰਦਰਭ ਲਈ ਪ੍ਰਸੰਗਿਕਤਾ ਸਕੋਰ = rated.rank()[:4] # ਚੋਟੀ ਦੇ 4
ਪੁੱਛਗਿੱਛ ਨੂੰ ਬਦਲਣਾ
ਕਈ ਵਾਰ ਸਮੱਸਿਆ ਖੋਜ ਵਿੱਚ ਨਹੀਂ ਹੁੰਦੀ, ਸਗੋਂ ਸਵਾਲ ਵਿੱਚ ਹੀ ਹੁੰਦੀ ਹੈ। ਜੇਕਰ ਉਪਭੋਗਤਾ ਪੁੱਛਦਾ ਹੈ "ਰਿਮੋਟ ਵਰਕਰਾਂ ਬਾਰੇ ਕੀ?" ', ਇਹ ਇਕੱਲੇ ਨਹੀਂ ਮੰਗਿਆ ਜਾ ਸਕਦਾ ਹੈ (ਇਹ ਸਪੱਸ਼ਟ ਨਹੀਂ ਹੈ ਕਿ ਰਿਮੋਟ ਵਰਕਰਾਂ ਲਈ ਕੀ ਹੈ)। ਇੱਥੇ ਪੁੱਛਗਿੱਛ ਪਰਿਵਰਤਨ ਤਕਨੀਕਾਂ ਹਨ:
- ਮੁੜ ਲਿਖੋ: ਸਵਾਲ ਨੂੰ ਇਕੱਲਾ ਬਣਾਉਣ ਲਈ ਗੱਲਬਾਤ ਦੇ ਇਤਿਹਾਸ ਦੀ ਵਰਤੋਂ ਕਰੋ: "ਰਿਮੋਟ ਵਰਕਰ ਸਲਾਨਾ ਛੁੱਟੀ ਦੇ ਹੱਕਦਾਰ ਕੀ ਹਨ?"
- ਮਲਟੀ-ਕਵੇਰੀ: ਇੱਕੋ ਸਵਾਲ ਦੇ 3 ਵੱਖ-ਵੱਖ ਸਮੀਕਰਨ ਤਿਆਰ ਕਰੋ, ਉਹਨਾਂ ਸਾਰਿਆਂ ਨਾਲ ਖੋਜ ਕਰੋ, ਨਤੀਜਿਆਂ ਨੂੰ ਜੋੜੋ। ਵੱਖੋ ਵੱਖਰੇ ਸ਼ਬਦ ਵੱਖੋ ਵੱਖਰੇ ਟੁਕੜੇ ਲੱਭਦੇ ਹਨ.
- HyDE (ਹਾਇਪੋਥੈਟੀਕਲ ਡੌਕੂਮੈਂਟ ਏਮਬੈਡਿੰਗਸ): ਪਹਿਲਾਂ ਮਾਡਲ ਲਈ ਇੱਕ "ਸੰਭਾਵੀ ਜਵਾਬ" ਪ੍ਰਿੰਟ ਕਰੋ, ਫਿਰ ਏਮਬੈਡ ਕਰੋ ਅਤੇ ਉਸ ਕਾਲਪਨਿਕ ਜਵਾਬ ਦੀ ਖੋਜ ਕਰੋ। ਕਾਲਪਨਿਕ ਜਵਾਬ ਕਈ ਵਾਰ ਬਿਹਤਰ ਪਾਇਆ ਜਾਂਦਾ ਹੈ ਕਿਉਂਕਿ ਇਹ ਅਸਲ ਦਸਤਾਵੇਜ਼ ਦੇ ਸ਼ਬਦਾਂ ਦੇ ਨੇੜੇ ਹੁੰਦਾ ਹੈ।
# ਮਲਟੀ-ਕਵੇਰੀ (ਸੰਕਲਪਿਕ) ਰੂਪ = model.uret("ਇਸ ਸਵਾਲ ਨੂੰ 3 ਵੱਖ-ਵੱਖ ਤਰੀਕਿਆਂ ਨਾਲ ਪ੍ਰਗਟ ਕਰੋ: " + ਸਵਾਲ)tum_sonuc = [] v ਲਈ ਰੂਪਾਂ ਵਿੱਚ: all_sonuc += vector_intermediate(v, k=6)context = singular_and_order(tum_result)[:6]
ਕਮਜ਼ੋਰ ਮੁੜ ਪ੍ਰਾਪਤੀ / ਮਜ਼ਬੂਤ ਪ੍ਰਾਪਤੀ
ਕਮਜ਼ੋਰ (ਸਿੰਗਲ ਪੜਾਅ, ਕੇਵਲ ਅਰਥ ਵਿਗਿਆਨ, ਸਥਿਰ k=3):
ਨਤੀਜਾ = ਵੈਕਟਰ_ਖੋਜ(ਸਵਾਲ, k=3)# ਸਮੱਸਿਆ: ਉਤਪਾਦ ਕੋਡ ਖੁੰਝ ਗਿਆ ਹੈ, ਔਖੇ ਸਵਾਲਾਂ ਵਿੱਚ ਸਹੀ ਭਾਗ 3 ਦਰਜ ਨਹੀਂ ਕਰ ਸਕਦਾ।
ਸ਼ਕਤੀਸ਼ਾਲੀ (ਹਾਈਬ੍ਰਿਡ + ਵਾਈਡਕ + ਰੀ-ਰੈਂਕਿੰਗ + ਮਲਟੀ-ਕਵੇਰੀ ਜੇ ਲੋੜ ਹੋਵੇ):
ਉਮੀਦਵਾਰ = ਹਾਈਬ੍ਰਿਡ_ਖੋਜ(ਮੁੜ ਲਿਖਣਾ(ਸਵਾਲ, ਅਤੀਤ), k=20) ਸੰਦਰਭ = reranker.score(ਸਵਾਲ, ਉਮੀਦਵਾਰ)।ਪਹਿਲਾ(4)# ਸਹੀ ਮੇਲ ਅਤੇ ਅਰਥ ਦੋਵੇਂ ਕੈਪਚਰ ਕੀਤੇ ਗਏ ਹਨ; ਇਹ ਸਭ ਤੋਂ ਵਧੀਆ 4 ਮਾਡਲਾਂ 'ਤੇ ਜਾਂਦਾ ਹੈ।
ਤਿੰਨ ਮਿੰਨੀ ਕੇਸ
ਕੇਸ 1 — ਉਤਪਾਦ ਕੋਡ ਬਚ ਗਿਆ। ਇੱਕ ਸਹਾਇਤਾ ਟੀਮ 'ਤੇ ਇੱਕ ਸ਼ੁੱਧ ਅਰਥ ਖੋਜ ਸਵਾਲ "RTX-9080 ਡਰਾਈਵਰ ਗਲਤੀ" ਵਿੱਚ "RTX-9080" ਸ਼ਬਦਾਵਲੀ ਨਹੀਂ ਲੱਭ ਸਕੀ; ਉਹ ਸਮਾਨ ਨਾਵਾਂ ਵਾਲੇ ਹੋਰ ਉਤਪਾਦ ਲਿਆ ਰਿਹਾ ਸੀ। ਜਦੋਂ ਹਾਈਬ੍ਰਿਡ ਖੋਜ ਸ਼ਾਮਲ ਕੀਤੀ ਗਈ ਸੀ, ਤਾਂ ਸਹੀ ਕੋਡ ਮੇਲ ਖਾਂਦਾ ਹੈ ਅਤੇ ਸਹੀ ਲੇਖਾਂ ਨੂੰ ਵਾਪਸ ਕਰਨ ਦੀ ਦਰ 58% ਤੋਂ 92% ਤੱਕ ਵਧ ਗਈ ਹੈ।
ਕੇਸ 2 — ਮੁੜ ਦਰਜਾਬੰਦੀ ਦਾ ਅੰਤਰ। ਇੱਕ ਪੈਰਾਲੀਗਲ k=5 ਨਾਲ ਕੰਮ ਕਰ ਰਿਹਾ ਸੀ ਪਰ ਸਹੀ ਆਈਟਮ ਜ਼ਿਆਦਾਤਰ 7-10 ਹੈ। ਉਹ ਕਤਾਰਾਂ ਵਿੱਚ ਰਹਿ ਰਿਹਾ ਸੀ। ਜਦੋਂ k=20 + ਰੀ-ਰੈਂਕਿੰਗ ਪੇਸ਼ ਕੀਤੀ ਗਈ ਸੀ, ਤਾਂ ਸਿਖਰ 3 ਵਿੱਚ ਸਹੀ ਲੇਖ ਦੀ ਦਰ 61% ਤੋਂ ਵਧ ਕੇ 94% ਹੋ ਗਈ ਸੀ; ਲੇਟੈਂਸੀ ਸਿਰਫ 300ms ਤੱਕ ਵਧੀ — ਇੱਕ ਸਵੀਕਾਰਯੋਗ ਸਮਝੌਤਾ।
ਕੇਸ 3 - ਬਿਨਾਂ ਪ੍ਰਸੰਗ ਦੇ ਫਾਲੋ-ਅੱਪ ਸਵਾਲ। ਇੱਕ HR ਸਹਾਇਕ ਵਿੱਚ, ਉਪਭੋਗਤਾ ਪੁੱਛਦਾ ਹੈ "ਪਾਰਟ-ਟਾਈਮਰ ਬਾਰੇ ਕੀ?" ਜਦੋਂ ਮੈਂ ਪੁੱਛਿਆ, ਤਾਂ ਸਿਸਟਮ ਨੇ ਅਣਉਚਿਤ ਹਿੱਸੇ ਲਿਆਏ। ਪੁੱਛਗਿੱਛ ਨੂੰ ਦੁਬਾਰਾ ਲਿਖਣ ਨਾਲ (ਅਤੀਤ ਤੋਂ "ਸਾਲਾਨਾ ਛੁੱਟੀ" ਦੇ ਸੰਦਰਭ ਨੂੰ ਖਿੱਚ ਕੇ ਅਤੇ "ਪਾਰਟ-ਟਾਈਮ ਕਰਮਚਾਰੀ ਸਾਲਾਨਾ ਛੁੱਟੀ ਦੇ ਹੱਕਦਾਰ ਹਨ" ਨੂੰ ਜੋੜ ਕੇ), ਸਹੀ ਜਵਾਬ ਦਰ 40% ਤੋਂ ਵਧ ਕੇ 86% ਹੋ ਗਈ ਹੈ।
ਆਮ ਗਲਤੀਆਂ
- ਸਿਰਫ਼ ਅਰਥ ਖੋਜ 'ਤੇ ਨਿਰਭਰ ਕਰਨਾ: ਉਤਪਾਦ ਕੋਡ, ਸੰਖੇਪ, ਸਹੀ ਨਾਮ ਖੁੰਝ ਗਿਆ ਹੈ; ਹਾਈਬ੍ਰਿਡ ਸ਼ਾਮਲ ਕਰੋ।
- k ਨੂੰ ਬਹੁਤ ਛੋਟਾ ਰੱਖਣਾ: ਸਹੀ ਟੁਕੜਾ ਸੂਚੀ ਵਿੱਚ ਦਾਖਲ ਨਹੀਂ ਹੋ ਸਕਦਾ; ਇਸਨੂੰ ਚੌੜਾ ਬਣਾਓ ਅਤੇ ਇਸਨੂੰ ਮੁੜ-ਰੈਂਕ ਨਾਲ ਤੰਗ ਕਰੋ।
- ਦੁਬਾਰਾ ਦਰਜਾਬੰਦੀ ਬਾਰੇ ਕਦੇ ਨਹੀਂ ਸੋਚਣਾ: ਪਹਿਲੀ ਖੋਜ ਰੁੱਖੀ ਹੈ; ਦੂਜਾ ਸਮਾਰਟ ਪਾਸ ਗੁਣਵੱਤਾ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਸੁਧਾਰ ਕਰਦਾ ਹੈ।
- ਫਾਲੋ-ਅਪ ਪ੍ਰਸ਼ਨਾਂ ਦੀ ਖੋਜ ਜਿਵੇਂ ਕਿ: ਪ੍ਰਸੰਗ ਤੋਂ ਬਿਨਾਂ ਇੱਕ ਪ੍ਰਸ਼ਨ ਅਰਥਹੀਣ ਦੀ ਖੋਜ ਕਰਦਾ ਹੈ; ਮੁੜ ਲਿਖਣਾ।
- ਅੰਨ੍ਹੇਵਾਹ k (ਮੁੜ-ਰੈਂਕ ਤੋਂ ਬਿਨਾਂ): ਮਾਡਲ ਰੌਲੇ ਨਾਲ ਭਰਿਆ ਹੋਇਆ ਹੈ, ਜਵਾਬ ਵਿਗਾੜਿਆ ਹੋਇਆ ਹੈ ਅਤੇ ਲਾਗਤ ਵਧਦੀ ਹੈ।
ਸਾਵਧਾਨ ਰਹੋ: ਹਰ ਤਕਨੀਕ ਲਾਗਤ ਅਤੇ ਦੇਰੀ ਜੋੜਦੀ ਹੈ। ਮਲਟੀ-ਕਵੇਰੀ ਦਾ ਮਤਲਬ ਹੈ 3-ਗੁਣਾ ਖੋਜ, ਰੀ-ਰੈਂਕਿੰਗ ਦਾ ਮਤਲਬ ਹੈ ਵਾਧੂ ਮਾਡਲ ਕਾਲ। ਪਹਿਲਾਂ ਸਧਾਰਨ ਹਾਈਬ੍ਰਿਡ + ਵਾਜਬ k ਨਾਲ ਸ਼ੁਰੂ ਕਰੋ; ਭਾਰੀ ਤਕਨੀਕਾਂ ਨੂੰ ਮਾਪੋ ਅਤੇ ਜੋੜੋ ਜਿੱਥੇ ਅਸਲ ਵਿੱਚ ਲੋੜ ਹੋਵੇ। ਬਿਨਾਂ ਮਾਪਿਆਂ ਜੋੜਨਾ।
ਸੰਖੇਪ ਵਿੱਚ
- ਟੌਪ-ਕੇ ਰੀਕਾਲ ਅਤੇ ਸ਼ੁੱਧਤਾ ਵਿਚਕਾਰ ਸੰਤੁਲਨ ਹੈ; ਆਮ ਤੌਰ 'ਤੇ 4-8 ਚੰਗੀ ਸ਼ੁਰੂਆਤ ਹੁੰਦੀ ਹੈ।
- ਹਾਈਬ੍ਰਿਡ ਖੋਜ ਕੀਵਰਡ (BM25) ਖੋਜ ਨਾਲ ਅਰਥ ਖੋਜ ਨੂੰ ਜੋੜਦੀ ਹੈ; ਸਟੀਕ ਮੇਲ ਮੁੜ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ।
- ਰੀ-ਰੈਂਕਿੰਗ ਇੱਕ ਮਜ਼ਬੂਤ ਮਾਡਲ ਦੇ ਨਾਲ ਵਿਆਪਕ ਸ਼ੁਰੂਆਤੀ ਖੋਜ ਤੋਂ ਉਮੀਦਵਾਰਾਂ ਨੂੰ ਮੁੜ-ਸਕੋਰ ਕਰਦੀ ਹੈ ਅਤੇ ਸਭ ਤੋਂ ਵਧੀਆ ਦੀ ਚੋਣ ਕਰਦੀ ਹੈ।
- ਪੁੱਛਗਿੱਛ ਪਰਿਵਰਤਨ (ਮੁੜ ਲਿਖਣਾ, ਮਲਟੀ-ਕਵੇਰੀ, HyDE) ਮੁਸ਼ਕਲ ਅਤੇ ਸੰਦਰਭ-ਮੁਕਤ ਪ੍ਰਸ਼ਨਾਂ ਨੂੰ ਖੋਜਣ ਯੋਗ ਬਣਾਉਂਦਾ ਹੈ।
- ਮਜ਼ਬੂਤ ਪੈਟਰਨ: ਵਿਆਪਕ ਪ੍ਰਾਪਤੀ → ਹਾਈਬ੍ਰਿਡ ਨਾਲ ਮਿਲਾਓ → ਮੁੜ-ਰੈਂਕ ਦੇ ਨਾਲ ਤੰਗ; ਪਰ ਹਰੇਕ ਤਕਨੀਕ ਨੂੰ ਮਾਪ ਕੇ ਜੋੜੋ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਪਿਛਲੀਆਂ ਇਕਾਈਆਂ ਦੇ ਡੇਟਾ ਦੇ ਨਾਲ 6 ਮੁਸ਼ਕਲ ਸਵਾਲ ਤਿਆਰ ਕਰੋ: ਘੱਟੋ-ਘੱਟ 2 ਸਹੀ ਮੇਲ (ਉਤਪਾਦ ਕੋਡ, ਸੰਖੇਪ, ਮਿਤੀ), 2 ਅਰਥ (ਵੱਖ-ਵੱਖ ਸ਼ਬਦਾਂ ਵਾਲਾ ਇੱਕੋ ਵਿਸ਼ਾ), 2 ਬਿਨਾਂ ਸੰਦਰਭ ਦੇ ਫਾਲੋ-ਅੱਪ ਸਵਾਲ। (1) ਪਹਿਲਾਂ ਹਰੇਕ ਪ੍ਰਸ਼ਨ ਨੂੰ ਸ਼ੁੱਧ ਅਰਥ ਖੋਜ ਵਜੋਂ ਸੋਚੋ ਅਤੇ ਹੱਥੀਂ ਨਿਸ਼ਾਨ ਲਗਾਓ ਕਿ ਕਿਹੜੇ ਭਾਗ ਆਉਣਗੇ। (2) ਹਾਈਬ੍ਰਿਡ ਅਤੇ ਰੀ-ਰੈਂਕਿੰਗ ਜੋੜ ਕੇ ਉਹੀ ਸਵਾਲਾਂ ਦਾ ਮੁੜ-ਮੁਲਾਂਕਣ ਕਰੋ। (3) ਬਿਨਾਂ ਸੰਦਰਭ ਦੇ ਫਾਲੋ-ਅੱਪ ਸਵਾਲਾਂ ਨੂੰ ਦੁਬਾਰਾ ਲਿਖੋ। ਇੱਕ ਸਾਰਣੀ ਦੇ ਰੂਪ ਵਿੱਚ ਨੋਟ ਕਰੋ ਕਿ ਕਿਹੜੀ ਤਕਨੀਕ ਕਿਸ ਪ੍ਰਸ਼ਨ ਦੀ ਕਿਸਮ ਵਿੱਚ ਫਰਕ ਪਾਉਂਦੀ ਹੈ।
ਚੈੱਕਲਿਸਟ
- [ ] ਮੈਂ ਜਾਣਦਾ ਹਾਂ ਕਿ top-k ਇੱਕ ਰੀਕਾਲ-ਸ਼ੁੱਧਤਾ ਸੰਤੁਲਨ ਹੈ ਅਤੇ ਇੱਕ ਵਾਜਬ ਸ਼ੁਰੂਆਤੀ ਰੇਂਜ ਹੈ।
- [ ] ਮੈਂ ਦੱਸ ਸਕਦਾ ਹਾਂ ਕਿ ਹਾਈਬ੍ਰਿਡ ਖੋਜ ਸਹੀ ਮੇਲ ਕਿਉਂ ਪ੍ਰਾਪਤ ਕਰਦੀ ਹੈ।
- [ ] ਮੈਂ ਮੁੜ ਦਰਜਾਬੰਦੀ ਦੇ ਦੋ-ਪੜਾਅ ਦੇ ਤਰਕ ਨੂੰ ਲਾਗੂ ਕਰ ਸਕਦਾ ਹਾਂ (ਵਿਆਪਕ → ਸਮਾਰਟ ਤੰਗ)।
- [ ] ਮੈਂ ਬਿਨਾਂ ਸੰਦਰਭ ਦੇ ਫਾਲੋ-ਅੱਪ ਸਵਾਲਾਂ ਨੂੰ ਮੁੜ ਲਿਖਣ ਦੀ ਲੋੜ ਨੂੰ ਪਛਾਣਦਾ ਹਾਂ।
- [ ] ਮੈਂ ਪੁਸ਼ਟੀ ਕਰਦਾ ਹਾਂ ਕਿ ਮੈਂ ਮਾਪਣ ਦੁਆਰਾ ਭਾਰੀ ਤਕਨੀਕਾਂ ਜੋੜੀਆਂ ਹਨ, ਨਾਪ ਕੇ।