Google ਅਸਮਰਥਿਤ Robots.txt ਨਿਯਮਾਂ ਦੀ ਸੂਚੀ ਦਾ ਵਿਸਤਾਰ ਕਰ ਸਕਦਾ ਹੈ

Google ਅਸਮਰਥਿਤ Robots.txt ਨਿਯਮਾਂ ਦੀ ਸੂਚੀ ਦਾ ਵਿਸਤਾਰ ਕਰ ਸਕਦਾ ਹੈ


Google HTTP ਆਰਕਾਈਵ ਦੁਆਰਾ ਇਕੱਠੇ ਕੀਤੇ ਅਸਲ-ਸੰਸਾਰ robots.txt ਡੇਟਾ ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਆਧਾਰ ‘ਤੇ ਆਪਣੇ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਅਸਮਰਥਿਤ robots.txt ਨਿਯਮਾਂ ਦੀ ਸੂਚੀ ਦਾ ਵਿਸਤਾਰ ਕਰ ਸਕਦਾ ਹੈ।

ਗੈਰੀ ਇਲੀਅਸ ਅਤੇ ਮਾਰਟਿਨ ਸਪਲਿਟ ਨੇ ਖੋਜ ਆਫ ਦਾ ਰਿਕਾਰਡ ਦੇ ਨਵੀਨਤਮ ਐਪੀਸੋਡ ‘ਤੇ ਪ੍ਰੋਜੈਕਟ ਦਾ ਵਰਣਨ ਕੀਤਾ। ਕੰਮ ਦੀ ਸ਼ੁਰੂਆਤ ਉਦੋਂ ਹੋਈ ਜਦੋਂ ਇੱਕ ਕਮਿਊਨਿਟੀ ਮੈਂਬਰ ਨੇ Google ਦੇ robots.txt ਰਿਪੋਜ਼ਟਰੀ ਨੂੰ ਅਸਮਰਥਿਤ ਸੂਚੀ ਵਿੱਚ ਦੋ ਨਵੇਂ ਟੈਗਾਂ ਨੂੰ ਜੋੜਨ ਦਾ ਪ੍ਰਸਤਾਵ ਦਿੱਤਾ।

ਇਲੀਸ ਨੇ ਦੱਸਿਆ ਕਿ ਟੀਮ ਨੇ PR ਵਿੱਚ ਦੋ ਟੈਗਾਂ ਤੋਂ ਪਰੇ ਦਾਇਰੇ ਨੂੰ ਕਿਉਂ ਵਿਸ਼ਾਲ ਕੀਤਾ:

“ਅਸੀਂ ਚੀਜ਼ਾਂ ਨੂੰ ਮਨਮਾਨੇ ਢੰਗ ਨਾਲ ਨਾ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ, ਸਗੋਂ ਡੇਟਾ ਇਕੱਠਾ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ।”

ਪ੍ਰਸਤਾਵਿਤ ਦੋ ਟੈਗ ਜੋੜਨ ਦੀ ਬਜਾਏ, ਟੀਮ ਨੇ ਸਿਖਰਲੇ 10 ਜਾਂ 15 ਸਭ ਤੋਂ ਵੱਧ ਵਰਤੇ ਗਏ ਅਸਮਰਥਿਤ ਨਿਯਮਾਂ ਨੂੰ ਦੇਖਣ ਦਾ ਫੈਸਲਾ ਕੀਤਾ। ਇਲੀਸ ਨੇ ਕਿਹਾ ਕਿ ਟੀਚਾ ਜੰਗਲੀ ਵਿੱਚ ਸਭ ਤੋਂ ਆਮ ਅਸਮਰਥਿਤ ਟੈਗਾਂ ਨੂੰ ਦਸਤਾਵੇਜ਼ ਬਣਾਉਣ ਲਈ “ਇੱਕ ਵਧੀਆ ਸ਼ੁਰੂਆਤੀ ਬਿੰਦੂ, ਇੱਕ ਵਧੀਆ ਬੇਸਲਾਈਨ” ਸੀ।

ਖੋਜ ਕਿਵੇਂ ਕੰਮ ਕਰਦੀ ਹੈ

ਟੀਮ ਨੇ ਇਹ ਅਧਿਐਨ ਕਰਨ ਲਈ HTTP ਆਰਕਾਈਵ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਕਿ ਵੈੱਬਸਾਈਟਾਂ ਆਪਣੀਆਂ robots.txt ਫਾਈਲਾਂ ਵਿੱਚ ਕਿਹੜੇ ਨਿਯਮਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੀਆਂ ਹਨ। HTTP ਆਰਕਾਈਵ WebPageTest ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ ਲੱਖਾਂ URL ਵਿੱਚ ਮਹੀਨਾਵਾਰ ਕ੍ਰਾਲ ਚਲਾਉਂਦਾ ਹੈ ਅਤੇ ਨਤੀਜਿਆਂ ਨੂੰ Google BigQuery ਵਿੱਚ ਸਟੋਰ ਕਰਦਾ ਹੈ।

ਪਹਿਲੀ ਕੋਸ਼ਿਸ਼ ਕੰਧ ਨਾਲ ਟਕਰਾ ਗਈ। ਡਿਫੌਲਟ ਕ੍ਰੌਲ ਦੇ ਦੌਰਾਨ ਟੀਮ ਨੇ “ਛੇਤੀ ਨਾਲ ਪਤਾ ਲਗਾਇਆ ਕਿ ਕੋਈ ਵੀ ਅਸਲ ਵਿੱਚ robots.txt ਫਾਈਲਾਂ ਦੀ ਬੇਨਤੀ ਨਹੀਂ ਕਰ ਰਿਹਾ ਹੈ”, ਮਤਲਬ ਕਿ HTTP ਆਰਕਾਈਵ ਡੇਟਾਸੈਟਾਂ ਵਿੱਚ ਆਮ ਤੌਰ ‘ਤੇ robots.txt ਸਮੱਗਰੀ ਸ਼ਾਮਲ ਨਹੀਂ ਹੁੰਦੀ ਹੈ।

ਬੈਰੀ ਪੋਲਾਰਡ ਅਤੇ HTTP ਆਰਕਾਈਵ ਕਮਿਊਨਿਟੀ ਨਾਲ ਸਲਾਹ ਮਸ਼ਵਰਾ ਕਰਨ ਤੋਂ ਬਾਅਦ, ਟੀਮ ਨੇ ਇੱਕ ਕਸਟਮ JavaScript ਪਾਰਸਰ ਲਿਖਿਆ ਜੋ robots.txt ਨਿਯਮਾਂ ਨੂੰ ਲਾਈਨ ਦਰ ਲਾਈਨ ਕੱਢਦਾ ਹੈ। ਕਸਟਮ ਮੈਟ੍ਰਿਕ ਨੂੰ ਫਰਵਰੀ ਕ੍ਰੌਲ ਤੋਂ ਪਹਿਲਾਂ ਵਿਲੀਨ ਕੀਤਾ ਗਿਆ ਸੀ, ਅਤੇ ਨਤੀਜਾ ਡਾਟਾ ਹੁਣ BigQuery ਵਿੱਚ custom_metrics ਡੇਟਾਸੈਟ ਵਿੱਚ ਉਪਲਬਧ ਹੈ।

ਡੇਟਾ ਕੀ ਦਿਖਾਉਂਦਾ ਹੈ

ਪਾਰਸਰ ਨੇ ਫੀਲਡ-ਕੋਲਨ-ਮੁੱਲ ਪੈਟਰਨ ਨਾਲ ਮੇਲ ਖਾਂਦੀ ਹਰ ਲਾਈਨ ਕੱਢੀ। ਇਲੀਅਸ ਨੇ ਨਤੀਜੇ ਵਜੋਂ ਵੰਡ ਦਾ ਵਰਣਨ ਕੀਤਾ:

“ਇਜਾਜ਼ਤ ਅਤੇ ਨਾਮਨਜ਼ੂਰ ਕਰਨ ਅਤੇ ਉਪਭੋਗਤਾ ਏਜੰਟ ਤੋਂ ਬਾਅਦ, ਬੂੰਦ ਬਹੁਤ ਸਖਤ ਹੈ।”

ਉਹਨਾਂ ਤਿੰਨ ਖੇਤਰਾਂ ਤੋਂ ਪਰੇ, ਨਿਯਮ ਦੀ ਵਰਤੋਂ ਘੱਟ ਆਮ ਨਿਰਦੇਸ਼ਾਂ ਦੀ ਇੱਕ ਲੰਬੀ ਪੂਛ ਵਿੱਚ ਆਉਂਦੀ ਹੈ, ਨਾਲ ਹੀ ਟੁੱਟੀਆਂ ਫਾਈਲਾਂ ਤੋਂ ਜੰਕ ਡੇਟਾ ਜੋ ਸਾਦੇ ਟੈਕਸਟ ਦੀ ਬਜਾਏ HTML ਵਾਪਸ ਕਰਦੇ ਹਨ।

Google ਵਰਤਮਾਨ ਵਿੱਚ robots.txt ਵਿੱਚ ਚਾਰ ਖੇਤਰਾਂ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ। ਉਹ ਖੇਤਰ ਉਪਭੋਗਤਾ-ਏਜੰਟ, ਆਗਿਆ, ਅਸਵੀਕਾਰ ਅਤੇ ਸਾਈਟਮੈਪ ਹਨ। ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਕਿਹਾ ਗਿਆ ਹੈ ਕਿ ਹੋਰ ਖੇਤਰ “ਸਮਰਥਿਤ ਨਹੀਂ ਹਨ” ਬਿਨਾਂ ਸੂਚੀਬੱਧ ਕੀਤੇ ਕਿਹੜੇ ਅਸਮਰਥਿਤ ਖੇਤਰ ਜੰਗਲੀ ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਧ ਆਮ ਹਨ।

ਗੂਗਲ ਨੇ ਸਪੱਸ਼ਟ ਕੀਤਾ ਹੈ ਕਿ ਅਸਮਰਥਿਤ ਖੇਤਰਾਂ ਨੂੰ ਅਣਡਿੱਠ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਮੌਜੂਦਾ ਪ੍ਰੋਜੈਕਟ ਖਾਸ ਨਿਯਮਾਂ ਦੀ ਪਛਾਣ ਕਰਕੇ ਉਸ ਕੰਮ ਦਾ ਵਿਸਤਾਰ ਕਰਦਾ ਹੈ ਜੋ Google ਦੁਆਰਾ ਦਸਤਾਵੇਜ਼ ਬਣਾਉਣ ਦੀ ਯੋਜਨਾ ਹੈ।

ਚਾਰ ਸਮਰਥਿਤ ਖੇਤਰਾਂ ਤੋਂ ਪਰੇ ਸਿਖਰ ਦੇ 10 ਤੋਂ 15 ਸਭ ਤੋਂ ਵੱਧ ਵਰਤੇ ਜਾਣ ਵਾਲੇ ਨਿਯਮਾਂ ਨੂੰ Google ਦੀ ਅਸਮਰਥਿਤ ਨਿਯਮਾਂ ਦੀ ਸੂਚੀ ਵਿੱਚ ਸ਼ਾਮਲ ਕੀਤੇ ਜਾਣ ਦੀ ਉਮੀਦ ਹੈ। ਇਲੀਸ ਨੇ ਖਾਸ ਨਿਯਮਾਂ ਦਾ ਨਾਮ ਨਹੀਂ ਦਿੱਤਾ ਜੋ ਸ਼ਾਮਲ ਕੀਤੇ ਜਾਣਗੇ।

ਟਾਈਪੋ ਸਹਿਣਸ਼ੀਲਤਾ ਵਧ ਸਕਦੀ ਹੈ

ਇਲੀਸ ਨੇ ਕਿਹਾ ਕਿ ਵਿਸ਼ਲੇਸ਼ਣ ਨੇ ਅਸਵੀਕਾਰ ਨਿਯਮ ਦੀਆਂ ਆਮ ਗਲਤ ਸ਼ਬਦ-ਜੋੜਾਂ ਨੂੰ ਵੀ ਸਾਹਮਣੇ ਲਿਆ:

“ਮੈਂ ਸ਼ਾਇਦ ਉਹਨਾਂ ਗਲਤੀਆਂ ਨੂੰ ਵਧਾਉਣ ਜਾ ਰਿਹਾ ਹਾਂ ਜੋ ਅਸੀਂ ਸਵੀਕਾਰ ਕਰਦੇ ਹਾਂ.”

ਉਸਦੇ ਵਾਕਾਂਸ਼ ਤੋਂ ਭਾਵ ਹੈ ਕਿ ਪਾਰਸਰ ਪਹਿਲਾਂ ਹੀ ਕੁਝ ਗਲਤ ਸ਼ਬਦ-ਜੋੜਾਂ ਨੂੰ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ। ਇਲੀਸ ਨੇ ਕਿਸੇ ਟਾਈਮਲਾਈਨ ਜਾਂ ਨਾਮ ਖਾਸ ਟਾਈਪੋਜ਼ ਲਈ ਵਚਨਬੱਧ ਨਹੀਂ ਕੀਤਾ।

ਇਹ ਮਾਇਨੇ ਕਿਉਂ ਰੱਖਦਾ ਹੈ

ਖੋਜ ਕੰਸੋਲ ਪਹਿਲਾਂ ਹੀ ਕੁਝ ਅਣਪਛਾਤੇ robots.txt ਟੈਗਾਂ ਨੂੰ ਪੇਸ਼ ਕਰਦਾ ਹੈ। ਜੇਕਰ Google ਹੋਰ ਅਸਮਰਥਿਤ ਨਿਰਦੇਸ਼ਾਂ ਨੂੰ ਦਸਤਾਵੇਜ਼ ਬਣਾਉਂਦਾ ਹੈ, ਤਾਂ ਇਹ ਇਸਦੇ ਜਨਤਕ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਖੋਜ ਕੰਸੋਲ ਵਿੱਚ ਪਹਿਲਾਂ ਹੀ ਦਿਖਾਈ ਦੇਣ ਵਾਲੇ ਅਣਪਛਾਤੇ ਟੈਗਾਂ ਨੂੰ ਵਧੇਰੇ ਨੇੜਿਓਂ ਪ੍ਰਤੀਬਿੰਬਤ ਕਰ ਸਕਦਾ ਹੈ।

ਅੱਗੇ ਦੇਖ ਰਿਹਾ ਹੈ

ਯੋਜਨਾਬੱਧ ਅੱਪਡੇਟ Google ਦੇ ਜਨਤਕ ਦਸਤਾਵੇਜ਼ਾਂ ‘ਤੇ ਅਸਰ ਪਾਵੇਗਾ ਅਤੇ ਟਾਈਪਿੰਗ ਨੂੰ ਕਿਵੇਂ ਨਜਿੱਠਿਆ ਜਾਂਦਾ ਹੈ। ਉਪਭੋਗਤਾ-ਏਜੰਟ, ਆਗਿਆ ਦੇਣ, ਅਸਵੀਕਾਰ ਕਰਨ ਅਤੇ ਸਾਈਟਮੈਪ ਤੋਂ ਪਰੇ ਨਿਯਮਾਂ ਦੇ ਨਾਲ ਇੱਕ robots.txt ਫਾਈਲ ਨੂੰ ਕਾਇਮ ਰੱਖਣ ਵਾਲੇ ਕਿਸੇ ਵੀ ਵਿਅਕਤੀ ਨੂੰ ਉਹਨਾਂ ਨਿਰਦੇਸ਼ਾਂ ਲਈ ਆਡਿਟ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੇ Google ਲਈ ਕਦੇ ਕੰਮ ਨਹੀਂ ਕੀਤਾ ਹੈ।

HTTP ਪੁਰਾਲੇਖ ਡੇਟਾ ਨੂੰ ਜਨਤਕ ਤੌਰ ‘ਤੇ BigQuery ‘ਤੇ ਕਿਸੇ ਵੀ ਵਿਅਕਤੀ ਲਈ ਪੁੱਛਣਯੋਗ ਹੈ ਜੋ ਸਿੱਧੇ ਤੌਰ ‘ਤੇ ਵੰਡ ਦੀ ਜਾਂਚ ਕਰਨਾ ਚਾਹੁੰਦਾ ਹੈ।


ਵਿਸ਼ੇਸ਼ ਚਿੱਤਰ: ਇਸ ਤੋਂ ਸਕ੍ਰੀਨਸ਼ੌਟ: YouTube.com/GoogleSearchCentral, ਅਪ੍ਰੈਲ 2026।



Source link

Postagens Similares

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *