सामग्री पर जाएं
SEO की बुनियादी बातें

XML Sitemap और robots.txt: सही तरीके से configure करें

· 6 min

XML sitemap आपके अहम पेजों की सूची देता है, ताकि Googlebot उन्हें आसानी से खोज ले। robots.txt फ़ाइल तय करती है कि बॉट किन हिस्सों को क्रॉल कर सकता है। ये दोनों फ़ाइलें एक-दूसरे की पूरक हैं और इंडेक्सिंग की ग़लतियों से बचने के लिए अप-टू-डेट रखनी चाहिए।

sitemap और robots.txt, SEO की दो सबसे बुनियादी सेटिंग फ़ाइलें हैं। ग़लत सेट होने पर ये अनजाने में अहम पेज बाहर कर सकती हैं, या बेकार के URL पर क्रॉल बजट बर्बाद कर सकती हैं।

XML sitemap: संरचना और अच्छी आदतें

XML sitemap उन URL की सूची देता है जिन्हें आप इंडेक्स होते देखना चाहते हैं, साथ में चाहें तो कुछ मेटाडेटा (संशोधन तारीख़, अपडेट की बारंबारता, प्राथमिकता)। Google इस मेटाडेटा को पढ़ता तो है, पर हूबहू नहीं मानता।

50,000 से ज़्यादा URL या 50 MB से बड़ी साइटों के लिए एक sitemap इंडेक्स बनाएं, जो कई थीमेटिक sitemap फ़ाइलों (लेख, प्रोडक्ट, कैटेगरी) की ओर इशारा करे।

  • सिर्फ़ canonical, इंडेक्स होने लायक और 200 कोड लौटाने वाले URL शामिल करें।
  • noindex पेज, रीडायरेक्ट और पैरामीटर वाले पेज बाहर रखें।
  • Search Console में अपना sitemap जमा करें और robots.txt में उसका ज़िक्र करें।
  • हर नए प्रकाशन पर sitemap अपने-आप अपडेट होने दें।

robots.txt फ़ाइल: निर्देश और सीमाएं

robots.txt डोमेन की जड़ (root) पर रहती है और user-agent के हिसाब से Allow व Disallow नियमों की सरल सिंटैक्स इस्तेमाल करती है। यह Googlebot को बताती है कि साइट के किन हिस्सों को क्रॉल न करे — पर इंडेक्सिंग से बाहर रखने की गारंटी नहीं देती।

robots.txt से रोका गया पेज फिर भी नतीजों में दिख सकता है, अगर बाहरी लिंक उसकी ओर इशारा करें। पूरी तरह बाहर रखने के लिए robots.txt नहीं, noindex टैग इस्तेमाल करें।

  • एडमिन, स्टेजिंग और टेस्ट फ़ोल्डर रोकें।
  • जो आंतरिक सर्च URL हज़ारों रूप बना देते हैं, उन्हें रोकें।
  • पेज दिखाने (rendering) के लिए ज़रूरी CSS और JS फ़ाइलें कभी न रोकें।
  • robots.txt फ़ाइल के आख़िर में sitemap का URL दें।

गंभीर ग़लतियां और उनसे कैसे बचें

सबसे गंभीर ग़लती: किसी माइग्रेशन या ठीक से साफ़ न की गई स्टेजिंग सेटिंग के बाद robots.txt में 'Disallow: /' से ग़लती से पूरी साइट रोक देना। हर बार लाइव करने के बाद सबसे पहले इसी फ़ाइल को जांचें।

sitemap में एरर वाले URL (404, 301) डालना एक आम ग़लती है, जो Google को लापरवाही का संकेत देती है और न मौजूद संसाधनों पर क्रॉल बजट बर्बाद करती है।

SEO ऑडिट में 15 से 40% साइटें अपने sitemap और सचमुच इंडेक्स होने लायक पेजों के बीच बेमेल दिखाती हैं, अक्सर साइट अपडेट के बाद ठीक से रखरखाव न होने की वजह से।

तकनीकी SEO ऑडिट पर 2025-2026 क्षेत्रीय अध्ययन

FAQ

क्या sitemap में प्राथमिकता और बारंबारता बतानी चाहिए?

इन टैग (priority और changefreq) को Google काफ़ी हद तक अनदेखा कर देता है, क्योंकि वह क्रॉल की बारंबारता आंकने के लिए अपने संकेतों पर भरोसा करता है। इनका होना नुक़सानदेह नहीं, पर न होना भी कोई दिक़्क़त नहीं।

जमा किए गए sitemap को पढ़ने में Google को कितना समय लगता है?

Search Console में जमा करने के बाद, Google आम तौर पर 24 से 72 घंटों में sitemap पढ़ लेता है। नए URL का खोजा जाना और उनका असल इंडेक्स होना साइट की अथॉरिटी के हिसाब से ज़्यादा समय लेता है।

क्या robots.txt सभी सर्च इंजनों के लिए काम करता है?

मानक मानने वाले सभी सभ्य बॉट robots.txt का पालन करते हैं। पर बदनीयत बॉट (स्क्रैपर, नियम न मानने वाले क्रॉलर) इसे नज़रअंदाज़ कर देते हैं। इसलिए robots.txt कोई सुरक्षा-औज़ार नहीं, बल्कि क्रॉल संभालने का औज़ार है।

आपकी वेबसाइट Google पर कहाँ खड़ी है?

अपनी वेबसाइट को कुछ ही सेकंड में जाँचें: SEO स्कोर, मज़बूत पहलू और प्राथमिकता वाले कदम। हमारे विशेषज्ञों द्वारा तैयार पूरा ऑडिट आपको मुफ़्त मिलता है — बिना किसी बाध्यता के।

मुफ़्त SEO ऑडिट