robots.txt
- Existență și status HTTP
- Dimensiune (limita Google: 512KB)
- Sintaxă corectă (User-agent, Allow, Disallow)
- Blocări periculoase (Disallow: / care blochează tot site-ul)
- Blocări resurse critice (CSS/JS necesare pentru randare)
- Referințe Sitemap prezente
- Linii nerecunoscute/invalide
sitemap
- Existență (verifică mai multe locații: sitemap.xml, sitemap_index.xml, URL din robots.txt)
- Validitate XML
- Sitemap Index vs sitemap simplu (testează ambele)
- Număr URL-uri (limita: 50.000)
- Dimensiune (limita: 50MB)
- Prezența și format corect
- Verificare status HTTP pentru primele 5 URL-uri (detectează 404, redirectări sau erori server)
Sitemap și robots.txt validator
Validează sitemap.xml sau sitemap_index.xml și robots.txt pentru orice website
Se verifică sitemap.xml și robots.txt...
De ce se verifică împreună robots.txt și sitemap
Cele două fișiere lucrează în pereche. Primul spune ce are voie un robot să parcurgă, al doilea spune ce merită parcurs. Când se contrazic, apar exact acele situații în care paginile bune lipsesc din index, iar cele fără rost se indexează.
Validatorul le citește pe amândouă și verifică și legătura dintre ele: dacă sitemapul este declarat în robots.txt și dacă adresele din sitemap chiar răspund.
Greșelile pe care le găsim cel mai des
- Regula
Disallow: /rămasă de la dezvoltare. Blochează tot site-ul. Se întâmplă la fiecare lansare grăbită și poate trece luni întregi neobservată. - Blocarea fișierelor CSS și JavaScript. Google trebuie să randeze pagina ca s-o înțeleagă. Fără stiluri și scripturi, o vede stricată.
- Sitemap cu adrese vechi. După trecerea la HTTPS sau după schimbarea domeniului rămân în sitemap adresele anterioare, care redirectează sau dau eroare.
- Pagini cu noindex trecute în sitemap. Un semnal se bate cap în cap cu celălalt, iar sitemapul își pierde credibilitatea.
- Sitemapul nedeclarat în robots.txt, deși există. Se pierde cea mai simplă cale prin care este găsit.
- Fișier robots.txt care lipsește sau răspunde cu eroare. Verificați și varianta cu www, și pe cea fără.
Ce faceți după verificare
- Reparați întâi blocările: o regulă greșită în robots.txt costă mai mult decât toate celelalte probleme la un loc.
- Curățați sitemapul de adresele care redirectează, de cele cu eroare și de paginile marcate noindex.
- Retrimiteți sitemapul din Google Search Console și urmăriți raportul de indexare în zilele următoare.
Robotul nu citește fișierul la fiecare vizită, deci o corectură nu se vede imediat. Reveniți după câteva zile și verificați din nou, apoi treceți restul semnalelor tehnice prin SEO Analyzer.
