SEO

Robots.txt och XML-sitemap: så får du sidorna indexerade

Så fungerar robots.txt och XML-sitemap, vilka misstag som stoppar indexering och hur du begär att Google indexerar en sida via Search Console.

Två små filer styr mycket av hur Google hittar din webbplats. Robots.txt talar om vilka delar av sajten sökmotorernas robotar får besöka. XML-sitemapen listar de sidor du vill att de ska hitta. Är någon av dem fel kan viktiga sidor saknas i Google helt, utan att något syns för besökarna.

Den här guiden går igenom båda filerna, de vanligaste misstagen och hur du får en sida indexerad.

Så går indexering till#

För att en sida ska kunna visas i Google måste den gå igenom tre steg.

  1. Upptäckt: Google hittar adressen, oftast via en länk från en annan sida eller via din sitemap.
  2. Genomsökning: Googlebot hämtar sidan och läser innehållet. Här styr robots.txt vad roboten får hämta.
  3. Indexering: Google bedömer sidan och lägger in den i sitt index. Först då kan den visas i sökresultaten.

Google indexerar inte allt den genomsöker. Sidor med tunt innehåll, dubbletter och sidor med noindex-instruktion lämnas utanför. Att indexera en sida betyder alltså att Google har valt att spara den, och det beslutet kan du påverka men inte bestämma.

Vad är robots.txt?#

Robots.txt är en vanlig textfil som ligger i roten av din domän, till exempel dindoman.se/robots.txt. Den måste ligga exakt där för att sökmotorerna ska läsa den. Varje värdnamn har sin egen fil, så en underdomän som shop.dindoman.se behöver en egen robots.txt.

Filen är offentlig. Vem som helst kan öppna den i webbläsaren, så den ska aldrig användas för att gömma känsligt innehåll. Den är en instruktion till väluppfostrade robotar och inget lösenordsskydd.

Syntaxen

Filen består av grupper av regler. Varje grupp börjar med vilken robot reglerna gäller och följs av vad den får och inte får besöka.

  • User-agent anger vilken robot gruppen gäller. En asterisk betyder alla robotar.
  • Disallow anger en sökväg som roboten inte får besöka.
  • Allow gör undantag från en Disallow-regel.
  • Sitemap anger den fullständiga adressen till din sitemap. Raden kan stå var som helst i filen.

Ett vanligt exempel för en företagssajt kan se ut så här:

  • User-agent: *
  • Disallow: /admin/
  • Disallow: /varukorg/
  • Allow: /admin/offentlig-sida/
  • Sitemap: https://www.dindoman.se/sitemap.xml

Reglerna matchar början av sökvägen, och skiftläget spelar roll. När flera regler matchar samma adress följer Google den mest specifika, alltså den med längst sökväg. Google stöder även asterisk som jokertecken och dollartecken för att markera slutet på en adress.

En tom Disallow-rad betyder att allt är tillåtet. Saknas filen helt tolkar Google det också som att hela sajten får genomsökas.

Vanliga misstag

Disallow: / kvar från utvecklingen. Under bygget av en ny sajt blockeras ofta hela sajten med en enda rad, Disallow: / under User-agent: *. Glöms raden kvar vid lansering slutar Google att genomsöka sajten. Kontrollera robots.txt samma dag som en ny sajt går live.

Blockerade CSS- och JavaScript-filer. Google renderar sidor ungefär som en webbläsare. Om robots.txt blockerar mappar med stilmallar och skript kan Google inte se sidan som besökarna ser den, och bedömningen av sidan kan bli fel. Låt resursfilerna vara åtkomliga.

För breda regler. Disallow: /tjanst blockerar även /tjanster/ och /tjanstebil/, eftersom regeln matchar början av sökvägen. Avsluta med snedstreck när du menar en mapp.

Regler som inte stöds. Google ignorerar crawl-delay och läser inte noindex i robots.txt. Sådana rader gör ingen nytta för Google.

Robots.txt tar inte bort sidor ur Google

Blockerar du en sida i robots.txt slutar Google att läsa den, men adressen kan ändå finnas kvar i indexet, eller komma in där, om andra sidor länkar till den. Den visas då i sökresultaten utan beskrivning.

Vill du att en sida ska försvinna ur Google ska du i stället använda noindex, antingen som meta-tagg i sidans head eller som HTTP-huvudet X-Robots-Tag. Google måste kunna genomsöka sidan för att se instruktionen, så sidan får inte samtidigt vara blockerad i robots.txt. Behöver du dölja en adress snabbt finns verktyget för borttagningar i Search Console, men det döljer bara tillfälligt.

Vill ni synas bättre på Google? Läs om SEO →

Vad är en XML-sitemap?#

En XML-sitemap är en fil som listar adresserna på din sajt i ett format som sökmotorerna kan läsa. Den ligger vanligen på dindoman.se/sitemap.xml. Sitemapen hjälper Google att upptäcka sidor, särskilt nya sidor och sidor som har få interna länkar.

Den ersätter inte bra intern länkning. En sida som bara finns i sitemapen men inte länkas från någon annan sida på sajten har svårt att bli prioriterad.

Vad hör hemma i sitemapen

Ta bara med sidor som du vill ska synas i Google. Varje adress i filen ska uppfylla tre krav.

  • Kanonisk: adressen ska vara den version du vill ska indexeras, inte en variant med parametrar eller en dubblett.
  • Indexerbar: sidan får inte ha noindex och får inte vara blockerad i robots.txt.
  • Svarar med 200: inga omdirigeringar, inga 404-sidor och inga serverfel.

Ta därför bort tacksidor, interna sökresultat, filtersidor och gamla adresser som omdirigeras. Använd fullständiga adresser med samma protokoll och samma www-variant som sajten använder.

lastmod

Varje adress kan ha ett lastmod-värde som anger när sidan senast ändrades. Google använder värdet om det stämmer över tid. Sätt det därför bara när innehållet faktiskt har ändrats, och inte till dagens datum på alla sidor vid varje bygge. Fälten changefreq och priority ignoreras av Google.

Sitemap-index för större sajter

En enskild sitemap får innehålla högst 50 000 adresser och vara högst 50 MB okomprimerad. Har du fler sidor delar du upp dem i flera filer och samlar dem i ett sitemap-index, en fil som listar dina sitemaps. Det kan vara praktiskt även på mindre sajter, till exempel med en fil för tjänstesidor och en för blogginlägg. Då ser du i Search Console hur indexeringen går för varje del.

De flesta publiceringssystem skapar sitemapen automatiskt. På sajter byggda i Next.js genereras både sitemap och robots.txt ofta direkt i koden, så att nya sidor kommer med av sig själva när de publiceras.

Skicka in sitemapen i Search Console#

Ange sitemapen på två ställen.

  1. Lägg till en Sitemap-rad i robots.txt, så att alla sökmotorer hittar den.
  2. Skicka in den i Google Search Console under rapporten för webbplatskartor.

Search Console visar sedan om filen kunde läsas, när den senast hämtades och hur många adresser som upptäcktes. Du behöver inte skicka in den igen varje gång den ändras. Google hämtar den på nytt med jämna mellanrum.

I rapporten för sidindexering kan du filtrera på din sitemap. Då ser du hur många av adresserna du själv pekat ut som faktiskt är indexerade, och varför resten inte är det.

Så begär du indexering av en sida#

Har du publicerat en ny sida eller gjort en viktig ändring kan du be Google att genomsöka den.

  1. Öppna Search Console och klistra in adressen i sökfältet för URL-granskning högst upp.
  2. Läs resultatet. Där står om sidan redan finns i Google och om något hindrar indexering.
  3. Klicka på testet av live-URL om du har rättat ett fel, för att se att Google ser den nya versionen.
  4. Klicka på Begär indexering.

Begäran lägger sidan i kö för genomsökning. Det går inte att lova när, eller om, den indexeras. Det finns också en daglig gräns för antalet begäranden, så spara knappen till sidor som är viktiga. Vid större förändringar, som en ny sajt eller många nya sidor, är en uppdaterad sitemap och bra intern länkning det som fungerar.

Indexeras sidan ändå inte är det sällan robots.txt eller sitemapen som är problemet. Oftare handlar det om att innehållet är för tunt, att sidan liknar en annan sida för mycket eller att den saknar länkar från resten av sajten. Läs mer om helheten i guiden om teknisk SEO och i vad SEO är.

Snabb kontroll av din sajt#

  • Öppna dindoman.se/robots.txt och leta efter Disallow: / under User-agent: *.
  • Kontrollera att robots.txt har en Sitemap-rad som pekar på rätt adress.
  • Öppna sitemapen och stickprova några adresser. De ska ladda utan omdirigering.
  • Jämför antalet adresser i sitemapen med antalet indexerade sidor i Search Console.
  • Gå igenom sidor med noindex och kontrollera att det är avsiktligt.

Vill du ha hjälp?#

Solva går igenom robots.txt, sitemap och indexering som en del av vårt SEO-arbete. Vill du först se hur din sajt ser ut i dag kan du beställa en gratis SEO-analys.

Vanliga frågor

Var ligger robots.txt?

Robots.txt ligger alltid i roten av domänen, till exempel dindoman.se/robots.txt. Filen måste ligga just där för att sökmotorerna ska hitta den, och varje underdomän behöver en egen fil.

Kan jag ta bort en sida från Google med robots.txt?

Nej. Robots.txt stoppar genomsökning men tar inte bort adressen ur indexet. Använd en noindex-tagg i stället och se till att sidan inte samtidigt är blockerad i robots.txt, så att Google kan läsa instruktionen.

Vilka sidor ska finnas i en XML-sitemap?

Bara sidor du vill ska synas i Google: kanoniska adresser som går att indexera och som svarar med statuskod 200. Omdirigeringar, 404-sidor, noindex-sidor och dubbletter ska inte vara med.

Hur får jag Google att indexera min sida?

Se till att sidan går att genomsöka, inte har noindex, finns i din sitemap och länkas från andra sidor på sajten. Klistra sedan in adressen i URL-granskningen i Google Search Console och klicka på Begär indexering.

Behöver en liten sajt en sitemap?

En liten sajt med bra intern länkning brukar bli hittad ändå, men en sitemap skadar inte och gör det lättare att följa indexeringen i Search Console. De flesta publiceringssystem skapar den automatiskt.

Skriven av Solva. Vi är en webbyrå i Uppsala som bygger hemsidor och sköter SEO och annonser för företag i hela Sverige. Mer om oss

Vill ni synas bättre på Google?

Vi går igenom er sajt och visar vad som håller den tillbaka. Genomgången är kostnadsfri.