Den, der falder uden for indekset, taber ikke til konkurrenten — han er slet ikke med i løbet. Denne artikel viser, hvorfor opdagelse, crawl og indeksering er tre adskilte trin, hvad Indexing Hub i Semalt-panelet gør målbart af det, og hvilke grænser værktøjet bevidst sætter.
Næsten enhver SEO-plan begynder med tekster, søgeord og links. Det er forståeligt, for dér er arbejdet synligt og kan diskuteres. Trinnet før forbliver til gengæld uomtalt: kender søgemaskinen overhovedet din side, og har den besluttet at gemme den? Så længe det står åbent, arbejder du på noget, hvis eksistens søgemaskinen ikke anerkender.
Det er heller ikke kun de store portalers problem. En københavnsk begivenhedsplatform med tusindvis af enkeltforestillinger, en webshop i designbranchen med et bredt sortiment, en cleantech-virksomhed med tosproget dokumentation: i alle tilfælde kommer der adresser til i et tempo, ingen længere følger med i manuelt. At der er et efterslæb, opdages typisk først, når den organiske trafik står stille, mens redaktionen udgiver hver uge.
Tre trin, der ofte forveksles med ét
Den mest sejlivede tankefejl behandler indeksering som én begivenhed, der enten sker eller ikke sker. I virkeligheden er der tale om tre trin i rækkefølge med hver sin logik og hver sin type blokering. Et problem, der opstår i det første trin, lader sig ikke reparere i det tredje, uanset hvor mange indsendelser man kaster efter det.
- Opdagelse. Søgemaskinen erfarer, at en adresse findes — via interne henvisninger, et sitemap, et eksternt link eller en aktiv besked. Uden en vej dertil eksisterer siden ikke i dens verdensbillede.
- Crawl. Bottet henter faktisk adressen. Hvor mange hentninger dit domæne får inden for en periode, kaldes crawlbudget og følger af serverydelse, tidligere svarkvalitet og den anslåede værdi af domænet.
- Indeksering. Den hentede side bliver vurderet og gemt — eller netop ikke. Den beslutning handler om indhold, dubletter og signaler, der enten peger samme vej eller modsiger hinanden.
Der kan gå uger mellem de tre handlinger. En adresse kan have været kendt i måneder uden nogensinde at være blevet hentet; en adresse kan være hentet og alligevel afvist. Den, der holder fast i den skelnen, stiller det eneste spørgsmål, der fører videre: hvilket trin går det i stå på? Et bredere overblik over alle moduler findes i beskrivelsen af det fornyede Semalt-panel; her handler det udelukkende om indekseringsdelen.
| Det du observerer | Trin hvor det går galt | Hvad du gør |
|---|---|---|
| Ingen bot har nogensinde besøgt URL'en | Opdagelse | Lav et internt link, udvid sitemappet, giv aktiv besked |
| Besøg registreret, men med en serverfejl | Crawl | Gennemgå infrastruktur og svartider under belastning |
| Besøg lykkedes, siden holdes ude af indekset | Indeksering | Bring indhold, canonical og interne signaler på linje |
| Kun de dybe sider halter bagefter | Opdagelse og crawl | Reducér klikdybden, ryd op i paginering og filtre |
| Nye sider dukker først op efter uger | Opdagelse | Brug aktiv besked frem for at vente på et rutinebesøg |
Seks årsager, der gentager sig
Ved gennemgange vender de samme årsager tilbage med en forudsigelighed, der grænser til det komiske. De seks herunder dækker langt hovedparten af tilfældene, ordnet efter det trin, de opstår i.
| Årsag | Trin | Sådan genkender du den | Hvad der løser den |
|---|---|---|---|
| Forældreløs side uden indgående links | Opdagelse | Svarer med status 200, findes i intet sitemap og ingen navigation | Optag den i en relevant rubrik og i sitemappet |
| For stor klikdybde | Opdagelse | Tolv klik fra forsiden, kun tilgængelig via paginering | Fladere struktur, hubsider, bedre intern linkning |
| Dubletindhold fra parametre | Indeksering | Samme artikel via tre stier, med sorterings- og filtervarianter | Vælg én canonical og brug den konsekvent |
| Modstridende canonicals | Indeksering | Paginering peger på side ét, målene viderestiller eller mangler | Lad canonical pege på en eksisterende, indekserbar URL |
| robots.txt forvekslet med noindex | Crawl | Blokeret URL bliver i indekset, fordi noindex ikke kan læses | Åbn adgangen, og lad noindex blive læst |
| Langsom eller ustabil levering | Crawl | Svartider stiger under belastning, 5xx-fejl i spidsbelastninger | Få caching, hosting og fejlhåndtering på plads |
To af de seks fortjener en advarsel for sig. Forvekslingen mellem robots.txt og noindex koster uger ved hver eneste lancering: en blokeret adresse bliver ikke læst, og dermed heller ikke instruktionen inde i den. Og en canonical er en anbefaling, ikke en ordre; søgemaskinen må vælge en anden variant end den, du havde tænkt dig.
Danmark lægger en egen skærpelse oven i. En virksomhed, der udgiver sit tilbud på både dansk og engelsk — og det er her snarere reglen end undtagelsen — fordobler sin beholdning af adresser. Crawlbudgettet fordobles ikke tilsvarende. Når det danske sprogområde i forvejen er lille, betyder det, at halvdelen af beholdningen kæmper om opmærksomhed på et marked, hvor den engelske version måske slet ikke er den, der skal prioriteres. Den, der forvalter store mængder uden at have styr på svartiderne, begynder derfor ikke ved indsendelsen, men ved det tekniske fundament.
Indexing Hub: grænserne er designet
Tre funktioner ligger samlet i Indexing Hub: at anmelde adresser, at læse sitemaps og at registrere, hvad bottene derefter gør ved dem. Det mest anvendelige er ikke mulighederne, men begrænsningerne, for de afgør, hvad der er opnåeligt inden for hvilken tidshorisont.
Det mindste tal er det mest interessante. Tusind adresser om dagen er rigeligt til et firmasite på halvfjerds sider, men ved et katalog med titusinder af adresser bliver det et knapt gode, der kræver fordeling — præcis som et mediebudget. Netop dér ligger gevinsten ved grænsen: den fremtvinger et valg, som ellers udskydes i det uendelige.
Masseindsendelse af adresser
Til de øjeblikke, hvor mange URL'er ændrer sig på én gang: en migrering, et redesign, en ny sæson.
- Én forsendelse, ingen portioner. Hele listen afsted på én gang; opdelingen i håndterbare stykker bortfalder.
- Dagsbudgettet er stadig bremsen. Ti tusind adresser leveret på én gang giver stadig ti dages behandling. Batchens størrelse ændrer altså ikke gennemløbstiden.
- Sorteringen er den egentlige beslutning. Ved et stramt budget er rækkefølgen det eneste, du fortsat styrer, og den afgør udbyttet i uge ét.
- Til undtagelser, ikke til rutinen. Det daglige udgivelsestempo på et normalt site kommer aldrig i nærheden af denne grænse.
Sitemapbehandling
Til samlinger, der allerede er organiseret i sitemapindekser, for eksempel pr. sprog eller pr. kategori.
- Upload eller henvisning. Både en uploadet fil og en offentlig adresse accepteres, så du kan gennemregne en opsætning, før den går live.
- Kæder tre lag dybt. Peger et indeks på endnu et indeks, foldes kæden ud i tre lag. Den, der nester dybere, gør klogt i at flade strukturen ud.
- Tusind filer i én opgave. Dermed dækker én runde hele opdelingen af et stort site efter sprog, rubrik eller indholdstype.
- To ad gangen, tyve ventende. Rigeligt for et bureau med en håndfuld københavnske kunder, forudsat at nogen holder øje med rækkefølgen: fredagens lancering skal ligge før rutinevedligeholdelsen.
Begge indgange munder ud i den samme registrering og deler det samme dagsbudget. Hvordan indekseringsmodulet hos Semalt forholder sig til analyse- og kampagnedelene, er beskrevet i platformsoversigten.
At skubbe i stedet for at vente
Traditionelt henter søgemaskinen, når det passer den. På et domæne med lav aktivitet kan en dyb side vente uger på det, og ved en prisændring eller en tilmeldingsfrist er det præcis de uger, der tæller. IndexNow-forbindelsen vender retningen om: sitet sender selv et signal til GoogleBot og BingBot, så snart noget har ændret sig.
Ved ændringer giver det først og fremmest gennemløbstid. En rettet beskrivelse, en ny pris, et åbnet program eller en genåbnet rubrik behøver ikke vente på, at nogen tilfældigt kommer forbi. For alt, der hænger på en kalender — begivenheder, turisme, restauration, sæsonvarer — afgør det, om du er synlig, mens efterspørgslen er der, eller først bagefter.
Det, der derimod ændrer sig, er det spørgsmål, du kan stille. Ikke længere: kender søgemaskinen overhovedet denne side? Men: den kender den, den har hentet den, og alligevel står den der ikke — hvad holder den tilbage? Det sidste kan undersøges.
Indhold der lige er ændret
En ny pris, en ændret åbningstid, en opdateret beskrivelse: her tæller hver dag, du er hurtigere ude.
- Tilbud med en slutdato
- Sider der bærer sæsonen
Adresser der lige er blevet tilgængelige
En ophævet blokering, en fjernet noindex eller en ny rubrik, der endnu ikke linkes til fra noget sted.
- Efter en lancering eller migrering
- Efter en reparation af robots.txt
Sider der ikke er ændret
At melde igen uden ændring koster dagsbudget og giver intet. Søgemaskinen har allerede dannet sin vurdering.
- Gentagelse fremskynder ingen beslutning
Sider der bliver afvist
Tyndt indhold, en dublet eller en modstridende canonical bliver ikke mere acceptabel af en besked.
- Først årsagen, så indsendelsen
Fra formodning til statuskode
Det er ikke afsendelsen, men registreringen, der gør modulet anvendeligt. For hver adresse noteres, hvornår en bot kom forbi, hvilken status den mødte, og hvilken fejldetalje der hørte til. Ved siden af løber tre tællere — indsendt, fundet, mislykket — som bevæger sig, allerede mens en opgave kører, så du ikke sidder og venter i blinde.
De tre oplysninger virker kun sammen. Tidspunktet viser, om der overhovedet er hentet; statussen røber, om du står med et teknisk eller et indholdsmæssigt spørgsmål; og fejldetaljen peger på, hvor reparationen skal ske. Dermed slutter en diskussion, der i mange projekter kan trække ud i årevis — at Google af uigennemskuelige grunde skulle holde en bestemt side ude — og der begynder en opgaveliste med ejere.
- Meldt, aldrig hentet. Tælleren registrerer indsendelsen, loggen forbliver tom. Se så på robots.txt, på serverens belastning og på en mulig opbremsning af hele domænet.
- Hentet, men serveren brød sammen. En 5xx under besøget er sjældent et problem ved netop den side; det trykker på gennemløbet for hele domænet.
- Hentet, men der stod intet. Status 404 eller 410 peger på en forældet linje i sitemappet eller en henvisning til slettet indhold. Så skal den fjernes, ikke sendes igen.
- Hentet, men viderestillet. Du har anmeldt en mellemstation i stedet for slutmålet. Meld fremover den endelige adresse.
- Hentet, læst, afvist. Teknisk er alt i orden. Årsagen ligger så i indholdet, i den kanoniske henvisning eller i manglende interne links.
Fyrre tusind adresser ved tusind om dagen
Regneeksemplet herunder skal gøre størrelsesordenen mærkbar; det er udtrykkeligt ikke en måling på et eksisterende projekt.
En københavnsk handelsplatform har 40.000 adresser i sine sitemaps, danske og engelske versioner lagt sammen. Med 1.000 adresser om dagen tager én komplet runde fyrre dage, og det tal gælder kun ved fuldt udnyttet budget uden en eneste gentagelse. Læg korrektionsrunderne til, og du er på seks til otte uger. En batchstørrelse på ti tusind ændrer intet ved det; den fjerner alene klippe-klistre-arbejdet.
Seks uger er for lang tid til et udbud med en udløbsdato. Det taler ikke imod værktøjet, men for at sortere. En sandsynlig opdeling af de samme fyrre tusind ser sådan ud.
- Cirka 14.500 filter- og parametervarianter. Sorteringer, prisintervaller, sessionsparametre. Det er et canonical-spørgsmål; forbrugt budget: nul.
- Cirka 9.200 udløbne poster. Afholdte datoer, udgåede varer. De kræver en viderestilling eller en pæn 410, ikke en indsendelse.
- Cirka 260 rubrik- og landingssider. De bærer hovedparten af omsætningen og kan være der på en fjerdedel af et dagsbudget.
- Cirka 4.400 aktuelle tilbudssider på begge sprog. De følger på fire til fem dage og dækker den løbende handel.
- Cirka 11.640 arkiv- og longtailsider. De kører derefter med i baggrunden, uden frist og uden pres.
Det, der lignede fyrre dage, skrumper dermed til fem dage for alt det, der giver penge. Gevinsten kommer fra sorteringen og ikke fra teknikken. For et tosproget dansk site kommer der ét kriterium til: beslut udtrykkeligt, hvilken sprogversion der går forud. Fordi det danske volumen i forvejen er lavt, er fristelsen til at prioritere den engelske version efter rå tal stor — men de engelske sider konkurrerer mod et langt bredere felt, og en manglende dansk side med tydelig købshensigt koster mere, end totalen antyder. Synlighedsrapporterne på den samme platform ligger i samme konto, så den kontrol skal ikke sættes op særskilt.
Sitemaphygiejne og en brugbar rækkefølge
Et sitemap er ikke en lagerliste, men en indstilling: med hver linje siger du, at netop denne side er værd at gemme. Består en fjerdedel af filen af viderestillinger, fejlsider og adresser med noindex, falder troværdigheden af det hele — også af de linjer, der med fuld ret står der.
Indekserbare slutmål
Kun kanoniske adresser med status 200, skrevet præcis som de står i den endelige form.
- Sandfærdig lastmod, ingen natlig opfriskning
- Egne filer pr. sprog og pr. indholdstype
- Et overordnet indeks, der holder sig inden for tre lag
Alt der alligevel afvises
Hver adresse, som søgemaskinen under alle omstændigheder afviser, svækker filens udsagn.
- Noindex, blokerede adresser, viderestillinger
- Filtrerede varianter og interne søgeresultater
- Kurv, kundeområde, testservere, fejlsider
Arbejdsrækkefølgen begynder derfor med oprydning og ikke med afsendelse. Sanér først filerne, og lad dem derefter læse ind, som upload eller som henvisning, alt efter om de allerede ligger offentligt. Det, der kommer retur, er en nulmåling: hvor mange adresser der blev fundet, hvor mange der faldt, og hvilke statuskoder der hober sig op.
Den fejlliste rydder du op i, før der overhovedet går et dagsbudget til den. Først derefter afsendes den sorterede liste, med de bærende sider øverst. En uge senere indeholder loggen materiale nok til tre bunker: hentet og gemt, hentet og afvist, og aldrig besøgt. Den sidste bunke er teknisk arbejde, den mellemste redaktionelt.
Ofte stillede spørgsmål
Hvor lang tid går der, før en indsendt adresse står i indekset?
Der findes ingen fast frist, og ethvert tal, du læser et sted, er et skøn. Det, du derimod forkorter, er vejen til opdagelse og til den første hentning. Selve optagelsen forbliver søgemaskinens beslutning. Loggen viser under alle omstændigheder, om hentningen har fundet sted, og dermed har du allerede halvdelen af svaret.
Er tusind adresser om dagen nok til en mellemstor webshop?
Til den daglige rytme næsten altid. Selv et travlt udgivelsesskema holder sig langt under tusind ændrede adresser i døgnet. Stramt bliver det ved en første fuld optælling, ved et redesign eller ved en migrering — netop de øjeblikke, hvor forsortering betaler sig, fordi den kommercielt bærende del af et katalog som regel er lille.
Hvordan griber man et site an, der betjener både dansk og engelsk?
Begge versioner er selvstændige adresser og trækker begge på det samme dagsbudget. Læg filerne adskilt pr. sprog under ét overordnet indeks — den kæde folder behandlingen ud uden besvær — og fastlæg derefter, hvilket sprog der har fortrin. Sprogregistrering ligger ikke i værktøjet; det valg kommer fra din egen struktur og dine prioriteter.
Hvad sker der, hvis jeg indsender den samme adresse flere gange?
Så går der budget til ingenting. En side, der ikke har ændret sig, bliver ikke vurderet hurtigere af en gentagelse. En anden melding betaler sig kun efter en reel ændring: andet indhold, en rettet canonical eller en blokering, du netop har fjernet.
Hvorfor står der sider i indekset, som jeg netop ville udelukke?
Næsten altid på grund af forvekslingen mellem robots.txt og noindex. En adresse, der er blokeret via robots.txt, bliver ikke hentet, så den noindex, der står i den, bliver aldrig læst — og siden kan på grundlag af eksterne henvisninger blive stående i indekset. Åbn adgangen, lad noindex blive læst, og blokér først derefter igen, hvis det stadig er nødvendigt.
Hvor synlighed reelt begynder
Indeksering er en overset flaskehals, fordi den aldrig melder sig som en driftsforstyrrelse. Der går ingen alarm, og ingen bjælke bliver rød; der er bare sider, der får nul visninger. Den, der ikke måler det, kan bruge måneder på tekster og links, mens blokeringen sidder et trin tidligere.
Indexing Hub løser det ikke med et enkelt tryk. Modulet stiller tre ting op ved siden af hinanden, som hver for sig betyder lidt: en gennemløbsgrænse, der tvinger dig til at vælge, et signal, der forkorter vejen til opdagelse, og en registrering, der erstatter gætteri med tidspunkter og statuskoder. Begrænsningerne hører med til billedet — tusind adresser i døgnet er endeligt, to parallelle opgaver ligeså, og en besked forbliver en besked.
Netop den nøgternhed gør arbejdet planlægbart. Den, der har på papir, at fyrre tusind adresser ved fuldt budget kræver fyrre dage, indgår andre aftaler end den, der trykker send og håber på det bedste. Vil du vide, hvor mange af dine egne sider der faktisk bliver hentet, så begynd med én sitemaprunde via Semalt-panelet og din første indekseringsopgave. Den første status er som regel mere lærerig end ventet — og på tosprogede danske sites ligger den største overraskelse næsten altid i den sprogversion, ingen kiggede på.