Inhoud

Websites

Hoe de crawler je site leest en de pdf's waar die naar linkt, wat hij bewust overslaat, en wat je doet als er pagina's ontbreken.

Een website is meestal de snelste manier om een agent te geven wat hij nodig heeft. Je vult een adres in, de crawler leest de pagina's, en elke pagina wordt een eigen bron.

Drie manieren om een site te lezen

Kies op Bronnen, onder Website, een van de drie:

  • Links doorzoeken begint bij het adres dat je opgeeft en volgt elke link die op dezelfde site blijft, in de menu's en de footer van een pagina net zo goed als in de tekst. Voor de meeste sites de beste keuze.
  • Sitemap leest de pagina's die in een sitemapbestand staan, en verder niets. Links worden niet gevolgd. Gebruik dit als je precies wilt bepalen wat er gelezen wordt, of als je navigatie zo gebouwd is dat de crawler die niet kan volgen.
  • Losse link leest alleen die ene pagina.

"Dezelfde site" nemen we strikt: hetzelfde schema, dezelfde host en dezelfde poort. Een crawl die begint bij https://www.example.com dwaalt niet af naar https://shop.example.com of naar de http://-versie. Voeg die toe als aparte crawls.

Delen weglaten

In de modus Links doorzoeken kun je onder Paden uitsluiten paden opgeven. Elk adres waarvan het pad met een daarvan begint, wordt overgeslagen. /blog laat dus /blog weg, /blog/2024/a-post en ook /blogroll. Sluit je de delen uit waar een agent niets aan heeft (nieuwsarchieven, vacatures, tagpagina's), dan wordt niet alleen de crawl korter, maar worden ook de antwoorden beter: de zoekstap hoeft zich door minder ruis heen te werken.

Hoe hij zich op je server gedraagt

  • Hij meldt zich als ChatterLab/1.0 (+https://chatterlab.ai/bot).
  • Hij houdt zich aan je robots.txt. Is dat bestand niet te lezen, dan gaat hij ervan uit dat alles is toegestaan. Een regel met Crawl-delay wordt niet gelezen.
  • Hij wacht 1 seconde na elke pagina die hij opslaat, en leest één pagina tegelijk.
  • Hij leest webpagina's, tot 5 MB per pagina, en pdf's, tot 20 MB per stuk, op de standaard webpoorten. JavaScript voert hij niet uit.
  • Eén crawl ontdekt hoogstens 5.000 adressen. Van een sitemap worden hoogstens 1.000 adressen gelezen, en een sitemap die alleen andere sitemaps opsomt, wordt niet verder geopend.

Pdf's op je site

Een pdf waar je pagina's naar linken, op dezelfde site, wordt meegelezen: technische fiches, handleidingen, certificaten, prijslijsten. Elke pdf wordt een eigen bron, onder zijn eigen adres, met de titel uit het document als naam, of de bestandsnaam als die titel alleen het programma noemt waarmee de pdf is gemaakt. In de lijst onder Bronnen staat er een documenticoon bij.

Steunt een antwoord op een van die pdf's, of vraagt een bezoeker om zo'n document, dan zet de agent er een link naar bij, zodat de bezoeker de pdf zelf kan openen. Hij linkt alleen naar het adres waar de crawl het bestand vond.

Een gescande pdf bevat afbeeldingen van tekst in plaats van tekst, en wordt daarom overgeslagen: er valt niets in te lezen. Zie Bestanden voor wat je ermee kunt.

Wat hij bewust overslaat

  • Afbeeldingen, video's en andere bestanden. Een link naar een foto, een film, een archief of een Office-document wordt niet gevolgd, en er wordt niets gedownload. Alleen pagina's en pdf's worden gelezen.
  • Pagina's met een wachtwoordveld. Van een inlogpagina leert een agent niets.
  • Pagina's waar bijna niets op staat zodra menu's en voetteksten weg zijn (minder dan 300 bytes tekst).
  • Herhaalde blokken. Zodra er 8 pagina's binnen zijn, worden korte blokken die op minstens 80% daarvan voorkomen, herkend als navigatie, cookiemeldingen en voetteksten, en verwijderd. Anders zou elk antwoord je voettekst vinden.
  • Tekst die een bezoeker niet kan zien. Elementen die verborgen zijn met hidden, aria-hidden, display:none of klassen die alleen voor schermlezers bedoeld zijn, vallen weg, net als onzichtbare tekens. Verborgen tekst is de plek waar instructies voor een AI worden verstopt, en een menselijke bezoeker leest die toch nooit. Zie Beveiliging.

Terwijl hij bezig is

Een grote site kost minuten. Je kunt de pagina verlaten. De crawl werkt op de achtergrond in korte beurten, en als een beurt wordt onderbroken, pakt hij na ongeveer 90 seconden zelf de draad weer op. De pagina die die beurt aan het lezen was, wacht ongeveer 10 minuten voor ze opnieuw geprobeerd wordt: tot dan is ze niet te onderscheiden van een pagina die een andere beurt nog leest. Staat er toch een keer Doorzoeken gepauzeerd, druk dan op Doorzoeken hervatten: wat al gelezen is, gaat niet verloren.

Een crawl stopt voortijdig als de opslag van de agent vol is. Dat meldt hij, met het aantal pagina's dat hij vond en het aantal dat hij bewaarde. Sluit paden uit die je niet nodig hebt, of stap over naar een abonnement met meer ruimte. Limieten en actualiteit.

Een crawl die je niet meer wilt, stop je met Doorzoeken stoppen op de kaart. De pagina's die hij tot dan toe heeft gelezen, blijven staan, als bron zoals elke andere, dus verwijder wat je niet wilt. De rest van de site blijft ongelezen, en een nieuw doorzoeken begint weer bij de eerste pagina.

Als er pagina's ontbreken

Wat je zietWaarschijnlijke oorzaakWat je doet
Pagina's staan wel op de site, maar niet in BronnenDe pagina is alleen bereikbaar via een menu dat met JavaScript wordt opgebouwdGebruik Sitemap, of voeg de pagina's toe als Losse link
Pagina's zijn er wel, maar bijna leegDe site bouwt zijn content pas in de browser opZet de content in een bestand of een tekstbron
Er is helemaal niets gelezenrobots.txt weert de crawler, of de site blokkeert onbekende botsSta ChatterLab toe in robots.txt of in je firewall
Een heel onderdeel ontbreektHet staat op een andere host, zoals shop. of help.Crawl die host apart

Een site opnieuw lezen

Crawl je een site die de agent al heeft, dan krijg je niet elke pagina dubbel. Een pagina op een adres dat de agent al heeft, wordt bijgewerkt met wat er nu op staat, en de oude passages verdwijnen, dus antwoorden kunnen de oude versie niet meer aanhalen. Een pagina waarop niets is veranderd, blijft zoals die is, en nieuwe pagina's komen erbij. Een bijgewerkte pagina telt voor je opslag alleen mee met het verschil in grootte, dus opnieuw crawlen vraagt geen ruimte voor een tweede exemplaar.

Wat een crawl nooit doet, is iets verwijderen. Een pagina die van de site is verdwenen of naar een ander adres is verhuisd, houdt zijn bron tot je die verwijdert, en antwoorden kunnen die nog aanhalen. Loop na een grote wijziging aan de site Bronnen na op pagina's die niet meer bestaan. Is er één pagina gewijzigd, voeg die dan opnieuw toe als Losse link.

Een pagina die de agent al heeft en die een nieuwe crawl afkeurt, als inlogpagina of als pagina met bijna geen tekst, houdt ook zijn bron. Ze staat bovenaan Bronnen onder Afgekeurd bij een latere crawl, met één knop die ze allemaal verwijdert als je ze hebt nagekeken. Een crawl ziet elke pagina met een wachtwoordveld als inlogpagina, dus op een site met een inlogvak in de kop kan elke pagina in die lijst staan: kijk ze na voor je ze verwijdert.