Bestanden
Welke documenten een agent kan lezen, wat ermee gebeurt, en het ene soort PDF waar hij ongemerkt niets van leert.
Upload de documenten die je al hebt: handleidingen, prijslijsten, voorwaarden, productbladen.
Pdf's waar je website naar linkt, hoef je niet te uploaden: een crawl van de site leest ze mee, en de agent kan ernaar linken. Zie Websites. Upload wat niet op de site staat.
Wat je kunt uploaden
Sleep op Bronnen, onder Bestanden, je bestanden naar het vak of kies ze zelf: PDF, DOCX, TXT of MD. Er is geen vast maximum per bestand. De grens is de opslagruimte van de agent, en de grootte van het bestand telt daarin mee. Limieten en actualiteit.
Een bestand gaat rechtstreeks van je browser naar onze bestandsopslag, die onder EU-jurisdictie valt. In Gegevens en privacy staat waar alles wordt bewaard.
Wat er daarna gebeurt
- Uploaden. Het bestand is onderweg. Een upload die nooit wordt afgerond, ruimen we na 1 uur op. Een upload die onderweg naar de opslag mislukt, verdwijnt meteen, en de pagina meldt dat het bestand niet kon worden verstuurd.
- In wachtrij, daarna Verwerken. De tekst wordt uit het bestand gehaald en in passages van ongeveer 500 tokens geknipt. Die overlappen een beetje, zodat er op een naad geen zin verloren gaat. Daarna worden ze doorzoekbaar gemaakt.
- Klaar. De agent kan het bestand gebruiken. Dat duurt meestal seconden, bij een lang document iets langer.
Eindigt een bestand op Mislukt, dan zegt de pagina Bronnen waarom: het bestand kon niet worden gelezen (meestal door een wachtwoord op een PDF), er is geen tekst in gevonden, het lezen kostte meer geheugen of tijd dan een bron mag gebruiken (verdeel het dan over kleinere bestanden), of er ging iets mis aan onze kant. In dat laatste geval probeert Agent opnieuw trainen het nog een keer. Van een mislukte bron leert de agent niets tot het is opgelost.
Gescande PDF's
Let op. Een PDF die een scan is, een foto van pagina's, bevat geen tekst, alleen plaatjes van tekst. Bronnen worden niet met tekstherkenning (OCR) gelezen. Zo'n bestand eindigt op Mislukt, met de melding dat er geen tekst in is gevonden.
Zo controleer je het: open de PDF en probeer met je muis een zin te selecteren. Kun jij geen tekst selecteren, dan kunnen wij dat ook niet. Haal het bestand eerst door OCR (de meeste PDF-programma's en scanners kunnen dat), of plak de inhoud als tekstbron.
Goede antwoorden uit documenten halen
- Tekst wint het van opmaak. Tabellen die leunen op samengevoegde cellen, tekst in afbeeldingen en brochures met meerdere kolommen verliezen hun betekenis als er alleen platte tekst van overblijft. Is een prijslijst belangrijk, dan geeft een gewone tabel of een tekstbron betere antwoorden dan een vormgegeven PDF.
- Eén onderwerp per document wordt beter gevonden dan één groot document met alles erin, want bij het zoeken telt de titel van het document bij elke passage mee. Een bestand dat "Retourbeleid" heet, helpt elke passage die erin staat. Een bestand dat "scan_0042" heet, helpt er geen enkele.
- Verwijder wat verouderd is. Een agent kan niet weten dat de prijslijst van 2023 vervangen is. Staan ze er allebei, dan kan hij uit elk van de twee citeren.
Via de API
De API en een assistent die via MCP is gekoppeld, kunnen geen bestand uploaden, dus voegen ze er een toe vanaf een adres. Wij halen het op zoals de crawler een pagina ophaalt, binnen 20 seconden en tot 50 MB, en leiden uit het bestand zelf af wat het is, niet uit de naam. Een bestand dat alleen op je computer staat, upload je hier.