Wer in den letzten Wochen mal in seine Server-Logs geschaut hat, wird es bemerkt haben: Neben dem Googlebot schlagen täglich Dutzende neue User-Agents auf – GPTBot, PerplexityBot, ClaudeBot, Bytespider und Konsorten.
Das Problem dabei: Diese LLM-Crawler fressen massiv Bandbreite und parsen oft seitenweise überflüssiges HTML, JavaScript-Bloat und Header-Navigation. Am Ende landet der Bot im Token-Limit oder halluziniert falsche Infos über eure Produkte und Dokumentation.
Genau hier kommt der offene Standard /llms.txt ins Spiel (ursprünglich vorgeschlagen von Jeremy Howard).
Was ist llms.txt kurz erklärt?
Genauso wie die robots.txt Crawlern sagt, wo sie hindürfen, liefert die llms.txt KI-Systemen eine saubere, kuratierte Markdown-Zusammenfassung eurer Website. Keine Menüs, keine Cookie-Banner, kein JavaScript – nur komprimierter Kontext mit Links zu den wichtigsten Seiten.
Die zwei Varianten:
-
/llms.txt: Die Übersichtsdatei im H1/H2-Format mit Kurzbeschreibungen eurer Kernseiten. -
/llms-full.txt: Der komplette Volltext eurer Dokumentation oder Blog-Inhalte, direkt lesbar für RAG-Pipelines und Reasoning-Modelle.
Wie setzt man das pragmatisch um?
Man kann die Datei natürlich manuell tippen, aber bei mehr als fünf Unterseiten wird das schnell unübersichtlich. Wenn ihr schnell eine saubere Struktur braucht: Ihr könnt eine llms.txt Datei erstellen mit diesem kostenlosen llms.txt Generator, der eure Sitemap oder URLs crawlt und direkt den validen Standard ausgibt – ohne Registrierung oder Paywall.
Anschließend legt ihr die Datei einfach in euer /public-Verzeichnis (bei Next.js, Vite, Astro etc.) oder richtet einen entsprechenden Redirect auf dem Webserver ein.
Wie handhabt ihr das aktuell? Blockiert ihr KI-Bots per robots.txt oder stellt ihr ihnen gezielt kuratierte Inhalte bereit?
Top comments (0)