Den llms.txt-Standard implementieren: Strukturierte Zusammenfassung für KI-Crawler
AI generated
GEO
AEO
GEO / Technische Umsetzung
Den llms.txt-Standard implementieren
Strukturierte Content-Zusammenfassung für KI-Crawler richtig aufsetzen

llms.txt ist eine seit September 2024 diskutierte Textdatei, die einer Website erlaubt, ihre wichtigsten Inhalte kuratiert und in einem für Sprachmodelle leicht verarbeitbaren Format zusammenzufassen. Anders als robots.txt regelt sie keinen Zugriff, sondern liefert eine inhaltliche Orientierung, was für GEO-Verantwortliche eine völlig neue Art von technischer Datei bedeutet. Dieser Artikel zeigt Aufbau, Abgrenzung zu robots.txt und sitemap.xml, die technische Umsetzung in Magento und eine ehrliche Einordnung des aktuellen, uneinheitlichen Adoptionsstands.

10 Min. Lesezeit llms.txt KI-Crawler-Steuerung

1. Was llms.txt ist und woher der Vorschlag stammt

llms.txt ist eine im September 2024 von Jeremy Howard, Mitgründer von Answer.AI, vorgeschlagene Textdatei im Markdown-Format, die im Root-Verzeichnis einer Website liegt und eine kuratierte Zusammenfassung der wichtigsten Inhalte für Sprachmodelle bereitstellt. Die Grundidee: Statt dass ein KI-System die gesamte Website crawlen und aus umfangreichem HTML die relevanten Informationen selbst herausfiltern muss, liefert die Website selbst eine kompakte, priorisierte Übersicht mit direkten Links zu den wichtigsten Unterseiten.

Die Datei ist bewusst schlank gehalten und folgt einer festen Grundstruktur: eine H1-Überschrift mit dem Namen der Website, ein kurzer Blockquote-Absatz mit einer prägnanten Beschreibung, gefolgt von thematisch gruppierten Abschnitten mit Markdown-Links auf die jeweils wichtigsten Unterseiten samt kurzer Beschreibung. Diese Struktur orientiert sich bewusst an Formaten, die Sprachmodelle aus ihren Trainingsdaten bereits gut kennen und zuverlässig verarbeiten können.

2. Der grundlegende Unterschied zu robots.txt

robots.txt und llms.txt lösen zwei völlig unterschiedliche Aufgaben, auch wenn beide Dateien im Root-Verzeichnis liegen und oberflächlich ähnlich wirken. robots.txt ist ein seit den neunziger Jahren etablierter, von Crawlern weitgehend respektierter Zugriffssteuerungs-Mechanismus: Sie legt fest, welche Bereiche einer Website ein bestimmter Bot crawlen darf und welche nicht, äußert sich aber nicht zum Inhalt der erlaubten Seiten.

llms.txt dagegen trifft keinerlei Zugriffsentscheidung, sondern liefert eine inhaltliche Kuration: eine von Menschen erstellte Einschätzung, welche Seiten für ein Sprachmodell besonders relevant sind und wie sie sich thematisch gruppieren lassen. Eine Website kann also weiterhin per robots.txt bestimmte Crawler vollständig aussperren und gleichzeitig eine llms.txt bereitstellen, die für erlaubte Crawler als inhaltlicher Wegweiser dient. Die beiden Dateien ergänzen sich, ersetzen sich aber nicht gegenseitig.

3. Abgrenzung zu sitemap.xml

Auch der Vergleich mit sitemap.xml zeigt einen wichtigen konzeptionellen Unterschied. Eine XML-Sitemap ist auf Vollständigkeit ausgelegt: Sie listet im Idealfall jede indexierbare URL einer Website auf, oft mit mehreren tausend Einträgen, ergänzt um technische Metadaten wie letztes Änderungsdatum, ohne inhaltliche Gewichtung oder Beschreibung.

llms.txt verfolgt das genaue Gegenteil: bewusste Selektion statt Vollständigkeit. Eine gute llms.txt enthält typischerweise nur eine überschaubare Zahl handverlesener Links, jeweils mit einer kurzen, für Menschen und Modelle gleichermaßen verständlichen Beschreibung, warum diese Seite relevant ist. Während eine Sitemap für klassisches Crawling und Indexierung gedacht ist, zielt llms.txt auf das schnelle inhaltliche Verständnis einer Website durch ein Sprachmodell ab, das nicht die Kapazität hat, tausende Einzelseiten vollständig zu erfassen.

4. Der Aufbau einer llms.txt im Detail

Der von Answer.AI vorgeschlagene Aufbau folgt einer klaren Markdown-Konvention, die sich in der Praxis mittlerweile weitgehend durchgesetzt hat, auch wenn es keine verbindliche, formal geprüfte Spezifikation gibt. Nach der H1-Überschrift und dem einleitenden Blockquote folgen ein oder mehrere H2-Abschnitte, die thematische Gruppen bilden, etwa Dokumentation, Produkte oder Unternehmensinformationen, jeweils mit einer Liste von Markdown-Links im Format Linktext gefolgt von einer kurzen Beschreibung nach einem Doppelpunkt.

Eine optionale letzte Sektion mit der Überschrift Optional kennzeichnet Links, die für ein grundlegendes Verständnis nicht zwingend notwendig sind, aber bei tieferem Interesse zusätzlichen Kontext liefern, etwa ausführliche technische Dokumentation oder Archivinhalte. Diese Trennung hilft Systemen mit begrenztem Kontextfenster, zunächst die wichtigsten Links zu verarbeiten und optionale Inhalte nur bei Bedarf nachzuladen.


# Mironsoft Beispielshop

> Magento-basierter Onlineshop für nachhaltige Bürobedarf-Produkte,
> Versand innerhalb Deutschlands und der EU.

## Produkte

- [Bürostühle](https://shop.example.com/bürostühle): Ergonomische
  Bürostühle mit Garantie und Testphase
- [Schreibtische](https://shop.example.com/schreibtische): Höhenverstellbare
  Schreibtische für Homeoffice und Büro

## Service

- [Versand und Lieferzeiten](https://shop.example.com/versand): Aktuelle
  Fristen und Kosten je Zielland
- [Rückgabe](https://shop.example.com/rückgabe): Bedingungen für
  Rückgabe und Umtausch

## Optional

- [Blog](https://shop.example.com/blog): Ratgeberartikel zu
  Buroausstattung und Ergonomie

5. Beispiel: llms.txt für einen Magento-Shop

Für einen Magento-basierten Onlineshop bietet sich eine Gliederung an, die sich an den wichtigsten Kundenanliegen orientiert statt an der internen Seitenstruktur des Shopsystems: eine kurze Unternehmensbeschreibung, die wichtigsten Produktkategorien mit direkten Links, zentrale Serviceseiten wie Versand- und Rückgabebedingungen sowie, sofern vorhanden, ein Verweis auf den Blog-Bereich mit Ratgeberinhalten.

Wichtig ist, dass die in der llms.txt beschriebenen Inhalte tatsächlich mit den verlinkten Seiten übereinstimmen und aktuell gehalten werden, weil eine veraltete oder irreführende llms.txt im schlimmsten Fall dazu führt, dass ein Sprachmodell auf Basis falscher Erwartungen eine nicht mehr zutreffende Aussage über den Shop trifft, etwa wenn eine dort beworbene Aktion längst ausgelaufen ist.

6. Die optionale Ergänzung llms-full.txt

Neben der schlanken llms.txt schlägt der ursprüngliche Vorschlag zusätzlich eine llms-full.txt vor, die denselben Namensraum nutzt, aber den vollständigen Inhalt der wichtigsten Seiten direkt als zusammenhängenden Markdown-Text enthält, statt nur darauf zu verlinken. Diese Variante kann für Systeme mit großem Kontextfenster sinnvoll sein, die eine Website in einem einzigen Abruf möglichst vollständig erfassen wollen, ohne mehrere Einzelseiten separat abrufen zu müssen.

Der Nachteil liegt im Pflegeaufwand: Jede Änderung an einer der referenzierten Seiten muss auch in der llms-full.txt nachgezogen werden, was ohne automatisierte Generierung aus dem bestehenden Content-Management-System schnell zu Inkonsistenzen führt. Für die meisten mittelständischen Magento-Shops ist deshalb die schlanke, linkbasierte llms.txt der praktikablere Einstieg, während llms-full.txt eher für Dokumentationsprojekte mit überschaubarem, klar abgegrenztem Umfang infrage kommt.

7. Aktueller Adoptionsstand: kein offizieller Standard, uneinheitliche Unterstützung

Ein entscheidender Punkt, den seriöse GEO-Beratung nicht verschweigen sollte: llms.txt ist kein von einem Standardisierungsgremium wie dem W3C verabschiedeter, offizieller Web-Standard, sondern ein von einzelnen Praktikern vorgeschlagenes und von Teilen der Entwicklergemeinschaft aufgegriffenes Format. Keiner der großen KI-Anbieter, weder Anthropic noch OpenAI oder Google, hat öffentlich bestätigt, die Datei systematisch und verlässlich für Websuche oder Trainingsdatenaufbereitung auszuwerten.

In der Praxis zeigen sich deshalb geteilte Ergebnisse: Manche Dokumentationsprojekte und Entwicklertools berichten von einer gewissen Nutzung durch KI-Coding-Assistenten, während für den breiten E-Commerce-Bereich bislang kein belastbarer Nachweis existiert, dass eine llms.txt allein die Sichtbarkeit in Antworten von Claude, ChatGPT oder Perplexity messbar verbessert. Wer die Datei einsetzt, sollte das realistisch als vorsorgliche, sehr günstige Zusatzmaßnahme einordnen, nicht als garantierten Sichtbarkeitshebel.

8. Grenzen und Kritik am llms.txt-Ansatz

Kritiker verweisen zu Recht darauf, dass ein Format ohne verbindliche Spezifikation und ohne bestätigte Unterstützung durch die relevanten KI-Anbieter strukturell dem Henne-Ei-Problem klassischer freiwilliger Web-Standards ähnelt: Ohne breite Unterstützung durch die Anbieter lohnt sich für Websites kaum der Pflegeaufwand, und ohne breite Verbreitung auf Website-Seite lohnt sich für Anbieter kaum die Implementierung einer verlässlichen Auswertung.

Ebenso wichtig ist der Hinweis, dass eine llms.txt keinesfalls eine gut strukturierte, semantisch saubere HTML-Seite mit klaren Überschriften, strukturierten Daten und direkt beantwortenden Absätzen ersetzt. Die eigentliche Grundlage für Sichtbarkeit in KI-Suchsystemen bleibt der reguläre, für Menschen wie Maschinen gut lesbare Seiteninhalt. llms.txt kann diese Grundlage bestenfalls ergänzen, niemals kompensieren, wenn die zugrunde liegenden Seiten selbst unstrukturiert oder inhaltlich dünn sind.

9. Technische Implementierung in Magento

Technisch ist eine llms.txt in Magento unkompliziert umzusetzen, weil es sich lediglich um eine statische Textdatei handelt, die im Web-Root-Verzeichnis unter pub abgelegt und direkt unter der URL Slash llms Punkt txt erreichbar sein muss, analog zu robots.txt. Für kleinere Shops reicht eine manuell gepflegte, per Deployment-Pipeline hochgeladene Datei vollkommen aus.

Für größere Kataloge mit häufig wechselnden Top-Kategorien empfiehlt sich stattdessen ein einfaches CLI-Kommando oder ein geplanter Cronjob, der die wichtigsten, aktuell aktiven Kategorien und Serviceseiten automatisiert aus der Magento-Datenbank ausliest und die Datei entsprechend aktuell hält, damit die llms.txt nicht schleichend veraltet, während sich das Sortiment weiterentwickelt.

Datei Zweck Format Verbindlichkeit
robots.txt Zugriffssteuerung für Crawler Einfache Direktiven-Syntax Seit Jahrzehnten etablierter De-facto-Standard
sitemap.xml Vollständige URL-Liste für Indexierung XML mit Metadaten Von Google, Bing offiziell unterstützt
llms.txt Kuratierte Content-Zusammenfassung Markdown mit Linkliste Kein offizieller Standard, uneinheitliche Nutzung
llms-full.txt Vollständiger Seiteninhalt als Text Zusammenhängender Markdown-Text Optionale Ergänzung, geringe Verbreitung
Strukturierte Daten (JSON-LD) Maschinenlesbare Auszeichnung von Seiteninhalt JSON-LD nach Schema.org Breit von Suchmaschinen unterstützt

Mironsoft

Technisches SEO, GEO und Social-Media-Sichtbarkeit

Guter Content, der bei Google und KI-Suchen trotzdem untergeht?

Wir optimieren Shops technisch für klassische Suchmaschinen UND generative KI-Suchsysteme, richten strukturierte Daten sauber ein und sorgen für Sichtbarkeit über Social-Media-Kanäle hinweg.

GEO-Optimierung

Content für generative KI-Suchsysteme wie ChatGPT und Perplexity aufbereiten.

Structured-Data-Audit

Schema.org-Markup auf Vollständigkeit und Fehler prüfen und ergänzen.

Social-SEO-Strategie

Sichtbarkeit über Social-Media-Kanäle mit SEO-Zielen sinnvoll verknüpfen.

10. Zusammenfassung

llms.txt: Das Wichtigste auf einen Blick

Kuration statt Zugriffssteuerung

llms.txt trifft keine Erlaubnis-Entscheidung wie robots.txt, sondern liefert eine inhaltliche Priorisierung.

Selektion statt Vollständigkeit

Im Gegensatz zur Sitemap enthält eine gute llms.txt nur eine handverlesene Auswahl wichtiger Seiten.

Kein offizieller Standard

Keiner der großen KI-Anbieter hat eine systematische, verlässliche Auswertung öffentlich bestätigt.

Ergänzung, keine Kompensation

llms.txt ersetzt niemals gut strukturierten, semantisch sauberen Seiteninhalt.

11. FAQ: llms.txt: Das Wichtigste auf einen Blick

1Wer hat den llms.txt-Vorschlag entwickelt?
Jeremy Howard, Mitgründer von Answer.AI, hat das Format im September 2024 vorgeschlagen. Es handelt sich um eine Praktiker-Initiative, nicht um einen offiziellen, von einem Gremium verabschiedeten Standard.
2Ersetzt llms.txt die robots.txt?
Nein. robots.txt steuert den Zugriff von Crawlern, llms.txt liefert eine inhaltliche Zusammenfassung. Beide Dateien lösen unterschiedliche Aufgaben und ergänzen sich, ersetzen sich aber nicht.
3Muss eine llms.txt jede Unterseite einer Website auflisten?
Nein, im Gegenteil. Anders als eine Sitemap ist llms.txt auf bewusste Selektion ausgelegt und sollte nur eine überschaubare Zahl handverlesener, besonders relevanter Seiten enthalten.
4In welchem Format wird eine llms.txt geschrieben?
Im Markdown-Format, mit einer H1-Überschrift, einem einleitenden Blockquote-Absatz und thematisch gruppierten Abschnitten mit Markdown-Links samt kurzer Beschreibung.
5Was ist der Unterschied zwischen llms.txt und llms-full.txt?
llms.txt enthält nur Links mit kurzer Beschreibung, während llms-full.txt den vollständigen Inhalt der wichtigsten Seiten direkt als zusammenhängenden Text bereitstellt.
6Wird llms.txt von ChatGPT, Claude oder Google bestätigt genutzt?
Nein, keiner der großen Anbieter hat öffentlich bestätigt, die Datei systematisch und verlässlich für Websuche oder Trainingsdatenaufbereitung auszuwerten.
7Lohnt sich der Aufwand für eine llms.txt trotzdem?
Als sehr günstige, vorsorgliche Zusatzmaßnahme ja, allerdings ohne garantierten Sichtbarkeitseffekt. Sie sollte niemals anstelle von guter, strukturierter HTML-Seitenqualität priorisiert werden.
8Wo muss die llms.txt-Datei technisch liegen?
Im Web-Root-Verzeichnis, erreichbar direkt unter der URL Slash llms Punkt txt, analog zur etablierten Position von robots.txt.
9Wie hält man eine llms.txt bei einem großen Magento-Katalog aktuell?
Über ein CLI-Kommando oder einen geplanten Cronjob, der die aktuell wichtigsten Kategorien und Serviceseiten automatisiert aus der Datenbank ausliest, statt die Datei manuell zu pflegen.
10Kann eine veraltete llms.txt schaden?
Ja, im schlimmsten Fall führt eine veraltete oder irreführende Datei dazu, dass ein Sprachmodell auf Basis falscher Erwartungen eine nicht mehr zutreffende Aussage über die Website trifft.