Pagina llms.txt și Manifest Agent: Un Index de Site Menținut, Orientat Mașinilor
Construiește și întreține o pagină llms.txt care oferă agenților AI un index precis al site-ului, fără a expune secrete, a duplica conținut sau a ieși din actualitate.
O pagină llms.txt și manifest de agent este un index orientat mașinilor care spune sistemelor AI ce reprezintă un site, ce pagini publice sunt autoritare și — atunci când afacerea suportă acțiuni ale agenților — ce capacități și politici verificate se aplică. Este o hartă către surse întreținute, nu un substitut pentru acele surse și nu o promisiune că vreun crawler anume o va folosi.
Contractul său este identitate → domeniu → destinații autoritare → capacități opționale → constrângeri → prospețime. Fișierul reușește atunci când o mașină îl poate prelua, îl poate interpreta fără a ghici, poate urma URL-uri canonice live și poate ajunge la fapte care încă corespund realității de producție.
Întrebări la care răspunde
Întrebarea principală este: „Ce părți ale acestui site ar trebui să folosească un sistem AI pentru a înțelege organizația, conținutul său și acțiunile sale suportate?" Întrebările suport includ:
- Care este numele canonic al site-ului, domeniul, scopul și publicul țintă?
- Ce pagini de produs, serviciu, documentație, prețuri, politici și suport sunt autoritare?
- Ce pagini ar trebui preferate în locul arhivelor, paginilor de campanie, parametrilor sau versiunilor regionale duplicate?
- Site-ul expune o capacitate reală de agent sau doar informații lizibile de om?
- Unde sunt documentate autentificarea, limitele de rată, manipularea datelor, termenii comerciali și suportul?
- Ce afirmații sunt îndrumări descriptive, mai degrabă decât reguli de control al accesului?
- Cine deține fișierul, ce eveniment declanșează o actualizare și cum este detectată deriva?
Când să folosești acest tip de postare
Folosește acest tip atunci când site-ul are suficient conținut public și durabil pentru a beneficia de un index curated orientat mașinilor și cineva își poate asuma întreținerea acestuia. Motivația publicării este de a reduce ambiguitatea pentru sistemele de regăsire, nu de a crea încă un URL de dragul său.
| Tip de postare confundabil | Ce organizează | Consumator principal | Alege-l în schimb atunci când |
|---|---|---|---|
| Pagina llms.txt și manifest de agent | Identitate canonică, surse publice de mare valoare și capacități opționale de agent verificate | Sisteme de regăsire AI, crawllere, agenți și echipele care îi validează | Livrabilul este o hartă concisă orientată mașinilor, la o locație previzibilă |
| Index de director | O colecție de profiluri, resurse, locații sau listări | O persoană care navighează și filtrează o colecție | Căile de descoperire, categoriile, descrierile și comparația umană sunt experiența principală |
| Articol de documentație | Un comportament de produs, câmp, limită, configurație sau versiune | Un utilizator existent care caută un răspuns exact de referință | Pagina trebuie să explice conținutul destinației, nu doar să trimită la el |
| Pagina de politici | Reguli autoritare, obligații, domeniu, excepții și date efective | Persoane sau sisteme care decid ce este permis | Politica în sine trebuie citită, acceptată sau aplicată; trimite la ea din manifest |
| Pagină agentică de date despre produs | Produse, identificatori, oferte, disponibilitate și fapte tranzacționale | Agenți care compară sau acționează pe baza datelor de produs | Datele comerciale la nivel de articol și acțiunile sunt încărcătura principală, nu un index la nivel de site |
Nu confunda îndrumarea cu controlul. robots.txt exprimă preferințele de acces ale crawlerelor; un sitemap XML ajută crawllerele să descopere URL-uri; autentificarea și autorizarea decid dacă o acțiune poate avea loc. llms.txt oferă context curated. O propoziție din llms.txt nu poate acorda acces, revoca acces, proteja un secret sau suprascrie termenii unei pagini de destinație.
Cel mai potrivit pentru aceste tipuri de afaceri
- SaaS . Cea mai puternică potrivire, deoarece o companie de software are de obicei surse distincte pentru produs, funcționalități, prețuri, integrări, API, securitate, status și documentație. Indexul poate rezolva ce pagină deține fiecare fapt, în timp ce un manifest separat de capacități poate descrie doar acțiunile pe care produsul le suportă cu adevărat.
- Ecommerce . Potrivire puternică atunci când produsele, transportul, returnările, disponibilitatea și politicile de servicii clienți sunt publice și canonice. Păstrează datele volatile în feeduri sau API-uri; folosește indexul pentru a trimite către acele surse întreținute, în loc să copiezi un catalog în Markdown.
- Marketplace-uri . Valoros atunci când politicile pentru cumpărători, vânzători, furnizori și platformă diferă. Etichetează fiecare audiență și jurisdicție astfel încât un agent să nu aplice regulile vânzătorului unui cumpărător sau să deducă stocul platformei dintr-un singur anunț.
- Servicii B2B . Util pentru clarificarea capacităților, industriilor, granițelor serviciilor, dovezilor, materialelor de achiziții și rutelor de contact. Nu transforma un domeniu negociat sau o promisiune specifică clientului într-o afirmație universală orientată mașinilor.
- Agenții . Util atunci când firma menține multe pagini de servicii, metodologii, studii de caz și expertiză. Portalurile clienților, acreditările, rapoartele private și playbook-urile interne rămân în afara fișierului public.
- Producători și afaceri industriale . Util pentru a direcționa sistemele către familii de produse, specificații, certificări, manuale, distribuitori și documente de siguranță. Indexul nu trebuie să parafrazeze niciodată instrucțiuni critice de siguranță atunci când documentul controlat este autoritatea.
Site-urile mici de tip broșură, cu cinci pagini stabile, pot câștiga puțin dintr-un alt artefact întreținut. Site-urile fără un proprietar de conținut clar ar trebui să rezolve canonicalizarea, navigația și calitatea sursei înainte de a publica un fișier care va devia imediat.
Intenția de căutare
intenția de căutare
este rezultatul așteptat de la o interogare. Acest tip are două audiențe cu intenții diferite. O mașină accesează o cale rădăcină previzibilă și așteaptă Markdown concis, titluri stabile, linkuri canonice și fără zgomot decorativ. Un căutător uman dorește de obicei îndrumări de implementare: „exemplu llms.txt", „ce trebuie inclus în llms.txt" sau „format manifest agent". Pagina explicativă publică poate răspunde acestor întrebări, în timp ce /llms.txt implementat rămâne optimizat pentru regăsirea mașinilor.
Fișierul în sine nu este o pagină de destinație pentru cuvinte cheie. Nu adăuga definiții generale, termeni de categorii repetați sau sute de linkuri de blog pentru a-l face să „se claseze". Fiecare rând suplimentar consumă atenție și creează o altă obligație de întreținere. Preferă zece linkuri deliberate cu descrieri clare în locul unui dump de zece mii de URL-uri.
Deoarece convențiile și suportul consumatorilor se pot schimba, menționează pe ce se bazează implementarea ta și evită să pretinzi o adoptare universală. O preluare reușită dovedește doar că fișierul este accesibil și parsabil; nu dovedește că un anumit produs AI îl folosește pentru clasare, regăsire, instruire sau citare.
Structura paginii
Benzile de cuvinte sunt constrângeri de editare, nu ținte. Fișierul implementat ar trebui să rămână suficient de concis pentru a fi auditat linie cu linie. Nota de implementare orientată către oameni poate fi mai lungă, dar nu trebuie copiată în fișierul mașină.
| Secțiune | Bandă de cuvinte | Scop | Obligatoriu? | |
|---|---|---|---|---|
| Numele site-ului și descriere directă | 30–70 | Stabilește identitatea canonică, scopul, publicul și domeniul înainte de orice linkuri. | Obligatoriu | |
| Domeniu și notă de interpretare | 30–90 | Explică ce acoperă indexul și trimite la sursele de control al accesului sau politicilor. | Obligatoriu când ambiguitatea este probabilă | |
| Resurse primare | 60–180 | Trimite la setul mic de pagini care definesc organizația, oferta, documentația, prețurile și suportul. | Obligatoriu | |
| Grupuri tematică sau de produse | 80–300 | Organizează resurse canonice suplimentare sub titluri simple și stabile. | Condiționat; folosește doar când catalogul o justifică | |
| Capacități agent | 80–250 | Identifică acțiunile reale și trimite la contractele lor citibile de mașinări, autentificare, limite și politici. | Condiționat; omite când nu există nicio acțiune suportată | |
| Resurse opționale | 40–150 | Listează material util dar neesențial, precum cercetare sau studii de caz selectate. | Condiționat | |
| Înregistrare de întreținere | 20–70 | Menționează data verificării, rolul deținătorului, sistemul sursă sau starea generată. | Obligatoriu |
Un fișier curated tipic are aproximativ 200–700 de cuvinte. Lungimea nu este un semnal de calitate: dimensiunea potrivită este cel mai mic index care stabilește identitatea și direcționează un consumator către surse întreținute, fără a ascunde distincții cheie.
Elemente obligatorii
Indexul trebuie să fie plictisitor în cel mai bun sens: previzibil, explicit și ușor de diferențiat. Plasează interpretarea critică înaintea linkurilor opționale, astfel încât o citire parțială să nu producă o concluzie falsă.
| Element | Întotdeauna sau condiționat | Poziție | Regulă de producție |
|---|---|---|---|
| bloc de răspuns direct | Întotdeauna | Primele rânduri după H1 | Numește organizația și menționează ce oferă site-ul într-un limbaj care stă singur. |
| prezentare generală rapidă și cuprins | Condiționat | După descriere | Folosește titluri Markdown simple ca navigare atunci când există mai multe grupuri de resurse; nu adăuga un cuprins web decorativ fișierului raw. |
| tabel de specificații | Condiționat | Pagina de implementare orientată către oameni | Documentează endpointul, formatul, deținătorul, sursa de generare, validarea și declanșatoarele de reîmprospătare; evită tabelele HTML în fișierul raw. |
| casetă de notă | Condiționat | Lângă îndrumarea de interpretare | Clarifică faptul că îndrumarea de indexare nu înlocuiește permisiunile, politicile sau faptele paginilor de destinație. |
| casetă de avertizare | Condiționat; obligatoriu pentru risc de expunere | Înaintea îndrumării despre capacități sau date private | Numește riscul și sursa sigură; nu plasa niciodată secrete, tokenuri, endpointuri ne-publice sau date ale clienților într-un manifest public. |
| bloc surse | Întotdeauna pe pagina de implementare | După specificație | Numește convenția, sistemele interne de adevăr sursă și dovezile de validare, fără a implica o standardizare nesuportată. |
| ștampilă de prospețime | Întotdeauna | La sfârșitul indexului raw sau aproape de începutul înregistrării de implementare | Menționează ultima verificare substanțială și rolul deținătorului. |
| jurnal de actualizări | Condiționat | Pagina de implementare orientată către oameni | Înregistrează modificări ale domeniului, destinațiilor importante, capacităților sau regulilor de generare — nu modificări de punctuație. |
| bloc de conținut similar | Întotdeauna pe pagina de implementare | Înainte de FAQ | Trimite la controale de acces, date structurate, date despre produs și îndrumări de măsurare, cu un motiv pentru fiecare. |
| structură FAQ | Întotdeauna pe pagina de implementare | Înainte de CTA | Răspunde la întrebări reziduale despre adoptare, domeniu, securitate, duplicare și întreținere. |
| bloc CTA | Întotdeauna pe pagina de implementare | Element final | Oferă o acțiune de validare, monitorizare sau implementare potrivită pentru un cititor în stadiul de considerare. |
Frontmatter
Urmărește specificația frontmatter
. Pe această specificație de tip postare, folosește entity = "post-type-llms-txt-page" și schemaType = "Article". Pe o pagină de implementare orientată către oameni pentru o organizație specifică, folosește o identitate stabilă precum acme-ai-access-index, nu o frază de campanie sau o dată.
Folosește Article deoarece pagina web explică implementarea. marcajul schema
descrie conținutul vizibil; nu transformă fișierul text raw într-un protocol de agent recunoscut. Nu marca pagina drept SoftwareApplication, Dataset sau HowTo decât dacă conținutul său vizibil și șablonul îndeplinesc în mod independent cerințele relevante.
Fișierul raw /llms.txt nu are de obicei frontmatter, deoarece frontmatter-ul nu trebuie să se scurgă în rezultatul publicat. Stochează metadatele sale operaționale în CMS, configurația generatorului sau înregistrarea depozitului: domeniul canonic, domeniul lingvistic, deținătorul, colecția sursă, modul de generare, ultima dată de verificare, următoarea regulă de revizuire, rezultatul validatorului și destinația de alertare. Dacă există fișiere localizate, documentează regula de selecție și păstrează un răspuns canonic rădăcină neambiguu.
Exemplu complet
Acest fișier fictiv demonstrează un index concis pentru o platformă SaaS. URL-urile, produsul și capacitatea sunt exemple; modelul este specificația.
# Northstar Analytics
> Northstar Analytics este o platformă de raportare pentru echipele operaționale. Acest index trimite la paginile publice care definesc produsul, planurile, documentația, politicile și capacitatea agentului suportată.
Permisiunile de acces sunt controlate de robots.txt, autentificare și politicile linkate mai jos. Acest fișier nu acordă acces sau permisiunea de a reutiliza conținutul.
## Produs
- [Prezentare generală produs](https://www.northstar.example/product): Domeniul actual al produsului și fluxurile de raportare suportate.
- [Planuri și prețuri](https://www.northstar.example/pricing): Planurile publice actuale, funcționalitățile incluse și termenii de facturare.
- [Integrări](https://www.northstar.example/integrations): Sursele de date suportate și sistemele de destinație.
## Documentație
- [Acasă documentație](https://docs.northstar.example/): Documentația curentă pentru utilizatori și administratori.
- [Referință API](https://docs.northstar.example/api/): Endpointuri publice, scheme, autentificare, erori și limite de rată.
- [Note de lansare](https://docs.northstar.example/releases/): Modificări datate ale comportamentului produsului și API-ului.
## Încredere și suport
- [Securitate](https://www.northstar.example/security): Programul de securitate și documentele curente de asigurare.
- [Politica de confidențialitate](https://www.northstar.example/privacy): Procesarea datelor, păstrarea și drepturile utilizatorilor.
- [Suport](https://www.northstar.example/support): Rutele de contact suportate și linkul de stare a serviciului.
## Capacitate agent
- [Acțiunea de export raport](https://docs.northstar.example/agents/export-report): Contract de acțiune autentificată, date de intrare acceptate, format de ieșire, limite de rată și gestionarea erorilor. Disponibilitatea depinde de planul și rolul utilizatorului.
## Opțional
- [Bibliotecă de cercetare](https://www.northstar.example/research): Rapoarte de referință originale, cu metode și date de publicare.
Verificat la 2026-08-27 de echipa de Documentație Operațională. Generat din registrul canonic de resurse publice; validează după modificări ale produsului, planurilor, politicilor, API-ului sau URL-urilor.
Exemplul declară o singură capacitate deoarece există un contract de acțiune real și documentat. Dacă produsul nu are nicio acțiune de agent suportată, omite acea secțiune. Nu deduce niciodată o capacitate tranzacțională din prezența unei casete de căutare, a unui formular sau a unui endpoint nedocumentat.
Pentru un manifest de agent stocat separat de /llms.txt, păstrează aceeași disciplină. Specifică un format versionat, identificator canonic, endpoint de producție, metodă de autentificare, operații permise, schemă de intrare și ieșire, limite de rată, granițe de consimțământ, stări de eroare și URL-uri de politici. Validează-l împotriva sistemului live. O declarație sintactic validă care publicită o acțiune dezactivată este tot greșită.
Galerie de design
Fișierul raw are puțin design vizual intenționat. Variantele din galerie ar trebui să testeze arhitectura informației, ordinea de scanare, lizibilitatea mobilă a paginii de implementare umană și dovezile operaționale — nu decorul.
Listă de verificare a calității
Publică doar atunci când fiecare afirmație aplicabilă este adevărată:
- Fișierul se rezolvă la URL-ul rădăcină intenționat fără autentificare, bucle de redirect, pereți de consimțământ sau o carcasă de aplicație randată.
- Răspunsul este text simplu sau Markdown lizibil, folosește UTF-8 și nu depinde de JavaScript pentru a-și dezvălui conținutul.
- H1 oferă numele canonic al organizației sau site-ului, iar descrierea menționează scopul, publicul și domeniul fără sloganuri.
- Fiecare URL linkat este canonic, public, indexabil prin politică, accesibil și deținut de organizație sau clar etichetat ca extern.
- Descrierile linkurilor spun ce autoritate deține destinația; nu repetă text generic de ancoră precum „află mai multe."
- Sursele primare de produs, prețuri, documentație, politici și suport sunt în acord cu indexul.
- Paginile de arhivă, rezultatele de căutare, parametrii de urmărire, locale duplicate, paginile de campanie și paginile de tag-uri de valoare redusă sunt excluse.
- Afirmațiile despre capacități corespund unui contract live, suportat, autentificat și includ constrângerile relevante.
- Nu apare niciun secret, token, endpoint privat, date personale, document al clientului, element de drum nepublicat sau detaliu de implementare sensibil la securitate.
- Limbajul privind accesul, permisiunile, licențierea și politicile trimite la sursele de control și nu este contrazis de index.
- Fișierul nu pretinde un clasament garantat, citare, excludere de la instruire sau suport universal al consumatorilor.
- Domeniul lingvistic și cel regional sunt explicite oriunde prețurile, politicile, disponibilitatea sau documentația diferă.
- Deținătorul, registrul sursă, procesul de generare și metoda de validare sunt înregistrate în afara sau la sfârșitul fișierului.
- Verificări de linkuri rupte, redirecturi neașteptate, status de răspuns, hash de conținut și secțiuni obligatorii rulează după implementările relevante.
- Data verificării se modifică doar după ce destinațiile, descrierile, capacitățile și politicile sunt verificate substanțial.
Greșeli comune
Tratarea fișierului ca pe un sitemap. Un inventar complet de URL-uri distruge prioritizarea și este greu de revizuit. Păstrează sitemapurile XML pentru descoperire; curatoriază llms.txt în jurul surselor autoritare și al grupurilor semnificative.
Tratarea lui ca pe un control al accesului. O solicitare în Markdown nu este un strat de aplicare. Exprimă regulile de crawl în robots.txt, protejează resursele private cu autentificare și plasează cerințele obligatorii în politica relevantă și controalele sistemului.
Copierea conținutului destinației în index. Prețurile, specificațiile produselor și politicile repetate deviază. Rezumă doar suficient pentru a identifica autoritatea, apoi trimite la sursa întreținută.
Publicarea de capacități speculative. Un formular nedocumentat sau o rută API nu face un site pregătit pentru agenți. Declară doar acțiunile suportate în producție, cu autentificare, scheme, constrângeri, erori și un deținător.
Includerea a tot „pentru orice eventualitate." Mai multe linkuri creează mai multă ambiguitate și mai multe puncte de eșec. Conținutul opțional ar trebui să-și câștige includerea răspunzând unei nevoi probabile de regăsire pe care secțiunile primare nu o acoperă.
Expunerea de material privat. Fișierele publice citibile de mașinări sunt publice. Nu lista niciodată hosturi de staging, API-uri interne, acreditări, exporturi de clienți, documente nepublicate sau detalii de securitate care nu au fost aprobate intenționat pentru publicare.
Generarea fără guvernanță. Automatizarea poate reproduce date sursă proaste cu viteză. Un generator are nevoie de un registru sursă aprobat, reguli de excludere, ordonare deterministă, validare, deținător de revizuire și alerte de implementare.
Editarea manuală a unui fișier generat. Următoarea generare suprascrie corecția. Corectează înregistrarea sursă sau generatorul, regenerează și înregistrează modificarea materială.
Pretinderea de rezultate nesuportate. „Acest lucru garantează citări AI" transformă o convenție de implementare incertă într-o promisiune înșelătoare. Raportează dovezile de accesibilitate și regăsire separat de rezultatele de vizibilitate și citare.
Actualizarea datei fără a verifica realitatea. Un timestamp nou nu poate repara un URL de documentație mort, un plan redenumit sau o acțiune dezactivată. Verificarea înseamnă compararea fiecărei declarații importante cu sursa sa de producție.
Linkuri interne
Trimite pagina de implementare umană în sus către tipurile de postări SEO atunci când un autor trebuie să distingă indexul mașină de un director, o pagină de documentație sau o politică. Trimite de la fiecare afirmație operațională la sursa sa de control: domeniul produsului la pagina de produs, prețurile curente la prețuri, comportamentul la documentație, permisiunile la controalele de acces și obligațiile la politică.
Fișierul raw ar trebui să folosească URL-uri canonice absolute, deoarece poate fi preluat în afara navigației normale a site-ului. Preferă o singură destinație autoritară per fapt. Dacă două pagini se suprapun, rezolvă proprietatea înainte de a le lista pe ambele; indexul ar trebui să expună ierarhia surselor, nu să memorializeze un dezacord intern.
Folosește nume de secțiuni scurte și stabile, precum Produs, Documentație, Politici și Capacități agent. Păstrează variantele lingvistice în grupuri clar etichetate doar atunci când diferă substanțial. Nu trimite la fiecare articol de blog; selectează doar cercetări sau ghiduri durabile atunci când ajută un sistem să înțeleagă subiectul și dovezile site-ului.
Linkurile de intrare contează și operațional. Documentația, portalurile de dezvoltatori și îndrumările de accesibilitate AI ar trebui să trimită întreținătorii către înregistrarea de implementare, iar înregistrarea să trimită la fișierul live și la validator. Aceasta creează o cale de revizuire pentru oameni fără a aglomera indexul mașină.
Cum să măsori rezultatele
Măsoară fișierul mai întâi ca infrastructură și apoi ca factor de vizibilitate. O creștere a citărilor nu poate fi atribuită llms.txt doar pentru că ambele s-au întâmplat după publicare.
Urmărește patru straturi:
- Disponibilitate: statusul răspunsului URL-ului rădăcină, comportamentul de redirect, tipul de conținut, codarea, latența, independența de randare și uptime-ul.
- Integritate: succesul parsării, secțiunile obligatorii, URL-urile duplicate, linkurile rupte, țintele de redirect, nepotrivirea canonică, domeniile neautorizate, secretele expuse și modificările hash-ului de conținut.
- Prospețime: zile de la ultima verificare substanțială, modificări ale destinațiilor de la verificare, acoperirea registrului sursă, confirmarea deținătorului și timpul de reparare a derivei.
- Rezultate: preluări din jurnalul serverului de către agenți identificabili, acolo unde este legal și tehnic adecvat, vizite la destinațiile indexate, citări AI ale paginilor canonice preferate și acuratețea răspunsurilor pentru întrebări urmărite despre brand sau produs.
Stabilește o bază de referință înainte de implementare: ce URL-uri sunt citate, ce fapte sunt denaturate, dacă fișierul rădăcină există și ce crawllere îl solicită. Adnotează publicarea și fiecare actualizare materială. Compară ferestre de observație suficient de lungi pentru a evita citirea unei singure preluări sau citări drept tendință și păstrează distincția dintre corelație și cauzalitate.
Testează modurile de eșec direct. Redenumește o copie de staging a unui URL listat și confirmă că validatorul detectează ruperea. Schimbă o mapare canonică și confirmă că generatorul actualizează indexul. Dezactivează o capacitate într-un mediu de test controlat și confirmă că verificarea manifestului eșuează. Aceste teste dovedesc sistemul de întreținere, nu adoptarea externă.
Folosește cum măsurăm rezultatele pentru a separa disponibilitatea tehnică, reprezentarea mașină, descoperirea, citarea, implicarea și rezultatele de afaceri. În AmICited, revizuiește fișierul live sub Agent Accessibility și folosește raportul Cockpit pentru a observa URL-urile citate și vizibilitatea AI alături de adnotările de implementare. Afirmația credibilă de succes este „fișierul este valid, actual și direcționează sistemele către sursele intenționate"; orice modificare descendentă a vizibilității necesită dovezi separate.
FAQ
Întrebări frecvente
Ce este o pagină llms.txt?
Este llms.txt același lucru cu robots.txt sau un sitemap XML?
Publicarea llms.txt îmbunătățește clasamentele sau garantează citări AI?
Ce trebuie inclus într-un manifest de agent?
Ar trebui fiecare site să publice un fișier llms-full.txt?
Cât de des ar trebui revizuit llms.txt?
Mai multe tutoriale în această secțiune
Gata să pui în practică?
Verificare gratuită · Perioadă de încercare de 7 zile · card de credit necesar