Iparági jelentés #001
Mit árul el az egészségügy webtopológiája az AI-felkészültségről
Tizenegy Fortune 500 egészségügyi oldal elemzése szerint nagyjából minden negyedik lap nem érhető el a kezdőlapról belső szerkesztői linkeket követve, és a topológiai hibamódok, amelyek az egyik oldalt megbénítják, ritkán bénítják meg ugyanúgy a következőt.
A lényeg
A 2026 első negyedévében bejárt tizenegy Fortune 500 egészségügyi oldalon, összesen 7 125 lapon és 11,1 millió token nyilvános tartalmon, a tartalom nagyjából negyede nem érhető el úgy, hogy a kezdőlapról belső szerkesztői linkeket követünk. Az XML-sitemap a lapok többségét megmenti a sitemapet olvasó keresőmotor-crawlerek számára, de marad egy maradék: minden tizenkettedik lap szerkezetileg láthatatlan: nincs szerkesztői út hozzá a kezdőlapról, és a sitemapben sem szerepel. URL-ként létezik az oldalon, de sehol sem hirdetik, ahol egy magára hagyott crawler megtalálhatná.
A következmény közvetlen. Amikor egy linkkövető AI-ügynököt egy nagy egészségügyi márkáról kérdeznek, a márka lapjainak nagyjából negyede nincs abban a válasz-térben, amit az ügynök magától elér. Ennek a résnek egy jelentős szelete olyan tartalom, amit az oldal maga a crawlereknek sem hirdet.
A háromszintű elérhetőségi modell
Egy oldal minden lapja a három elérhetőségi szint egyikébe esik:
- Belső linkeken elérhető. Létezik olyan út a kezdőlapról, amely szerkesztői (tartalmon belüli) linkeket követve vezet a laphoz. Ezek azok a lapok, amelyeket egy linkkövető AI-ügynök magától megtalál.
- Csak a sitemapben. A lap szerepel az oldal XML-sitemapjében, de nem vezet hozzá belső szerkesztői linkút. A sitemapet olvasó crawlerek indexelik. Az ügynökök, amelyek nem olvassák, nem.
- Szerkezetileg elérhetetlen. A lap sem szerkesztői linkeken nem érhető el, sem a sitemapben nincs jelen. URL-ként létezik az oldalon, de sehol sem hirdetik, ahol egy magára hagyott crawler megtalálhatná. Hogy egyáltalán felbukkan-e egy keresésben, az más oldalakról érkező külső bejövő linkeken múlik.
A 11 oldalas egészségügyi mintánkon átlagolva:
Az átlagok elfedik, milyen egyenetlenül oszlik el a hiba. Az alábbi oldalankénti pontsávon a tizenegyből négy oldal szerkezetileg-elérhetetlen aránya nulla vagy annak közelében van: a szerkesztői gráfjuk és a sitemapjük egyetért abban, mi az oldal. A maradék hét 0,4% és 34,7% között szóródik, és az egyik oldal a lapjainak teljes harmadát teszi ki minden hirdetett úton kívülre.
Adatok megtekintése
| Oldal | Szerkezetileg elérhetetlen laparány (az oldal lapjainak %-a) |
|---|---|
| SH1 | 0% |
| SH3 | 0% |
| SH6 | 0% |
| SH9 | 0% |
| SH2 | 0.4% |
| SH5 | 2.9% |
| SH11 | 7% |
| SH4 | 11.1% |
| SH10 | 11.3% |
| SH7 | 20% |
| SH8 | 34.7% |
| Mintaátlag | 7.9% |
Egészségi mutatók: a hibamódok nem esnek egybe
A hagyományos intuíció szerint az árvák (a befelé mutató szerkesztői link nélküli lapok) a domináns szerkezeti probléma. Az egészségügyi F500 adatok érdekesebb történetet mesélnek: a legrosszabb árva-arányú oldalak nem ugyanazok, mint a legrosszabb zsákutca-arányúak.
Adatok megtekintése
| Oldal | Árva-arány (az oldal lapjainak %-a) |
|---|---|
| SH2 | 0.4% |
| SH1 | 2.3% |
| SH11 | 2.8% |
| SH8 | 3.6% |
| SH6 | 4.2% |
| SH10 | 12.3% |
| SH4 | 13.4% |
| SH5 | 19.1% |
| SH7 | 20.2% |
| SH9 | 22.4% |
| SH3 | 42.6% |
| Mintaátlag | 13% |
Adatok megtekintése
| Oldal | Zsákutca-arány (az oldal lapjainak %-a) |
|---|---|
| SH2 | 0% |
| SH6 | 0% |
| SH5 | 0.5% |
| SH3 | 1.2% |
| SH4 | 1.8% |
| SH1 | 4.5% |
| SH9 | 14.7% |
| SH10 | 15.8% |
| SH7 | 20.5% |
| SH8 | 29.1% |
| SH11 | 72% |
| Mintaátlag | 14.6% |
Vesd össze a két sávot. A legmagasabb árva-arányú oldalnak (SH3, 42,6%) csaknem a legalacsonyabb zsákutca-aránya van (1,2%). A legmagasabb zsákutca-arányú oldalnak (SH11, 72,0%) csaknem a legalacsonyabb árva-aránya (2,8%). Ezek független hibamódok, nem ugyanannak a problémának a két arca.
A pontsávok azt is megmutatják, hogy a zsákutca-arányok szórása nagyobb, mint az árva-arányoké. Az árvák a tizenegyből tíz oldalon 0,4% és 22,4% között csoportosulnak, egy oldal pedig 40% fölé fut. A zsákutca-arányok a tizenegyből tízen egyenletesebben terülnek szét 0% és 30% között, majd a szélsőséges esetben 72%-ra ugranak.
A tanulság egy linkszerkezetet bejáró AI-ügynök számára: egy árva hiányzó belépési pont, egy zsákutca viszont keringési végpont. Mindkettő megbukik az ügynök azon elvárásán, hogy egy lapra megérkezni további lapok felfedezését jelenti. Ezeken az egészségügyi oldalakon a hiba ritkán csak az egyik vagy a másik. A legtöbb oldalon a kettő közül legalább az egyik a piros tartományban van.
Az iparági pontozótábla
Az ötlencsés elemzés minden oldalnak zöld, sárga vagy piros pontszámot ad mind az öt lencsén. A mintán:
| Oldal | Váz Méret, sűrűség és átlagos úthossz. Mekkora az oldal, és mennyire összekapcsolt a törzs szintjén. | Keringés PageRank-eloszlás és szerkezeti szűk keresztmetszetek. Hogyan áramlik a fontosság a lapok között, és mely csomópontok tartják össze az egészet. | Szervek Közösségdetektálás. A tematikus klaszterek tisztán elválnak-e, vagy egyetlen óriásklaszter ural mindent. | Egészség Szigetek, árvák és zsákutcák. Hol haldoklik szerkezetileg a tartalom: elérhetetlen, linkeletlen vagy lezáruló. | Idegrendszer Kattintási mélység, hidak és közösségek közötti linkelés. Az oldal jól tervezett épület-e, vagy összefüggéstelen szobák halmaza. |
|---|---|---|---|---|---|
| SH1 | |||||
| SH2 | |||||
| SH3 | |||||
| SH4 | |||||
| SH5 | |||||
| SH6 | |||||
| SH7 | |||||
| SH8 | |||||
| SH9 | |||||
| SH10 | |||||
| SH11 |
- Zöld: egészséges
- Sárga: mérsékelt aggály
- Piros: kritikus
A minta a hőtérképen: a vázak és a keringés többnyire rendben vannak. Az Egészség és a Szervek a gyenge pontok. A tizenegyből tíz oldal zöld vázat kap, a maradék egy sárgát, vagyis a linksűrűség a törzs szintjén egészséges. De a tizenegyből három piros az Egészségen, és csak kettő zöld, miközben a tizenegyből négy piros a Szerveken. A kép következetes: az egészségügyi F500 oldalak a felszínen jól megépítettek, és hibásak azon a szinten, ahogy a szerkesztői jel a tematikus közösségek között utazik.
Kattintási mélység: az elérhetőség adója
Még a technikailag elérhető lapok is ülhetnek messze a kezdőlaptól. A kohorsz átlagos maximális kattintási mélysége 7,3 kattintás; az egyik oldalon vannak 14 kattintás mélyen lévő lapok. A mintán átfutva a lapok 21%-a él 4-es vagy nagyobb kattintási mélységben.
| Kattintási-mélység mutató | Mintaátlag (n=11) | Tartomány |
|---|---|---|
| Maximális kattintási mélység | 7,3 kattintás | 3–14 |
| Átlagos kattintási mélység | 3,2 kattintás | 1,7–4,2 |
| Lapok ≥4 mélységben | 21,0% | 0%–37% |
Két rezsim él egymás mellett. Öt oldal maximális mélysége három-öt kattintásnál tetőzik: vagy a kezdőlap keveset ér el szerkesztői linkeken, vagy az egész linkgráf lapos legyező, nem hierarchia. A másik véglet az SH6 a 14-es mélységgel, egy mély, de lineáris gráf, ahol egyes lapokhoz tizennégy szerkesztői ugrás kell a belépési ponttól. Az AI-ügynökök és a hagyományos crawlerek egyaránt a sekély utak felé hajlanak. Egy lap, amelyhez hét vagy több szerkesztői ugrás kell, a gyakorlatban csak annyira felfedezhető, amennyire a sitemap-sora.
Tartalomminőség léptékben
Mind a tizenegy oldal együtt: 7 125 lap, 11,1 millió token törzsszöveg, és nagyjából 257 000 belső szerkesztői link közöttük.
| Tartalmi mutató | Mintaátlag (n=11) | Megjegyzés |
|---|---|---|
| Lap per oldal | 648 | Medián 699, tartomány 239–998 |
| Átlagos szószám per lap | 874 | Medián 605; hosszú lapok hosszú farka |
| Átlagos tokenszám per lap | ~1470 | Karakter-alapú becslés (hossz / 4) |
| Vékony tartalmú lapok (200 szó alatt) | 17,2% | Tartomány 0%–37% |
| Nulla tartalmú lapok | ~1% | A „redirect / héj-oldal” arány |
| Belső és külső linkek aránya | 82% belső | Az egészségügyi oldalak többnyire önmagukra linkelnek |
| Title-tag lefedettség | 99,5% | Szinte univerzális |
| Meta-leírás lefedettség | 80,5% | Minden ötödik lapról hiányzik a leírás |
A vékony-tartalom szám az, amit figyelni érdemes. A kohorsz átlagos oldalán minden hatodik lap 200 szónál rövidebb. Ezek azok a lapok, amelyek legalább annyira a sitemapnek léteznek, mint az olvasónak: redirect-célok, navigációs csonkok, lokációs oldalak, egy-állítású landoló oldalak, archivált esemény-összefoglalók. Egy AI-ügynök szemszögéből gyenge jelek: túl kevés szöveg egy magabiztos összefoglaló rögzítéséhez, de elég ahhoz, hogy telezsúfoljanak egy tudásgráfot. Némelyik vékony lap legitim (egy kategória-landoló, amely a gyerekeire delegál). A 17,2%-os mintaátlag a jelzésre érdemes rendszerszintű hányad, nem az egyes lap.
Mit oszt meg minden egészségügyi F500 oldal
Minden oldal egyetlen legnagyobb URL-szakaszát nézve egy következetes alak rajzolódik ki. A tizenegyből hat oldal domináns tartalomtípusa egy sajtóközlemény- / hír- / hírszoba-szakasz; azokon az oldalakon, ahol ez a szakasz létezik, rendszeresen az összes bejárt lap 40% és 80% közötti részét adja.
A kohorsz domináns mintája a sajtóközlemények / hírek / hírszoba valamilyen változata. A minta fele hordozza ezt az archetípust, és azokon az oldalakon átlagosan az összes bejárt lap felét adja. Az ebben a kötegben szereplő egészségügyi F500 oldalak szerkezetileg hírarchívumok, tetejükön egy vékony termékréteggel.
Ez az egyetlen építészeti döntés végiggyűrűzik a fenti topológiai mutatók többségén. A sajtóközlemény-tartalom nagy volumenű, gyorsan avuló, és ritkán linkel keresztbe a saját dátum-silóján kívülre. Egy 2018-as negyedéves eredményközlemény aligha linkel egy 2024-es termékbevezetésre, és fordítva. Az eredmény pontosan az a topológia, amit mértünk: mély kattintási mélység, a hír-silóban koncentrálódó magas árva- és zsákutca-arányok, kevés szakaszok közötti linkelés. A legtöbb egészségügyi F500 oldal nem valami szokatlan módon hibás építészetileg. Sajtóközlemény-archívumok, amelyek történetesen terméklapokat is hostolnak.
Mit jelent ez az AI-keresési felkészültség szempontjából
Két különböző AI-fogyasztási minta másképp lép kölcsönhatásba a három elérhetőségi szinttel. Az indexelő crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) beolvassák a sitemap.xml-t, és a 2. szintű, csak-sitemapben lapokat ugyanúgy elérik, mint a Googlebot; számukra a szerkezetileg elérhetetlen 7,9% a releváns rés. A másik eset az ügynöki böngészés lekérdezéskor: egy LLM, amely valós időben követ belső linkeket egy konkrét kérdés megválaszolásához („mit kínál ez a cég az onkológiában?”). Ez a mód link-kötött. Nem tölti be előre a sitemapet; azt járja be, ami szerkesztőileg linkelve van onnan, ahol landol. Az ügynöki esetben a teljes 27%-os, linkeken elérhetetlen szám van játékban.
A szerkezeti probléma mindkét rezsimben számít, de a másodikban élesebben. A szakasz hátralévő része a linkkövető esetről szól.
Egy AI-ügynöknek, amely a belső linkszerkezetet használja tartalom felfedezésére és rangsorolására, három következmény adódik ezekből az adatokból.
1. A tartalom nagyjából negyede láthatatlan egy linkkövető ügynök számára. A 27%-os átlagos, linkeken elérhetetlen arány azt jelenti, hogy minden három lapra, amiről az ügynök bejárással tudomást szerez, jut nagyjából még egy, amit sosem lát. A tipikus oldal nagyjából 19%-át a sitemap menti meg (a sitemapet olvasó crawlerek számára); a maradék 8% láthatatlan minden számára, ami nem ismeri eleve az URL-t.
2. Még az elérhető lapok is gyakran sehová sem vezetnek. A zsákutca-arány nem hiányzó-lap probléma; keringési probléma. Az ügynök megérkezik a lapra, de semmit sem tud meg arról, mi van mellette. A tematikus városrészek nem épülnek fel, mert a linkek, amelyek felépítenék őket, nem léteznek. Ez érinti azt, hogyan válaszol az ügynök olyan kérdésekre, mint „mi mást kínál még ez a cég ezen a területen?” A válasz-tér szükségtelenül beszűkül.
3. A sajtóközlemény-tartalom elnyomja a terméktörténetet. Amikor egy hír / hírszoba szakasz az oldalak bejárható lapjainak nagyjából felét adja átlagosan azon az oldal-felen, ahol ez a minta dominál, és a szerkesztői linkelés többnyire a dátum-silón belül marad, egy AI-ügynök arra a kérdésre, hogy „mit csinál ez a cég?”, azt a választ kapja, hogy „sajtóközleményeket ad ki”. A terméktörténet, amit a marketingcsapat a felszínen szeretne látni, relatíve alul-linkelt marad az alapból létező hírarchívum-tartalomhoz képest.
A megoldás nem több tartalom, több lap vagy egy újratervezés. Szerkezeti: a zsákutcák lezárása tematikus szomszédokra mutató kimenő linkekkel, az árvák megmentése a közösségeikbe, azoknak a szakaszok közötti hidaknak a felépítése, amelyek egy sajtóközlemény-archívumból valódi termék-gerincű topológiát csinálnak. Ez a Digital MRI szolgáltatás teljes premisszája.
Módszertan
Ez a jelentés tizenegy anonimizált Fortune 500 egészségügyi weboldal topológiai és tartalmi adatait összesíti. Minden oldal ugyanazon a folyamaton ment át: Playwright-alapú tartalmi feltérképezés, törzstartalom-kinyerés (a navigációs, fejléc- és lábléclinkek kiszűrése), gráfépítés globális-nav-link szűrővel, és az ötlencsés topológiai elemzés (Váz, Keringés, Szervek, Egészség, Idegrendszer). Minden azonosító információt semleges kódnevek (SH1-től SH11-ig) váltottak fel; a hozzárendelést ez a jelentés nem teszi közzé. Oldalszintű adat-függelék kérésre elérhető.
A tizenegy oldal kurált kohorsz, nem az egészségügyi iparág véletlen mintája. Az összesített számok (mintaátlagok, tartományok) ezt a köteget írják le, és feltáró referenciaértékekként közöljük őket az F500 egészségügyi topológiához, nem a tágabb szektorra vonatkozó pontbecslésekként. Egy nagyobb, iparágakon átívelő alapvonal készülőben van.
Egy tizenkettedik, eredetileg ebbe a kötegbe szánt Fortune 500 egészségügyi oldal kiesett, miután a crawl-hosztunkról ismételten TCP-szintű hálózati elérhetetlenséget mutatott (geo-blokkolás az oldal peremén). Nem része a fenti számoknak.
Megjegyzés arról, mit mér a „szerkezetileg elérhetetlen”
Ebben a jelentésben a szerkezetileg elérhetetlen olyan lapokra utal, amelyekhez nem vezet belső szerkesztői linkút a kezdőlapról, és nincsenek benne az oldal XML-sitemapjében. Ez annak a mértéke, hogy az oldal maga mennyire hirdeti szerkezetileg a lapot, nem a lap keresőmotoros indexeltségi állapotáé. Azok a lapok, amelyeket az oldal maga jelöl nem-indexelhetőnek, kimaradnak a számításból.
A kezdőlap azért a horgony, mert az a lap, amit a crawlerek és az ügynökök szinte mindig elsőként érnek el: a kanonikus belépési pont, amelyre a domain gyökere, a keresési találatok, a külső hivatkozások és a márka saját marketingje is linkel. A felfedezés innen halad kifelé azokon a szerkesztői linkeken át, amelyeket a kezdőlap kitesz. Egy lap, amely ezeket a linkeket követve nem érhető el, gyakorlati értelemben olyan lap, amit az oldal senkinek sem hirdet, aki a főbejáraton érkezik.
Jogi nyilatkozat. Ez az elemzés webtopológiai feltérképezéssel és hálózattudományi módszerekkel készült, beleértve a PageRanket, a Louvain közösségdetektálást és a köztiség-centralitást. A crawler tiszteletben tartja az oldalszintű robots-direktívákat; a tiltott lapokat sosem töltöttük le, és nem részei ennek az adathalmaznak. A navigációs, fejléc- és lábléclinkek automatikusan kizárásra kerültek: bármely link-cél, amely a lapok több mint 80%-án megjelent, globális navigációként lett kezelve, és a topológiai elemzés előtt kikerült a gráfból. Csak a tartalmon belüli (szerkesztői) linkek maradnak. Az oldal által nem-indexelhetőnek jelölt lapok levonásra kerülnek a szerkezetileg-elérhetetlen számból. Minden adat kizárólag nyilvánosan elérhető oldalszerkezetet képvisel. Nem gyűjtöttünk és nem tároltunk tartalmat, metaadatot vagy felhasználói adatot. Minden azonosító információ anonimizált; a kódnév-domain hozzárendelést szándékosan nem publikáljuk. A tokenszámok karakter-alapú becslések (a lap hossza osztva néggyel), nem tokenizáló kimenetek. A kattintási mélységet a kezdőlaptól mért szélességi-bejárásos távolságként mérjük, belső szerkesztői linkeket követve. A statisztikai minták kizárólag oktatási célt szolgálnak, és nem minősülnek tanácsnak semmilyen konkrét oldalról vagy cégről.