JavaScripti ja üheleherakenduste crawlimine
LinkSweep crawlib JavaScriptiga renderdatud saite nii, nagu brauser neid näeb. Kui lehe toores HTML on tühi raamistiku kest — mis on tavaline Reacti, Vue, Angulari, Next.js-i ja Nuxti puhul — tuvastab LinkSweep selle ja renderdab lehe peata Chromiumi kaudu uuesti, seejärel skaneerib täielikult renderdatud DOM-i katkiste linkide, piltide ja SEO-probleemide osas. See loeb sinu robots.txt-i ja saidikaardi sama brauseri kaudu, nii et crawlib läbi kogu saidi, mitte ainult avalehe.
Enamik linkide kontrollijaid loeb ainult toorest HTML-i, mille su server tagastab. Kaasaegses kliendipoolel renderdatud rakenduses on see HTML sageli tühi kest — ei sisu ega navigatsiooni — nii et lihtne crawler näeb üht tühja lehte ja peatub. LinkSweep saab nende saitidega hakkama ilma sinupoolse seadistuseta.
Kuidas see töötab
- Kiire esimene läbimine. LinkSweep loeb toorest HTML-i, mille su server tagastab, nagu iga crawler — kiiresti ja kergelt paljude serveripoolel renderdatud saitide jaoks.
- Kesta tuvastamine. Kui leht on kliendipoolel renderdatud kest ilma päris sisu või linkideta, tunneb LinkSweep ära raamistiku signatuuri — Next.js, Nuxt, Gatsby, Remix, Angular, React või üldine JavaScripti kimp.
- Päris brauseri renderdus. See laadib iga lehe uuesti peata Chromiumi renderdaja (Playwright) kaudu, mida majutatakse LinkSweepi enda EL-serverites, ja skaneerib täielikult renderdatud DOM-i.
- Kogu saidi avastamine. See loeb sinu robots.txt-i ja XML-saidikaardi sama brauseri kaudu, nii et leiab ja crawlib läbi iga lehe — mitte ainult sisenemispunkti — isegi kui toores HTML ei sisalda linke.
Mida see JavaScripti saitidel tuvastab
- Katkised lingid, mille lisab kliendipoolne marsruutimine ja mida toores HTML ei sisalda
- Katkised ja laisalt laaditud pildid, mis ilmuvad alles pärast renderdust
- Puuduvad või dubleerivad pealkirjad, metakirjeldused ja Open Graph -sildid renderdatud
<head> - Lehed, mis ei renderdu kunagi — tühjad kestad ja hüdratsioonitõrked, mille olekukoodi monitor teataks tervena
Raamistikud, mille see ära tunneb
React, Vue, Angular, Next.js, Nuxt, Gatsby, Remix ja SvelteKit — ning üldised JavaScripti kimbud. Midagi pole vaja seadistada: tuvastamine ja üleminek brauseri renderdusele on automaatsed, iga lehe kohta.
Sama päris brauser tuleb toime bot-kaitsega
Turvateenused nagu Akamai ja DataDome esitavad JavaScripti väljakutse, mida tavaline HTTP-crawler ei suuda lahendada. Kuna LinkSweep suudab renderdada päris brauseris, proovib see väljakutset peata Chromiumi kaudu uuesti ja, kui see on lahendatud, crawlib ülejäänud saidi sinu saidikaardilt renderdusrežiimis. Kui tulemüür seda ikka blokeerib, ütleb LinkSweep, milline teenus, ja annab sulle ühekordse lubatud loendi juhendi. Vaata võrdlust teiste tööriistadega võrdluslehel.
Ausad piirangud
Räägime pigem, mida LinkSweep ei suuda, kui lubame liiga palju:
- Kui sait tarnib puhta kliendipoolel renderdatud kesta ja isegi päris brauser ei suuda selle navigatsiooni esile tuua, siis LinkSweep ei oleta — see teatab lehest kui JavaScriptiga renderdatud saidist ja soovitab lubada serveripoolse renderduse (SSR) või eelrenderduse, tavaliselt ühe rea konfiguratsioonimuudatus.
- Sisu, mis on sisselogimise taga või mis laadib alles pärast kasutaja tegevust (lõputu kerimine, klõpsuga laadimine), ei crawlita.
Korduma kippuvad küsimused
Kas LinkSweep töötab Reacti, Vue ja Next.js-i saitidega?
Jah. Kui lehe toores HTML on tühi raamistiku kest, tuvastab LinkSweep raamistiku ja renderdab lehe peata Chromiumi kaudu uuesti, seejärel skaneerib täielikult renderdatud DOM-i katkiste linkide, piltide ja SEO-probleemide osas. Seadistust pole vaja.
Kas pean JavaScripti renderduse jaoks midagi seadistama?
Ei. LinkSweep loeb esmalt toorest HTML-i, mille su server tagastab, ja lülitub brauseri renderdusele ainult siis, kui tuvastab kliendipoolel renderdatud kesta. Tuvastamine ja üleminek on automaatsed.
Kuidas LinkSweep leiab kõik mu lehed, kui lingid lisab JavaScript?
See loeb sinu robots.txt-i ja XML-saidikaardi sama peata brauseri kaudu ja crawlib sealt edasi, nii et avastab kogu su saidi isegi siis, kui toores HTML ei sisalda navigatsioonilinke.
Kas see suudab crawlida JavaScripti saiti Cloudflare'i või Akamai taga?
Sageli jah. Sama peata Chromiumi tee lahendab JavaScripti bot-kaitse väljakutsed teenustelt nagu Akamai ja DataDome. Kui tulemüür ikka crawlerit blokeerib, tuvastab LinkSweep, milline see on, ja annab sulle ühekordse lubatud loendi juhendi.
Kus JavaScripti renderdus toimub?
LinkSweepi enda serverites EL-is (Eestis), kasutades ise-majutatud peata Chromiumi (Playwright). Sinu URL-e ei saadeta ühelegi kolmanda osapoole renderdusteenusele.
Skaneeri oma JavaScripti sait tasuta
Tee kogu saidi skaneering ja vaata probleeme, mida olekukoodi monitor ei märka. Krediitkaarti pole vaja.