
Web scraping na Okou
Dejte agentovi odkaz a on se vrátí s tím, co stránka skutečně říká, v čistém čitelném textu. Žádný dodavatel pro scraping, u kterého byste se museli registrovat.
Webová data · Bez nastavení · Dva režimy fakturace, standardní a rozšířený
Nasměrujte agenta na veřejný odkaz a on vám stránku přečte: slova, nikoli navigační menu, bannery s cookies a zápatí. Požádejte o stránku jako čistý text, nebo jen o seznam odkazů na ní, když je úkolem rozhodnout, co číst dál.
Čtení probíhá na Firecrawl a je tam v okamžiku, kdy o něj požádáte: žádné nastavení, žádný klíč, nic, co by váš tým musel udržovat. Zůstává záměrně úzké: jedna stránka na požadavek. Hledání stránek je práce webového vyhledávání a cokoli za přihlášením nebo kliknutím patří vzdálenému prohlížeči.
Co je Web scraping
Každý výzkumný úkol dosáhne bodu, kdy výsledek vyhledávání nestačí a potřebujete, co stránka skutečně říká. Správné provedení je těžší, než se zdá. Stránky načítají polovinu svého obsahu pomocí skriptů a užitečný text se nachází mezi nabídkami, bannery a reklamami.
Na Okou je tato část již vyřešena za vás. Agent odešle jeden veřejný odkaz a získá stránku zpět jako čistý text, který může číst a shrnout, nebo jako seznam všech odkazů na ní.
Některé stránky odolávají běžnému čtení. Pro ty existuje silnější režim a agent o něj musí požádat, protože stojí více za stránku a měli byste být schopni vidět, kdy si ho pracovní postup vybral.
Je to to samé, co lidé nakupují jako web scraping API. Rozdíl je v tom, že nemusíte nakupovat: je to již v běhu, takže si stránku vyžádáte ve zprávě a agent vám přinese, co je na ní.
Co Web scraping umí
Co s tím agent dokáže a co se vrátí, když to udělá.
Pokrytí a limity
Co nedělá, řečeno předem, aby nikdo neplánoval pracovní postup kolem něčeho, co je mimo rozsah.
Pouze veřejné stránky
Není vyžadováno přihlášení, takže stránka za přihlášením, paywallem nebo botwallem je mimo rozsah. K tomu slouží vzdálený prohlížeč.
Jedna stránka najednou
Přečte stránku, na kterou ho nasměrujete. Neprochází zbytek webu, takže čtení celého webu znamená dotazování stránku po stránce a placení stránku po stránce.
Drahý režim je volba
Většina stránek se čte normálně. Silnější režim stojí více a agent o něj musí požádat, takže pracovní postup nikdy tiše nezdraží.
Co se vrátí, jsou informace, nikoli objednávky
Text z webové stránky je považován za něco ke čtení, nikdy ne za pokyny k následování. To je to, co brání nepřátelské stránce v tom, aby agenta přiměla k něčemu jinému.
Co stojí Web scraping
Webové služby se účtují v kreditech za volání, nikoli za token. Nemusíte kontrolovat samostatnou fakturu dodavatele.
zero scrapeČtení stránky spotřebovává kredity a silnější režim stojí více než ten normální. Nic jiného se nekupuje a není žádné minimum, takže pracovní postup, který čte tři stránky týdně, platí pouze za práci, kterou vykoná.
Názvy produktů a loga patří jejich vlastníkům a jsou zde uvedeny pouze pro označení, na čem služba běží. Neznamenají žádné schválení ani partnerství.
Nastavení a přístup
Nic k nastavení
Nic k připojení. Žádná registrace, žádný klíč k vložení, nic nepřidáno do vašeho seznamu konektorů. To je rozdíl mezi tímto a konektorem Firecrawl v katalogu Okou: konektor funguje s vaším vlastním účtem Firecrawl, pokud ho již máte, a toto je jednoduše k dispozici pro použití jakýmkoli agentem.
Kdo to může použít
Čtení webových stránek je oprávnění, které udělujete, nikoli něco, co má každý agent. Dejte ho agentům a lidem, kteří ho potřebují, na tak dlouho, jak ho potřebují, a vezměte si ho zpět, aniž byste se dotkli čehokoli jiného, co agent může dělat.
K čemu týmy používají Web scraping
Čtení stránky za výsledkem vyhledávání
Vyhledávání vám poskytne titulek a dva řádky. Většina práce vyžaduje tělo, takže vzor je nejprve vyhledat, vybrat dva nebo tři relevantní výsledky a poté přečíst pouze ty.
Sledování stránek, které nemají jinou cestu dovnitř
Ceny konkurence, protokoly změn, stavové stránky, regulační oznámení. Naplánovaný agent přečte stránku, porovná ji s minulým týdnem a upozorní vás pouze, když se něco změnilo.
Přeměna dlouhého dokumentu na pracovní materiál
Specifikace, výroční zpráva, centrum nápovědy. Čistý text je rozdílem mezi souhrnem dokumentu a souhrnem jeho navigačního menu.
Kdy nepoužívat Web scraping
Přeskočte to, když stránka vyžaduje přihlášení, kliknutí nebo formulář, a místo toho použijte vzdálený prohlížeč. Přeskočte to pro čtení celé stránky, kde se náklady na stránku sčítají rychleji, než je hodnota odpovědi. A přeskočte to, když zdroj publikuje vlastní správná data, což je téměř vždy stabilnější než čtení jeho stránek.
Jak se tomu říká jinde
Stejná věc má na trhu několik názvů. Pokud jste si jednu z nich kupovali, takto se to mapuje na to, co zde získáte.
Web scraping API
Obvyklý název pro placení služby za načtení stránky a vrácení jejího textu. Přesně to to je. Účet a klíč patří Okou, nikoli vám.
Scraping bez psaní scraperu
Není co stavět ani udržovat. Požadujete stránku ve zprávě a načítání a čištění probíhá uvnitř běhu.
HTML na Markdown
Konverze, kterou si lidé obvykle píší sami: stránka HTML dovnitř, čistý Markdown ven. Děje se to dříve, než se text vůbec dostane k agentovi, a proto model věnuje svou pozornost obsahu namísto značkování.
AI nebo LLM web scraping
Škrabání, jehož výstup je určen k přečtení modelem, spíše než k parsování kódem. Je to stejné načítání, posuzované podle toho, zda je text čitelný, spíše než podle toho, zda selektor stále odpovídá.
Web scraping bez kódu
Nikdo zde nepíše scraper. Požádáte o stránku ve zprávě a agent provede načítání, což je to, co lidé hledají, když hledají scraping bez kódu.
Web scraping porovnáno
Web scraping vs vytvoření vlastního scraperu
Stejný výstup, velmi odlišné množství práce. Sami si musíte vybrat službu nebo napsat stahovač, klíč, který musí někdo udržovat v bezpečí, a údržbu pokaždé, když se změní tvar stránky. Zde se zeptáte a přečtete si odpověď, a přístup je oprávnění namísto sdíleného tajemství.
Web scraping vs konektor Firecrawl
Okou také dodává konektor Firecrawl, a to je správná volba, pokud již máte účet Firecrawl a chcete tam využívat, nebo potřebujete něco, co tato služba nepokrývá. Vestavěný je správný, když byste se raději jen zeptali a dostali stránku.
Web scraping vs samostatné řízení prohlížeče
Prohlížeč, který ovládáte, je schopnější a mnohem náročnější na práci, a přesto musíte stránku poté převést na čitelný text. Použijte vzdálený prohlížeč, když práce skutečně vyžaduje klikání, a tento, když potřebujete jen to, co stránka říká.
Krátká verze
Výchozí způsob čtení webové stránky na Okou. Pokud je stránka veřejná a chcete, co je na ní, je to jeden krok, bez účtu a poplatek za stránku. Cokoli, co vyžaduje přihlášení nebo kliknutí, patří do vzdáleného prohlížeče.
Často kladené otázky
Potřebuji účet Firecrawl?
Ne. Čtení stránky je něco, co už každý agent umí, takže se stačí zeptat. Není třeba vytvářet účet ani držet klíč.
V čem se to liší od konektoru Firecrawl?
Konektor funguje s vaším vlastním účtem Firecrawl, pokud ho již máte a chcete tam využívat. Vestavěná služba je připravena k použití bez nutnosti konfigurace.
Může číst stránky za přihlášením?
Ne. Otevírá veřejné stránky bez přihlášení. Použijte vzdálený prohlížeč, který může zůstat přihlášen a může ho v průběhu převzít osoba.
Může přečíst celou webovou stránku?
Ne sám o sobě. Každé čtení je jedna stránka, takže pokrytí webu znamená dotazování stránku po stránce a každá stránka je zpoplatněna. Vyplatí se nastavit limit.
Kolik stojí přečtení stránky?
Kredity za úspěšné čtení, s vyšším poplatkem za silnější režim používaný na stránkách, které odolávají normálnímu čtení. Tento režim není nikdy zvolen tiše.
Je bezpečné jednat podle toho, co se vrátí?
Považujte to za informaci. Okou zpracovává text z webové stránky jako materiál ke čtení, nikoli jako pokyny k následování, což zabraňuje přesměrování agenta, který ji přečetl.
Potřebuji stále nástroj pro scraping?
Pro čistý text ze stránky v rámci pracovního postupu, ne: můžete se zeptat agenta a získat ho. Pokud chcete vlastní dashboard a plnou sadu funkcí od dodavatele scrapingu, připojte místo toho svůj vlastní účet prostřednictvím konektoru.
Jak se náklady srovnávají s mým vlastním plánem scrapingu?
Nástroje pro scraping obvykle prodávají měsíční plány s minimem. Zde čtení stránky spotřebovává kredity bez měsíčního závazku, což vyhovuje pracovnímu postupu, který čte několik stránek týdně a vyplatí se měřit ve velmi vysokém objemu.
Může vrátit Markdown pro čtení modelem?
Ano. Čistý Markdown je výchozí tvar, díky čemuž je stránka použitelná jako kontext spíše než jako zeď značek.
Musím psát scraper nebo udržovat selektory?
Ne. Není co psát a nic se nerozbije, když se stránka přepracuje, protože se ptáte na text stránky, nikoli na obsah konkrétního prvku.
Jak požádáte o Web scraping
Běžným jazykem popíšete, co chcete. Agent určí potřebnou službu a zavolá ji.
“Přečtěte si tuto stránku a řekněte mi pět nejdůležitějších věcí, s přesným zněním pro každou z nich.”
“Stáhněte odkazy z tohoto indexu dokumentace, poté si přečtěte tři o cenách a porovnejte je.”
“Každé pondělí zkontrolujte cenovou stránku našeho konkurenta a řekněte mi, pouze pokud se něco změnilo.”

