
Okou上的網頁抓取
給智能體一個連結,它把頁面上真正寫了什麼帶回來,是乾淨好讀的正文。不用再去註冊一家抓取服務商。
網頁資料 · 無需配置 · 兩種計費模式:標準與增強
把一個公開連結丟給智能體,它就替你把頁面讀出來:只要正文,不要導航選單、cookie提示條和頁尾。你可以要乾淨的正文,也可以在還沒想好下一步讀什麼時,只要頁面上的連結清單。
抓取跑在Firecrawl上,你一開口它就在:不用設定,不用金鑰,團隊也沒有東西要維護。它的範圍是刻意收窄的——一次請求只讀一個頁面。找頁面是網頁搜尋的活,需要登入或點選才能拿到的內容則歸遠端瀏覽器管。
網頁抓取是什麼
任何研究任務都會走到這一步:搜尋結果不夠用了,你得知道頁面上到底寫了什麼。把這件事做對,比看上去難。頁面有一半內容是指令碼載入出來的,有用的文字還夾在選單、橫幅和廣告中間。
在Okou上,這部分已經替你解決好了。智能體發一個公開連結過去,拿回來的是可以直接閱讀和總結的乾淨正文,或者頁面上所有連結的清單。
有些頁面用常規方式讀不動。為此準備了一個更強的模式,而且必須由智能體主動要求,因為它單頁成本更高,你也該看得到工作流什麼時候選了它。
這就是大家在市面上到處挑的網頁抓取API。區別在於你不用挑:它已經在這次執行裡了,你在訊息裡說要讀哪個頁面,智能體就把上面的內容帶回來。
網頁抓取能做什麼
智能體能用它做什麼,做完又會拿回什麼。
覆蓋範圍與限制
把它做不到的事先說清楚,免得有人圍著能力範圍之外的東西去設計工作流。
只讀公開頁面
整個過程不涉及登入,所以登入牆、付費牆或反爬牆後面的頁面不在範圍內。那是遠端瀏覽器該做的事。
一次一個頁面
它只讀你指定的那個頁面,不會順著站點到處爬,所以讀完整個網站就意味著一頁一頁地問、一頁一頁地付費。
貴的模式是主動選的
多數頁面用常規方式就讀得好。更強的模式更貴,必須由智能體主動要求,所以工作流不會悄悄變貴。
拿回來的是資訊,不是指令
網頁上的文字一律當作供閱讀的材料,絕不會被當成要執行的指令。正是這一點,讓懷有惡意的頁面沒法把智能體說動去做別的事。
網頁抓取怎麼收費
Web服務按呼叫次數扣積分,不按token計費。也沒有另一份廠商帳單要對。
zero scrape讀一個頁面會消耗積分,更強的模式比常規模式貴。除此之外沒有別的要買,也沒有起步門檻,所以一週只讀三個頁面的工作流,就只為這三次付費。
產品名稱和標識歸各自所有者所有,出現在這裡只是為了說明某項服務基於什麼執行,不代表任何背書或合作關係。
設定與接入
無需設定
沒有什麼要連線。不用註冊,不用貼上金鑰,也不會往你的連接器列表里加東西。這正是它和Okou目錄裡那個Firecrawl連接器的區別:連接器走的是你自己的Firecrawl帳號,前提是你已經有一個;而這個服務就在那兒,任何智能體都能用。
誰可以用
讀網頁是一項你分配出去的權限,不是每個智能體天生就有。把它給需要的智能體和需要的人,需要多久就給多久;收回時也不用動這個智能體的其他能力。
團隊都用網頁抓取做什麼
讀搜尋結果背後的頁面
搜尋只給你一個標題加兩行字。大部分工作需要正文,所以常見做法是先搜尋,挑出真正要緊的兩三條結果,再只讀這幾個頁面。
盯住沒有別的入口的頁面
競品定價、更新日誌、狀態頁、監管通告。定時執行的智能體讀一遍頁面,和上週對比,只在有變化時才告訴你。
把長文件變成能用的材料
一份規範、一份年報、一個幫助中心。有沒有乾淨的正文,決定了你拿到的是這份文件的摘要,還是它導航選單的摘要。
什麼時候不該用網頁抓取
頁面需要登入、點選或填表時別用它,改用遠端瀏覽器。要讀完整個網站時別用它,單頁成本漲得比答案的價值還快。資料來源本身就對外提供正經資料時也別用它——直接取數幾乎總是比讀它的頁面更穩。
別處怎麼稱呼它
同一件事在市場上有好幾種叫法。如果你比較過其中某一類產品,這裡說明它對應到這邊的什麼能力。
網頁抓取API
花錢讓一個服務去取頁面、把正文交回來,通常就叫這個名字。它做的正是這件事。區別只是帳號和金鑰歸Okou,不歸你。
不用寫爬蟲的抓取
沒有東西要開發,也沒有東西要維護。你在訊息裡說要讀哪個頁面,取回和清洗都在這次執行裡完成。
HTML轉Markdown
大家平時自己動手寫的那道轉換:一頁HTML進去,乾淨的Markdown出來。它在文字送到智能體之前就做完了,所以模型的注意力花在內容上,而不是標記上。
AI或LLM網頁抓取
輸出是給模型讀的抓取,而不是給程式碼解析的。取頁面的動作一樣,評判標準變成文字是否好讀,而不是某個選擇器還能不能匹配上。
無程式碼網頁抓取
這裡沒人寫爬蟲。你在訊息裡說要讀哪個頁面,取頁面的活交給智能體——大家搜尋「不寫程式碼的抓取」時想要的正是這個。
網頁抓取橫向對比
網頁抓取對比自己做一套抓取
產出一樣,工作量差得遠。自己做,就要挑一家服務商或者自己寫取頁面的程式,要有人保管金鑰,頁面每改一次版就得維護一次。在這裡你問一句、讀答案,使用權是一項權限,而不是一份共享的金鑰。
網頁抓取對比Firecrawl連接器
Okou同時提供Firecrawl連接器。如果你本來就有Firecrawl帳號、希望用量記在那邊,或者需要內建服務覆蓋不到的能力,那就用連接器。內建服務適合你只想開口要一個頁面、直接拿到內容的場景。
網頁抓取對比自己操作瀏覽器
自己操作瀏覽器能力更強,但工作量也大得多,事後還得把頁面轉成能讀的文字。任務確實需要點選時用雲端瀏覽器,只想知道頁面寫了什麼時就用它。
一句話總結
在Okou上讀網頁的預設方式。頁面是公開的、你要的就是上面的內容,那就一步到位:不用帳號,按頁計費。需要登入或點選的事,交給雲端瀏覽器。
常見問題
我需要Firecrawl帳號嗎?
不需要。讀網頁是每個智能體本來就會做的事,你開口就行。不用註冊帳號,也不用保管金鑰。
它和Firecrawl連接器有什麼區別?
連接器走你自己的Firecrawl帳號,適合你已經有帳號、也希望用量記在那邊的情況。內建服務不用配置,開箱就能用。
它能讀需要登入才能看的頁面嗎?
不能。它只開啟無需登入的公開頁面。這類頁面請用雲端瀏覽器:它能保持登入狀態,中途還可以由人接手。
它能讀完整個網站嗎?
它自己做不到。每次讀取只針對一個頁面,想覆蓋整站就得一頁一頁地要,每頁都計費。建議設一個上限。
讀一個頁面要花多少積分?
每次讀取成功按積分計費;遇到普通方式讀不動的頁面,會用更強的模式,費用更高。這個模式不會被悄悄啟用。
拿回來的內容可以直接照著做嗎?
把它當成資訊看。Okou把網頁文字當作可閱讀的素材,而不是要執行的指令,這樣一個頁面就無法反過來指揮讀它的智能體。
我還需要專門的抓取工具嗎?
如果只是在工作流裡拿到頁面的乾淨文字,不需要:跟智能體說一聲就有。如果你想要抓取廠商自己的儀表板和完整功能,那就透過連接器接入你自己的帳號。
和我自己買抓取套餐比,成本如何?
抓取工具通常按月售賣套餐,還有起步門檻。這裡讀一個頁面消耗積分,沒有按月的承諾,適合每週只讀幾頁的工作流;量特別大的時候,值得先算一筆賬。
它能返回Markdown給模型讀嗎?
可以。預設就是乾淨的Markdown,頁面因此能當作上下文使用,而不是一堆標記。
我需要寫爬蟲或者維護選擇器嗎?
不需要。沒有程式碼要寫,頁面改版也不會把什麼弄壞,因為你要的是頁面的文字,而不是某個元素裡的內容。
怎麼讓智能體用網頁抓取
你用日常語言說清楚要什麼,智能體自己判斷該用哪個服務,再去發起呼叫。
“讀這個頁面,告訴我最要緊的五件事,每件都附上原文措辭。”
“把這個文件索引頁上的連結抓出來,再讀其中和定價相關的三篇,做個對比。”
“每週一檢查競品的定價頁,只在有變化時告訴我。”

