推文
@0xGky · 2026-10-09 15:45
想用 Hermes 和 Openclaw 白薅全网数据、又不想被反爬逮住的,收拢这 10 个仓库就齐了! 1️⃣ Firecrawl:URL 往里一撂,它自个儿就把整站刨穿,吐出来直接是 AI 张口就能吞的干净数据,JS 渲染的页面也照扛,15.2 万★,杀进 GitHub Top 100。 🔗 https://github.com/firecrawl/firecrawl 2️⃣ Crawl4AI:把网站捏成 LLM 扫一眼就能读的文本,API key 免了,钱也免了。一个被 16 美元月费气炸的程序员,几天就抟出来了,8.4 万★。 🔗 https://github.com/unclecode/crawl4ai 3️⃣ browser-use:叫 AI 照着真人的路子点鼠标、登账号、填表单,ETH Zurich 学生团队捣鼓的,11.2 万★。 🔗 https://github.com/browser-use/browser-use 4️⃣ Crawlee:自动倒腾代理、重试、伪装指纹、管队列,一整套绕卡子的家当全给你置办齐整,约 8,000★。 🔗 https://github.com/apify/crawlee 5️⃣ Scrapy:摸爬滚打十几年的老江湖,几百万页面照样不虚,永久白使,约 6 万★。 🔗 https://github.com/scrapy/scrapy 6️⃣ MarkItDown:微软丢出来的,PDF、Office、HTML、图片成批转文本,源码敞开、白使,16.7 万★。 🔗 https://github.com/microsoft/markitdown 7️⃣ Scrapling:网站改版它自个儿就调头适应,还能一路甩开封禁,免费版能干付费的营生,6.9 万★。 🔗 https://github.com/D4Vinci/Scrapling 8️⃣ scrcpy:拿电脑远程耍安卓手机,专治那些光有 App、没网页的,15 万★。 🔗 https://github.com/Genymobile/scrcpy 9️⃣ AutoScraper:丢个样例过去,它自己就把规律摸透批量扒,选择器压根不用碰,几行 Python 就开跑。 🔗 https://github.com/alirezamika/autoscraper 🔟 curl-impersonate:把请求裹成真 Chrome 指纹,瞅着就跟真人在戳一样,躲反爬简直不费吹灰之力,3,600★。 🔗 https://github.com/lwthiker/curl-impersonate 家当都撂这儿了,能刨出多少全凭你本事。
曝光 1268 · 评论 2 · 点赞 18 · 书签 22 · 曝光/时 195.13827220859082