深眠大鲨鱼🦈
132 posts

深眠大鲨鱼🦈
@Pandaa853775
AI & Web3 | 大二探索者 | OpenClaw本地玩家 养了只叫小🦈的虾 每天前进一步,停滞即腐败。
Katılım Temmuz 2025
190 Takip Edilen16 Takipçiler

训记的视频素材原来是来自于这里吗。我嘞个。
那我还订阅个什么训记,自己搓一个出来不就完事了。
Viking@vikingmute
才发现这个 repo 就是扒了这个 API docs.ascendapi.com/introduction,而且它扒的还是旧版 v1(Free Version) 新版 v2 更强大,有 Images, HD videos(我看了一下比 gif 强),我试了一下,视频质量很高,还有一个 Muscle Visualizer,一个组件来高亮不同的肌肉部位,很有想法。V2 的免费额度也很高,All free plans include a limit of 1,000 requests per hour per API key,视频另算。感觉一般的小应用加点缓存也够用了。 我现在发现卖这种小众服务其实还是很有需求的啊,比如这种健身的 API,几乎没有啥竞争对手吧,当你数据质量高的话,那几乎是垄断的。这个服务也卖一次性 data,一次性可以全部下载,600刀,数据量也不大。
中文

看到一个神奇的 Repo:github.com/hasaneyldrm/ex…
健身数据库,里面有 1,324 exercises 健身动作,有详细的 metadata,还弄了个前端页面可以检索。
最有价值的是里面每个动作都有一张静态图片和一个视频文件(gif)。
用这个数据库可以完全创建一个类似的应用了,里面数据都齐了。当然人家代码库里有 Disclaimer,for educational and non-commercial research purposes only。用的时候要注意了。

中文

10个GitHub仓库帮你爬取整个互联网
全部收藏。每个都能从任何网站提取干净数据,这种访问权限通常需要销售电话和合同才能获得。
1. github.com/firecrawl/fire…
指向任何网站,它就能爬取每个页面、渲染JavaScript,返回AI能立即读取的干净结构化数据。13万星,进入GitHub百大仓库。半数AI创业公司悄悄运行的爬虫骨架,完全开源。
2. github.com/unclecode/craw…
GitHub排名第一的爬虫。把任何网站转换成干净的LLM就绪的markdown,比付费服务更快,无需API密钥、无需账户、无需按页面付费。某开发者被16美元的付费爬虫激怒后几天就搞出来了。5.1万星。Apache 2.0。
3. github.com/browser-use/br…
像真人一样操控浏览器的AI代理,点击、滚动、登录、填表,从未见过的网站中提取数据。两位苏黎世ETH研究员开发,一年内达到9.5万星。能爬取简单爬虫无法触及的页面。MIT协议。
4. github.com/apify/crawlee
完整专业爬虫框架,包含轮换代理、自动重试、浏览器指纹欺骗和队列管理。防止被封禁的全套机制,爬虫公司收费数千的技术栈,现在免费给你。
5. github.com/scrapy/scrapy
十多年来悄悄为数据团队赋能的工业级爬虫。爬百万页面、提取任何内容、干净导出。在大多数付费工具无法触及的规模上经过实战检验,始终免费。
6. github.com/microsoft/mark…
微软自家工具,将任何文件或网页、PDF、Office文档、HTML、图像转换成AI能用的干净markdown。整个数据管道公司都在围绕此构建,由微软开源。
7. github.com/D4Vinci/Scrapl…
隐形爬虫,能自动适应网站布局变化,绕过反爬虫检测。防爬供应商当高级功能出售的猫鼠游戏,现在免费开源。
8. github.com/Genymobile/scr…
从电脑远程控制任何安卓手机,提取数据和自动化没有网站的应用。通往大多数爬虫无法触及的纯移动平台的桥梁。13万+星。Apache 2.0。
9. github.com/alirezamika/au…
给一个例子它就自动找出规律爬取网站其余内容。无需选择器、无需代码维护。'直接给我数据'按钮,几行Python。
10. github.com/lwthiker/curl-…
curl的增强版,完美模拟真实浏览器指纹,请求看起来就像有Chrome的真人。昂贵爬虫API底层暗用的最低级技巧,现在免费。
公司为此收费2000美元/月。源代码就在这儿。




中文
















