01 · 数据源选型:RSS / API 优先于爬虫#

来源:橘鸦《我的 AI 实践》第二段「信息采集」


原则(一句话)#

要采集某类信息,先问它有没有原生 RSS / API,再问 RSSHub 等聚合器,再问浏览器手动存档,最后才是爬虫


为什么#

橘鸦原文理由就三条,很朴素但经得起推:

  1. 很多站原生就有 RSS(LINUX DO、Reddit 等)
  2. 没原生 RSS 的主流站,第三方方案基本成熟(RSSHub)
  3. RSS 通过 XML 交换,结构化、保留样式——爬出来还得自己清洗结构

爬虫的隐性成本除了反爬,还有「清洗 + 去重 + 样式补回」的活儿,这些时间没体现在工时里但都在账上


何时调用#

  • 「我要 X 类资讯 / 数据 / 公众号 / 博客的内容」
  • 「帮我监控 Y 的更新」
  • 「抓 Z 网站的内容汇总成 M」
  • 任何「持续 / 批量 / 跨源」信息采集任务的第一步

怎么做(决策树)#

有原生 RSS / API?
├─ 是 → 直接订阅
└─ 否 ↓
RSSHub / Feedbin / RSS.app 等聚合器能转?
├─ 是 → 配置路由
└─ 否 ↓
Obsidian Web Clipper / 浏览器手动存档?
├─ 是 → 元信息 + Markdown 存档
└─ 否 ↓
才考虑爬虫(且优先官方 API > 第三方 > 自写)

反例 / 边界#

  • 实时性要求极高(分钟级)+ 无官方推送 → RSS 不够,得 WebSocket / 轮询
  • 需要登录后才能看到的内容 → 浏览器手动存档 + cookies 复用是唯一稳妥路径
  • 站内搜索 / 特定聚合视图(如「今日热榜」)→ 通常没有 RSS,但 RSSHub 多数能路由

关联原则#

  • 03-信息护栏:有了干净数据源,下一步是过滤
  • 02-Workflow编排:采集到处理之间,这一段是窄 AI 跑得最稳的
Profile Image of the Author
月曦夜
在代码、学术与分子动力学模拟间穿梭的普通人。
📢
新博客搭建中,内容陆续填充...
音乐
封面

音乐

暂未播放

0:00 0:00
暂无歌词
分类
标签
站点统计
文章
0
分类
0
标签
0
总字数
0
运行时长
0
最后活动
0 天前

文章目录