Uninote
Uninote
用户根目录
brdr
common
programming
docs
后端试题
问题讨论

doc-crawler

用 Node js 实现一个 CLI 爬虫,递归爬取页面内容。

参数

  • 接收一个 URL,必传
  • 可选参数 selector,-s,如果传入了,则仅保存 selector指定的内容
  • 范围限定参数 -p:仅爬取和此参数前缀匹配的内容,如果不传,则将主页面的 parent 作为此参数。可以指定多个
  • 转换为 Markdown 格式。
  • -c 限定数量,超过此数量则停止。

明确:1、应该先要做路径规范化,转为绝对路径,再判断是否是前缀包含关系。 2、整个页面的链接都要用来做递归,而非仅仅selector内的 3、广度优先 4、-v 输出详细日志,包括某个链接是递归还是被过滤了

axure

ios 环境

点赞(0) 阅读(3) 举报
目录
标题