doc-crawler
用 Node js 实现一个 CLI 爬虫,递归爬取页面内容。
参数
- 接收一个 URL,必传
- 可选参数 selector,-s,如果传入了,则仅保存 selector指定的内容
- 范围限定参数 -p:仅爬取和此参数前缀匹配的内容,如果不传,则将主页面的 parent 作为此参数。可以指定多个
- 转换为 Markdown 格式。
- -c 限定数量,超过此数量则停止。
明确:1、应该先要做路径规范化,转为绝对路径,再判断是否是前缀包含关系。 2、整个页面的链接都要用来做递归,而非仅仅selector内的 3、广度优先 4、-v 输出详细日志,包括某个链接是递归还是被过滤了
