摘要:
做采集的时候,可以使用file_get_contents()去获取网页源代码,但是使用file_get_contents采集,速度慢,而且超时时间,不好控制。如果采集的页面不存在,需要等待的时间很长。一般来说,curl的速度最快,其次是socket,最后是file_get_contents。现在跟大... 阅读全文
posted @ 2015-02-04 09:44
archoncap
阅读(296)
评论(0)
推荐(0)
摘要:
下载地址: http://www.jb51.net/codes/33397.html Snoopy的一些特点: 1抓取网页的内容 fetch 2 抓取网页的文本内容 (去除HTML标签) fetchtext 3抓取网页的链接,表单 fetchlinks fetchform 4 支持代理主机 5支持基... 阅读全文
posted @ 2015-02-04 09:43
archoncap
阅读(222)
评论(0)
推荐(0)

浙公网安备 33010602011771号