| 注册
请输入搜索内容

热门搜索

Java Linux MySQL PHP JavaScript Hibernate jQuery Nginx
jopen
9年前发布

使用python+phantomjs抓取动态页面

前一段时间公司需要爬取部分web页面的数据使用。但是页面中的主要数据是ajax load出来的,传统的抓取方法是拿不到数据的。后来在网上发现了phantomjs,在无界面的情况下运行js,渲染dom。用这个工具抓取ajax load出来的数据再方便不过啦。

系统环境:CentOS release 6.5 (Final)

phantomjs版本:1.9.8

  • phantomjs抓取加载完整的dom结构。说到phantomjs怎么把数据传递给处理程序,我看到网上很多人是写一个本地文件,然后具体的处理程序再读取那个文件进行处理。感觉这种方式太麻烦了,干脆将数据打印到到标准输出中,然后处理程序从标准输出中读取数据。

使用python+phantomjs抓取动态页面

  • 用python获取数据。然后就开始处理了。具体的处理逻辑就不展示了。

使用python+phantomjs抓取动态页面

来自:http://my.oschina.net/ushuaia/blog/361091

 本文由用户 jopen 自行上传分享,仅供网友学习交流。所有权归原作者,若您的权利被侵害,请联系管理员。
 转载本站原创文章,请注明出处,并保留原始链接、图片水印。
 本站是一个以用户分享为主的开源技术平台,欢迎各类分享!
 本文地址:https://www.open-open.com/lib/view/open1419643348828.html
网络爬虫 PhantomJS