设为首页收藏本站

LUPA开源社区

 找回密码
 注册
文章 帖子 博客
LUPA开源社区 首页 业界资讯 软件追踪 查看内容

WebMagic 0.7.3版本发布,Java爬虫框架

2017-7-31 23:12| 发布者: joejoe0332| 查看: 2122| 评论: 0|原作者: oschina|来自: oschina

摘要: WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic,你可以快速开发出一个高效、易维护的爬虫。本次更新增加了Downloader模块的一些功能。#609修复HttpRequestBody没有默认构造函数导致无法反序列化的bug。#631Ht ...

WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic,你可以快速开发出一个高效、易维护的爬虫。

本次更新增加了Downloader模块的一些功能。

  • #609 修复HttpRequestBody没有默认构造函数导致无法反序列化的bug。

  • #631 HttpRequestBody的静态构造函数不再抛出UnsupportedEncodingException受检异常。

  • #571 Page对象增加bytes属性,用于获取二进制数据。下载纯二进制页面时,请设置request.setBinarayContent(true),这样对于二进制内容不会尝试转换为String,减小开销。

  • #629 在HttpUriRequestConverter中会自动对一些导致URI异常的字符进行转移或过滤。

  • #610 自动识别编码时,可以识别Content-Type中charset为大写的情况。

  • #627 支持为Request单独设置页面编码,兼容同一站点多种编码方式的情况。

  • #613 Page对象增加charset属性,其值为request/site中设置的charset,或者为自动检测的charset(未定义时)。

  • #606 升级jsonpath到2.4.0

  • #608 升级jsoup到1.10.3


酷毙

雷人

鲜花

鸡蛋

漂亮
  • 快毕业了,没工作经验,
    找份工作好难啊?
    赶紧去人才芯片公司磨练吧!!

最新评论

关于LUPA|人才芯片工程|人才招聘|LUPA认证|LUPA教育|LUPA开源社区 ( 浙B2-20090187 浙公网安备 33010602006705号   

返回顶部