Apache Tika 1.18 发布,内容抽取工具集合

【腾讯云】0基础建站 网站模板9元起! >>>  

Apache Tika 1.18 已发布,Tika 是一个内容抽取的工具集合(a toolkit for text extracting)。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其对第三方文件格式的支持。

Apache Tika 1.18 包含许多改进和错误修复,其中包括:

  • Jackson 更新至 2.9.5

  • 支持 brotli

  • 将 geo-apis 升级到 3.0.1

  • 从 PPT 中的分组文本框中提取文本

  • 为 XPS 添加解析器

  • 要求 Java 8

完整更新内容请查看发行说明

下载地址:http://tika.apache.org/download.html

猜你喜欢

转载自www.oschina.net/news/95521/apache-tika-1-18-released