Apache Tika 1.18 已发布,Tika 是一个内容抽取的工具集合(a toolkit for text extracting)。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其对第三方文件格式的支持。
Apache Tika 1.18 包含许多改进和错误修复,其中包括:
Jackson 更新至 2.9.5
支持 brotli
将 geo-apis 升级到 3.0.1
从 PPT 中的分组文本框中提取文本
为 XPS 添加解析器
要求 Java 8
完整更新内容请查看发行说明。