织梦CMS - 轻松建站从此开始!

亿万先生-亿万先生mr007-亿万先生老虎机

当前位置: 主页 > 亿万先生 >

提取pdf文件内容,将pdf文件转为txt格式

时间:2017-07-13 22:33来源:未知 作者:admin 点击:
我现在有很多pdf文件,现在假设这些pdf文件都是文字类型的,非扫描版图片格式的。虽然可以使用软件将pdf转为txt文本文件,但是由于pdf文件数量太多,大概有好几百篇,所以我也没有

我现在有很多pdf文件,现在假设这些pdf文件都是文字类型的,非扫描版图片格式的。虽然可以使用软件将pdf转为txt文本文件,但是由于pdf文件数量太多,大概有好几百篇,所以我也没有尝试使用操作软件的手工方式。这两天,尝试过使用itext,引用itextpdf-5.5.10.jar,代码来自于http://stackoverflow.com/ques... 的ExtractPageContent类,直接使用,正确运行,没有报错。但是转换之后的文本内容明显减少,好像也只能识别出英文数据,达不到要求。使用python的pdfminer3k进行转换,乱码。使用ghostscript转换,乱码。后来用了别人的源码(基于poppler),效果还行,但是由于pdf是两列的格式,它进行转换时候,是按照行来转换的,转换之后的格式不好,如下图所示。

织梦二维码生成器
顶一下
(0)
0%
踩一下
(0)
0%
------分隔线----------------------------
发表评论
请自觉遵守互联网相关的政策法规,严禁发布色情、暴力、反动的言论。
评价:
表情:
用户名: 验证码:点击我更换图片
栏目列表
推荐内容