Not a member of Pastebin yet?
Sign Up,
it unlocks many cool features!
- package org.ali;
- //import java.io.IOException;
- import java.io.PrintWriter;
- import java.io.FileOutputStream;
- import com.itextpdf.text.pdf.PRTokeniser;
- import com.itextpdf.text.pdf.parser.PdfContentStreamProcessor;
- import com.itextpdf.text.pdf.parser.ContentByteUtils;
- import com.itextpdf.text.pdf.parser.PdfReaderContentParser;
- import com.itextpdf.text.pdf.parser.RenderListener;
- import com.itextpdf.text.pdf.parser.TextExtractionStrategy;
- import com.itextpdf.text.pdf.parser.SimpleTextExtractionStrategy;
- import com.itextpdf.text.pdf.PdfContentByte;
- import com.itextpdf.text.pdf.PdfName;
- import com.itextpdf.text.pdf.PdfDictionary;
- ///////////////////////////////////
- import com.itextpdf.text.Document;
- import com.itextpdf.text.pdf.PdfImportedPage;
- import com.itextpdf.text.pdf.PdfReader;
- import com.itextpdf.text.pdf.parser.PdfTextExtractor;
- import java.io.File;
- import java.awt.Rectangle;
- import com.itextpdf.text.pdf.parser.RenderFilter;
- import com.itextpdf.text.pdf.parser.RegionTextRenderFilter;
- import com.itextpdf.text.pdf.parser.FilteredTextRenderListener;
- import com.itextpdf.text.pdf.parser.LocationTextExtractionStrategy;
- import com.itextpdf.text.pdf.parser.TextMarginFinder;
- import com.itextpdf.text.pdf.parser.PdfReaderContentParser;
- import com.itextpdf.text.pdf.PdfStamper;
- public class PdfExctractor {
- public PdfExctractor (String inFile, String outFile){
- try{
- PdfReader reader = new PdfReader(inFile);
- int n = reader.getNumberOfPages();
- String str = PdfTextExtractor.getTextFromPage(reader, 1);
- System.out.println(str + "\n\n total pages:" + n);
- } catch (Exception e){
- e.printStackTrace();
- }
- }
- public void parser3 (String src, String dest){
- try{
- PdfReader reader = new PdfReader(src);
- PrintWriter out = new PrintWriter(new FileOutputStream(dest));
- Rectangle rect = new Rectangle(70, 80, 100, 500);
- RenderFilter filter = new RegionTextRenderFilter(rect);
- TextExtractionStrategy strategy;
- for (int i = 1; i <= reader.getNumberOfPages(); i++){
- strategy = new FilteredTextRenderListener(new LocationTextExtractionStrategy(), filter);
- out.println(PdfTextExtractor.getTextFromPage(reader, i));
- }
- out.flush();
- out.close();
- } catch (Exception e){
- e.printStackTrace();
- }
- }
- /**
- * @param args
- */
- public static void main(String[] args) {
- // TODO Auto-generated method stub
- String pdfFile = "1.pdf";
- String outText = "out.txt";
- if (args.length > 0) pdfFile = args[0];
- PdfExctractor p = new PdfExctractor(pdfFile, outText);
- p.parser3(pdfFile, "another_try.txt");
- }
- }
Advertisement
Add Comment
Please, Sign In to add comment