Jawn78

Untitled

Mar 25th, 2019
127
0
Never
Not a member of Pastebin yet? Sign Up, it unlocks many cool features!
Java 2.26 KB | None | 0 0
  1. import java.io.File;
  2. import java.io.FileInputStream;
  3. import java.io.IOException;
  4. import java.io.InputStream;
  5. import org.apache.tika.exception.TikaException;
  6. import org.apache.tika.io.TikaInputStream;
  7. import org.apache.tika.metadata.Metadata;
  8. import static org.apache.tika.metadata.Property.ValueType.URL;
  9. import org.apache.tika.parser.AutoDetectParser;
  10. import org.apache.tika.parser.ParseContext;
  11. import org.apache.tika.parser.html.BoilerpipeContentHandler;
  12. import org.apache.tika.sax.BodyContentHandler;
  13. import org.apache.tika.sax.ToHTMLContentHandler;
  14. import org.apache.tika.sax.ToXMLContentHandler;
  15. import org.xml.sax.ContentHandler;
  16. import org.xml.sax.SAXException;
  17.  
  18. /**
  19.  *
  20.  * @author jonat
  21.  */
  22. public class Rex2nlp {
  23.  
  24.     /**
  25.      * @param args the command line arguments
  26.      * @return
  27.      * @throws java.io.IOException
  28.      * @throws org.xml.sax.SAXException
  29.      * @throws org.apache.tika.exception.TikaException
  30.      */
  31.  /*   public static void main(String[] args)throws IOException, SAXException, TikaException {
  32.     ContentHandler handler = new BodyContentHandler(
  33.             new ToXMLContentHandler());
  34.   String target = "C:\\Users\\jonat\\Documents\\NetBeansProjects\\rex2nlp\\test.docx";
  35.   File document = new File(target);
  36.     AutoDetectParser parser = new AutoDetectParser();
  37.     Metadata metadata = new Metadata();
  38.         FileInputStream inputstream = new FileInputStream(document);
  39.   parser.parse(inputstream, handler, metadata, new ParseContext());
  40.   System.out.println(handler.toString());      
  41.     }
  42.     */
  43.     public static void main(String args[]) throws IOException, SAXException, TikaException {
  44.         AutoDetectParser parser = new AutoDetectParser();
  45.         ContentHandler textHandler = new BodyContentHandler(new ToHTMLContentHandler());
  46.        
  47.         Metadata xmetadata = new Metadata();
  48.         String target = "C:\\Users\\jonat\\Documents\\NetBeansProjects\\rex2nlp\\test2.docx";
  49.         File document = new File(target);
  50.         FileInputStream inputstream = new FileInputStream(document);
  51.         try  (InputStream stream = inputstream){
  52.             parser.parse(stream, new BoilerpipeContentHandler(textHandler), xmetadata);
  53.             System.out.println("text:\n" + textHandler.toString());
  54.         }
  55.     }
  56.  
  57. }
Advertisement
Add Comment
Please, Sign In to add comment