java使用htmlparser提取网页纯文本例子

时间：2022-06-14 12:47:05　

package com.test;

import org.htmlparser.Node;
import org.htmlparser.NodeFilter;
import org.htmlparser.Parser;
import org.htmlparser.filters.TagNameFilter;
import org.htmlparser.tags.TableTag;
import org.htmlparser.util.NodeList;

/**
* 标题:利用htmlparser提取网页纯文本的例子
*/
public class TestHTMLParser {
public static void testHtml() {
    try {
        String sCurrentLine;
        String sTotalString;
        sCurrentLine = "";
        sTotalString = "";
        java.io.InputStream l_urlStream;
        java.net.URL l_url = new java.net.URL("http://www.ideagrace.com/html/doc/2006/07/04/00929.html");
        java.net.HttpURLConnection l_connection = (java.net.HttpURLConnection) l_url.openConnection();
        l_connection.connect();
        l_urlStream = l_connection.getInputStream();
        java.io.BufferedReader l_reader = new java.io.BufferedReader(new java.io.InputStreamReader(l_urlStream));
        while ((sCurrentLine = l_reader.readLine()) != null) {
          sTotalString += sCurrentLine+"/r/n";
        // System.out.println(sTotalString);
        }
        String testText = extractText(sTotalString);
        System.out.println( testText );

    } catch (Exception e) {
        e.printStackTrace();
    }

}

public static String extractText(String inputHtml) throws Exception {
    StringBuffer text = new StringBuffer();
    Parser parser = Parser.createParser(new String(inputHtml.getBytes(),"GBK"), "GBK");
    // 遍历所有的节点
    NodeList nodes = parser.extractAllNodesThatMatch(new NodeFilter() {
        public boolean accept(Node node) {
          return true;
        }
    });

    System.out.println(nodes.size()); //打印节点的数量
    for (int i=0;i<nodes.size();i++){
         Node nodet = nodes.elementAt(i);
         //System.out.println(nodet.getText());
        text.append(new String(nodet.toPlainTextString().getBytes("GBK"))+"/r/n");
    }
    return text.toString();
}

public static void test5(String resource) throws Exception {
    Parser myParser = new Parser(resource);
    myParser.setEncoding("GBK");
    String filterStr = "table";
    NodeFilter filter = new TagNameFilter(filterStr);
    NodeList nodeList = myParser.extractAllNodesThatMatch(filter);
    TableTag tabletag = (TableTag) nodeList.elementAt(11);

}

public static void main(String[] args) throws Exception {
// test5("http://www.google.com");
testHtml();
}
}

标签：java,htmlparser

投稿

java使用htmlparser提取网页纯文本例子

猜你喜欢

spring boot 注入 property的三种方式（推荐）

C#微信公众号开发之使用MessageHandler简化消息处理流程

Android WebView开发之自定义WebView工具框

SpringCloud Nacos + Ribbon 调用服务的实现方式(两种)

Spring Retry 重试实例详解

Java并发程序入门介绍

C#键盘鼠标钩子实例

详解Java中clone的写法

Android简单使用PopupWindow的方法

Java多线程下载网图的完整案例

Quartz与Spring集成的两种方法示例

SpringBoot Web依赖教程

Java毕业设计实战之在线高中考试系统的实现

springboot openfeign从JSON文件读取数据问题

Spring如何更简单的读取和存储对象

C#开发Windows服务实例之实现禁止QQ运行

详解Spring的两种代理方式：JDK动态代理和CGLIB动态代理

SpringSecurity实现访问控制url匹配

Android App开发中创建Fragment组件的教程

Springboot项目快速实现拦截器功能