php解析xmlblob技巧_从零开始学Java之带你学会解析XML文件

文章目录 [+]

当然上面的观点比较抽象，作为初学者，你可能不太好理解。
实际上，XML类似于HTML，它俩可以说是“堂兄弟”，两者都是标记措辞。
但与HTML不同的是，XML是可扩展的，这意味着用户可以定义自己的标记和元素，并且XML的设计目的是传输和存储数据，这就使得XML成了一种极为灵巧的数据交流格式。

2. 利用场景

由于XML具有良好的可扩展性、内容与形式分离、遵照严格的语法哀求、保值性良好等优点，以是XML文档可以运用于很多场景中，比如：

php解析xmlblob技巧_从零开始学Java之带你学会解析XML文件

数据交流：XML可以用来标记数据、定义数据类型，使得它成为了Web开拓中最常用的数据格式之一。
网络传输：XML文档可以通过HTTP协议在网络上传输，从而实现分布式运用程序之间的通信。
配置文件：很多软件和系统利用XML文档作为配置文件，以便用户可以通过修正XML文件来改变软件和系统的行为。
模板措辞：XML可以用作模板措辞（类似于HTML），用于天生动态的Web页面和报告。
数据库存储：一些数据库系统可以将XML文档存储为BLOB（二进制大工具），从而实现对XML文档的存储和查询。

（图片来自网络侵删）

3. 文档构成

我们一样平常是在一个.xml格式的文档中操作XML，而一个XML文档紧张由标签、元素和属性组成。
标签是XML文档中的基本单位，它们用来表示数据的开始和结束位置，“<>”是开始标签，“</>“是结束标签。
元素是标签中包含的内容，它们可以包含其他的元素或文本内容。
属性是元素的附加信息，它们定义了一个元素的特性和属性。
我们来看看下面这个大略的XML文档：

xml

复制代码

<bookstore> <book category="children"> <title lang="en">跟壹哥学java</title> <author>逐一哥</author> <year>2008</year> <price>29.99</price> </book> <book category="web"> <title lang="en">跟壹哥学XML</title> <author>壹哥</author> <year>2023</year> <price>39.88</price> </book> </bookstore>

在这个XML文档中，bookstore是一个元素，它包含了两个book元素。
每个book元素都有一个category属性，表示书本的种别。
每个book元素中又包含了title、author、year和price四个子元素。
title元素中还有一个lang属性，表示书本的措辞。

4. 文档规范

XML文档必须符合XML规范，包括精确的标记语法、精确的嵌套构造、精确的属性情式等。
一个XML文档必须有一个根元素，所有其他元素都必须是这个根元素的子元素。
XML元素和属性的名称是区分大小写的。
XML文档中可以包含注释和处理指令。
XML文档中可以利用实体引用来表示分外字符，比如<表示小于号，>表示大于号。
详细来说，有以下这些XML规范哀求须要我们遵守：

精确的标记语法：XML文档中的所有元素和属性都必须利用精确的标记语法，即开始标记和结束标记之间不能有其他标记或文本。
精确的嵌套构造：XML文档中的元素必须按照精确的嵌套构造进行排列，即一个元素不能包含另一个元素的开始标记和结束标记，也不能与另一个元素的开始标记和结束标记重叠。
精确的属性情式：XML文档中的属性必须利用精确的格式进行定义，即属性名和属性值之间必须有一个等号，并且属性值必须利用引号括起来。
有且仅有一个根元素：XML文档中必须有一个根元素，所有其他元素都必须是这个根元素的子元素。
元素和属性名称区分大小写：XML元素和属性的名称是区分大小写的。
注释和处理指令：XML文档中可以包含注释和处理指令。
实体引用：XML文档中可以利用实体引用来表示分外字符，比如<表示小于号，>表示大于号。

以上规范是XML文档必须遵照的基本哀求，只有知足这些哀求，才能担保XML文档的精确性和可读性。

5. 把稳事变

虽然XML文档操作时比较灵巧自由，但我们在利用XML文档时，也须要把稳以下几点：

XML文档必须符合XML规范，包括精确的标记语法、精确的嵌套构造、精确的属性情式等； XML文档必须有一个根元素，所有其他的元素都必须是这个根元素的子元素； XML元素和属性的名称是严格区分大小写的； XML文档中可以包含注释和处理指令； XML文档中可以利用实体引用来表示分外字符，比如<表示小于号，>表示大于号。

我们在开拓时一定要把稳XML文档的这些规范哀求，否则可能会涌现一些莫名其妙的缺点。

二. XML解析1. 解析观点

XML解析便是将XML文档转换为可操作的数据构造的过程。
XML解析器读取XML文档并将其转换为内存中的树形构造，然后再通过某种编程措辞的API来访问和操作这个树形构造，得到树形构造中的数据信息。

2. 解析办法

目前在XML解析办法中，有四种常用的解析技能：DOM、SAX、StAX和Pull。

2.1 DOM

DOM(文档工具模型)是一种基于树形构造的XML解析技能。
它会把全体XML文档转换为一个树形构造，并将每个元素都表示为一个节点。
我们通过遍历这个树形构造，就可以访问和操作XML文档中的任何元素和属性。

虽然DOM解析给我们供应了非常方便的操作API，但它须要将全体XML文档都加载到内存中，因此对付大型XML文件来说，DOM的性能和内存占用都会比较高，对内存花费比较大，以是现在开拓时较少利用，尤其是在移动端。

2.2 SAX

SAX(大略API for XML)是一种基于事宜的XML解析技能。
SAX解析器读取XML文档，并可以在解析过程中触发一系列的事宜。
运用程序可以注册回调函数来处理这些事宜，从而读取XML文档中的元素和属性。

与DOM比较，SAX是一种流式解析技能，它不须要将全体XML文档加载到内存中，因此对付大型的XML文件来说，SAX的性能和内存占用都会比较低。
在移动端开拓中，该办法较为常用。

2.3 StAX

StAX(流式API for XML)是一种基于迭代器的XML解析技能。
StAX解析器读取XML文档，并返回一个迭代器，运用程序可以利用这个迭代器来遍历XML文档中的元素和属性。

与DOM和SAX比较，StAX的API更加的大略和直不雅观，同时也不须要将全体XML文档加载到内存中，因此对付大型XML文件来说，StAX的性能和内存占用都会比较低。

2.4 Pull解析

Pull解析也是一种基于迭代器的XML解析技能，它与StAX类似，但更加简洁和易用。
Pull解析器读取XML文档后会返回一个迭代器，运用程序可以利用这个迭代器来遍历XML文档中的元素和属性。

与DOM和SAX比较，Pull解析器的API更加大略和直不雅观，同时也不须要将全体XML文档加载到内存中，因此对付大型XML文件来说，Pull解析器的性能和内存占用都会比较低。
在移动端开拓中，Pull解析很常用。

由于现在XML解析并不是很常用，以是壹哥并不会把以上4种解析办法，都带大家进行代码实现，我会挑选个中的DOM和Pull解析进行代码讲解。

3. DOM解析

我们在Java中进行DOM解析时，须要依赖javax.xml.parsers包中的DocumentBuilder类和Document类，这两个类都是Java标准库中的一部分，因此无需额外下载依赖包。

但如果我们须要利用更高等的XML解析特性，比如XPath、XSLT、DTD、Schema等，可以考虑利用第三方的XML处理库，比如Apache Xerces、JDOM、DOM4J等开源框架。
这些库给我们供应了更多的XML解析和处理API，同时也供应了更好的性能和更丰富的特性，我们可以在它们的官方网站下载和利用这些库。

接下来壹哥就通过一个案例，来带大家利用DOM进行XML解析。
在解析XML时，我们可以在项目中提前准备一个XML文件，存放到项目的文件路径中。
壹哥就把上面的bookstore的xml文件，存放在了src目录下，如下图所示：

接着我们就可以加载这个xml文件，并对其进行解析了，代码如下：

java

复制代码

import java.io.File; import javax.xml.parsers.DocumentBuilder; import javax.xml.parsers.DocumentBuilderFactory; import org.w3c.dom.Document; import org.w3c.dom.Element; import org.w3c.dom.NodeList; / @author 逐一哥Sun @company 千锋教诲 / public class Demo01 { public static void main(String[] args) { try { // 创建DOM解析器工厂 DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance(); // 创建DOM解析器 DocumentBuilder builder = factory.newDocumentBuilder(); // 加载XML文件，解析XML文档 Document doc = builder.parse(new File("src/books.xml")); // 获取根元素 Element root = doc.getDocumentElement(); System.out.println("根元素：" + root.getNodeName()); // 获取所有的book元素 NodeList books = root.getElementsByTagName("book"); for (int i = 0; i < books.getLength(); i++) { //得到得到每一个book元素 Element book = (Element) books.item(i); System.out.println("book元素："); // 获取book元素中的category属性 String category = book.getAttribute("category"); System.out.println("category属性：" + category); // 获取title元素 Element title = (Element) book.getElementsByTagName("title").item(0); //获取title里的lang属性 String lang = title.getAttribute("lang"); //得到元素中的第一个孩子的节点内容 String text = title.getFirstChild().getNodeValue(); System.out.println("title元素：" + lang + " " + text); // 获取author元素 Element author = (Element) book.getElementsByTagName("author").item(0); String authorText = author.getFirstChild().getNodeValue(); System.out.println("author元素：" + authorText); // 获取year元素 Element year = (Element) book.getElementsByTagName("year").item(0); String yearText = year.getFirstChild().getNodeValue(); System.out.println("year元素：" + yearText); // 获取price元素 Element price = (Element) book.getElementsByTagName("price").item(0); String priceText = price.getFirstChild().getNodeValue(); System.out.println("price元素：" + priceText); } } catch (Exception e) { e.printStackTrace(); } } }

实行结果如下图所示：

在这个案例中，我们利用了Java标准库javax.xml.parsers包中的DocumentBuilder和Document类，以及org.w3c.dom包下的Element和NodeList类。

首先，我们会利用DocumentBuilderFactory类创建一个DOM解析器工厂，然后利用newDocumentBuilder()方法创建DOM解析器，并利用parse()方法解析XML文档。

接着，我们又利用getDocumentElement()方法获取到根元素，并利用getElementsByTagName()方法获取所有的book元素。
对付每个book元素，我们可以利用getAttribute()和getElementsByTagName()方法来获取元素的属性和子元素，并利用getFirstChild()和getNodeValue()方法来获取属性和文本内容，末了将它们打印到掌握台上。

以上这个代码案例实在只是一个大略的DOM解析案例，实际上，DOM可以供应非常丰富的API来访问和操作XML文档。
如果你想要处理繁芜的XML文档，或者想进行繁芜的数据操作，都可以利用DOM解析器。

4. Pull解析

我们在Java中进行Pull解析，须要依赖javax.xml.stream包中的干系类，这些类包括XMLInputFactory、XMLStreamReader等。
这些类都是Java标准库中的一部分，因此不须要额外下载其他的依赖包。

java

复制代码

import java.io.FileInputStream; import java.io.FileNotFoundException; import javax.xml.stream.XMLInputFactory; import javax.xml.stream.XMLStreamConstants; import javax.xml.stream.XMLStreamException; import javax.xml.stream.XMLStreamReader; / @author 逐一哥Sun @company 千锋教诲 / public class Demo02 { public static void main(String[] args) { try { // 创建XML解析器工厂 XMLInputFactory factory = XMLInputFactory.newInstance(); // 创建XML解析器 XMLStreamReader reader = factory.createXMLStreamReader(new FileInputStream("src/books.xml")); // 遍历XML文档 while (reader.hasNext()) { //获取下一个事宜 int event = reader.next(); switch (event) { case XMLStreamConstants.START_ELEMENT://开始事宜 System.out.print(reader.getLocalName() + ": "); // 打印元素的属性 for (int i = 0; i < reader.getAttributeCount(); i++) { //得到元素中的属性名及属性值 System.out.print(reader.getAttributeLocalName(i) + "=" + reader.getAttributeValue(i)); } System.out.println(); break; case XMLStreamConstants.CHARACTERS://处理字符事宜 String text = reader.getText().trim(); if (!text.isEmpty()) { System.out.println(text); } break; } } // 关闭XML解析器 reader.close(); } catch (FileNotFoundException e) { e.printStackTrace(); } catch (XMLStreamException e) { e.printStackTrace(); } } }

上面这个代码案例，我们利用了Java标准库javax.xml.stream包中的XMLInputFactory和XMLStreamReader类。

首先，我们利用XMLInputFactory类创建了一个Pull解析器工厂。

然后利用createXMLStreamReader()方法创建了一个Pull解析器，并利用next()方法遍历XML文档。

对付每个事宜，我们利用switch语句进行处理。
对付START_ELEMENT事宜，我们利用getLocalName()方法获取元素名称，并利用getAttributeCount()、getAttributeLocalName()和getAttributeValue()方法获取元素的属性。

对付XMLStreamConstants.CHARACTERS事宜，我们利用getText()方法获取文本内容，并利用trim()方法去除空缺字符，末了将文本内容打印到掌握台上。
XMLStreamConstants.CHARACTERS是Pull解析器在读取到XML文档中的字符数据时触发的事宜。
在这个事宜中，我们可以利用XMLStreamReader类的getText()方法来获取字符数据，并利用trim()方法去除空缺字符。
由于XML文档中的空缺字符也会被解析器读取到，因此我们须要利用trim()方法来打消空缺字符，只获取故意义的文本内容。

在本日的文章中，壹哥重点给大家讲解DOM解析与Pull解析两种解析办法，其他的两种解析办法，大家如果感兴趣可以自行学习哦。

5. 总结比拟

以上几种XML解析办法都有各自的特点，比如：

DOM解析给我们供应了非常方便的操作API，但须要将全体XML文档加载到内存中，对付大型XML文件来说，性能和内存占用都会比较高。
SAX和StAX不须要将全体XML文档加载到内存中，因此性能和内存占用都会比较低，但编程繁芜度较高。
Pull解析器的API更加大略和直不雅观，同时不须要将全体XML文档加载到内存中，因此性能和内存占用都会比较低，但功能相对较弱，不适宜处理繁芜的XML文档。

我们可以通过一个表格来清晰地比拟不同解析办法的优缺陷：

解析技能

优点

缺陷

DOM

供应非常方便的操作API

须要将全体XML文档加载到内存中，对付大型XML文件来说，性能和内存占用都会比较高

SAX

不须要将全体XML文档加载到内存中，性能和内存占用都会比较低

编程繁芜度较高，须要注册回调函数来处理事宜

StAX

API大略和直不雅观，不须要将全体XML文档加载到内存中，性能和内存占用都会比较低

编程繁芜度较高，须要利用迭代器来遍历XML文档

Pull

API大略和直不雅观，不须要将全体XML文档加载到内存中，性能和内存占用都会比较低

功能相对较弱，不适宜处理繁芜的XML文档

以上便是壹哥对DOM、SAX、StAX和Pull这四种常用的XML解析技能的优缺陷剖析，实际上每种技能都有其优点和缺陷，我们在开拓时可以根据自己的实际需求选择得当的技能。
如果须要处理繁芜的XML文档，或者须要进行繁芜的数据操作，且内存资源较充足，壹哥建议利用DOM或SAX解析器；如果XML文档相对大略，数据操作较为大略，且内存资源比较宝贵，我们可以考虑利用StAX或Pull解析器。

------------------------------正片已结束，来根事后烟----------------------------

三. 结语

壹哥一贯跟大家强调，这个天下上没有十全十美的技能，虽然XML有挺多优点，但它也存在一些毛病，比如：

XML语法比较繁琐，须要利用大量的标记和属性来描述数据，因此相对付其他格式来说会比较冗长。
XML解析须要比较大的内存开销，这对付大型XML文件来说是一个问题； XML的可扩展性和自由度也是它的毛病之一，由于这样会导致XML文档的构造比较繁芜，不同的运用程序可能会定义不同的标签和属性，从而导致XML文档之间的互操作性变得很困难，很难实现统一的操作模式。
XML文档的解析和处理须要利用专门的工具和库，这对付一些小型运用程序来说可能会增加开拓本钱。

正是基于以上这些毛病，导致现在很多的项目中已经不再优先考虑XML文档作为数据存储和传输载体了，现在一样平常的项目大多都是方向于利用JSON格式。