编程技术是改变世界的力量。
本站
当前位置:网站首页 > 后端语言 > 正文

Java Web轻松学33 - XML核心原理 java的应用

gowuye 2024-04-04 11:55 15 浏览 0 评论

本系列文章旨在记录和总结自己在Java Web开发之路上的知识点、经验、问题和思考,希望能帮助更多码农和想成为码农的人。

目录

  1. 介绍
  2. XML是什么
  3. XML核心思想
  4. XML的物理构件
  5. XML基本概念
  6. XML命名空间
  7. XML Schema
  8. 总结

介绍

到目前为止,我们接触到的需要用到XML的地方有两处:

  • 一处是Servlet的配置,它使用了部署描述符web.xml,可以参考这篇文章
  • 一处是Spring IoC的配置元数据提供了基于XML的方式,可以参考这篇文章

基于“用到才讲解”的原则,本篇文章介绍一下XML的基础知识,这样我们遇到类似的使用XML的时候才不至于有惊慌失措,满脑子是问号的感觉。

但根据“够用就好”的原则,我们的介绍也仅限于基础的概念,经常用到的知识点,不会深入到细枝末节。

XML是什么

XML的英文全称是eXtensible Markup Language,缩写为XML,中文翻译过来就是可扩展标记语言。事实上,它又是另外一个标记语言的子集,就是SGML(Standard Generalized Markup Language,即标准通用标记语言),这是一个更加复杂的标记语言,不常用,不再赘述。

提到标记语言,大家是不是能够想到我们之前介绍过的HTML(HyperText Markup Language),可以参考这篇文章

所以,它们都是标记语言,必然有很多共同之处:

  • 都是基于文本的(而非二进制的),易于人类阅读和编辑;
  • 核心思想都是打标记(标签);
  • 都使用尖括号<、>来表示标签;
  • 等等。

那XML与HTML有什么不同吗?

实际上它们最大的不同,体现在XML名字中的eXtensible(可扩展)这个词上。

大家知道,HTML的标签是由标准组织定义的,不能随意的添加新的标签,或废弃已有的标签(当然,总有不遵守规范的)。

XML的标签则可以由用户自己定义。即你可以定义一组标签,用来描述电商数据(比如商品、订单、账户);还可以定义另外一组标签,用来描述其他数据。

我们前面使用的部署描述符web.xml中的标签就是由Servlet相关的标准组织定义的;而Spring IoC基于XML的配置元数据中的标签则是由Spring项目组织定义的。

现在,世界上有很多组织都使用XML扩展各自领域中比较通用的标签,比如数学标记语言MathML、化学标记语言CML、可缩放的矢量图形SVG、Web Service中的SOAP/WSDL等等。

所以,当你觉得有必要定义自己的标签来描述自己的数据,那么你也可以使用XML扩展自己的专业领域标签。当然,你可以放到Internet上共享给大家使用。

XML核心思想

前面已经提到过,XML的核心思想就是给数据打标记(标签),即用标记描述你的数据,这些标记就是元数据

比如,我设计这样一个XML文档:

<姓名>
 <姓>张</姓>
 <名>三</名>
</姓名>

标签<姓名>、<姓>、<名>其实就是元数据。

XML的物理构件

一方面,我们使用XML语言编写我们的XML文档,使用任何一款文本编辑器即可,因为XML是基于文本的;

另一方面,我们的XML文档需要由机器来读取、解析、处理并展现里面的数据,机器实际上是通过程序来执行这些动作的,这些程序就被叫做XML解析器/处理器

当然,你完全可以自己再造一个这样的XML解析器,但这就有点重复劳动了,因为有很多开源、共享的XML解析器。

很显然,web.xml应该是由Tomcat里面的XML解析器来读取并解析的;Spring IoC基于XML的配置元数据是由Spring框架库里面的XML解析器来读取并解析的。至于它们用的是哪一个XML解析器,大家可以看看它们的源代码。

XML基本概念

我们以Spring IoC基于XML的配置元数据为例(来自这篇文章):

<?xml version="1.0" encoding="UTF-8"?>
<beans xmlns="http://www.springframework.org/schema/beans"
	xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
	xsi:schemaLocation="http://www.springframework.org/schema/beans 
		https://www.springframework.org/schema/beans/spring-beans.xsd">
	
	<bean id="svcA" class="test.service.ServiceA">
		<constructor-arg name="serviceB" ref="svcB" />
		<constructor-arg name="repositoryA" ref="repoA" />
	</bean>
	
	<bean id="svcB" class="test.service.ServiceB">
		<property name="repositoyB" ref="repoB" />
	</bean>
	
	<bean id="repoA" class="test.repository.RepositoryA" />
	<bean id="repoB" class="test.repository.RepositoryB" />
</beans>

XML声明语句

每一个XML文档都应该(但不是必须)加上XML声明语句,说明文档是属于XML类型的,比如上面的:

<?xml version="1.0" encoding="UTF-8"?>
  • 开始必须是:<?xml
  • 结束必须是:?>
  • 必须放在文档第一行,且前面不能有空格
  • 必须有version属性,其值为1.0或1.1
  • 还可以有encodingstandalone属性,但顺序必须是version、encoding、standalone

跟HTML类似,encoding属性的值必须与你实际存储XML文档使用的编码相同。

标签

上面的例子中有四个标签,准确的说法应该是四种标签:

  • <beans>
  • <bean>
  • <constructor-arg>
  • <property>

当然,每一种标签都最好有一个能够尽量准确表达其语义的名字。

标签遵守的一些语法规则如下:

  • 使用尖括号
  • 分三类:开始标签<tag>、结束标签</tag>、自封闭标签<tag />
  • 标签名区分大小写,也要遵从XML命名规定,比如不能有空格,开始字符不能是xml等等,不再赘述
  • 开始标签和自封闭标签都可以有属性

元素

包括开始标签、结束标签,及其它们之间的内容;或者是自封闭标签。

  • 每一个开始标签必须有一个对应的结束标签(自封闭标签其实可以看作是开始标签和结束标签合二为一)
  • 元素可以嵌套,即一个元素的内容可以是其他元素,但是,嵌套必须正确。
  • 一个XML文档只能有一个根元素,比如例子中的<beans>...</beans>
  • 元素的内容可以是其他元素、纯文本字符、或者两者皆有
  • 纯文本字符的内容叫做PCDATA(Parsed Character Data,可解析的字符数据)
  • PCDATA中的空白符也是数据的一部分,即XML解析器不会删除这些空白符,这一点与HTML不一样。
  • 一个XML文档中,元素的顺序不能忽略

属性

上面的例子中,<beans>有:

  • xmlns
  • xmlns:xsi
  • xsi:schemaLocation

三个属性,实际上,前两个不应该叫做属性;或者你也可以认为前两个既是属性,同时也是命名空间/名字空间/名称空间(namespace)的声明。

<bean>有id、class等属性,其他元素也类似。

  • 属性以名/值形式存在
  • 属性值必须使用引号,单引号或双引号均可
  • 属性必须有值,即便是空字符串,不像HTML中的<input checked>
  • 属性的顺序无关紧要

XML命名空间

可能会有这么一个场景:为各个业务领域都定义了自己的一组标签,但那些跨领域的业务需要将这些标签放到同一个XML文档中使用,于是必然会出现标签同名或者属性同名的问题。

于是,XML引入命名空间的概念。实际上,任何一门语言技术都存在名字冲突的问题,就比如我们使用的Java编程语言,它是引入的概念来解决。

本质上,不管是命名空间还是包,都是为我们的名字添加限定符而已,可以理解为将我们的名字变的更长,从而在某个范围内是唯一的。

现在的问题就是这个唯一性如何来保证,必须有一个专门的机构来管理命名空间。很幸运,Web中就有一个已经由专门机构管理概念,那就是域名。所以,我们可以使用URL来标识我们定义的某一组XML标签。

所以说,一个XML的命名空间仅仅是一个抽象的概念,它就类似一个集合而已,装了若干XML标签,将其他XML标签隔离开来。我们相当于又为命名空间起了一个名字,这个名字用URL规范。

不过,我们千万不要假设标识该命名空间的URL真的能够在Web中可以访问,虽然很多情况下都是可以的,比如我们例子中Spring IoC基于XML的配置元数据中的命名空间:

http://www.springframework.org/schema/beans

在浏览器中竟然可以访问:

命名空间的声明

所以,如果我们需要在一个XML文档中使用到多个命名空间的标签,那么往往需要声明命名空间以避免名字冲突;否则,也可以不声明。

我们例子中声明了两个命名空间:

<beans xmlns="http://www.springframework.org/schema/beans"
	xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
	xsi:schemaLocation="http://www.springframework.org/schema/beans 
		https://www.springframework.org/schema/beans/spring-beans.xsd">
  • 命名空间的声明使用元素属性的名/值形式,属性名必须是xmlnsxmlns:命名空间前缀,所以前面说这两个既可当做属性,也可以不当做属性
  • 命名空间的声明可以在任何一个元素的开始标签或自封闭标签上,但一般都加在根元素上
  • 属性名是xmlns的声明表示是默认命名空间,属于默认命名空间的元素和属性在书写时就不需要加上命名空间前缀
  • 标签和属性都可以属于某一个命名空间

命名空间前缀

因为要在同一个文档中使用多个命名空间的标签(这些标签有可能是同名的),所以需要将命名空间的名字作为限定符修饰标签。

而命名空间采用URL作为标识符往往很长,当然书写起来就不方便,于是乎人们想到为命名空间定义前缀的方式来。

命名空间前缀的定义与声明是放在一起的,就是采用

xmlns:命名空间前缀="http://example.com/ns1"

的形式,比如我们例子中的:

xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"

所以,我们就可以用前缀来引用该命名空间的属性了:

xsi:schemaLocation="http://www.springframework.org/schema/beans 
		https://www.springframework.org/schema/beans/spring-beans.xsd"

该命名空间(http://www.w3.org/2001/XMLSchema-instance)有个schemaLocation的全局属性,用来指示文档中所用到的命名空间所对应XML Schema文档

再看另外一个例子(来自这篇文章):

<?xml version="1.0" encoding="UTF-8"?>
<beans xmlns="http://www.springframework.org/schema/beans"
	xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
	xmlns:context="http://www.springframework.org/schema/context"
	xsi:schemaLocation="http://www.springframework.org/schema/beans 
		https://www.springframework.org/schema/beans/spring-beans.xsd 
		http://www.springframework.org/schema/context 
		https://www.springframework.org/schema/context/spring-context.xsd">
	
	<context:component-scan base-package="test" />
</beans>

这里又多声明了一个命名空间:

xmlns:context="http://www.springframework.org/schema/context"

于是,文档中也就可以使用该命名空间中的<component-scan>标签:

<context:component-scan base-package="test" />

XML Schema

前面提到,命名空间(http://www.w3.org/2001/XMLSchema-instance)有个schemaLocation的全局属性,用来指示文档中所用到的命名空间所对应XML Schema文档。

比如:

xsi:schemaLocation="http://www.springframework.org/schema/beans 
		https://www.springframework.org/schema/beans/spring-beans.xsd"

我们再尝试用浏览器访问该XML Schema文档:

可以看到,XML Schema就是用来扩展/定义标签和属性的,它本身又是基于XML的。上面例子spring-beans.xsd中大部分内容是定义标签的,比如<beans>、<bean>等标签。

schemaLocation属性将被XML解析器所读取,从而找到命名空间所对应的XML Schema文档,从而能够根据该文档来验证我们的XML文档是否符合规则

因此,XML Schema文档称为模式文档,是用来定义和扩展标签的,我们就可以用它来设计我们的标签和属性,设计它们的规则;

而我们使用设计好的标签编写的普通XML文档就被称作是模式实例文档

关于如何使用XML Schema来定义和扩展标签,我们以后再讨论。

实际上,XML文档的验证还有一种比较常用的是DTD(Document Type Definition,即文档类型定义)技术,也是定义和扩展标签之用的,只不过是使用另外一种语法,以后用到了再讨论。

总结

  • 打标记、元数据的思想很重要
  • 名字冲突是一个普遍性问题,实际上就是如何唯一标识一个对象、资源、实体等
  • 我们以后如果需要用到读取XML文档的任务,可以找找第三方开发的XML解析器
  • XML、JSON、properties文件、YAML等都是基于文本的,都用于数据的描述、存储、交换等

相关推荐

嵌入式C语言中常量的应用实例(嵌入式c语言中常量的应用实例是什么)

常量,我们都知道,就是数值保持不变的量。在C语言中,常量一旦初始化了,它的值将在整个程序运行周期内,不允许发生任何变化。常量与变量是相对的,我们实际项目中经常会用到它。定义常量的两种方式C语言中主要有...

C语言编程基础知识汇总学习,适合初学者!更新常量知识

(二)整型常量整型常量有3种形式:十进制整型常量、八进制整型常量和十六进制整型常量。(注意:c语言中没有直接表示二进制的整型常量,在c语言源程序中不会出现二进制。)书写方式如下:十进制整型常量:123...

【C语言】第二章第六节:字符串常量

第二章第六节:字符串常量。下表C语言中的常用转义字符。·字符形式功能:ASCIl码(十进制形式)。→\t水平制表(横向跳格:跳到下一个tab位置)。→\b退格8。→\r回车(不换行,光标移到本行行首)...

「GCTT 出品」Go 系列教程——5. 常量

这是我们Golang系列教程的第五篇。定义在Go语言中,术语”常量”用于表示固定的值。比如5、-89、IloveGo、67.89等等。看看下面的代码:varaint=50v...

每日C语言-常量指针、指针常量、指向常量的指针常量

一、常量指针1)什么是常量指针?通过该指针不可以修改其所指向存储单元中的值指针本身即地址可以被修改2)定义:类型说明符const*指针变量;类型说明符表示指针所指向存储单元中的值得数据类型指针...

C语言-符号常量、常变量、变量之我见

更新内容:新增音频。音频和文章一起更配oHello,大家好,又和大家见面了~~相信很多朋友们听了C语言的“符号常量”、“常变量”、“变量”后还是对这三者一脸懵逼吧。不管老师怎么歇斯底里地讲解,同学们迷...

零基础带你学习C语言:四:探索常量与变量

前言常量与变量学习;一:分析:short、float、long类型#include<stdio.h>intmain(){shortage=18;floatweight=12...

C语言中是如何定义常量的?那定义字符串呢?

常量有整型常量、浮点型常量、字符型常量及字符串常量。‘常量定义是指定义符号常量,用一个标识符来代表一个常量,通过宏定义预处理指令来实现。常量的定义:#definecount60这就定义了一个常量...

C语言符号常量的优点,会是那几点?

符号常量是一个常量,是不变量,所以,在编译的时候,就把符号常量出现的地方,替换为符号常量对应的常量。符号常量一般用户定义一个全局使用的数据,而且要改变该数据的时候,只需要改变符号常量的值,代码中引用符...

嵌入式开发- C语言数据类型-常量(c语言嵌入式是干嘛的)

基本数据类型的常量-掌握**整型常量:**常量是指在程序运行期间其数值不发生变化的数据。整型常量通常简称为整数整数可以是十进制数、八进制数、十六进制数八进制06334十六进制0xd1...

c语言解剖课:只读变量、常量、字面量傻傻分不清?

写在前面本篇主题的缘起,是因为一个计算机专业的大学生在和我讨论c语言问题时,说const常量如何如何,我说变量被const修饰了,还是变量,不是“常量”。他给了我一个截图:他说大模型都是这样回答的,变...

C/C++编程笔记:C数组、字符串常量和指针!三分钟弄懂它

想弄懂C语言中数组和指针的关系吗?这篇文章就占据你三分钟时间,看完你肯定会有收获!数组数组声明为数据类型名称[constant-size],并将一个数据类型的一个或多个实例分组到一个可寻址的位...

C语言入门到精通【第008讲】——C语言常量

C语言常量常量是固定值,在程序执行期间不会改变。这些固定的值,又叫做字面量。常量可以是任何的基本数据类型,比如整数常量、浮点常量、字符常量,或字符串字面值,也有枚举常量。常量就像是常规的变量,只不过常...

这是C语言无法修改得东西,C语言基础教程之常量解析

常量是指程序在执行期间不会改变的固定值。这些固定值也称为文字。常量可以是任何基本数据类型,如整数常量,浮点常量,字符常量或字符串文字,还有枚举常量。常量被视为常规变量,除了它们的值在定义后无法修改。整...

C语言中的单精度、双精度、常量等都有什么意思?

刚接触C语言时,对于常量,变量,浮点,单精度,双精度等问题的理解,大都很模糊不清,其实在程序运行过程中,其值不能改变的量称为常量。如12、0、-3为整型常量,4.6、-1.23为实型常量,'a'、'...

取消回复欢迎 发表评论: