
对于字符串“a5”,是由两个字符“a”、“5”以及三个位置组成的,这一点对于正则表达式的匹配原理理解很重要。
正则表达式匹配过程中,如果子表达式匹配到的是字符内容,而非位置,并被保存到最终的匹配结果中,那么就认为这个子表达式是占有字符的;如果子表达式匹配的仅仅是位置,或者匹配的内容并不保存到最终的匹配结果中,那么就认为这个子表达式是零宽度的。
占有字符还是零宽度,是针对匹配的内容是否保存到最终的匹配结果中而言的。
占有字符是互斥的,零宽度是非互斥的。也就是一个字符,同一时间只能由一个子表达式匹配,而一个位置,却可以同时由多个零宽度的子表达式匹配。
正则表达式由两种字符构成。一种是在正则表达式中具体特殊意义的“元字符”,另一种是普通的“文本字符”。
元字符可以是一个字符,如“^”,也可以是一个字符序列,如“\w”。
字符组可以匹配[ ]中包含的任意一个字符。虽然可以是任意一个,但只能是一个。
字符组支持由连字符“-”来表示一个范围。当“-”前后构成范围时,要求前面字符的码位小于后面字符的码位。
[^…] 排除型字符组。排除型字符组表示任意一个未列出的字符,同样只能是一个。排除型字符组同样支持由连字符“-”来表示一个范围。
|
表达式 |
说明 |
|
[abc] |
表示“a”或“b”或“c” |
|
[0-9] |
表示0~9中任意一个数字,等价于[0123456789] |
|
[\u4e00-\u9fa5] |
表示任意一个汉字 |
|
[^a1<] |
表示除“a”、“1”、“<”外的其它任意一个字符 |
|
[^a-z] |
表示除小写字母外的任意一个字符 |
举例:
“[0-9][0-9]”在匹配“Windows 2003”时,匹配成功,匹配的结果为“20”。
“[^inW]”在匹配“Windows 2003”时,匹配成功,匹配的结果为“d”。
对于一些常用的字符范围,如数字等,由于非常常用,即使使用[0-9]这样的字符组仍显得麻烦,所以定义了一些元字符,来表示常见的字符范围。
|
表达式 |
说明 |
|
\d |
任意一个数字,相当于[0-9],即0~9 中的任意一个 |
|
\w |
任意一个字母或数字或下划线,相当于[a-zA-Z0-9_] |
|
\s |
任意空白字符,相当于[ \r\n\f\t\v] |
|
\D |
任意一个非数字字符,\d取反,相当于[^0-9] |
|
\W |
\w取反,相当于[^a-zA-Z0-9_] |
|
\S |
任意非空白字符,\s取反,相当于[^ \r\n\f\t\v] |
举例:
“\w\s\d”在匹配“Windows 2003”时,匹配成功,匹配的结果为“s 2”。
小数点可以匹配除“\n”以外的任意一个字符。如果要匹配包括“\n”在内的所有字符,一般用[\s\S],或者是用“.”加(?s)匹配模式来实现。
|
表达式 |
说明 |
|
. |
匹配除了换行符 \n 以外的任意一个字符 |
|
表达式 |
说明 |
|
^ |
匹配字符串开始的位置,不匹配任何字符 |
|
更多精彩内容其他人还在看
JavaScript 中的正则表达式(推荐)正则表达式通常用于在文本中查找匹配的字符串,js正则表达式在程序开发中应用非常广泛,本文给大家介绍JavaScript 中的正则表达式(推荐),感兴趣的朋友一起学习吧
收藏 0赞 0分享 Java正则表达式入门基础篇(新手必看)这篇文章给大家介绍java正则表达式入门基础篇, 由于正则表达式是一个很庞杂的体系,所以我仅例举些入门的概念,更多的请参阅相关书籍及自行摸索。感兴趣的朋友一起跟着小编来看看吧
收藏 0赞 0分享 Linux正则表达式特性详解及BRE与ERE的异同点本篇文章给大家介绍linux正则表达式特性及BRE与ERE的不同,Linux正则表达式(Regular Expression)主要遵从POSIX BRE或者POSIX ERE标准,对linux正则表达式感兴趣的朋友可以参考下本篇文章
收藏 0赞 0分享 Linux下如何使用grep命令查找带有tab(退格)的字符本文给大家介绍linux下如何使用grep命令查找带有tab(退格)的字符,涉及到linux grep 查找带有tab的字符方面的知识,对linux grep tab感兴趣的朋友可以参考下本篇文章
收藏 0赞 0分享 比较全面的C 、Java、JavaScript中的正则表达式详解正则表达式(Regular Expression) 就是用某种模式去匹配一类字符串的公式。本篇文章给大家介绍C 、Java、JavaScript中的正则表达式,本文介绍的非常全面,感兴趣的朋友一起看看吧
收藏 0赞 0分享 |