美文网首页
正则表达式

正则表达式

作者: PySong | 来源:发表于2018-07-31 16:31 被阅读0次

正则表达式是一种查找以及字符串替换操作。正则表达式在文本编辑器中广泛使用,比如正则表达式被用于:

检查文本中是否含有指定的特征词

找出文中匹配特征词的位置

从文本中提取信息,比如:字符串的子串

修改文本

与文本编辑器相似,几乎所有的高级编程语言都支持正则表达式。在这样的语境下,“文本”也就是一个字符串,可以执行的操作都是类似的。一些编程语言(比如Perl,JavaScript)会检查正则表达式的语法。

正则表达式是什么?

正则表达式只是一个字符串。没有长度限制,但是,这样的正则表达式长度往往较短。如下所示是一些正则表达式的例子:

I had a \S+ day today

[A-Za-z0-9-_]{3,16}

\d\d\d\d-\d\d-\d\d

v(\d+)(.\d+)*

TotalMessages="(.*?)"

<[^<>]>

这些字符串实际上都是微型计算机程序。正则表达式的语法,实际上是一种轻量级、简洁、适用于特定领域的编程语言。记住这一点,那么你就很容易理解下面的事情:

每一个正则表达式,都可以分解为一个指令序列,比如“先找到这样的字符,再找到那样的字符,再从中找到一个字符。。。”

每一个正则表达式都有输入(文本)和输出(匹配规则的输出,有时是修改后的文本)

正则表达式有可能出现语法错误——不是所有的字符串都是正则表达式

正则表达式语法很有个性,也可以说很恐怖

有时可以通过编译,使得正则表达式执行更快

在实现中,正则表达式还有其他的特点。本文将重点讨论正则表达式的核心语法,在几乎所有的正则表达式中都可以见到这些规则。

特别提示:正则表达式与文件通配语法无关,比如 *.xml

正则表达式的基础语法

字符

正则表达式中包含了一系列的字符,这些字符只能匹配它们本身。有一些被称为“元字符”的特殊字符,可以匹配一些特殊规则。

如下所示的例子中,我用红色标出了元字符。

I had a \S+ day today

[A-Za-z0-9-_]{3,16}

\d\d\d\d-\d\d-\d\d

v(\d+)(.\d+)*

TotalMessages="(.*?)"

<[^<>]*>

大部分的字符,包括所有的字母和数字字符,是普通字符。也就意味着,它们只能匹配它们自己,如下所示的正则表达式:

cat

意味着,只能匹配一个字符串,以“c”开头,然后是字符“a”,紧跟着是字符“t”的字符串。

到目前为止,正则表达式的功能类似于

常规的Find功能

Java中的String.indexOf()函数

PHP中的strpos()函数

等等

注意:不做特殊说明,正则表达式中是区分大小写的。但是,几乎所有正则表达式的实现,都会提供一个Flag用来控制是否区分大小写。

点“.”

我们第一个要讲解的元字符是“.”。这个符号意味着可以匹配任意一个字符。如下所示的正则表达式:

c.t

意味着匹配“以c开头,之后是任意一个字符,紧跟着是字母t”的字符串。

在一段文本中,这样的正则表达式可以用来找出cat,cot,czt这样的字符串,甚至可以找出c.t这样的组合,但是不能找到ct或者是coot这样的字符串。

使用反斜杠“\”可以忽略元字符,使得元字符的功能与普通字符一样。所以,正则表达式

c.t

表示“找到字母c,然后是一个句号(“.”),紧跟着字母t”

反斜杠本身也是一个元字符,这意味着反斜杠本身也可以通过相似的方法变回到普通字符的用途。因此,正则表达式

c\t

表示匹配“以字符c开头,然后是一个反斜杠,紧跟着是字母t”的字符串。

注意!在正则表达式的实现中,.是不能用于匹配换行符的。”换行符“的表示方法在不同实现中也不同。实际编程时,请参考相关文档。在本文中,我认为.是可以匹配任意字符的。实现环境通常会提供一个Flag标志位,来控制这一点。

字符类

字符类是一组在方括号内的字符,表示可以匹配其中的任何一个字符。

正则表达式c[aeiou]t,表示可以匹配的字符串是”以c开头,接着是aeiou中的任何一个字符,最后以t结尾”。在文本的实际应用中,这样的正则表达式可以匹配:cat,cet,cit,cot,cut五种字符串。

正则表达式[0123456789]表示匹配任意一个整数。

正则表达式[a]表示匹配单字符a。

包含忽略字符的例子

a表示匹配字符串[a]

[[]\ab]表示匹配的字符为”[“或者”]”或者”a”,或者”b”

[\[]]表示匹配的字符为”\”或者 “[”或者”]”

在字符类中,字符的重复和出现顺序并不重要。[dabaaabcc]与[abc]是相同的

重要提示:字符类中和字符类外的规则有时不同,一些字符在字符类中是元字符,在字符类外是普通字符。一些字符正好相反。还有一些字符在字符类中和字符类外都是元字符,这要视情况而定!

比如,.表示匹配任意一个字符,而[.]表示匹配一个全角句号。这不是一回事!

字符类的范围

在字符集中,你可以通过使用短横线来表示匹配字母或数字的范围。

[b-f]与[b,c,d,e,f]相同,都是匹配一个字符”b”或”c”或”d”或”e”或”f”

[A-Z]与[ABCDEFGHIJKLMNOPQRSTUVWXYZ]相同,都是匹配任意一个大写字母。

[1-9]与[123456789]相同,都是匹配任意一个非零数字。

相关文章

  • Linux命令行与Shell脚本编程大全-shell正则表达式

    本章内容: 定义正则表达式 了解基本正则表达式 扩展正则表达式 创建正则表达式 定义正则表达式 正则表达式是你定义...

  • 正则相关

    正则表达式基本语法 正则表达式常见字符 正则表达式特殊字符 正则表达式数量词 正则表达式边界匹配 正则表达式逻辑或...

  • 正则表达式系列-1

    正则表达式系列-1正则表达式系列-2正则表达式系列-3正则表达式系列-4 什么是正则表达式 正则表达式就是用事先定...

  • 正则表达式

    正则表达式 - 教程正则表达式 - 简介正则表达式 - 语法正则表达式 - 元字符正则表达式 - 运算符优先级正则...

  • Python基础入门 - 正则表达式与综合实战

    1. 初识正则表达式 1.1 介绍 步骤介绍正则表达式入门及应用正则表达式的进阶正则表达式案例 1.2 正则表达式...

  • Java正则表达式参考

    Java正则表达式入门 java正则表达式应用 深入浅出之正则表达式(一) 深入浅出之正则表达式(二) 正则表达式...

  • 正则表达式

    正则表达式 正则表达式就是记录文本规则的代码 正则表达式常用的元字符 正则表达式常用的限定符 正则表达式举例:这里...

  • Python爬虫(十)_正则表达式

    本篇将介绍python正则表达式,更多内容请参考:【python正则表达式】 什么是正则表达式 正则表达式,又称规...

  • python正则表达式

    本篇将介绍python正则表达式,更多内容请参考:【python正则表达式】 什么是正则表达式 正则表达式,又称规...

  • 正则表达式

    了解正则表达式基本语法 能够使用JavaScript的正则对象 正则表达式简介 什么是正则表达式 正则表达式:用于...

网友评论

      本文标题:正则表达式

      本文链接:https://www.haomeiwen.com/subject/xjuhvftx.html