美文网首页
正则表达式笔记

正则表达式笔记

作者: 长不大的帅小伙 | 来源:发表于2016-09-29 11:14 被阅读31次

正则表达式用于匹配字符串的规则的,知识点不难,但是比较繁琐,这篇文章把正则的基本常用点系统的整理了一下,方便自己以后要用的时候查阅,也希望给大家提供参考。废话不多说,直接奔主题。

1. 元字符

元字符 说明
. 除了换行符以外的任意字符
* 指定*前边的内容可以连续重复使用任意次数
+ 匹配重复1次或更多次
^ 匹配字符串的开始
$ 匹配字符串的结束
\d 匹配一位数字
\s 匹配任意的空白符,如空格、Tab、换行符、中文全角空格等
\w 匹配字母或数字或下划线或汉字等
\b 匹配单词的开始或结束

2. 转义字符

如果想查找元字符本身的话,就得使用\来取消这些字符的特殊意义。因此你应该使用\.\*。当然如果要查找\本身,也得用\\\
例子:

deerchao\.net : 匹配deerchao.net
C:\\Windows : 匹配C:\Windows

3.限定符(重复)

代码 说明
* 重复0次或更多次
+ 重复1次或更多次
? 重复0次或1次
{n} 重复n次
{n,} 重复n次或更多次
{n,m} 重复n到m次

4. 字符类

要想查找数字,字母,空白是很简单的,因为已经有了对应这些字符集合的元字符,但是如果你想匹配没有预定义元字符的字符集合(比如元音字母a,e,i,o,u),应该怎么办?这个时候字符类就起作用了。例如:

代码 说明
[aeiou] 匹配任何一个英文元音字母
[.?!] 匹配标点符号(.或?或!)
[0-9] \d完全一致,匹配0到9中的一位数字
[a-z0-9A-Z] 匹配a到z,A到Z,中任意一个字母或0到9任意一个数字

5. 分枝条件

正则表达式里的分枝条件指的是有几种规则,如果满足其中任意一种规则都应该当成匹配,具体方法是用|把不同的规则分隔开。(注:匹配分枝条件时,将会从左到右地测试每个条件,如果满足了某个分枝的话,就不会去再管其它的条件了。)例子:
0\d{2}-\d{8}|0\d{3}-\d{7} : 这个表达式能匹配两种以连字号分隔的电话号码:一种是三位区号,8位本地号(如010-12345678),一种是4位区号,7位本地号(0376-2233445)

6. 分组

可以用小括号来指定子表达式(也叫做分组),然后你就可以指定这个子表达式的重复次数了。例子:
(\d{1,3}\.){3}\d{1,3} : 可以匹配如123.123.123.123、001.002.003.004等类似于这样的字符串

7. 反义

代码 说明
\W 匹配任意不是字母,数字,下划线,汉字的字符
\S 匹配任意不是空白符的字符
\D 匹配任意非数字的字符
\B 匹配不是单词开头或结束的位置
[^x] 匹配除了x以外的任意字符
[^aeiou] 匹配除了aeiou这几个字母以外的任意字符

例子:

<a[^>]+> : 匹配用尖括号括起来的以a开头的字符串。

8. 后向引用

后向引用用于重复搜索前面某个分组匹配的文本。

  1. 默认情况下,每个分组会自动拥有一个组号,规则是:从左向右,以分组左括号为标志,第一个出现的分组的组号为1,第二个为2,以此类推。例:
\b(\w+)\b\s+\1\b : 这里的\1就相当于(\w+),这个正则可以匹配go go或move move这样的字符串
  1. 也可以自己指定表达式的组名。例:
(?<Word>\w+) 或者(?'Word'\w+)这样就把\w+组名指定为Word了,要后向引用这个分组捕获的内容,你可以使用\k<Word>,所以上一个例子也可以这么写\b(?<Word>\w+)\b\s+\k<Word>\b

后向引用捕获语法

代码/语法 说明
(exp) 匹配exp,并捕获文本到自动命名的组里
(?<name>exp) 匹配exp,并捕获文本到名称为name的组里,也可以写成(?'name'exp)
(?:exp) 匹配exp,不捕获匹配的文本,也不给此分组分配组号

9. 断言

代码/语法 说明
(?=exp) 匹配exp前面的位置
(?<=exp) 匹配exp后面的位置
(?!exp) 匹配后面跟的不是exp的位置
(?<!exp) 匹配前面不是exp的位置

例子:

\b\w+(?=ing\b) : 匹配以ing结尾的单词的前面部分(除了ing以外的部分),如:'m singing while you're dancing.时,它会匹配sing和danc。
(?<=\bre)\w+\b : 匹配以re开头的单词的后半部分(除了re以外的部分) 如:reading a book时,它匹配ading。
\b((?!abc)\w)+\b : 匹配不包含连续字符串abc的单词。
\d{3}(?!\d) : 匹配三位数字,而且这三位数字的后面不能是数。
(?<![a-z])\d{7} : 匹配前面不是小写字母的七位数字。
(?<=<(\w+)>).*(?=<\/\1>) : 如匹配`<html>`和`</html>`之间的内容。

10. 贪婪与懒惰

  • 当正则表达式中包含能接受重复的限定符时,通常的行为是(在使整个表达式能得到匹配的前提下)匹配尽可能多的字符。以这个表达式为例:a.*b,它将会匹配最长的以a开始,以b结束的字符串。如果用它来搜索aabab的话,它会匹配整个字符串aabab。这被称为贪婪匹配。
  • 有时,我们更需要懒惰匹配,也就是匹配尽可能少的字符。前面给出的限定符都可以被转化为懒惰匹配模式,只要在它后面加上一个问号?。这样.*?就意味着匹配任意数量的重复,但是在能使整个匹配成功的前提下使用最少的重复。例如:
    a.*?b匹配最短的,以a开始,以b结束的字符串。如果把它应用于aabab的话,它会匹配aab(第一到第三个字符)和ab(第四到第五个字符)。
代码/语法 说明
*? 重复任意次,但尽可能少重复
+? 重复1次或更多次,但尽可能少重复
?? 重复0次或1次,但尽可能少重复
{n,m}? 重复n到m次,但尽可能少重复
{n,}? 重复n次以上,但尽可能少重复

相关文章

  • 学习笔记 正则表达式

    2021.01.19 北京海淀 -2℃ 小雪转晴 正则表达式学习笔记 说明:该笔记参考“菜鸟教程”网站正则表达式...

  • 笔记:正则表达式

    正则表达式基础部分笔记

  • js高级(四)

    JavaScript高级第04天笔记 1.正则表达式概述 1.1什么是正则表达式 正则表达式( Regular E...

  • 正则表达式学习笔记

    正则表达式学习笔记 一篇记录了学习正则表达式的笔记。 1. 转义字符 在 HTMl 中转义字符以 & 符号开头,分...

  • JavaScript正则表达式

    JavaScript 正则表达式 @(笔记)[正则表达式] 第一章 课程简介 1-1 JS正则表达式简介及应用 课...

  • Python学习随笔

    本笔记整理自中谷教育在线教育视频 学习笔记——正则表达式常用符号 这里学习过正则表达式后,简单做了一个爬虫程序,效...

  • 作业-第04周--课堂-Day15-正则表达式与三剑客知识应用实

    Day15 课堂笔记 1. 正则表达式 什么是正则表达式? 简单地说,正则表达式就是为了处理大量的字符串及文本而定...

  • 一个程序员的自我学习第一天

    《正则表达式必知必会》笔记 第一章:正则表达式入门 1:正则表达式是一些用来匹配和处理文本的字符串。正则...

  • Python ☞ day 11

    Python学习笔记之 正则表达式 re模块概述:Python自1.5以后增加了re的模块,提供了正则表达式模式...

  • Python3.5笔记——第11章 正则表达式

    Python3.5笔记 第11章 正则表达式 认识正则表达式 正则表达式是一个特殊字符序列,能够帮助用户检查一个字...

网友评论

      本文标题:正则表达式笔记

      本文链接:https://www.haomeiwen.com/subject/rfvkyttx.html