Python正则匹配URL链接完整写法

时间：2026-03-15

匹配URL的正则表达式可以写为：https?://(?:www.)?[a-zA-Z0-9-]+(.[a-zA-Z]{2,})+(/\S*)?，其结构分为三部分：1. 匹配协议头http或https；2. 匹配域名，包括可选的www前缀、域名主体和顶级域名；3. 可选的路径和参数部分。在使用时可通过Python的re模块进行匹配，并可根据需求添加行首行尾锚点、扩展端口号与IP地址支持，或结合urllib.parse处理更复杂的场景。

Python正则表达式如何匹配URL链接？完整模式

匹配URL链接的正则表达式其实并不复杂，但要写出一个既全面又实用的模式，就需要考虑各种常见的URL格式。下面这个正则表达式基本上可以覆盖大多数常见情况：

https?://(?:www\.)?[a-zA-Z0-9-]+(\.[a-zA-Z]{2,})+(/[^\s]*)?

接下来我们分几个部分来解释这个正则表达式的结构，并给出一些使用建议。

匹配协议头：http 或 https

URL通常以 http:// 或 https:// 开头。这部分可以用以下正则表示：

https?

这里的 s? 表示“s”是可选的，也就是既可以匹配 http 也可以匹配 https。

匹配域名（包括 www 和非 www）

域名部分通常由字母、数字、短横线组成，可能带有 www. 前缀。我们可以这样写：

(?:www\.)?[a-zA-Z0-9-]+(\.[a-zA-Z]{2,})+

(?:www\.)? 表示可选的 www.，且不捕获该组（非捕获组）
[a-zA-Z0-9-]+ 表示域名主体，如 google、example 等
(\.[a-zA-Z]{2,})+ 表示顶级域名，如 .com、.org、.co.uk 等，至少两个字符

匹配路径和参数（可选）

URL中可能会有路径或查询参数，比如 /about 或 ?id=123。这部分可以用：

(/[^\s]*)?

/ 表示路径开始
[^\s]* 表示除了空格以外的任意字符（即路径和参数）
整个用 ()? 包裹，表示整个路径部分是可选的

实际使用建议

在Python中使用时，可以结合 re 模块进行匹配：

import re

pattern = r'https?://(?:www\.)?[a-zA-Z0-9-]+(\.[a-zA-Z]{2,})+(/[^\s]*)?'
text = '访问我们的网站 https://example.com/about 获取更多信息'

urls = re.findall(pattern, text)
print(urls)