从文本中提取 URL
粘贴聊天记录、Markdown 文档、电子邮件对话串或原始 HTML 内容,即可获得其中所有 http:// 和 https:// 链接的干净列表。工具会去除末尾标点、识别 Markdown 和 HTML 链接语法,并移除完全相同的重复项,因此你可以直接把列表交给爬虫或归档工具。
如何提取 URL
-
1
粘贴源代码
输入文本或 HTML。引号、尖括号、Markdown 链接语法及末尾标点都会自动处理。
-
2
运行扫描
找出所有 `http://` 和 `https://` 链接,去除末尾标点,并移除完全相同的重复项。
-
3
查看数量
你可以看到找到了多少个唯一 URL,以及完整的列表。
-
4
复制或导出
每行一个 URL,可直接用于 `curl -I`、归档工具、截图服务或 Screaming Frog 种子列表。
什么算作一个 URL
URL 检测比看起来更复杂,这个提取器刻意坚持一条安全规则:只识别完整的 http:// 和 https:// 链接,其余内容全部保留在你的文本中。
可识别的形式
| 形式 | 示例 |
|---|---|
| 绝对 HTTPS | https://example.com/path?q=1 |
| 绝对 HTTP | http://example.com |
| Markdown 链接目标 | [text](https://example.com) |
| HTML 中的绝对 href | href="https://example.com" |
截断规则
末尾标点会被移除,因此 (https://example.com). 会变成 https://example.com。空格、引号、尖括号、圆括号、方括号、逗号和分号都会终止匹配。包含括号的 URL 会在第一个左括号处被截断,所以维基百科式的标题只能提取到左括号之前。
会跳过什么
mailto:、tel:、ftp:以及所有非http或https的方案。- 协议相对链接,如
//cdn.example.com/asset.js。 - 无协议的裸域名和
www.前缀地址,如example.com/docs/intro或www.example.com/page。 - 仅含锚点的片段,如
#section,以及 JavaScript 伪 URL。
如何处理重复项
完全相同的重复项会被移除:https://example.com 无论出现多少次都只计一次,而 Example.com 和 example.com 会保留为两个独立条目。列表保持每个 URL 首次出现的顺序。
后处理技巧
- 先转小写再做规范化去重。 如果希望
Example.com和example.com算作同一主机,请先把输出转成小写,再重新去重。 - 移除跟踪参数。 归档前使用 UTM 清理工具处理,否则会得到数十个几乎重复的链接。
- 检查状态。 确定列表前,先用失效链接检查工具过滤掉 404 错误。
常见问题
只有当短链接带有完整方案时才能识别。单独的 bit.ly/xyz 不会被捕获,但 https://bit.ly/xyz 会作为普通 URL 处理。提取器不跟踪重定向,如需最终目标地址,请单独解析。
可以,当 href 是完整的 http:// 或 https:// URL 时。值会被干净地提取出来,不带周围标签;相对 href 不会被捕获。
它们会原样保留。如需移除 utm_* 及类似的跟踪参数,请在提取后使用 URL 清理工具。
不会。文本在请求期间处理,内容不会被持久化或记录。
相关工具
字数统计器
统计单词、字符、句子和段落数,并提供阅读时间、朗读时间、关键词密度,以及面向论文、帖子、配文和元描述的 Flesch 易读性评分。
域名生成器
根据一个关键词生成域名创意:在六种常见 TLD 中组合前缀、后缀、重复字母和数字结尾。
适合阅读障碍者的文本转换工具
将粘贴的文本重新排版为短段落和约72个字符的行,便于阅读。将结果复制到任何文档、邮件或编辑器中。
可复制的箭头符号
一键复制常用 Unicode 箭头:直线、双线、斜向、钩形、环形和三角样式,适合文档、聊天和设计。
小于或等于符号
复制 ≤ 符号及相关数学比较符号。包含适用于电子表格、论文和网页的 Unicode、HTML 实体及 LaTeX 标记。
Base64 文本编码器
把文本编码为 Base64,或把 Base64 解码回可读文本。支持 UTF-8、URL 安全变体以及含空白字符的输入。
此工具还提供其他语言版本
- Metinden URL'leri Çıkarma [TR]
- Extraire des URL du texte [FR]
- Extrahera URL:er från text [SV]
- Extrair URLs do Texto [PT]
- Extract URLs from Text [EN]
- استخراج عناوين URL من النص [AR]
- 텍스트에서 URL을 추출합니다 [KO]
- テキストからURL抽出 [JA]
- URL's extraheren uit tekst [NL]
- ดึง URL จากข้อความ [TH]
- Extraer URLs del Texto [ES]
- Ekstrak URL dari Teks [ID]
- Wydobywanie URL-ów z tekstu [PL]
- Trích xuất URL từ văn bản [VI]
- URLs aus Text extrahieren [DE]
- Извлечение URL из текста [RU]
- Estrai URL dal testo [IT]