从文本中提取 URL

粘贴聊天记录、Markdown 文档、电子邮件对话串或原始 HTML 内容,即可获得其中所有 http://https:// 链接的干净列表。工具会去除末尾标点、识别 Markdown 和 HTML 链接语法,并移除完全相同的重复项,因此你可以直接把列表交给爬虫或归档工具。

如何提取 URL

  1. 1

    粘贴源代码

    输入文本或 HTML。引号、尖括号、Markdown 链接语法及末尾标点都会自动处理。

  2. 2

    运行扫描

    找出所有 `http://` 和 `https://` 链接,去除末尾标点,并移除完全相同的重复项。

  3. 3

    查看数量

    你可以看到找到了多少个唯一 URL,以及完整的列表。

  4. 4

    复制或导出

    每行一个 URL,可直接用于 `curl -I`、归档工具、截图服务或 Screaming Frog 种子列表。

什么算作一个 URL

URL 检测比看起来更复杂,这个提取器刻意坚持一条安全规则:只识别完整的 http://https:// 链接,其余内容全部保留在你的文本中。

可识别的形式

形式 示例
绝对 HTTPS https://example.com/path?q=1
绝对 HTTP http://example.com
Markdown 链接目标 [text](https://example.com)
HTML 中的绝对 href href="https://example.com"

截断规则

末尾标点会被移除,因此 (https://example.com). 会变成 https://example.com。空格、引号、尖括号、圆括号、方括号、逗号和分号都会终止匹配。包含括号的 URL 会在第一个左括号处被截断,所以维基百科式的标题只能提取到左括号之前。

会跳过什么

  • mailto:tel:ftp: 以及所有非 httphttps 的方案。
  • 协议相对链接,如 //cdn.example.com/asset.js
  • 无协议的裸域名和 www. 前缀地址,如 example.com/docs/introwww.example.com/page
  • 仅含锚点的片段,如 #section,以及 JavaScript 伪 URL。

如何处理重复项

完全相同的重复项会被移除:https://example.com 无论出现多少次都只计一次,而 Example.comexample.com 会保留为两个独立条目。列表保持每个 URL 首次出现的顺序。

后处理技巧

  • 先转小写再做规范化去重。 如果希望 Example.comexample.com 算作同一主机,请先把输出转成小写,再重新去重。
  • 移除跟踪参数。 归档前使用 UTM 清理工具处理,否则会得到数十个几乎重复的链接。
  • 检查状态。 确定列表前,先用失效链接检查工具过滤掉 404 错误。

常见问题

只有当短链接带有完整方案时才能识别。单独的 bit.ly/xyz 不会被捕获,但 https://bit.ly/xyz 会作为普通 URL 处理。提取器不跟踪重定向,如需最终目标地址,请单独解析。

可以,当 href 是完整的 http://https:// URL 时。值会被干净地提取出来,不带周围标签;相对 href 不会被捕获。

它们会原样保留。如需移除 utm_* 及类似的跟踪参数,请在提取后使用 URL 清理工具。

不会。文本在请求期间处理,内容不会被持久化或记录。

相关工具

此工具还提供其他语言版本