外部链接提取器

粘贴原始HTML,即可获得其中所有外部链接的干净、去重列表。可选输入基础URL,让提取器知道哪些主机算作内部;指向任何其他主机的链接都会被列出。适用于排查链接泄露、过期的合作伙伴链接,或确认外链指向符合你的政策要求。

如何提取外部链接

  1. 1

    提供来源

    粘贴页面的原始HTML。可选添加基础URL,让提取器知道哪些主机算作内部;留空则所有主机都视为外部。

  2. 2

    运行提取

    先选择是否将子域名视为内部,以及是否包含 nofollow、sponsored 和 ugc 链接。随后读取每个`<a href>`和`<area href>`,以基础URL为准解析相对链接,只保留指向其他主机的 http/https 链接。重复的链接会合并并计数。

  3. 3

    查看列表

    你会得到一张外部URL表格,列出每个URL的锚文本、rel 值(nofollow、sponsored、ugc)及出现次数,同时统计内部链接的数量。

  4. 4

    使用结果

    将所有URL复制到剪贴板,将表格下载为CSV文件以便在电子表格中使用,或在新标签页中打开任意目标地址。

提取器视为外部的链接

当链接的主机与你提供的基础URL的主机不同时,该链接即视为外部。比较时不区分大小写,并忽略开头的www.,因此example.com和www.example.com属于同一网站。默认情况下,子域名按独立主机处理,因此blog.example.com相对于www.example.com是外部链接;如需将该主机的所有子域名视为内部,请在子域名选项中选择“是”。基础URL留空时,所有 http/https 链接都会作为外部链接列出。

表格会为每个目标地址显示锚文本(图片链接和<area>图像映射区域显示其替代文本)、其链接上的rel值(nofollow、sponsored和ugc会高亮显示)以及出现次数。CSV下载文件包含相同的列,另加域名。

它忽略的内容

  • mailto:、tel:、javascript:以及仅含片段的#链接。
  • 基础URL留空时的相对URL:没有基础URL,提取器就无法判断它们指向何处,因此只计数。提供基础URL后,相对URL会被解析并计为内部链接。//cdn.example.com这类协议相对URL始终包含主机名,因此会被检查(没有基础URL时按 https 处理)。
  • 不含href的锚标签(它们不是可导航的链接)。

小贴士

  • 页面使用JavaScript时,请粘贴渲染后的HTML。 框架在客户端生成的链接只有在你粘贴渲染后的DOM时才会出现(例如从DevTools复制outerHTML)。
  • 留意跟踪包装链接。 通过/go/或/out/进行的联盟重定向可能隐藏真实目标;提取器会按原样返回包装URL,因此当目标地址可疑时,请检查原始href。
  • 比较前先规范化。 带有不同片段或跟踪参数的URL会被计为单独链接,因此在比较两次提取结果前请先规范化URL。
  • 定期对比。 每月运行一次提取器并对比列表;你未添加的新外部链接是主题或插件被入侵的第一个迹象。

常见问题

它会按照HTML中的原样提取href。跟踪每个重定向会显著拖慢报告生成速度,并可能触发目标网站的爬虫防护;如需最终落地URL,请单独处理。

不能。提取器按原样解析传入的HTML。框架在客户端渲染的链接只有在你粘贴渲染后的DOM时才会出现(例如从DevTools复制outerHTML)。

只列出指向其他主机的 http/https 链接。相对路径属于内部链接(没有基础URL时只计数),mailto:、tel:和javascript:链接会被跳过;在子域名选项中选择“是”时,子域名算作内部;在 nofollow、sponsored 和 ugc 链接选项中选择“否”时,这些链接会被排除。

你粘贴的HTML和基础URL只保留在你的浏览器中,不会发送到我们的服务器,也不会添加到页面网址中:链接直接在此页面上提取,在各步骤之间,HTML会保存在此标签页的临时存储中,直到你重新开始或关闭标签页。

相关工具

此工具还提供其他语言版本