从文本中提取电子邮件

只需粘贴消息内容、CSV列数据、论坛帖子或HTML片段,提取工具便会自动识别并提取所有可识别的电子邮件地址。输出结果已经过去重处理,即可直接导入CRM系统或用于退信检测工具。该方案符合RFC 5322标准的实际要求(包括附加地址格式、本地部分中的点符号以及域名中的连字符),且不会产生普通a@b正则表达式可能产生的误报。

如何从文本中提取电子邮件

  1. 1

    粘贴您的来源

    可添加自由文本、日志记录、HTML页面或导出的联系人列表,任何包含`local@domain.tld`模式的内容均可。

  2. 2

    运行提取器

    该正则表达式用于扫描完整地址,并忽略其周围的标点符号。

  3. 3

    审核数量

    您将获得找到的唯一地址数量以及完整的列表。

  4. 4

    复制列表

    将内容复制到剪贴板(以新行分隔的列表形式),或直接粘贴到电子表格列中。

什么才算有效的电子邮件

该提取器遵循实用电子邮件的格式结构,而非完整的RFC 5322语法规范,因为完整语法允许使用现代邮件传输代理(MTA)无法接受的地址形式(如带空格的引号内本地域名、括号内的注释)。以下是匹配器涵盖的内容:

模式元素 接受 拒绝
本地部分 a-z 0-9 . _ % + - 空格、引号字符串、尖括号
域名 a-z 0-9 . - 末尾的句点、标签中的下划线
TLD 2 个及以上ASCII字母 纯数字 TLD

它能处理的常见杂乱输入

  • 句中地址后紧跟 .,,标点符号不会被一并提取。
  • mailto: 链接内的电子邮件,协议头会被自动移除。
  • @ 等HTML实体不会被解码,因此以 info@example.com 形式书写的地址无法被识别。
  • 电子邮件头中用 <尖括号> 包裹的地址。

如何处理输出结果

  • 可送达性验证。 在导入前,请通过邮件退信检测服务对列表进行检查,采集到的列表中通常约有10%为无效地址。
  • 同意条款。 地址出现在文件中并不意味着当事人已同意被联系。在开展沟通前,请务必查阅 GDPR 或当地法律法规。
  • 请在本地部分也进行重复数据消除。john@gmail.comj.ohn@gmail.com 在 Gmail 中指向同一个邮箱;若需确保标识符完全唯一,请统一使用点号。

常见问题

不能。该提取工具专门针对真实且可解析的地址。请先还原被混淆的格式,或对文本进行预处理,将 [at] 替换为 @,将 [dot] 替换为 .

不能。匹配仅支持基本的拉丁字母,因此 müller@straße.de 无法被识别。运行提取器之前,请将地址转换为ASCII punycode形式,例如 user@xn--strae-oqa.de

不能,没有保留重复项的选项。默认输出已去重并保留首次出现的顺序。如需统计提及次数,请在源文本中统计。

不会。文本仅用于处理您的请求,不会被存入数据库、不会记入日志,也不会添加到页面链接中。

相关工具

此工具还提供其他语言版本