从文本中提取电话号码

只需粘贴包含散文文本、签名或抓取的HTML代码,即可提取其中的所有电话号码。该提取工具可识别北美格式(xxx) xxx-xxxx、欧洲空格分隔格式、紧凑型国际格式+CC...,以及用户在邮件中常用的自由格式(如555.123.4567+44 20 7946 0958)。输出结果将以原始格式返回,便于后续与libphonenumber等电话号码库进行标准化比对。

如何提取电话号码

  1. 1

    粘贴源文本

    把文本放进来,联系页面、邮件签名、CSV导出文件、聊天记录皆可。

  2. 2

    运行扫描

    正则表达式会遍历文本,寻找包含至少7位数字以及可识别分隔符或国家代码的连续数字序列。

  3. 3

    核对匹配结果

    结果每行显示一个候选号码,重复项会自动移除。请检查列表中是否有误判(如订单编号、日期等),如有混入,请修正源文本。

  4. 4

    复制或导出

    将干净列表以纯文本格式获取(每行一个号码),即可直接用于您的CRM系统或拨号工具。

可识别的电话号码格式

电话号码非常混乱,因为每个国家都有各自的拨号规范,而且人们往往也不遵守这些规则。该提取工具专门针对实际文本中常见的实用格式进行识别。

支持的格式(示例)

格式 示例 说明
E.164 +14155552671 黄金标准;建议用于存储。
国际空格分隔 +44 20 7946 0958 用空格分组的英国固话号码。
北美 NANP (415) 555-2671 区号加括号。
北美点分隔 415.555.2671 常用于邮件签名。
欧洲本地格式 020 7946 0958 以零开头的国内前缀。
墨西哥10位数 55 1234 5678 无国家代码。

需警惕的假阳性结果

  • 订单号与追踪号。 包裹的FedEx追踪号为13位数字,若使用空格书写时可能看起来像电话号码,请结合上下文仔细核对。
  • 日期。 根据正则表达式模式的不同,2024 09 15可匹配包含7位及以上数字的格式;若数据源中包含大量日期信息,请优先对日期进行过滤。
  • 信用卡号码。 形式为4xxx xxxx xxxx xxxx的16位数字组可进行匹配。提取前需对PCI数据进行预处理(去标识化)。

提示:存储前先标准化

对于同一个真实号码,不同的输入写法正是CRM数据去重难题的根源。用能识别各国规则的库(如libphonenumber、Python中的phonenumbers、PHP中的laravel-phone)快速处理一遍,就能把所有号码统一转换为E.164格式,这是数据库中唯一应保存的格式。

常见问题

提取器会返回原始匹配结果;国家推断需要包含拨号代码和长度规则的数据包。若您仅关注 +CC 前缀,则该部分将在输出结果中原样保留。

提取器只会返回主号码;像555-2671 ext. 123这样的内联分机号不属于匹配结果。若需严格按E.164存储,请将extx#之后的内容拆到单独字段。

是的,美国免费电话号码(800、888、877、866、855、844、833)均符合标准 NANP 格式。英国的0800及类似本地免费号码也能正常拨打,因其外观与普通固话号码无异。

提取响应返回后,系统不会保存您的输入内容副本;处理过程直接在请求对应的内存中完成。

相关工具

此工具还提供其他语言版本