文本统计

下一步

该工具会对你粘贴的文本做一次快速的结构检查:含空格与不含空格的字符数、单词数、句子数、段落数、音节数,以及每句平均单词数。字符数和段落数对中文同样准确,但单词、句子和音节的判定是为以空格分词的语言设计的,请留意这一点。它适合检查长度限制、发现过长句子,以及在不打开文字处理软件的情况下核对作业要求。

如何分析一段文本

  1. 1

    粘贴你的文本

    从一条推文到一万字的草稿,什么都可以放进来:分析会作用于全部文本。

  2. 2

    点击“分析”

    工具使用支持 Unicode 的正则表达式来切分单词,但它依赖空格。中文不使用空格分词,因此一段连续的汉字会被算作一个“单词”。字符数和段落数对中文依然准确。

  3. 3

    阅读明细

    你会看到七行:字符总数、单词数、句子数、段落数、音节数和平均句长。

  4. 4

    反复修改

    编辑文本后重新运行,即可在精简或扩写时查看数值变化。

每个指标说明什么

指标 为何重要
含空格字符 推文、短信、元描述的硬性上限
不含空格字符 大多数按字符计费所采用的基准
单词 篇幅对照要求,节奏对照读者(面向以空格分词的语言)
句子 密度;太少 = 冗长,太多 = 支离破碎(不识别 。)
段落 结构;网页文字每 3 到 5 句换气一次
音节 Flesch-Kincaid 等可读性公式的输入(面向英语)
每句平均单词数 14 到 20 读起来自然;超过 25 会让读者疲劳

计数器使用的规则

  • 单词: 以 [\p{L}\p{N}']+ 匹配,因此 don't、20th 和 café 各算作一个单词。中文没有空格,连续的汉字不会被拆分,会算作一个单词。
  • 句子: 任何一串 .、! 或 ? 都算作一个边界。遇到 U.S.A. 这类缩写会多计,而不识别中文、日文使用的全角 。、!、?,因此这些语言会被记为一个句子。
  • 段落: 以空行(连续两个换行)分隔。
  • 音节: 一种轻量估算,去掉结尾的 e 后统计元音组。对英语与人工统计相差约 5% 以内,但不适用于中文。

提示

  • 网页文字建议把每句平均长度控制在 20 个单词以内。
  • 对英语而言,若音节数除以单词数超过 1.8,可考虑用更短的同义词替换多音节词。
  • 长文本中段落数为 1,几乎总是说明你忘了按回车键。

常见问题

字符数和段落数对中文等语言都准确,字符数也是中文最有用的指标。但单词数、句子数和音节数是为以空格分词的语言设计的。中文没有空格,且以句号(。)结尾,因此单词数会失真、句子数几乎为 1,音节数也没有意义。

带句点的缩写(Dr.、e.g.、U.S.A.)会抬高计数。若有影响,请在分析前删除或替换。

句长是可读性公式的输入之一,但不是全部。例如 Flesch-Kincaid 还会权衡每个单词的音节数。

没有硬性上限,但非常长的文档(超过约 200 KB)处理时可能需要片刻。

你的文本会发送到我们的服务器进行统计,不会分享给任何第三方,仅用于向你返回统计结果。

相关工具

此工具还提供其他语言版本