文本统计
步 1 / 3
该工具会对你粘贴的文本做一次快速的结构检查:含空格与不含空格的字符数、单词数、句子数、段落数、音节数,以及每句平均单词数。字符数和段落数对中文同样准确,但单词、句子和音节的判定是为以空格分词的语言设计的,请留意这一点。它适合检查长度限制、发现过长句子,以及在不打开文字处理软件的情况下核对作业要求。
如何分析一段文本
-
1
粘贴你的文本
从一条推文到一万字的草稿,什么都可以放进来:分析会作用于全部文本。
-
2
点击“分析”
工具使用支持 Unicode 的正则表达式来切分单词,但它依赖空格。中文不使用空格分词,因此一段连续的汉字会被算作一个“单词”。字符数和段落数对中文依然准确。
-
3
阅读明细
你会看到七行:字符总数、单词数、句子数、段落数、音节数和平均句长。
-
4
反复修改
编辑文本后重新运行,即可在精简或扩写时查看数值变化。
每个指标说明什么
| 指标 | 为何重要 |
|---|---|
| 含空格字符 | 推文、短信、元描述的硬性上限 |
| 不含空格字符 | 大多数按字符计费所采用的基准 |
| 单词 | 篇幅对照要求,节奏对照读者(面向以空格分词的语言) |
| 句子 | 密度;太少 = 冗长,太多 = 支离破碎(不识别 。) |
| 段落 | 结构;网页文字每 3 到 5 句换气一次 |
| 音节 | Flesch-Kincaid 等可读性公式的输入(面向英语) |
| 每句平均单词数 | 14 到 20 读起来自然;超过 25 会让读者疲劳 |
计数器使用的规则
- 单词: 以
[\p{L}\p{N}']+匹配,因此don't、20th和café各算作一个单词。中文没有空格,连续的汉字不会被拆分,会算作一个单词。 - 句子: 任何一串
.、!或?都算作一个边界。遇到U.S.A.这类缩写会多计,而不识别中文、日文使用的全角。、!、?,因此这些语言会被记为一个句子。 - 段落: 以空行(连续两个换行)分隔。
- 音节: 一种轻量估算,去掉结尾的
e后统计元音组。对英语与人工统计相差约 5% 以内,但不适用于中文。
提示
- 网页文字建议把每句平均长度控制在 20 个单词以内。
- 对英语而言,若音节数除以单词数超过 1.8,可考虑用更短的同义词替换多音节词。
- 长文本中段落数为 1,几乎总是说明你忘了按回车键。
常见问题
字符数和段落数对中文等语言都准确,字符数也是中文最有用的指标。但单词数、句子数和音节数是为以空格分词的语言设计的。中文没有空格,且以句号(。)结尾,因此单词数会失真、句子数几乎为 1,音节数也没有意义。
带句点的缩写(Dr.、e.g.、U.S.A.)会抬高计数。若有影响,请在分析前删除或替换。
句长是可读性公式的输入之一,但不是全部。例如 Flesch-Kincaid 还会权衡每个单词的音节数。
没有硬性上限,但非常长的文档(超过约 200 KB)处理时可能需要片刻。
你的文本会发送到我们的服务器进行统计,不会分享给任何第三方,仅用于向你返回统计结果。
相关工具
此工具还提供其他语言版本
- テキスト統計 [JA]
- Estadísticas de texto [ES]
- Textstatistik [SV]
- สถิติข้อความ [TH]
- Thống kê văn bản [VI]
- Tekststatistieken [NL]
- Statystyki tekstu [PL]
- Textstatistik [DE]
- Estatísticas de texto [PT]
- Statistik Teks [ID]
- إحصاءات النص [AR]
- Statistiques de texte [FR]
- 텍스트 통계 [KO]
- Text Statistics [EN]
- Statistiche del testo [IT]
- Статистика текста [RU]
- Metin İstatistikleri [TR]