粘贴 1200 词,文本统计与转换一次回答七个问题:词数、含空格与不含空格的字符数、句数、段数、行数,以及按每分钟 200 词算的 6 分钟阅读时间和按 130 词算的 10 分钟朗读时间。旁边的字符计数器与分析器再深一层:前 10 个高频字符,以及把整段文本拆成大写、小写、数字、符号、空格五路。两个工具全程在浏览器本地运行,不上传。
两个工具,两种问题
文本统计是页面级摘要:一个 7 个数字的盒子,外加一键大写、小写、标题式、句首式四种改写。字符计数是成分报告:同样的核心计数,加上阅读与朗读时间、空格统计、五路字母拆分,以及出现最多的前 10 个字符排行榜。发帖前的快速核对,7 格视图够用;当问题变成哪个字母、哪个词用得太狠,字符视图和词频统计工具提供细节。
词数与字符数的差从哪来
词按连续空白切分,所以全字母句 the quick brown fox jumps over the lazy dog 是 9 个词、含空格 43 字符、不含 35 字符。标点粘在词尾,不成词。两个字符数的差恰好是空白。还有 CJK 边界:中日韩文本没有空格,200 字的一段读起来是 1 个词,所以对 CJK 来说,字符数而不是词数才是诚实的长度口径。大小写改写则从不移动任何计数器:the、THE、The 一样重,所以无论走大小写转换器还是内置按钮,改的只是外观,不是长短。
阅读按 200,朗读按 130
阅读时间是词数除以 200 向上取整,下限 1 分钟:1200 词正好 6,1300 词是 7,因为 1300 / 200 = 6.5 向上取整。朗读时间除以 130,那是演示语速:1200 词得 9.23,取整 10 分钟。所以 10 分钟讲稿落在 1300 词附近,2 分钟博客开头落在 400 词附近。两个速率在字符计数器里并排放,讲稿可以同时对照阅读预算和朗读预算。
前 10 与五路拆分
去掉空格,给每个剩余字符计数,按频率排序:前 10 个就是排行榜,英文散文里通常是 e 打头,其次 t、a、o。五路拆分把每个字符归入大写、小写、数字、符号、空格,它有个陷阱:a-z、A-Z、0-9 之外一律算符号,所以中日韩句子、表情、德语变音字母都落进符号桶。把拆分当纯度表看:干净的拉丁文文本段是巨大的一条小写条、几乎为零的符号条;满是单位、电话号码、话题标签的文本则反过来。
为什么字符上限要紧
计数是遇到上限的地方。推文上限 280 字符,商品标题几百字符,AI 提示词有随图像与视频模型而变的硬预算。AI 图像提示词指南在字符预算内排版,风格与镜头术语抢同一份 75 到 200 字符的空间;AI 视频提示词指南对更长的动态描述做同样的算术。计数器在 API 拒绝负载之前告诉你:砍形容词,别砍主体。
计数到底数的是什么
字符数就是你粘进来的字符串长度,粘贴可能藏着两样东西。一是标记:从富文本编辑器粘出会带上标签,<b>hi</b> 算 10 个字符,可见的只有 hi;HTML 格式化指南讲怎么看见并去掉这一层。二是编码:长度按 UTF-16 码元计,所以 😀 这类表情占 2,哪怕它只是一个字形、在 UTF-8 里是 4 字节;文本转二进制指南把同样的码点逐字节走完。两件事之间,计数器如实报告字符串的存储形态,而接收系统量到的也正是它。