掌握一万个单词

英语单词开头字母分布

场景 A:词典(统计「不重复单词种类」,有多少不同单词)
排序:S > C > T > P > A
S:sub/super/syn 前缀 + 海量基础名词动词,新词种类最多;
C:con/com 万能前缀 + c 发 /k/、/s/ 两套词汇,种类第二; 
 

场景 B:小说 / 课本阅读文本(统计「所有出现过的单词,含重复」)
以《白鲸记》《傲慢与偏见》《大卫科波菲尔》等百万词小说统计为例,单词首字母出现频次(按出现次数,含重复) 固定顺序:

T(断层第一,约 16% 所有单词)
A(约 10%–12%)
I
S
O、W、H……
后面才轮到 B、C、M、F、P……


为什么小说里 T 碾压所有人?
根源只有一个:定冠词 the
the 是英文小说、课文出现最多的词,每两三句就一次,全部 T 开头,直接把 T 的总量拉到断层第一;
其次 to、take、turn、tell、trans- 类单词持续加码 T。

为什么 A 排第二?
高频基础词全是 A 开头:
a/an(不定冠词,通篇反复出现)、all、and、any、at、as,叠加 ad - 前缀词汇,总量稳居第二。

S 只能排第四,C 差距巨大
S 开头词虽然种类多,但重复度低
S 大多是名词、抽象动词(sun, stand, speak, subject),不会像 the/a 那样每句重复几十遍;只有复数 s 结尾不改变首字母,不加分。

C 开头劣势最明显
C 没有像 the/a/to 这种超高频 2-3 字母基础小词:
没有每天反复用的极简 C 开头功能词,con/com 前缀长单词出现频率低,city/cold/cut 这类基础词重复次数远不如 T、A、S 的基础词。