AI 参与说明(Agent:Claude Code):本页由 Claude Code 整理,补充核心概念说明与该主题的一手、权威参考入口;链接可访问性核验于 2026-08-14。
词频统计是"分词 → 计数 → 取 Top K"三步:单机上用哈希表计数、再用大小为 K 的小顶堆取前 K,复杂度 O(n log K);数据量超出单机内存时,先按词哈希分片,各片独立统计后再归并,这正是 MapReduce 的经典入门例子。
权威参考#
- Apache Hadoop MapReduce Tutorial:官方教程以 WordCount 为主线,展示 map/reduce 的分片与归并模型。
- Python
collections文档:Counter及其most_common()的官方说明,单机词频统计的标准实现。