一、 迷雾中的哈希值:老张的困惑
在那个 2023 年的下午,老张坐在那张堆满旧文件的红木书桌前,手指头机械地敲着键盘。屏幕上的光把他的脸照得像个刚出炉的烤肠。他面前躺着一堆看起来像是随机排列的哈希值文件,左边是“用户 A 访问了 1023 次”,右边是“用户 B 访问了 1023 次”。老张抓耳挠腮,脑袋像被塞进了一团棉花,嘴里念叨着:“这玩意儿如何如此像 ?”
这并非一个简单的数字巧合。老张突然想起那会儿在《算法导论》里见过类似的图,那是符号图,每条边代表访问频率,节点之间连着表示“访问了”的关系。要是理论上存有一个概率 使得这两个分布彻底一样,老张就当作自己搞丢了方向,直到他意识到,这根本不是关于概率分布,而是关于统计意义上的相同。
? 核心洞察
在海量数据面前,表面的差异往往掩盖了底层的统计一致性。基本置换定理 提醒我们,当样本量足够大时,许多看似随机的“噪音”实际上服从着严格的统计规律。
1.1 概率的直觉 vs 数学的精确
老张是个计算机科普博主,他总爱拿这些枯燥的概率论段子来逗大伙儿乐。他最喜爱讲那个著名的“从 1 到 100 随机数”的故事。想象一下,你闭上眼,手在空中随意拍一下,猜中 1 到 100 之间随机数的概率是 。要是你再猜一次,还是 。要是你重复这个动作 1000 次,统计上,你猜中 100 个数的概率理论上是多少?
这时候你脑子里会跳出那个著名的二项分布公式:
你看着那个公式,认定这玩意儿苍白无力,出于它没法直接计算 是多少。直到你突然灵光一闪,要么说是老张突然认定“概率这东西不是用来算的,是用来猜的”。这就引出了概率论里最让人挠头的那个悖论:你们到底能不能通过观察、通过数据,去“猜”出两个随机变量在统计上是否相同?