概率分布

网络流量性质理解

Posted by BY beta on April 21, 2021

前言

之前在阅读相关论文的时候,曾经多次遇到过zipf分布,skewness等类似的概念。在当时,我虽然花了些时间,也自以为有了了解。当时在第二次遇到的时候,头脑中依然缺乏清晰的表述。

故整理此博客。

zipf分布

zipf分布是指,将元素按照出现频率从高到低的次序排列,则一个元素出现的频率与其排序成反比. \(Pr = \frac{C}{k^\alpha}\) 以英文单词出现的频率为例,$C$约等于0.1,$\alpha$约等于0.1。 注意这里的$C$和$\alpha$是有直接的联系的,因为所有元素的频率相加为1. 也就是说,这个具体的参数是与具体的元素来源有关。

如果以概率密度来表示,则 \(f(x;a,n) = \frac{1}{x^a\sum_{i=1}^{n}(1/i)^a}\) x 表示按次序排列的顺序。所以这里与数据来源相关的变量就两个,$a$和$n$。 实际上当$n=+\infty$时,也就zipf分布就变成了zeta分布

zeta分布

zeta分布,被视为在离散概率分布中的帕累托分布. zipf分布与zeta分布关系如下图,当n趋向于无穷时,zipf即退化为zeta分布。

image-20210421225708921

skewness 倾斜度

数据倾斜度的计算,对于原始数据,我们可以计算相应的倾斜度,如下图所示,当skew为负值,说明变量更偏向在右侧分布;当skew为正值时,变量偏向左侧分布

image-20210421225344116

由zipf分布可知, 首先需要对数据按出现频次进行排序。那么经过这样的数据预处理之后,$skew>= 0$