Posted by My Blog on December 28, 2022

正文

与任何研究人员一样,我经常被问到我的研究领域是什么。我的是数据素描。可以说这是一个小众领域,但是我对此感到非常兴奋。它会对人们使用数据的方式产生不可思议的影响,而恕我直言是统计理论与实际问题的完美结合。从根本上讲,它可以解决以下问题:

在海量数据集的世界中,是否有可能消除造成大数据处理缓慢的主要障碍:即数据的庞大性?

这似乎是一个愚蠢的问题。毕竟,除了大数据这一事实之外,大数据为什么会带来革命性的变化。但是,请考虑一下统计学家数十年来所做的事情,即从大量人口中构建小型数据集(样本),以充满信心地使用数据回答问题。重要的是确保数据集的信息内容足以回答当前的问题。

数据草图就是这样做的。它们将相关信息保留在很小的空间中。此外,它们提供了必要的保证,使得答案是可以信赖的,甚至针对对抗性数据也提供了严格的理论保证。

可以节省大量空间。例如,常见的广告指标报告问题是计算广告的不重复展示次数。一个草图HLL可以在仅5kB的空间中对此进行计数,精度约为1%。将其与为最多拥有1B用户的站点构造哈希表进行比较。这很容易占用8GB或超过一百万倍的空间!

虽然这很棒,但是草图有一些关键的局限性。特别是,单个数据草图可以回答一组有限的问题。它丢弃有关“不重要”问题的数据,以节省空间。这些问题取决于草图的类型和选择的参数。这为实现者带来了一些烦人的选择。我的工作重点是设计新的草图和技术来解决实施障碍,将它们视为解决广泛问题的基础,而不是针对特定的风格化问题的单独解决方案,并为从业人员提供轻松地优化其草图选择的方法。参数。

希望这能使我对研究的内容以及工作的一些实际目标有所了解。我想以自己遇到的实际问题来激励我的工作,而且我一直在寻找行业中更具动机的问题。因此,如果有,请给我留言!

附言对于那些对我的研究示例感兴趣的人:NeurIPS论文《Optimal Subsampling using Influence Functions》展示了如何为任何参数ML / stats模型构造最优子采样程序。我在KDD中对CountMin草图进行的工作显示了如何获取最佳估计值,有用的严格误差估计值(而不是非常松散的边界),以及如何使用这些值来选择最佳草图参数。关于不重复计数和设置操作的一系列论文[1、2、3]讨论了如何构建最佳计数器和设计草图,以有效地回答众多不重复计数查询,这是某些工业应用中的重要问题,例如广告报告/唯一印象计数。

原文:

Daniel Ting发表在Linkedin:Data sketching: Big data,made fast

https://www.linkedin.com/pulse/data-sketching-big-made-fast-daniel-ting?articleId=6409536036229177344#comments-6409536036229177344&trk=public_profile_article_view

  1. https://research.tableau.com/sites/default/files/cmdistinct_sigmod.pdf

  2. https://research.tableau.com/sites/default/files/kdd_sketch_merge.pdf
  3. https://research.fb.com/publications/streamed-approximate-counting-of-distinct-elements/

思考

网络数据是典型的海量级数据,