My Blog

Thinking will not overcome fear but action will.

前言 寻找数据流中出现最频繁的k个元素,这个问题和自己目前的研究兴趣有很大的相关性,只不过在具体的场景中可能有其他的限制条件,但抽象的问题并没有实质的区别。 两个问题存在本质的区别: 查找 频率超过p*M 的元素 查找 Top-K的元素 问题1. 查找频率超过p*M的元素 数据流大小为M, 令寄存器数...

前言 在阅读一些源代码的时候,看到使用字节对齐和SSE指令进行优化。由于之前对字节对齐并不熟悉,所以在网上查看了相关的博客加深自己的理解。 1. 字节对齐是什么 字节对齐是数据存储在内存中的起始地址的限制。 对于程序中的变量而言,都需要存储在内存设备中,CPU通过地址对数据进行访问。然而不同的数据类型所需的存储空间是不同的,比如int在x86. 理论而言,计算机可以读取任何位置的数...

链接:https://www.zhihu.com/question/28823373/answer/101504099 来源:知乎 著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。 Benchmark和baseline都有性能比较的意思。 先看看字典定义。 benchmark:N-COUNT A benchmark is something whose q...

正文 与任何研究人员一样,我经常被问到我的研究领域是什么。我的是数据素描。可以说这是一个小众领域,但是我对此感到非常兴奋。它会对人们使用数据的方式产生不可思议的影响,而恕我直言是统计理论与实际问题的完美结合。从根本上讲,它可以解决以下问题: 在海量数据集的世界中,是否有可能消除造成大数据处理缓慢的主要障碍:即数据的庞大性? 这似乎是一个愚蠢的问题。毕竟,除了大数据这一事实之外,大数据为...

前言 此篇博客主要是为了理解实模式和保护模式,分段与分页等概念的区别。 首先得非常明确的指出: 实模式有分段寻址:物理地址=段基址+段偏移。 保护模式有两种寻址方式,涉及到三种地址:逻辑地址、线性地址、物理地址。 分段模式。物理地址=段选择符+段偏移;段选择符需要在GDT或LDT中找到段基地址, ...

四个不同层次的加载 不同层次的加载所面临的基础条件不同,所要解决的问题也是不同的。 first loader(永久性内存ROM等存储的bios) 处理器没有任何资料,所以其所在的位置需要固定 检查、初始化硬件 second loader(存储在外部设备,硬盘、软盘) 第一个loader可以访问的位置。需要规...

博士阶段总结


2021年 投入

步入正轨

这世界有那么多人 人群里 敞着一扇门 我迷朦地眼睛里长存 初见你 蓝色清晨 前言 2021年在忙忙碌碌、来来回回中悄然从身边流走,猛然地觉得地球公转一年又来到了年初的起点,植物学家看着巍峨大树的年轮确认这一年的阳光雨露,历史学家通过浩瀚文献研究这一年人类社会的变迁。而我,则是看着这一年的日记本、消费账单、博客、github记录回想21年在我身上留下的痕迹。 似...

控制论学习

一些基础概念

前言 基础概念 最大熵原理 最大熵原理是指,在只掌握关于未知分布的部分知识时,应该选取符合这些知识但熵值最大的概率分布。 换而言之,存在多种分布符合已知知识,最大熵原理是一种从多种分布中选取符合目标的原则。这种原则可表述为,关于未知分布最合理的推荐就是符合已知知识的最不确定或最随机分布。 按照吴军博士所说, 这是一种不偏不倚的选择,任何其他的选择都意味这增加了其他的约束和假...

稀疏表示和压缩感知

分布式机器学习通信压缩相关概念

## 前言 最近看了些联邦学习通信量相关的文章,想要看看联邦学习通信量压缩是否有可以做的点. 在这个过程中,看到了很多相关的概念,需要梳理帮助理解. ## 基本概念 稀疏 在压缩感知中经常有稀疏的概念, 它的意思是: 对于N维的向量, 它的N个元素值只有K个是非零的,其中K«N, 则我们称这个向量是严格K稀疏的. 严格K稀疏比较困难,一般而言,只要除了这K个值以外的其他值都很小, ...