分类: 工具软件

Pandas中DataFrame的合并与连接

在使用Pandas处理数据时,有时需要多数据进行合并和连接操作,最常用的包括将多个分割的文件进行合并: import pandas as pd import glob file_list = glob.glob('data/*') df_list = [] for file in file_l…

Jpuyter中使用PySpark连接Hive

公司的Jupyter环境支持PySpark。这样就可以非常方便的使用PySpark连接到Hive查询和使用。由于先前完全没有接触过Spark,所以整理了一些参考资料。 Spark Context PySpark里最核心的模块是SparkContext(简称sc),…

使用Python进行压缩与解压缩

在日常工作中,除了会涉及到使用Python处理文本文件,有时候还会涉及对压缩文件的处理。 通常会涉及到的压缩文件格式有: rar:Windows 环境下用的比较多的压缩,比较著名的GUI工具是winrar tar: Li…

Jupyter学习笔记:IPython魔法命令

Jupyter与IPython的关系 IPython是个比默认的Python Shell好用得多的Python交互命令行界面,支持变量自动补全、自动缩进、Bash Shell命令,还内置了许多很有用的功能和函数。大大提高交互式计算和软件开发的生产率…

器→工具, 工具软件 ·

Matplotlib初级入门教程

Matplotlib简介 MATLAB MATLAB是Matrix & Laboratory两个词的组合,意为矩阵工厂(矩阵实验室)。是由美国 Mathworks公司发布的主要面对科学计算、可视化以及交互式程序设计的高科技计算环境。 它将数…

家庭存储:Gen 8 折腾记

硬件篇 家里原先的希捷GoAgent Home突然不能使用了(后面确认下来机器没有坏,是电源适配器坏了,话说希捷配的电源适配器真的很容易坏掉。),为了保障数据的安全,于是打算购买一台NAS,对于NAS的要求:支持Raid1…

器→工具, 工具软件 ·

比t-SNE更好的降维算法UMAP

针对高维数据的降维,先前使用的是t-SNE。无意中接触到umap,发现还是蛮有啥意思的。整理了一些资料供以后深入研究。 UMAP简介 UMAP ,全称uniform manifold approximation and projection,统一流形逼近与投影,…

深入分析Google Analytics原理与实现

以下内容是自己十年前整理的,期间翻看了Google Analytics的所有帮助文档,查看了商业版本的Urchin及代码。最终对Google Analytics有了大致了解,并基于实际需求,搭建了一套更加完善的数据跟踪体系,相关资料分享…

网页正文提取工具Readability

什么是Readability? 如果你在网上看到一篇不错的文章想收藏起来稍后再读,却又不想同时保存那一大堆花花绿绿的广告或无关紧要的一些网页元素,那么你可以试试 Readability 了! Readability 是一个颇有特色的“…

PHP集成运行环境XAMPP

PHP已经没有像当年个人网站蓬勃发展是那么火热,但期间留下来的很多开源的程序还是有非常高的学习和使用价值,比如这个博客正在使用的WordPress。在研究PHP代码的过程中需要部署PHP的运行环境,比较简单的方法是使…

器→工具, 工具软件 ·