前一段时间写了不少Python的爬虫程序, 为此还看了极客学院上的一些教程, 现在来简单总结一下. 主要介绍用requests + lxml的方式, scrapy的话之前写 …
前一段时间写了不少Python的爬虫程序, 为此还看了极客学院上的一些教程, 现在来简单总结一下. 主要介绍用requests + lxml的方式, scrapy的话之前写 …
总结一下用python撸codejam时常用的一些库, 并且给一些简单的例子. 发现用python撸codejam非常合适: codejam的时间要求不严格(4/8分钟), 而且程序只要本地运行. 正好可以使用python简洁的语法和丰富的函数库.
py自带的一些好用的数据结构...
https://docs.python.org/2/library/collections.html …
http://www.imooc.com/learn/317
包: 文件夹 (可以有多级), 且包含__init__.py文件(每层都要有)
模块: py文件
代码分开放在多个py文件(模块名=文件名). 同 …
http://www.imooc.com/learn/317
函数式编程: 更抽象, 更脱离指令(计算机), 更贴近计算(数学).
python科学计算包的基础是numpy, 里面的array类型经常遇到. 一开始可能把这个array和python内建的列表(list)混淆, 这里简单总结一下列表(list), 多维数组(np.ndarray)和矩阵(np.matrix)的区别.
列表属于python的三种基本集合类型之一, 其他 …
Scrapy是用来爬取数据的很流行的包, 这里小记一下. 以前几天做的一个爬虫为例子, 这个爬虫把韩寒一个app的前九百多期的文章抓了下来.
scrapy的安装参考: http://scrapy-chs.readthedocs.org/zh_CN/latest/topics/ubuntu.html
(直接pip安装的好像缺少什么包)
需要 …
在处理大量数的时候, 如果输出类似 "process i out of n files..." 这样的内容来指示进度的话, 虽然可以显示目前的进度(用来安慰等待 …
Learning IPython for Interactive Computing and Data Visualization这本书的前两章的笔记, 这本书还被放在了IPython官网上, 虽然只有一百页多一点点, 但是讲的内容却很丰富, 介绍 …
首先, 导入pandas
import pandas as pd
以及开启pylab: IPython里输入%pylab
http://www.bearrelroll.com/2013/05/python-pandas-tutorial/
http://cloga.info/python/%E6%95%B0%E6%8D%AE%E7%A7%91%E5%AD%A6/2013/09/17/pandas_intro/
pandas和numpy的关系: pandas是建立在numpy上面的, pandas可以处理不同类型的数据集合 …
python的pickle/unpickle机制可以非常方便的保存一些计算的中间结果, 这一点java虽然也可以做到, 但是java里面的包的名字实在是长的让人记不住...
不过今天在使用pickle的时候遇到了一个很奇怪的问题.
是这样的, 原本写了一个程序main.py, 这个程序里进行了一些计算并且pickle下了这些内容, 后来我觉 …