pandas指南:做更高效的数据科学家
时间:2019-01-25
作者:
来源:
Python是开源的,所以有很多开源固有的问题。如果你是Python新手,很难知道针对特定任务的包哪个是最好的。你需要有经验的人来告诉你。今天我要告诉你们的是:在数据科学中,有一个软件包是你们绝对需要学习的,那就是pandas。
摘要:Python是开源的,所以有很多开源固有的问题。如果你是数据科学中,有一个软件包是你们绝对需要学习的,那就是pandas。
并对数据进行转换,但它还能做更多。</p>
<p>如果你已经熟悉Python,可以直接进入第三部分</p>
<p>现在让我们开始:</p>
<p>import pandas as pd</p>
<p><strong>pandas包最基本的功能</strong></p>
<p><strong>1、读取数据:</strong></p>
<p>data = pd.read_csv('my_file.csv')<br>
data=pd.read_csv('my_file.csv',sep=';',encoding='latin-1',nrows=1000, kiprows=[2,5])</p>
<p>sep变量代表分隔符。因为Excel中的csv分隔符是“;”,因此需要显示它。编码设置为“latin-1”以读取法语字符。nrows=1000表示读取前1000行。skiprows=[2,5]表示在读取文件时将删除第2行和第5行</p>
<p>最常用的函数:read_csv, read_excel</p>
<p>还有一些很不错的函数:read_clipboard、read_sql</p>
<p><strong>2、写入数据</strong></p>
<p>data.to_csv('my_new_file.csv', index=None)</p>
<p>index=None将简单地按原样写入数据。如果你不写index=None,会得到额外的行。</p>
<p>我通常不使用其他函数,比如to_excel,to_json,to_pickle,to_csv,虽然它们也做得很好,但是csv是保存表最常用的方法。</p>
<p><strong>3、检查数据:</strong></p>
<p>data.shape<br>
data.describe()<br>
data.head(3)</p>
<p>.head(3)打印数据的前3行,.tail()函数将查看数据的最后一行。</p>
<p>data.loc[8]</p>
<p>打印第8行。</p>
<p>data.loc[8, 'column_1']</p>
<p>将第8行值打印在“column_1”上。</p>
<p>data.loc[range(4,6)]</p>
<p>打印第4行到第6行。</p>
<p><strong>pandas的初级功能</strong></p>
<p><strong>1、逻辑运算</strong></p>
<p>data[data['column_1']=='french']<br>
data[(data['column_1']=='french') & (data['year_born']==1990)]<br>
data[(data['column_1']=='french')&(data['year_born']==1990)&(data['city']=='London')]</p>
<p>如果要根据逻辑操作对数据进行运算,在使用& (AND)、~ (NOT)和| (OR)等逻辑操作之前和之后添加“(”&“)”。</p>
<p>data[data['column_1'].isin(['french', 'english'])]</p>
<p>不要为同一列编写多个OR,最好是使用.isin()函数。</p>
<p><strong>2、基本绘图</strong></p>
<p>多亏了matplotlib包,这个特性才得以实现。就像我们在介绍中说的,它可以直接用在pandas身上。</p>
<p>data['column_numerical'].plot()</p>
<p> </p>
<img alt=)
免责声明:本网站部 分文章和信息来源于互联网,本网转载出于传递更多信息和学习之目的,并不意味着赞同其观点或证实其内容的真实性。如转载稿涉及版权等问题,请立即联系管理
员,我们会予以更改或删除相关文章,保证您的权利。对使用本网站信息和服务所引起的后果,本网站不作任何承诺。