Pandas玩转数据（七) -- Series和DataFrame去重 - 代码天地

Pandas玩转数据（七) -- Series和DataFrame去重

其他 2018-07-20 10:09:19 阅读次数: 0

import numpy as np
import pandas as pd
from pandas import Series, DataFrame

df = pd.read_csv('demo_duplicate.csv')
df.head()
Out[40]: 
   Unnamed: 0   Price  Seqno Symbol        time
0           0  1623.0    0.0   APPL  1473411962
1           1  1623.0    0.0   APPL  1473411962
2           2  1623.0    0.0   APPL  1473411963
3           3  1623.0    0.0   APPL  1473411963
4           4  1649.0    1.0   APPL  1473411963

# 
df.size
Out[41]: 19945

len(df)
Out[42]: 3989

len(df['Seqno'].unique())
Out[46]: 1000

# 某一行Series的duplicate
df['Seqno'].duplicated().head()
Out[47]: 
0    False
1     True
2     True
3     True
4    False
Name: Seqno, dtype: bool

type(df['Seqno'].duplicated())
Out[48]: pandas.core.series.Series

# DataFrame去重，drop_dupliates
df.drop_duplicates(['Seqno']).head()
Out[49]: 
    Unnamed: 0   Price  Seqno Symbol        time
0            0  1623.0    0.0   APPL  1473411962
4            4  1649.0    1.0   APPL  1473411963
8            8  1642.0    2.0   APPL  1473411964
12          12  1636.0    3.0   APPL  1473411965
16          16  1669.0    4.0   APPL  1473411966

# keep参数指定保留哪一个
df.drop_duplicates(['Seqno'], keep='last').head()
Out[53]: 
    Unnamed: 0   Price  Seqno Symbol        time
3            3  1623.0    0.0   APPL  1473411963
7            7  1649.0    1.0   APPL  1473411964
11          11  1642.0    2.0   APPL  1473411965
15          15  1636.0    3.0   APPL  1473411966
19          19  1669.0    4.0   APPL  1473411967

猜你喜欢

转载自blog.csdn.net/weixin_39778570/article/details/81114746

Pandas玩转数据（七) -- Series和DataFrame去重

Pandas玩转数据（二) -- Series和DataFrame排序

Pandas玩转数据（四) -- DataFrame的merge

Pandas玩转数据（三) -- DataFrame重命名

Pandas玩转数据（十四) -- 分组和透视功能实战

Pandas玩转数据（九) -- 时间序列的采样和画图

Pandas玩转数据（五) -- Concatenate和Combine

Pandas库03_Series和DataFrame数据结构_重索引

pandas.DataFrame去重

Pandas之Series和Dataframe

pandas教程：series和dataframe

pandas中的Series和DataFrame

Pandas -----简述 Series和DataFrame

pandas中DataFrame的数据去重

Pandas数据对象进阶——Series和DataFrame

pandas Series和DataFrame数据类型

【数据挖掘】——pandas中Series和Dataframe

python基础-----Pandas的DataFrame和pandas.core.series.Series

python pandas dataframe 的去重函数

python pandas dataframe 去重函数

python数据分析（七） python pandas--series和dataframe的算术运算和数据对齐

pandas之Series和Dataframe简单介绍

pandas基础(1)_Series和DataFrame

pandas入门之Series、DataFrame和Index

pandas DataFrame和Series类型的理解

pandas中Series和Dataframe的排序操作

pandas中Series()和DataFrame()的区别与联系

pandas学习series和dataframe基础

pandas中series和dataframe之间的区别

Pandas：Series和DataFrame的索引取值

今日推荐

基于大语言模型的开源知识库问答系统 MaxKB GitHub Star 数量突破 5,000 个！

美国拟限制 AI 大模型出口中国和俄罗斯

苹果将与 OpenAI 达成协议，将 ChatGPT 应用于 iPhone

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

《2024 年一季度互联网投融资运行情况》研究报告

报告：Django 仍然是 74% 开发者的首选

15 年前上了“FFmpeg 耻辱柱”，今天他还得谢谢咱——腾讯QQPlayer一雪前耻？

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

周排行

记一下去大梅沙的准备（2018-05-26）

Spring 注解事务

基于HTTP协议的客户端缓存

阿里云rds 备份和还原

[PHP] 几个拖慢 PHP 程序/API 运行速度的点

python 代码风格------------PEP8规则

js控制json生成菜单——自制菜单（一）

将字符串: 'k:1|k1:2|k2:3|k3:4 ' ,处理成 python 字典: {'k':1, 'k1':2, ...}

微信小程序转支付宝小程序

Qt551.窗口滚动条

每日归档

更多

2024-05-13(18)

2024-05-12(0)

2024-05-11(38)

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)

2024-05-04(7)