【数据分析可视化】通过去重进行数据清洗 - 代码天地

【数据分析可视化】通过去重进行数据清洗

其他 2020-05-01 10:59:23 阅读次数: 0

import numpy as np
import pandas as pd
from pandas import Series,DataFrame

# 读取刚刚分解处理完的返回数据
link_csv = '/Users/bennyrhys/Desktop/数据分析可视化-数据集/homework/demo_duplicate.csv'
df = pd.read_csv(link_csv)
df

	Unnamed: 0	Price	Seqno	Symbol	time
0	0	1623.0	0.0	APPL	1473411962
1	1	1623.0	0.0	APPL	1473411962
2	2	1623.0	0.0	APPL	1473411963
3	3	1623.0	0.0	APPL	1473411963
4	4	1649.0	1.0	APPL	1473411963

# 删掉无用的unname
del df['Unnamed: 0']
df

	Price	Seqno	Symbol	time
0	1623.0	0.0	APPL	1473411962
1	1623.0	0.0	APPL	1473411962
2	1623.0	0.0	APPL	1473411963
3	1623.0	0.0	APPL	1473411963
4	1649.0	1.0	APPL	1473411963

df.size

len(df)

# 查看no列有多少重复的
df['Seqno'].unique()

array([0., 1.])

len(df['Seqno'].unique())

# 检测是否与前边重复
df['Seqno'].duplicated()

0    False
1     True
2     True
3     True
4    False
Name: Seqno, dtype: bool

# 删掉重复的数据也就是上方展示为true的数据
df['Seqno'].drop_duplicates()

0    0.0
4    1.0
Name: Seqno, dtype: float64

# 这样范围局限，无法展示全部（Series）
type(df['Seqno'].drop_duplicates())

pandas.core.series.Series

# 这样no列重复值删不感觉（不传参，则整体考虑某列重复最小处理原则）
df.drop_duplicates()

	Price	Seqno	Symbol	time
0	1623.0	0.0	APPL	1473411962
2	1623.0	0.0	APPL	1473411963
4	1649.0	1.0	APPL	1473411963

# 在DataFrame状态下进行处理(暂时全部)
df.drop_duplicates(['Seqno'])

	Price	Seqno	Symbol	time
0	1623.0	0.0	APPL	1473411962
4	1649.0	1.0	APPL	1473411963

# 去重 参数(保留最后出现的)
df.drop_duplicates(['Seqno'],keep='last')

	Price	Seqno	Symbol	time
3	1623.0	0.0	APPL	1473411963
4	1649.0	1.0	APPL	1473411963

bennyrhys

原创文章 257 获赞 187 访问量 16万+

关注私信

猜你喜欢

转载自blog.csdn.net/weixin_43469680/article/details/105623985

【数据分析可视化】通过去重进行数据清洗

数据分析师入门——用 Pandas 进行数据预处理：数据清洗与可视化

【数据分析可视化】通过apply进行数据预处理

利用Python进行数据分析——可视化

python数据分析与可视化实训--对 Excel 小费数据集进行数据的分析与可视化

利用python进行数据分析之数据可视化(一)

爬取数据并进行数据分析及可视化

Python数据分析实战：使用pyecharts进行数据可视化

数据可视化｜用散点图进行数据分析

Python数据分析中如何更好地进行数据可视化？

Impala：数据驱动的业务决策：使用Impala进行数据分析和可视化

《利用Python进行数据分析》第8章绘图和可视化笔记

利用Python进行数据分析——绘图和可视化 xticks-学习笔记

Matplotlib-利用pandas进行数据分析并作可视化展示

【利用python进行数据分析】绘图和可视化

利用Python进行数据分析——绘图和可视化(八)(2)

使用pyecharts1.5进行数据分析可视化

爬取知乎热度并且进行数据分析和可视化

利用python进行数据分析—七、绘图与可视化—matplotlib与seaborn

对result文件进行数据清洗以及进行可视化

爬取B站全站日榜前20数据进行数据分析与可视化

微博热搜榜前20信息数据爬取进行数据分析与可视化

利用Python进行数据分析——数据清洗与准备

[Python] 5.利用Python进行数据分析-单因子探索分析与可视化

pyechart进行数据可视化

python进行数据可视化

绘图和可视化《利用Python进行数据分析》第8章读书笔记

[利用python进行数据分析书笔记]第8章绘图和可视化

《利用Python进行数据分析·第2版》第9章绘图和可视化

转载绘图和可视化《利用Python进行数据分析》第8章读书笔记

今日推荐

基于大语言模型的开源知识库问答系统 MaxKB GitHub Star 数量突破 5,000 个！

美国拟限制 AI 大模型出口中国和俄罗斯

苹果将与 OpenAI 达成协议，将 ChatGPT 应用于 iPhone

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

《2024 年一季度互联网投融资运行情况》研究报告

报告：Django 仍然是 74% 开发者的首选

15 年前上了“FFmpeg 耻辱柱”，今天他还得谢谢咱——腾讯QQPlayer一雪前耻？

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

周排行

记一下去大梅沙的准备（2018-05-26）

Spring 注解事务

基于HTTP协议的客户端缓存

阿里云rds 备份和还原

[PHP] 几个拖慢 PHP 程序/API 运行速度的点

python 代码风格------------PEP8规则

js控制json生成菜单——自制菜单（一）

将字符串: 'k:1|k1:2|k2:3|k3:4 ' ,处理成 python 字典: {'k':1, 'k1':2, ...}

微信小程序转支付宝小程序

Qt551.窗口滚动条

每日归档

更多

2024-05-13(18)

2024-05-12(0)

2024-05-11(38)

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)

2024-05-04(7)