pandas中的数据去重处理

2023-03-27 12:36:38

数据去重可以使用duplicated()和drop_duplicates()两个方法。
DataFrame.duplicated（subset = None，keep =‘first’ ）返回boolean Series表示重复行
参数：
subset：列标签或标签序列，可选
仅考虑用于标识重复项的某些列，默认情况下使用所有列
keep：{‘first’，‘last’，False}，默认’first’

first：标记重复，True除了第一次出现。
last：标记重复，True除了最后一次出现。
错误：将所有重复项标记为True。

import numpy as np
import pandas as pd
from pandas import Series, DataFrame

df = pd.read_csv('./demo_duplicate.csv')
print(df)
print(df['Seqno'].unique()) # [0. 1.]

# 使用duplicated 查看 重复值
# 参数 keep 可以标记重复值 {'first'，'last'，False}
print(df['Seqno'].duplicated())
'''
0    False
1     True
2     True
3     True
4    False
Name: Seqno, dtype: bool
'''

# 删除 series 重复数据
print(df['Seqno'].drop_duplicates())
'''
0    0.0
4    1.0
Name: Seqno, dtype: float64
'''

# 删除 dataframe 重复数据
print(df.drop_duplicates(['Seqno'])) # 按照 Seqno 来 去重
'''
    Price  Seqno Symbol        time
0  1623.0    0.0   APPL  1473411962
4  1649.0    1.0   APPL  1473411963
'''
# drop_dujplicates() 第二个参数 keep 包含的值 有： first、last、False
print(df.drop_duplicates(['Seqno'], keep='last')) # 保存最后一个
'''
    Price  Seqno Symbol        time
3  1623.0    0.0   APPL  1473411963
4  1649.0    1.0   APPL  1473411963
'''

demo_duplicate.csv文件下载地址：
https://download.csdn.net/download/missyougoon/11174804

作者：我是小蚂蚁
原文链接：https://laoai.blog.csdn.net/article/details/83926840
更新时间：2023-03-27 12:36:38

相关文章

mybatis中trim，foreach等标签以及prefixOverrides、s
1.首先来看一下常用的属性作用1.以下是trim标签中涉及到的属性属性prefix拼接sql语句中所用到的前缀
2022-07-09

Mybatis Plus实现动态SQL语句的原理，你知道吗？
点击关注公众号，利用碎片时间学习Mybatis-Plus（简称MP）是一个 Mybatis 的增强工具,那么它
2022-07-09

MyBatis 配置 setting 详解
0x00：前言参考之前的《MyBatis 中 SqlMapConfig 配置文件详解》记了一下 MyBatis
2022-07-09

Mybatis-Plus的框架使用
Mybati_Puls
2022-07-09

随机文章

Reactjs中优化组件渲染的技巧：Memoization和PureComponen
2023-06-17

深入了解ThinkPHP：Session操作与安全性分析
2023-06-17

如何使用Laravel框架实现角色权限管理
2023-06-17

使用Django框架开发Web应用
2023-06-17

文章导航

热门标签

VPN BGP 华为 DHCP 组播 ISIS NAT 交换机 H3C 交换 TCP RADIUS LDP 链路聚合网络工程师小助手路由 QOS IPV6 IGMP CCNA视频教程 MPLS Vlan STP Wireshark PIM BGP选路 LACP IP GPON OSPF

最新文章

PHP范围解析运算符（：:)
介绍在PHP中，双冒号::定义为Scope Resolution Operator。
2023-11-18

完全删除数组中的多余元素-JavaScript
我们需要编写一个函数，该函数接受一个数组并返回一个新数组，该数组已删除了所有重复值。
2023-11-18

在不使用库函数的情况下使用真实/伪造的值展平数组-JavaScript
我们需要编写一个JavaScript数组函数，该函数接受具有伪造值的嵌套数组，并返回
2023-11-18

JavaScript在数组的伪索引处插入元素方法详解
我们需要编写一个Array函数，比如pushAtFalsy()，该函数应该包含一个数
2023-11-18

PHP整数数据类型
定义和用法在PHP中，Integer是标量数据类型，代表数字常量，代表整数，不带任何
2023-11-18

PHP错误控制运算符
介绍在PHP中，将@符号定义为错误控制运算符。当它以任何表达式为前缀时，PHP解析器
2023-11-18

PHP类型杂耍详解
定义和用法PHP被称为动态类型语言。在PHP中既不需要也不支持变量的显式类型声明。与
2023-11-18

PowerShell版本7中引入了哪些新的Null运算符？
PowerShell版本7引入了一些新的空运算符。它们如下。空合并运算符-??空条件
2023-11-18

PowerShell中$ ErrorView的用途是什么？
$Errorview变量确定PowerShell中错误消息的显示格式。在PowerS
2023-11-18

PHP执行运算符
介绍PHP中定义了一个执行运算符。一个字符串内部背蜱S（``）被视为一个DOS命令（
2023-11-18

Copyright © 2022 忙忙碌碌网
把实用的技术和经验，分享给最需要的读者，希望每一位来访的朋友都能有所收获！

文章目录