Pandas核心数据结构
Pandas是Python最强大的数据分析库,核心数据结构是Series(一维)和DataFrame(二维)。
import pandas as pd
df = pd.DataFrame({
"姓名": ["张三", "李四", "王五", "赵六"],
"年龄": [25, 30, 28, 35],
"薪资": [8000, 12000, 9500, 15000],
"部门": ["技术", "产品", "技术", "管理"]
})
print(df.describe())
print(df.groupby("部门")["薪资"].mean())
数据清洗
df.isnull().sum() # 查看每列缺失数
df.dropna() # 删除缺失行
df.fillna(0) # 用0填充
df["薪资"].fillna(df["薪资"].mean()) # 用均值填充
df.drop_duplicates() # 删除重复行
数据可视化
import matplotlib.pyplot as plt
df.groupby("部门")["薪资"].mean().plot(kind="bar")
plt.title("各部门平均薪资")
plt.tight_layout()
plt.savefig("salary_by_dept.png", dpi=150)
常用操作速查
| 操作 | 代码 |
|---|---|
| 读取CSV | pd.read_csv("file.csv") |
| 写入CSV | df.to_csv("out.csv", index=False) |
| 合并DataFrame | pd.merge(df1, df2, on="key") |
| 透视表 | pd.pivot_table(df, values="薪资", index="部门") |
0 条评论 欢迎参与讨论