Pandas核心数据结构

Pandas是Python最强大的数据分析库,核心数据结构是Series(一维)和DataFrame(二维)。

import pandas as pd

df = pd.DataFrame({
    "姓名": ["张三", "李四", "王五", "赵六"],
    "年龄": [25, 30, 28, 35],
    "薪资": [8000, 12000, 9500, 15000],
    "部门": ["技术", "产品", "技术", "管理"]
})

print(df.describe())
print(df.groupby("部门")["薪资"].mean())

数据清洗

df.isnull().sum()        # 查看每列缺失数
df.dropna()              # 删除缺失行
df.fillna(0)             # 用0填充
df["薪资"].fillna(df["薪资"].mean())  # 用均值填充
df.drop_duplicates()     # 删除重复行

数据可视化

import matplotlib.pyplot as plt

df.groupby("部门")["薪资"].mean().plot(kind="bar")
plt.title("各部门平均薪资")
plt.tight_layout()
plt.savefig("salary_by_dept.png", dpi=150)

常用操作速查

操作代码
读取CSVpd.read_csv("file.csv")
写入CSVdf.to_csv("out.csv", index=False)
合并DataFramepd.merge(df1, df2, on="key")
透视表pd.pivot_table(df, values="薪资", index="部门")