Topics in this subject

28 topics

Pandas

0 of 28 complete 0%
01 1 min read

1. Introduction

Pandas gives you labeled, heterogeneous, tabular data on top of NumPy.

02 1 min read

2. Reading Data

df = pd.readcsv('data.csv')

03 1 min read

3. Writing Data

df.tocsv('out.csv', index=False) # drop the index column

04 1 min read

4. Exploring Data

df.head(3) # first 3 rows

05 2 min read

5. Selecting Data

df = pd.DataFrame({'age':[25,30,35], 'city':['NYC','LA','SF']},

06 2 min read

6. Cleaning Data

df.isna().sum() # count NaNs per column

07 2 min read

7. Working with Columns

df['bonus'] = df['salary'] 0.1 # create

08 1 min read

8. Sorting

df.sortvalues('age') # ascending

09 2 min read

9. GroupBy

The split-apply-combine pattern: split rows into groups, apply a function, combine results.

10 2 min read

10. Merge & Join

left = pd.DataFrame({'id':[1,2,3], 'name':['A','B','C']})

11 1 min read

11. Pivot Tables & Reshaping

df = pd.DataFrame({

12 1 min read

12. MultiIndex (hierarchical index)

idx = pd.MultiIndex.fromtuples(

13 1 min read

13. String Functions (`.str` accessor)

s = pd.Series([' Alice ', 'BOB', 'charlie99'])

14 1 min read

14. DateTime

df['date'] = pd.todatetime(df['date']) # parse strings

15 1 min read

15. Window Functions

s = pd.Series([1, 2, 3, 4, 5])

16 1 min read

16. Performance Tips

df['city'] = df['city'].astype('category') # if few unique values

17 4 min read

17. Pandas Interview Questions (50+)

1. Series vs DataFrame? 1-D labeled array vs 2-D labeled table.

18 1 min read

Project 1 — Cleaning a Messy Dataset

raw = pd.DataFrame({

19 1 min read

Project 2 — Sales Analysis

sales = pd.DataFrame({

20 1 min read

Project 3 — Employee Salary Analysis

emp = pd.DataFrame({

21 1 min read

Project 4 — Titanic-style Analysis

titanic = pd.DataFrame({

22 1 min read

Project 5 — Time Series Analysis

dates = pd.daterange('2024-01-01', periods=90, freq='D')

23 1 min read

Project 6 — Feature Engineering & ML Preprocessing

df = pd.DataFrame({

24 1 min read

Project 7 — Customer Churn Analysis

cust = pd.DataFrame({

25 3 min read

Pandas Exercises

P1. Create a DataFrame from a dict. pd.DataFrame({'a':[1,2],'b':[3,4]})

26 1 min read

Mixed NumPy + Pandas Exercises

M1. Convert a DataFrame column to a NumPy array. df['v'].tonumpy()

27 2 min read

Quick Comparison Tables

Revision notes.

28 2 min read

Final Revision Cheat Sheets

readcsv, head, info, describe, loc, iloc, groupby, agg,