Load, Select
Import
import pandas as pdCreate dataframe
dataFrameName = pd.DataFrame({
'Product ID': [1, 2, 3, 4],
'Product Name': ['t-shirt', 't-shirt', 'skirt', 'skirt'],
'Color': ['blue', 'green', 'red', 'black']
})
# or
dataFrameName = pd.DataFrame(
[[1, 'San Diego', 100],
[2, 'Los Angeles', 120],
[3, 'San Francisco', 90],
[4, 'Sacramento', 115]],
columns=['Store ID', 'Location', 'Number of Employees']
)
Print dataframe
print(dataFrameName)
# shows first few rows
print(dataFrameName.head())
# shows some stats about each column
print(dataFrameName)
Select column
# use this one, less likerly to error, due to syntax
dataFrameName['colName']
# or
dataFrameName.colName
# select multiple
dataFrameName[['colName', 'colName1']]
# select with logic
dataFrameName[dataFrameName['colName'] == 78]Select row
dataFrameName.iloc[0]
dataFrameName.iloc[1:8]
dataFrameName.iloc[-1]
# yes i thought it not being called iloc was odd
dataFrameName.loc[[1, 3, 5]]
# select with logic
dataFrameName[(dataFrameName.age > 30) | (dataFrameName.name == 'benji')]
# or
# returns rows if they have val
dataFrameName[dataFrameName['colName'].isin(['val','val','val'])]Reseting Index
Note: the indexs are carried over from the previous data frame, we can reset them
# resets them back to 0...n, note a new column is made with the old indies
new_dataFrameName = dataFrameName.reset_index()
# this removes that new column
new_dataFrameName = dataFrameName.reset_index(drop = True)
# modifys current data frame
dataFrameName.reset_index(drop = True, implace = True)