# scikit learn
course: Academy — 65-GENAI-for-Engineers
module: Academy/65-GENAI-for-Engineers
type: notebook
source_url: https://personal-learn.armco.dev/files/Academy/65-GENAI-for-Engineers/folders/Live_Intervention_Visualisation_and_Scikit_Folder/scikit_learn.ipynb
---
[cell 1 code]
import pandas as pd
[cell 2 code]
df = pd.read_csv("/content/food_sales.csv")
[cell 3 code]
from google.colab import drive
drive.mount('/content/drive')
[cell 4 code]
print(df.head())
[cell 5 code]
#top 10 selling items
[cell 6 code]
top_items = df.groupby('Item')['Sales'].sum().sort_values(ascending=False).head(10)
print(top_items)
[cell 7 code]
#Category-wise Sales
import matplotlib.pyplot as plt
import seaborn as sns
[cell 8 code]
plt.figure(figsize=(6,4))
sns.barplot(x='Category', y='Sales',data=df)
plt.show()
[cell 9 code]
# Trend
sns.lineplot(x='Date', y='Sales', data=df)
plt.show()
[cell 10 code]
# Distribution of data
sns.histplot(df['Sales'],bins=10)
plt.xlim(0,1000)
plt.show()
[cell 11 code]
#Box plot
sns.boxplot(x='Category', y='Sales', data=df)
plt.show()
[cell 12 code]
# Scikit - learn also known as sklearn
# Simulated dataset
[cell 13 code]
from sklearn.datasets import make_classification
import pandas as pd
x,y = make_classification(n_samples=100, n_features=5, n_classes=2, random_state=42)
df = pd.DataFrame(x, columns=['feature1','feature2','feature3','feature4','feature5'])
df['target'] = y
print(df.head(10))
print(df)