Playing around with Datasets & Python w/ Copilot
from sklearn.datasets import load_iris
import pandas as pd
iris = load_iris()
df = pd.DataFrame(iris.data, columns=iris.feature_names)
df["class"] = iris.targetdf.head()โ first rowsdf.tail()โ last rowsdf.shapeโ dimensionsdf.describe()โ stats summarydf.columnsโ column namesdf.dtypesโ data types
df["class"].unique()โ class labelsdf["class"].value_counts()โ samples per classdf.corr()โ correlations
df.hist()
df.plot(kind="box")
df.plot(kind="scatter", x="sepal length (cm)", y="petal width (cm)")from sklearn.model_selection import train_test_split
from sklearn.neighbors import KNeighborsClassifier
X = df.iloc[:, :-1]
y = df["class"]
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)
model = KNeighborsClassifier()
model.fit(X_train, y_train)
model.score(X_test, y_test)#-----------------------------------------------
Below is a compact but powerful toolbox you can lean on as you learn.
These examples assume:
from sklearn.datasets import load_iris
import pandas as pd
iris = load_iris()
df = pd.DataFrame(iris.data, columns=iris.feature_names)
df["class"] = iris.targetdf.head()df.tail()df.shapedf.columnsdf.describe()df.dtypesdf["class"].unique()df["class"].value_counts()df.corr()import matplotlib.pyplot as pltdf.hist(figsize=(8,6))
plt.show()df.plot(kind="scatter", x="sepal length (cm)", y="sepal width (cm)")
plt.show()df.plot(kind="box", figsize=(8,6))
plt.show()from sklearn.model_selection import train_test_split
X = df.iloc[:, :-1]
y = df["class"]
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)from sklearn.neighbors import KNeighborsClassifier
model = KNeighborsClassifier()
model.fit(X_train, y_train)model.score(X_test, y_test)This is the modern, canonical approach:
df = pd.DataFrame(iris.data, columns=iris.feature_names)
df["class"] = iris.targetNo URLs, no CSVs โ just clean, inโmemory data.