Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

ย 

History

4 Commits
ย 
ย 
ย 
ย 

Repository files navigation

iris-dataset-structures

Playing around with Datasets & Python w/ Copilot

๐ŸŒŸ A Tiny โ€œIris Dataset Quick Referenceโ€ You Can Keep Handy

๐Ÿ”ง Load the dataset

from sklearn.datasets import load_iris
import pandas as pd

iris = load_iris()
df = pd.DataFrame(iris.data, columns=iris.feature_names)
df["class"] = iris.target

๐Ÿ“˜ Core DataFrame operations

  • df.head() โ€” first rows
  • df.tail() โ€” last rows
  • df.shape โ€” dimensions
  • df.describe() โ€” stats summary
  • df.columns โ€” column names
  • df.dtypes โ€” data types

๐Ÿ” Exploration

  • df["class"].unique() โ€” class labels
  • df["class"].value_counts() โ€” samples per class
  • df.corr() โ€” correlations

๐Ÿ“Š Quick visualizations

df.hist()
df.plot(kind="box")
df.plot(kind="scatter", x="sepal length (cm)", y="petal width (cm)")

๐Ÿค– Machine learning basics

from sklearn.model_selection import train_test_split
from sklearn.neighbors import KNeighborsClassifier

X = df.iloc[:, :-1]
y = df["class"]

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)

model = KNeighborsClassifier()
model.fit(X_train, y_train)
model.score(X_test, y_test)

#-----------------------------------------------

Below is a compact but powerful toolbox you can lean on as you learn.


๐ŸŒฑ Essential Iris Dataset Functions (Modern Python)

These examples assume:

from sklearn.datasets import load_iris
import pandas as pd

iris = load_iris()
df = pd.DataFrame(iris.data, columns=iris.feature_names)
df["class"] = iris.target

๐Ÿ“Œ 1. Inspecting the Dataset

View the first rows

df.head()

View the last rows

df.tail()

Get dataset shape

df.shape

Column names

df.columns

Quick summary statistics

df.describe()

Data types

df.dtypes

๐Ÿ” 2. Exploring the Data

Unique class labels

df["class"].unique()

Count samples per class

df["class"].value_counts()

Correlation matrix

df.corr()

๐Ÿ“Š 3. Basic Visualizations (using pandas + matplotlib)

import matplotlib.pyplot as plt

Histogram

df.hist(figsize=(8,6))
plt.show()

Scatter plot

df.plot(kind="scatter", x="sepal length (cm)", y="sepal width (cm)")
plt.show()

Boxplots

df.plot(kind="box", figsize=(8,6))
plt.show()

๐Ÿค– 4. Preparing Data for Machine Learning

Split into train/test

from sklearn.model_selection import train_test_split

X = df.iloc[:, :-1]
y = df["class"]

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)

Train a simple model

from sklearn.neighbors import KNeighborsClassifier

model = KNeighborsClassifier()
model.fit(X_train, y_train)

Evaluate

model.score(X_test, y_test)

๐Ÿงญ 5. Converting the scikitโ€‘learn dataset into a DataFrame (the clean way)

This is the modern, canonical approach:

df = pd.DataFrame(iris.data, columns=iris.feature_names)
df["class"] = iris.target

No URLs, no CSVs โ€” just clean, inโ€‘memory data.


About

Playing around with Datasets & Python

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages