AIUnlimited
🌳

AI-Fundamenten

🌱
AI Seeds

Begin bij nul

🌿
AI Sprouts

Bouw een fundament

🌳
AI Branches

Pas toe in de praktijk

🏕️
AI Canopy

Ga de diepte in

🌲
AI Forest

Beheers AI

🔨

AI-Meesterschap

✏️
AI Sketch

Begin bij nul

🪨
AI Chisel

Bouw een fundament

⚒️
AI Craft

Pas toe in de praktijk

💎
AI Polish

Ga de diepte in

🏆
AI Masterpiece

Beheers AI

📘

AI Praktijk

📖
Open-source modellen begrijpen

Fundamenten en bronnen voor open-source modellen

🎯
Van probleem naar modeltaak

Bedrijfsproblemen omzetten in modeltaken

⚡
Uw eerste model uitvoeren

Zie uw eerste resultaten in 30 minuten

🔧
Fijntuning en evaluatie

Modellen fijntunen en prestaties evalueren

🚀
Applicatiesystemen

Bouw echte AI-toepassingen

🎨
Generatieve AI

Verken open-source AIGC-modellen

🤖
Agents

Leer Agent-frameworks en MCP-tools

📐
Aanvullende fundamenten

LLM-basis en evaluatie

🎓

Claude Academie

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Lab

7 experimenten geladen
🧬Neuraal Netwerk Sandbox🤖AI of Mens?🥋Prompt Engineering Dojo🏁Algoritme-race🧠AI-triviant🏗️Systeemontwerp Canvas
🎯Proef-sollicitatieGa naar het lab→
🚀

Carrièreontwikkeling

🚀
Interview Startplatform

Start je reis

🌟
Gedragsinterview Meesterschap

Beheers soft skills

💻
Technische Interviews

Slaag voor de codeerronde

🤖
AI- & ML-interviews

ML-interview meesterschap

🏆
Aanbod & verder

Bemachtig het beste aanbod

Begin met leren
AIUnlimited

MIT-licentie.

沪ICP备18025655号-11

Leren

  • AI-basis
  • AI Praktijk
  • Claude Academie
  • Lab
  • Carrièreontwikkeling

Community

  • Over ons
  • FAQ

Ondersteuning

  • footer.terms
  • footer.privacy
  • footer.contact
AI & Engineering Opleidingen›🌿 AI Sprouts›Lessen›Supervised vs unsupervised learning: belangrijkste verschillen uitgelegd
🔀
AI Sprouts • Gemiddeld⏱️ 25 min leestijd

Supervised vs unsupervised learning: belangrijkste verschillen uitgelegd

Begeleid versus onbewaakt leren: belangrijkste verschillen uitgelegd

Wanneer u begint met het leren van machinaal leren, is een van de eerste splitsingen deze: wat voor soort leren doet u? Het antwoord verandert alles: de algoritmen die voor u beschikbaar zijn, de gegevens die u nodig heeft en wat u van uw model kunt verwachten.

De twee fundamentele categorieën zijn onder toezicht leren en onbegeleid leren. Het begrijpen van het verschil is niet alleen academisch; het is de eerste beslissing die u neemt als u een nieuw ML-probleem aanpakt.

🏷️ Het kernonderscheid: labels

Het meest fundamentele verschil tussen begeleid en onbewaakt leren is of uw trainingsgegevens labels bevatten.

Gelabelde gegevens betekent dat elk voorbeeld in uw dataset het 'juiste antwoord' bevat: de uitkomst die u door het model wilt laten voorspellen of classificeren:

# Labelled dataset (supervised)
email_text                          | label
------------------------------------|-------
"Congratulations! You've won £1000" | spam
"Meeting rescheduled to Thursday"   | not_spam
"URGENT: Your account is suspended" | spam

Niet-gelabelde gegevens betekent dat u over de invoer beschikt, maar geen vooraf gedefinieerde antwoorden – alleen de ruwe observaties:

# Unlabelled dataset (unsupervised)
customer_id | age | annual_spend | frequency | location
------------|-----|--------------|-----------|----------
C001        | 34  | £2,400       | 12/year   | London
C002        | 52  | £18,000      | 52/year   | Manchester
C003        | 28  | £650         | 3/year    | London

Gelabelde gegevens zijn duur en tijdrovend om te produceren; er zijn mensen nodig om voorbeelden handmatig te annoteren. Er is een overvloed aan ongelabelde data (de meeste data ter wereld hebben geen labels). Deze praktische beperking bepaalt welke aanpak mogelijk is voor een bepaald probleem.

✅ Begeleid leren

Bij begeleid leren leert het model een mapping van input naar output door gelabelde voorbeelden te bestuderen. De 'supervisor' is de gelabelde data zelf; elk trainingsvoorbeeld vertelt het model wat de juiste output zou moeten zijn.

Classificatie

Wanneer de uitvoer een afzonderlijke categorie is, is er sprake van een classificatieprobleem.

Voorbeelden:

  • Is deze e-mail spam of geen spam?
  • Bevat deze afbeelding een kat of een hond?
  • Zal deze leningaanvrager in gebreke blijven? (Ja/Nee)
  • Welk cijfer (0–9) vertegenwoordigt dit handgeschreven nummer?

Gemeenschappelijke algoritmen:

  • Logistieke regressie
  • Beslissingsbomen en willekeurige bossen
  • Ondersteuning van vectormachines (SVM)
  • Neurale netwerken
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import train_test_split

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)

classifier = RandomForestClassifier(n_estimators=100)
classifier.fit(X_train, y_train)

accuracy = classifier.score(X_test, y_test)
print(f"Test accuracy: {accuracy:.2%}")

Regressie

Als de uitvoer een continu getal is, is er sprake van een regressieprobleem.

Voorbeelden:

  • Waarvoor zal dit huis verkocht worden?
  • Wat zal deze aandelenkoers morgen zijn?
  • Hoeveel eenheden zullen we volgende maand verkopen?
  • Wat zal de bloeddruk van een patiënt over zes maanden zijn?

Gemeenschappelijke algoritmen:

  • Lineaire regressie
  • Ridge / Lasso-regressie
  • Verloopversterking (XGBoost, LightGBM)
  • Neurale netwerken
from sklearn.ensemble import GradientBoostingRegressor

model = GradientBoostingRegressor(n_estimators=200, learning_rate=0.1)
model.fit(X_train, y_train)

predictions = model.predict(X_test)
# predictions = [245000, 182000, 412000, ...]  (house prices in £)
🤯
Gradient Boosting-modellen (XGBoost, LightGBM, CatBoost) hebben meer Kaggle machine learning-wedstrijden gewonnen dan welke andere algoritmecategorie dan ook. Ze blijven de beste keuze voor gestructureerde/tabelgegevens in de industrie.

🔍 Leren zonder toezicht

Bij onbewaakt leren onderzoekt het model de structuur van gegevens zonder labels. In plaats van een mapping naar een bekende output te leren, ontdekt het zelf verborgen patronen, groeperingen of representaties.

Clustering

Clusteralgoritmen groeperen vergelijkbare datapunten zonder dat hen wordt verteld wat de groepen moeten zijn.

Voorbeelden:

  • Klanten segmenteren op basis van koopgedrag (zonder segmenten vooraf te definiëren)
  • Groepeer documenten op onderwerp
  • Identificeer gemeenschappen in een sociaal netwerk
  • Detecteer afwijkingen (punten die niet tot een cluster behoren)

Gemeenschappelijke algoritmen:

  • K-betekent clustering
  • DBSCAN (gebaseerd op dichtheid, verwerkt onregelmatige vormen)
  • Hiërarchische clustering
from sklearn.cluster import KMeans

# We don't know how many customer segments exist — let's try 4
kmeans = KMeans(n_clusters=4, random_state=42)
kmeans.fit(customer_data_scaled)

# Each customer now has a cluster label (0, 1, 2, or 3)
df['segment'] = kmeans.labels_

# Analyse what each segment looks like
print(df.groupby('segment')[['age', 'annual_spend', 'frequency']].mean())

Dimensionaliteitsreductie

Comprimeer hoogdimensionale gegevens in minder dimensies, terwijl zoveel mogelijk structuur behouden blijft. Gebruikt voor visualisatie, voorverwerking en verwijdering van overtollige informatie.

Gemeenschappelijke algoritmen:

  • PCA (Principal Component Analysis) — lineaire compressie
  • t-SNE — niet-lineair, uitstekend geschikt voor visualisatie
  • UMAP — snel, behoudt zowel de lokale als de mondiale structuur
  • Autoencoders — op neurale netwerken gebaseerde compressie
from sklearn.decomposition import PCA
import matplotlib.pyplot as plt

# Reduce 50-dimensional data to 2D for visualisation
pca = PCA(n_components=2)
X_2d = pca.fit_transform(X_scaled)

plt.scatter(X_2d[:, 0], X_2d[:, 1], c=cluster_labels, cmap='tab10')
plt.title('Customer segments visualised in 2D')
plt.show()
🤔
Think about it:Een retailer beschikt over transactiegegevens van 10 miljoen klanten, maar geen vooraf gedefinieerde klantsegmenten. Waarom zou clustering zonder toezicht hier nuttig zijn? Tot welke zakelijke beslissingen kunnen de ontdekte segmenten leiden?

🔄 Voorbij het binaire getal: andere leerparadigma's

Het onderscheid tussen toezicht en toezicht is fundamenteel, maar het ML-landschap is rijker dan alleen deze twee categorieën.

Semi-begeleid leren

Gebruikt een kleine hoeveelheid gelabelde gegevens gecombineerd met een grote hoeveelheid niet-gelabelde gegevens. Dit is erg praktisch omdat etiketteren duur is.

Voorbeeld: u heeft 1.000 gelabelde medische scans en 100.000 niet-gelabelde scans. Met semi-gecontroleerd leren kunt u profiteren van de niet-gelabelde gegevens om de prestaties te verbeteren boven wat de 1.000 labels alleen al zouden kunnen bereiken.

Zelfgestuurd leren

Een speciaal geval waarbij de labels automatisch worden gegenereerd op basis van de gegevens zelf. Dit is hoe moderne grote taalmodellen vooraf worden getraind.

Voorbeeld: Neem een ​​zin, verberg enkele woorden en train het model om de ontbrekende woorden te voorspellen. De "labels" (de juiste woorden) zijn gratis; ze komen rechtstreeks uit de tekst zelf. Zo is BERT opgeleid.

Input:  "The cat sat on the [MASK]."
Target: "mat"

Zelfgestuurd leren heeft een transformatief effect gehad omdat het training op internetschaal mogelijk maakt zonder menselijke annotatie.

Versterkend leren

Een agent leert door acties te ondernemen in een omgeving en beloningen of strafpunten te ontvangen. Er zijn geen labels – alleen feedbacksignalen van uitkomsten.

Voorbeelden: schaken, een robot trainen om te lopen, het koelsysteem van een datacenter optimaliseren. We gaan hier uitgebreid op in in zijn eigen les.

🗺️ De juiste aanpak kiezen

Hier is een praktisch beslissingskader:

Do you have labelled data?
├── YES → Supervised Learning
│         ├── Output is a category? → Classification
│         │     (spam/not spam, dog/cat, fraud/legit)
│         └── Output is a number?  → Regression
│               (price, temperature, sales volume)
└── NO  → Unsupervised Learning
          ├── Want to find groups?      → Clustering
          │     (customer segments, document topics)
          ├── Want to compress data?    → Dimensionality Reduction
          │     (visualisation, pre-processing)
          └── Want to detect anomalies? → Anomaly Detection
                (fraud, equipment failure)

Partially labelled? → Semi-Supervised Learning
Learning from interaction? → Reinforcement Learning
🧠Snelle check

Je hebt 50.000 productrecensies zonder sterbeoordelingen of sentimentlabels. U wilt ze automatisch op onderwerp groeperen. Welke leeraanpak moet je gebruiken?

Belangrijkste afhaalrestaurants

  • Voor begeleid leren zijn gelabelde gegevens vereist; het model leert een mapping van inputs naar bekende outputs - gebruikt voor classificatie (discrete output) en regressie (continue output)
  • Ongecontroleerd leren werkt met ongelabelde gegevens; het model ontdekt verborgen structuur – gebruikt voor clustering, dimensionaliteitsreductie en anomaliedetectie
  • De keuze tussen gecontroleerd en niet-gecontroleerd wordt voornamelijk bepaald door of u gegevens heeft gelabeld en welke vraag u probeert te beantwoorden
  • Semi-gesuperviseerd leren overbrugt de kloof door gebruik te maken van een kleine hoeveelheid gelabelde data naast grote hoeveelheden ongelabelde data
  • Zelfgestuurd leren genereert zijn eigen labels op basis van de gegevens - het is de techniek achter moderne LLM's zoals BERT en GPT
  • Reinforcement learning verschilt van beide: een agent leert van beloningssignalen door interactie met een omgeving, zonder labels
  • Gebruik het beslissingskader: gelabeld + categorie-uitvoer → classificatie; gelabeld + continue output → regressie; ongelabeld + zoek groepen → clustering
Les 14 van 160% voltooid
←Feature Engineering: machines leren wat belangrijk is

Discussie

Inloggen deelnemen aan de discussie