Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lernen Implementierung an Einem Realen Datensatz | DBSCAN
Clusteranalyse Mit Python

Implementierung an Einem Realen Datensatz

Swipe um das Menü anzuzeigen

Verwendung des Mall-Kunden-Datensatzes, der die folgenden Spalten enthält:

Folgende Schritte sollten vor der Clusterbildung durchgeführt werden:

  1. Daten laden: Verwendung von pandas zum Laden der CSV-Datei;
  2. Relevante Merkmale auswählen: Fokus auf die Spalten 'Annual Income (k$)' und 'Spending Score (1-100)';
  3. Datenskalierung (wichtig für DBSCAN): Da DBSCAN Distanzberechnungen verwendet, ist es entscheidend, die Merkmale auf ähnliche Wertebereiche zu skalieren. Hierfür kann StandardScaler verwendet werden.

Interpretation

Der Code erstellt in diesem Fall 5 Cluster. Es ist wichtig, die resultierenden Cluster zu analysieren, um Einblicke in die Kundensegmentierung zu gewinnen. Beispielsweise könnten Cluster folgende Gruppen repräsentieren:

  • Kunden mit hohem Einkommen und hohen Ausgaben;
  • Kunden mit hohem Einkommen und niedrigen Ausgaben;
  • Kunden mit niedrigem Einkommen und hohen Ausgaben;
  • Kunden mit niedrigem Einkommen und niedrigen Ausgaben;
  • Kunden mit mittlerem Einkommen und mittleren Ausgaben.
DBSCAN-Cluster

Abschließende Bemerkungen

War alles klar?

Wie können wir es verbessern?

Danke für Ihr Feedback!

Abschnitt 5. Kapitel 5

Fragen Sie AI

expand

Fragen Sie AI

ChatGPT

Fragen Sie alles oder probieren Sie eine der vorgeschlagenen Fragen, um unser Gespräch zu beginnen

Implementierung an Einem Realen Datensatz

Verwendung des Mall-Kunden-Datensatzes, der die folgenden Spalten enthält:

Folgende Schritte sollten vor der Clusterbildung durchgeführt werden:

  1. Daten laden: Verwendung von pandas zum Laden der CSV-Datei;
  2. Relevante Merkmale auswählen: Fokus auf die Spalten 'Annual Income (k$)' und 'Spending Score (1-100)';
  3. Datenskalierung (wichtig für DBSCAN): Da DBSCAN Distanzberechnungen verwendet, ist es entscheidend, die Merkmale auf ähnliche Wertebereiche zu skalieren. Hierfür kann StandardScaler verwendet werden.

Interpretation

Der Code erstellt in diesem Fall 5 Cluster. Es ist wichtig, die resultierenden Cluster zu analysieren, um Einblicke in die Kundensegmentierung zu gewinnen. Beispielsweise könnten Cluster folgende Gruppen repräsentieren:

  • Kunden mit hohem Einkommen und hohen Ausgaben;
  • Kunden mit hohem Einkommen und niedrigen Ausgaben;
  • Kunden mit niedrigem Einkommen und hohen Ausgaben;
  • Kunden mit niedrigem Einkommen und niedrigen Ausgaben;
  • Kunden mit mittlerem Einkommen und mittleren Ausgaben.
DBSCAN-Cluster

Abschließende Bemerkungen

War alles klar?

Wie können wir es verbessern?

Danke für Ihr Feedback!

Abschnitt 5. Kapitel 5
some-alt