From e53ff44b8df0c8299d9f80ac21bebf0029e4a356 Mon Sep 17 00:00:00 2001 From: aaron Date: Thu, 18 Jun 2026 20:27:18 +0200 Subject: [PATCH] update: erkenntnisse aus uebung --- NSL/notizen/L1_Notizen.md | 9 +++++++++ 1 file changed, 9 insertions(+) diff --git a/NSL/notizen/L1_Notizen.md b/NSL/notizen/L1_Notizen.md index a04d182..8b3a2ab 100644 --- a/NSL/notizen/L1_Notizen.md +++ b/NSL/notizen/L1_Notizen.md @@ -327,3 +327,12 @@ kproto = KPrototypes(n_clusters=4, init='Cao', verbose=2) clusters = kproto.fit_predict(X, categorical=[1, 2]) # Indizes der kategorialen Spalten kproto.cluster_centroids_ # bestimmte Cluster-Zentren ``` + +## Praxis-Notizen aus Übung 2 (Stock-Daten) + +- Skalierung nötig: Dividend/PE/Cap auf sehr verschiedenen Skalen → sonst dominiert Cap die Distanz komplett. RobustScaler (Median/IQR) statt StandardScaler wegen starker Ausreisser in PE/Cap +- `categorical_idx` bezieht sich auf das Feature-Array `X` (nach Entfernen der ID-Spalten Stock/Symbol), nicht auf das originale `df` +- gamma fixieren! `cost_` ist nur über verschiedene $k$ vergleichbar, wenn `gamma` fest vorgegeben ist — sonst schätzt kmodes es pro Fit neu → cost-Kurve wird nicht-monoton +- `init="Cao"` kann bei grossem $k$ abbrechen ("could not initialize") → kleineres $k$ oder `init="Huang"` +- Ausreisser-Empfindlichkeit (live gesehen): die 3 PE-Extremwerte bilden eigene Mini-Cluster (Grössen 3/12/79), ~95 % aller Aktien landen in einem Topf → k-Prototypes clustert hier primär nach Ausreissern statt nach inhaltlicher Struktur +- Interpretation: numerische Zentren mit `scaler.inverse_transform` in Originaleinheiten zurückrechnen; kategoriales Zentrum = Modus (häufigster Sektor)