Status: Eksperymentalny zestaw narzędzi do opisu i transformacji danych tabelarycznych.
Główna idea polega na utrzymywaniu jawnej wiedzy o rolach kolumn: celach, cechach numerycznych, nominalnych, porządkowych, cyklicznych, tekstowych i usuwanych. Repozytorium łączy tę reprezentację z własnymi encoderami i pipeline'ami przetwarzania.
- klasa
DatasetKnowledgewmain.pyzarządzająca semantyką kolumn - własne encodery i transformery w
encoders.py,Transformers.pyipipeline1.py - dane demonstracyjne z problemu House Prices oraz skrypty eksperymentalne
- próba oddzielenia wiedzy dziedzinowej o kolumnach od samego DataFrame i transformacji
- punkt wyjścia do budowy deklaratywnego, audytowalnego preprocessingu danych mieszanych
- materiał do porównania własnych transformerów z
ColumnTransformeri nowoczesnymi narzędziami metadanych
- brak stabilnego API, pakietu, testów kontraktowych i przykładu pełnego przebiegu od danych do modelu
- część logiki ma charakter roboczy i wymaga walidacji zachowania dla braków danych oraz nieznanych kategorii
- dołączone dane demonstracyjne nie dowodzą przewagi podejścia nad standardowym pipeline'em scikit-learn
- zbudować mały przykład z kolumnami wszystkich obsługiwanych typów
- porównać wynik transformacji, odporność na nowe kategorie i możliwość odwrócenia transformacji
- oceniać przede wszystkim użyteczność modelu metadanych, nie sam zbiór danych
Opis sporządzono na podstawie plików obecnych na domyślnej gałęzi repozytorium. Nie zakłada on funkcji, wyników ani gotowości produkcyjnej, których nie da się potwierdzić z zawartości.
Obecność kodu lub danych nie oznacza automatycznie gotowości produkcyjnej, poprawności naukowej ani prawa do redystrybucji materiałów zewnętrznych. Licencję i pochodzenie danych należy oceniać na podstawie odpowiednich plików źródłowych oraz warunków ich dostawców.