Skip to content

PeterPirog/DatasetKnowledge

Repository files navigation

DatasetKnowledge

Status: Eksperymentalny zestaw narzędzi do opisu i transformacji danych tabelarycznych.

Cel i rzeczywista zawartość

Główna idea polega na utrzymywaniu jawnej wiedzy o rolach kolumn: celach, cechach numerycznych, nominalnych, porządkowych, cyklicznych, tekstowych i usuwanych. Repozytorium łączy tę reprezentację z własnymi encoderami i pipeline'ami przetwarzania.

Zakres potwierdzony w repozytorium

  • klasa DatasetKnowledge w main.py zarządzająca semantyką kolumn
  • własne encodery i transformery w encoders.py, Transformers.py i pipeline1.py
  • dane demonstracyjne z problemu House Prices oraz skrypty eksperymentalne

Gdzie leży wartość merytoryczna

  • próba oddzielenia wiedzy dziedzinowej o kolumnach od samego DataFrame i transformacji
  • punkt wyjścia do budowy deklaratywnego, audytowalnego preprocessingu danych mieszanych
  • materiał do porównania własnych transformerów z ColumnTransformer i nowoczesnymi narzędziami metadanych

Ograniczenia rzetelnej oceny

  • brak stabilnego API, pakietu, testów kontraktowych i przykładu pełnego przebiegu od danych do modelu
  • część logiki ma charakter roboczy i wymaga walidacji zachowania dla braków danych oraz nieznanych kategorii
  • dołączone dane demonstracyjne nie dowodzą przewagi podejścia nad standardowym pipeline'em scikit-learn

Jak zweryfikować wartość projektu

  • zbudować mały przykład z kolumnami wszystkich obsługiwanych typów
  • porównać wynik transformacji, odporność na nowe kategorie i możliwość odwrócenia transformacji
  • oceniać przede wszystkim użyteczność modelu metadanych, nie sam zbiór danych

Uwagi

Opis sporządzono na podstawie plików obecnych na domyślnej gałęzi repozytorium. Nie zakłada on funkcji, wyników ani gotowości produkcyjnej, których nie da się potwierdzić z zawartości.

Obecność kodu lub danych nie oznacza automatycznie gotowości produkcyjnej, poprawności naukowej ani prawa do redystrybucji materiałów zewnętrznych. Licencję i pochodzenie danych należy oceniać na podstawie odpowiednich plików źródłowych oraz warunków ich dostawców.

About

Tool to analyze csv datasets

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages