Projekt

Projektgruppe - Data Science Semesterprojekt

Extraktion regulatorischer Entitäten im deutschen Energiemarkt

  • © Projektgruppe mit ChatGPT

Projektbeschreibung 

Im Rahmen des Projekts wurde ein Prototyp für eine Pipeline entwickelt, die regulatorisch relevante Entitäten automatisch aus unstrukturierten SAP-Dokumenten extrahiert. Ziel war es, eine strukturierte Analyse dieser Daten zu ermöglichen und die Klassifikation von Entitäten ohne aufwendige manuelle Annotationen durchzuführen.

Methodik 

  • Datenextraktion: Einsatz von BeautifulSoup und Requests zur Extraktion aus HTML-Seiten.
  • Vorverarbeitung: Tokenisierung, Lemmatisierung und POS-Tagging zur sprachlichen Aufbereitung.
  • Clustering: Mustererkennung mit K-Means (mit und ohne Autoencoder) sowie HDBSCAN zur Dimensionsreduzierung.
  • Kontextbasierte Klassifikation: Berücksichtigung von Top-K-Phrasen innerhalb von Clustern.
  • Integrationvon Sprachmodellen (LLMs): Erweiterung der inhaltlichen Analyse durch intelligente Sprachmodelle.

Ergebnisse 

  • Entwicklung eines funktionsfähigen Prototyps, der SAP-Dokumente automatisch analysiert.
  • Automatische Entitätserkennung und -klassifikation (z. B. Marktrollen, Prozesse, Fristen, Kennzahlen).
  • Gruppierung inhaltlich ähnlicher Phrasen in Clustern.
  • Bereitstellung einer semi-supervised Labeling-Schnittstelle für interaktive Anpassungen und den Aufbau spezifischer Datasets.

Fazit 

Das Projekt reduziert den manuellen Aufwand bei der Analyse regulatorischer Dokumente erheblich und schafft die Grundlage für weiterführende Anwendungen im Bereich der automatisierten Dokumentenanalyse. 

Betreuer/in