Projekt

Projektgruppe - Data Science Semesterprojekt

Fake News Detection mit Machine Learning

  • © Bild durch Wordcloud-Bibliothek generiert
    Bild durch Wordcloud-Bibliothek generiert auf Grundlage des Datensatzes des Projekts

Vergleich klassischer ML-Ansätze und Word Embeddings


Modul / Lehrveranstaltung: Projekt Data Science
Semester: 3. Semester
Jahr: 2025
 

Die Verbreitung von Fehlinformationen in sozialen Medien stellt eine wachsende gesellschaftliche Herausforderung dar. Fake News verbreiten sich nachweislich sechsmal schneller als echte Nachrichten und erreichen durch automatisierte Bots und Social Media Algorithmen Millionen von Nutzern innerhalb weniger Stunden. Während manuelle Faktenprüfung durch Journalisten wichtig bleibt, kann sie mit der Geschwindigkeit der digitalen Informationsverbreitung nicht mithalten. Wie können Machine Learning Techniken dabei helfen, automatisierte Systeme zur Erkennung von Fake News zu entwickeln? Und welche Textrepräsentationsmethoden liefern die besten
Ergebnisse?
 

Diesen Fragen wurde im durchgeführten Data Science Projekt nachgegangen und somit die Wirksamkeit verschiedener Machine Learning Ansätze zur automatisierten Fake News Erkennung analysiert. Als Datengrundlage diente der WELFake Dataset aus Kaggle, welcher echte und gefälschte Nachrichtenartikel aus verschiedenen Quellen kombiniert und entsprechend klassifiziert.
Das Projekt verfolgte einen systematischen Vergleich zweier fundamentaler Ansätze der Textanalyse: Zum einen wurde ein klassischer Machine Learning Ansatz mit TF-IDF Vektorisierung implementiert, der statistische Worthäufigkeiten zur Merkmalserzeugung nutzt. Zum anderen wurde ein semantikbasierter Ansatz mit Word2Vec Embeddings entwickelt, bei dem Wörter in einen mehrdimensionalen Vektorraum eingebettet und durch Mittelwertbildung zu Dokumentvektoren aggregiert werden.
Für beide Ansätze wurden umfassende Textvorverarbeitungsschritte implementiert, einschließlich Bereinigung von Sonderzeichen, Stopwort-Entfernung und Lemmatisierung. Die klassischen Machine Learning Modelle umfassten
Naive Bayes, Logistic Regression, SVM, XGBoost und Random Forest Klassifikatoren, während der Word2Vec Ansatz mit verschiedenen Embedding-Dimensionen und nachgelagerten Klassifikatoren getestet wurde.
Ein besonderer Fokus lag auf der produktionsreifen Implementierung: Das gesamte Projekt wurde in Docker-Containern entwickelt und auf einem Kubernetes Cluster der Universität deployed. Diese Infrastruktur ermöglichte es, mit persistentem Speicher , automatischer Skalierung und Hochverfügbarkeit zu arbeiten.
 

Als Ergebnis des Projektes konnte gezeigt werden, dass beide Ansätze effektiv für die Fake News Erkennung geeignet sind, jedoch unterschiedliche Stärken aufweisen: Während TF-IDF-basierte Modelle durch Interpretierbarkeit und Trainingsgeschwindigkeit überzeugen, bieten Word2Vec Embeddings besseres semantisches Verständnis bei kompakterer Repräsentation. Die entwickelte containerisierte ML-Pipeline ist skalierbar und produktionsreif, mit automatisierter Modellpersistierung und Versionskontrolle über Docker Images.

Betreuer/in