15.09.2026, 9:00 Uhr
Universität Wien
Besprechungsraum 4.34
Währinger Str. 29
1090 Wien
Titel: Fine-tuning MarkupLM for relation extraction from web pages
Kurzfassung:
Das Extrahieren von relationalen Tripeln aus Webseiten ist eine zentrale Aufgabe für
den Aufbau von Wissensgraphen und für Anwendungen wie Faktenüberprüfung und
automatische Fragebeantwortung. Die komplexe und unregelmäßige Struktur von HTMLDokumenten
führt jedoch häufig dazu, dass herkömmliche Scraping- und textbasierte
Extraktionsmethoden teilweise oder vollständig versagen, wenn es darum geht, diese
strukturierten Beziehungen zu rekonstruieren. Diese Arbeit untersucht, ob ein Markupbewusstes
Sprachmodell feinabgestimmt werden kann, um zu einem gegebenen Prädikat
Subjekt- und Objektspannen direkt aus HTML-Dokumenten zu extrahieren, wobei die
geparste Dokumentstruktur als explizites Signal genutzt wird.
Wir erstellen einen auf Spannenebene annotierten Tripel-Datensatz aus sechs Domänen
des SWDE-Korpus (movie, university, restaurant, auto, job und book), der 18
Prädikate und über 114.000 Webseiten abdeckt. Aufbauend auf dieser Ressource entwickeln
wir eine prädikatskonditionierte Pointer-Architektur auf Basis von MarkupLM,
die es dem Modell ermöglicht, Subjekt- und Objektspannen direkt aus der HTMLToken-
Sequenz gemeinsam vorherzusagen. Das System wird mit einer reproduzierbaren
Vorverarbeitungs- und Sharding-Pipeline, einer Negativsampling-Strategie und einem
Multi-Task-Trainingsziel trainiert, das die Spannenextraktion mit einem zusätzlichen
Term für das Vorliegen einer Relation kombiniert. Der zugehörige Klassifikationskopf blieb
in der aktuellen Implementierung untrainiert; die berichteten Ergebnisse messen daher
die Spannenextraktion zu einem gegebenen Prädikat und nicht die Relationserkennung.
Wir evaluieren das Modell auf einem zurückgehaltenen SWDE-Testsplit anhand von
Exact Match (EM), getrennt für Subjekt- und Objektspannen, sowie anhand tokenbasierter
makro- und mikro-gemittelter F1-Werte. Auf der ausgerichteten Teilmenge von 20.271
Testtripeln, deren Gold-Spannen innerhalb des 512-Token-Fensters des Modells liegen,
erreicht das feinabgestimmte Modell 0,934 EM (0,991 Subjekt, 0,941 Objekt), 0,984
Makro-F1 und 0,976 Mikro-F1, mit domänenweisen EM-Werten zwischen 0,875 und 0,997.
Darüber hinaus vergleichen wir mit Llama 3 8B und GPT-5.1 im Zero-Shot-Prompting
auf denselben Instanzen; beide erreichen deutlich niedrigere Werte (0,156 bzw. 0,195 EM).
Wir identifizieren ein Prompt-Artefakt in unserem eigenen Evaluierungsaufbau, das einen
Großteil des Rückstands von GPT-5.1 erklärt, und quantifizieren seine Auswirkung: Auf
den nicht betroffenen Instanzen erreicht GPT-5.1 0,574 EM; der Vergleich fällt weiterhin
klar zugunsten des feinabgestimmten Modells aus.
Insgesamt leistet diese Arbeit folgende Beiträge: (i) einen reproduzierbaren, auf SWDE
basierenden Tripel-Extraktionsdatensatz und eine Vorverarbeitungspipeline, die es ermöglicht,
alle oder nur ausgewählte Domänen zu verwenden, (ii) eine prädikatskonditionierte
Pointer-Architektur für MarkupLM, (iii) eine Zero-Shot-Evaluierung zweier aktueller
LLMs unter identischem Prompting auf denselben Testinstanzen samt einer Analyse des
Einflusses der Prompt-Konstruktion auf den gemessenen Abstand sowie (iv) eine Inferenz-
Toolchain für die praktische Extraktion von Tripeln aus beliebigen HTML-Dokumenten.