14.09.2026, 13:00 Uhr
Universität Wien
Besprechungsraum 4.34
Währinger Str. 29
1090 Wien
Titel: Efficient and Secure Deep Learning Image Descriptors
Kurzfassung:
Merkmalbasierte visuelle Lokalisierungssysteme stützen sich zunehmend auf cloudbasierte Pipelines,
in denen Edge-Geräte extrahierte Schlüsselpunkte und Deskriptoren an Remote-Server übertragen, um
die Position und Ausrichtung einer Kamera innerhalb einer Umge-bung zu schätzen. Obwohl
Schlüsselpunkte und ihre Deskriptoren nicht direkt für Menschen lesbar sind, haben jüngste
Inversionsangriffe gezeigt, dass sie sensible visuelle Informationen preisgeben können, darunter
die Identität von Personen und den Inhalt von Szenen. Bestehende Ansätze zum Schutz der
Privatsphäre stützen sich in erster Linie auf eine nachträgliche Verschleierung von Deskriptoren
oder 3D-Kartenstrukturen. Da die sensiblen Informationen bereits vor der Anwendung jeglicher
Verschleierung in der Darstellung kodiert sind, behandeln solche Abwehrmaßnahmen eher das Symptom
als die Ursache – wodurch Systeme Angreifern ausgesetzt bleiben, die das ausnutzen können, was die
Darstellung bereits enthält.
Diese Arbeit stellt Misanthrope vor, einen privatsphäreerhaltend Schlüsselpunktdetek-tor, der
darauf ausgelegt ist, datenschutzrelevante Informationen bereits an der Quelle zu unterdrücken.
Anstatt Merkmale erst nach der Extraktion zu verschleiern, wird Mis-anthrope mithilfe eines
Selbstdestillations-Frameworks trainiert, um die Erkennung von Schlüsselpunkten an Personen zu
vermeiden, die in den meisten Lokalisierungsszenarien die vorherrschende Quelle privater
Informationen darstellen. Ein „Teacher“-Netzwerk erzeugt Schlüsselpunkt-Aktivierungskarten, die
anhand von Personenmasken gefiltert werden, und ein architektonisch identisches „Student“-Netzwerk
lernt diese gefilterten Vorhersagen mittels KL-Divergenz-Supervision ein, wodurch die Vermeidung
von Per-sonen verinnerlicht wird, ohne dass bei der Inferenz ein separates Segmentierungsmodell
erforderlich ist.
Experimentelle Auswertungen zeigen, dass Misanthrope den Privatsphäreverlust bei Angriffen durch
Merkmalsinversion erheblich reduziert. Bei einem geringen Keypoint-Budget von 0,27% der Bildpixel –
der Einstellung, die für ressourcenbeschränkte Edge-Bereitstellungen am repräsentativsten ist –
sinkt die Recall-Rate bei der Personenerken-nung aus rekonstruierten Bildern von 63,44% für die
State-of-the-Art-Baseline DeDoDe (Edstedt et al., 2024) auf 2,74%, und die Genauigkeit bei der
Personenwiedererkennung sinkt von 28,25% auf 1,94%, wobei auch bei höheren Extraktionsbudgets von
bis zu 1,07% der Pixel ein bedeutender Datenschutzvorteil erhalten bleibt. Gleichzeitig bewahrt
Misanthrope die Lokalisierungsleistung – und verbessert sie in Szenen mit vielen Personen sogar.
Beim „Image Matching Challenge 2021 Phototourism“-Benchmark (Gou et al., 2017) erzielt es in 7 von
9 Szenen die beste Leistung unter den Extraktoren für spärliche Merkmale und reduziert gleichzeitig
den Translationsfehler im Wild-SLAM-Datensatz Zheng et al. (2025) für die Innenraum-Odometrie.
Diese Ergebnisse zeigen, dass die Vermeidung von Merkmalen bei Personen den Verlust
an Privatsphäre auf ein vernachlässigbares Maß reduziert und gleichzeitig die Abgleich-leistung in
Szenen mit menschlichen Störfaktoren verbessert, was darauf hindeutet, dass der Schutz der
Privatsphäre und die Lokalisierungsgenauigkeit durch die Gestaltung von
Merkmalen auf Quellenebene gemeinsam optimiert werden können.