- AutorIn
- Marc Laurin Remane
- Titel
- Erkennung von Mensch-Objekt-Interaktionen auf omnidirektionalen Bildaufnahmen
- Zitierfähige Url:
- https://nbn-resolving.org/urn:nbn:de:bsz:l189-qucosa2-962682
- Datum der Einreichung
- 03.03.2025
- Abstract (DE)
- Die automatische Erkennung von Mensch-Objekt-Interaktionen (HOI) spielt eine zentrale Rolle in der Mensch-Computer-Interaktion, der Verhaltenanalyse und zahlreichen KI-Anwendungen. Während aktuelle HOI-Methoden überwiegend auf rektilinearen Bildern trainiert wurden, gewinnen omnidirektionale Kameras mit Fischaugenobjektiven zunehmend an Bedeutung, da sie mit ihrem extrem weiten Sichtfeld deutlich größere Räume abdecken können, als hermkömmliche Kameras. Allerdings führen die starken optischen Verzerrungen dieser Objektive dazu, dass herkömmliche Computer-Vision-Algorithmen oft unzuverlässige Ergebnisse liefern. Diese Arbeit untersucht, inwiefern bestehende Methoden zur Erkennung von Mensch-Objekt-Interaktionen an die besonderen Eigenschaften von Fischaugenaufnahmen angepasst werden können. Durch den Einsatz von Transferlernen wurde ein bestehendes HOI-Modell auf zwei speziell erstellte Datensätze trainiert. Zudem wurde eine Annotationssoftware entwickelt, welches eine effiziente Beschriftung von Mensch-Objekt-Interaktionen ermöglicht und der Forschungsgemeinschaft zur Verfügung steht. Die experimentellen Ergebnisse zeigen, dass HOI-Modelle durch Transferlernen erfolgreich an die Verzerrungen omnidirektionaler Bilder angepasst werden können, wodurch eine Erkennungsgenauigkeit von bis zu 85% erreicht wurde.
- Abstract (EN)
- Human-object interaction (HOI) detection plays an important role in human-computer interaction, action analysis, and a wide range of AI-driven applications. While current HOI methods are mainly trained on perspective images, omnidirectional cameras are gaining importance due to their ultra-wide field of view, enabling coverage of significantly larger spaces compared to conventional cameras. However, the optical distortions inherent to fisheye lenses often cause traditional computer vision algorithms to produce unreliable results. This thesis explores how existing HOI detection methods can be adapted to address the unique challenges of fisheye images. Using the method of transfer learning, an established HOI model was fine-tuned on two custom datasets. Additionally, an annotation tool was developed for the labeling of HOI triplets, which has been made publicly available to support the research community. Experimental results demonstrate that HOI models can be successfully adapted to handle distortions in omnidirectional images through transfer learning, achieving a detection accuracy of up to 85%. This work highlights the feasibility of bridging the gap between conventional HOI frameworks and the demands of fisheye-based vision systems.
- Freie Schlagwörter (DE)
- Mensch-Objekt-Interaktion, Bilderkennung, Echtzeitsystem, Computer Vision, Omnidirektionale, Bildaufnahmen, Fischaugenobjektiv, Transformer
- Freie Schlagwörter (EN)
- Human-object interaction, image detection, real-time system, computer vision, omnidirectional images, fisheye lens, transformer
- Den akademischen Grad verleihende / prüfende Institution
- Hochschule für Technik, Wirtschaft und Kultur Leipzig, Leipzig
- Sonstige beteiligte Institution
- ScaDS.AI Dresden/Leipzig, Leipzig
- Version / Begutachtungsstatus
- angenommene Version / Postprint / Autorenversion
- URN Qucosa
- urn:nbn:de:bsz:l189-qucosa2-962682
- Veröffentlichungsdatum Qucosa
- 17.03.2025
- Dokumenttyp
- Bachelorarbeit
- Sprache des Dokumentes
- Deutsch
- Lizenz / Rechtehinweis
CC BY 4.0- Inhaltsverzeichnis
1 Einleitung 1.1 Problemstellung 1.2 Zielsetzung 1.3 Forschungsfragen 2 Grundlagen 2.1 Mensch-Objekt-Interaktion 2.2 Verfahren für die HOI-Erkennung 2.2.1 Zweistufige Verfahren 2.2.2 Einstufige Verfahren 2.2.3 End-To-End Verfahren 2.2.4 Übersicht 2.3 Datensätze 2.3.1 HICO-DET 2.3.2 V-COCO 2.3.3 360Action 2.4 Augmentierungsmethoden 2.5 Faltungsnetze 2.6 Transferlernen 3 Verwandte Arbeiten 3.1 HOI-Erkennung in Echtzeit 3.2 HOI-Erkennung in 360° Aufnahmen 3.3 Transferlernen auf Fischaugenbildern 4 Auswahl des Modells 4.1 HoiTransformer 4.1.1 Backbone 4.1.2 Encoder 4.1.3 Decoder 4.1.4 Prediction Head 5 Datenerzeugung 5.1 Fischaugen-HOI-Datensatz 5.2 Datenaugmentierung 5.3 Annotationssoftware 5.3.1 HOI-Det-UI 5.3.2 HOI Labeling Tool 6 Methode 6.1 Daten 6.2 Evaluierungsmetrik 6.3 Trainingsaufbau 7 Ergebnisse und Auswertung 7.1 Quantitative Ergebnisse 7.2 Qualitative Ergebnisse 8 Schluss 8.1 Fazit 8.2 Ausblick