Bachelorarbeit
Information Retrieval für eine Web Suchmaschine mithilfe von neuronalen Netzen und klassischen Methoden
Eckdaten
- Autor
- Lucas Imhof
- Hochschule
- Hochschule Merseburg
- Fachbereich
- Fachbereich Ingenieur- und Naturwissenschaften
- Erstprüfer
- Prof. Dr. rer. pol. Uwe Schröter
- Zweitprüfer
- Prof. Dr. rer. nat. habil. Dr. phil. Michael Schenke
- Abgabe
- 11. März 2019
- Veröffentlicht
- 28. März 2019
- Umfang
- 102 Seiten
- Sprache
- Deutsch
- Herausgeber
- Hochschulbibliothek, Hochschule Merseburg
- Handle
- 1981185920/13836
- PPN
- 1662878591
- Lizenz
- CC BY 4.0
- Schlagwörter
- Information Retrieval · Retrieval-System · Suchmaschine · Bildersuche
Abstract
Die vorliegende Bachelorarbeit befasst sich mit dem Information Retrieval für eine Web Suchmaschine. Die Qualität der durch das Information Retrieval gesammelten Daten bestimmt maßgeblich die Effizienz der Suchmaschine, die mithilfe dieser Daten einem Anwender Suchergebnisse liefern soll. Qualität bedeutet, dass ein Anwender ein Ergebnis erhält, welches für seine aktuelle Aufgabe zielführend ist – also Daten, die sowohl thematisch wie auch inhaltlich zu seiner Suchanfrage passen und abhängig von verschiedenen Faktoren korrekt priorisiert sind. Eine besondere Herausforderung stellt dabei die Bildersuche dar, da bei dieser nicht einfach nach Schlagworten gesucht werden kann, sondern der Inhalt des Bildes zunächst vom Information-Retrieval-System analysiert und kategorisiert werden muss.
Parallel zu dieser schriftlichen Arbeit ist ein Prototyp für eine Suchmaschine entstanden. Dieser Prototyp besteht aus einem Crawler-Netzwerk, welches Informationen von Webseiten, Bildern oder auch Dokumenten extrahiert und diese mithilfe eines Servers in einer Datenbank abspeichert. Zudem besteht der Prototyp aus einer Suchmaschine, mit der man nach Textfragmenten und Bildern suchen kann, die von dem Crawler-Netzwerk gefunden wurden.
In Zahlen
102
Seiten
6
Kapitel
26
Abbildungen
3
Tabellen
27
Code-Listings
7
Formeln
88
Quellen
Gliederung
Kapitelüberschriften im Original, Seitenzahlen wie im PDF.
Kernaussagen
- 1
Klassische Textanalyse reicht für die Phrasensuche – neuronale Netze lohnen sich dort erst mit Nutzungsdaten für ein personalisiertes Ranking.
- 2
Für die Bildersuche sind neuronale Netze unverzichtbar, weil nach dem Bildinhalt gesucht wird; Bildtitel und OCR-Text ergänzen das unzureichend trainierte Netz.
- 3
Die Kombination beider Ansätze ist der richtige Weg für eine Web-Suchmaschine.
- 4
Der Prototyp skaliert nur mit Clustering, strikter Kapselung der Module und einer temporären Link-Datenbank vor der Suchdatenbank.
- 5
Eine neue Suchmaschine für Europa müsste transparent, Open Source, werbefrei, spendenfinanziert und in Europa gehostet sein – und hätte trotzdem kaum eine Chance gegen die Marktführer.
Die Arbeit lesen
Die veröffentlichte Fassung, direkt von dieser Seite geladen (3,3 MB). Keine Verbindung zu Drittanbietern.
Offizielle Publikation
Die Arbeit ist im Open-Access-Repositorium der Universitäts- und Landesbibliothek Sachsen-Anhalt (Share_it) veröffentlicht und über DOI und URN dauerhaft zitierbar. Lizenz: Creative Commons Namensnennung 4.0.
Zitieren
APA
Imhof, L. (2019). Information Retrieval für eine Web Suchmaschine mithilfe von neuronalen Netzen und klassischen Methoden [Bachelorarbeit, Hochschule Merseburg]. Hochschulbibliothek Merseburg. https://doi.org/10.25673/13738
BibTeX
@thesis{imhof2019zypersearch,
author = {Imhof, Lucas},
title = {Information Retrieval f{\"u}r eine Web Suchmaschine mithilfe von neuronalen Netzen und klassischen Methoden},
type = {Bachelorarbeit},
school = {Hochschule Merseburg},
year = {2019},
month = mar,
doi = {10.25673/13738},
url = {https://opendata.uni-halle.de/handle/1981185920/13836},
note = {Lizenz: CC BY 4.0}
}