Eingabehilfen öffnen
Zum Hauptinhalt springen

Semi-automatisierte Dokumentenaufbereitung für den LLM-Einsatz

Entwicklung eines RAG-basierten Assistenzsystems für technische Dokumentationen 

Im Rahmen eines Digitalisierungsprojekts unterstützten die Experten des Mittelstand-Digital Zentrum Hamburg bei der Anforderungserhebung, der technischen Konzeption und der prototypischen Entwicklung eines Retrieval-Augmented-Generation-Systems bei der DEOS AG. Ein besonderer Schwerpunkt lag dabei auf der automatisierten Aufbereitung der bestehenden Dokumente als Grundlage für eine zuverlässige Suche. 

Ausgangslage

Die DEOS AG entwickelt Lösungen für die Gebäudeautomation und stellt ihren Kund:innen umfangreiche technische Dokumentationen zu ihren Produkten und Systemen zur Verfügung. Diese umfassen unter anderem Bedienungsanleitungen, technische Handbücher, Produktinformationen und weitere unterstützende Unterlagen. Auch intern werden diese Dokumentationen von verschiedenen Bereichen genutzt.

Die benötigten Informationen sind grundsätzlich vorhanden, jedoch auf zahlreiche und teilweise sehr umfangreiche Dokumente verteilt. Bei konkreten Fragestellungen müssen daher häufig mehrere Dokumente durchsucht werden. Dies kann insbesondere dann zeitaufwendig sein, wenn sich relevante Informationen über verschiedene Dateien oder Abschnitte verteilen. Auch ähnliche Angaben in mehreren Dokumenten erschweren die Suche, da zunächst festgestellt werden muss, auf welches Produkt, welche Produktgruppe oder welche Systemversion sich die jeweilige Information bezieht.

Die Dokumente werden überwiegend in einem internen Dokumentenmanagementsystem bereitgestellt und liegen hauptsächlich als PDF- und Word-Dateien vor. Obwohl die Dokumentationen vergleichbar aufgebaut sind, unterscheiden sich einzelne Dateien beispielsweise hinsichtlich der Formatierung von Tabellen, Überschriften und Seitenlayouts. Solche Unterschiede erschweren eine einheitliche automatisierte Verarbeitung. Insbesondere Tabellen enthalten zahlreiche wichtige technische Angaben, lassen sich jedoch häufig nicht mit einfachen Verfahren zuverlässig aus den Dokumenten extrahieren.

Mit dieser Basis nahm das Unternehmen im Anschluss an eine Veranstaltung Kontakt mit uns auf und wir entwickelten ein Konzept. Grundidee war es, die Möglichkeiten eines quellengestützten Assistenzsystems auf Basis eines Large Language Models zu untersuchen. Ein solches System sollte Nutzer:innen ermöglichen, Fragen in natürlicher Sprache zu stellen und schnell eine präzise Antwort aus den vorhandenen technischen Dokumentationen zu erhalten.


Herausforderungen

Eine zentrale Herausforderung bestand in der Größe und Struktur des vorhandenen Dokumentenbestands. Relevante Informationen konnten sich an unterschiedlichen Stellen befinden und über mehrere Dokumente verteilt sein. Gleichzeitig enthielten verschiedene Dokumente teilweise ähnliche Angaben, die sich jedoch auf unterschiedliche Produkte, Kategorien oder Produktversionen bezogen. Eine rein stichwortbasierte Suche konnte diese Zusammenhänge nur eingeschränkt berücksichtigen.

Retrieval-Augmented Generation (RAG)

Durch RAG-Systeme werden den Problemen, die bei großen Sprachmodellen bei der Verarbeitung von großer Textmengen entstehen, entgegengewirkt. RAG verbindet eine Suchfunktion mit einem Large Language Model. Statt eine Antwort ausschließlich aus dem im Sprachmodell gespeicherten Wissen zu erzeugen, sucht das System zunächst gezielt nach relevanten Informationen in einer bereitgestellten Wissensbasis. Diese gefundenen Textstellen werden dem Sprachmodell anschließend als Kontext für die Antwort zur Verfügung gestellt. Dadurch können Antworten auf unternehmensspezifischen Dokumenten basieren und mit den zugrunde liegenden Quellen verknüpft werden.

Als Ausgangslage im Projekt dienten die technischen Dokumentationen des Unternehmen als Wissensbasis.

Die erste Hürde, die durch die Größe und Struktur der dieser Daten entstand: Auch ein übliches RAG-Verfahren, bei dem Dokumente in gleich große Textabschnitte aufgeteilt werden, war für den vorliegenden Anwendungsfall nur bedingt geeignet. Bei diesem Trennen von Textabschnitten, dem sogenannten Chunking, können inhaltlich zusammengehörige Informationen getrennt werden. Ebenso können Überschriften und übergeordnete Zusammenhänge verloren gehen. Ein einzelner gefundener Abschnitt enthält dann möglicherweise zwar die gesuchte technische Angabe, jedoch nicht mehr die Information, auf welches Produkt oder welche Produktgruppe sich diese Angabe bezieht.

Eine weitere Herausforderung war die zuverlässige Verarbeitung der unterschiedlichen Dateiformate. Neben maschinenlesbarem Text enthielten die Dokumente Tabellen, Bilder, Kopf- und Fußzeilen, Inhaltsverzeichnisse sowie weitere wiederkehrende Gestaltungselemente. Teilweise war eine optische Zeichenerkennung erforderlich, um Inhalte aus den Dateien auszulesen. Fehler bei diesem ersten Verarbeitungsschritt wirken sich direkt auf alle nachfolgenden Schritte aus: Nicht erkannte oder falsch zugeordnete Informationen können später weder zuverlässig gefunden noch korrekt beantwortet werden.

Besonders anspruchsvoll war die Verarbeitung von Tabellen. Technische Eigenschaften werden häufig in tabellarischer Form dargestellt, wobei die Bedeutung einzelner Werte erst durch die zugehörigen Spalten, Zeilenüberschriften und Produktbezeichnungen verständlich wird. Beim einfachen Auslesen können diese Beziehungen verloren gehen. Die Tabellen mussten daher möglichst strukturiert erfasst und für die weitere Verarbeitung aufbereitet werden.

Darüber hinaus sollte das System Antworten ausschließlich auf Grundlage der bereitgestellten Dokumentationen erzeugen. Nicht belegbare oder vom Sprachmodell ergänzte Aussagen sollten möglichst vermieden werden. Gleichzeitig musste nachvollziehbar bleiben, aus welchen Dokumenten und von welchen Seiten die verwendeten Informationen stammten.


Vorgehen & Ergebnisse

Zu Beginn des Projekts wurden gemeinsam mit der DEOS AG die bestehende Ausgangssituation und die zentralen Probleme bei der Dokumentensuche untersucht. Darauf aufbauend wurden die Anforderungen an ein RAG-basiertes Assistenzsystem erhoben. Als besonders relevant wurden eine hohe Antwortgenauigkeit, nachvollziehbare Quellenangaben und eine möglichst schnelle Bereitstellung der gesuchten Informationen identifiziert.

Anschließend wurde ein erster vollständiger RAG-Prototyp entwickelt. Dieser ermöglichte es, Dokumente zu verarbeiten, Nutzerfragen entgegenzunehmen, passende Textstellen aus einer Wissensdatenbank abzurufen und daraus eine Antwort zu erzeugen. Der Prototyp wurde in Python unter Verwendung bekannter modularer Komponenten aus einem Open-Source-Framework fürs Arbeiten mit Sprachmodellen und weiterer Werkzeugen zur Dokumentenverarbeitung umgesetzt. Zur Speicherung und semantischen Suche der aufbereiteten Inhalte wurde eine Vektordatenbank eingesetzt.

Während der prototypischen Entwicklung zeigte sich, dass die Qualität der erzeugten Antworten wesentlich von der Aufbereitung der Ausgangsdokumente abhängig war. Der Schwerpunkt des Projekts wurde deshalb zunehmend auf die Entwicklung und Untersuchung einer verbesserten Verarbeitungspipeline gelegt.

Sequenzielle Verarbeitungsstufen der Lösung
  1. Stufe 1
    Einlesen und Vereinheitlichung von PDF- und Word-Dokumenten
    1. Einsatz von Parsern und Verfahren zur optischen Zeichenerkennung.

    2. Unterteilung der Inhalte in kleinere, für die Suche geeignete Abschnitte.

    3. Hinzufügen von Metadaten wie Dokumentname, Seite, Produkt und Abschnitt.

  2. Stufe 2
    Weiterentwickelte Verarbeitungspipeline
    1. Zusammenfassung von einzelnen Textabschnitten auf ihrer jeweiligen Ebene.

    2. Diese Ergebnisse werden schrittweise erneut verarbeitet, bis übergeordnete Zusammenfassungen für Kategorien und Produktgruppen entstehen.

    3. Daraus entsteht eine hierarchische Zusammenführung und Verdichtung von extrahierten Informationen innerhalb definierter Produktklassen und Kategorien.

Die entwickelte Lösung besteht aus zwei aufeinander aufbauenden Verarbeitungsstufen. In der ersten Stufe werden PDF- und Word-Dokumente eingelesen und vereinheitlicht. Hierfür werden sowohl klassische Parser, also Programme zum Auslesen von Daten und Erkennen derer Bestandteile für die Weiterverarbeitung, als auch Verfahren zur optischen Zeichenerkennung eingesetzt. Anschließend werden die Inhalte in kleinere, für die Suche geeignete Abschnitte unterteilt und mit Metadaten wie Dokumentname, Seite, Produkt und Abschnitt versehen. 

Diese grundlegende Verarbeitung erzeugt eine möglichst saubere und nachvollziehbare Datenbasis. Die ursprüngliche Position eines Inhalts innerhalb des Dokuments bleibt dabei erhalten, sodass gefundene Informationen später wieder ihrer Quelle zugeordnet werden können. 

In der zweiten Stufe kommt eine weiterentwickelte Verarbeitungspipeline zum Einsatz. Dabei werden die extrahierten Informationen innerhalb definierter Produktklassen und Kategorien hierarchisch zusammengeführt und verdichtet. Einzelne Textabschnitte werden zunächst auf ihrer jeweiligen Ebene zusammengefasst. Darauf aufbauend werden die Ergebnisse schrittweise erneut verarbeitet, bis übergeordnete Zusammenfassungen für Kategorien und Produktgruppen entstehen. 

Vereinfacht lässt sich dieses Vorgehen mit einer geordneten Ablagestruktur vergleichen: Anstatt bei jeder Frage sämtliche Seiten aller Handbücher einzeln zu durchsuchen, erstellt das System zunächst strukturierte Übersichten über einzelne Themen, Produkte und Produktgruppen. Bei einer Suchanfrage kann dadurch zuerst der passende Bereich identifiziert werden. Anschließend werden gezielt die dazugehörigen Detailinformationen und Originalquellen abgerufen. 

Die Verdichtung erfolgt rekursiv, da die Zusammenfassungen einer Ebene jeweils als Grundlage für die nächsthöhere Ebene dienen. Gleichzeitig bleiben Verknüpfungen zu den ursprünglichen Dokumentabschnitten erhalten. Dadurch können Informationen aus mehreren Dokumenten miteinander in Beziehung gesetzt werden, ohne dass die Originalquellen verloren gehen. 

Dieser Ansatz ist insbesondere relevant, wenn gleiche Begriffe oder technische Werte in unterschiedlichen Zusammenhängen auftreten. Durch die Zuordnung zu Produktklassen, Kategorien und gegebenenfalls Produktversionen erhält das System zusätzlichen Kontext. Die Wahrscheinlichkeit wird damit reduziert, dass eine zwar sprachlich passende, fachlich jedoch unzutreffende Textstelle für die Antwort verwendet wird. 

Für unterschiedliche Verarbeitungsschritte wurden verschiedene Large Language Models untersucht. Dabei wurde zwischen leistungsfähigen, aber kostenintensiveren Modellen und kleineren, wirtschaftlicher einsetzbaren Modellen unterschieden. Nicht jeder Verarbeitungsschritt erforderte die gleiche Modellleistung. Einfache Aufgaben wie die Klassifikation oder formale Aufbereitung von Inhalten konnten durch kleinere Modelle übernommen werden, während komplexere Verdichtungen oder Qualitätsprüfungen leistungsfähigere Modelle erforderten. Auf diese Weise wurde untersucht, wie sich Genauigkeit und laufende Kosten sinnvoll miteinander verbinden lassen. 

LLM as a Judge

Dabei wird ein Sprachmodell nicht zur eigentlichen Beantwortung einer Frage eingesetzt, sondern zur Bewertung der Ergebnisse eines anderen Verarbeitungsschritts. Im Projekt wurde dieses Verfahren genutzt, um automatisch zu prüfen, ob erzeugte Zusammenfassungen die wesentlichen Informationen korrekt enthalten und keine relevanten Inhalte verfälschen. Eine solche Bewertung kann insbesondere bei großen Mengen automatisch erzeugter Texte helfen, Qualitätsprobleme frühzeitig zu erkennen. Die abschließende Antwortqualität wurde im Projekt zusätzlich anhand exemplarischer Fragen qualitativ beurteilt.

Die Qualität der Verarbeitung wurde anhand verschiedener Kriterien betrachtet. Hierzu wurden von den Expert:innen aus dem Unternehmen und dem Mittelstand-Digital Zentrum Hamburg die Genauigkeit des Retrievals, die Präzision der erzeugten Verdichtungen und der erforderliche Tokenverbrauch festgelegt. Zur automatisierten Bewertung der Zusammenfassungen wurde ergänzend ein weiteres Sprachmodell als bewertende Instanz eingesetzt. Dieses sogenannte „LLM as a Judge“-Verfahren prüfte, ob wesentliche Informationen korrekt und ohne inhaltliche Verfälschung in den verdichteten Darstellungen enthalten waren. Die abschließende Antwortqualität wurde zusätzlich anhand exemplarischer Fragen qualitativ beurteilt. 

Um die Nachvollziehbarkeit der Antworten sicherzustellen, wurden die gefundenen Informationen nicht nur als allgemeine Quellenliste ausgegeben. Einzelne Informationen konnten mit konkreten Verweisen auf die zugrunde liegenden Dokumente und Seiten verbunden werden. Ähnlich wie bei wissenschaftlichen Zitaten konnten dadurch auch mehrere Quellen für eine Aussage angegeben werden. Nutzer:innen konnten somit erkennen, auf welchen Dokumentstellen eine Antwort beruhte. 

Die Entwicklung erfolgte iterativ. Zwischenergebnisse wurden fortlaufend getestet und die Verarbeitungsschritte entsprechend der identifizierten Anforderungen angepasst. Am Projektende wurde dem Partnerunternehmen ein funktionsfähiger Prototyp übergeben. Die weitere Integration in die unternehmenseigene Systemumgebung erfolgt durch die DEOS AG. 


Erkenntnisse

Im Projekt zeigte sich, dass die Qualität eines RAG-basierten Assistenzsystems maßgeblich von der vorgelagerten Dokumentenverarbeitung bestimmt wird. Auch ein leistungsfähiges Sprachmodell kann fehlerhaft erkannte Tabellen, fehlende Überschriften oder falsch zugeordnete Textabschnitte nicht zuverlässig ausgleichen. Die korrekte Extraktion, Bereinigung und Strukturierung der Dokumente ist daher unabhängig von der später verwendeten RAG-Architektur die wichtigste technische Grundlage. 

Insbesondere die optische Zeichenerkennung und das Verarbeiten (Parsing) komplexer Dokumente erwiesen sich als zentrale Herausforderungen. Unterschiedliche Tabellenformatierungen, wiederkehrende Seitenbestandteile und umfangreiche Dokumentstrukturen müssen bereits bei der Datenaufbereitung berücksichtigt werden. Dieser Aspekt ist nicht nur für die DEOS AG relevant, sondern stellt bei vielen kleinen und mittleren Unternehmen mit historisch gewachsenen Dokumentenbeständen eine typische Herausforderung dar. 

Die Untersuchungen zeigten zudem, dass Chunking mit klassischen Verfahren als Ansatz für RAG-Systeme bei umfangreichen technischen Dokumentationen nur eingeschränkt ausreicht. Durch die Aufteilung in einzelne Abschnitte können wichtige übergeordnete Zusammenhänge verloren gehen. Dies betrifft insbesondere Fälle, in denen technische Angaben erst gemeinsam mit Informationen zu Produktgruppe, Kategorie oder Version eindeutig werden. 

Die rekursive hierarchische Verdichtung kann diese Einschränkung reduzieren. In den prototypischen Tests führte die strukturierte Aufbereitung zu einer höheren Präzision der Antworten und ermöglichte es, für eine Anfrage gezielter relevante Informationen abzurufen. Gleichzeitig wurden weniger Text beziehungsweise weniger Tokens an das antwortgenerierende Sprachmodell übergeben. Dadurch kann neben einer verbesserten Antwortqualität langfristig auch eine Verringerung der laufenden Nutzungskosten erreicht werden, während die Initialkosten zur Erstellung der Verdichtung aber erhöht sind. 

Ein weiterer Vorteil bestand darin, dass mehrere Quellen für einzelne Aussagen berücksichtigt werden konnten. Informationen, die sich über unterschiedliche Dokumente verteilen oder gegenseitig ergänzen, konnten gemeinsam in die Antwort einfließen und jeweils mit ihren Ursprungsquellen verknüpft werden. Dies verbessert die Nachvollziehbarkeit und erleichtert die fachliche Überprüfung der Ergebnisse. 

Der zusätzliche Aufwand einer hierarchischen Verdichtung ist jedoch nicht für jeden Dokumentenbestand gleichermaßen sinnvoll. Bei kleinen Datenmengen oder kurzen, bereits klar strukturierten Dokumenten können die Kosten der zusätzlichen Verarbeitung den erzielbaren Nutzen übersteigen. Der Ansatz eignet sich daher vor allem für größere Dokumentenbestände, in denen Informationen über viele Dateien, Produkte und Kategorien verteilt sind. 

Auch die Auswahl der eingesetzten Sprachmodelle sollte sich am jeweiligen Verarbeitungsschritt orientieren. Der Einsatz eines besonders leistungsfähigen Modells für sämtliche Aufgaben wäre technisch möglich, jedoch wirtschaftlich nicht immer sinnvoll. Durch die gezielte Kombination unterschiedlicher Modelle können einfache Verarbeitungsschritte kostengünstig durchgeführt werden, während höhere Modellleistung nur für komplexe Aufgaben eingesetzt wird. 

Kurzzusammenfassung der Erkenntnisse
  • Datenqualität ist entscheidend

    Eine gute Dokumentenaufbereitung ist die wichtigste Grundlage für ein zuverlässiges RAG-System.

  • Chunking als RAG-System-Ansatz hat Grenzen

    Bei komplexen Dokumenten können wichtige Zusammenhänge verloren gehen.

  • Hierarchische Verdichtung verbessert die Ergebnisse

    Sie erhöht die Antwortqualität und reduziert gleichzeitig den Token-Verbrauch.

  • Quellenübergreifende Informationen erhöhen die Nachvollziehbarkeit:

    Mehrere Dokumente können für eine Antwort zusammengeführt und mit ihren Ursprungsquellen verknüpft werden.

  • Der Ansatz eignet sich vor allem für große Dokumentenbestände

    Bei kleinen oder bereits gut strukturierten Beständen kann der zusätzliche Aufwand zu hoch sein.

  • Praxistests sind der nächste Schritt

    Die Integration in bestehende Systeme und Tests mit realen Nutzer:innen sollen die Praxistauglichkeit weiter überprüfen.

Für einen produktiven Einsatz sind im nächsten Schritt die Integration des Prototyps in die unternehmenseigenen Systeme und weiterführende Tests mit realen Nutzer:innen erforderlich. Dabei sollte insbesondere untersucht werden, wie externe Kundinnen, Supportmitarbeitende und weitere interne Bereiche das Assistenzsystem im Arbeitsalltag verwenden. Die Ergebnisse dieser Tests können als Grundlage dienen, um die Benutzerführung, die Qualität der Antworten und die Aufbereitung neuer oder aktualisierter Dokumente weiterzuentwickeln. 


Sie haben Fragen zu diesem Projekt?

Wir freuen uns auch über eine Nachricht an:

Mittelstand-Digital Zentrum Hamburg
mittelstand-digital@haw-hamburg.de

Haben wir Ihr Interesse geweckt?

Wir bieten weitere Angebote zum Thema Digitalisierung und KI an.
Schauen Sie gerne in unsere Veranstaltungen rein.

Das Mittelstand-Digital Zentrum Hamburg gehört zu Mittelstand-Digital. Mit dem Mittelstand-Digital Netzwerk unterstützt das Bundesministerium für Wirtschaft und Energie die Digitalisierung in kleinen und mittleren Unternehmen und dem Handwerk. Kommen Sie gern auf uns zu, wir bringen Sie Digital Voraus!