RAG, GraphRAG und was wir stattdessen bauen
Drei Wege, eine Frage zu den eigenen Dokumenten zu beantworten und warum der Unterschied zwischen ihnen keine Geschmacksfrage ist.
Fragen Sie einen KI-Anbieter, wie er Fragen zu Ihren Dokumenten beantwortet, kommen meist drei Antworten zurück: Retrieval-Augmented Generation, ein von einem LLM zur Indexierungszeit gebauter oder etwas, das als beides zugleich beschrieben wird. Im Verkaufsgespräch verschwimmen die Namen. Technisch sind das keine austauschbaren Systeme und der Unterschied ist keine Geschmacksfrage, er entscheidet, welchen Antworten Sie tatsächlich trauen können.
Drei Wege, dieselbe Frage zu beantworten
Vektor- zerteilt Ihre Dokumente, bettet die Abschnitte ein und ruft zur Abfragezeit die Abschnitte ab, die der Frage im Einbettungsraum am nächsten liegen. GraphRAG geht einen Schritt weiter: Ein LLM extrahiert aus dem Korpus einen Graphen aus Entitäten und Beziehungen, gruppiert verwandte Entitäten zu Communities und durchsucht diese Struktur statt flachen Texts. Wir bauen ein drittes System: eine OWL-, abgeleitet aus den Fragen, die das Unternehmen beantwortet haben muss, befüllt mit Entitäten, die gegen reale Identität aufgelöst sind, abgefragt über SPARQL. Alle drei lesen dieselben Dokumente. Wo sie aufhören, sich zu ähneln, zeigt sich erst, wenn man dieselbe Frage zweimal stellt.
Wo Ähnlichkeitssuche still versagt
Ein reales Beispiel: Hat die Brandschutztür im vierten Stock wirklich die Klasse T30 und welches Dokument belegt das? Fragen Sie ein Vektor--System, erhalten Sie je nachdem, welcher Abschnitt in diesem Durchlauf am nächsten eingebettet wurde, drei verschiedene Antworten: Ein Brandschutzbericht sagt T30, ein Lieferschein in der Nähe sagt T0, ein unzusammenhängender Absatz wird herangezogen, weil er ähnliches Vokabular verwendet. Fragen Sie fünf Minuten später erneut, kann sich die Rangfolge so verschieben, dass sich die Antwort ändert. Nichts ist defekt, das System tut genau das, was Nächste-Nachbarn-Suche tut. „Am nächsten im Einbettungsraum“ und „wahr“ sind zwei verschiedene Eigenschaften und nur eine davon ist das, was die Frage braucht.
Ein über denselben Dokumenten gebauter liefert eine Antwort: Tür T-04-117 ist im Brandschutzbericht, Seite 14, als T30 dokumentiert und mit -Element #4471 verknüpft und er macht sichtbar, dass ein nahegelegener Lieferschein dem widerspricht, denn der Graph behält beide Tatsachen und beide Quellen, statt den Widerspruch zu verwerfen. Fragen Sie einmal oder hundertmal, der Traversierungsweg ist derselbe, also ist die Antwort dieselbe.
Was GraphRAG richtig macht und wo es aufhört
Graphbasiertes ist eine echte Verbesserung gegenüber flachem , kein bloßes Rebranding. Entitäten und Beziehungen in einem Graphen zu extrahieren, verwandte Entitäten zu Communities zusammenzufassen für übergeordnete „globale“ Abfragen neben entitätsverankerter „lokaler“ Suche, schlägt Chunk-Retrieval nachweisbar bei Multi-Hop-Fragen, also solchen, deren Antwort zwei oder drei Dokumente verbindet statt nur das eine ähnlichste zu finden.
Die Grenze liegt darin, woraus der Graph gebaut ist. Er wird bei jedem Indexierungslauf neu von einem LLM extrahiert, aus dem, was das Modell in diesem Moment im Text bemerkt. Es gibt keine , die festlegt, was eine Klasse oder eine Beziehung bedeuten darf, keine Garantie für Entity Resolution, dass derselbe in fünf Dokumenten genannte Lieferant zu einem Knoten statt zu fünf wird, und keine Versionsgeschichte: Indexieren Sie denselben Korpus neu, kann der entstehende Graph strukturell anders sein, ohne Aufzeichnung, was sich geändert hat oder warum. Er erbt die Unsicherheit der Extraktion, ohne sie ausdrücken zu können.
Was „gepflegt“ in der Praxis heißt
Der Unterschied ist eine Eigenschaft, die sich testen lässt, keine Behauptung, der man glauben muss. Stellen Sie einem gepflegten Graphen dieselbe Frage zweimal, ein Jahr auseinander, erhalten Sie dieselbe Antwort, belegt mit derselben Quelle oder eine Änderung, auf die Sie zeigen können, ein aktualisiertes Dokument, eine neue -Version, keine stille Drift. Entity Resolution passiert einmal, als modellierter Schritt, sodass „Müller GmbH“ und „Müller GmbH, Niederlassung Stuttgart“ zu einem Knoten mit definierter Beziehung zusammenfallen, statt zwei unverbundene Erwähnungen zu bleiben. Jede Tatsache trägt, woher sie kommt: das Dokument, die Seite und wie sicher die Extraktion war.
Wo welches Werkzeug hingehört
Nichts davon macht Vektor- oder GraphRAG zum falschen Werkzeug. Für „Fassen Sie zusammen, was sich in diesem Vertrag geändert hat“ oder „Finden Sie Dokumente wie dieses“ über einen unübersichtlichen, unstrukturierten Korpus, ohne Modellierungsaufwand, sind sie das richtige. Wofür sie nicht gebaut sind, ist „Listen Sie jede Maschine, die dieses zurückgerufene Teil enthält, und wen ich zu jeder anrufen muss“ oder „Hatte diese Tür schon immer die Klasse T30 und wer hat das bestätigt“: Fragen, die exakt, vollständig und beim zehnten Fragen genauso beantwortet sein müssen wie beim ersten. Das ist eine Routing-Entscheidung zwischen zwei tatsächlich verschiedenen Werkzeugen, keine Behauptung, dass eines das andere ersetzt.
Bei einem vergleichbaren Benchmark für strukturierte Abfragen erreichte GPT-4 mit direktem Zugriff auf ein rohes Schema 16 % Genauigkeit. Dasselbe Modell erreichte, antwortend über eine -Repräsentation derselben Daten, 54 % (Sequeda et al., 2023). Das Modell war dasselbe; der Unterschied lag in der Grundlage, auf der es antworten durfte.
Mehr aus dem Blog
