TATECHATLAS
◎ Deutsch
Künstliche Intelligenz

Verifizierung von RAG-Zitaten: Von der Quellenexistenz zur Belegprüfung

Ein Zitierbezeichner beweist nur, dass eine Quelle abgerufen wurde, nicht dass sie die Behauptung stützt. Dieser Artikel zeigt, wie Antworten zerlegt, Belegstellen lokalisiert und Abrufsprüfungen von Groundedness-Prüfungen getrennt werden.

Auf dieser Seite

Um RAG-Zitate zu verifizieren, muss zunächst die mechanische Prüfung, ob ein Quellenbezeichner existiert, von der semantischen Prüfung getrennt werden, ob die zitierte Passage die Behauptung tatsächlich stützt. Zerlegen Sie die Antwort in atomare Behauptungen, lokalisieren Sie den genauen Belegtext in jeder zitierten Quelle und beurteilen Sie die logische Folgerung (Entailment). Markieren Sie fehlende Belege und widersprüchliche Quellen. Verwenden Sie eine strukturierte Checkliste und beachten Sie, dass automatisierte Groundedness-Metriken subtile Unstimmigkeiten übersehen können.

Trennung von Verknüpfung und Beleg

Eine Quellenmarkierung muss geprüft werden. Sie beweist nicht, dass das Modell die richtige Passage abgerufen oder gelesen hat. Ordnen Sie die Markierung zunächst dem tatsächlich bereitgestellten Kontext zu und prüfen Sie, ob der bezeichnete Quellenausschnitt vorhanden ist. Prüfen Sie danach, ob er die konkrete Aussage stützt. Im hypothetischen Beispiel erlaubt Quelle A die Rückgabe unbenutzter Artikel innerhalb von 14 Tagen; Quelle B deckt Herstellungsfehler für 12 Monate ab. Die Aussage, alle benutzten Artikel seien erstattungsfähig, wird von Quelle A nicht gestützt, selbst wenn die Markierung korrekt aufgelöst wird.

Zerlegung der Antwort in Behauptungen

Um die Belege systematisch zu verifizieren, zerlegen Sie die Antwort in einzelne faktische Aussagen. Der Microsoft-Artikel zum Prompt Engineering empfiehlt, das Modell anzuweisen, für jede Behauptung die Quelle zu zitieren, was diese Dekomposition erleichtert. Für die Beispielantwort 'Sie können alle benutzten Artikel innerhalb von 30 Tagen erstatten' sind die atomaren Behauptungen 'alle benutzten Artikel erstatten' und 'innerhalb von 30 Tagen'. Jede Behauptung kann durch unterschiedliche Quellen gestützt werden oder durch gar keine. Die Zerlegung der Antwort in Behauptungen verhindert, dass eine teilweise gestützte Antwort als Ganzes akzeptiert wird. Nach der Dekomposition können Sie jede Behauptung unabhängig gegen ihre zitierte Quelle prüfen.

Lokalisierung der Belegpassage

Finden Sie für jede Behauptung den exakten Text in der zitierten Quelle, der sie stützen soll. Im Beispiel zitiert die Behauptung 'alle benutzten Artikel erstatten' Quelle A. Der Text von Quelle A lautet 'Unbenutzte Artikel können innerhalb von 14 Tagen zurückgegeben werden.' Es gibt keine Erwähnung von benutzten Artikeln, daher existiert keine Belegpassage. Die Behauptung 'unbenutzte Artikel können innerhalb von 14 Tagen zurückgegeben werden' unter Zitierung von Quelle A stimmt hingegen direkt mit dem Quelltext überein. Dieser Schritt erfordert das Lesen des Quelleninhalts und nicht nur die Prüfung, ob der Quellenbezeichner erscheint. Der Evaluierungsartikel beschreibt Groundedness-Berechnungen, die Natural Language Inference verwenden, um zu bestimmen, ob Behauptungen auf dem Kontext basieren, was diesen Abgleich bis zu einem gewissen Grad automatisiert.

Nachverfolgung gestützter und nicht gestützter Behauptungen

Im hypothetischen Beispiel stützt Quelle A die Aussage, dass unbenutzte Artikel innerhalb von 14 Tagen zurückgegeben werden können. Dieselbe Passage stützt nicht die Aussage, alle benutzten Artikel seien erstattungsfähig. Eine korrekte Quellenzuordnung beweist daher nicht, dass die Aussage aus der Passage folgt. Prüfen Sie jede Aussage einschließlich Bedingungen, Mengen und Fristen separat. Unterscheiden Sie eine unbelegte Erweiterung von einer Aussage, die dem Kontext ausdrücklich widerspricht.

Umgang mit fehlenden Belegen

Wenn eine Behauptung kein Zitat hat oder die zitierte Quelle keine relevanten Informationen enthält, handelt es sich um fehlende Belege. Der Prompt-Engineering-Artikel rät dazu, das Modell anzuweisen, anzugeben, welche Informationen fehlen, wenn der Kontext die Frage nicht vollständig beantwortet. Im Beispiel wäre die Behauptung 'alle benutzten Artikel erstatten' ohne stützende Quelle aufgrund fehlender Belege nicht belegt. Der Prüfer sollte dies markieren und prüfen, ob das Modell mit 'Ich weiß es nicht' oder einer Klarstellung geantwortet hätte. Die Evaluierungsmetrik 'Completeness' misst, ob alle Teile der Anfrage beantwortet wurden; eine Behauptung mit fehlenden Belegen kann die Vollständigkeit höher erscheinen lassen, als sie tatsächlich ist, während die Groundedness niedrig bleibt.

Umgang mit widersprüchlichen Quellen

Abgerufene Chunks können widersprüchliche Informationen enthalten. Der Prompt-Engineering-Artikel weist explizit an: 'Wenn die bereitgestellten Quellen widersprüchliche Informationen enthalten, präsentieren Sie beide Perspektiven und zitieren Sie die jeweiligen Quellen.' Wenn beispielsweise Quelle A Rückgaben innerhalb von 14 Tagen und Quelle B innerhalb von 30 Tagen nennt, sollte die Antwort beides anerkennen. Wenn die Antwort stillschweigend eine Quelle auswählt, ist dies ein Groundedness-Problem, da ein Teil des Kontextes ignoriert wird. Die Korrektheitsmetrik des Evaluierungsartikels kann beeinträchtigt werden, wenn die Antwort die falsche Quelle wählt. Prüfen Sie bei der Überprüfung, ob die Antwort den Konflikt transparent darstellt oder ihn ohne Begründung auflöst.

Erstellung einer praktischen Prüfliste

Notieren Sie für jede Aussage die Quellenmarkierung, die genaue Passage und Ihr Urteil zur Unterstützung. Unterscheiden Sie fehlende oder irrelevante Quellen von vorhandenen Passagen, die die Aussage nicht stützen. Halten Sie bei widersprüchlichen Quellen den Konflikt fest und prüfen Sie, ob die Antwort ihn erklärt. Die Prüfliste am Ende des Leitfadens fasst diese Schritte zusammen.

Grenzen automatisierter Verifizierer verstehen

Automatische Prüfungen können unbelegte Aussagen erkennen, doch ein Bewertungswert ist keine Garantie. Eine geänderte Bedingung, eine Verneinung oder eine falsche Frist kann übersehen werden. Kontextbezug und sachliche Richtigkeit beantworten zudem unterschiedliche Fragen: Eine Antwort kann eine falsche oder veraltete Quelle getreu wiedergeben und trotzdem auf ihr beruhen. Umgekehrt kann eine richtige Information außerhalb des bereitgestellten Kontextes dort unbelegt sein. Prüfen Sie wichtige Aussage-Passage-Paare direkt und bewerten Sie Zuverlässigkeit, Datum und Anwendbarkeit der Quelle separat. Die Regeln in diesem Leitfaden sind konstruierte Beispiele, keine Ergebnisse eines ausgeführten Abrufexperiments.

Was Sie prüfen sollten

  • Überprüfen Sie, ob jeder Zitationsbezeichner mit einem abgerufenen Quellen-Chunk übereinstimmt.
  • Lokalisieren Sie für jede Behauptung die exakte Passage in der zitierten Quelle, die sie stützen soll.
  • Beurteilen Sie, ob die Behauptung logisch aus der Passage folgt und nicht nur erwähnt wird.
  • Markieren Sie Behauptungen, denen jede stützende Passage fehlt, als nicht belegt.
  • Prüfen Sie bei widersprüchlichen Quellen, ob die Antwort den Konflikt anerkennt oder stillschweigend eine Seite wählt.
  • Trennen Sie die Abrufqualität (Existenz der Quelle) von der Groundedness (semantische Unterstützung).
  • Verwenden Sie eine strukturierte Checkliste zur Überprüfung jedes Behauptungs-Quellen-Paars.
  • Seien Sie sich bewusst, dass automatisierte Groundedness-Metriken subtile Unstimmigkeiten übersehen können.

Automatisierte Groundedness-Metriken erkennen möglicherweise nicht alle semantischen Unstimmigkeiten; für hochriskante Entscheidungen ist eine menschliche Überprüfung erforderlich. Das Beispiel verwendet hypothetische Richtlinien-Snippets und keine realen Abrufergebnisse.

Quellen

  1. Microsoft: RAG prompt engineering ↗
  2. Microsoft: RAG answer evaluation ↗
Nach oben ↑