ENTSCHEIDUNG · RAG ODER FINE-TUNING

RAG oder Fine-Tuning: die eine Entscheidung, die zählt

Beide Wege binden ein Sprachmodell an Ihr Unternehmen, und beide liefern am Ende Text. Der Unterschied liegt darin, wo das Wissen liegt: in einem austauschbaren Index oder in den Gewichten des Modells selbst. Daraus folgt fast alles Weitere, von der Aktualität bis zum wiederkehrenden Aufwand.

Links ein weißer Würfel mit einer feinen Nahtlinie um die Mitte, rechts eine offene weiße Karteibox mit einer halb herausgezogenen Karte, beide auf dunklem Schiefer, verbunden durch einen orangefarbenen LichtstrahlKI-GENERIERT
Vergleichsstudie
RAG lag in einem direkten Vergleich bei bereits bekanntem und bei neuem Wissen deutlich vor unüberwachtem Fine-Tuning (Ovadia u. a., 2023).
Vergessen wächst mit der Größe
Größere Sprachmodelle vergessen beim Nachtrainieren tendenziell mehr von ihrem ursprünglichen Wissen, nicht weniger (Luo u. a., 2023).
Effizientes Fine-Tuning
LoRA trainiert bei einem Modell mit 175 Milliarden Parametern nur einen Bruchteil der Gewichte neu und senkt den Grafikspeicherbedarf um das Dreifache (Hu u. a., 2021).
Grundprinzip
RAG hält Wissen in einem austauschbaren Index, Fine-Tuning in den Gewichten des Modells selbst.

Worin unterscheiden sich RAG und Fine-Tuning wirklich?

Fine-Tuning verändert die Gewichte eines Sprachmodells selbst und macht neues Wissen zu einem festen Bestandteil des Modells. Retrieval-Augmented Generation lässt das Modell unverändert und legt ihm zur Antwortzeit passende Textstellen aus einem Index vor. Nur der Index kann später sagen, woher eine Aussage stammt, die Gewichte eines Modells können das nicht.

Diese Trennung entscheidet fast alles Weitere: wie schnell neues Wissen ankommt, ob eine Antwort belegbar ist und wo im Betrieb der Aufwand entsteht.

Warum gewinnt RAG einen direkten Vergleich meistens?

Eine Vergleichsstudie testete beide Wege an denselben wissensintensiven Aufgaben und ließ Sprachmodelle sowohl bereits bekanntes als auch völlig neues Wissen abrufen. Retrieval-Augmented Generation lag in beiden Fällen deutlich vorn, unüberwachtes Fine-Tuning verbesserte die Ergebnisse nur leicht, ein Abstand, der sich seither in weiteren Untersuchungen wiederholt hat (Ovadia u. a., 2023).

Für ein Unternehmen heißt das: Bei der Frage, ob ein Modell neues Wissen zuverlässig aufnimmt, ist der Index bisher der verlässlichere Weg, nicht das Nachtrainieren.

Wofür lohnt sich Fine-Tuning trotzdem?

Fine-Tuning eignet sich, wenn ein fester Ausgabestil, ein enges Klassifikationsschema oder branchenspezifische Fachbegriffe antrainiert werden sollen, die im Basismodell kaum vorkamen. Bei sehr hohem, gleichförmigem Anfragevolumen kann ein kleineres feinjustiertes Modell günstiger laufen, allerdings vergisst ein nachtrainiertes Modell mit wachsender Größe tendenziell mehr von seinem ursprünglichen Wissen, nicht weniger (Luo u. a., 2023).

Beispiel: Ein Modell, das feste Berichte in einem exakten Format ausgeben soll, lernt dieses Format über Beispiele zuverlässiger, als es sich aus einem langen Prompt jedes Mal neu ableiten ließe.

Parameter-effiziente Verfahren wie LoRA verändern dabei nur einen kleinen Teil der Gewichte, statt das gesamte Modell neu zu trainieren (Hu u. a., 2021).

Wie unterscheiden sich RAG und Fine-Tuning nebeneinander?

RAG oder Fine-Tuning im Überblick

KriteriumRetrieval-Augmented GenerationFine-Tuning
Wo das Wissen liegtIn einem austauschbaren IndexIn den Gewichten des Modells
Neues WissenSofort nach dem Einlesen verfügbarBraucht einen neuen Trainingslauf
BelegbarkeitJede Aussage nennt eine FundstelleKeine Herkunftsangabe möglich
ZugriffsrechteLassen sich am Index abbildenNicht auf einzelne Personen eingrenzbar
Wiederkehrender AufwandPflege der QuellenErneutes Kuratieren und Trainieren
10.000fach wenigertrainierbare Gewichte bei LoRA gegenüber vollständigem Fine-Tuning eines 175-Milliarden-Parameter-ModellsHu u. a., 2021
3fach wenigerGrafikspeicherbedarf bei LoRA gegenüber vollständigem Fine-Tuning desselben ModellsHu u. a., 2021

Wie trifft man die Entscheidung für den eigenen Anwendungsfall?

Entscheidungspfad

RAG, Fine-Tuning oder beides?

    Alle Fragen und Ergebnisse als Liste
    • Ändert sich das zugrunde liegende Wissen häufig?
      • Ja, Ergebnis: Retrieval-Augmented Generation zuerst
      • Nein, weiter mit: Muss jede Antwort eine Fundstelle nennen?
    • Muss jede Antwort eine Fundstelle nennen?
      • Ja, Ergebnis: Retrieval-Augmented Generation zuerst
      • Nein, weiter mit: Geht es vor allem um Form, Ton oder eine enge Fachsprache?
    • Geht es vor allem um Form, Ton oder eine enge Fachsprache?
      • Ja, Ergebnis: Fine-Tuning als Ergänzung prüfen
      • Nein, Ergebnis: Retrieval-Augmented Generation zuerst
    • Ergebnis: Retrieval-Augmented Generation zuerstBauen Sie zunächst ein einfaches Retrieval-System und prüfen Sie es an echten Fragen. Es zeigt schnell, ob die Datenlage überhaupt trägt.
    • Ergebnis: Fine-Tuning als Ergänzung prüfenEin feinjustiertes Modell kann Form oder Fachsprache verbessern, ersetzt aber keine Quellenanbindung. Prüfen Sie es an denselben Fragen wie ein Retrieval-System.

    Häufige Fragen

    Ist Fine-Tuning immer teurer als RAG?

    Nicht zwingend, aber der wiederkehrende Aufwand liegt an unterschiedlichen Stellen. Bei RAG entsteht er im Pflegen der Quellen, bei Fine-Tuning im erneuten Kuratieren und Trainieren bei jeder relevanten Änderung. Bei sehr hohem, gleichförmigem Anfragevolumen kann ein kleines feinjustiertes Modell im Betrieb günstiger sein.

    Kann Fine-Tuning Halluzinationen beseitigen?

    Nein. Es verschiebt, worüber ein Modell falsch liegt, gibt ihm aber keine Möglichkeit, eine Aussage zu belegen. Nachvollziehbarkeit entsteht durch die Anbindung an einen Index mit Fundstellen, nicht durch einen weiteren Trainingslauf.

    Verliert ein Modell beim Fine-Tuning vorhandenes Wissen?

    Das Risiko besteht und wächst tendenziell mit der Modellgröße, nicht umgekehrt: In einer Untersuchung vergaßen größere Modelle beim fortlaufenden Nachtrainieren mehr von ihrem ursprünglichen Wissen als kleinere (Luo u. a., 2023). Ein Testsatz vor und nach dem Training macht das sichtbar.

    Lassen sich RAG und Fine-Tuning kombinieren?

    Ja, in dieser Reihenfolge: zuerst Retrieval, weil sich damit schnell zeigt, ob die Datenlage trägt, danach Fine-Tuning nur dort, wo Antworten inhaltlich stimmen, aber Form oder ein enger Sonderfall stören.

    Wie viele Beispiele braucht Fine-Tuning mindestens?

    Weniger als oft angenommen, aber sie müssen sauber und widerspruchsfrei sein. Eine kleine, konsistente Sammlung trägt oft weiter als eine große mit vielen widersprüchlichen Fällen, weil ein Modell den Widerspruch sonst mitlernt.

    Quellen

    1. 01 Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks Lewis, P. u. a., arXiv, NeurIPS 2020, 2020 · arxiv.org
    2. 02 Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs Ovadia, O. u. a., arXiv, 2023 · arxiv.org
    3. 03 An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning Luo, Y. u. a., arXiv, 2023 · arxiv.org
    4. 04 LoRA: Low-Rank Adaptation of Large Language Models Hu, E. u. a., arXiv, Microsoft, 2021 · arxiv.org
    5. 05 Ragas: Automated Evaluation of Retrieval Augmented Generation Es, S. u. a., arXiv, 2023 · arxiv.org

    Bereit, KI souverän einzusetzen?

    Vereinbaren Sie ein unverbindliches Erstgespräch. Wir besprechen den ersten Anwendungsfall, der sich für Sie lohnt.

    Anwendungsfall besprechen

    Weiterführende Seiten

    Vertiefen Sie einzelne Standorte und Lösungen unserer KI-Beratung.

    Aus unseren Signalen

    Praxisnahe Einblicke zu souveräner KI, RAG und Compliance.

    Arthur C. Clarke

    “Jede hinreichend fortgeschrittene Technologie ist von Magie nicht zu unterscheiden.”