RAG & Wissen

Feinabstimmung oder Abruf: Die Entscheidung dreht sich um Änderungen, nicht um Vorlieben

Feinabstimmung kodiert Verhalten; Abruf liefert Fakten. Wenn man fragt, was besser ist, stellt man die falsche Frage — man sollte fragen, wie oft das zugrunde liegende Wissen sich ändert und ob man es zitieren muss.

Zwei Mechanismen, die oft miteinander verwechselt werden

Feinabstimmung ändert die Gewichte. Retrieval ändert den Prompt. Sie werden häufig als konkurrierende Techniken für denselben Job diskutiert, was der Grund dafür ist, dass so viele Teams auf Instinkt hin eine auswählen und dann ein Vierteljahr damit verbringen, herauszufinden, warum sie nicht passt.

Sie lösen unterschiedliche Probleme. Feinabstimmung ist gut für die Form: Ton, Ausgabeform, Aufgabenkonformität, Domänenidiom. Retrieval ist gut für den Inhalt: spezifische Fakten, Dokumente, die während der Trainingszeit nicht existierten, alles, was Sie zitieren müssen.

Die Entscheidungsregel

Beginnen Sie mit zwei Fragen. Erstens: Wie oft ändert sich dieses Wissen? Alles, was in einem Zyklus kürzer als Ihrem Neuschulungszyklus liegt, gehört in das Retrieval, denn ein fein abgestimmtes Modell wird stillschweigend veraltet und Sie werden es nicht bemerken, bis ein Benutzer es tut. Zweitens: Müssen Sie zeigen, woher die Antwort kommt? Wenn ja, ist Retrieval nicht optional – eine Gewichtsaktualisierung kann keine Zitation erzeugen.

Nur nachdem beide Fragen positiv beantwortet wurden, sollten Sie eine Feinabstimmung in Betracht ziehen. Der verbleibende Fall ist eng, aber real: Sie benötigen ein stabiles Verhalten oder Format, das das Prompten nicht zuverlässig produzieren kann, bei einem Token-Budget oder einer Latenz, die das Retrieval verschlechtert.

Der Ausfallmodus jedes

Feinabstimmung scheitert leise. Das Modell wird in Ihrem Domänenwortschatz flüssig, während es weiterhin zuversichtlich falsch über aktuelle Fakten ist, und weil es richtig klingt, überprüft niemand. Es erzeugt auch eine Wartungspflicht: Jedes Upgrade des Basismodells bedeutet, dass die Schulung wiederholt und die Bewertung erneut durchgeführt werden muss.

Retrieval scheitert sichtbar, was eine Funktion ist. Schlechte Retrieval produziert offensichtlich irrelevante Kontexte, und Sie können es messen. Die Kosten sind, dass Sie nun eine Pipeline besitzen: Parsing, Chunking, Einbettung, Indexfrische und Berechtigungsfilterung. Die meisten Qualitätsprobleme in RAG-Systemen liegen in dieser Pipeline und nicht im Modell.

Was normalerweise funktioniert

Retrieval zuerst, für fast alles, weil es messbar und rückgängig ist. Dann fein abstimmen für die Form, sobald Sie Spuren haben, die eine konsistente Verhaltenslücke zeigen, die das Prompten und Few-Shot-Beispiele nicht schließen können. Wenn Sie es in dieser Reihenfolge tun, haben Sie das Bewertungsset bereit, bevor Sie es benötigen, was das ist, was die meisten Teams fehlt, wenn sie beginnen.

Was daraus folgt

  • Feinabstimmung ist für Form und Verhalten geeignet; Abruf ist für Inhalt und Fakten geeignet
  • Fragen Sie, wie oft das Wissen sich ändert und ob Sie es zitieren müssen — das entscheidet in den meisten Fällen
  • Feinabstimmung scheitert stillschweigend; Abruf scheitert sichtbar, was den Betrieb erleichtert
  • Bauen Sie das Bewertungsset mit Abruf auf, dann feinabstimmen Sie gezielt, wenn Spuren einen echten Gap anzeigen