Die drei Frameworks, die im DACH-Mittelstand tatsächlich zur Auswahl stehen, sind LlamaIndex, LangChain und Haystack. Alle drei können RAG-Systeme abbilden, alle drei haben aktive Ökosysteme, alle drei laufen produktiv bei ernst zu nehmenden Kunden. Die Unterschiede liegen in Detailentscheidungen, die erst ab Sprint 8 spürbar werden, und dann teuer sind, wenn man das falsche Framework gewählt hat.
Dieser Artikel ist ein direkter Vergleich mit Bewertung nach fünf Dimensionen, die in Auswahl-Entscheidungen wirklich zählen: RAG-spezifische Ergonomie, Wartbarkeit, DSGVO-Tauglichkeit, Lock-in-Risiko und Community-Support. Ergänzt den Beratungs-Leitfaden mit konkreten Framework-Empfehlungen.
Der schnelle Überblick
| Dimension | LlamaIndex | LangChain | Haystack | |---|---|---|---| | Primärer Fokus | RAG + Data-Framework | Agenten + Tool-Orchestrierung | RAG + NLP-Pipeline (deutscher Ursprung) | | Sprache | Python + TypeScript | Python + JavaScript | Python (v2) | | Ergonomie für Standard-RAG | Sehr gut | Mittel (viel Boilerplate) | Gut | | Multi-Agent / komplexe Workflows | Zusatz-Modul | Nativ, umfangreich | Basis vorhanden | | DSGVO-Tauglichkeit out-of-box | Neutral | Neutral | Neutral (aber deutscher Ursprung) | | Selbst-Hosting-Freundlichkeit | Hoch | Hoch | Sehr hoch | | Lock-in-Risiko | Mittel | Höher (viele proprietäre Konnektoren) | Niedrig | | GitHub Stars (2026-07) | ~40k | ~95k | ~17k | | Enterprise-Support | Verfügbar | Verfügbar | Verfügbar (deepset) |
LlamaIndex, das Standard-RAG-Framework
Wenn ihr euch nicht sicher seid, ist LlamaIndex meist der richtige Startpunkt.
Stärken:
- Speziell für RAG entworfen, die Abstraktionen (Index, Retriever, ResponseSynthesizer) passen genau auf das Grundproblem
- Sehr gute Dokumentation mit Fokus auf realen Use-Cases, nicht auf Marketing-Demos
- Neuere Features (Property Graphs, Multi-Modal RAG, Structured Extraction) kommen kontinuierlich
- LlamaCloud als optionaler Managed-Service für Teams ohne DevOps-Kapazität
Schwächen:
- Für komplexe Multi-Agent-Workflows weniger elegant als LangChain
- API-Änderungen zwischen Major-Versionen (0.9 → 0.10 → 0.11) waren bisher aufwändig zu migrieren
- Ökosystem an Konnektoren kleiner als LangChain
Wann wählen: Standard-RAG-Anwendungsfall, Team mit begrenzter Framework-Erfahrung, keine komplexen Agenten-Workflows nötig. Der pragmatische Default für 70 % der Projekte.
Wann nicht: Wenn schon eine LangChain-Codebase existiert oder Multi-Agent-Orchestrierung Kernanforderung ist.
LangChain, das Alleskönner-Framework
Marktführer nach GitHub-Stars, mit dem breitesten Ökosystem.
Stärken:
- Über 700 Integrationen (Datenquellen, LLMs, Vector-DBs, Tools), für praktisch alles gibt es einen Konnektor
- LangGraph für Multi-Agent-Workflows ist ausgereift und mächtig
- LangSmith als integrierte Observability-Lösung (Trace-Analyse, Evaluation, Prompt-Management)
- Große Community, viele Beispiele, viele fertige Recipe-Blueprints
Schwächen:
- Viel Boilerplate für einfache RAG-Cases, was in LlamaIndex 20 Zeilen ist, sind in LangChain 60
- Abstraktionen sind mächtig, aber die Lernkurve ist steiler
- Neigt zu Feature-Creep und häufigen API-Änderungen
- LangSmith ist zwar hilfreich, aber ein Lock-in-Risiko wenn Observability daran hängt
Wann wählen: Multi-Agent-Anwendungsfälle, sehr spezifische Konnektoren gebraucht (z.B. exotische SaaS-APIs), Team mit LangChain-Erfahrung.
Wann nicht: Einfaches RAG mit Standard-Konnektoren, dann ist die Komplexität nicht gerechtfertigt.
Haystack, der europäische Kandidat
Von deepset (Berlin) entwickelt, mit besonders starker Verankerung im deutschsprachigen NLP-Ökosystem.
Stärken:
- Deutscher Anbieter mit europäischem Rechtsrahmen, praktisch bei Enterprise-Ausschreibungen, wo dieser Punkt aufkommt
- Sehr klare Pipeline-Abstraktion mit typisierten Komponenten, gute Wartbarkeit
- Starke Integration mit Hugging-Face-Modellen (für self-hosted Setups relevant)
- deepset Cloud als Managed-Alternative mit EU-Region
Schwächen:
- Ökosystem kleiner als LangChain und LlamaIndex, für Konnektoren muss man mehr selbst schreiben
- Community-Größe ist eine Größenordnung geringer, bei Problemen findet man weniger Google-Antworten
- Multi-Agent-Framework existiert, ist aber noch nicht so ausgereift wie LangGraph
Wann wählen: Enterprise-Setups mit expliziter „europäisch"-Anforderung, komplexe klassische NLP-Anwendungen (Question Answering, Named Entity Recognition), Teams mit Präferenz für Typ-Sicherheit.
Wann nicht: Wenn ihr auf Vielfalt der Konnektoren oder Community-Support angewiesen seid.
Wie ihr in einer Stunde entscheidet
Wenn ihr euch nicht durch alle drei Frameworks arbeiten wollt, geht dieser Entscheidungspfad meistens durch:
1. Ist eure Anwendung Multi-Agent (Agenten die Tools aufrufen, Zwischenergebnisse austauschen, Entscheidungen treffen)?
- Ja → LangChain mit LangGraph. Kein anderes Framework ist hier so weit.
- Nein → weiter zu Frage 2.
2. Habt ihr eine explizite Anforderung an europäischen Anbieter (Vertragspartner, Support-Verpflichtung)?
- Ja → Haystack von deepset.
- Nein → weiter zu Frage 3.
3. Habt ihr komplexe Konnektor-Anforderungen (exotische SaaS-APIs, viele Datenquellen die schon in LangChain-Community-Beispielen existieren)?
- Ja → LangChain, weil das Ökosystem am größten ist.
- Nein → LlamaIndex, weil es für Standard-RAG das eleganteste Framework ist.
Dieser Entscheidungspfad führt in 4 von 5 Fällen zur richtigen Wahl.
Was ihr in allen drei Fällen zusätzlich braucht
Egal welches Framework, folgende Komponenten müssen separat entschieden und gebaut werden. Kein Framework nimmt sie euch ab:
- Vector-DB: siehe Vector-DB-Auswahl-Guide
- LLM-Anbieter: siehe DSGVO-Setup-Guide
- Evaluations-Harness: aufbauen mit einem Test-Set von 20–30 realistischen Fragen und einem Groundedness-Check
- Monitoring: Latenz, Kosten, Retrieval-Qualität, Halluzinations-Rate im Blick behalten
- Prompt-Management: Versionierung, A/B-Tests, Rollback-Fähigkeit
Der Framework-Anteil ist etwa 20 % der Gesamtarbeit. Die anderen 80 % sind Daten, Retrieval-Qualität, Compliance und Betrieb.
Nächster Schritt
Der RAG-Reifegrad-Check prüft in fünf Fragen, welches Framework-Profil zu eurem Vorhaben passt, kostenlos, in unter fünf Minuten.
Wenn ihr die Framework-Wahl mit einem Team klären wollt, das mit allen dreien produktiv gearbeitet hat: Kalendertermin buchen, 30 Minuten kostenlos.
---
Verwandte Artikel: RAG-System-Beratung: Was Sie vor der Tool-Auswahl klären müssen · Vector-DB-Auswahl für DACH-Mittelstand