Artificial Intelligence
Retrieval Augmented Generation mit Azure OpenAI und AI Search
Wie das RAG-Muster Chatantworten auf indexierte Quelldokumente stuetzt — am Beispiel von JustitiaAI mit Azure OpenAI, Azure AI Search und Bicep.
ReleasedOpen in signal graph →- Category
- Artificial Intelligence
- Difficulty
- Intermediate
- Reading time
- 6 min
- Updated
- TODO
Das Muster
Retrieval Augmented Generation (RAG) trennt Wissen von Sprachfaehigkeit: Ein Suchindex haelt die Fakten, das Sprachmodell formuliert daraus Antworten. Bei jeder Nutzerfrage laeuft dieselbe Kette ab:
- Die Frage wird gegen den Index gestellt (Volltext, Vektor oder hybrid).
- Die relevantesten Passagen werden als Kontext in den Prompt eingebettet.
- Das Modell antwortet ausschliesslich auf Basis dieses Kontexts und zitiert die Quellen.
Das reduziert Halluzinationen messbar, weil das Modell nicht mehr aus dem Trainingsgedaechtnis antworten muss — und jede Antwort ueberpruefbar bleibt.
Die Azure-Bausteine
Das Projekt JustitiaAI setzt das Muster fuer Schweizer Rechtsregulierungen um und nutzt dafuer vier Azure-Dienste:
- Azure OpenAI stellt das GPT-Chatmodell und das Embedding-Modell bereit.
- Azure AI Search indiziert die Rechtsdokumente, inklusive integrierter Vektorisierung.
- Azure Blob Storage haelt die Quelldokumente (PDF, DOCX und weitere Formate).
- Azure App Service hostet das Python-Backend samt React-Frontend.
Provisioniert wird alles deklarativ: Bicep-Templates beschreiben die Ressourcen, azd up erstellt sie und indiziert die Beispieldaten, azd deploy aktualisiert spaeter nur den Code. Application Insights liefert End-to-End-Traces jeder Chatanfrage.
Uebertragbarkeit
Dieselbe Architektur traegt auch den Assistenten dieses Archivs: Inhalte werden in Chunks zerlegt, eingebettet und bei jeder Frage als Kontext angezogen. Der wichtigste Lerneffekt aus JustitiaAI ist die Kostenseite — AI Search und OpenAI verursachen laufende Kosten, weshalb azd down nach Experimenten Pflicht ist.