Überblick#
Entwickelte eine modulare Retrieval-Augmented Generation Plattform, die lokale PDFs einliest und Dokumentations-Websites rekursiv crawlt, bevor die Inhalte in Chunks zerlegt, eingebettet und für die semantische Suche indiziert werden.
Implementierte ein semantisches Retrieval mit LangChain, Gemini Embeddings und Qdrant Cloud, das sitzungsisolierte Vektorsammlungen für die mandantenfähige Dokumentenindizierung nutzt.
Integrierte ein intelligentes Query-Intent-Routing, die Erkennung von Prompt-Injections, Toxizitätsfilterung und Groundedness-Evaluationen, um Halluzinationen radikal zu reduzieren und unsichere Anfragen abzuwehren.
Entwickelte ein reaktionsschnelles React-Frontend mit Streaming-Antworten, direkten Quellenangaben und einem interaktiven Ausführungs-Trace, der Pipeline-Stadien, Latenz und Token-Nutzung in Echtzeit anzeigt.
Entwarf ein strikt entkoppeltes FastAPI-Backend, das robuste REST-APIs für Dokumentenerfassung, Retrieval, Indizierung und Chat-Workflows gemäß einer modularen Service-Architektur bereitstellt.
Automatisierte Tests und nahtlose Bereitstellung mit GitHub Actions. Das Backend wurde sicher auf Google Cloud Run deployed und das Frontend global über Firebase Hosting bereitgestellt.
Tech Stack#
Python
Core language
FastAPI
REST API backend
React
Frontend UI
Vite
Build tool
Tailwind CSS
Styling
LangChain
RAG orchestration
Gemini Embeddings
Vector embeddings
Groq
Fast LLM inference
Qdrant Cloud
Vector database
REST APIs
Architecture
Pytest
Testing framework
Docker
Containerization
Google Cloud Run
Backend hosting
Firebase Hosting
Frontend hosting
GitHub Actions
Automated pipelines
LLM-as-Judge (Evals)
Evaluation
CI/CD
Continuous integration