PROJEKTKI
Behördebot KI
BehördeBot ist ein KI-gestützter Assistent, der Nutzern beim Ausfüllen deutscher Behördenformulare hilft.

Projekteinführung

BehördeBot ist ein modulares System mit einem Flask-Backend (Kernverarbeitung) und einem Streamlit-Frontend (Benutzeroberfläche). Nutzer laden gescannte oder fotografierte Formulare (PDF/JPG/PNG) hoch. Das Backend wandelt Seiten in Bilder um, führt OCR aus und visualisiert erkannten Text sowie Begrenzungsrahmen.
Das System klassifiziert den Formulartyp, extrahiert strukturierte Felder (mit Konfidenzwerten), führt eine Named-Entity-Extraktion durch, wendet heuristische Fehlerprüfungen an und führt eine Retrieval-Augmented-Generation-Suche (RAG) über einen lokalen Korpus juristischer Dokumente aus, um relevante Rechtsauszüge hervorzuheben.
Nutzer können Inhalte Deutsch↔Englisch übersetzen, erkannte Feldwerte in einer interaktiven Tabelle bearbeiten, strukturiertes JSON speichern und übersetzte, layouterhaltende PDFs zum Download erzeugen. Ein Evaluations-Dashboard berechnet OCR- (WER/CER), Übersetzungs- (BLEU) und Usability-Metriken (SUS, Aufgabenabschluss), und Sitzungsausgaben/-protokolle werden in uploads/ und outputs/ gespeichert. Die Architektur ist erweiterbar (weitere Formulartypen hinzufügen, LLMs ergänzen, Cloud-Datenbanken anbinden).

Herausforderungen
- OCR-Zuverlässigkeit bei schlechten Scans: Handschriftlicher Text, niedrig aufgelöste Scans oder komplexe Layouts verringern die Extraktionsgenauigkeit und die nachgelagerte Felderkennung.
- Formularvielfalt & Layout-Komplexität: Viele Behördenformulare weisen feine Layoutunterschiede auf; eine robuste Klassifizierung und Feldzuordnung für zahlreiche Vorlagen ist arbeitsintensiv.
- Rechtlicher Kontext, Relevanz & Vertrauen: Sicherstellen, dass RAG-Ergebnisse rechtlich korrekt, aktuell und mit angemessenen Hinweisen versehen sind, um Nutzer nicht in die Irre zu führen.
KI-Lösung
- Modulare OCR- + NER-Pipeline: Kombination von Tesseract (oder besseren OCR-Engines) mit spaCy-basierter NER und Heuristiken zur Extraktion von Feldkandidaten und Entitätstypen (Namen, Daten, Adressen).
- Formularklassifizierung + strukturierte Extraktion: ML-Klassifikatoren zur Erkennung von Formulartypen und vorlagenbewusste Extraktionslogik (Begrenzungsrahmen + semantisches Parsing), um OCR-Text den Feldern zuzuordnen.
- Juristisches RAG für kontextbewusste Orientierung: Lokaler Vektorspeicher über juristische Dokumente, um pro Anfrage/Seite unterstützende Auszüge abzurufen und so Formularanforderungen zu erklären und Referenzen zu zitieren.
Ergebnisse / Nutzen
- Schnelleres, fehlerärmeres Ausfüllen von Formularen: Nutzer füllen Formulare schneller aus, dank feldbezogener Hilfestellung, Fehlerhinweisen und Autovervollständigung aus extrahierten Entitäten.
- Bessere Barrierefreiheit & Mehrsprachigkeit: Sofortige Übersetzung Deutsch↔Englisch und layouterhaltende PDF-Erzeugung senken Sprachbarrieren für Nicht-Deutschsprachige.
- Prüfbarkeit & Nachvollziehbarkeit: Strukturierte JSON-Ausgaben und Protokolle erleichtern die Überprüfung, was extrahiert, korrigiert und referenziert wurde (nützlich für Servicestellen oder Compliance).
Ressourceneffizienz
- Reduzierte manuelle Bearbeitungszeit: Die Automatisierung von OCR + Validierung verringert den Personalaufwand für manuelle Dateneingabe und Korrekturen.
- Weniger wiederholte Einreichungen: Fehlererkennung und klare Hinweise reduzieren erneute Einreichungen und sparen Verwaltungskosten und Papier.
- Lokale/Offline-first-Bereitstellungsoption: Datei-/RAM-basierter Zustand und lokale Rechtskorpora ermöglichen Bereitstellungen ohne hohe Cloud-Kosten oder persistente Datenbanken (geringere Hosting-Kosten, besserer Datenschutz).












Mehr entdecken



SIE HABEN EINE KOMPLEXE IDEE, DIE WIR UMSETZEN SOLLEN?
STARTEN SIE MIT EINEM DESIGN-THINKING-PILOT ODER EINEM BERATUNGSGESPRÄCH.