PROJEKTAI
Behördebot AI
BehördeBot to wspierany przez AI asystent, który pomaga użytkownikom w wypełnianiu niemieckich formularzy urzędowych.

Wprowadzenie do projektu

BehördeBot to modularny system złożony z backendu Flask (przetwarzanie podstawowe) oraz frontendu Streamlit (interfejs użytkownika). Użytkownicy przesyłają zeskanowane lub sfotografowane formularze (PDF/JPG/PNG). Backend konwertuje strony na obrazy, wykonuje OCR i wizualizuje rozpoznany tekst oraz ramki ograniczające.
System klasyfikuje typ formularza, wyodrębnia ustrukturyzowane pola (z wartościami ufności), przeprowadza ekstrakcję nazwanych encji, stosuje heurystyczne kontrole błędów oraz wykonuje wyszukiwanie typu retrieval-augmented generation (RAG) w lokalnym korpusie dokumentów prawnych, aby wyróżnić odpowiednie fragmenty przepisów.
Użytkownicy mogą tłumaczyć treści niemiecki↔angielski, edytować rozpoznane wartości pól w interaktywnej tabeli, zapisywać ustrukturyzowany JSON oraz generować przetłumaczone pliki PDF zachowujące układ do pobrania. Panel ewaluacji oblicza metryki OCR (WER/CER), tłumaczenia (BLEU) i użyteczności (SUS, ukończenie zadania), a dane wyjściowe i logi sesji są zapisywane w folderach uploads/ i outputs/. Architektura jest rozszerzalna (dodawanie kolejnych typów formularzy, uzupełnianie o LLM, podłączanie baz danych w chmurze).

Wyzwania
- Niezawodność OCR przy słabych skanach: odręczny tekst, skany o niskiej rozdzielczości lub złożone układy zmniejszają dokładność ekstrakcji i późniejsze rozpoznawanie pól.
- Różnorodność formularzy i złożoność układu: wiele formularzy urzędowych ma subtelne różnice w układzie, solidna klasyfikacja i przypisywanie pól dla licznych szablonów jest pracochłonne.
- Kontekst prawny, trafność i zaufanie: zapewnienie, że wyniki RAG są prawnie poprawne, aktualne i opatrzone odpowiednimi wskazówkami, aby nie wprowadzać użytkowników w błąd.
Rozwiązanie AI
- Modularny potok OCR i NER: połączenie Tesseract (lub lepszych silników OCR) z NER opartym na spaCy oraz heurystykami do wyodrębniania kandydatów na pola i typów encji (nazwiska, daty, adresy).
- Klasyfikacja formularzy i ustrukturyzowana ekstrakcja: klasyfikatory ML do rozpoznawania typów formularzy oraz logika ekstrakcji świadoma szablonu (ramki ograniczające i parsowanie semantyczne) w celu przypisania tekstu OCR do pól.
- Prawne RAG dla orientacji świadomej kontekstu: lokalny magazyn wektorowy dokumentów prawnych, umożliwiający pobieranie wspierających fragmentów dla każdego zapytania/strony, aby wyjaśnić wymagania formularza i przytoczyć odniesienia.
Wyniki / korzyści
- Szybsze i mniej podatne na błędy wypełnianie formularzy: użytkownicy wypełniają formularze szybciej dzięki pomocy dotyczącej poszczególnych pól, wskazówkom o błędach i autouzupełnianiu na podstawie wyodrębnionych encji.
- Lepsza dostępność i wielojęzyczność: natychmiastowe tłumaczenie niemiecki↔angielski oraz generowanie plików PDF zachowujących układ obniżają bariery językowe dla osób nieposługujących się niemieckim.
- Możliwość kontroli i identyfikowalność: ustrukturyzowane dane wyjściowe JSON i logi ułatwiają weryfikację tego, co zostało wyodrębnione, poprawione i przywołane (przydatne dla punktów obsługi lub zgodności).
Efektywność zasobów
- Skrócony czas ręcznego przetwarzania: automatyzacja OCR i walidacji zmniejsza nakład pracy personelu na ręczne wprowadzanie danych i korekty.
- Mniej powtarzanych wniosków: wykrywanie błędów i jasne wskazówki zmniejszają liczbę ponownych złożeń, oszczędzając koszty administracyjne i papier.
- Opcja wdrożenia lokalnego/offline-first: stan oparty na plikach/RAM oraz lokalne korpusy prawne umożliwiają wdrożenia bez wysokich kosztów chmury czy trwałych baz danych (niższe koszty hostingu, lepsza ochrona danych).












Dowiedz się więcej



MAJĄ PAŃSTWO ZŁOŻONY POMYSŁ, KTÓRY CHCIELIBYŚMY DLA PAŃSTWA WDROŻYĆ?
ZACZNIJMY OD PILOTAŻU DESIGN THINKING LUB ROZMOWY KONSULTACYJNEJ.