Daten aus PDF-Dokumenten extrahieren und digitalisieren
Von PDF-Dokumenten zu strukturierten Daten für Qualitäts- und Dokumentationsprozesse
Automatisieren Sie die Extraktion relevanter Informationen aus PDF-Dokumenten und reduzieren Sie manuellen Erfassungsaufwand, Fehlerquellen und Medienbrüche.
Für wen ist der Workshop geeignet?
Der Workshop richtet sich an Fach- und Führungskräfte, die PDF-Dokumente und technische Dokumentinformationen effizient digital weiterverarbeiten möchten beispielsweise in folgenden Funktionen und Anwendungsfeldern:
- Auftragsabwicklung
- Prüfmittelmanagement
- technische Dokumentation
- Qualitätsmanagement
- Laborabläufe
Voraussetzungen
Empfohlen werden:
- Grundkenntnisse in Python
- grundlegendes Verständnis für Datenverarbeitung
- Interesse an Automatisierung technischer Prozesse
Vorkenntnisse im Bereich künstliche Intelligenz sind nicht erforderlich.
Methodik
- Fachvortrag
- Live-Demonstrationen
- Hands-on Übungen
- Praxisbeispiele
- Diskussion eigener Anwendungsfälle
- Erfahrungsaustausch mit den Teilnehmenden
Inhalte des Workshops
1. Tag: Grundlagen der automatisierten Dokumentenverarbeitung
Einführung
- Vorstellungsrunde
- Abfrage der Kenntnisse und Erwartungen der Teilnehmenden
- Übersicht über den Workshop
Dokumenttypen und Herausforderungen
- strukturierte vs. unstrukturierte Dokumente
- native PDF-Dokumente, Scans und Bilddokumente
- typische Herausforderungen technischer Dokumente
- Layout, Tabellen, Freitext, Mischformate
Python und Entwicklungsumgebung
Arbeiten mit virtuellen Python-Umgebungen
- Projektstruktur mit PyCharm aufbauen
- Installation benötigter Bibliotheken
- Programmieren mit Unterstützung durch ChatGPT
Text- und Strukturextraktion aus PDF-Dokumenten
- Textextraktion aus nativen PDFs
- Layoutorientierte Analyse
- Positionsbasierte Extraktion
- Tabellen erkennen und verarbeiten
- Umgang mit mehrseitigen Dokumenten
Dokumentzugriff und Darstellung
- Batch-Verarbeitung von PDF-Dokumenten
- PDF-Seiten rendern und anzeigen
- einfache Weboberfläche (z. B. mit Flask)
- Darstellung der Ergebnisse
- lokale Dateiverarbeitung
- Extraktionsdaten strukturiert als JSON speichern
Praxisübungen der Teilnehmenden
Automatisierte Extraktion aus typischen technischen PDF-Dokumenten
2. Tag: KI-gestützte Informationsextraktion
Von regelbasierter Extraktion zur intelligenten Dokumentenanalyse
- klassische Parser vs. KI-basierte Verfahren
- wann Regeln sinnvoll sind
- wann KI Vorteile bietet
- hybride Ansätze
Large Language Models für Dokumentdaten
- strukturierte Extraktion mit LLMs
- API-Anbindung
- JSON-Ausgaben erzeugen
- Prompt Engineering für Dokumentaufgaben
- Umgang mit Kontextfenstern
- Qualitätssicherung
Risiken und Grenzen
Halluzinationen
- Validierung von Ergebnissen
- Nachvollziehbarkeit
- Datenschutz und Sicherheitsaspekte
Aufbau robuster Dokumentenpipelines
- Dokumenteingang
- Klassifikation
- Extraktion
- Validierung
- Datenübergabe an Folgesysteme
Praxisnahe Anwendungsfälle
- Kalibrierzertifikate
- Prüfberichte
- Messprotokolle
- technische Datenblätter
- Lieferscheine
- Auftragsunterlagen
Praxisübungen der Teilnehmenden
Automatisierte Extraktion aus typischen technischen PDF-Dokumenten
Praxisdiskussion
Übertragung auf eigene Anwendungsfälle der Teilnehmenden