Daten aus PDF-Dokumenten extrahieren und digitalisieren

Von PDF-Dokumenten zu strukturierten Daten für Qualitäts- und Dokumentationsprozesse

Automatisieren Sie die Extraktion relevanter Informationen aus PDF-Dokumenten und reduzieren Sie manuellen Erfassungsaufwand, Fehlerquellen und Medienbrüche.

Für wen ist der Workshop geeignet?

Der Workshop richtet sich an Fach- und Führungskräfte, die PDF-Dokumente und technische Dokumentinformationen effizient digital weiterverarbeiten möchten beispielsweise in folgenden Funktionen und Anwendungsfeldern:

  • Auftragsabwicklung
  • Prüfmittelmanagement
  • technische Dokumentation
  • Qualitätsmanagement
  • Laborabläufe

Voraussetzungen

Empfohlen werden:

  • Grundkenntnisse in Python
  • grundlegendes Verständnis für Datenverarbeitung
  • Interesse an Automatisierung technischer Prozesse

Vorkenntnisse im Bereich künstliche Intelligenz sind nicht erforderlich.

Methodik

  • Fachvortrag
  • Live-Demonstrationen
  • Hands-on Übungen
  • Praxisbeispiele
  • Diskussion eigener Anwendungsfälle
  • Erfahrungsaustausch mit den Teilnehmenden

Inhalte des Workshops

1. Tag: Grundlagen der automatisierten Dokumentenverarbeitung

Einführung

  • Vorstellungsrunde
  • Abfrage der Kenntnisse und Erwartungen der Teilnehmenden
  • Übersicht über den Workshop

Dokumenttypen und Herausforderungen

  • strukturierte vs. unstrukturierte Dokumente
  • native PDF-Dokumente, Scans und Bilddokumente
  • typische Herausforderungen technischer Dokumente
  • Layout, Tabellen, Freitext, Mischformate

Python und Entwicklungsumgebung

Arbeiten mit virtuellen Python-Umgebungen

  • Projektstruktur mit PyCharm aufbauen
  • Installation benötigter Bibliotheken
  • Programmieren mit Unterstützung durch ChatGPT

Text- und Strukturextraktion aus PDF-Dokumenten

  • Textextraktion aus nativen PDFs
  • Layoutorientierte Analyse
  • Positionsbasierte Extraktion
  • Tabellen erkennen und verarbeiten
  • Umgang mit mehrseitigen Dokumenten

Dokumentzugriff und Darstellung

  • Batch-Verarbeitung von PDF-Dokumenten
  • PDF-Seiten rendern und anzeigen
  • einfache Weboberfläche (z. B. mit Flask)
  • Darstellung der Ergebnisse
  • lokale Dateiverarbeitung
  • Extraktionsdaten strukturiert als JSON speichern

Praxisübungen der Teilnehmenden

Automatisierte Extraktion aus typischen technischen PDF-Dokumenten

2. Tag: KI-gestützte Informationsextraktion

Von regelbasierter Extraktion zur intelligenten Dokumentenanalyse

  • klassische Parser vs. KI-basierte Verfahren
  • wann Regeln sinnvoll sind
  • wann KI Vorteile bietet
  • hybride Ansätze

Large Language Models für Dokumentdaten

  • strukturierte Extraktion mit LLMs
  • API-Anbindung
  • JSON-Ausgaben erzeugen
  • Prompt Engineering für Dokumentaufgaben
  • Umgang mit Kontextfenstern
  • Qualitätssicherung

Risiken und Grenzen

Halluzinationen

  • Validierung von Ergebnissen
  • Nachvollziehbarkeit
  • Datenschutz und Sicherheitsaspekte

Aufbau robuster Dokumentenpipelines

  • Dokumenteingang
  • Klassifikation
  • Extraktion
  • Validierung
  • Datenübergabe an Folgesysteme

Praxisnahe Anwendungsfälle

  • Kalibrierzertifikate
  • Prüfberichte
  • Messprotokolle
  • technische Datenblätter
  • Lieferscheine
  • Auftragsunterlagen

Praxisübungen der Teilnehmenden

Automatisierte Extraktion aus typischen technischen PDF-Dokumenten

Praxisdiskussion

Übertragung auf eigene Anwendungsfälle der Teilnehmenden