9.1 Übersicht
Extrahierungsregeln ermöglichen das automatische Auslesen von Informationen aus PDF-Dokumenten. Die extrahierten Daten können in Dateinamen, E-Mail-Texten, Zielordnern und vielen anderen Kontexten als Platzhalter verwendet werden.
Öffnen: Klicken Sie in den Profileinstellungen unter Datenextrahierung auf Hinzufügen oder Bearbeiten.
Typische Anwendungen
| Anwendung |
Beispiel |
| Dateinamen |
<Rechnungsdatum>_<Rechnungsnummer>.pdf |
| Zielordner |
D:\Archiv\<Jahr>\<Monat>\ |
| E-Mail-Betreff |
Rechnung <Rechnungsnummer> vom <Rechnungsdatum> |
| CSV-Export |
Alle extrahierten Werte in einer Tabelle |
Aufbau einer Regel
Jede Regel besteht aus mehreren Komponenten:
| Komponente |
Beschreibung |
| Allgemein |
Name, Quelle, Datentyp |
| Bestimmung |
Wie der Wert gefunden wird |
| Bereinigung |
Vorverarbeitung des Rohwerts |
| Verifikation |
Prüfung des gefundenen Werts |
| Format |
Nachformatierung des Werts |
Temp. OCR-Unterstützung für eingescannte Beispieldateien
Unten links im Regeleditor finden Sie die Checkbox Temp. OCR-Unterstützung. Sie ist mit der Einstellung der gleichnamigen Kategorie der Profileinstellungen (Abschnitt 8.4) vorbelegt und gilt für alle Regeln: Ist sie aktiviert, erkennt die Vorschau den Text von Beispieldateien ohne Textebene (z. B. Scans) vorübergehend per Texterkennung - Sie können Regeln damit direkt am Scan einrichten und sehen genau die Werte, die auch die Verarbeitung ermitteln wird.
- Beim ersten Zugriff auf eine solche Datei zeigt ein Fortschrittsfenster den Stand der Texterkennung an (dies kann je nach Umfang einige Minuten dauern). Über Abbrechen wird die Temp. OCR-Unterstützung für die aktuelle Sitzung deaktiviert; die Erkennung läuft im Hintergrund weiter, sodass ein erneutes Aktivieren später ohne Wartezeit greift.
- Aktivieren Sie die Checkbox, während die Kategorie “Temp. OCR-Unterstützung” im Profil noch deaktiviert ist, bietet das Programm deren Aktivierung an - sie ist Voraussetzung, damit auch die Verarbeitung eingescannte Dateien erkennt.
- Die Erkennung erfolgt in einer temporären Kopie mit den Einstellungen der Kategorie (inklusive Seitenbegrenzung); die Beispieldatei selbst bleibt unverändert.
9.2 Allgemein
Die Registerkarte Allgemein enthält grundlegende Einstellungen der Regel.
9.2.1 Name
Der Name der Regel. Dieser Name wird für Platzhalter verwendet.
Format: <RuleId:N(Regelname)> Die Regel-ID N wird automatisch ermittelt und verwendet.
Tipp: Verwenden Sie aussagekräftige Namen ohne Sonderzeichen, zum Beispiel Kundennummer oder Rechnungsdatum.
Hinweis: Wenn Sie mehrere Regeln mit dem gleichen Namen anlegen, ist es ausreichend, wenn eine dieser Regeln ein gültiges Ergebnis erzielt. Das Programm verwendet automatisch das erste erfolgreiche Ergebnis. Dies ist nützlich für Rückfall-Szenarien, z.B. wenn eine Regel für bestimmte Dokumenttypen fehlschlägt.
9.2.2 Kommentar
Optionales Feld für Notizen zur Regel.
9.2.3 Datenquelle
Bestimmt, woher die Daten extrahiert werden:
| Quelle |
Beschreibung |
| Dokumententext |
Text des PDF-Dokuments |
| Barcode |
Inhalt eines Barcodes im PDF |
| PDF-Eigenschaft |
Metadaten des PDFs (Titel, Autor, etc.) |
| Dateieigenschaft |
Eigenschaften der Datei (Name ohne Dateiendung, Pfad, Datum) |
| Benutzerdefinierter Text |
Fester oder berechneter Wert, zum Beispiel n.v. |
| Platzhalterwert |
Referenz auf eine andere Regel, die sich oberhalb der aktuellen Regel befindet |
| Formularfeld |
Wert eines PDF-Formularfelds |
| Fortlaufende Nummer |
Automatisch inkrementierende Nummer (z.B. für Dokumenten-IDs) |
9.2.4 Datentyp
Der benötigte Typ des extrahierten Werts:
| Datentyp |
Beschreibung |
| Text |
Beliebiger Text |
| Datum |
Datumswerte mit automatischer Erkennung |
| Zahl |
Numerische Werte |
| Abfrage |
Bedingte Wertauswahl |
| Abfrage (mit Liste) |
Wert aus einer statischen oder dateibasierten Liste |
9.2.5 Ermitteltes Ergebnis darf leer sein
Normalerweise gilt eine Regel als fehlgeschlagen, wenn sie keinen Wert liefert - die Aufgabe bricht dann mit einem Fehler ab, sofern keine gleichnamige Rückfallregel greift (siehe Abschnitt 9.15.3). Mit dieser Option gilt die Regel auch ohne Ergebnis als erfolgreich: Der Platzhalter bleibt in diesem Fall einfach leer.
Typischer Anwendungsfall: Ein Wert kommt nur in manchen Dokumenten vor, zum Beispiel ein Kalenderjahr im Betreff. Ist es vorhanden, soll es in den Dateinamen; fehlt es, soll die Datei trotzdem verarbeitet werden. In der Vorschau wird ein solches Ergebnis als “leer (zulässig)” angezeigt.
Die Option gilt für alle gleichnamigen Regeln gemeinsam: Erst wenn keine davon einen Wert liefert, wird das leere Ergebnis verwendet.
Die Option greift nur bei “nichts gefunden”. Zugriffs- und Konfigurationsfehler, etwa eine nicht erreichbare Abfrageliste, eine nicht lesbare Datei oder ein verwaister Platzhalter, bleiben Fehler. Verweist eine weitere Regel per “Platzhalterwert” auf eine solche leere Gruppe, erhält sie ebenfalls einen leeren Wert. Im Extraktionsergebnis-Filter zählt eine leere Gruppe als erfolgreich ermittelt mit leerem Wert; das Kriterium “Extraktion muss fehlschlagen” trifft dann nicht mehr zu.
9.3 Datenquelle Dokumententext oder Barcode - Bestimmung: Position
Bei der positionsbasierten Bestimmung wird mit einem größenveränderbaren Auswahlrechteck der gewünschte Bereich auf der Seite markiert.
9.3.1 Seite bestimmen
| Option |
Beschreibung |
| Seitennummer angeben |
Auswahlrechteck wird immer auf der angegebenen Seitennummer positioniert |
| Seite mit Schlüsselwort finden |
Auswahlrechteck wird immer auf der Seite mit dem angegebenen Schlüsselwort positioniert |
9.3.2 Im PDF-Viewer markieren
Markieren Sie den gewünschten Bereich direkt in der Seitenvorschau: 1. Klicken Sie auf Position ändern und passen Sie Position und Größe des Auswahlrechtecks an, um den gewünschten Bereich festzulegen 2. Klicken Sie auf Position fixieren
9.4 Datenquelle Dokumententext oder Barcode - Bestimmung: Schlüsselwort
Bei der Schlüsselwortbestimmung wird ein Wert relativ zu einem Suchbegriff (Schlüsselwort) extrahiert.
9.3.1 Seite bestimmen
| Option |
Beschreibung |
| Keine Bestimmung notwendig |
Die Seite wird durch das in Datenbereich festlegen angegebene Schlüsselwort definiert |
| Seitennummer angeben |
Die Seite wird durch eine angegebene Seitennummer definiert |
| Seite mit Schlüsselwort finden |
Die Seite wird durch das hier angegebene Schlüsselwort definiert |
9.4.1 Datenbereich festlegen
9.4.1.1 Schlüsselwort
Der Text, nach dem im Dokument gesucht wird.
Beispiel: Rechnungsnummer:, um die rechts danebenstehende Nummer zu finden.
9.4.1.2 Suchoptionen
| Option |
Beschreibung |
| Groß-/Kleinschreibung |
Beachtet die Schreibweise |
| Regulärer Ausdruck |
Schlüsselwort als Regex interpretieren |
| Bei mehreren Vorkommen |
Ein bestimmtes Vorkommen, sollte normalerweise das erste Vorkommen sein |
9.4.1.3 Datenposition (Position relativ zum Schlüsselwort)
| Position |
Beschreibung |
| Rechts |
Text rechts vom Schlüsselwort |
| Links |
Text links vom Schlüsselwort |
| Oberhalb |
Text oberhalb |
| Unterhalb |
Text unterhalb |
| Bereich der Fundstelle |
das gesuchte Schlüsselwort (optimal, um durch Erweitern des Datenbereichs den gewünschten Bereich festzulegen) |
9.4.2 Datenbereich erweitern
Ermöglicht, den über das Schlüsselwort gefundenen Bereich, aus welchem die Daten extrahiert werden, zu verlagern und/oder zu erweitern:
| Einstellung |
Beschreibung |
| Nach links |
Verlagert die linke Kante des Datenbereichs um einen positiven oder negativen Wert |
| Nach rechts |
Verlagert die rechte Kante des Datenbereichs um einen positiven oder negativen Wert |
| Nach oben |
Verlagert die obere Kante des Datenbereichs um einen positiven oder negativen Wert |
| Nach unten |
Verlagert die untere Kante des Datenbereichs um einen positiven oder negativen Wert |
9.4.3 Datenbereichserweiterung anpassen
Wenn sich bei der vorherigen Erweiterung des Datenbereichs auf ein Schlüsselwort bezogen wurde, kann man hier noch einmal nachjustieren
9.4.4 Visualisierung im PDF-Viewer
Im PDF-Viewer werden angezeigt: - Rot: Das gefundene Schlüsselwort - Grün: Der Datenbereich - Blau: Der extrahierte Wert
9.5 Datenquelle Dokumententext - Bestimmung: Text der Seite(n)
Bei dieser Bestimmung wird der gesamte Text einer oder mehrerer Seiten als Basis verwendet.
9.5.1 Datenermittlung (Seitentext)
9.5.1.1 Seite bestimmen
| Option |
Beschreibung |
| Keine Bestimmung notwendig |
Verwendet den Text aller Seiten |
| Seitennummer angeben |
Verwendet den Text der Seite mit der angegebenen Seitennummer |
| Seite mit Schlüsselwort finden |
Verwendet den Text der Seite mit dem angegebenen Schlüsselwort |
9.5.1.2 Kombination mit Bereinigung
Die Datenermittlung mittels Seitentext liefert oft viel Text. Verwenden Sie die Bereinigung, um den relevanten Teil zu extrahieren.
9.6 Datentypen
9.6.1 Text
Zur Extrahierung, Verifizierung und Formatierung von Text
Für die meisten Fälle ist der Datentyp Text die richtige Wahl.
9.6.2 Datum
Zur Extrahierung und Verifizierung eines Datums
Beim Datentyp Datum werden automatisch alle Datumsangaben im Text ausgewertet. Wenn Sie kein Schlüsselwort angeben, wird das erste gefundene Datum verwendet. Bei Verwendung dieses Datentyps stehen bei der Verwendung des Platzhalters für den Pfad oder Dateinamen alle Datumsbestandteile separat zur Verfügung. Sie können beispielsweise nur das vierstellige Jahr und den Monatsnamen verwenden.
Für die automatische Datumserkennung stehen vier Suchoptionen zur Verfügung:
| Option |
Beschreibung |
| Suche nach einem Datum im landestypischen Format |
Erkennt Datumsangaben im Format der Programmsprache (z.B. “15.12.2024” oder “15. Dezember 2024”) |
| Suche nach einem Datum im beliebigen Format |
Erkennt die offiziellen Datumsformate aller Länder |
| Suche nach einem Datum ohne Tag im Format “MMMM yyyy” |
Erkennt Angaben aus Monatsname und Jahr (z.B. “April 2026”). Das gefundene Datum erhält den 1. als Tag |
| Suche nach einem Datum in benutzerdefinierten Formaten |
Erkennt Datumsangaben anhand einer selbst definierten Datumsformatsliste (z.B. auch “MM/yyyy” oder andere Formate ohne Tag) |
Die Prüfung erfolgt in dieser Reihenfolge: zuerst die Datumsformatsliste, dann das landestypische Format, dann sämtliche Formate, zuletzt die Suche ohne Tag. Groß- und Kleinschreibung des Monatsnamens spielt keine Rolle.
Uhrzeiten in benutzerdefinierten Formaten: Die Formate der Datumsformatsliste dürfen auch Zeitbestandteile enthalten - HH (Stunde 00-23), hh (Stunde 01-12), mm (Minute), ss (Sekunde) und tt (am/pm). Damit lassen sich Uhrzeiten erkennen und über das Ausgabeformat umformatieren, z. B. eine 12-Stunden-Angabe in die 24-Stunden-Darstellung: Suchformat hh:mm:ss tt findet “02:35:47 pm”, und mit dem Ausgabeformat HH:mm:ss wird daraus “14:35:47”. Auch kombinierte Angaben wie dd.MM.yyyy HH:mm sind möglich. Hinweis: Bei einer reinen Uhrzeit ohne Datum erhält der Wert intern das Platzhalter-Datum 01.01.2000 - eine Verifizierung “Datum liegt zwischen” ist dann nicht sinnvoll. Die Legende der Datumsformate (Seite “Formatierung” und Datumsformatslisten) und das Menü “Datumsbestandteil einfügen” führen die Zeitbestandteile ebenfalls auf.
9.6.2 Zahl
Zur Extrahierung und Verifizierung einer Zahl
Mit der optionalen automatischen Zahlenerkennung (“Suche nach einer Zahl im Text”) wird aus dem ermittelten Text gezielt eine Zahl herausgesucht. Das ist nützlich, wenn der Datenbereich neben der gewünschten Zahl noch weiteren Text enthält - oder wenn der gesamte Seitentext als Datenquelle dient, z.B. bei eingescannten Belegen.
Für die Suche stehen drei Modi zur Verfügung:
| Option |
Beschreibung |
| im landestypischen Zahlenformat |
Erkennt Zahlen mit den Tausender- und Dezimaltrennzeichen der Programmsprache (z.B. “1.234,56” bei Deutsch) |
| in beliebigem Format |
Erkennt Zahlen mit Punkt, Komma, Apostroph oder Leerzeichen als Trennzeichen (z.B. “1,234.56” oder “1’234.55”) |
| als Ganzzahl (reine Ziffernfolge) |
Erkennt zusammenhängende Ziffernfolgen, optional mit fester Stellenzahl - z.B. achtstellige Auftrags- oder Belegnummern. Führende Nullen bleiben erhalten |
Über “Verwende Vorkommen Nr.” bestimmen Sie, das wievielte Vorkommen verwendet wird - vom Anfang oder vom Ende des Textes gezählt. Mit “1 vom Ende” erhalten Sie beispielsweise die letzte Zahl des Bereichs, etwa den Gesamtbetrag einer Rechnung.
Die Suche bezieht sich auf den ermittelten Text bzw. Datenbereich; er kann also vorab per Schlüsselwort und Datenposition eingegrenzt werden. Gefundene Zahlen im landestypischen oder beliebigen Format werden in das Zahlenformat der Programmsprache überführt und können über die Seite “Formatierung” weiter angepasst werden. Ohne aktive Suche wird der ermittelte Text unverändert übernommen - bestehende Regeln verhalten sich also wie bisher.
9.6.1 Einfache Abfrage
Bei Abfragen wird ein Wert basierend auf Bedingungen ermittelt.
Definiert Bedingungen und zugehörige Rückgabewerte:
Dokumenttext enthält: "X<ODER>Y<ODER>Z", dann verwende als Ergebnis "Lieferschein", sonst ""
9.6.2 Abfrage (mit Liste)
Sie können mit dem Datentyp “Abfrage (mit Liste)” nach dem Vorkommen eines Begriffs suchen und den zugeordneten Wert als Ergebnis verwenden, z.B. eine E-Mail-Adresse oder einen Ordnernamen.
Listenformat: Suchbegriff und Ergebniswert werden durch Semikolon getrennt.
Beispiel 1: E-Mail-Adressen anhand von Kundennummern zuordnen:
Kundennummer : 19006;x@y.de
Kundennummer : 1900;a@b.de
Kundennummer : 18765;c@d.de
Enthält das PDF “Kundennummer : 19006”, wird “x@y.de” als Ergebnis verwendet.
Beispiel 2: IBAN suchen, Firmenname als Ergebnis verwenden:
DE02120300000000202051<ODER>DE02 1203 0000 0000 2020 51;Mustermann GmbH
DE02500105170137075030;Musterfrau GmbH
Hier wird die IBAN (mit oder ohne Leerzeichen) gesucht und der zugehörige Firmenname zurückgegeben.
Beispiel 3: Suchmuster (regulärer Ausdruck) als Suchbegriff - Strassennamen mit Schreibvarianten einer ID zuordnen:
<BeginOfRegex>(?i)Bahnhofstr(aße|asse|\.)\s+12\b<EndOfRegex>;4711
<BeginOfRegex>(?i)Seestr(aße|asse|\.)\s+5\b<EndOfRegex>;4712
Der Suchbegriff wird von <BeginOfRegex> und <EndOfRegex> eingerahmt und dann als regulärer Ausdruck ausgewertet. Das erste Muster findet “Bahnhofstraße 12”, “Bahnhofstrasse 12” und “Bahnhofstr. 12” gleichermaßen, auch mit mehreren Leerzeichen vor der Hausnummer. Bitte beachten Sie:
- Suchmuster unterscheiden Gross-/Kleinschreibung, sofern nicht
(?i) vorangestellt wird
- Die Option “ganze Wörter suchen” wird bei Suchmustern nicht angewendet - verwenden Sie stattdessen
\b im Muster
- Da Suchmuster Kommas enthalten können, empfiehlt sich das Semikolon als Spaltentrennzeichen
Zeichen am Anfang oder Ende des Suchbegriffs ignorieren: Stammt die Liste aus einem anderen Programm, sind die Suchbegriffe dort oft “länger” als der Wert im Dokument - etwa durch eine angehängte Prüfziffer, führende Nullen oder ein vorangestelltes Kürzel. Mit der Option “Ignoriere beim Vergleich bis zu [x] Zeichen am Anfang und bis zu [y] Zeichen am Ende des Suchbegriffs” gilt ein Listeneintrag auch dann als Treffer, wenn er erst nach dem Weglassen von bis zu x Anfangs- bzw. y Endzeichen im Wert vorkommt. Die Liste selbst bleibt dabei unverändert.
Beispiel 4: Die automatisch erzeugte Versandliste enthält Sendungsnummern mit Prüfziffer (12-stellig), aus dem Dateinamen wird aber die 11-stellige Sendungsnummer extrahiert:
831180869281;LI2601904
831180869298;LI2601904
Mit “bis zu 1 Zeichen am Ende ignorieren” findet der Suchwert “83118086928” den Eintrag “831180869281” und liefert “LI2601904”. Entsprechend trifft mit “bis zu 3 Zeichen am Anfang ignorieren” der Listeneintrag “0004711” den Wert “4711”. Der Standardwert 0 entspricht dem exakten Vergleich.
Enthält der Suchbegriff Operatoren, gilt die Option für den ersten Suchbegriff - also den Teil vor dem ersten <ODER> bzw. <UND>; die übrigen Teile und Suchmuster bleiben unverändert (dort leistet z. B. \d? dasselbe). So bleibt etwa “831180869281<UND>Rechnung” nutzbar: Die Nummer vorn wird toleriert, der Kontextbegriff muss exakt vorkommen. Sollen mehrere alternative Werte toleriert werden, verwenden Sie je Wert eine eigene Listenzeile.
Extrahiert Werte aus PDF-Formularfeldern.
9.7.1 Feldauswahl
Zeigt alle im PDF vorhandenen Formularfelder an:
| Feldtyp |
Beschreibung |
| TextBox |
Texteingabefeld |
| CheckBox |
Auswahlfeld (Ja/Nein) |
| RadioButton |
Optionsfeld |
| ComboBox |
Dropdown-Liste |
| ListBox |
Auswahlliste |
Wählen Sie das Formularfeld nach seinem Namen aus. Der Name wird in den PDF-Formulareinstellungen definiert.
9.8 Datenquelle: Fortlaufende Nummer
Erzeugt eine automatisch inkrementierende Nummer, die pro Profil und Regel gespeichert wird. Im Gegensatz zu den anderen Datenquellen werden hier keine Daten aus dem PDF extrahiert, sondern ein neuer Wert generiert.
Typische Anwendungen: Dokumenten-IDs, Barcode-Inhalte, Rechnungsnummern, Vorgangsnummern.
9.8.1 Einstellungen
| Einstellung |
Beschreibung |
| Startwert |
Die erste Nummer (z.B. 1 oder 1000) |
| Schrittweite |
Erhöhung pro Dokument (z.B. 1, 10, 100) |
| Format |
Ausgabeformat für führende Nullen (z.B. 000000 → 000001) |
| Automatisch zurücksetzen nach Tagen |
Zähler wird nach X Tagen gelöscht (0 = nie) |
9.8.2 Wert zurücksetzen
Um den aktuellen Zählerstand auf den Startwert zurückzusetzen, aktivieren Sie die Checkbox Aktuellen Wert auf Startwert zurücksetzen und speichern Sie das Profil.
9.8.3 Beispiel
Dokumenten-ID mit QR-Code:
- Extrahierungsregel “DokNr” erstellen mit Datenquelle Fortlaufende Nummer
- Startwert: 1, Format: 000000
- Barcode-Aufgabe mit Inhalt:
DOC-<RuleId:1(DokNr)>
- Ergebnis: DOC-000001, DOC-000002, DOC-000003, …
Hinweis: Die fortlaufende Nummer ist auch in der Aufgabe Inhalt ersetzen als eigenständige Ersetzungsquelle verfügbar. Dort sind Startwert, Format und Schrittweite direkt in den Ersetzungseinstellungen konfigurierbar.
9.9 Bereinigung
Die Bereinigung ermöglicht die Vorverarbeitung des extrahierten Rohwerts.
9.9.1 Verfügbare Bereinigungsaufgaben
Ersetzen-Operationen
| Aufgabe |
Beschreibung |
| Text ersetzen |
Ersetzt einen Text durch einen anderen |
| Text vor Marker ersetzen |
Ersetzt alles vor einem Marker |
| Text hinter Marker ersetzen |
Ersetzt alles nach einem Marker |
| Regex-Ergebnis ersetzen |
Ersetzt Regex-Treffer |
| Zeilenumbrüche ersetzen |
Ersetzt Zeilenumbrüche durch Text |
| Mit Excel-Datei ersetzen |
Ersetzt basierend auf Excel-Mapping |
Einfügen-Operationen
| Aufgabe |
Beschreibung |
| Vor Marker einfügen |
Fügt Text vor einem Marker ein |
| Hinter Marker einfügen |
Fügt Text nach einem Marker ein |
| An Position einfügen |
Fügt Text an einer bestimmten Position ein |
Entfernen-Operationen
| Aufgabe |
Beschreibung |
| Text entfernen |
Entfernt einen bestimmten Text |
| Text vor Marker entfernen |
Entfernt alles vor einem Marker |
| Erste/Letzte Zeichen entfernen |
Entfernt X Zeichen am Anfang/Ende |
| Regex-Ergebnis entfernen |
Entfernt Regex-Treffer |
| Leerzeilen entfernen |
Entfernt alle Leerzeilen |
| Zeilen mit Regex entfernen |
Entfernt Zeilen, die einem Muster entsprechen |
Zeilen-Operationen
| Aufgabe |
Beschreibung |
| Zeile X extrahieren |
Extrahiert nur eine bestimmte Zeile |
| Zeile X verschieben |
Verschiebt eine Zeile an eine andere Position |
| Zeilen mit Text verschieben |
Verschiebt Zeilen, die bestimmten Text enthalten |
9.9.2 Reihenfolge der Bereinigung
Mehrere Bereinigungsaufgaben werden in der definierten Reihenfolge ausgeführt. Verwenden Sie die Pfeiltasten, um die Reihenfolge anzupassen.
9.10 Verifikation: Text
Textverifikationen prüfen den extrahierten Wert auf bestimmte Bedingungen.
9.10.1 Verfügbare Prüfungen
| Prüfung |
Beschreibung |
| Text ist gleich |
Exakte Übereinstimmung |
| Text ist nicht gleich |
Keine Übereinstimmung |
| Text enthält |
Enthält den Suchbegriff |
| Text enthält nicht |
Enthält den Suchbegriff nicht |
| Text beginnt mit |
Startet mit dem Suchbegriff |
| Text endet mit |
Endet mit dem Suchbegriff |
| Text entspricht Regex |
Entspricht dem regulären Ausdruck |
| Text entspricht nicht Regex |
Entspricht nicht dem Ausdruck |
| Extrahierter Text ist leer |
Kein Wert extrahiert |
| Anzahl Zeichen |
Prüft die Textlänge |
| Anzahl Zeilen |
Prüft die Zeilenanzahl |
9.10.2 Zeichenverifikation
Prüft einzelne Zeichen an bestimmten Positionen:
| Prüfung |
Beschreibung |
| Ist Ziffer |
Zeichen ist 0-9 |
| Ist Buchstabe |
Zeichen ist A-Z oder a-z |
| Ist Großbuchstabe |
Zeichen ist A-Z |
| Ist Kleinbuchstabe |
Zeichen ist a-z |
| Ist alphanumerisch |
Zeichen ist Buchstabe oder Ziffer |
| Entspricht Regex |
Zeichen entspricht einem Muster |
9.11 Verifikation: Datum
Datumsverifikationen prüfen, ob der extrahierte Wert ein gültiges Datum ist.
9.11.1 Verfügbare Prüfungen
| Prüfung |
Beschreibung |
| Datum ist gültig |
Wert ist ein erkennbares Datum |
| Datum liegt zwischen |
Datum liegt im angegebenen Zeitraum |
Das System erkennt automatisch verschiedene Datumsformate: - 01.12.2024 (deutsch) - 12/01/2024 (amerikanisch) - 2024-12-01 (ISO) - 1. Dezember 2024 (mit Monatsname) - Dezember 2024 (Monatsname und Jahr, sofern die Suchoption “Datum ohne Tag” aktiviert ist)
9.12 Verifikation: Zahl
Zahlenverifikationen prüfen numerische Werte.
9.12.1 Verfügbare Prüfungen
| Prüfung |
Beschreibung |
| Zahl ist gültig |
Wert ist eine erkennbare Zahl |
| Zahl liegt zwischen |
Wert liegt im Bereich |
Erkannte Formate: - 1234 (ganzzahlig) - 1.234,56 (deutsch) - 1,234.56 (englisch) - -123,45 (negativ)
9.13 Verifikation: Abfrage
Abfrageverifikationen prüfen Werte basierend auf Bedingungen.
9.13.1 Verfügbare Prüfungen
| Prüfung |
Beschreibung |
| Abfrage liefert Ergebnis |
Die Abfrage gibt einen Wert zurück |
Die Formatierung ermöglicht die Nachbearbeitung des verifizierten Werts. Der wesentliche Unterschied zur Bereinigung ist, dass hier bei Ersetzungen das Suchwort vorkommen muss.
Leerzeichen am Anfang oder Ende: Fügen Sie in der Formatierung bewusst ein Leerzeichen am Anfang oder Ende ein (zum Beispiel “Füge ein an Position” mit dem Text ” “), bleibt es beim Einsetzen des Platzhalters erhalten. So entsteht ein bedingter Zusatz: Liefert die Regel”Kalenderjahr” den Wert ” 2025”, ergibt das Schema Beitragsaufwand<RuleId:3(Kalenderjahr)> den Namen “Beitragsaufwand 2025”. Liefert sie nichts (Option “Ermitteltes Ergebnis darf leer sein”, Abschnitt 9.2.5), bleibt es bei “Beitragsaufwand” ohne überzähliges Leerzeichen. Leerzeichen, die nicht aus einer solchen Einfügung stammen, werden am Anfang und Ende des Werts weiterhin entfernt.
9.15 Platzhalter verwenden
Extrahierte Werte können in vielen Kontexten als Platzhalter verwendet werden.
9.15.1 Platzhalter-Syntax
| Syntax |
Beschreibung |
<Regelname> |
Einfacher Platzhalter |
<RuleId:1(Regelname)> |
Vollständige Syntax mit ID |
<Regelname{DatePart}> |
Datumsteil extrahieren |
9.15.2 Datumsteile
| DatePart |
Beschreibung |
Beispiel |
Year4 |
Vierstelliges Jahr |
2024 |
Year2 |
Zweistelliges Jahr |
24 |
Month |
Monat (zweistellig) |
12 |
MonthName |
Monatsname |
Dezember |
MonthNameAbbreviated |
Monatsname kurz |
Dez |
Day |
Tag (zweistellig) |
15 |
Hour24 |
Stunde (00-23) |
14 |
Hour12 |
Stunde (01-12) |
02 |
Minute |
Minute (00-59) |
35 |
Second |
Sekunde (00-59) |
47 |
AmPm |
am/pm (AM/PM) |
PM |
Beispiel: <Rechnungsdatum{Year4}>-<Rechnungsdatum{Month}> ergibt “2024-12”
9.15.3 Fallback-Regeln
Wenn mehrere Regeln denselben Namen haben, wird die erste erfolgreiche Regel verwendet. Dies ermöglicht Fallback-Werte:
- Regel “Datum” - Versucht Extraktion aus Dokumenttext
- Regel “Datum” - Falls fehlgeschlagen: Verwendet Dateidatum
Die Rückfallregel kann auch die Datenquelle “Benutzerdefinierter Text” mit einem festen Wert sein, zum Beispiel “-”. Soll bei fehlendem Wert schlicht nichts eingesetzt werden, ist die Option “Ermitteltes Ergebnis darf leer sein” (Abschnitt 9.2.5) der einfachere Weg - sie kommt ohne zweite Regel aus.