PDF-Anhänge nach Inhalt durchsuchen: Regeln, die den Rechnungstext lesen

Von Thomas Postler, Geschäftsführer PSE GmbH · Veröffentlicht 07.09.2026 · Lesezeit ca. 5 Minuten

Bisher konnten Regeln in MailWerk eine Rechnung an dem erkennen, was außen dranstand: am Betreff, am Absender, am Dateinamen des Anhangs. Das reicht oft — aber längst nicht immer. Viele Rechnungen kommen mit nichtssagendem Betreff („Ihre Unterlagen"), von wechselnden Absenderadressen oder mit einem Dateinamen wie dokument_final_2.pdf. Das Entscheidende steht dann nur im PDF: die Kundennummer, der Lieferant, die Vertragsnummer. Genau da setzt die neue Bedingung an: MailWerk kann jetzt den Text eines PDF-Anhangs durchsuchen und eine Regel davon abhängig machen, was wirklich drinsteht.

Kurz beantwortet: Die Regelbedingung „PDF-Anhang enthält" prüft den extrahierten Text aller PDF-Anhänge einer Mail auf eine beliebige Zeichenkette — Kundennummer, Lieferant, Stichwort. Trifft sie zu, laufen die gewohnten Aktionen: ablegen, weiterleiten, verschieben, einer Löschfrist oder Aufgabe zuordnen.

Warum Betreff und Dateiname als Erkennung oft nicht genügen

Wer Eingangsrechnungen automatisch erfassen will, kämpft in der Praxis mit drei Mustern, die wir aus unseren eigenen Postfächern und aus Kundenprojekten kennen:

  • Aussagelose Betreffe: „Rechnung", „Invoice", „Ihre Rechnung August" — oder eben gar kein Hinweis. Eine Betreff-Regel greift dann entweder zu breit oder gar nicht.
  • Wechselnde Absender: Große Anbieter versenden über billing@, no-reply@, Rechenzentren oder Marktplätze — die Adresse ändert sich, die Kundennummer im PDF bleibt.
  • Beliebige Dateinamen: RE_1007.pdf, download.pdf, scan0001.pdf. Der Dateiname trägt selten das, wonach du eigentlich sortieren willst.

Die verlässlichste Konstante ist fast immer der Inhalt: Die Kundennummer 0815, die Vertragsnummer oder der Firmenname steht auf praktisch jeder Rechnung desselben Lieferanten — Ausgabe für Ausgabe an derselben Stelle im PDF. Genau darauf lässt sich jetzt eine Regel bauen.

So funktioniert die Bedingung „PDF-Anhang enthält"

Im Regeleditor ziehst du den Baustein „PDF-Inhalt" in die Bedingungen und trägst den gesuchten Text ein. MailWerk liest beim Eingang den Text aller PDF-Anhänge der Mail und prüft, ob deine Zeichenkette darin vorkommt. In der Klartext-Vorschau, die jede Regel als lesbaren Satz zeigt, sieht das so aus:

Wenn ein PDF-Anhang „0815" enthält, dann speichere alle Anhänge in NextCloud unter „Rechnungen/Lieferant/%%JAHR%%" und verschiebe die Mail nach „Rechnungen".

Die Bedingung verhält sich wie jede andere in MailWerk: Groß- und Kleinschreibung wird standardmäßig ignoriert, du kannst sie mit UND und ODER zu Gruppen verknüpfen und mit „Umkehren (NICHT)" ins Gegenteil drehen — etwa „PDF-Anhang enthält NICHT ‚Storno'". So baust du auch feine Unterscheidungen: (PDF enthält „Kundennummer 12345") UND (PDF enthält NICHT „Mahnung"). Wie du Bedingungen sauber kombinierst und gefahrlos testest, steht ausführlich in E-Mail-Regeln erstellen.

Drei Praxisbeispiele, die sofort Zeit sparen

1. Rechnungen nach Kundennummer in getrennte Ordner

Du betreust mehrere Mandanten oder Standorte, und jeder hat beim selben Lieferanten eine eigene Kundennummer? Lege je Kundennummer eine Regel an — „PDF-Anhang enthält 007" → Ablage nach Rechnungen/Standort-Nord/%%JAHR%%. Der Betreff darf dabei völlig egal sein. Die Aktion dahinter ist die vertraute Anhang-Ablage mit variablen Pfaden, wie in Belege automatisch speichern beschrieben.

2. Eine Lieferantenrechnung sicher erkennen — trotz Fantasie-Betreff

Manche Anbieter verschicken Rechnungen als kommentarlose Bestellbestätigung. Statt am Betreff hängst du die Regel am Firmennamen oder der Umsatzsteuer-ID im PDF auf: „PDF-Anhang enthält ‚Musterlieferant GmbH'" → weiterleiten an die Buchhaltung und nach „Rechnungen" verschieben. Kombiniert mit dem kompletten Ablauf aus Rechnungseingang automatisieren wird daraus ein Ende-zu-Ende-Prozess ohne Handarbeit.

3. Nur echte Rechnungen, keine Angebote

Angebote und Auftragsbestätigungen sehen im Postfach fast aus wie Rechnungen. Ein zusätzliches Kriterium auf den Inhalt trennt sie sauber: (PDF enthält „Rechnungsnummer") UND (PDF enthält NICHT „Angebot"). So wandert nur, was wirklich zu bezahlen ist, in den Rechnungs-Workflow.

Ehrliche Grenzen — was die Funktion nicht tut

Transparenz ist uns wichtiger als ein großes Versprechen, deshalb die klaren Grenzen:

  • Keine Texterkennung für Bild-Scans: Durchsucht wird die Textebene des PDFs. Digital erzeugte Rechnungen haben sie praktisch immer; ein reiner Foto- oder Scan-PDF ohne OCR enthält keinen durchsuchbaren Text. Damit keine Regel dann falsch greift, gilt ein solches PDF bewusst als „enthält nicht". Verschlüsselte oder beschädigte PDFs ebenso.
  • Keine Feld-Extraktion: Die Funktion prüft, ob ein Text vorkommt — sie zieht keine Beträge, Daten oder Rechnungsnummern strukturiert heraus und bucht nichts. Sie macht die Erkennung treffsicher; verarbeitet wird mit den gewohnten Aktionen.
  • Sinnvoll dimensioniert: Der PDF-Text wird nur gelesen, wenn eine Regel ihn braucht, und je Mail nur einmal. Sehr große Dateien jenseits von 25 MB werden nicht ausgewertet.

Kurz: Für die typische, digital erzeugte Lieferantenrechnung ist die Erkennung über den Inhalt ein Volltreffer. Für Papier, das erst abfotografiert wurde, bleibt der Betreff oder der Absender das bessere Kriterium.

In vier Schritten eingerichtet

  1. Echte Rechnung öffnen: Nimm eine bereits eingegangene Rechnung des Lieferanten und schau ins PDF, welcher Text zuverlässig vorkommt (Kundennummer, Firmenname, Vertragsnummer).
  2. Regel anlegen: Bedingung „PDF-Anhang enthält" mit genau diesem Text. Tipp: die Zeichen am besten abtippen statt aus dem PDF-Viewer kopieren — beim Kopieren rutschen manchmal unsichtbare Steuerzeichen mit hinein.
  3. Testen: Der Regeltest führt die Bedingung an einer echten Mail aus und zeigt, ob der PDF-Text getroffen wurde — erst danach schaltest du die Regel scharf.
  4. Aktion wählen: ablegen, weiterleiten, verschieben, einer Löschfrist oder Aufgabe zuordnen — beliebig kombinierbar in einem Durchlauf.

Häufige Fragen

Kann MailWerk den Inhalt eines PDF-Anhangs durchsuchen?

Ja — die Bedingung „PDF-Anhang enthält" durchsucht den Text aller PDF-Anhänge einer Mail nach einer beliebigen Zeichenkette (Kundennummer, Lieferant, Stichwort). Groß-/Kleinschreibung wird ignoriert; UND/ODER und eine NICHT-Umkehrung sind wie bei jeder Bedingung möglich.

Funktioniert das auch bei eingescannten PDFs?

Nur mit Textebene. Digitale Rechnungen haben sie praktisch immer; reine Bild-Scans ohne OCR enthalten keinen durchsuchbaren Text und gelten als „nicht enthalten". Eine Texterkennung für Bilder ist bewusst nicht eingebaut.

Liest MailWerk damit Beträge oder Rechnungsnummern aus?

Nein. Die Funktion prüft nur, ob ein Text vorkommt — sie extrahiert keine Felder und bucht nichts. Verarbeitet wird mit den gewohnten Aktionen.

Belastet die PDF-Prüfung den Server?

Kaum: Der Text wird nur gelesen, wenn eine Regel ihn braucht, und je Mail nur einmal. Dateien über 25 MB werden nicht ausgewertet.

Kann ich Rechnungen nach Kundennummer automatisch sortieren?

Ja — je Kundennummer eine Regel „PDF-Anhang enthält …" mit eigenem Zielordner oder eigener Weiterleitung. Der Betreff spielt dann keine Rolle mehr.

Jetzt kostenlos testen

7 Tage kostenlos · alle Funktionen · keine Zahlungsdaten

Weiterlesen

Über den Autor

Thomas Postler ist Geschäftsführer der PSE GmbH (Eckental, Amtsgericht Fürth, HRB 15084) und verantwortet die Entwicklung von MailWerk. Die Inhalts-Erkennung von PDF-Rechnungen entstand aus dem eigenen Rechnungseingang der PSE GmbH und läuft dort produktiv. Fragen? Sprich uns direkt an.

Entwickelt & betrieben in Deutschland DSGVO-konform, AVV auf Anfrage Persönlicher Support statt Ticketschleife Transparent: Impressum & Datenschutz