Skip to main content
White Fox Automations
Wissen 8 Min. Lesezeit

Rechnungserkennung mit OCR: Wie der Mittelstand DATEV und sevDesk füllt

Eingangsrechnungen automatisch auslesen, prüfen und in DATEV oder sevDesk buchen: OCR-Pipeline, Validierungslogik und realistische Erkennungsraten für die Buchhaltung im Mittelstand.

Von Learoy Eichholz

Rechnungserkennung mit OCR: Wie der Mittelstand DATEV und sevDesk füllt · White Fox Automations Hamburg
Rechnungserkennung mit OCR: Wie der Mittelstand DATEV und sevDesk füllt. Foto: White Fox Automations, Hamburg.

Warum Rechnungen manuell abtippen Verschwendung ist

Jede Woche landen im Mittelstand zwischen 20 und 200 Eingangsrechnungen im Postfach oder als PDF im E-Mail-Anhang. Die Buchhaltung tippt Rechnungsnummer, Betrag, Datum, Lieferant und Kostenstelle ab, prüft die Umsatzsteuer-ID und bucht den Beleg in DATEV oder sevDesk. Bei 100 Rechnungen pro Woche kostet das zwischen 3 und 5 Stunden Arbeitszeit. Die Fehlerquote liegt bei manueller Eingabe zwischen 2 und 4 Prozent, weil Zahlendreher und Tippfehler unvermeidlich sind.

Eine OCR-Pipeline (Optical Character Recognition, optische Zeichenerkennung) liest strukturierte Daten aus Rechnungs-PDFs aus, validiert sie gegen Geschäftsregeln und schreibt sie direkt in Ihr Buchhaltungssystem. Sie sparen Zeit, senken die Fehlerquote und schaffen Kapazität für Tätigkeiten, die Urteilsvermögen verlangen.

Was OCR für Rechnungen technisch bedeutet

OCR erkennt Text in Bildern oder PDFs. Für Rechnungen benötigen Sie zusätzlich strukturiertes Parsing: Das System muss nicht nur Zeichen erkennen, sondern auch verstehen, wo Rechnungsnummer, Bruttobetrag, Steuersatz und Fälligkeitsdatum stehen. Klassische regelbasierte OCR (Tesseract, ABBYY) arbeitet mit Layout-Templates. Moderne Systeme nutzen Machine-Learning-Modelle, die auf Tausenden von Rechnungsformaten trainiert wurden (z. B. Amazon Textract, Google Document AI, Microsoft Azure Form Recognizer oder Open-Source-Modelle wie LayoutLM).

Eine vollständige Pipeline besteht aus fünf Schritten:

  1. Dokumenten-Eingang: E-Mail-Anhang, Scan-Ordner oder Upload-Formular.
  2. OCR-Verarbeitung: Extraktion von Text und strukturierten Feldern (Rechnungsnummer, Datum, Betrag, Lieferant, Steuersatz).
  3. Validierung: Prüfung auf Vollständigkeit, Plausibilität (Brutto = Netto + MwSt.) und Dubletten.
  4. Mapping: Zuordnung zu Kostenstellen, Projekten oder Sachkonten nach Geschäftsregeln.
  5. Buchung: Automatisches Anlegen des Belegs in DATEV oder sevDesk über API.

OCR-Pipeline im Mittelstand: Konkrete Bausteine

Wir setzen OCR-Pipelines für Eingangsrechnungen auf n8n oder Make um. Der typische Ablauf:

Schritt 1: Dokumenten-Eingang
E-Mails mit Anhängen landen in einem dedizierten Postfach (z. B. ). Ein Workflow prüft alle 15 Minuten neue Nachrichten, lädt PDF-Anhänge herunter und speichert sie in einem Cloud-Ordner (Nextcloud, SFTP oder S3-kompatiblen Bucket). Alternativ nutzen Sie einen Scan-Ordner, in den physische Belege nach dem Scannen abgelegt werden.

Schritt 2: OCR-Verarbeitung
Das PDF wird an einen OCR-Dienst geschickt. Wir empfehlen für den Mittelstand:

  • Amazon Textract (AWS): Erkennungsrate bei deutschsprachigen Rechnungen 92 bis 96 Prozent, kostet ca. 1,50 Euro pro 1.000 Seiten. EU-Hosting über die Region Frankfurt möglich.
  • Google Document AI: Ähnliche Genauigkeit, etwas günstiger (ca. 1,00 Euro pro 1.000 Seiten), EU-Region verfügbar.
  • Mindee (Open-Source-Alternative): Self-Hosted möglich, Erkennungsrate ca. 88 bis 92 Prozent, keine laufenden API-Kosten, dafür höherer Setup-Aufwand.

Das Ergebnis ist ein JSON-Objekt mit strukturierten Feldern:

{
  "invoice_number": "RE-2024-00123",
  "invoice_date": "2024-03-15",
  "due_date": "2024-04-14",
  "supplier_name": "Musterbau GmbH",
  "supplier_vat_id": "DE123456789",
  "net_amount": 5000.00,
  "tax_rate": 19,
  "tax_amount": 950.00,
  "gross_amount": 5950.00,
  "line_items": [
    {
      "description": "Stahlträger 200x100mm",
      "quantity": 50,
      "unit_price": 100.00,
      "total": 5000.00
    }
  ]
}

Schritt 3: Validierung
Der Workflow prüft:

  • Ist die Rechnungsnummer eindeutig? Existiert sie bereits in DATEV oder sevDesk?
  • Stimmt Brutto = Netto + (Netto × Steuersatz)?
  • Ist das Rechnungsdatum plausibel (nicht in der Zukunft, nicht älter als 12 Monate)?
  • Ist die Umsatzsteuer-ID formal korrekt (DE gefolgt von 9 Ziffern)?

Fehlt ein Pflichtfeld oder schlägt eine Validierung fehl, wird die Rechnung in eine manuelle Prüfliste geschrieben. Die Buchhaltung erhält eine Slack- oder E-Mail-Benachrichtigung mit Link zum Original-PDF.

Schritt 4: Mapping
Geschäftsregeln ordnen Rechnungen automatisch zu:

  • Lieferant “Musterbau GmbH” wird Kostenstelle “Baustelle Nord” und Sachkonto 4400 (Roh-, Hilfs- und Betriebsstoffe) zugeordnet.
  • Rechnungen über 10.000 Euro werden automatisch als “Freigabe erforderlich” markiert und an die Geschäftsführung gemailt.
  • Artikel mit dem Schlagwort “Werkzeug” landen in Kostenstelle “Werkstatt”.

Diese Regeln hinterlegen Sie als Tabelle (CSV, Airtable oder direkt im Workflow).

Schritt 5: Buchung
DATEV bietet eine REST-API (DATEVconnect) für die Beleganlage. sevDesk hat eine vollständige REST-API mit Dokumentation unter api.sevdesk.de. Der Workflow erstellt einen neuen Beleg, hängt das Original-PDF als Anhang an und setzt den Status auf “offen” oder “freigegeben”, je nach Mapping-Regel.

Realistische Erkennungsraten und Fehlerquellen

Selbst moderne OCR-Systeme erreichen keine 100 Prozent. Typische Fehlerquellen:

  • Handschriftliche Ergänzungen: Notizen auf der Rechnung (z. B. “Rechnung geprüft, OK”) werden als Teil der Rechnungsnummer erkannt.
  • Schlechte Scan-Qualität: Faxe, Durchschläge oder fotografierte Belege liefern Erkennungsraten unter 80 Prozent.
  • Exotische Layouts: Rechnungen aus dem Ausland oder von kleinen Handwerksbetrieben ohne Vorlage.
  • Mehrseitige Rechnungen: Positionstabellen, die über mehrere Seiten laufen, werden nicht immer korrekt zusammengeführt.

In der Praxis erreichen Sie mit guter Scan-Qualität und deutschsprachigen Standard-Rechnungen eine Durchlaufrate von 85 bis 92 Prozent vollautomatisch. Die restlichen 8 bis 15 Prozent landen in der manuellen Prüfliste. Das ist immer noch eine Zeitersparnis von 70 bis 80 Prozent.

DATEV vs. sevDesk: Welche API passt

DATEV ist im Mittelstand Standard, wenn Sie mit einem Steuerberater zusammenarbeiten. Die API (DATEVconnect) erfordert eine Registrierung als Partner, OAuth2-Flow und die Zustimmung des Mandanten. Die Dokumentation ist umfangreich, aber nicht immer praxisnah. Vorteil: Nahtlose Integration in die Fibu-Welt des Steuerberaters.

sevDesk richtet sich an kleinere Unternehmen und bietet eine moderne REST-API mit Swagger-Dokumentation. Der Einstieg ist deutlich einfacher, die API-Limits großzügig (1.000 Requests pro Stunde im Standard-Tarif). Nachteil: Weniger verbreitet bei Steuerberatern, Export für DATEV notwendig.

Für OCR-Pipelines spielt die Wahl der Buchhaltungssoftware eine untergeordnete Rolle. Beide Systeme lassen sich über API ansprechen, die Datenstruktur ist ähnlich. Entscheidend ist, ob Ihr Steuerberater DATEV erwartet oder Sie die Buchhaltung intern abwickeln.

Was nicht funktioniert: Typische Fehlannahmen

“OCR ersetzt die Buchhaltung.”
Nein. OCR automatisiert die Dateneingabe, nicht die fachliche Prüfung. Sachkonten, Kostenstellen und steuerliche Bewertung bleiben menschliche Aufgaben. Eine Pipeline entlastet, ersetzt aber keine Fachkraft.

“Einmal einrichten, dann läuft es für immer.”
Lieferanten ändern Rechnungsformate, neue Lieferanten kommen hinzu, Geschäftsregeln werden angepasst. Planen Sie monatlich 1 bis 2 Stunden für Wartung und Optimierung ein.

“Kostenlose OCR ist genauso gut.”
Open-Source-Tools wie Tesseract erreichen bei strukturierten Rechnungen Erkennungsraten zwischen 70 und 85 Prozent. Für Serienbetrieb im Mittelstand lohnt sich ein kommerzieller Dienst mit höherer Genauigkeit.

“DSGVO verbietet Cloud-OCR.”
Nein, wenn Sie einen EU-Anbieter mit AV-Vertrag (Auftragsverarbeitungsvertrag) nutzen. Amazon Textract in Frankfurt, Google Document AI in Belgien und Azure Form Recognizer in den Niederlanden erfüllen alle DSGVO-Anforderungen. Alternativ hosten Sie ein Open-Source-Modell auf eigener Infrastruktur.

Was Sie jetzt tun können

Wenn Sie monatlich mehr als 80 Eingangsrechnungen verarbeiten, rechnet sich eine OCR-Pipeline nach 3 bis 6 Monaten. Die Investition liegt bei 4.000 bis 8.000 Euro für Setup, Integration und Schulung. Die laufenden Kosten (API-Nutzung, Hosting, Wartung) betragen zwischen 50 und 150 Euro pro Monat, je nach Volumen.

Wir bauen OCR-Pipelines für DATEV und sevDesk auf n8n oder Make, integrieren Validierungslogik und Geschäftsregeln und schulen Ihr Team in der Pflege der Pipeline. Wenn Sie Ihre Eingangsrechnungen automatisiert verarbeiten möchten, sprechen Sie uns an.

Sprechen Sie mit uns

Sie möchten das in Ihrem Betrieb umsetzen? Wir bauen die passende Maschine mit Ihnen.

Telefon: 040 468 967 680
E-Mail: info@whitefox-automations.com
Oder über unser Kontaktformular.

Wenn Sie das praktisch umsetzen wollen

Alle Insights ansehen

30 Minuten · kostenlos · unverbindlich

Schreiben Sie uns kurz, wo bei Ihnen der Schuh drückt.

Sie bekommen innerhalb eines Werk­tags eine Antwort. Kein Verkaufs­gespräch, keine E-Mail-Strecke. Florian oder ein Kollege ruft Sie an, hört zu und ordnet ein, ob wir die Richtigen sind.

Florian Wessling Learoy Eichholz Arno Hoffrichter

Persönlicher Rückruf

Wir rufen Sie persönlich zurück.

Sie schreiben hier, jemand aus unserem Hamburger Team meldet sich. Kein Sales-Team, kein Call-Center, keine E-Mail-Strecke. Wir hören zu, ordnen ein und sagen Ihnen ehrlich, ob unsere Lösung zu Ihrer Situation passt.

Das White-Fox-Team · Hamburg

Lieber sofort anrufen?

+49 40 46 89 67 68 0

Oder per E-Mail an

info@whitefox-automations.com

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Bearbeitung Ihrer Anfrage verwenden. Details in unserem Datenschutz. Datenschutz .

Anrufen Erstgespräch