Belege per OCR auslesen: wo die Texterkennung in der Kanzlei an Grenzen stößt
OCR-Software erkennt auf einem gut lesbaren Beleg Betrag, Datum, Rechnungsnummer und Aussteller meist zuverlässig. Typische Fehler entstehen bei unscharfen Fotos, verblasstem Thermopapier, mehreren Steuersätzen auf einem Beleg, verwechselbaren Zeichen in UID-Nummern und Belegen mit mehreren Seiten. Die Texterkennung beantwortet aber nur die Frage, was auf dem Beleg steht – nicht, ob der Beleg vollständig und verwendbar ist. Diese Prüfung bleibt ein eigener Schritt.
Was OCR bei Belegen tatsächlich leistet
OCR (optische Zeichenerkennung) wandelt ein Bild oder PDF in maschinenlesbaren Text um. Moderne Systeme gehen darüber hinaus und ordnen die erkannten Werte Feldern zu: Rechnungsdatum, Rechnungsnummer, Bruttobetrag, Nettobetrag, Steuerbetrag, Aussteller, UID-Nummer. Bei einer sauberen PDF-Rechnung eines bekannten Lieferanten funktioniert das in der Regel gut. Der Text ist ohnehin digital vorhanden, das Layout ist gleichbleibend, die Felder stehen an erwartbaren Stellen. In diesem Fall spart die Texterkennung tatsächlich Tipparbeit. Schwieriger wird es bei allem, was nicht diesem Idealfall entspricht – und in einer Kanzlei mit mehreren hundert Mandanten ist das ein erheblicher Teil der Belege.
Sechs Stellen, an denen die Erkennung regelmäßig danebenliegt
1. Unscharfe oder schräge Fotos Ein mit dem Handy fotografierter Beleg ist oft leicht verwackelt, schräg oder teilweise im Schatten. Die Software liest trotzdem etwas – aber nicht unbedingt das Richtige. Aus einer 8 wird eine 3, aus 1.240,00 wird 124,00. 2. Verblasstes Thermopapier Kassenbons aus Thermodruckern verblassen mit der Zeit. Wird der Bon erst Wochen nach dem Kauf fotografiert, sind Beträge oder Datum teilweise nicht mehr erkennbar. Die OCR liefert dann Lücken oder Zufallswerte. 3. Mehrere Steuersätze auf einem Beleg In Österreich stehen auf einem Beleg häufig Positionen mit 20, 13 und 10 Prozent nebeneinander, etwa bei Gastronomie- oder Handelsbelegen. Die Erkennung des Gesamtbetrags gelingt meist, die korrekte Aufteilung nach Steuersätzen deutlich seltener. 4. Verwechselbare Zeichen in der UID Eine österreichische UID beginnt mit ATU, gefolgt von acht Ziffern. Die Buchstaben O und I werden leicht mit den Ziffern 0 und 1 verwechselt. Eine falsch gelesene UID sieht auf den ersten Blick plausibel aus und fällt erst bei einer formalen Prüfung auf. 5. Datumsformate und Leistungszeitraum Rechnungsdatum, Lieferdatum und Leistungszeitraum stehen oft nah beieinander. Die Software übernimmt dann das falsche Datum, oder sie liest 03.04. je nach Einstellung als 3. April oder 4. März. 6. Mehrseitige Belege und Sammel-PDFs Hat eine Rechnung zwei Seiten und steht die Summe erst auf der zweiten, oder enthält ein PDF mehrere Rechnungen, liest die Erkennung häufig nur einen Teil – oder erzeugt aus einem Dokument mehrere Belege.
Lesen ist nicht Prüfen
Selbst wenn jedes Zeichen korrekt erkannt wird, bleibt eine zweite Frage offen: Ist dieser Beleg vollständig und verwendbar? Die Texterkennung stellt fest, dass auf dem Beleg ein Betrag von 1.850 Euro steht. Sie stellt nicht fest, dass bei diesem Betrag die UID des Ausstellers fehlt, obwohl eine Rechnung über 400 Euro sie nach § 11 UStG enthalten muss. Sie stellt nicht fest, dass dieselbe Rechnung vor zwei Wochen schon einmal als Foto eingereicht wurde. Und sie stellt nicht fest, dass in der Rechnungsnummernfolge eines Mandanten eine Nummer fehlt. Diese Prüfungen setzen Regeln und Kontext voraus: Schwellenwerte, den Belegbestand des Mandanten, die Stammdaten. Ein OCR-Ergebnis ist ihr Ausgangsmaterial, nicht ihr Ersatz.
Wo sich der Aufwand dadurch verschiebt
Kanzleien, die OCR einführen, sparen Zeit bei der Erfassung. Gleichzeitig entsteht ein neuer Arbeitsschritt: die Kontrolle der erkannten Werte. Wer die OCR-Ergebnisse ungeprüft übernimmt, verlagert Fehler vom Erfassen in die Buchhaltung – wo sie später und aufwendiger korrigiert werden müssen, im ungünstigsten Fall erst beim Abschluss. Der Gesamtaufwand sinkt deshalb nur dann spürbar, wenn zwei Dinge zusammenkommen: eine Erkennung, die unsichere Werte als unsicher kennzeichnet, statt sie stillschweigend zu übernehmen, und eine Prüfung, die fehlerhafte oder unvollständige Belege aussortiert, bevor sie in die Erfassung gelangen.
Was sich in der Praxis bewährt
- Unsichere Werte sichtbar machen: Eine Erkennung, die bei jedem Feld angibt, wie sicher sie ist, erlaubt eine gezielte Nachkontrolle statt einer Vollprüfung. - Bildqualität beim Eingang prüfen: Ein unscharfes Foto wird am besten im Moment des Hochladens zurückgewiesen, solange der Mandant den Beleg noch in der Hand hat. - Plausibilität gegen Stammdaten: Eine erkannte UID, die nicht zum bekannten Lieferanten passt, ist ein Hinweis auf einen Lesefehler oder auf einen falsch zugeordneten Beleg. - Summenkontrolle: Stimmen Netto, Steuer und Brutto rechnerisch nicht überein, ist mindestens ein Wert falsch gelesen.
Häufige Fragen
Bei digital erstellten PDF-Rechnungen sehr zuverlässig, weil der Text bereits maschinenlesbar vorliegt. Bei Fotos von Papierbelegen hängt die Qualität stark von Schärfe, Licht und Zustand des Belegs ab. Eine feste Fehlerquote lässt sich nicht angeben, weil sie vom Belegmix der jeweiligen Mandanten abhängt.
Nein. Die Texterkennung liest, was auf dem Beleg steht. Ob etwas fehlt – etwa die UID über 400 Euro –, ergibt sich erst aus einer nachgelagerten Prüfung gegen die Anforderungen des § 11 UStG.
Weil sie meist auf Thermopapier gedruckt sind, das mit der Zeit verblasst, und weil sie häufig spät und unter ungünstigen Bedingungen fotografiert werden. Dazu kommen schmale Formate und mehrere Steuersätze auf einem Bon.
Nein. OCR beschleunigt die Erfassung, prüft aber weder Vollständigkeit noch Dubletten oder Nummernkreise. Diese Kontrolle bleibt ein eigener Schritt, der idealerweise vor der Erfassung stattfindet.
Passend dazu
Von der Annahme bis zur Buchung durchläuft ein einzelner Beleg mehr Arbeitsschritte, als in der Kanzlei sichtbar ist – und an jedem davon kann Zeit verloren gehen.
Abgebrochene Importe, doppelte Buchungen, falsche Steuercodes: Die sechs Ursachen, an denen der Belegimport in BMD regelmäßig hängt – und wo sie tatsächlich entstehen.
Derselbe Beleg als Foto und als PDF: Unentdeckte Duplikate führen zu doppelten Buchungen und doppelt gezogener Vorsteuer. Wie man sie zuverlässig erkennt.
