Zur Übersicht

21.8.2026

Simon Eckert

t2k releast docTR 1.1.0: Von reiner Texterkennung zum ganzheitlichen Dokumentenverständnis

Eine Frage beantwortet docTR bereits sehr gut: Welche Wörter befinden sich in diesem Dokument an welcher Position? Über einen zweistufigen Prozess aus Detektion und Erkennung liefert die Software verlässlich Wörter samt Bounding Boxes und Konfidenzwerten. Für einige Anwendungsfälle genügt dieser Funktionsumfang. Für einen entscheidenden Geschäftsprozess in der Praxis reicht es jedoch nicht: Die ganzheitliche, strukturierte Untersuchung und Weiterverarbeitung komplexer Dokumente. Eine reine Ansammlung isolierter Wörter verrät nicht, ob eine Zeile eine entscheidende Überschrift bildet, ob zwölf Textboxen eine mehrspaltige Tabelle darstellen oder in welcher logischen Reihenfolge Randspalten und Haupttext gelesen werden müssen. Ohne diesen Kontext gehen wertvolle Informationen verloren oder müssen aufwendig manuell nachbearbeitet werden. Unsere Lösung: Ganzheitliches Dokumentenverständnis mit docTR 1.1.0.

Drei neue, nahtlos integrierte Kernbausteine heben die automatisierte Dokumentenverarbeitung auf ein neues Level:

  1. Intelligente Layout-Analyse: Erkennt logische Abschnitte, Überschriften, Fußnoten und Textblöcke automatisch
  2. Präzise Tabellenstruktur-Erkennung: Rekonstruiert komplexe Tabellen samt Zeilen- und Spaltenzuordnungen exakt
  3. Logisches Lesereihenfolge-Modul: Garantiert den korrekten inhaltlichen Ablauf – selbst bei mehrspaltigen Dokumenten oder komplexen Layouts. Für eine schnelle und nahtlose Integration in bestehende Systeme wird zudem ein Command Line Interface zur Verfügung gestellt – schnelle Lösungen, keine Programmierung erforderlich.

Layout-Analyse

Die neuen Modelle lw_detr_s und lw_detr_m lokalisieren und klassifizieren die visuellen Elemente einer Seite in elf Klassen:

  • Bild-/Tabellenunterschrift
  • Fußnote
  • Formel
  • Listenelement
  • Fußzeile
  • Kopfzeile
  • Abbildung
  • Abschnittsüberschrift
  • Tabelle
  • Fließtext
  • Dokumententitel

Anders andere Layout-Detektoren können die Modelle auch rotierte und schiefe Seiten verarbeiten. lw_detr_s verwendet 15,1 Mio. Parameter und benötigt nur rund 0,5 Sekunden pro Seite eines Dokuments bei Ausführung auf einer CPU (Intel i7-11800H).

Layouterkennung.jpg

Weitere Informationen sind im offiziellen Repository von docTR zu finden.

Kontaktieren Sie uns und bringen Sie Ihre Dokumenten-Pipelines auf das nächste Level

Warum docTR 1.1.0 der Schlüssel für Ihre automatisierte Dokumentenverarbeitung ist:

  • Massive Zeit- und Kostenersparnis: Keine manuellen Nacherfassungen oder aufwendigen Custom-Skripte zur Strukturerkennung mehr.
  • Nahtlose Weiterverarbeitung für KI & LLMs: Das ausgegebene Markdown eignet sich perfekt als strukturierter Input für Large Language Models (LLMs) und RAG-Pipelines.
  • Höhere Datenqualität: Vermeiden Sie Fehlinterpretationen bei Verträgen, Rechnungen und Berichten durch automatisches Kontextverständnis.

Möchten Sie docTR in Ihrer eigenen Umgebung testen oder anpassen? Kontaktieren Sie uns für eine gemeinsame Bestandsaufnahme oder eine individuelle Demonstration.