Wer ein öffentliches Bauvorhaben kalkulieren will, steht fast immer vor demselben ersten Schritt: Das Leistungsverzeichnis liegt als PDF in den Vergabeunterlagen — oft als eingescanntes Dokument, manchmal über hunderte Positionen, gelegentlich zweispaltig oder mit fortgeschriebenen Mengen über mehrere Seiten. Bevor überhaupt kalkuliert werden kann, müssen diese Positionen strukturiert erfasst werden. Von Hand abzutippen kostet Stunden und erzeugt Fehler; generische PDF-Konverter liefern eine Textwüste ohne Struktur. Dieser Artikel erklärt, was automatische Positionsextraktion leistet, warum ein Bau-LV besondere Anforderungen stellt und woran allgemeine Werkzeuge scheitern.
LV-Positionsextraktion ist das automatische Erkennen und Strukturieren der einzelnen Leistungspositionen eines Leistungsverzeichnisses aus einer unstrukturierten Vorlage — typischerweise ein PDF (auch ein Scan), Word, Excel oder ein Bild. Ziel ist, aus dem Fließtext je Position die kalkulationsrelevanten Felder herauszulösen: Ordnungszahl (OZ), Kurz- und Langtext, Menge, Mengeneinheit und, falls angegeben, Einheits- und Gesamtpreis. Anders als ein reiner PDF-zu-Text-Export erkennt eine gute Extraktion die hierarchische Gliederung eines LVs (Titel, Lose, Positionen) und die verschiedenen Positionsarten — und liefert damit eine Struktur, die sich direkt weiterverarbeiten und bepreisen lässt.
Warum ein Bau-LV kein gewöhnliches PDF ist
Ein Leistungsverzeichnis ist ein hochstrukturiertes Dokument, das nur zufällig wie Fließtext aussieht. Diese Struktur ist der Grund, warum generische Werkzeuge scheitern:
- Ordnungszahl-Hierarchie: Positionen sind über Ordnungszahlen in Titel, Untertitel und Lose gegliedert (z. B.
01.02.0030). Wer die Hierarchie verliert, weiß später nicht mehr, zu welchem Gewerk oder Bauteil eine Position gehört. - Kurztext und Langtext: Jede Position hat einen knappen Kurztext für die Übersicht und einen ausführlichen Langtext mit der eigentlichen Leistungsbeschreibung, technischen Anforderungen und Verweisen auf Normen. Beide gehören zusammen, stehen im PDF aber oft auf verschiedenen Zeilen oder Seiten.
- Menge und Einheit: Ohne die korrekte Zuordnung von Menge und Mengeneinheit (m², m³, Stück, psch) zur richtigen Position ist keine Kalkulation möglich — und genau hier verrutschen Tabellenextraktoren am häufigsten.
- Positionsarten: Normalpositionen, Bedarfs- bzw. Eventualpositionen, Grund- und Alternativpositionen, Zulagepositionen und Stundenlohnarbeiten müssen unterschieden werden. Eine Eventualposition, die versehentlich als Normalposition kalkuliert wird, verfälscht die Angebotssumme.
- Bietertextergänzungen und Auswahlpositionen: Lücken, die der Bieter selbst füllt oder aus denen er auswählt — ein reines Text-Extrakt übersieht sie.
Ein Bau-LV verlangt also nicht Texterkennung, sondern Verständnis der LV-Logik. Das ist der entscheidende Unterschied.
Woran generische PDF-Tools scheitern
Werkzeuge zur allgemeinen PDF- oder Tabellenextraktion — von Office-Konvertern bis zu Data-Extraction-Diensten — sind auf Rechnungen, Formulare oder tabellarische Datensätze optimiert. Auf ein Leistungsverzeichnis angewendet, treten typische Fehler auf:
- Struktur geht verloren. Der Export liefert Text in Lesereihenfolge, aber ohne OZ-Hierarchie und ohne die Zuordnung, welche Menge zu welcher Position gehört. Aus einer sauberen Gliederung wird eine flache Liste.
- Scans bleiben unlesbar oder fehlerhaft. Viele Vergabeunterlagen sind eingescannt. Ohne verlässliche Texterkennung (OCR) auf schlechten Scans entstehen Zahlendreher bei Mengen — der teuerste Fehlertyp in der Kalkulation.
- Mehrspaltige und seitenübergreifende Positionen zerreißen. Läuft ein Langtext über einen Seitenumbruch oder steht das LV zweispaltig, mischen einfache Extraktoren Zeilen aus verschiedenen Positionen.
- Keine fachliche Prüfbarkeit. Selbst wenn Text herausfällt, fehlt der Bezug zurück zur Fundstelle. Man kann nicht nachvollziehen, aus welcher Seite und Zeile eine Menge stammt — und muss am Ende doch alles gegenlesen.
Das Ergebnis: Man spart das Abtippen nicht wirklich, weil die Nachkontrolle genauso lange dauert. Für eine belastbare Kalkulation braucht es eine Extraktion, die die LV-Struktur kennt und ihre Ergebnisse belegt.
Der Sonderfall GAEB: strukturiert von Anfang an
Liegt das LV im GAEB-Format (X81, X83, X84, X86) vor, ist die Struktur bereits maschinenlesbar enthalten — Ordnungszahlen, Texte, Mengen und Einheiten sind sauber getrennt. Dann ist keine Bild- oder Texterkennung nötig, sondern ein korrektes Einlesen des Formats. In der Praxis stellen öffentliche Auftraggeber aber sehr häufig nur ein PDF bereit, oder GAEB und PDF nebeneinander. Ein Werkzeug sollte deshalb beides beherrschen: das strukturierte GAEB direkt verarbeiten und, wo es fehlt, die Positionen aus dem PDF rekonstruieren. Mehr zu den Formaten in unseren Beiträgen GAEB-Dateiformate erklärt und X83 vs. X84.
Wie Vergabescanner Positionen ausliest
Vergabescanner ist auf genau diese Aufgabe für deutsche Bau- und Handwerksbetriebe zugeschnitten. Die KI liest die Positionen aus den gängigen Formaten aus:
- PDF, auch gescannte Dokumente — gescannte Seiten, Pläne und Grundrisse werden als Bilddaten per KI-Vision ausgewertet, nicht nur als Text.
- Word, Excel, Bilder und GAEB (X81/X83/X84/X86) — strukturierte Formate werden direkt eingelesen.
- Erkannt werden Ordnungszahl, Kurztext, Langtext, Menge und Einheit je Position, eingeordnet in die Titel- und Los-Gliederung des LVs.
Entscheidend ist die Prüfbarkeit: Jede extrahierte Position trägt einen Quellenverweis auf die exakte Stelle im Original — Dokument, Seite und Zitat. So bleibt jede Menge und jeder Text nachvollziehbar, statt blind übernommen zu werden. Das verwandelt die Nachkontrolle von „alles neu gegenlesen” in „Stichprobe am Beleg prüfen”.
Von der Extraktion zur Kalkulation
Die Extraktion ist kein Selbstzweck — sie ist die Voraussetzung für die eigentliche Arbeit: die Kalkulation. Aus den erkannten Positionen erzeugt Vergabescanner eine BOM-basierte Vorkalkulation (Material, Lohnzeit, Nebenleistung) auf Basis Ihrer eigenen, gewerk-spezifischen Preisprofile. Damit schließt sich die Kette vom PDF bis zum bepreisten Angebot ohne Medienbruch — der Punkt, an dem sich integrierte Werkzeuge von reinen Extraktoren unterscheiden (siehe unseren Tool-Vergleich). Wer das ausprobieren möchte, kann eine LV-Kalkulation kostenlos testen.
Grenzen und Qualitätssicherung
Keine automatische Extraktion ist zu 100 % fehlerfrei — schlechte Scans, ungewöhnliche LV-Layouts und mehrdeutige Angaben bleiben eine Herausforderung. Genau deshalb ist der Quellenverweis so wichtig: Er macht die Ergebnisse fachlich prüfbar, statt sie als gegeben auszugeben. In der Praxis bewährt sich ein klarer Ablauf: automatisch extrahieren lassen, die kritischen Positionen (große Mengen, Pauschalen, Eventualpositionen) am Beleg gegenprüfen und dann kalkulieren. Vor der Angebotsabgabe empfiehlt sich ohnehin die vollständige LV-Prüfung. Die finale Verantwortung für das Angebot bleibt bei Ihnen — das Werkzeug nimmt Ihnen die Fleißarbeit ab, nicht die fachliche Entscheidung.
Fazit
Ein Leistungsverzeichnis aus einem PDF auszulesen ist keine reine Texterkennung, sondern verlangt Verständnis der LV-Struktur: Ordnungszahlen, Positionsarten, die richtige Zuordnung von Menge und Einheit — und Verlässlichkeit auch bei Scans. Generische PDF-Werkzeuge liefern Text, aber keine kalkulierbare Struktur und keinen Beleg. Ein auf Bau-LVs spezialisiertes Werkzeug erkennt die Positionen, ordnet sie in die Gliederung ein, belegt jede Angabe mit der Fundstelle und übergibt sie direkt an die Kalkulation. Damit wird aus Stunden des Abtippens eine prüfbare Vorlage in Minuten.