LightOnOCR-3 liest Dokumente und verortet ihre Inhalte auf der Seite

Ein OCR-System kann den Text einer PDF-Seite korrekt erkennen und trotzdem wichtige Zusammenhänge verlieren: Welche Überschrift gehört zu welchem Absatz? Wo steht eine Tabelle, und was zeigt die Grafik daneben? Für Suchsysteme und KI-Anwendungen, die Dokumente auswerten, sind solche Beziehungen oft ebenso wichtig wie der reine Wortlaut. LightOn hat am 8. Oktober mit LightOnOCR-3 eine Modellfamilie vorgestellt, die Text und Seitenstruktur gemeinsam ausgeben soll. Die Gewichte der drei Varianten sind unter Apache 2.0 verfügbar.

Vom Scan zum verorteten Inhalt

Die Modelle heißen LightOnOCR-3-0.8B, -1B und -4B. Ohne Textprompt liefern sie wie ihre Vorgänger eine Transkription der Seite. Wer stattdessen grounding als Prompt übergibt, erhält zusätzlich für jeden erkannten Block einen Typ und seine Position. Die Koordinaten sind auf einen Bereich von 0 bis 1000 normiert. Neben Text und Überschriften können so etwa Tabellen, Formeln, Bilder und Diagramme auf der Seite verortet werden. Bilder versieht das Modell mit kurzen Beschreibungen; Datenpunkte aus Diagrammen gibt es als HTML-Tabelle aus. Die Modellkarte dokumentiert das Ausgabeformat und die beiden unterstützten Prompt-Modi.

Damit kann eine Dokumenten-Pipeline beispielsweise einen Textabschnitt zusammen mit seiner Fundstelle speichern und eine Abbildung bei einer späteren Antwort gezielt wiederfinden. Bei Diagrammen ist jedoch Vorsicht nötig: Ein aus einer Kurve abgelesener Wert ist nicht dasselbe wie eine gedruckte Zahl. LightOn beschreibt für seine Trainingsdaten ausdrücklich, dass nicht beschriftete Diagrammwerte anhand der Achsen geschätzt wurden. Solche extrahierten Tabellen sollten deshalb vor der Übernahme in Analysen oder Geschäftssysteme gegen das Original geprüft werden.

Technisch unterscheiden sich die Varianten. Die 1B-Ausführung behält die Architektur der vorherigen Generation bei; die Modelle mit den Bezeichnungen 0.8B und 4B setzen auf eine Qwen3.5-Vision-Language-Architektur. LightOn trainierte neben der Transkription auch das Zuordnen von Inhalten zu Seitenbereichen. Dafür kombinierte das Team bei der Erstellung der Trainingsdaten mehrere Erkennungs- und Layoutwerkzeuge, glich ihre Funde mit einer Referenztranskription ab und filterte unsichere Zuordnungen. Nach dem überwachten Training kam Reinforcement Learning mit überprüfbaren Belohnungen für unter anderem die Lokalisierung von Blöcken hinzu. Gerade dieser Aufwand zeigt, warum ein einzelnes Modell im Betrieb attraktiv sein kann: Es soll einen Teil der mehrstufigen Verarbeitung übernehmen, die zuvor für Text, Layout und Bildinhalte getrennt nötig war.

Was die Messwerte zeigen – und was nicht

In LightOns eigenen Messungen erreicht die 4B-Variante auf olmOCR-Bench insgesamt 86,3 Punkte. Infinity Parser Pro liegt dort bei 87,6, Chandra 2 bei 85,8 Punkten. Auf ParseBench erreicht LightOnOCR-3-4B in der Auswertung über fünf Kategorien 75,1 Punkte gegenüber 74,3 für Infinity Parser Pro. Die kleinste LightOnOCR-3-Variante kommt dort auf 74,6 Punkte. Die Ergebnisse sprechen für eine leistungsfähige offene Lösung, aber nicht für einen pauschalen Sieg auf jedem Dokumenttyp: Bei alten Scans und Kopf- oder Fußzeilen liegt Infinity Parser Pro im veröffentlichten olmOCR-Vergleich vorn.

Auch das Ausgabeformat beeinflusst die Messung. LightOn erklärt, dass die verwendeten Benchmarks auf Zeichenabständen beruhen und verschiedene, inhaltlich gleichwertige Schreibweisen unterschiedlich bewerten können. Vor der Bewertung normalisierte das Team daher Modellausgaben; der Begleitcode enthält Skripte zur Reproduktion. Die Leistungszahlen stammen aus LightOns Vergleich und ersetzen keinen Test mit den eigenen Dokumenten. Das gilt besonders für handschriftliche Unterlagen, schwierige Scans und komplexe Grafiken.

Beim Durchsatz zählt zudem nicht nur die Modellgröße. Für den Geschwindigkeitstest nutzte LightOn dieselben 512 Seiten, jeweils eine H100-GPU pro Modell und vLLM 0.30.0. Höher aufgelöste Seiten verbessern bei zwei Varianten die OCR-Ergebnisse, erhöhen aber die Zahl der Bild-Token und drücken den maximalen Durchsatz. Wer große Bestände verarbeitet, muss Auflösung, Qualität und Kosten deshalb gemeinsam testen. Das zusätzliche Grounding verlängert außerdem die Ausgabe gegenüber der bloßen Transkription.

Einordnung für die Praxis

Die Modellgewichte und der Client mit PDF-Verarbeitung und Viewer ermöglichen eigene Versuche, auch ohne Dokumente an einen externen OCR-Dienst zu senden. Für Retrieval-Augmented Generation kann die Verbindung aus Text, Blocktyp und Position nützlich sein: Ein Treffer verweist dann nicht nur auf einen Satz, sondern auch auf dessen Stelle im Dokument. Entwickler sollten allerdings prüfen, ob Lesereihenfolge, Tabellenstruktur und Diagrammwerte bei ihren eigenen Vorlagen tatsächlich stimmen. Zudem ist das Modell laut Modellkarte auf den leeren Prompt und grounding ausgelegt, nicht auf beliebige Anweisungen zur Dokumentanalyse.

LightOnOCR-3 macht damit aus OCR noch keine fehlerfreie Dokumenteninterpretation. Die Veröffentlichung ist vor allem deshalb interessant, weil offene Modelle Transkription und räumliche Zuordnung in einem Schritt verbinden. Ob dadurch eine bestehende Pipeline wirklich einfacher wird, entscheiden die Fehlerfälle und der benötigte Durchsatz im konkreten Datenbestand.

Quellen

Nach oben scrollen