LightOn lance LightOnOCR-3, une IA documentaire qui caracole en tête de trois benchmarks
Dans un communiqué diffusé le 8 octobre 2026 au titre de l'information réglementaire, l'éditeur parisien coté sur Euronext Growth a présenté une famille de modèles d'IA qui va au-delà de la reconnaissance de texte : description des images, extraction des données de graphiques et préservation de la structure des documents. LightOn met en avant un coût d'utilisation qu'il présente comme « une fraction du coût des modèles concurrents ».
Premier sur trois tests ouverts, deuxième sur OlmOCR-Bench
Selon LightOn, LightOnOCR-3 se classe en première position sur un ensemble de trois tests de référence ouverts évaluant la reconnaissance de texte et l'interprétation des informations visuelles, devant les modèles OCR existants en Europe, aux États-Unis et en Chine. Sur OlmOCR-Bench, que la société décrit comme le test de référence du secteur pour l'extraction de texte documentaire, le modèle arrive deuxième, derrière Infinity-Parser2-Pro (un modèle plus de huit fois plus volumineux), et devant Chandra-OCR-2, Mistral OCR 4.1 et dots.mocr. LightOnOCR-3 arrive également en tête des modèles à poids ouverts sur ParseBench, qui évalue la restitution de la mise en page, la description d'images et l'extraction de données structurées à partir de graphiques et de schémas scientifiques. Il se classe premier sur FRBench-pdf2md, consacré aux documents en français, avec les gains les plus importants en reconnaissance de l'écriture manuscrite. Les scores détaillés sont renvoyés à un article technique associé. La société cible trois usages : l'analyse financière (extraction de données issues du texte, des tableaux et des graphiques des rapports), les processus administratifs (conversion de formulaires et de courriers) et la recherche dans les documents techniques, grâce à l'identification des sections et de l'emplacement des informations sur la page.
Deux versions sous licence Apache 2.0, jusqu'à deux fois plus rapides
LightOnOCR-3 succède à LightOnOCR-2, qui enregistre 240 000 téléchargements par mois sur Hugging Face selon la société. La nouvelle famille est proposée en deux versions de 0,8 milliard et 4 milliards de paramètres, afin de permettre aux organisations de choisir le modèle adapté à leurs ressources de calcul. D'après LightOn, ces modèles peuvent traiter les documents jusqu'à deux fois plus vite que LightOnOCR-2 et présentent les coûts d'utilisation les plus faibles parmi les principaux modèles OCR. Déployés sur l'infrastructure propre d'une organisation, ces coûts peuvent descendre sous la barre du centime pour mille pages, selon le matériel, le niveau d'utilisation et la charge de travail. Le regroupement de la transcription, de l'analyse de la mise en page et du traitement des images dans un seul modèle vise à réduire le besoin d'assembler des outils distincts. Distribués sous licence Apache 2.0, les modèles peuvent être utilisés à des fins commerciales, modifiés, redistribués et intégrés aux applications des utilisateurs.