LightOn étend son modèle OCR à l'arabe pour viser le Moyen-Orient
LightOn démontre vendredi la capacité de son modèle de compréhension de documents LightOnOCR-2 à traiter l'arabe par apprentissage fin (fine-tuning). Cette extension intervient après le lancement de Console, sa plateforme documentaire, et cible notamment les organisations du Moyen-Orient traitant des archives et documents administratifs.
Démonstration sur 12 000 pages synthétiques en arabe
LightOn a testé l'adaptation de LightOnOCR-2 à l'arabe à partir d'un jeu de données comprenant 12 000 pages synthétiques et leurs transcriptions de référence. Le corpus couvre plusieurs scénarios documentaires : artefacts de numérisation, variations de police, niveaux de résolution et types de documents variés.
La sortie conserve le format d'entraînement du modèle, avec détection de boîtes englobantes (bounding box) associant le texte à sa position spatiale. Cette démonstration s'appuie sur un pipeline interne de génération de données synthétiques, conçu pour couvrir les langues actuellement sous-représentées dans les outils OCR du marché.
Défis spécifiques de l'OCR en arabe
L'application de la reconnaissance optique de caractères à l'arabe pose des défis distincts. Le script s'écrit de droite à gauche, les caractères sont liés en forme cursive, et les ensembles de données ouvertes ainsi que les modèles spécialisés restent moins disponibles que pour les langues basées sur l'alphabet latin.
Pour les organisations traitant des archives, documents administratifs, juridiques ou patrimoniaux en arabe, ces limitations ralentissent l'automatisation des flux de traitement documentaire. LightOn indique que cette démonstration répond à des besoins identifiés au Moyen-Orient, où l'entreprise travaille déjà avec des organisations publiques et privées.
Accessibilité et modèle open source
LightOn met à disposition les guides nécessaires pour reproduire ce fine-tuning sur son espace Hugging Face, afin de rendre cette approche accessible au plus grand nombre et adaptable à d'autres contextes documentaires.
LightOnOCR-2 est diffusé en open source sous la licence Apache 2.0 et joue un rôle central dans le processus d'ingestion de documents au sein de Console, l'offre en libre-service de l'entreprise. Le modèle de base obtient un score de 83,2 % sur le banc d'essai OlmOCR-Bench.